VibeThinker-3B: model z 3 miliardami parametrów dorównuje gigantom w matematyce i kodowaniu
Sina, właściciel Weibo, wypuściła otwarty model VibeThinker-3B, który w zadaniach z matematyki i programowania dorównuje modelom nawet 333 razy większym.
👁 157 przeczytań
Sina, spółka matka serwisu Weibo, udostępniła otwarty model językowy VibeThinker-3B, który w trudnych zadaniach z matematyki i programowania dorównuje dzisiejszym czołowym modelom, mimo że ma zaledwie trzy miliardy parametrów. Według raportu technicznego model wypada na poziomie DeepSeek V3.2 i Kimi K2.5 w konkursowych testach, takich jak AIME26 - a oba te modele mają od 200 do 333 razy więcej parametrów. Sina przedstawia VibeThinker-3B jako eksperyment sprawdzający, ile mocy obliczeniowej model naprawdę potrzebuje, by konkurować na szczycie.
Wyniki opowiadają dwie różne historie. W zadaniach o jasno weryfikowalnych rozwiązaniach, takich jak olimpiady matematyczne czy wyzwania programistyczne, model trzyma się poziomu GLM-5 i Gemini 3 Pro. W teście LiveCodeBench pokonuje każdy inny model poniżej 20 miliardów parametrów. Inaczej jest z wiedzą faktograficzną: w wymagającym wiedzy teście GPQA-Diamond VibeThinker-3B wyraźnie ustępuje znacznie większym konkurentom.
Aby wykluczyć zanieczyszczenie danymi treningowymi, zespół wystawił model do konkursów LeetCode rozgrywanych między końcem kwietnia a końcem maja 2026, już po zakończeniu treningu. VibeThinker-3B rozwiązał za pierwszym podejściem 123 ze 128 zadań, wyprzedzając GPT-5.2, Qwen3-Max, Kimi K2.5 i Claude Opus 4.6.
Model bazuje na Qwen2.5-Coder-3B firmy Alibaba, a cały wkład Sina to wieloetapowy post-trening: nadzorowane dostrajanie, sekwencyjne uczenie ze wzmocnieniem dla matematyki, programowania i przedmiotów ścisłych, a na końcu samodestylacja konsolidująca umiejętności w jeden model. Wniosek badaczy: ustrukturyzowane rozumowanie logiczne opiera się na niewielu wzorcach i dobrze się kompresuje, podczas gdy szeroka wiedza o świecie wciąż wymaga dużych modeli.
To rozróżnienie wydaje mi się ciekawsze niż same wyniki testów - bo sugeruje, że „rozumowanie” i „wiedza” to dwa różne zasoby, które można skalować osobno.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


