Przejdź do treści
Newsy

iLLaDA od ByteDance: dyfuzyjny model językowy 8B, który dorównuje Qwen2.5

Badacze z Uniwersytetu Renmin i ByteDance wypuścili iLLaDA - dyfuzyjny model 8B, który na poziomie bazowym minimalnie wyprzedza Qwen2.5 7B.

2 min czytania
iLLaDA od ByteDance: dyfuzyjny model językowy 8B, który dorównuje Qwen2.5
W skrócie
  • iLLaDA to dyfuzyjny model językowy 8B trenowany od zera na 12 bilionach tokenów.
  • Wersja bazowa osiąga średnio 63,9 punktu wobec 63,3 dla autoregresyjnego Qwen2.5 7B.
  • Po dostrojeniu instrukcyjnym pojawia się luka: 67,1 punktu iLLaDA wobec 77,1 Qwen2.5 7B Instruct.

👁 134 przeczytań

Badacze z chińskiego Uniwersytetu Renmin oraz firmy ByteDance opublikowali iLLaDA - dyfuzyjny model językowy o 8 miliardach parametrów, który na poziomie bazowym minimalnie wyprzedza autoregresyjny Qwen2.5 7B. Po dostrojeniu instrukcyjnym model wyraźnie zostaje jednak w tyle.

Niemal wszystkie znane modele językowe - GPT, Claude czy Qwen - generują tekst autoregresyjnie: słowo po słowie, od lewej do prawej, gdzie każdy nowy token zależy wyłącznie od poprzednich. Modele dyfuzyjne działają inaczej. Zaczynają od sekwencji znaczników-zaślepek (tzw. masked tokens) i doprecyzowują je w wielu równoległych przebiegach, podobnie jak modele obrazu wyłaniają zdjęcie z szumu. Każda pozycja może jednocześnie odnosić się do każdej innej, co czyni proces dwukierunkowym.

Google · Twoje źródłaDodaj promptowy.com do preferowanych źródeł w Google

Trening od zera, nacisk na jakość

iLLaDA, czyli "improved LLaDA", to gęsty model 8B trenowany od zera z naciskiem na jakość. Zespół wytrenował go wstępnie na 12 bilionach tokenów - wobec 2,3 biliona dla poprzednika LLaDA - i dostroił przez dwanaście epok. Według artykułu wersja iLLaDA-Base wyraźnie poprawia wynik poprzednika, skacząc na przykład o 21,6 punktu w teście rozumowania BBH. Średnio osiąga 63,9 punktu, co stawia ją tuż przed autoregresyjnym Qwen2.5 7B z wynikiem 63,3.

Korzystnie wypada też porównanie z konkurencyjnym modelem dyfuzyjnym Dream 7B, który nie był trenowany od zera, lecz dostrojony z istniejącego punktu kontrolnego Qwen2.5. iLLaDA i tak wygrywa średnio 63,9 do 61,4, mimo braku przewagi mocnej bazy autoregresyjnej. Dream utrzymuje niewielką przewagę jedynie w testach programistycznych.

Pozostaje za to luka na poziomie instrukcyjnym. iLLaDA-Instruct osiąga 67,1 punktu, podczas gdy Qwen2.5 7B Instruct zdobywa 77,1, a większość różnicy generują matematyka i kod. Autorzy tłumaczą to dodatkowym dostrajaniem przez uczenie ze wzmocnieniem w Qwen2.5, którego iLLaDA nie ma. W aneksie zauważają też, że przy trudniejszych zadaniach model potrafi zaciąć się w pętlach rozumowania.

iLLaDA wpisuje się w szerszy nurt, do którego należy także Google. W czerwcu 2026 Google DeepMind wypuściło DiffusionGemma - model generujący tekst około cztery razy szybciej dzięki dyfuzji, ale słabiej wypadający w testach takich jak MMLU i kod od podobnej rozmiarem autoregresyjnej Gemmy 4. Google poleca go do zastosowań wymagających niskich opóźnień, a nie do produkcji krytycznej dla jakości. DiffusionGemma idzie więc w przeciwnym kierunku niż iLLaDA: stawia na szybkość, podczas gdy chiński model goni za jakością.

Pytanie, które stoi za całym tym nurtem, brzmi prosto: czy model dyfuzyjny zbudowany od podstaw może realnie dorównać modelom autoregresyjnym. Na poziomie bazowym iLLaDA pokazuje, że tak.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Wypisujesz się jednym kliknięciem.
// Zapytaj AI o ten news
Co o tym sądzisz?
Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

$ sitemap --all Cała strona w jednym miejscu - żeby się nie pogubić.
🛒 Sklep Kinetyka X Premium+ & SuperGrok 699 zł/rok CapCut Pro 600 zł/rok LinkedIn Premium od 149 zł/rok Zobacz wszystko → 💙 wspieraj
Redaguje
× powiększenie