🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 7 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Newsy

Olmo Hybrid kontra transformer: które tokeny model przewiduje lepiej

Ai2 porównało własny model transformerowy i hybrydowy token po tokenie, by sprawdzić, gdzie naprawdę leży przewaga architektury hybrydowej.

2 min czytania
Olmo Hybrid kontra transformer: które tokeny model przewiduje lepiej

👁 137 przeczytań

Ai2 opublikowało eksperyment, w którym porównało swój najmocniejszy model transformerowy Olmo 3 z modelem hybrydowym Olmo Hybrid - oba w rozmiarze 7B - aby sprawdzić, które konkretnie tokeny każda z architektur przewiduje lepiej. Wyniki opisano w raporcie technicznym.

Olmo Hybrid kontra transformer: które tokeny model przewiduje lepiej

Punkt wyjścia jest prosty: standardowe testy porównawcze pokazują, że hybrydy potrafią dorównać transformerom lub je pokonać, ale liczby zbiorcze nie mówią, na czym ta przewaga polega. Dlatego oba modele zbudowano tak, by różniły się niemal wyłącznie architekturą - ten sam zbiór danych, ten sam tokenizer i ta sama receptura treningu. Dzięki temu różnice w predykcjach można przypisać samej budowie modelu, a nie przypadkowi czy danym.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Uwaga kontra rekurencja

Transformer w każdej warstwie korzysta z mechanizmu uwagi (attention): sięga jednocześnie do wszystkich wcześniejszych tokenów i waży, jak bardzo każdy z nich jest istotny dla bieżącej predykcji. To czyni go bardzo dobrym w dokładnym przywoływaniu konkretnego, wcześniejszego tokenu, nawet odległego. Cena jest jednak wysoka - każdy token porównywany jest ze wszystkimi poprzednimi, więc koszt rośnie stromo wraz z długością wejścia.

Olmo Hybrid kontra transformer: które tokeny model przewiduje lepiej

Hybryda zachowuje kilka warstw uwagi, a resztę zamienia na warstwy rekurencyjne. Taka warstwa czyta tokeny od lewej do prawej i utrzymuje pamięć o stałym rozmiarze, dokładając do niej każdy nowy token. Koszt przetwarzania pojedynczego tokenu pozostaje płaski niezależnie od długości tekstu. Wadą jest to, że pamięć jest skompresowana i stratna, więc warstwa rekurencyjna nie potrafi sięgnąć po dokładny, wcześniejszy token tak jak uwaga.

Aby wyizolować mocne i słabe strony obu podejść, badacze podali obu modelom różne typy tekstu: artykuły, hasła z Wikipedii, książki i prace naukowe, a także tekst strukturalny - Python, HTML i LaTeX. Następnie porównali predykcje token po tokenie.

Przewaga hybrydy okazała się realna, ale nie powszechna. Olmo Hybrid radzi sobie najlepiej z tokenami niosącymi znaczenie - rzeczownikami, czasownikami i przymiotnikami - oraz z tymi, które da się przewidzieć tylko dzięki śledzeniu kontekstu, jak ustalenie, do której osoby odnosi się zaimek. Tam, gdzie token jest po prostu dosłownym powtórzeniem wcześniejszego słowa czy frazy, przewaga hybrydy niemal znika - bo odpowiedź leży gotowa do odszukania, a w tym mocny jest właśnie transformer.

To rzadki przypadek analizy, która zamiast jednej liczby w teście porównawczym pokazuje, gdzie konkretnie architektura hybrydowa zyskuje, a gdzie oddaje pole klasycznej uwadze.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie