Milion tokenów, które naprawdę działają. Najcichsza zmiana w GPT-6 Astra
Okno miliona tokenów miało już kilka modeli. Różnica polega na tym, ile z tego miliona model faktycznie widzi. Wyniki testu na odnajdywanie informacji w bardzo długim tekście mówią, że tym razem prawie wszystko.
👁 137 przeczytań
Okno kontekstu miliona tokenów przestało być wyróżnikiem, ma je już kilka modeli. Prawdziwe pytanie brzmi inaczej: ile z tego miliona model faktycznie widzi, gdy wrzucisz mu komplet dokumentów. Do tej pory odpowiedź była niewygodna. Modele deklarowały milion, a w praktyce gubiły informacje z końca lub środka długiego materiału.
Przy premierze GPT-6 Astra pojawił się wynik, który tę odpowiedź zmienia. W teście MRCR v2, w którym w bardzo długim tekście ukrywa się osiem informacji i sprawdza, czy model znajdzie wszystkie, Astra uzyskała 100 procent w przedziale od 256 do 512 tysięcy tokenów i 96,3 procent w przedziale od 512 tysięcy do miliona. Poprzednik, GPT-5.6 Sol, miał w tych samych przedziałach 91,5 i 73,8 procent.
Dlaczego to ważniejsze, niż brzmi
Różnica między 73,8 a 96,3 procent to różnica między narzędziem, któremu trzeba pomagać, a narzędziem, któremu można zaufać. Przy 74 procentach model gubi co czwartą informację z końca długiego materiału, więc pracę trzeba dzielić na kawałki, pilnować, co już podano, i weryfikować, czy odpowiedź uwzględnia całość. Przy 96 procentach można wrzucić cały materiał naraz i zająć się pytaniem, a nie logistyką.
W praktyce oznacza to trzy rzeczy, które do tej pory były nierealne albo zawodne: analizę całej dokumentacji projektu w jednym zapytaniu, przeszukiwanie kilkuset stron umów bez dzielenia ich na partie oraz pracę agenta na całym repozytorium kodu bez wybierania plików ręcznie.
Gdzie jest haczyk
Dwa. Pierwszy to cena: milion tokenów wejścia kosztuje 10 dolarów, więc każde zapytanie z pełnym kontekstem to dziesięć dolarów zanim model napisze pierwsze słowo. Przy dziesięciu pytaniach do tego samego materiału to sto dolarów, chyba że użyjesz pamięci podręcznej, która powtarzające się fragmenty rozlicza taniej. Drugi to czas: przetworzenie miliona tokenów trwa, a tryb szybki podwaja stawkę.
Rozsądny wzorzec pracy wygląda więc tak: pełny kontekst ładujesz raz, korzystasz z pamięci podręcznej przy kolejnych pytaniach i nie odświeżasz całości bez potrzeby. Wtedy milion tokenów jest narzędziem, a nie rachunkiem.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Uczciwe zastrzeżenie
Test MRCR opracowało OpenAI i wyniki pochodzą z materiałów producenta. Jest to jednak test o jasno zdefiniowanej metodzie, a różnica względem własnego poprzednika, mierzona tą samą metodą, jest wiarygodna niezależnie od tego, kto mierzył. Niezależne pomiary długiego kontekstu pojawią się w kolejnych tygodniach.
Pełne dane modelu i cennik zebrałem w przewodniku o GPT-6 Astra. Ile kosztuje przetworzenie długiego dokumentu na różnych modelach, liczę w kalkulatorze kosztów AI.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


