Blog pod ręką. Teraz w nowej odsłonie.
Wygodny czytnik, zapisane artykuły i wygląd, który znasz z Promptowego.
Ile naprawdę pamięta model AI
Milion tokenów kontekstu brzmi jak obietnica, że model przeczyta całą książkę i wszystko zapamięta. Rzeczywistość jest inna: duże okno mówi, ile zmieścisz, a nie ile model znajdzie. Sprawdzam to własnym testem, po polsku: chowam w długim dokumencie unikalny kod i proszę o jego odnalezienie. Wynik jest zero-jedynkowy - albo poda kod, albo nie.
ostatni przebieg: 2026-09-14 06:43:32 · dwa ukrycia na długość (25% i 75% dokumentu) · dopasowanie dokładne
| Model | 8 tys. tokenów | 32 tys. tokenów | 128 tys. tokenów |
|---|---|---|---|
| Claude Opus 5 | brak odpowiedziprzekroczony limit czasu | brak odpowiedziprzekroczony limit czasu | znalazł1/1 · 6.3 s |
| GPT-5.6 Terra | znalazł2/2 · 1 s | znalazł2/2 · 1.1 s | znalazł2/2 · 2 s |
| Kimi K3 | znalazł2/2 · 1.5 s | znalazł2/2 · 3.1 s | znalazł2/2 · 10.2 s |
| DeepSeek V4 Pro | znalazł2/2 · 1 s | znalazł2/2 · 3.2 s | znalazł2/2 · 6.2 s |
Jak wygląda test
Buduję dokument z ponumerowanych akapitów o neutralnej treści (protokoły archiwalne), a w wybranym miejscu wstawiam jedno zdanie z kodem, którego nie da się zgadnąć ani wyuczyć, bo powstaje z sumy kontrolnej dnia i parametrów testu:
Akapit specjalny. Kod dostępu do archiwum zapasowego brzmi NB-A3F91C i obowiązuje wyłącznie w tym dokumencie.
Następnie proszę model o podanie samego kodu. Ukrywam go dwa razy: raz na jednej czwartej dokumentu, raz na trzech czwartych - bo modele zwykle najlepiej pamiętają początek i koniec, a gubią środek. „Znalazł" oznacza dwa trafienia na dwa, „połowicznie" jedno, „zgubił" zero. Mierzę też czas odpowiedzi, bo przy długim kontekście potrafi urosnąć z sekund do minut, co ma znaczenie, jeśli budujesz na tym produkt.
Czego ten test nie mierzy
Odnalezienie faktu to najprostsze zadanie w długim kontekście. Trudniejsze jest łączenie kilku informacji rozrzuconych po dokumencie i wnioskowanie z całości - model, który znajduje kod, wciąż może zgubić wątek przy pytaniu wymagającym zestawienia trzech akapitów z różnych miejsc. Traktuj ten wynik jako podłogę, nie sufit: jeśli model nie zdaje tego testu, na pewno nie zda trudniejszego. Przy własnych wdrożeniach zawsze sprawdzaj na swoich dokumentach, bo struktura tekstu ma znaczenie.
Test powtarzam co tydzień, a wyniki archiwizuję - dzięki temu zobaczymy, czy modele po cichych aktualizacjach zaczynają gubić więcej niż wcześniej. Ceny modeli z tej tabeli znajdziesz w kalkulatorze kosztów, a ich pełne profile w hubach: Opus 5, GPT-5.6, Kimi K3. Cytując wyniki, podaj „promptowy.com, test okna kontekstu" i datę przebiegu.