Przejdź do treści
PROMPTOWY NA ANDROIDZIE

Blog pod ręką. Teraz w nowej odsłonie.

Wygodny czytnik, zapisane artykuły i wygląd, który znasz z Promptowego.

// benchmark własny

Ile naprawdę pamięta model AI

Milion tokenów kontekstu brzmi jak obietnica, że model przeczyta całą książkę i wszystko zapamięta. Rzeczywistość jest inna: duże okno mówi, ile zmieścisz, a nie ile model znajdzie. Sprawdzam to własnym testem, po polsku: chowam w długim dokumencie unikalny kod i proszę o jego odnalezienie. Wynik jest zero-jedynkowy - albo poda kod, albo nie.

Długi zwój papieru i odnaleziony punkt

ostatni przebieg: 2026-09-14 06:43:32 · dwa ukrycia na długość (25% i 75% dokumentu) · dopasowanie dokładne

Model8 tys. tokenów32 tys. tokenów128 tys. tokenów
Claude Opus 5 brak odpowiedziprzekroczony limit czasubrak odpowiedziprzekroczony limit czasu znalazł1/1 · 6.3 s
GPT-5.6 Terra znalazł2/2 · 1 s znalazł2/2 · 1.1 s znalazł2/2 · 2 s
Kimi K3 znalazł2/2 · 1.5 s znalazł2/2 · 3.1 s znalazł2/2 · 10.2 s
DeepSeek V4 Pro znalazł2/2 · 1 s znalazł2/2 · 3.2 s znalazł2/2 · 6.2 s

Jak wygląda test

Buduję dokument z ponumerowanych akapitów o neutralnej treści (protokoły archiwalne), a w wybranym miejscu wstawiam jedno zdanie z kodem, którego nie da się zgadnąć ani wyuczyć, bo powstaje z sumy kontrolnej dnia i parametrów testu:

Akapit specjalny. Kod dostępu do archiwum zapasowego brzmi NB-A3F91C i obowiązuje wyłącznie w tym dokumencie.

Następnie proszę model o podanie samego kodu. Ukrywam go dwa razy: raz na jednej czwartej dokumentu, raz na trzech czwartych - bo modele zwykle najlepiej pamiętają początek i koniec, a gubią środek. „Znalazł" oznacza dwa trafienia na dwa, „połowicznie" jedno, „zgubił" zero. Mierzę też czas odpowiedzi, bo przy długim kontekście potrafi urosnąć z sekund do minut, co ma znaczenie, jeśli budujesz na tym produkt.

Czego ten test nie mierzy

Odnalezienie faktu to najprostsze zadanie w długim kontekście. Trudniejsze jest łączenie kilku informacji rozrzuconych po dokumencie i wnioskowanie z całości - model, który znajduje kod, wciąż może zgubić wątek przy pytaniu wymagającym zestawienia trzech akapitów z różnych miejsc. Traktuj ten wynik jako podłogę, nie sufit: jeśli model nie zdaje tego testu, na pewno nie zda trudniejszego. Przy własnych wdrożeniach zawsze sprawdzaj na swoich dokumentach, bo struktura tekstu ma znaczenie.

Test powtarzam co tydzień, a wyniki archiwizuję - dzięki temu zobaczymy, czy modele po cichych aktualizacjach zaczynają gubić więcej niż wcześniej. Ceny modeli z tej tabeli znajdziesz w kalkulatorze kosztów, a ich pełne profile w hubach: Opus 5, GPT-5.6, Kimi K3. Cytując wyniki, podaj „promptowy.com, test okna kontekstu" i datę przebiegu.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie