Test Stroopa łamie najnowsze AI. Dlaczego modele językowe gubią się na 40 słowach?
Klasyczny psychologiczny test ujawnił fundamentalną słabość najnowszych modeli językowych. Dla AI proste zestawienie kolorów i słów to przepis na katastrofę.
pl.
👁 111 przeczytań
- GPT-4o przy 5 słowach osiąga 91% celności, ale przy 40 słowach spada do 15%, co odpowiada poziomowi losowego rzutu monetą.
- Modele transformerów nie mają odpowiednika wykonawczej kontroli poznawczej, przez co ich mechanizm self-attention nie potrafi stłumić najsilniejszych nawyków treningowych.
- Badanie opublikowane w PNAS Nexus objęło pięć modeli: GPT-4o, GPT-5, Claude 3.5 Sonnet, Claude Opus 4.1 i Gemini 2.5, a żaden nie poradził sobie przy długich listach.
Psychologiczny test, który demaskuje AI
Wyobraź sobie, że dostajesz zadanie: nazwij kolor tuszu, którym wydrukowano słowo. Proste? Dla człowieka - tak. Dla najbardziej zaawansowanych modeli językowych świata - katastrofa. Gdy lista słów się wydłuża, ich celność spada do poziomu losowego rzutu monetą.
To nie hipotetyczny test, a rzetelne badanie opublikowane właśnie w czasopiśmie PNAS Nexus. Zespół naukowców pod kierunkiem Suketu Patela postanowił przepuścić przez wirówkę Stroopa najnowsze modele językowe: GPT-4o, GPT-5, Claude 3.5 Sonnet, Claude Opus 4.1 i Gemini 2.5. Wyniki? Dla branży sztucznej inteligencji - kubeł zimnej wody.
Psychologiczny test, który demaskuje AI
Test Stroopa to w psychologii klasyka. Pacjentowi pokazuje się słowa oznaczające kolory - np. słowo „CZERWONY” - ale wydrukowane atramentem innego koloru, na przykład niebieskim. Zadanie: zignorować znaczenie słowa i nazwać kolor tuszu. Ludzki mózg, choć ma z tym kłopot (zwalnia, popełnia drobne błędy), radzi sobie stabilnie nawet przy długich seriach.
Naukowcy przenieśli ten sam schemat na modele językowe. Zamiast pacjenta - algorytm. Zamiast kartki - sekwencja tokenów. I tu zaczęły się schody.
„LLM-y są trenowane przede wszystkim do czytania i przewidywania tekstu. Gdy każemy im ignorować znaczenie słowa i skupić się na jego kolorze, podstawowy trening bierze górę” - tłumaczy zespół w artykule.
Katastrofa na 40 słowach
Przy bardzo krótkich listach - zaledwie pięciu wyrazów - modele radziły sobie nieźle. GPT-4o osiągnął nawet 91% celności. Problem pojawił się, gdy lista urosła. Przy dziesięciu słowach dokładność spadła do 57%. Przy czterdziestu - runęła do 15%. Model praktycznie przestawał wykonywać polecenie, zamiast tego odczytywał słowa, bo tak został wytrenowany.
Claude 3.5 Sonnet trzymał się nieco dłużej - do dwudziestu słów utrzymywał przyzwoity poziom. Lecz przy czterdziestu załamał się do 24%. Najnowsze modele, jak GPT-5, Claude Opus 4.1 i Gemini 2.5, nie były lepsze. W testach z mieszanką słów dopasowanych i niedopasowanych kolorystycznie ich celność przy niedopasowanych elementach spadała do bliska 0%.
To nie jest chwilowa usterka, którą łatka naprawi. Badacze mówią wprost o fundamentalnej, strukturalnej różnicy między uwagą sztuczną a biologiczną.
Dlaczego mózg wygrywa z algorytmem?
Ludzki mózg ma system „nadzorcy” - wykonawczą kontrolę poznawczą, która potrafi zdusić automatyczny odruch i nakazać mu: „teraz robisz coś innego”. Modele transformerów, na których oparte są dzisiejsze LLM-y, nie mają odpowiednika takiego modułu. Ich mechanizm samouważności (self-attention) świetnie radzi sobie z wyłapywaniem wzorców, ale zupełnie kapituluje, gdy musi stłumić własne, najsilniejsze nawyki.
Jak obrazowo opisuje to raport w Neuroscience News, model jest jak uczeń, który perfekcyjnie opanował dodawanie, ale gdy każesz mu mnożyć, po trzech przykładach z rozpędu zaczyna z powrotem dodawać. Nie dlatego, że nie zna zasad mnożenia. Dlatego, że jego domyślny tryb jest silniejszy od instrukcji.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co to znaczy dla przyszłości AI?
Test Stroopa to tylko jeden, bardzo specyficzny sprawdzian. Pokazuje jednak coś uniwersalnego: syntetyczna uwaga ma sufit. Gdy presja na wykonanie zadania rośnie (dłuższy kontekst, więcej informacji do odfiltrowania), modele wracają do swoich najgłębszych wzorców treningowych.
To ma bezpośrednie przełożenie na realne zastosowania. System AI analizujący skrzynkę pocztową, przegląd medyczny czy strumień danych finansowych może - pod wpływem długiego kontekstu - zacząć działać „po staremu”: ignorować instrukcje i generować coś, co jest tylko probabilistycznie poprawne, ale nie jest odpowiedzią na pytanie.
Badanie bynajmniej nie skreśla AI. Ujawnia jednak, że droga do modeli, które naprawdę „myślą”, a nie tylko przewidują kolejne słowo, jest znacznie dłuższa, niż sądzili optymiści. Na razie, gdy chodzi o prostą kontrolę nad własnymi odruchami, człowiek - ze swoim 1,4 kilograma mózgu - wciąż bije algorytm na głowę.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Dlaczego modele językowe gubią się w teście Stroopa przy długich listach?
Modele gubią się, bo są trenowane do czytania i przewidywania tekstu, więc przy długim kontekście wracają do domyślnego trybu i odczytują słowa zamiast nazywać kolory. Badacze określają to jako fundamentalną, strukturalną różnicę między uwagą sztuczną a biologiczną, a nie chwilową usterkę.
Jak bardzo spada dokładność GPT-4o w teście Stroopa w zależności od długości listy?
GPT-4o osiąga 91% celności przy 5 słowach, 57% przy 10 słowach i tylko 15% przy 40 słowach. Oznacza to, że przy najdłuższej liście model praktycznie przestaje wykonywać polecenie.
Czy nowsze modele jak GPT-5 czy Gemini 2.5 radzą sobie lepiej w teście Stroopa?
Nie, GPT-5, Claude Opus 4.1 i Gemini 2.5 nie wypadają lepiej od starszych modeli. W testach z mieszanką słów dopasowanych i niedopasowanych kolorystycznie ich celność przy niedopasowanych elementach spada do bliska 0%.
Gdzie zostały opublikowane wyniki badania nad testem Stroopa i modelami AI?
Badanie opublikowano w czasopiśmie PNAS Nexus, a przeprowadził je zespół pod kierunkiem Suketu Patela. Objęło ono pięć modeli językowych: GPT-4o, GPT-5, Claude 3.5 Sonnet, Claude Opus 4.1 i Gemini 2.5.
Przetestowałem 6 najnowszych modeli na fal.ai. FLUX.3, MiniMax H3 i dwa modele, które piszą po polskuAI dla twórców
Halucynacje AI - dlaczego modele zmyślają i 7 sposobów obronyPodstawy
Koreańczycy kochają AI bardziej niż ktokolwiek na świecie. Dlaczego?Nauka
