Wyjaśnij i pokaż kontekst: Test 500 dni jako prezes: tylko trzy modele AI nie zbankrutowały
Trzy z testowanych modeli AI przetrwały symulację prowadzenia firmy przez 500 dni - reszta zbankrutowała. To wynik eksperymentu CEO-Bench opracowanego przez badaczy z Princeton, opisanego w artykule Modele AI prowadziły firmę przez 500 dni - tylko trzy nie zbankrutowały.
Na czym polega test?
Agenci AI wcielają się w rolę prezesa fikcyjnej firmy software'owej NovaMind i prowadzą ją przez 500 symulowanych dni. Warunki startowe są jednakowe: milion dolarów w kasie i zero klientów. Reguła przetrwania jest bezwzględna - jeśli saldo choć raz spadnie poniżej zera, oznacza to bankructwo i koniec symulacji. Większość modeli tego progu nie utrzymała.
Dlaczego to ważne?
CEO-Bench pokazuje różnicę między błyszczeniem w krótkich zadaniach a prowadzeniem długiego, wieloetapowego procesu, w którym każda decyzja wpływa na kolejne. To ten sam kierunek, który widać w innych „realistycznych" benchmarkach - jak ScarfBench od IBM, oceniający agentów AI w prawdziwych scenariuszach migracji kodu Javy zamiast na sztucznych fragmentach.
Kontekst praktyczny: wyniki takie potwierdzają obserwacje z recenzji modeli - agentowość i konsekwentne prowadzenie zadania „od początku do końca" to wciąż wyzwanie. Modele jak Claude (9.4/10) czy narzędzia agentowe Claude Code i Cursor (po 8.7/10) chwalone są właśnie za wierne trzymanie się instrukcji w długich łańcuchach działań.
Podsumowanie: CEO-Bench to trzeźwy sygnał - AI radzi sobie z pojedynczymi decyzjami, ale samodzielne, długofalowe zarządzanie pozostaje trudną barierą.