Agenci AI nie są gotowi do samodzielnego prowadzenia badań naukowych
Nowe badanie Princeton University pokazuje, że agenci AI potrafią wykonywać zadania inżynierskie potrzebne do badań nad AI, ale nie są w stanie samodzielnie prowadzić oryginalnych badań naukowych na poziomie akceptowanym przez topowe konferencje.
👁 127 przeczytań
Badacze z Princeton University pod kierownictwem Petera Kirgisa i Sayasha Kapoora opublikowali studium, w którym agenci AI nie zdołali napisać artykułów naukowych na poziomie akceptowanym przez topową konferencję uczenia maszynowego NeurIPS 2026.
W eksperymencie agent oparty na modelu Claude Opus 4.8 dostał sześć dni, 3000 dolarów w kredytach API Anthropic, budżet obliczeniowy na GPU i dostęp do internetu. Zadanie: odpowiedzieć na pytania badawcze z dwóch niepublikowanych jeszcze prac zgłoszonych na NeurIPS i napisać artykuł godny publikacji. Autorzy oryginalnych prac odrzucili oba teksty wygenerowane przez agenta.
Agent bez problemu radził sobie z częścią inżynierską - przejrzał literaturę i przeprowadził setki eksperymentów. Zawodziło wszystko inne. „Agenci byli bezspornie słabi w samym prowadzeniu badań” - powiedział Kapoor. Przeprowadzali osobliwe eksperymenty na mikroskopijnych syntetycznych zbiorach danych i nie wnosili żadnego oryginalnego wkładu do swoich dziedzin.
Autorzy badania proponują nową metodę oceny agentów, którą nazywają „shadow evaluation” - zamiast mierzalnych zadań inżynierskich sprawdza ona otwarte myślenie badawcze. Wyniki sugerują, że optymistyczne prognozy o bliskim nastaniu rekurencyjnego samodoskonalenia AI mogą wyprzedzać aktualne możliwości.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


