OpenAI o modelu Astra: badacze spierają się, czy AI ukrywa swoje rozumowanie
Badacze bezpieczeństwa AI ostrzegają, że najnowszy model OpenAI - Astra - może przeprowadzać rozumowanie bez widocznego śladu w tekście, co utrudnia nadzór nad systemem.
👁 118 przeczytań
Badacze bezpieczeństwa AI wszczęli publiczny spór o to, czy model Astra od OpenAI przeprowadza kluczowe etapy rozumowania poza widocznym tekstem - a po obu stronach tej debaty stoją współautorzy tego samego dokumentu naukowego.
„Wygląda na to, że potrafi rozwiązywać trudne zadania z konkursów matematycznych wyłącznie w swojej głowie” - napisał na X Ryan Greenblatt z Redwood Research, dodając, że uważa to za „niezwykle niepokojące”. Semafor poinformował też, że OpenAI mogło celowo ograniczyć widoczność wyjść modelu, aby poprawić jego możliwości - firma tego nie potwierdziła.

W odpowiedzi zabrał głos Jakub Pachocki, główny naukowiec OpenAI. „Chcę zapobiec wyścigowi w niemonitorowalność, wywołanemu przez dezorientujące doniesienia medialne” - napisał, zapowiadając dalsze wyjaśnienia.
Niecodzienny kontekst sporu: zarówno Greenblatt, jak i Pachocki są współautorami position paper opublikowanego w lipcu 2025 roku, który podpisało około czterdziestu badaczy z OpenAI, Google DeepMind, Anthropic, Meta, Amazona, brytyjskiego AI Security Institute i właśnie Redwood Research. Dokument uznaje monitorowalność łańcucha rozumowania za „nową i kruchą szansę dla bezpieczeństwa AI” i postuluje, by deweloperzy budowali standaryzowane ewaluacje, a wyniki publikowali w kartach systemowych.
W Europie to zobowiązanie ma już konkretny adresat i termin. OpenAI jako pełny sygnatariusz unijnego GPAI Code of Practice musi złożyć Model Report do AI Office przed wprowadzeniem modelu na rynek - raport zawiera między innymi pięć losowo wybranych próbek wejść i wyjść z każdej istotnej ewaluacji. To właśnie wejścia i wyjścia pozostają jedynym śladem, gdy rozumowanie przestaje docierać jako tekst.
OpenAI przeznacza już 20% mocy obliczeniowej na monitorowanie własnych systemów - co pokazuje, że firma traktuje problem poważnie, nawet jeśli wyniki tego monitoringu budzą właśnie największe pytania.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


