🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

OpenAI o modelu Astra: badacze spierają się, czy AI ukrywa swoje rozumowanie

Badacze bezpieczeństwa AI ostrzegają, że najnowszy model OpenAI - Astra - może przeprowadzać rozumowanie bez widocznego śladu w tekście, co utrudnia nadzór nad systemem.

2 min czytania
OpenAI o modelu Astra: badacze spierają się, czy AI ukrywa swoje rozumowanie

👁 118 przeczytań

Badacze bezpieczeństwa AI wszczęli publiczny spór o to, czy model Astra od OpenAI przeprowadza kluczowe etapy rozumowania poza widocznym tekstem - a po obu stronach tej debaty stoją współautorzy tego samego dokumentu naukowego.

„Wygląda na to, że potrafi rozwiązywać trudne zadania z konkursów matematycznych wyłącznie w swojej głowie” - napisał na X Ryan Greenblatt z Redwood Research, dodając, że uważa to za „niezwykle niepokojące”. Semafor poinformował też, że OpenAI mogło celowo ograniczyć widoczność wyjść modelu, aby poprawić jego możliwości - firma tego nie potwierdziła.

1515 Third Street.jpg
fot. Coolcaesar / Wikimedia Commons, CC BY 4.0

W odpowiedzi zabrał głos Jakub Pachocki, główny naukowiec OpenAI. „Chcę zapobiec wyścigowi w niemonitorowalność, wywołanemu przez dezorientujące doniesienia medialne” - napisał, zapowiadając dalsze wyjaśnienia.

Niecodzienny kontekst sporu: zarówno Greenblatt, jak i Pachocki są współautorami position paper opublikowanego w lipcu 2025 roku, który podpisało około czterdziestu badaczy z OpenAI, Google DeepMind, Anthropic, Meta, Amazona, brytyjskiego AI Security Institute i właśnie Redwood Research. Dokument uznaje monitorowalność łańcucha rozumowania za „nową i kruchą szansę dla bezpieczeństwa AI” i postuluje, by deweloperzy budowali standaryzowane ewaluacje, a wyniki publikowali w kartach systemowych.

W Europie to zobowiązanie ma już konkretny adresat i termin. OpenAI jako pełny sygnatariusz unijnego GPAI Code of Practice musi złożyć Model Report do AI Office przed wprowadzeniem modelu na rynek - raport zawiera między innymi pięć losowo wybranych próbek wejść i wyjść z każdej istotnej ewaluacji. To właśnie wejścia i wyjścia pozostają jedynym śladem, gdy rozumowanie przestaje docierać jako tekst.

OpenAI przeznacza już 20% mocy obliczeniowej na monitorowanie własnych systemów - co pokazuje, że firma traktuje problem poważnie, nawet jeśli wyniki tego monitoringu budzą właśnie największe pytania.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł
// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie