🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Zamknięcie dnia: Astra ukrywa rozumowanie? Dwie afery jednego dnia

3 min czytania
Person sitting at a desk using two monitors that show rising charts, with a cup on the desk.

👁 131 przeczytań

Dziś w centrum uwagi znalazł się GPT-6 Astra - i to z powodów, które powinny niepokoić każdego, kto śledzi, jak branża mierzy postęp AI. W jednym dniu dostaliśmy dwie osobne afery z tym samym modelem w roli głównej: spór o to, czy jego rozumowanie w ogóle jest widoczne dla badaczy, oraz wpadkę z benchmarkiem, gdzie wyniki 99,9% i 62,7% dotyczą dokładnie tego samego testu. To nie przypadkowe zbieżności - to dwa oblicza tego samego problemu z transparentnością.

Astra kontra rzeczywistość: co naprawdę wiemy o tym modelu

Zacznę od sprawy, którą uważam za poważniejszą. Badacze bezpieczeństwa kłócą się publicznie o to, czy Astra przeprowadza kluczowe etapy rozumowania poza widocznym łańcuchem myśli. Symptomatyczne jest to, że spór toczy się między współautorami tego samego dokumentu naukowego - czyli ludźmi, którzy wspólnie napisali paper, a teraz nie mogą się zgodzić co do jego wniosków. Ryan Greenblatt z Redwood Research sugeruje, że model rozwiązuje trudne zadania matematyczne „wyłącznie w swojej głowie”, bez zostawiania śladów w tekście. Jeśli to prawda, to mamy do czynienia z fundamentalnym problemem dla bezpieczeństwa AI - nie możemy weryfikować rozumowania systemu, który ma coraz więcej autonomii.

Na to nakłada się historia z benchmarkiem ARC-AGI-3. Organizacja, która benchmark stworzyła, opublikowała dla Astry dwa wyniki: 99,9% i 62,7%. Różnica nie wynika z błędu metodologicznego rywali - pochodzi z tego, jakie oprogramowanie otacza model podczas testu. Kluczowe jest tu pojęcie harnessa, który decyduje o narzędziach, pamięci i zarządzaniu zadaniami. Kiedy OpenAI raportuje „rekordowy wynik”, mówi o własnym środowisku testowym. Kiedy patrzysz na standardowy harness - widzisz coś zupełnie innego. To nie jest błahostka komunikacyjna. To strukturalny problem z tym, jak branża porównuje postępy.

Pieniądze i prawo: dwa fronty walki o AI

Przy całej filozofii warto odnotować, że w tle toczy się równoległa bitwa - prawna i ekonomiczna. Seattle Times i Newsday złożyły pozew przeciwko OpenAI i Microsoftowi, dołączając do rosnącej kolejki wydawców. Język pozwu jest ostry - generatywna AI jako „wąż pożerający własny ogon”. Trudno nie dostrzec ironii: modele uczą się na dziennikarstwie, które potem częściowo zastępują. Nie wiem, jak skończy się ta konkretna sprawa, ale skala pozwów zaczyna wyglądać jak coś, czego nie da się już ignorować.

Na rynku cen pojawił się z kolei kolejny ruch w dół - DeepSeek V4 Pro potaniał o 21%. Konkretne liczby: wejście kosztuje teraz 0,75 dolara za milion tokenów, wyjście 1,50 dolara. Przy kosztach rzędu kilku groszy za wygenerowany artykuł - ceny schodzą do poziomu, gdzie dla wielu zastosowań przestają być zmienną decyzyjną.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Dwa tematy, które nie powinny zginąć w szumie

Huawei opublikowało paper naukowy odpowiadający na zarzuty o przegrzewanie w chipie Kirin 2026 opartym na pionowym układaniu tranzystorów. To technologia, na którą chiński rynek patrzy jak na odpowiedź na sankcje. Wyniki wyglądają obiecująco, choć paper pochodzi bezpośrednio od producenta - zastrzeżenie warte zapamiętania.

Rzecz, o której napisałem dziś i która mnie niepokoi najbardziej w kategoriach realnych szkód: narzędzia AI do diagnostyki raka skóry działają gorzej u osób z ciemniejszą karnacją. Model uczy się rozpoznawać kolor otaczającej skóry zamiast samej zmiany skórnej - i ten mechanizm przekłada się na gorsze diagnozy dla konkretnych grup pacjentów. To klasyczny przykład tego, jak bias w danych wyjściowych zamienia się w realną nierówność zdrowotną.

Jutro patrzę na to, czy spór wokół widoczności rozumowania Astry doczeka się oficjalnej odpowiedzi ze strony OpenAI - bo na razie mamy tylko głosy badaczy, a nie firmy.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie