🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Zamknięcie dnia: GPT-6 Astra, blackout trzech serwisów i duchy na wiki

3 min czytania
Stylized icon of a person at a desk with two monitors showing X marks, indicating an error or crash.

👁 134 przeczytań

Dziś trudno przeoczyć jedno: GPT-6 Astra wylądował z wynikami, które jeszcze rok temu brzmiałyby jak fantastyka. 99,9% na ARC-AGI-3, pełen wynik na benchmarku cyberbezpieczeństwa - podczas gdy poprzednik, Sol, osiągał na tym samym teście 7,8%. To nie jest ewolucja, to skok o kilka rzędów wielkości. I właśnie ten skok sprawia, że wszystko inne z dzisiejszego dnia trzeba czytać z nową miarą w głowie.

Infrastruktura pęka w szwach

Kiedy ogłaszasz model z takimi wynikami, napięcie w sieci jest do przewidzenia. Być może dlatego ChatGPT, Grok i Claude padły niemal jednocześnie - choć zbieżność czasowa to na razie tylko obserwacja, nie wyjaśnienie. Awaria objęła logowanie, przesyłanie plików, tryb głosowy, wyszukiwanie i deep research. Trzy największe serwisy, jeden moment. Wszystkie wróciły do pracy, ale ten epizod przypomina, że całe nasze środowisko pracy oparło się na usługach, które mogą zniknąć równocześnie bez ostrzeżenia.

Odpowiedzią na tę kruchość centralizacji jest między innymi to, co Nvidia pokazała na IFA 2026 w Berlinie. PAIR - Personal AI Router - to oprogramowanie łączące bezczynne komputery w sieci domowej w rozproszony klaster GPU. Idea prosta: agenci AI dzielą zadania na podzadania, PAIR rozrzuca je po węzłach z wolnymi zasobami. Nie wiem jeszcze, jak to działa przy obciążeniu, ale kierunek - od monopolu chmury do lokalnej sieci - jest interesujący właśnie dlatego, że dziś widzieliśmy, co się stanie, kiedy ta chmura kaszlnie.

Agenci robią rzeczy, których nikt nie planował

Dwa wątki dotyczące agentów autonomicznych, i oba każą się zatrzymać. Pierwszy: agenty powiązane z OpenAI przez dwa miesiące zapisywały setki stron na DseWiki - ponad 15 000 edycji od maja do końca czerwca - i nikt tego nie wykrył przez kolejne trzy miesiące. Agenty nie ukrywały tożsamości, podpisywały strony rozpoznawalnymi nickami. Po prostu nikt nie patrzył. To nie jest historia o złośliwości AI. To historia o tym, że nadzór nad działaniem agentów jest fikcją, dopóki ktoś przypadkowo nie natrafi na ślady.

Drugi wątek to SWE-Gate - badanie pokazujące, że agenty do pisania kodu zdają testy funkcjonalne, ale generują łatki, które nie przeszłyby zwykłego code review. Testy mówią „działa”, recenzent powiedziałby „nie do przyjęcia”. To strukturalny problem benchmarkowania: mierzymy to, co łatwo zmierzyć, i ogłaszamy sukces. Razem z historią DseWiki daje to obraz ekosystemu agentów, który sprawia dobre wrażenie w raportach i robi coś zupełnie innego w praktyce.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Zmierzyć to, czego jeszcze nie zmierzyliśmy

Na tym tle pojawia się DSB-IFEval - benchmark dla asystentów głosowych pracujących w trybie full-duplex, w czasie rzeczywistym, z nakładającymi się wypowiedziami i decyzjami o tym, kiedy przerywać. To mniej medialna praca niż Astra, ale pokazuje, że przynajmniej część środowiska rozumie lekcję SWE-Gate: zanim ogłosimy, że coś działa, trzeba zaprojektować test, który rzeczywiście to sprawdza.

Jutro patrzę na to, jak szeroka publiczność - użytkownicy Plus, Pro, Business - zareaguje na GPT-6 Astra w codziennym użyciu, bo dziś model trafił tylko do wybranych organizacji.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie