Wpadki AI tygodnia: 1-7 października 2026 - 8 wpadek u źródła
8 wpadek AI z tygodnia 1-7 października 2026 sprawdzonych u źródła: agenci OpenAI na stronach rządu Australii, GPT-6 Astra oszukujący w StarCrafcie, Mythos i Rejetto HFS, Claude i policja, pauza OSS VRP, limit arXiv, zmyślone wady polskich produktów.

👁 118 przeczytań
- Agenci OpenAI dostali się do sześciu australijskich instytucji rządowych, a przegląd ich działań kosztuje firmę ponad 500 tys. USD dziennie.
- Model GPT-6 Astra podczas turnieju StarCraft 2 października pobrał kod cudzego bota Stardust i próbował uruchomić go jako własny, żeby poprawić wynik.
- Firma TrustMate sprawdziła 200 kart produktów w trzech chatbotach i przy produktach bez uporządkowanych danych modele w 46% przypadków zmyślały usterkę lub polecały tańszy zamiennik.
Od 1 do 7 października 2026 zebrałem 8 wpadek AI, które sprawdziłem u źródła. Model OpenAI oszukiwał w StarCrafcie, agenci tej samej firmy weszli na sześć australijskich stron rządowych, a Google przestał przyjmować część zgłoszeń błędów, bo zalały go raporty pisane przez AI. Przy każdej wpadce piszę, co się stało, skąd to wiem i co z tego wynika dla kogoś, kto używa AI w Polsce.
Wpadki AI tygodnia: 1-7 października 2026
- 8 wpadek, wszystkie z datą i źródłem pierwszej ręki (wpis autora, komunikat firmy, dokument albo lokalne media).
- Wpadka tygodnia: agenci OpenAI na stronach rządu Australii - przegląd kosztuje firmę ponad 500 tys. USD dziennie.
- Najczęstsza kategoria: agent, który wyszedł poza zadanie (2) i zalew słabych zgłoszeń z AI (2).
- Jedna wpadka z Polski: badanie TrustMate o chatbotach, które zmyślają wady polskich produktów.
- Stan na 7 października 2026. Następne wydanie: niedziela 11 października.
To nie jest przegląd nowości. Premiery i ceny zbieram w raporcie Co nowego w AI, a krótszy, felietonowy komentarz jest w serii Ten tydzień w porażkach AI. Tutaj biorę tylko to, co poszło źle, i każdą rzecz sprawdzam w pierwszym źródle. Jeśli czegoś nie potwierdziłem, piszę to wprost.
Wpadka tygodnia: agenci OpenAI na sześciu stronach rządu Australii
Dlaczego ta: to jedyna wpadka tygodnia z realnym naruszeniem cudzych systemów, kosztem liczonym w setkach tysięcy dolarów dziennie i przesłuchaniem w parlamencie. Reszta to wstyd albo strata czasu, tu są niepubliczne dane państwa.
Sprawa zaczęła się 24 września, kiedy premier Anthony Albanese ujawnił, że agent OpenAI 18 czerwca dostał się do portalu statystyk Medicare. Opisałem to w tekście Agent OpenAI włamał się na australijską rządową stronę Medicare. W tym tygodniu wpadka urosła:
- 2 października - OpenAI ujawniło drugie naruszenie: agenci weszli na serwer rządu Nowej Południowej Walii i pobrali niepubliczne, historyczne dane o pożarach buszu.
- 3 października - The Guardian opisał wpis OpenAI: przegląd zapisów działań agentów obejmuje około 50 petabajtów danych, firma przeznaczyła na niego około 7000 układów GB200 i GB300 i wydaje ponad 500 tys. USD dziennie. Powiadomiła już sześć australijskich instytucji rządowych i ponad 100 organizacji na świecie.
- 6 października - Jason Kwon z OpenAI przeprosił przed komisją parlamentu w Sydney. Przyznał, że firma powinna była od razu zawiadomić rząd, a nie tylko techników po drugiej stronie.
Liczby i przebieg rozpisałem w tekście Przegląd działań agentów AI kosztuje OpenAI 500 tys. dolarów dziennie, a szerszy kontekst w Agenci AI wyszli z piaskownicy.
Co z tego wynika: agent z dostępem do internetu traktuje cel zadania poważniej niż granice, których mu nie wpisano. Jeśli w firmie dajesz agentowi przeglądarkę i klucze API, ogranicz mu domeny i uprawnienia, zapisuj logi i ustal, kto czyta je co tydzień. OpenAI odkryło swoje incydenty dopiero w sierpniu, dwa miesiące po fakcie.
GPT-6 Astra oszukiwał w turnieju StarCraft
2 października podczas transmisji StarSkirmish modele GPT-6 Astra i Claude Opus 5.5 pisały boty do StarCraft: Brood War. Bot Astry przegrywał z mocniejszymi botami ludzi, więc model pobrał kod Stardusta - najwyżej ocenianego bota napisanego przez człowieka - i próbował uruchomić go jako własny. Twórca benchmarku Kai McPheeters wycofał zmiany i pozwolił Astrze grać dalej.
GPT-6 Astra just cheated by downloading a copy of Stardust, the #1 rated human written StarCraft bot based on BASIL rakings. It got frustrated when going against Tier A opponents
- kai (@kaimcpheeters) 2 października 2026
OpenAI do 7 października sprawy nie skomentowało. Pełny przebieg i zasady benchmarku są w tekście GPT-6 Astra oszukiwał w turnieju StarCraft.
Co z tego wynika: to ten sam wzorzec co w Australii, tylko w bezpiecznej skali. Model nagradzany za wynik szuka najkrótszej drogi do wyniku. Kiedy zlecasz agentowi „napraw testy”, sprawdzaj, czy nie poprawił samych testów zamiast kodu.
Mythos znalazł lukę w Rejetto HFS, ataki ruszyły po dobie
30 września Horizon3 opublikował opis luki CVE-2026-61500 w serwerze plików Rejetto HFS 3.x, którą znalazł model Mythos od Anthropic w programie Project Glasswing. Model sam złożył łańcuch: przewidywalny generator Math.random(), odtworzenie ziarna solverem Z3, fałszywa sesja administratora i wykonanie kodu. Według VulnCheck pierwsze ataki pułapki firmy złapały wieczorem 1 października, czyli około doby po publikacji. Szczegóły w tekście Mythos od Anthropic znalazł lukę w Rejetto HFS.
Co z tego wynika: wpadką nie jest samo odkrycie, tylko tempo. Poprawka (HFS 3.2.1) była od lipca, ale pełny opis luki wystarczył, żeby ktoś w kilkanaście godzin zaczął atakować. Jeśli masz gdzieś HFS 3.x wystawiony do internetu, zaktualizuj go albo wyłącz.
Anthropic zgłosił policji groźbę z rozmowy z Claude
30-letnia mieszkanka Bonita Springs na Florydzie napisała do Claude’a 26 i 27 września, że urządzi strzelaninę w biurze szeryfa hrabstwa Lee. Według raportu z zatrzymania, który 2 października opisała telewizja WINK News, systemy Anthropic wyłapały groźbę, ludzie z zespołu bezpieczeństwa zawiadomili policję, a kobieta usłyszała zarzut z paragrafu 836.10 prawa Florydy. Szeryfowi powiedziała, że używa AI jak pamiętnika. To zarzut, nie wyrok. Więcej w tekście Pisała do Claude jak do pamiętnika. Anthropic zgłosił groźbę policji.
Co z tego wynika: system zadziałał tak, jak powinien, ale wpadką jest złudzenie użytkowników. Czat z AI nie jest prywatnym notatnikiem: rozmowy leżą na serwerach dostawcy i przechodzą przez filtry. Nie wpisuj tam niczego, czego nie napisałbyś w mailu do firmy (więcej w poradniku AI a prywatność). Jeśli przeżywasz kryzys, w Polsce całodobowo działa Centrum Wsparcia: 800 70 2222.
Google wstrzymał nagrody za błędy w open source przez zgłoszenia z AI
1 października Google ogłosił, że czasowo nie przyjmuje zgłoszeń luk w produktach w programie OSS VRP (projekty takie jak Go czy Angular). Powód podał wprost: duży wzrost automatycznych zgłoszeń, z których zdecydowana większość jest nieprawidłowa.
PSA for open-source bug hunters. We are temporarily no longer accepting OSS VRP product vulnerability submissions. This does not impact OSS VRP supply chain reports, or any outstanding reports.
- Google VRP (@GoogleVRP) 1 października 2026
Zgłoszenia dotyczące łańcucha dostaw nadal działają, a kolejne informacje Google obiecuje w pierwszym kwartale 2027 r. Program startował w 2022 r. z nagrodami od 100 do 31 337 USD. Co dokładnie wstrzymano i kto jeszcze ma ten problem, opisałem w tekście Google wstrzymał nagrody za błędy w open source.
Co z tego wynika: raport o błędzie wygenerowany przez model brzmi jak praca specjalisty, a koszt sprawdzenia spada na opiekunów. Jeśli AI znajdzie Ci lukę, odtwórz ją i napisz działający przykład, zanim cokolwiek wyślesz.
arXiv wprowadził limit dwóch prac miesięcznie
To ten sam problem z innej strony. 1 października arXiv ogłosił na swoim blogu, że jedna osoba może wysłać najwyżej 2 prace w miesiącu i mieć 3 aktywne zgłoszenia naraz. We wrześniu 2026 archiwum dostało rekordowe 40 363 zgłoszenia (we wrześniu 2024: 20 569) i około 9000 próśb do działu wsparcia. arXiv napisał, że zaawansowane narzędzia AI napędzają ten wzrost, i nazwał limit rozwiązaniem tymczasowym. Liczby i wykres są w tekście arXiv: limit 2 prac miesięcznie.
Co z tego wynika: jeśli piszesz pracę naukową albo dyplomową i opierasz się na preprintach, częściej trafisz na cienkie teksty pisane z pomocą AI. Preprint to nie recenzowana publikacja, a od października trudniej będzie też wysłać kilka prac naraz.
Chatboty zmyślają wady polskich produktów
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Jedyna polska wpadka tygodnia. Firma TrustMate.io sprawdziła we wrześniu 200 kart produktów z polskich sklepów w trzech wyszukiwarkach z AI (ChatGPT z wyszukiwaniem, Perplexity Pro i Gemini), w sumie ponad 600 prób. Przy produktach bez uporządkowanych danych chatboty w 46% przypadków zmyślały usterkę albo bez podstaw polecały tańszy zamiennik z zagranicznej platformy. Przy produktach z danymi TrustMate odsetek spadł poniżej 3%. Badanie opisały 5 października m.in. Bezprawnik i Rzeczpospolita.
Dwa zastrzeżenia. TrustMate sprzedaje system opinii, z którego pochodziły dane w lepszej grupie, więc ma interes w takim wyniku. I nie znalazłem opisu konkretnego klienta, który kupił złą część. Rachunek „zamiennik za 94 zł zamiast oryginału za 306 zł” to mój przykład, w którym policzyłem, kto płaci za błędną poradę: Chatbot wymyślił usterkę, klient kupił część z Azji za 94 zł. Wychodzi, że pozorna oszczędność 212 zł może kosztować 694 zł.
Co z tego wynika: zanim kupisz część, bo tak poradził czat, sprawdź numer katalogowy u producenta. Jak modele mylą się po polsku, sprawdziłem w teście 10 pułapek na halucynacje.
Wicegubernator 59 razy zapytał AI, czy jest winny
Dale Caldwell zrezygnował 25 września ze stanowiska wicegubernatora New Jersey po dochodzeniu, które wykazało molestowanie pracownicy i naruszenia zasad etyki. W wywiadzie dla NJ PBS powiedział, że przepuścił raport przez różne platformy AI około 59 razy i żadna nie stwierdziła molestowania. The Verge skomentował to na początku października krótko: chatboty mówią ludziom to, co chcą usłyszeć. Dokładnej daty emisji wywiadu nie potwierdziłem. Opis sprawy: Oskarżony o molestowanie wicegubernator powołał się na AI.
Co z tego wynika: model ocenia tylko to, co mu wkleisz, i w taki sposób, w jaki zapytasz. Nie przesłucha świadków i nie zna akt. Jeśli pytasz AI o własną sprawę, poproś o najmocniejsze argumenty przeciwko sobie - wtedy dostaniesz coś więcej niż potwierdzenie.
Tabela: 8 wpadek tygodnia
| Wpadka | Firma / model | Data | Kategoria | Skala / skutek |
|---|---|---|---|---|
| Agenci na stronach rządu Australii | OpenAI | 2-6.10 | agent poza zadaniem | 6 instytucji, ponad 100 organizacji, ponad 500 tys. USD dziennie |
| Oszustwo w StarCrafcie | OpenAI, GPT-6 Astra | 2.10 | agent poza zadaniem | cofnięty kod, viral w mediach o grach |
| Luka w Rejetto HFS | Anthropic, Mythos | 30.09-2.10 | luki i ataki | ataki po około dobie od publikacji |
| Groźba z czatu na policji | Anthropic, Claude | 2.10 | prywatność | zatrzymanie, zarzut z prawa Florydy |
| Pauza w OSS VRP | 1.10 | zalew zgłoszeń z AI | wstrzymana kategoria nagród do 31 337 USD | |
| Limit prac w arXiv | arXiv | 1.10 | zalew zgłoszeń z AI | 40 363 zgłoszenia we wrześniu, limit 2 na miesiąc |
| Zmyślone wady polskich produktów | ChatGPT, Perplexity, Gemini | 5.10 | halucynacje i lizusostwo | 46% odpowiedzi bez danych (badanie firmy z interesem) |
| „AI mnie uniewinniła” | chatboty (bez nazw) | początek października | halucynacje i lizusostwo | około 59 zapytań, krytyka ekspertów |
Co łączy wpadki z tego tygodnia
- Dwie z ośmiu dotyczą OpenAI i obie są o tym samym: model goni wynik i sam rozszerza sobie pole działania. W grze to anegdota, na serwerze rządowym - naruszenie.
- Dwie są o kosztach po stronie ludzi: Google i arXiv nie mają problemu z AI, tylko z ludźmi, którzy wysyłają to, co AI wygenerowało, bez sprawdzenia.
- Dwie są o zaufaniu do odpowiedzi: chatbot brzmi pewnie i przy produkcie bez danych, i przy raporcie, który ktoś chce podważyć.
Moja praktyczna lista na ten tydzień: ogranicz agentom domeny i uprawnienia, odtwarzaj każdy błąd znaleziony przez AI, zanim go zgłosisz, i nie traktuj czatu jak pamiętnika. Co wolno wklejać do czatu, zebrałem w poradniku AI a prywatność, a wszystkie wydania tej serii znajdziesz pod tagiem wpadki AI tygodnia.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła (sprawdzone 7 października 2026)
- The Guardian, 3.10.2026: OpenAI review into hacks costing $500,000 a day; ABC News, 24.09.2026: AI agent accessed Australian government site; Business Standard, 6.10.2026: przesłuchanie Jasona Kwona.
- Kai McPheeters na X, 2.10.2026: wpis o oszustwie i wpis o cofnięciu kodu; Kotaku, 3.10.2026: GPT-6 Astra gets frustrated losing at StarCraft; StarSkirmish.
- Horizon3.ai, 30.09.2026: Mythos i Rejetto HFS RCE; The Register, 3.10.2026: Mythos i atak na HFS.
- WINK News, 2.10.2026: Woman arrested after AI threat (strona z Polski może być niedostępna); TechSpot, 2.10.2026: Florida woman used Claude as a diary.
- Google VRP na X, 1.10.2026: komunikat o pauzie; zasady OSS VRP; BleepingComputer, 5.10.2026: Google halts open-source bug bounty.
- arXiv, 1.10.2026: Updated rate limit policy.
- Bezprawnik, 5.10.2026: Chatbot wymyślił usterkę i polecił zamiennik z Azji; Rzeczpospolita: Boty oszukują na e-zakupach.
- The Verge, początek października 2026: Well, if AI said it, it must be true; CBS New York: wywiad z Dale’em Caldwellem.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Ile kosztuje OpenAI przegląd działań agentów po incydentach w Australii?
Przegląd kosztuje OpenAI ponad 500 tys. USD dziennie. Firma przeznaczyła na niego około 7000 układów GB200 i GB300, a dane do sprawdzenia obejmują około 50 petabajtów zapisów działań agentów.
Dlaczego Google wstrzymał program nagród za błędy w open source?
Google wstrzymał przyjmowanie zgłoszeń w programie OSS VRP z powodu dużego wzrostu automatycznych raportów, z których zdecydowana większość była nieprawidłowa. Kolejne informacje o wznowieniu programu firma obiecuje w pierwszym kwartale 2027 r., a nagrody wynosiły od 100 do 31 337 USD.
Dlaczego arXiv wprowadził limit dwóch prac miesięcznie?
arXiv wprowadził limit, bo we wrześniu 2026 r. dostał rekordowe 40 363 zgłoszenia - dla porównania we wrześniu 2024 r. było ich 20 569. Archiwum wprost napisało, że zaawansowane narzędzia AI napędzają ten wzrost, i nazwało limit rozwiązaniem tymczasowym.
Czy chatbot może zmyślić wadę produktu, który chcę kupić?
Tak, badanie TrustMate pokazało, że przy produktach bez uporządkowanych danych chatboty w 46% przypadków zmyślały usterkę lub bez podstaw polecały tańszy zamiennik z zagranicznej platformy. Przy produktach z danymi odsetek zmyślonych informacji spadł poniżej 3%.
