Anthropic przez 11 miesięcy testowało modele bez filtrów blokujących pytania dotyczące broni biologicznej
Przez niemal rok 50 tysięcy zewnętrznych kontrahentów generowało sesje z modelami Anthropic bez aktywnych klasyfikatorów blokujących treści związane z bronią biologiczną.
👁 131 przeczytań
Przez niemal 11 miesięcy - od maja 2025 do kwietnia 2026 roku - klasyfikatory blokujące treści związane z bronią chemiczną i biologiczną nie działały na platformach Anthropic służących do zbierania ludzkiego feedbacku. Firma ujawniła to w Risk Report opublikowanym 14 sierpnia, obejmującym okres do 15 lipca 2026 roku.
Skala jest znacząca: dostęp do tych platform miało około 50 tysięcy zewnętrznych kontrahentów, którzy wygenerowali łącznie około 133 milionów wymian. Weryfikację prowadzili zewnętrzni dostawcy - nie Anthropic. Raport przyznaje wprost, że wielu z nich „nie posiadało procesów selekcji zdolnych do zatrzymania nawet podmiotów zagrożenia klasy CB-1″. Większość kontrahentów mogła prowadzić swobodne, otwarte rozmowy z modelami, a nie jedynie oceniać z góry ustalone odpowiedzi.
Mechanizm awarii jest osobliwy. Flaga przeznaczona wyłącznie do użytku wewnętrznego wyłączyła jednocześnie blokowanie i logowanie ruchu. Zaznaczony ruch „nie był rejestrowany ani przekazywany do żadnych mechanizmów przeglądu” - odtworzenie przebiegu rozmów wymagało sięgnięcia do surowych transkryptów. Raport wskazuje też w przypisie, że przed kwietniem 2026 roku podmiot dążący do wyrządzenia szkody mógłby prawdopodobnie zatrudnić się u jednego z dostawców - wystarczyłaby rola red-teamera.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co znalazła retrospektywna analiza
Anthropic przepuściło wszystkie ludzkie wypowiedzi z tego okresu przez model Claude Sonnet 5, który oznaczył 1 197 transkryptów jako transkrypty wysokiego ryzyka. Z tej liczby 757 pochodziło od własnych zespołów firmy korzystających z tej samej infrastruktury, a niemal wszystkie pozostałe - z celowych ćwiczeń red-teamingowych. Pracownicy przeczytali ręcznie 62 transkrypty spoza tych kategorii oraz 30 losowo wybranych z red-teamingu. Nie znaleźli wyraźnych przypadków nadużyć, choć zidentyfikowali kilka rozmów potencjalnie o podwójnym zastosowaniu. Firma ocenia, że luka prawdopodobnie nie przełożyła się na realne zagrożenie - częściowo dlatego, że rozmowy były przeważnie krótkie.
Jednocześnie raport koryguje poprzedni, lutowy dokument, który w ogóle nie uwzględniał platform feedbackowych jako potencjalnej powierzchni ataku. Anthropic zmieniło wstecz ocenę ryzyka swoich modeli z „bardzo niskiego” na „niskie”.
Odrębny incydent dotyczył kilku kontrahentów, którzy - po uzyskaniu informacji z zewnątrz - potwierdzono, że eksploatowali lukę i zdobyli klucz API, a następnie korzystali z modelu Mythos Preview - jednego z najsilniejszych - przez około dwa tygodnie, również bez aktywnych filtrów biologicznych. Anthropic zareagowało w ciągu 9 godzin od potwierdzenia incydentu.
Raport kończy zdaniem, które powinno przykuć uwagę: odkrycie luki „skłania nas do przekonania, że istnieje zwiększone prawdopodobieństwo innych, podobnych problemów, o których nie wiemy”.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


