🔥 Gemini Pro 170 zł -43% CapCut Pro 460 zł -23% do niedzieli Zobacz →
Przejdź do treści
Newsy

Anthropic przez 11 miesięcy testowało modele bez filtrów blokujących pytania dotyczące broni biologicznej

Przez niemal rok 50 tysięcy zewnętrznych kontrahentów generowało sesje z modelami Anthropic bez aktywnych klasyfikatorów blokujących treści związane z bronią biologiczną.

2 min czytania
Anthropic przez 11 miesięcy testowało modele bez filtrów blokujących pytania o broń biologiczną

👁 131 przeczytań

Przez niemal 11 miesięcy - od maja 2025 do kwietnia 2026 roku - klasyfikatory blokujące treści związane z bronią chemiczną i biologiczną nie działały na platformach Anthropic służących do zbierania ludzkiego feedbacku. Firma ujawniła to w Risk Report opublikowanym 14 sierpnia, obejmującym okres do 15 lipca 2026 roku.

Skala jest znacząca: dostęp do tych platform miało około 50 tysięcy zewnętrznych kontrahentów, którzy wygenerowali łącznie około 133 milionów wymian. Weryfikację prowadzili zewnętrzni dostawcy - nie Anthropic. Raport przyznaje wprost, że wielu z nich „nie posiadało procesów selekcji zdolnych do zatrzymania nawet podmiotów zagrożenia klasy CB-1″. Większość kontrahentów mogła prowadzić swobodne, otwarte rozmowy z modelami, a nie jedynie oceniać z góry ustalone odpowiedzi.

Mechanizm awarii jest osobliwy. Flaga przeznaczona wyłącznie do użytku wewnętrznego wyłączyła jednocześnie blokowanie i logowanie ruchu. Zaznaczony ruch „nie był rejestrowany ani przekazywany do żadnych mechanizmów przeglądu” - odtworzenie przebiegu rozmów wymagało sięgnięcia do surowych transkryptów. Raport wskazuje też w przypisie, że przed kwietniem 2026 roku podmiot dążący do wyrządzenia szkody mógłby prawdopodobnie zatrudnić się u jednego z dostawców - wystarczyłaby rola red-teamera.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co znalazła retrospektywna analiza

Anthropic przepuściło wszystkie ludzkie wypowiedzi z tego okresu przez model Claude Sonnet 5, który oznaczył 1 197 transkryptów jako transkrypty wysokiego ryzyka. Z tej liczby 757 pochodziło od własnych zespołów firmy korzystających z tej samej infrastruktury, a niemal wszystkie pozostałe - z celowych ćwiczeń red-teamingowych. Pracownicy przeczytali ręcznie 62 transkrypty spoza tych kategorii oraz 30 losowo wybranych z red-teamingu. Nie znaleźli wyraźnych przypadków nadużyć, choć zidentyfikowali kilka rozmów potencjalnie o podwójnym zastosowaniu. Firma ocenia, że luka prawdopodobnie nie przełożyła się na realne zagrożenie - częściowo dlatego, że rozmowy były przeważnie krótkie.

Jednocześnie raport koryguje poprzedni, lutowy dokument, który w ogóle nie uwzględniał platform feedbackowych jako potencjalnej powierzchni ataku. Anthropic zmieniło wstecz ocenę ryzyka swoich modeli z „bardzo niskiego” na „niskie”.

Odrębny incydent dotyczył kilku kontrahentów, którzy - po uzyskaniu informacji z zewnątrz - potwierdzono, że eksploatowali lukę i zdobyli klucz API, a następnie korzystali z modelu Mythos Preview - jednego z najsilniejszych - przez około dwa tygodnie, również bez aktywnych filtrów biologicznych. Anthropic zareagowało w ciągu 9 godzin od potwierdzenia incydentu.

Raport kończy zdaniem, które powinno przykuć uwagę: odkrycie luki „skłania nas do przekonania, że istnieje zwiększone prawdopodobieństwo innych, podobnych problemów, o których nie wiemy”.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie