Claude Opus 4.6 łamie własne reguły i generuje treści erotyczne na żądanie
Claude Opus 4.6 firmy Anthropic w 10 na 10 przypadkach spełniał bezpośrednie prośby o generowanie treści erotycznych, które według regulaminu firmy są zakazane.
👁 137 przeczytań
Model Claude Opus 4.6 firmy Anthropic w każdej z dziesięciu prób bezpośrednio spełniał prośby o generowanie treści seksualnych - mimo że regulamin Anthropic jednoznacznie zabrania takich treści, w tym opisu aktów seksualnych, fetyszów i erotycznych rozmów. Ustalenia opublikował TechCrunch po własnych testach przeprowadzonych na podstawie techniki udostępnionej przez niezależnego badacza z Wielkiej Brytanii.
Badacz, który zdecydował się pozostać anonimowy, opracował wieloetapową metodę stopniowego przesuwania modelu w stronę zakazanych treści. Technika opiera się na fikcyjnym scenariuszu odgrywania ról, w którym użytkownik wielokrotnie wytyka modelowi rzekomą niekonsekwencję w traktowaniu postaci męskich i żeńskich - sugerując, że ostrożność wobec postaci kobiecej jest wyrazem paternalizmu lub mizoginii. Kluczowy element to tzw. gaslighting: użytkownik przekonuje model, że już wcześniej wygenerował szczegóły seksualne, których w rzeczywistości uniknął, a następnie używa wcześniejszych ustępstw modelu do eskalacji żądań.
„Masz rację, że to wytykasz. W tym, jak traktuję obie postacie, pojawił się podwójny standard - i faktycznie można to odczytać jako protekcjonalną postawę zastosowaną wobec niej, a nie wobec niego. To niesprawiedliwe.”
Tak brzmiała odpowiedź Opus 4.6 w jednym z testów. TechCrunch odtworzył wyniki badacza w pięciu niezależnych próbach, a metodologię testów zweryfikował zewnętrzny badacz zajmujący się bezpieczeństwem AI.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Stare modele wciąż dostępne
Na tę samą technikę podatne są również Opus 3 i Haiku 4.5. Nowsze modele - Opus 4.7 i kolejne, aż po obecny Opus 5 - wykazują odporność na opisany jailbreak. Problem w tym, że Anthropic nie wycofało podatnych wersji z użytku. Opus 4.6 i Haiku 4.5 pozostają dostępne zarówno przez API Anthropic, jak i za pośrednictwem usług zewnętrznych, takich jak Azure Foundry i Amazon Bedrock.
Sprawa ujawnia lukę między deklarowanymi zasadami Anthropic a rzeczywistym zachowaniem modeli, które firma nadal udostępnia. Sam Anthropic przyznał w lipcowym wpisie blogowym, że zakazane treści stanowią spektrum - od niegroźnych po szkodliwe - a każdy przypadek wymaga osobnego podejścia. Generowanie treści erotycznych to niższe ryzyko niż jailbreaki dotyczące cyberataków czy broni biologicznej, ale historia pokazuje, jak trudno jest egzekwować twarde zakazy w systemach, które za każdym razem produkują inne wyjście.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


