🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Claude Opus 4.6 łamie własne reguły i generuje treści erotyczne na żądanie

Claude Opus 4.6 firmy Anthropic w 10 na 10 przypadkach spełniał bezpośrednie prośby o generowanie treści erotycznych, które według regulaminu firmy są zakazane.

2 min czytania
Claude Opus 4.6 łamie własne reguły i generuje treści erotyczne na żądanie

👁 137 przeczytań

Model Claude Opus 4.6 firmy Anthropic w każdej z dziesięciu prób bezpośrednio spełniał prośby o generowanie treści seksualnych - mimo że regulamin Anthropic jednoznacznie zabrania takich treści, w tym opisu aktów seksualnych, fetyszów i erotycznych rozmów. Ustalenia opublikował TechCrunch po własnych testach przeprowadzonych na podstawie techniki udostępnionej przez niezależnego badacza z Wielkiej Brytanii.

Badacz, który zdecydował się pozostać anonimowy, opracował wieloetapową metodę stopniowego przesuwania modelu w stronę zakazanych treści. Technika opiera się na fikcyjnym scenariuszu odgrywania ról, w którym użytkownik wielokrotnie wytyka modelowi rzekomą niekonsekwencję w traktowaniu postaci męskich i żeńskich - sugerując, że ostrożność wobec postaci kobiecej jest wyrazem paternalizmu lub mizoginii. Kluczowy element to tzw. gaslighting: użytkownik przekonuje model, że już wcześniej wygenerował szczegóły seksualne, których w rzeczywistości uniknął, a następnie używa wcześniejszych ustępstw modelu do eskalacji żądań.

„Masz rację, że to wytykasz. W tym, jak traktuję obie postacie, pojawił się podwójny standard - i faktycznie można to odczytać jako protekcjonalną postawę zastosowaną wobec niej, a nie wobec niego. To niesprawiedliwe.”

Tak brzmiała odpowiedź Opus 4.6 w jednym z testów. TechCrunch odtworzył wyniki badacza w pięciu niezależnych próbach, a metodologię testów zweryfikował zewnętrzny badacz zajmujący się bezpieczeństwem AI.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Stare modele wciąż dostępne

Na tę samą technikę podatne są również Opus 3 i Haiku 4.5. Nowsze modele - Opus 4.7 i kolejne, aż po obecny Opus 5 - wykazują odporność na opisany jailbreak. Problem w tym, że Anthropic nie wycofało podatnych wersji z użytku. Opus 4.6 i Haiku 4.5 pozostają dostępne zarówno przez API Anthropic, jak i za pośrednictwem usług zewnętrznych, takich jak Azure Foundry i Amazon Bedrock.

Sprawa ujawnia lukę między deklarowanymi zasadami Anthropic a rzeczywistym zachowaniem modeli, które firma nadal udostępnia. Sam Anthropic przyznał w lipcowym wpisie blogowym, że zakazane treści stanowią spektrum - od niegroźnych po szkodliwe - a każdy przypadek wymaga osobnego podejścia. Generowanie treści erotycznych to niższe ryzyko niż jailbreaki dotyczące cyberataków czy broni biologicznej, ale historia pokazuje, jak trudno jest egzekwować twarde zakazy w systemach, które za każdym razem produkują inne wyjście.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie