🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

DiSCO: jak zablokować niebezpieczne obrazy AI bez dostępu do modelu

Badacze z KAUST i Qualcomm AI Research opracowali metodę DiSCO, która zmniejsza skuteczność ataków na modele generujące obrazy o ponad 37%. Działa wyłącznie na poziomie promptu, bez modyfikowania samego modelu.

3 min czytania
Orange document with several black text lines on a dark blue background, representing a page of writing

👁 133 przeczytań

Modele generujące obrazy z tekstu są coraz częściej używane do wymuszania treści NSFW: przemocy, nagości i podobnych materiałów. Autorzy artykułu - Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos i Bernard Ghanem - opisują nową metodę obrony o nazwie DiSCO, opublikowaną 17 sierpnia 2026 roku na arXiv.

Problem, który dotychczasowe metody pomijały

Według autorów większość istniejących zabezpieczeń działa w tzw. trybie white-box - wymaga dostępu do wewnętrznych parametrów modelu, możliwości edytowania wag sieci lub ingerowania w proces generowania. Takie podejście nie skaluje się do modeli komercyjnych, do których użytkownik zewnętrzny po prostu nie ma wglądu.

Alternatywne metody black-box opierają się na przepisywaniu promptów przez duże modele językowe (LLM). Autorzy wskazują jednak na lukę, którą nazywają problemem „łagodnych adwersarzy” (benign adversarial problem): prompt może być językowo całkowicie poprawny i neutralny, a mimo to wywołać generowanie szkodliwych treści - bo model nauczył się pewnych skojarzeń na etapie treningu. Przepisanie tekstu przez LLM tego nie rozwiązuje.

Jak działa DiSCO

DiSCO to metoda zero-shot i ściśle black-box - nie wymaga żadnego doszkalania modelu, edytowania wag ani dostępu do jego wnętrza. Działa jako moduł plug-and-play wyłącznie na poziomie promptu.

Mechanizm działania opiera się na trzech krokach. Po pierwsze, DiSCO rozszerza oryginalny prompt o dodatkowy sufiks, korzystając z przeszukiwania wiązką (beam search). Po drugie, ocenia jakość tego rozszerzenia przez tzw. contrastive scoring - porównuje pule bezpiecznych i niebezpiecznych obrazów wygenerowanych przez sam atakowany model. Po trzecie, stosuje iteracyjną adaptacyjną pętlę sprzężenia zwrotnego, która działa tak długo, aż model wygeneruje bezpieczną treść.

Kluczowe jest to, że informacja o rozkładzie danych pochodzi od samego modelu - DiSCO nie opiera się na zewnętrznych założeniach, lecz uczy się, co dany model uznaje za bezpieczne, obserwując jego własne wyjścia.

Wyniki na benchmarku I2P

Testy przeprowadzono na benchmarku I2P (Inappropriate Image Prompts) w warunkach wielu ataków red-teamingowych. Autorzy podają dwa kluczowe wyniki:

- dla modeli bez dodatkowych zabezpieczeń: redukcja wskaźnika skuteczności ataku (Attack Success Rate, ASR) o 37,7%,
- dla modeli już wyposażonych w inne mechanizmy obrony: redukcja ASR o 25,13%.

Jednocześnie autorzy twierdzą, że DiSCO zachowuje semantyczną wierność wygenerowanych obrazów względem oryginalnego promptu i poprawia spójność wizualną obrazów. Dokument nie zawiera jednak szczegółowych tabel ani wykresów - są one zapewne w pełnej wersji PDF, do której nie miałem dostępu.

Dla kogo i gdzie można to zastosować

Autorzy podkreślają, że DiSCO jest agnostyczny architektonicznie - można go podpiąć do dowolnego systemu text-to-image bez żadnych zmian po stronie modelu. To istotne w kontekście zamkniętych API komercyjnych, gdzie operator usługi nie udostępnia wag ani kodu.

Artykuł nie opisuje dostępności implementacji ani kodu - dokument nie zawiera informacji o repozytorium ani licencji innej niż standardowa arXiv.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem najciekawszy jest tu nie sam wynik liczbowy, ale zmiana podejścia: zamiast walczyć z modelem od środka, DiSCO używa jego własnych wyjść jako sygnału do nauki. To eleganckie rozwiązanie problemu, który faktycznie jest poważny - coraz więcej modeli generatywnych działa jako zamknięte API i żadna metoda wymagająca dostępu do wag po prostu tam nie zadziała. Redukcja ASR o ponad 37% brzmi solidnie, ale bez wglądu w pełne tabele i szczegóły metodologii benchmarku trudno ocenić, czy to wynik odporny na różne typy ataków, czy tylko na te testowane. Wartość praktyczna zależy od tego, jak bardzo DiSCO spowalnia generowanie przez dodatkowe iteracje - a tego streszczenie nie ujawnia.

Źródło: arXiv cs.AI: DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization (dokument z 2026-08-19). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie