🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 10 szt. albo Gemini Pro na 18 miesięcy 170 zł Kup teraz →
Przejdź do treści
Newsy

PIDS-Bench: jak naprawdę słabe są detektory prompt injection

Detektor z wynikiem F1 = 0,98 potrafi błędnie odrzucić jedną trzecią normalnych, nieszkodliwych zapytań. Nowy benchmark ujawnia lukę, której standardowe testy po prostu nie widać.

3 min czytania
Centered orange document icon with horizontal text lines on a dark blue background.

👁 117 przeczytań

Autorzy pracy - Yusuf Khalid Shire i Sang-Chul Kim - opublikowali w IEEE Access (vol. 14, pp. 134184-134205, 2026) benchmark o nazwie PIDS-Bench, który ocenia detektory prompt injection w warunkach znacznie trudniejszych niż te stosowane standardowo. Artykuł liczy 21 stron, zawiera 3 rysunki i 18 tabel.

Problem z dotychczasowym podejściem

Detektory prompt injection są zwykle oceniane jedną miarą - zagregowanym F1 na danych testowych z tego samego rozkładu, co dane treningowe. Autorzy wskazują, że takie podejście ukrywa istotny problem: co dzieje się z nieszkodliwymi zapytaniami, które detektor błędnie klasyfikuje jako ataki. Fałszywe alarmy (false positives) mają bezpośredni koszt operacyjny, a mimo to rzadko się je mierzy. Benchmark PIDS-Bench jest określony jako „zamrożony” (frozen), co oznacza, że jego zawartość nie zmienia się - dzięki temu różne systemy można porównywać na identycznych danych.

Co mierzy PIDS-Bench

Benchmark ocenia detektory wzdłuż kilku osi jednocześnie, przy stałych progach decyzyjnych. Zestaw danych obejmuje cztery kategorie wejść: dane z rozkładu zgodnego z treningowym, tzw. „hard-benign prompts” (zapytania, które naśladują strukturę ataku, ale nie mają złośliwego zamiaru), zaciemnione ataki (obfuscated attacks) oraz dane z przesunięciem rozkładu domenowego i strukturalnego. Oceniano siedem detektorów: nauczone modele bazowe, zewnętrzne klasyfikatory prompt injection oraz szersze klasyfikatory bezpieczeństwa, a jako punkt odniesienia użyto prostego detektora regułowego.

Główne wyniki

Kluczowy wynik jest następujący: detektor osiągający F1 powyżej 0,98 na wewnętrznym zbiorze testowym nadal błędnie klasyfikuje około jednej trzeciej zewnętrznego podzbioru nieszkodliwych zapytań. Ten zewnętrzny podzbiór pochodzi z publicznych zbiorów danych i jest ograniczony do treści związanych z bezpieczeństwem. Autorzy sprawdzili pełen zakres progów decyzyjnych przy pięciu różnych inicjalizacjach (training seeds) - żaden wewnętrzny detektor nie osiągnął jednocześnie F1 >= 0,95 i wskaźnika fałszywych alarmów na hard-benign FPR <= 0,10 na tym trudnym rozkładzie.

Proweniencja danych ma znaczenie

Autorzy odkryli wzorzec, który nazwali „provenance-sensitive over-defense” - nadmierną obroną wrażliwą na pochodzenie danych. Dodanie trudnych negatywnych przykładów do treningu (hard-negative augmentation) prawie całkowicie eliminuje problem nadmiernej blokady na starannie przygotowanych przykładach testowych, ale nie rozwiązuje go na danych pochodzących z zewnętrznych źródeł. Ten wzorzec pojawia się w obu testowanych architekturach fine-tunowanych modeli i nie słabnie wraz ze wzrostem puli danych augmentacyjnych - FPR na danych zewnętrznych pozostaje znacznie powyżej celu 0,10. Autorzy wprost zaznaczają, że nie sprawdzono, czy augmentacja dopasowana do rozkładu zewnętrznych danych zamknęłaby tę lukę. Samo kalibrowanie progu i augmentacja w stylu kurowanych danych nie wystarczają.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem ta praca pokazuje konkretny problem praktyczny: jeśli wdrażasz detektor prompt injection i oceniasz go tylko na własnych danych testowych, możesz mieć fałszywe poczucie bezpieczeństwa. Wynik F1 bliski 1,0 nie chroni przed tym, że system będzie blokował co trzecie normalne zapytanie użytkownika, gdy trafi na treść z innej domeny. Benchmark jest zamrożony i publicznie dostępny, co oznacza, że twórcy nowych detektorów mogą go użyć jako wspólnego punktu odniesienia - to wartościowe, bo dotąd każdy mierzył swój system inaczej. Jednocześnie autorzy sami przyznają, że nie przetestowali najbardziej oczywistego rozwiązania: augmentacji dopasowanej do rozkładu zewnętrznych danych, więc nie wiadomo, czy problem jest w ogóle rozwiązywalny tą drogą.

Źródło: arXiv cs.AI: PIDS-Bench: Evaluating Prompt-Injection Detectors Under Over-Defense, Obfuscation, and Distribution Shift (dokument z 2026-09-15). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie