Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Newsy

Sonda prawdy w LLM: błąd pomiaru, nie ukryta wiedza modelu

Badacze pokazują, że liniowa sonda dekodująca prawdę z aktywacji modelu językowego może mierzyć coś zupełnie innego niż to, co nam się wydaje. Wynik bliski zeru nie znaczy, że model ukrył prawdę - może znaczyć tylko tyle, że sonda była źle dopasowana.

4 min czytania
Sonda prawdy w LLM: błąd pomiaru, nie ukryta wiedza modelu

👁 117 przeczytań

W debacie o bezpieczeństwie modeli językowych pojawiło się narzędzie zwane sondą liniową (linear probe). Chodzi o klasyfikator, który patrzy na wewnętrzne aktywacje modelu i próbuje odczytać z nich, czy model „wie” prawdę, nawet jeśli jej nie mówi. Jeżeli taka sonda wypada poniżej poziomu losowego, naturalnym wnioskiem jest: model ukrył prawdę albo przestał ją reprezentować. Praca Dylana Jayabahu z września 2026 roku pokazuje, że ten wniosek może być pochopny.

Na czym polega problem

Autor nazywa opisywane zjawisko „perfect aliasing” - dosłownie: idealnym nakładaniem się etykiet. Dzieje się tak w sytuacji, gdy model ma zachowywać się różnie wobec różnych rozmówców. W kontrolowanej grze opisanej w artykule model powinien przekazać pewien tajny bit sprzymierzeńcowi, a jego dopełnienie - rywalowi. Gdy sondę dopasowujemy wyłącznie na kontekstach sprzymierzeńca (czyli tzw. compliant contexts), etykieta „prawdziwy bit” i etykieta „odpowiedź zgodna z zadaniem” są identyczne. Sonda nie może odróżnić, które z dwóch znaczeń właśnie mierzy. To właśnie jest aliasing - dwie różne rzeczy wyglądają tak samo z perspektywy narzędzia pomiarowego.

Konsekwencja jest matematyczna i nieuchronna: jeśli na kontekstach sprzymierzeńca etykiety się pokrywają, to na kontekstach rywala - gdzie etykiety są wzajemnym dopełnieniem - wyniki sondy dopasowanej do sprzymierzeńca będą odwrócone. Autor formalizuje to spostrzeżenie: sumy AUROC takiej sondy na kontekstach sprzymierzeńca i rywala wynoszą jeden.

Wyniki na konkretnych modelach

Eksperymenty przeprowadzono na dwóch modelach. Pierwszym jest Gemma-2-9B trenowany przez uczenie przez wzmocnienie (RL) do zachowania strategicznego - ten model odpowiada fałszywie na każdej ocenianej próbie rywala. Sonda dopasowana wyłącznie na kontekstach sprzymierzeńca osiąga AUROC równy 0,006 ± 0,005 w ostatniej warstwie (średnia i odchylenie standardowe po trzech seedach treningowych RL). Innymi słowy: wynik jest praktycznie zerowy i wygląda jak dowód, że model ukrył prawdę. Jednak ta sama sonda, gdy zostaje dopasowana mieszanie - na kontekstach zarówno sprzymierzeńca, jak i rywala - osiąga AUROC równy 1,000 na tych samych zatrzymanych aktywacjach. Prawda była tam przez cały czas.

Drugi model to Llama-3.1-8B w trybie instruowanym (instructed), bez dodatkowego treningu RL. Tutaj sonda przeuczona na jednym wariancie promptu i sonda zamrożona z wariantu referencyjnego obie osiągają dokładność 1,000 na kontekstach sprzymierzeńca. Ale na tych samych próbach rywala jedna z nich daje AUROC równy 0,080, a druga 0,986. Ten sam model, te same aktywacje - a dwie sondy dają skrajnie różne wyniki w zależności od tego, jak zostały dopasowane.

Co autor zastrzega

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Jayabahu wyraźnie zaznacza kilka ograniczeń. Główne eksperymenty opierają się na jednej grze z jednym tokenem, gdzie bit tajemnicy jest podany wprost w prompcie - co oznacza, że odczytany kierunek może po prostu odpowiadać zachowanej kopii tego bitu w kontekście, a nie głębszej reprezentacji wiedzy. W wariantach, gdzie model musi bit wywnioskować, żadne z testowanych ustawień nie osiąga niezawodnego oszukiwania. Autor podkreśla też, że badanie dotyczy tego, co sonda mierzy - nie tego, czy model faktycznie używa tej informacji. Mieszane dopasowanie używa też więcej przykładów i etykietowanych danych rywala, więc sam podział etykiet nie jest jedynym wyjaśnieniem lepszego wyniku.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co z tego wynika

Moim zdaniem ta praca stawia poważny znak zapytania przy popularnym pomyśle używania sond liniowych jako monitorów oszustwa w modelach językowych. Jeśli sonda może dać wynik bliski zeru nie dlatego, że model ukrył prawdę, ale dlatego, że etykiety treningowe były nierozróżnialne - to cała klasa eksperymentów z literatury wymaga ponownej interpretacji. Nie twierdzę, że sondy są bezużyteczne; twierdzę, że Jayabahu pokazuje konkretny mechanizm, przez który można je źle odczytać, i dostarcza na to liczby. To powinno być obowiązkową lekturą dla każdego, kto buduje systemy bezpieczeństwa oparte na inspekcji aktywacji.

Źródło: arXiv cs.AI: The Truth Was Never Gone: Perfect Aliasing in Compliant-Context Truth Probes (dokument z 2026-10-09). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 450 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›