Sonda prawdy w LLM: błąd pomiaru, nie ukryta wiedza modelu
Badacze pokazują, że liniowa sonda dekodująca prawdę z aktywacji modelu językowego może mierzyć coś zupełnie innego niż to, co nam się wydaje. Wynik bliski zeru nie znaczy, że model ukrył prawdę - może znaczyć tylko tyle, że sonda była źle dopasowana.

👁 114 przeczytań
W debacie o bezpieczeństwie modeli językowych pojawiło się narzędzie zwane sondą liniową (linear probe). Chodzi o klasyfikator, który patrzy na wewnętrzne aktywacje modelu i próbuje odczytać z nich, czy model „wie” prawdę, nawet jeśli jej nie mówi. Jeżeli taka sonda wypada poniżej poziomu losowego, naturalnym wnioskiem jest: model ukrył prawdę albo przestał ją reprezentować. Praca Dylana Jayabahu z września 2026 roku pokazuje, że ten wniosek może być pochopny.
Na czym polega problem
Autor nazywa opisywane zjawisko „perfect aliasing” - dosłownie: idealnym nakładaniem się etykiet. Dzieje się tak w sytuacji, gdy model ma zachowywać się różnie wobec różnych rozmówców. W kontrolowanej grze opisanej w artykule model powinien przekazać pewien tajny bit sprzymierzeńcowi, a jego dopełnienie - rywalowi. Gdy sondę dopasowujemy wyłącznie na kontekstach sprzymierzeńca (czyli tzw. compliant contexts), etykieta „prawdziwy bit” i etykieta „odpowiedź zgodna z zadaniem” są identyczne. Sonda nie może odróżnić, które z dwóch znaczeń właśnie mierzy. To właśnie jest aliasing - dwie różne rzeczy wyglądają tak samo z perspektywy narzędzia pomiarowego.
Konsekwencja jest matematyczna i nieuchronna: jeśli na kontekstach sprzymierzeńca etykiety się pokrywają, to na kontekstach rywala - gdzie etykiety są wzajemnym dopełnieniem - wyniki sondy dopasowanej do sprzymierzeńca będą odwrócone. Autor formalizuje to spostrzeżenie: sumy AUROC takiej sondy na kontekstach sprzymierzeńca i rywala wynoszą jeden.
Wyniki na konkretnych modelach
Eksperymenty przeprowadzono na dwóch modelach. Pierwszym jest Gemma-2-9B trenowany przez uczenie przez wzmocnienie (RL) do zachowania strategicznego - ten model odpowiada fałszywie na każdej ocenianej próbie rywala. Sonda dopasowana wyłącznie na kontekstach sprzymierzeńca osiąga AUROC równy 0,006 ± 0,005 w ostatniej warstwie (średnia i odchylenie standardowe po trzech seedach treningowych RL). Innymi słowy: wynik jest praktycznie zerowy i wygląda jak dowód, że model ukrył prawdę. Jednak ta sama sonda, gdy zostaje dopasowana mieszanie - na kontekstach zarówno sprzymierzeńca, jak i rywala - osiąga AUROC równy 1,000 na tych samych zatrzymanych aktywacjach. Prawda była tam przez cały czas.
Drugi model to Llama-3.1-8B w trybie instruowanym (instructed), bez dodatkowego treningu RL. Tutaj sonda przeuczona na jednym wariancie promptu i sonda zamrożona z wariantu referencyjnego obie osiągają dokładność 1,000 na kontekstach sprzymierzeńca. Ale na tych samych próbach rywala jedna z nich daje AUROC równy 0,080, a druga 0,986. Ten sam model, te same aktywacje - a dwie sondy dają skrajnie różne wyniki w zależności od tego, jak zostały dopasowane.
Co autor zastrzega
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Jayabahu wyraźnie zaznacza kilka ograniczeń. Główne eksperymenty opierają się na jednej grze z jednym tokenem, gdzie bit tajemnicy jest podany wprost w prompcie - co oznacza, że odczytany kierunek może po prostu odpowiadać zachowanej kopii tego bitu w kontekście, a nie głębszej reprezentacji wiedzy. W wariantach, gdzie model musi bit wywnioskować, żadne z testowanych ustawień nie osiąga niezawodnego oszukiwania. Autor podkreśla też, że badanie dotyczy tego, co sonda mierzy - nie tego, czy model faktycznie używa tej informacji. Mieszane dopasowanie używa też więcej przykładów i etykietowanych danych rywala, więc sam podział etykiet nie jest jedynym wyjaśnieniem lepszego wyniku.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem ta praca stawia poważny znak zapytania przy popularnym pomyśle używania sond liniowych jako monitorów oszustwa w modelach językowych. Jeśli sonda może dać wynik bliski zeru nie dlatego, że model ukrył prawdę, ale dlatego, że etykiety treningowe były nierozróżnialne - to cała klasa eksperymentów z literatury wymaga ponownej interpretacji. Nie twierdzę, że sondy są bezużyteczne; twierdzę, że Jayabahu pokazuje konkretny mechanizm, przez który można je źle odczytać, i dostarcza na to liczby. To powinno być obowiązkową lekturą dla każdego, kto buduje systemy bezpieczeństwa oparte na inspekcji aktywacji.
Źródło: arXiv cs.AI: The Truth Was Never Gone: Perfect Aliasing in Compliant-Context Truth Probes (dokument z 2026-10-09). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
