PROMPTOWY_
Newsy

Sonda prawdy w LLM: błąd pomiaru, nie ukryta wiedza modelu

promptowy@ai:~$ cat news_1

› W debacie o bezpieczeństwie modeli językowych pojawiło się narzędzie zwane sondą liniową (linear probe).

promptowy@ai:~$ cat news_2

› Chodzi o klasyfikator, który patrzy na wewnętrzne aktywacje modelu i próbuje odczytać z nich, czy model "wie" prawdę, nawet jeśli jej nie mówi.

promptowy@ai:~$ cat news_3

› Jeżeli taka sonda wypada poniżej poziomu losowego, naturalnym wnioskiem jest: model ukrył prawdę albo przestał ją reprezentować.

promptowy@ai:~$ cat news_4

› Praca Dylana Jayabahu z września 2026 roku pokazuje, że ten wniosek może być pochopny.Na czym polega problemAutor nazywa opisywane zjawisko "perfect aliasing" - dosłownie: idealnym nakładaniem się etykiet.

promptowy@ai:~$ open --full
Czytaj całość

Sonda prawdy w LLM: błąd pomiaru, nie ukryta wiedza modelu

Otwórz artykuł na promptowy.com