› W debacie o bezpieczeństwie modeli językowych pojawiło się narzędzie zwane sondą liniową (linear probe).
› Chodzi o klasyfikator, który patrzy na wewnętrzne aktywacje modelu i próbuje odczytać z nich, czy model "wie" prawdę, nawet jeśli jej nie mówi.
› Jeżeli taka sonda wypada poniżej poziomu losowego, naturalnym wnioskiem jest: model ukrył prawdę albo przestał ją reprezentować.
› Praca Dylana Jayabahu z września 2026 roku pokazuje, że ten wniosek może być pochopny.Na czym polega problemAutor nazywa opisywane zjawisko "perfect aliasing" - dosłownie: idealnym nakładaniem się etykiet.