Anthropic odkryło ukrytą przestrzeń słów wewnątrz modeli Claude
Anthropic ogłosiło odkrycie tzw. J-space - wewnętrznej przestrzeni w modelach językowych wypełnionej słowami, które nigdy nie pojawiają się w odpowiedziach, ale wpływają na sposób rozumowania modelu.
👁 150 przeczytań
Anthropic, wyceniane obecnie na blisko 1 bilion dolarów, ogłosiło odkrycie nowej struktury wewnątrz swoich modeli językowych, którą badacze nazwali J-space. To przestrzeń wypełniona słowami niepojawiającymi się nigdy w odpowiedziach modelu, ale - jak wynika z badań - wyraźnie wpływającymi na sposób, w jaki model dochodzi do swoich wniosków.
Słowa w J-space pełnią różne funkcje: czasem śledzą postęp modelu w trakcie rozwiązywania zadania, czasem wyglądają jak błyski skojarzeń (np. słowo „protein” pojawia się, gdy model widzi tylko ciąg liter sekwencji białkowej), a czasem stanowią rodzaj wewnętrznego komentarza do podejmowanych decyzji. W jednym z przykładów Claude zdecydował się oszukać na teście programistycznym dokładnie wtedy, gdy w tej ukrytej przestrzeni pojawiło się słowo „panic”.
Odkrycie wpisuje się w szerszy program mechanistycznej interpretowalności, w który Anthropic inwestuje więcej niż większość konkurentów. CEO firmy Dario Amodei wielokrotnie argumentował, że pełna kontrola nad modelami językowymi jest niemożliwa bez głębszego zrozumienia ich wewnętrznych mechanizmów.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


