🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 8 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Newsy

Kiedy narzędzia psują myślenie LLM - badanie zależne od stanu wiedzy modelu

Powszechne założenie, że zewnętrzne narzędzia zawsze pomagają modelom językowym, okazuje się fałszywe. Nowe badanie pokazuje, że narzędzia mogą odwracać poprawne odpowiedzi, jeśli model już wcześniej dobrze sobie radził bez nich.

3 min czytania
Orange document icon with horizontal lines on a dark blue background.

👁 114 przeczytań

Przyjęło się sądzić, że wyposażenie modelu językowego w zewnętrzne narzędzia - wyszukiwarkę, interpreter kodu - zawsze podnosi jakość odpowiedzi. Jeśli narzędzie dostarcza trafnych informacji, powinno pomóc; jeśli dostarcza nieistotnych, model powinien je zignorować. Autorzy pracy „When Tools Hurt LLM Reasoning: State-Dependent Belief Revision under External Evidence” pokazują, że to założenie jest błędne - i to w sposób, który zależy od stanu wewnętrznej pewności modelu.

Na czym polega problem

Badacze przeprowadzili eksperymenty na benchmarkach z użyciem dwóch rodzajów narzędzi: Pythona i Wikipedii. Wyniki są jednoznaczne - zewnętrzne dowody pomagają wtedy, gdy wyjściowe przekonania modelu są słabe, czyli gdy model sam nie wie dobrze, jak odpowiedzieć. Natomiast gdy model już ma silne wewnętrzne wsparcie dla poprawnej odpowiedzi, sięgnięcie po narzędzie może tę poprawną odpowiedź odwrócić na błędną.

Autorzy opisują to jako „błędną alokację władzy rewizji” (misallocation of revision authority). Ich argument brzmi tak: zdawanie się na zewnętrzne narzędzie jest nieoptymalną strategią w sytuacji, gdy wewnętrzne wsparcie modelu dla poprawnej odpowiedzi przewyższa spodziewaną jakość wyników narzędzia. Innymi słowy - jeśli model wie lepiej, nie powinien ustępować zewnętrznemu źródłu tylko dlatego, że ono coś podaje.

Jak to zbadano

Z tej teorii wynika konkretna przepowiednia: szkody spowodowane przez narzędzia powinny koncentrować się właśnie na przypadkach, gdzie model bez narzędzia odpowiadał poprawnie z wysoką pewnością. Autorzy weryfikują tę przepowiednię trzema metodami: lokalizacją progów pewności (threshold localization), audytem błędnych ścieżek wnioskowania (wrong-trace audits) oraz interwencją o nazwie „same-clue” - ta ostatnia pokazuje, że sama zmiana sposobu przedstawienia dowodu (revision framing) zmienia skalę szkód wyrządzanych przez mylące informacje zewnętrzne.

Proponowane rozwiązanie - CASE

Jako minimalne rozwiązanie problemu autorzy wprowadzają system o nazwie CASE (od „label-free controller”). Jest to kontroler niewymagający etykietowania danych, który wybiera między ścieżką bez narzędzia a ścieżką wspomaganą narzędziem - i robi to na podstawie pewności co do stanu odpowiedzi (answer-state certainty). Według autorów CASE osiąga lepsze wyniki niż istniejące metody arbitrażu oparte na pewności modelu. Szczegółów dotyczących konkretnych liczb i benchmarków w samym abstrakcie nie podano - dokument dostępny jest w pełnej wersji PDF.

Główny wniosek jest sformułowany jasno: systemy łączące tryb bez narzędzia z trybem wspomaganym narzędziem powinny arbitrować, komu przyznać władzę decyzji, zamiast domyślnie uprzywilejowywać dowody z narzędzia. Praca została przyjęta na konferencję EMNLP 2026. Kod eksperymentów jest dostępny publicznie pod adresem wskazanym w dokumencie.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

To badanie uderza w jeden z bardziej bezkrytycznie przyjętych dogmatów w budowie systemów agentowych - że narzędzia są zawsze bezpiecznym dodatkiem. Jeśli wyniki potwierdzą się na szerszą skalę, oznacza to, że każdy system RAG czy agent korzystający z wyszukiwarki powinien mieć wbudowany mechanizm oceny, czy model w ogóle powinien sięgać po zewnętrzne źródło w danym momencie. Obecna praktyka domyślnego ufania narzędziom może być nie tylko nieefektywna, ale aktywnie szkodliwa dla jakości odpowiedzi. Obserwuję ten kierunek badań z zainteresowaniem, bo to jeden z pierwszych przypadków, gdy problem opisany intuicyjnie przez praktyków dostaje solidne formalne ujęcie.

Źródło: arXiv cs.AI: When Tools Hurt LLM Reasoning: State-Dependent Belief Revision under External Evidence (dokument z 2026-09-09). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro 440 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie