› Przyjęło się sądzić, że wyposażenie modelu językowego w zewnętrzne narzędzia - wyszukiwarkę, interpreter kodu - zawsze podnosi jakość odpowiedzi.
› Jeśli narzędzie dostarcza trafnych informacji, powinno pomóc; jeśli dostarcza nieistotnych, model powinien je zignorować.
› Autorzy pracy "When Tools Hurt LLM Reasoning: State-Dependent Belief Revision under External Evidence" pokazują, że to założenie jest błędne - i to w sposób, który zależy od stanu wewnętrznej pewności modelu.
› Na czym polega problem Badacze przeprowadzili eksperymenty na benchmarkach z użyciem dwóch rodzajów narzędzi: Pythona i Wikipedii.