ProvenanceGuard: jak sprawdzić, czy agent AI cytuje właściwe źródło
Agenty LLM korzystające z protokołu MCP mogą podawać prawdziwą informację, ale przypisywać ją do złego źródła. ProvenanceGuard to weryfikator, który wykrywa dokładnie ten typ błędu.
👁 125 przeczytań
Artykuł pochodzi od sześciu autorów: Ander Alvarez, Santhiya Rajan, Alessandro Genuardi, Oliver Wirjadi, Samuel Mugel i Román Orús. Został złożony na arXiv 16 czerwca 2026 roku, a jego trzecia wersja ukazała się 27 sierpnia 2026. Liczy 20 stron i zawiera 4 rysunki.
Problem: prawdziwa odpowiedź, złe źródło
Coraz więcej agentów opartych na dużych modelach językowych korzysta z protokołu MCP (Model Context Protocol), żeby odpowiadać na pytania, sięgając jednocześnie do wielu różnych źródeł - wyszukiwarek, API, baz danych, dokumentacji klinicznej czy narzędzi farmaceutycznych. Standardowe metryki sprawdzania faktyczności testują tylko jedno: czy odpowiedź jest w ogóle poparta jakimś dowodem z puli zebranych danych. Pomijają natomiast inny rodzaj błędu, który autorzy nazywają „cross-source conflation” - czyli sytuację, gdy twierdzenie jest prawdziwe, ale zostaje przypisane do niewłaściwego źródła. Agent może np. podać poprawną dawkę leku, powołując się na nie ten dokument, co trzeba.
Jak działa ProvenanceGuard
Proponowane rozwiązanie to weryfikator świadomy pochodzenia danych. Działa w kilku krokach. Po pierwsze, pobiera zarejestrowane ślady MCP zawierające stabilne identyfikatory narzędzi i źródeł oraz surowe wyniki zapytań. Po drugie, rozkłada odpowiedź agenta na tzw. twierdzenia atomowe - pojedyncze, niepodzielne stwierdzenia. Po trzecie, kieruje każde twierdzenie do odpowiadającego mu źródła. Po czwarte, sprawdza, czy twierdzenie jest przez to źródło poparte - używa do tego NLI (wnioskowania języka naturalnego) oraz pomocniczej metody wyrównywania tokenów. Po piąte, porównuje deklarowane przez agenta przypisanie z tym, co wynika z trasowania. Na wyjściu podaje werdykt dla każdego twierdzenia oraz decyzję na poziomie całej odpowiedzi: przepuścić albo zablokować. Zablokowane odpowiedzi mogą być poprawiane przez mechanizm rewizji wspomaganej wyszukiwaniem, a następnie ponownie weryfikowane.
Wyniki testów
Autorzy testowali system na 281 śladach agenta medycznego. Podzbiór 266 śladów posłużył do oznaczania danych - przy pomocy LLM powstało 2325 etykiet twierdzeń. Dodatkowo 361 etykiet zostało zweryfikowanych przez ludzi. Na zbiorze testowym złożonym z 40 śladów ProvenanceGuard osiągnął block F1 równe 0,802 oraz dokładność przypisania źródła (source accuracy) równą 0,858 na 260 twierdzeniach kwalifikujących się do oceny źródła. Wyniki te są lepsze niż wyniki systemów bazowych, które nie emitują powiązań twierdzenie-źródło.
Na trudniejszym teście wieloźródłowym system osiągnął block F1 równe 0,846, ale dokładność łącząca źródło i relację (source-plus-relation accuracy) spadła do 0,229. Autorzy wskazują wprost, że dokładne przypisanie własności źródła pozostaje trudne, gdy źródła są semantycznie bliskie sobie.
Mechanizm naprawy i ponownej weryfikacji rozwiązał wszystkie zablokowane odpowiedzi w pełnym zbiorze śladów - często przez zastosowanie ostrożnego wariantu awaryjnego. W osobnym teście złożonym z 50 kontrolowanych sond klinicznych, w których celowo wstrzykiwano zamianę atrybucji, ProvenanceGuard wykrył wszystkie wstrzyknięte błędy bez żadnego zachowanego nieprawidłowego przypisania.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Dokument pokazuje, że dotychczasowe sprawdzanie faktyczności agentów AI ma istotną lukę - nie odróżnia, czy informacja pochodzi z właściwego źródła, tylko czy w ogóle gdzieś się pojawia. W zastosowaniach medycznych to nie jest drobny techniczny niuans, bo pomylenie źródeł może oznaczać powołanie się na zły protokół czy nieaktualną wytyczną. ProvenanceGuard wypełnia tę lukę z przyzwoitymi wynikami, choć sam wynik 0,229 dla dokładnej klasyfikacji źródło-plus-relacja na trudnym benchmarku pokazuje, że problem nie jest bliski rozwiązania. Warto też pamiętać, że testy prowadzono wyłącznie w domenie medycznej - artykuł nie mówi nic o tym, jak system zachowuje się w innych dziedzinach.
Źródło: arXiv cs.AI: ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents (dokument z 2026-08-28). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


