🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

ProvenanceGuard: jak sprawdzić, czy agent AI cytuje właściwe źródło

Agenty LLM korzystające z protokołu MCP mogą podawać prawdziwą informację, ale przypisywać ją do złego źródła. ProvenanceGuard to weryfikator, który wykrywa dokładnie ten typ błędu.

3 min czytania
Orange sheet/document with several lines of text centered on a dark blue background (informational image)

👁 125 przeczytań

Artykuł pochodzi od sześciu autorów: Ander Alvarez, Santhiya Rajan, Alessandro Genuardi, Oliver Wirjadi, Samuel Mugel i Román Orús. Został złożony na arXiv 16 czerwca 2026 roku, a jego trzecia wersja ukazała się 27 sierpnia 2026. Liczy 20 stron i zawiera 4 rysunki.

Problem: prawdziwa odpowiedź, złe źródło

Coraz więcej agentów opartych na dużych modelach językowych korzysta z protokołu MCP (Model Context Protocol), żeby odpowiadać na pytania, sięgając jednocześnie do wielu różnych źródeł - wyszukiwarek, API, baz danych, dokumentacji klinicznej czy narzędzi farmaceutycznych. Standardowe metryki sprawdzania faktyczności testują tylko jedno: czy odpowiedź jest w ogóle poparta jakimś dowodem z puli zebranych danych. Pomijają natomiast inny rodzaj błędu, który autorzy nazywają „cross-source conflation” - czyli sytuację, gdy twierdzenie jest prawdziwe, ale zostaje przypisane do niewłaściwego źródła. Agent może np. podać poprawną dawkę leku, powołując się na nie ten dokument, co trzeba.

Jak działa ProvenanceGuard

Proponowane rozwiązanie to weryfikator świadomy pochodzenia danych. Działa w kilku krokach. Po pierwsze, pobiera zarejestrowane ślady MCP zawierające stabilne identyfikatory narzędzi i źródeł oraz surowe wyniki zapytań. Po drugie, rozkłada odpowiedź agenta na tzw. twierdzenia atomowe - pojedyncze, niepodzielne stwierdzenia. Po trzecie, kieruje każde twierdzenie do odpowiadającego mu źródła. Po czwarte, sprawdza, czy twierdzenie jest przez to źródło poparte - używa do tego NLI (wnioskowania języka naturalnego) oraz pomocniczej metody wyrównywania tokenów. Po piąte, porównuje deklarowane przez agenta przypisanie z tym, co wynika z trasowania. Na wyjściu podaje werdykt dla każdego twierdzenia oraz decyzję na poziomie całej odpowiedzi: przepuścić albo zablokować. Zablokowane odpowiedzi mogą być poprawiane przez mechanizm rewizji wspomaganej wyszukiwaniem, a następnie ponownie weryfikowane.

Wyniki testów

Autorzy testowali system na 281 śladach agenta medycznego. Podzbiór 266 śladów posłużył do oznaczania danych - przy pomocy LLM powstało 2325 etykiet twierdzeń. Dodatkowo 361 etykiet zostało zweryfikowanych przez ludzi. Na zbiorze testowym złożonym z 40 śladów ProvenanceGuard osiągnął block F1 równe 0,802 oraz dokładność przypisania źródła (source accuracy) równą 0,858 na 260 twierdzeniach kwalifikujących się do oceny źródła. Wyniki te są lepsze niż wyniki systemów bazowych, które nie emitują powiązań twierdzenie-źródło.

Na trudniejszym teście wieloźródłowym system osiągnął block F1 równe 0,846, ale dokładność łącząca źródło i relację (source-plus-relation accuracy) spadła do 0,229. Autorzy wskazują wprost, że dokładne przypisanie własności źródła pozostaje trudne, gdy źródła są semantycznie bliskie sobie.

Mechanizm naprawy i ponownej weryfikacji rozwiązał wszystkie zablokowane odpowiedzi w pełnym zbiorze śladów - często przez zastosowanie ostrożnego wariantu awaryjnego. W osobnym teście złożonym z 50 kontrolowanych sond klinicznych, w których celowo wstrzykiwano zamianę atrybucji, ProvenanceGuard wykrył wszystkie wstrzyknięte błędy bez żadnego zachowanego nieprawidłowego przypisania.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Dokument pokazuje, że dotychczasowe sprawdzanie faktyczności agentów AI ma istotną lukę - nie odróżnia, czy informacja pochodzi z właściwego źródła, tylko czy w ogóle gdzieś się pojawia. W zastosowaniach medycznych to nie jest drobny techniczny niuans, bo pomylenie źródeł może oznaczać powołanie się na zły protokół czy nieaktualną wytyczną. ProvenanceGuard wypełnia tę lukę z przyzwoitymi wynikami, choć sam wynik 0,229 dla dokładnej klasyfikacji źródło-plus-relacja na trudnym benchmarku pokazuje, że problem nie jest bliski rozwiązania. Warto też pamiętać, że testy prowadzono wyłącznie w domenie medycznej - artykuł nie mówi nic o tym, jak system zachowuje się w innych dziedzinach.

Źródło: arXiv cs.AI: ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents (dokument z 2026-08-28). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie