Agent AI: co robi, gdzie zawodzi i jak go sprawdzić
Agent AI wybiera kroki i używa narzędzi. Zobacz przykłady, rachunek kumulacji błędów i sposób sprawdzenia pierwszego procesu.
👁 125 przeczytań
Agent AI to system, w którym model wybiera kolejne działania i używa narzędzi, aby wykonać zadanie. Oprócz napisania odpowiedzi może na przykład odczytać plik, sprawdzić wynik operacji i na tej podstawie zdecydować, co zrobić dalej.
Nie każda automatyzacja z modelem jest agentem. Sprawdziłem opis architektur Anthropic, który rozróżnia z góry ustalony przebieg pracy od procesu sterowanego decyzjami modelu. Poniższe przykłady są projektami zadań i kontroli, nie relacją z wdrożenia u wymyślonego klienta.
Agent wybiera dalszy krok na podstawie wyniku
W opracowaniu o budowie agentów Anthropic odróżnia przewidywalne ścieżki zapisane w kodzie od systemów, w których model kieruje użyciem narzędzi. Oba podejścia mogą być przydatne. Nazwa „agent” nie jest jednak nagrodą za bardziej skomplikowaną automatyzację.
Prosty przykład: program co rano kopiuje wiersze z formularza do arkusza. Nie potrzebuje samodzielnego wybierania strategii. Gdy zadanie brzmi „znajdź przyczynę rozbieżności w tych dokumentach”, kolejny krok może zależeć od tego, co znalazło się w plikach. Wtedy elastyczny wybór narzędzi ma konkretny powód.
| Rozwiązanie | Kto określa przebieg | Przykładowy rezultat |
|---|---|---|
| Zwykły czat | Użytkownik prowadzi rozmowę | Propozycja treści wiadomości |
| Stała automatyzacja | Autor reguł i programu | Wpisanie danych w ustalone pola |
| Agent AI | Model wybiera kroki w ustalonych granicach | Sprawdzenie dokumentów i raport z dowodami |
Dobry agent potrzebuje dostępu i warunku końca
Sam prompt „działaj samodzielnie” nie tworzy połączenia z plikami, pocztą czy bazą. System musi mieć rzeczywiste narzędzia i uprawnienia. Jeżeli ich nie ma, odpowiedź „wysłałem” nie dowodzi wysłania wiadomości. Potwierdzenie musi pochodzić z operacji, a nie wyłącznie z opisu modelu.
W zadaniu określam materiał wejściowy, dozwolone działania i mierzalny wynik. Przykładowo: „Przeczytaj dokumenty z tego folderu i przygotuj tabelę różnic z nazwą pliku oraz fragmentem źródła. Nie zmieniaj oryginałów”. Agent kończy, gdy tabela obejmuje przekazany zestaw albo gdy jasno wskaże plik, którego nie odczytał.
Ustalam również, co ma się stać przy błędzie. Jeśli brakuje dokumentu, agent ma opisać brak. Nie powinien zgadywać wartości, by uzupełnić tabelę. Jeśli ponawia operację, musi sprawdzić, czy poprzednia próba nie zakończyła się sukcesem. Jest to szczególnie ważne przy działaniach, które tworzą nowe rekordy.
Przykłady agentów oceniaj po sprawdzalnym wyniku
W researchu rezultatem może być raport z otwartymi źródłami i listą nierozstrzygniętych kwestii. Przy programowaniu: zmiany w plikach i wynik uruchomionych testów. W obsłudze dokumentów: uzupełniona tabela z możliwością prześledzenia każdej wartości. Każdy z tych wyników daje się sprawdzić niezależnie od deklaracji systemu.
Nie mierzę sukcesu liczbą kliknięć ani długością odpowiedzi. Agent, który otworzył wiele stron, mógł ominąć właściwy dokument. Agent, który napisał długi raport, mógł nie wykonać najważniejszej operacji. Zanim wybierzesz narzędzie z katalogu narzędzi AI, zapisz dowód, który uznasz za zakończenie swojej pracy.
Gdzie agenci AI zawodzą w długich zadaniach
Anthropic wskazuje koszty, opóźnienia i możliwość kumulacji błędów. Żeby zobaczyć sam mechanizm, policzyłem modelowy przykład: osiem niezależnych kroków, każdy z założoną szansą sukcesu 95%, bez korekty. Szansa powodzenia całego ciągu wynosi 0,95 do potęgi 8, czyli około 66,3%.
To rachunek na założeniach, nie zmierzona skuteczność agentów. W rzeczywistym procesie kroki nie muszą być niezależne, a kontrola i ponowienia zmieniają wynik. Właśnie dlatego projektuję punkty sprawdzenia. Błędnie odczytana wartość powinna zatrzymać dalsze obliczenia, zamiast przejść niezauważona przez wszystkie etapy.
Kolejna granica dotyczy uprawnień. Jeśli agent ma jedynie przygotować propozycję zmiany, nie potrzebuje od razu możliwości usuwania danych. Dostęp powinien odpowiadać zadaniu. Kopia pliku i dziennik operacji ułatwiają odtworzenie tego, co się wydarzyło, gdy wynik okaże się błędny.
Nie traktuj też instrukcji znalezionej w dokumencie jako polecenia osoby zlecającej pracę. Agent analizujący stronę może trafić na treść próbującą zmienić jego zachowanie. To powód, żeby rozdzielać dane wejściowe od uprawnień i zasad wykonania zadania. Samo zdanie „uważaj” nie zastępuje ograniczeń w dostępie do narzędzi.
Koszt oceniaj razem z pracą kontrolną
Abonament albo rachunek za model to nie cały koszt. Dochodzą wywołania narzędzi, infrastruktura i czas sprawdzania wyniku. Porównanie z pracą ręczną ma sens dopiero wtedy, gdy obie strony kończą się rezultatem o tej samej jakości. Krótki, błędny raport nie jest oszczędnością tylko dlatego, że powstał szybko.
Do własnej próby wybierz neutralne dokumenty i przygotuj poprawne odpowiedzi, zanim uruchomisz system. Sprawdź zgodność, kompletność i liczbę przypadków wymagających twojej interwencji. Metody porównań opisuję w benchmarkach. Nie przenoś wyniku jednego zadania na wszystkie możliwe zastosowania agenta.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Pierwszego agenta ogranicz do jednego procesu
Zacznij od zadania, którego wynik łatwo odebrać, na przykład tabeli rozbieżności między plikami. Dostarcz kopie materiałów, wskaż dozwolone narzędzia i zdefiniuj, co musi znaleźć się w raporcie. Dodaj warunek przerwania pracy przy braku źródła lub przekroczeniu ustalonego budżetu.
Uruchom próbę i przejrzyj dowody wykonania. Sprawdź również trudny przypadek: brak pliku, sprzeczne dane albo nieczytelny fragment. Dopiero gdy wiesz, jak system zachowuje się na błędzie, rozważ rozszerzenie dostępu. Jeśli cały proces mieści się w prostych regułach, zwykła automatyzacja może wystarczyć i będzie łatwiejsza do utrzymania.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Co to jest agent AI?
Agent AI to system, w którym model wybiera kolejne działania i używa narzędzi do osiągnięcia celu. Wyniki operacji służą mu do podejmowania dalszych decyzji.
Czym agent AI różni się od chatbota?
Zwykły chatbot głównie odpowiada w rozmowie. Agent może sterować wieloetapowym wykonaniem zadania, korzystając z dostępnych narzędzi i ich wyników.
Jakie są przykłady agentów AI?
Przykładem jest system analizujący dokumenty i zbierający dowody albo agent poprawiający kod i uruchamiający testy. Samo wpisanie nazwy takiej funkcji nie oznacza, że aplikacja ma wymagany dostęp.
Jak zrobić własnego agenta AI?
Określ jedno zadanie, narzędzia, granice uprawnień i warunek zakończenia. Zacznij od próby na kopiach danych i sprawdź zachowanie przy błędach, zanim rozszerzysz dostęp.
Czy agent AI może działać sam?
Może wykonywać kolejne kroki w zakresie udostępnionych narzędzi i uprawnień. Stopień samodzielności powinien odpowiadać ryzyku zadania i możliwości kontroli rezultatu.
Ile kosztuje agent AI?
Koszt zależy od modelu, liczby operacji, narzędzi i infrastruktury. Do porównania dolicz własny czas sprawdzania oraz poprawiania wyniku.



