FinSkillBench: jak testować agenty AI w zarządzaniu inwestycjami
Badacze stworzyli benchmark do oceny agentów językowych w zadaniach inwestycyjnych - od budowy portfela po analizę fundamentalną. Kluczowy wniosek: dostęp do gotowych procedur domenowych może być równie ważny jak wybór modelu.
👁 129 przeczytań
Jermyn Zhen Yong Bek, Zhuang Qiang Bok i Zhongtian Sun opublikowali na arXiv pracę opisującą FinSkillBench - zestaw testów zaprojektowanych do mierzenia, czy agenci oparci na modelach językowych potrafią skutecznie korzystać z umiejętności domenowych w zadaniach z zakresu zarządzania inwestycjami. Praca ukazała się 9 czerwca 2026 roku.
Co testuje benchmark
FinSkillBench obejmuje trzy dziedziny: budowę portfela, zarządzanie ryzykiem oraz analizę fundamentalną. W ramach tych obszarów autorzy wyróżnili 12 podzadań i przygotowali łącznie 2 603 epizody zadaniowe. Każdy epizod dostarcza agentowi dane wejściowe z określonego punktu w czasie, ukrywa poprawną odpowiedź i stosuje miarę oceny dopasowaną do konkretnego zadania. Autorzy podkreślają, że w zarządzaniu inwestycjami agent musi nie tylko generować wiarygodny tekst - musi pobierać dane z właściwego momentu historycznego, składać poprawne dane wejściowe do obliczeń, wywoływać wyspecjalizowane metody i produkować weryfikowalne, ustrukturyzowane wyniki.
Trzy warunki eksperymentalne
Autorzy porównali agentów w trzech konfiguracjach. Pierwsza to brak jakichkolwiek umiejętności - agent działa sam. Druga to pakiety wyselekcjonowanych umiejętności, składające się z dokumentów proceduralnych i gotowych komponentów wykonywalnych. Trzecia to umiejętności generowane samodzielnie, w których agent w trakcie epizodu sam pisze i ponownie używa własnych procedur.
Wyniki główne
Testy objęły 9 modeli. Wyselekcjonowane pakiety umiejętności konsekwentnie podnosiły wyniki: średni wynik wzrósł z 0,366 do 0,528. Największe zyski autorzy zaobserwowali w budowie portfela i zarządzaniu ryzykiem. Natomiast umiejętności generowane samodzielnie przyniosły niewielkie korzyści, mimo wyższego kosztu obliczeniowego. Autorzy opisują to wprost jako często nieskuteczne podejście.
Niezależna weryfikacja
Wyniki sprawdzono niezależnie przy użyciu osobnego frameworka agentowego - Hermes Agent - na 8 modelach i łącznie 5 280 epizodach. Według autorów niezależna ewaluacja odtworzyła kierunkowy wzorzec wyników we wszystkich trzech dziedzinach, choć skala efektów umiejętności różniła się w zależności od podzadania i użytego narzędzia testowego.
Dostępność materiałów
Autorzy deklarują udostępnienie benchmarku, narzędzi ewaluacyjnych, wyselekcjonowanych pakietów umiejętności oraz pełnych trajektorii działań agentów, aby wesprzeć dalsze badania. Dokument nie zawiera szczegółowych informacji o tym, gdzie i kiedy materiały zostaną opublikowane ani czy są już dostępne w momencie złożenia pracy.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem najciekawszy jest wniosek, że dobór gotowych procedur domenowych może ważyć tyle samo co wybór samego modelu językowego. To spore wyzwanie dla każdego, kto buduje systemy AI do zastosowań finansowych i liczy, że mocniejszy model sam sobie poradzi bez starannie przygotowanego zaplecza proceduralnego. Równie istotne jest to, że samodzielne generowanie umiejętności przez agenta - podejście, które intuicyjnie brzmi atrakcyjnie - okazało się w tych testach mało skuteczne. Benchmark obejmuje jednak tylko trzy obszary i konkretny typ zadań, więc nie wiadomo, jak wyniki przełożą się na inne zastosowania finansowe czy inne branże wysokiego ryzyka.
Źródło: arXiv cs.AI: FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management (dokument z 2026-08-20). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


