🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

FinSkillBench: jak testować agenty AI w zarządzaniu inwestycjami

Badacze stworzyli benchmark do oceny agentów językowych w zadaniach inwestycyjnych - od budowy portfela po analizę fundamentalną. Kluczowy wniosek: dostęp do gotowych procedur domenowych może być równie ważny jak wybór modelu.

3 min czytania
Orange document icon with horizontal lines representing text on a dark blue background (centered)

👁 129 przeczytań

Jermyn Zhen Yong Bek, Zhuang Qiang Bok i Zhongtian Sun opublikowali na arXiv pracę opisującą FinSkillBench - zestaw testów zaprojektowanych do mierzenia, czy agenci oparci na modelach językowych potrafią skutecznie korzystać z umiejętności domenowych w zadaniach z zakresu zarządzania inwestycjami. Praca ukazała się 9 czerwca 2026 roku.

Co testuje benchmark

FinSkillBench obejmuje trzy dziedziny: budowę portfela, zarządzanie ryzykiem oraz analizę fundamentalną. W ramach tych obszarów autorzy wyróżnili 12 podzadań i przygotowali łącznie 2 603 epizody zadaniowe. Każdy epizod dostarcza agentowi dane wejściowe z określonego punktu w czasie, ukrywa poprawną odpowiedź i stosuje miarę oceny dopasowaną do konkretnego zadania. Autorzy podkreślają, że w zarządzaniu inwestycjami agent musi nie tylko generować wiarygodny tekst - musi pobierać dane z właściwego momentu historycznego, składać poprawne dane wejściowe do obliczeń, wywoływać wyspecjalizowane metody i produkować weryfikowalne, ustrukturyzowane wyniki.

Trzy warunki eksperymentalne

Autorzy porównali agentów w trzech konfiguracjach. Pierwsza to brak jakichkolwiek umiejętności - agent działa sam. Druga to pakiety wyselekcjonowanych umiejętności, składające się z dokumentów proceduralnych i gotowych komponentów wykonywalnych. Trzecia to umiejętności generowane samodzielnie, w których agent w trakcie epizodu sam pisze i ponownie używa własnych procedur.

Wyniki główne

Testy objęły 9 modeli. Wyselekcjonowane pakiety umiejętności konsekwentnie podnosiły wyniki: średni wynik wzrósł z 0,366 do 0,528. Największe zyski autorzy zaobserwowali w budowie portfela i zarządzaniu ryzykiem. Natomiast umiejętności generowane samodzielnie przyniosły niewielkie korzyści, mimo wyższego kosztu obliczeniowego. Autorzy opisują to wprost jako często nieskuteczne podejście.

Niezależna weryfikacja

Wyniki sprawdzono niezależnie przy użyciu osobnego frameworka agentowego - Hermes Agent - na 8 modelach i łącznie 5 280 epizodach. Według autorów niezależna ewaluacja odtworzyła kierunkowy wzorzec wyników we wszystkich trzech dziedzinach, choć skala efektów umiejętności różniła się w zależności od podzadania i użytego narzędzia testowego.

Dostępność materiałów

Autorzy deklarują udostępnienie benchmarku, narzędzi ewaluacyjnych, wyselekcjonowanych pakietów umiejętności oraz pełnych trajektorii działań agentów, aby wesprzeć dalsze badania. Dokument nie zawiera szczegółowych informacji o tym, gdzie i kiedy materiały zostaną opublikowane ani czy są już dostępne w momencie złożenia pracy.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem najciekawszy jest wniosek, że dobór gotowych procedur domenowych może ważyć tyle samo co wybór samego modelu językowego. To spore wyzwanie dla każdego, kto buduje systemy AI do zastosowań finansowych i liczy, że mocniejszy model sam sobie poradzi bez starannie przygotowanego zaplecza proceduralnego. Równie istotne jest to, że samodzielne generowanie umiejętności przez agenta - podejście, które intuicyjnie brzmi atrakcyjnie - okazało się w tych testach mało skuteczne. Benchmark obejmuje jednak tylko trzy obszary i konkretny typ zadań, więc nie wiadomo, jak wyniki przełożą się na inne zastosowania finansowe czy inne branże wysokiego ryzyka.

Źródło: arXiv cs.AI: FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management (dokument z 2026-08-20). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie