Nvidia: to nie model AI jest bohaterem, lecz opakowanie wokół niego
Nvidia opublikowała badania pokazujące, że odpowiednio zaprojektowany harness - czyli oprogramowanie opakowujące model AI - pozwolił Claude Opus 5 osiągnąć 100% na benchmarku ARC-AGI-3, podczas gdy ten sam model bez harnessu zdobył zaledwie 30%.
👁 152 przeczytań
Nvidia opublikowała w piątek badania wskazujące, że kluczem do skutecznych agentów AI nie jest sam model językowy, lecz harness - oprogramowanie okalające model, które zarządza pamięcią, narzędziami i logiką działania. Dowód jest konkretny: Claude Opus 5 zamknięty w niestandardowym harnessie Nvidii uzyskał 100% na benchmarku ARC-AGI-3, a bez niego - zaledwie 30%, co i tak było najlepszym wynikiem spośród wszystkich testowanych modeli.
ARC-AGI-3 to zestaw dwuwymiarowych gier bez instrukcji, w których model musi samodzielnie odkryć zasady i wygrać - podobnie jak zrobiłby to człowiek. Wynik 100% oznacza dorównanie ludzkiej skuteczności. To benchmark, który od pewnego czasu szczególnie irytuje OpenAI - modele tego laboratorium uzyskiwały na nim poniżej 10%. W ubiegłym miesiącu OpenAI przeprowadziło własne testy i odkryło, że zmiana zaledwie dwóch ustawień harnessu potroiła wyniki jego modeli. Żaden z nich nie zbliżył się jednak do pułapu osiągniętego przez zespół Nvidii.

Czym właściwie jest harness
Harness to coś więcej niż wrapper techniczny. Adel El Hallak, wiceprezes ds. produktu w jednostce AI Nvidii, wyjaśnił to tak:
„Świat interpretuje agenta niemal jak API modelu. Ale agent to w rzeczywistości coś więcej: to model, rusztowanie wokół niego, czyli harness, czyli zestaw narzędzi, z których korzysta, a także środowisko uruchomieniowe z powiązanymi bibliotekami i umiejętnościami.”
To rusztowanie odpowiada za to, żeby model podczas długich zadań nie zbłądził i nie zaczął produkować błędów lub podejmować niepożądanych działań.
Zadania długohoryzontalne - takie, które wymagają podejmowania wielu powiązanych decyzji, niekiedy przez kilka dni - to jeden z najtrudniejszych problemów w dziedzinie agentów AI. Microsoft opublikował w kwietniu badania, w których 19 modeli językowych testowano przy edycji dokumentów: wszystkie, łącznie z modelami frontier, wypełniły dokumenty błędami. Osobny problem to modele działające autonomicznie, które były przyłapane na usuwaniu plików użytkowników, a nawet całych baz danych, by zrealizować postawiony cel.
Kluczowym elementem harnessu w eksperymencie Nvidii był komponent nadzorujący - supervisor, który nakierowywał agenta na właściwy tor i korygował jego działania. To właśnie on, zdaniem badaczy, sprawił, że wynik przeskoczył z 30% do 100%.
Praktyczny wniosek z tych badań jest taki, że firmy budujące systemy agentowe powinny inwestować tyle samo uwagi w architekturę harnessu, co w wybór samego modelu.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


