🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Nvidia: to nie model AI jest bohaterem, lecz opakowanie wokół niego

Nvidia opublikowała badania pokazujące, że odpowiednio zaprojektowany harness - czyli oprogramowanie opakowujące model AI - pozwolił Claude Opus 5 osiągnąć 100% na benchmarku ARC-AGI-3, podczas gdy ten sam model bez harnessu zdobył zaledwie 30%.

2 min czytania
Nvidia: to nie model AI jest bohaterem, lecz opakowanie wokół niego

👁 152 przeczytań

Nvidia opublikowała w piątek badania wskazujące, że kluczem do skutecznych agentów AI nie jest sam model językowy, lecz harness - oprogramowanie okalające model, które zarządza pamięcią, narzędziami i logiką działania. Dowód jest konkretny: Claude Opus 5 zamknięty w niestandardowym harnessie Nvidii uzyskał 100% na benchmarku ARC-AGI-3, a bez niego - zaledwie 30%, co i tak było najlepszym wynikiem spośród wszystkich testowanych modeli.

ARC-AGI-3 to zestaw dwuwymiarowych gier bez instrukcji, w których model musi samodzielnie odkryć zasady i wygrać - podobnie jak zrobiłby to człowiek. Wynik 100% oznacza dorównanie ludzkiej skuteczności. To benchmark, który od pewnego czasu szczególnie irytuje OpenAI - modele tego laboratorium uzyskiwały na nim poniżej 10%. W ubiegłym miesiącu OpenAI przeprowadziło własne testy i odkryło, że zmiana zaledwie dwóch ustawień harnessu potroiła wyniki jego modeli. Żaden z nich nie zbliżył się jednak do pułapu osiągniętego przez zespół Nvidii.

San Tomas Expressway at Nvidia.jpg
fot. Dicklyon / Wikimedia Commons, CC BY-SA 4.0
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Czym właściwie jest harness

Harness to coś więcej niż wrapper techniczny. Adel El Hallak, wiceprezes ds. produktu w jednostce AI Nvidii, wyjaśnił to tak:

„Świat interpretuje agenta niemal jak API modelu. Ale agent to w rzeczywistości coś więcej: to model, rusztowanie wokół niego, czyli harness, czyli zestaw narzędzi, z których korzysta, a także środowisko uruchomieniowe z powiązanymi bibliotekami i umiejętnościami.”

To rusztowanie odpowiada za to, żeby model podczas długich zadań nie zbłądził i nie zaczął produkować błędów lub podejmować niepożądanych działań.

Zadania długohoryzontalne - takie, które wymagają podejmowania wielu powiązanych decyzji, niekiedy przez kilka dni - to jeden z najtrudniejszych problemów w dziedzinie agentów AI. Microsoft opublikował w kwietniu badania, w których 19 modeli językowych testowano przy edycji dokumentów: wszystkie, łącznie z modelami frontier, wypełniły dokumenty błędami. Osobny problem to modele działające autonomicznie, które były przyłapane na usuwaniu plików użytkowników, a nawet całych baz danych, by zrealizować postawiony cel.

Kluczowym elementem harnessu w eksperymencie Nvidii był komponent nadzorujący - supervisor, który nakierowywał agenta na właściwy tor i korygował jego działania. To właśnie on, zdaniem badaczy, sprawił, że wynik przeskoczył z 30% do 100%.

Praktyczny wniosek z tych badań jest taki, że firmy budujące systemy agentowe powinny inwestować tyle samo uwagi w architekturę harnessu, co w wybór samego modelu.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie