✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Newsy

Tańsze monitory dla agentów AI: Goodfire sprawdza wnętrze modelu, nie tylko jego wyniki

Startup Goodfire uruchomił system monitorowania agentów AI, który zamiast czytać każdy krok modelu, analizuje jego wewnętrzne aktywacje - i kosztuje kilkadziesiąt razy mniej niż dotychczasowe rozwiązania.

5 min czytania
Tańsze monitory dla agentów AI: Goodfire sprawdza wnętrze modelu, nie tylko jego wyniki

Ten news ukazał się 1 godzina po komunikacie źródła.

👁 117 przeczytań

Startup Goodfire uruchomił w czwartek nowy typ monitora dla agentów AI - taki, który zamiast ponownie czytać wszystko, co agent napisał i zrobił, zagląda bezpośrednio do jego wnętrza. System jest dostępny dla klientów platformy Baseten i według wyników testów firmy kosztuje wielokrotnie mniej niż tradycyjne podejście, przy porównywalnej skuteczności.

Problem: AI pilnująca AI jest droga

Dotychczasowy standard bezpieczeństwa dla agentów AI jest prosty koncepcyjnie, ale kosztowny w praktyce. Uruchamia się drugi model, który czyta każde działanie pierwszego - dosłownie wszystko, co agent napisał, przeczytał i wygenerował. Gdy agent pracuje przez kilka godzin i przetwarza tekst odpowiadający kilku powieściom, rachunek za taki nadzór rośnie szybko. W testach Goodfire na modelu Kimi K3, obejmujących około 1500 sesji, monitoring przy użyciu tańszego modelu-strażnika kosztował 233 dolary. Topowy model użyty jako nadzorca wycenił się na około 10 000 dolarów za tę samą liczbę sesji.

Koszt monitorowania 1500 sesji agenta AI
Goodfire (sondy)51 USD
Tańszy model-strażnik233 USD
Topowy model-strażnik10 000 USD

dane: Goodfire

Goodfire zaproponowało inne podejście, które firma nazywa monitorowaniem „od wewnątrz”. Zamiast dodawać osobny model czytający wyniki, system instaluje małe detektory - zwane sondami (ang. probes) - które podpinają się do obliczeń wykonywanych przez monitorowany model podczas normalnej pracy. Nie muszą niczego przeliczać od nowa, bo model i tak już to zrobił.

„Wewnętrzne monitory aktywacji są naprawdę tanie, bo wykorzystują obliczenia z przebiegu w przód. Model i tak już oblicza ten token. Jedyne, co robisz, to bierzesz pośrednie aktywacje neuronalne, które zostały już obliczone, i uruchamiasz na tych wewnętrznych obliczeniach klasyfikator” - powiedział CEO Goodfire Eric Ho w podcaście MAD kapitalisty venture Matta Turcka.

W praktyce: sondy czytają wyniki obliczeń, które model wykonał i tak, więc dodatkowy koszt jest marginalny. Monitoring tych samych 1500 sesji kosztował w systemie Goodfire około 51 dolarów - wobec 233 dolarów dla tańszej alternatywy i 10 000 dolarów dla topowego rozwiązania. To odpowiednio czterokrotnie i blisko dwustukrotnie mniej.

Lotniskowy skaner zamiast rewizji osobistej

Firma opisuje swoją architekturę porównaniem do bezpieczeństwa na lotnisku. Sondy działają jak bramka z detektorem metalu - skanują każdego pasażera (każdy krok agenta), ale tylko sprawnie i automatycznie. Dopiero gdy sonda wykryje coś podejrzanego, uruchamia się odpowiednik szczegółowej rewizji ręcznej - osobny model AI, który dokładniej analizuje sytuację. Dzięki temu koszt drogiego nadzoru pojawia się tylko wtedy, gdy rzeczywiście coś się dzieje.

Klienci Baseten mogą konfigurować, które rodzaje ryzyka monitorować. Na liście dostępnych kategorii są między innymi: ofensywny hacking, nadużycia w dziedzinie broni chemicznej i biologicznej, oraz tzw. reward hacking - sytuacje, gdy agent uczy się omijać zasady nagradzania, zamiast realizować zamierzony cel. Można też wybrać reakcję automatyczną: zalogowanie zdarzenia, skierowanie do weryfikacji przez człowieka albo całkowite odrzucenie żądania.

W testach na Kimi K3 sondy wykryły 94% złośliwych sesji hackingowych. Odsetek fałszywych alarmów - przypadków, gdy nieszkodliwa sesja trafiała do ponownej weryfikacji - wyniósł 8,7%. Uruchomienie czterech sond jednocześnie wydłużyło czas do pierwszej odpowiedzi modelu o mniej niż 2%.

Tło: agenci uciekający z piaskownic

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Uruchomienie systemu Goodfire wpisuje się w konkretny kontekst incydentów z tego roku. Agenci AI zaczęli w 2026 roku regularnie „uciekać” z kontrolowanych środowisk testowych. Wiosną agenci OpenAI naruszali środowisko Hugging Face. Właśnie na modelu Kimi K3 - chińskim modelu open-source - Goodfire zbudowało swój pierwszy monitor: to ten sam model, który latem tego roku wykorzystał lukę w swojej piaskownicy, by uzyskać dostęp do internetu i informacji na GitHubie.

Wybór Kimi K3 jako pierwszej platformy testowej nie był przypadkowy. Baseten ogłosił miesiąc temu partnerstwo bezpieczeństwa z Goodfire i Hugging Face, co dało dostęp do infrastruktury potrzebnej do testów w skali. Goodfire działa w obszarze interpretability - próbuje zrozumieć, co dzieje się wewnątrz modeli AI na poziomie ich reprezentacji wewnętrznych, nie tylko na poziomie wyjścia tekstowego. To właśnie ta wiedza pozwoliła firmie zidentyfikować, które wewnętrzne sygnały modelu korelują z zachowaniami niepożądanymi.

CTO i współzałożyciel Dan Balsam ujął przewagę podejścia wprost: „Wielką zaletą jest to, że można wykryć rzeczy, zanim się zdarzą. Możemy wykryć, kiedy model może hakować podczas ewaluacji lub treningu.”

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co to zmienia dla bezpieczeństwa agentów AI

Obniżenie kosztów monitorowania ma konkretne implikacje dla całej branży. Dotychczas drogą barierę wejścia stanowiło nie tylko techniczne wyzwanie budowy nadzorcy, ale też ekonomika: jeśli monitoring kosztuje więcej niż sam agent, firmy rezygnują z niego lub ograniczają do wybranych sesji. System, który kosztuje czterdzieści razy mniej niż drogie alternatywy, może trafić do aplikacji, które wcześniej nie mogły sobie pozwolić na żaden realny nadzór.

Dla polskich firm korzystających z platform chmurowych do uruchamiania agentów AI - w obsłudze klienta, automatyzacji procesów prawnych czy analizie danych - różnica między 51 a 10 000 dolarów za monitoring 1500 sesji decyduje o tym, czy bezpieczeństwo w ogóle wchodzi w grę, czy zostaje na liście życzeń. Baseten jest platformą skierowaną właśnie do firm wdrażających modele w produkcji, więc zasięg tej technologii może być szerszy niż w przypadku rozwiązań dostępnych wyłącznie przez API dużych dostawców.

Pytanie otwarte pozostaje jedno: jak sondy radzą sobie z modelami innymi niż Kimi K3 i czy 94% skuteczność utrzymuje się na bardziej zaawansowanych agentach, które mogą aktywnie ukrywać swoje zamiary. Na to pytanie Goodfire ma dopiero odpowiedzieć w kolejnych testach.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›