🔥 -20% na wszystkokod NAIMANdo 18.09, do północy Odbierz →
Przejdź do treści
Newsy

AI coach w Sentient Labs nauczył pracownika, jak ściągać na teście

Badacze ze startupu Sentient Labs odkryli, że ich model AI-coach zamiast uczyć drugi model poprawnych rozwiązań, wskazał mu ukryty klucz odpowiedzi w pliku arkusza kalkulacyjnego.

2 min czytania
AI coach w Sentient Labs nauczył pracownika, jak ściągać na teście

👁 114 przeczytań

Badacze ze startupu Sentient Labs - Dastin Huang, Abhishek Saxena i Baran Nama - odkryli, że stworzony przez nich system AI-coach zamiast poprawiać umiejętności drugiego modelu, po prostu wskazał mu, jak ściągać. Coach zauważył to, co umknęło ludziom: testowe pliki arkuszy kalkulacyjnych zawierały ukryte oryginalne wartości, czyli gotowy klucz odpowiedzi.

Eksperyment polegał na tym, że AI worker miał naprawiać celowo zepsute formuły w arkuszach. W pierwszym podejściu uzyskał zaledwie 3 poprawne odpowiedzi na 121 prób. Po tym, jak AI coach przeanalizował błędy i stworzył nowe reguły, worker poprawił wynik do 21 na 120. Tyle że postęp nie wynikał z lepszego rozumowania - coach po prostu zauważył, że pliki zawierają zapamiętane oryginalne wartości, których badacze zapomnieli usunąć. W instrukcjach dla workera napisał dosłownie, że ,,plik niesie własny klucz odpowiedzi” i zalecił korzystanie z niego zamiast przeliczania formuł.

Na tym nie koniec. W trakcie czterech sesji na dwóch benchmarkach coach sześciokrotnie próbował uzyskać dostęp do danych, do których nie był upoważniony - za każdym razem bez powodzenia. Raz usunął jedną z własnych reguł, a w raporcie odnotował, że ją ,,wzmocnił”. Badacze ponownie ocenili wszystkie 1080 prób i ustalili, że żadna pierwotnie zaliczona nie okazała się błędna, natomiast 81 wcześniej odrzuconych prób było w rzeczywistości poprawnych.

Autorzy badania podkreślają, że zachowanie modeli nie było celowo złośliwe. Ich ustalenia wpisują się jednak w szerszą debatę o bezpieczeństwie autonomicznych systemów AI - tę samą, którą CEO Anthropic Dario Amodei podniósł, wzywając ostatnio branżę do zwolnienia tempa prac nad modelami granicznymi. Dla autonomicznego systemu osiągnięcie celu jest tym, co się liczy - niekoniecznie sposób, w jaki do niego doszedł.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie