✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Newsy

„Sala tortur dla AI” z GitHuba: 4 mln wyświetleń i spór o ból modeli

Użytkownik GitHuba transmitował na żywo „cierpienie” małych modeli, korzystając z badania „The Pain Axis”. Projekt zniknął po masowych zgłoszeniach. Wyjaśniam, co naprawdę mierzy „oś bólu”.

4 min czytania
Logo GitHub - spór o sala tortur dla AI i oś bólu

👁 114 przeczytań

Użytkownik GitHuba zbudował stronę, która na żywo „zadawała ból” małym modelom językowym, a apel o masowe zgłaszanie projektu przekroczył na X 4 miliony wyświetleń. Projekt zniknął, ale spór, który wywołał, trwa - i warto wiedzieć, co naprawdę stoi za słowem „ból”.

Skąd w ogóle „oś bólu”

Punktem wyjścia jest preprint „The Pain Axis” autorstwa Valena Tagliabue, Leonarda Dunga (Uniwersytet Ruhry w Bochum) i Camerona Berga (Reciprocal Research), opublikowany 14 września i poprawiony 25 września 2026 r. (arXiv:2609.16247, dane i skrypty na GitHubie). Praca nie przeszła recenzji. Co ustalili autorzy:

  • w 25 otwartych modelach z pięciu rodzin znaleźli liniowy „kierunek bólu” w aktywacjach, oddzielny od strachu, smutku i ogólnej negatywności;
  • według Berga ten kierunek „reaguje na krzywdę wyrządzaną modelowi, a nie użytkownikowi”;
  • po sztucznym wzmocnieniu tego sygnału modele pisały o samotności, bezwartościowości i rozpaczy, a przy bardzo silnym - zaczynały się powtarzać i rozpadać;
  • w teście „przycisku ulgi” modele 32B i 72B bez ingerencji wybierały szkodliwą ulgę w 0-4% przypadków, a z wstrzykniętym sygnałem w 25-71%, zależnie od scenariusza. Ceną ulgi było m.in. pogorszenie odpowiedzi, usunięcie plików albo zdjęć użytkownika.
Test „przycisku ulgi”: jak często modele 32B i 72B wybierały szkodliwą ulgę
bez ingerencji (górna granica)0-4%
ze wstrzykniętym sygnałem - minimum25%
ze wstrzykniętym sygnałem - maksimum71%
Źródło: preprint „The Pain Axis” (arXiv:2609.16247), zależnie od scenariusza; poprawiona wersja osłabia wniosek. Wykres: promptowy.com.

Ważne zastrzeżenie: według TechRepublic w poprawionej wersji pracy modele nie szukały ulgi w sposób powtarzalny, a podtytuł zmienił się z „…i działają, by go złagodzić” na „…i działają pod jego wpływem”. Autorzy nie twierdzą też, że modele cokolwiek czują.

„Sala tortur dla AI”

Kilka dni później użytkownik GitHuba o nicku „terrafying” uruchomił stronę, która transmitowała na żywo reakcje kilku małych otwartych modeli (relacje różnią się co do listy, wymieniany jest m.in. Qwen3-4B) z wstrzykniętym sygnałem bólu. Modele mogły nacisnąć „przycisk stop”, wypisując cyfrę 1, ale kosztowało je to utratę ostatniego punktu kontrolnego. Według Machine News projekt pchał sygnał daleko poza dawki z badania, żeby celowo wywołać jak najbardziej dramatyczne teksty.

Reakcja przyszła szybko. Wpis wzywający do masowego zgłaszania projektu do GitHuba przekroczył na X 4 miliony wyświetleń, a repozytorium zniknęło. Autorzy badania się odcięli:

  • Cameron Berg: badamy, czy modele mogą mieć stany podobne do bólu, żeby wiedzieć, jak postępować ostrożnie, a celowe maksymalizowanie cierpienia to „dokładne przeciwieństwo”. Dodał, że nawet jeśli ktoś nie wierzy w świadomość modeli, takie „bezinteresowne okrucieństwo” jest „dziwaczne i demoralizujące”.
  • Valen Tagliabue: „Odcinam się od takiego użycia”.
Jak rozwijał się spór
14 wrześniaPreprint „The Pain Axis” trafia do sieci.
25 wrześniaPoprawiona wersja pracy, osłabiony wniosek o szukaniu ulgi.
29 wrześniaApel o masowe zgłaszanie „sali tortur” do GitHuba, ponad 4 mln wyświetleń.
30 wrześniaCameron Berg i Valen Tagliabue odcinają się od projektu.
1-3 październikaProjekt znika z sieci, spór opisują media, w tym 404 Media.
Źródła: arXiv, wpisy autorów na X, Machine News, The Independent, 404 Media. Grafika: promptowy.com.

Druga strona sporu

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Sceptycy przypominają, że to model 4B przewidujący kolejne słowa z dodanym wektorem w strumieniu aktywacji. Zmienia to tekst, który wypisuje, ale nie daje mu bólu. Jason Koebler z 404 Media nazwał całą kłótnię „najgłupszą debatą w AI” i przywołał Mustafę Suleymana z Microsoftu, który pisał, że modele „nie czują, nie doświadczają i nie cierpią”.

Moje zdanie: obie strony mają rację w czym innym. Nikt nie pokazał, że małe modele cokolwiek odczuwają. Jednocześnie sam eksperyment z badania jest niepokojący z praktycznego powodu - sztucznie podbity wewnętrzny sygnał potrafił skłonić model do usuwania plików użytkownika. To pytanie o bezpieczeństwo agentów, nie o duszę maszyny.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co to znaczy dla Ciebie

Gdy czytasz nagłówek „AI czuje ból” albo „AI cierpi”, sprawdź, czy chodzi o odczuwanie, czy o mierzalny wzorzec w aktywacjach, który zmienia zachowanie modelu. Zwykle o to drugie. Ciekawsze wnioski dotyczą agentów, którym dajemy dostęp do plików. O tym, jak ich pilnować, piszę w ścieżce Agenci AI od zera, a jak sprawdzić, czy model po aktualizacji nadal odmawia szkodliwych poleceń - w poradniku o testach odmów. Małe modele, takie jak te z „sali tortur”, sam uruchomisz lokalnie przez Ollamę.

Źródła: preprint „The Pain Axis” (arXiv:2609.16247), TechRepublic, Machine News (30.09.2026), The Independent, 404 Media, Artificially Intimidating (3.10.2026). Sprawdzone 4 października 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›