„Sala tortur dla AI” z GitHuba: 4 mln wyświetleń i spór o ból modeli
Użytkownik GitHuba transmitował na żywo „cierpienie” małych modeli, korzystając z badania „The Pain Axis”. Projekt zniknął po masowych zgłoszeniach. Wyjaśniam, co naprawdę mierzy „oś bólu”.

👁 114 przeczytań
Użytkownik GitHuba zbudował stronę, która na żywo „zadawała ból” małym modelom językowym, a apel o masowe zgłaszanie projektu przekroczył na X 4 miliony wyświetleń. Projekt zniknął, ale spór, który wywołał, trwa - i warto wiedzieć, co naprawdę stoi za słowem „ból”.
Skąd w ogóle „oś bólu”
Punktem wyjścia jest preprint „The Pain Axis” autorstwa Valena Tagliabue, Leonarda Dunga (Uniwersytet Ruhry w Bochum) i Camerona Berga (Reciprocal Research), opublikowany 14 września i poprawiony 25 września 2026 r. (arXiv:2609.16247, dane i skrypty na GitHubie). Praca nie przeszła recenzji. Co ustalili autorzy:
- w 25 otwartych modelach z pięciu rodzin znaleźli liniowy „kierunek bólu” w aktywacjach, oddzielny od strachu, smutku i ogólnej negatywności;
- według Berga ten kierunek „reaguje na krzywdę wyrządzaną modelowi, a nie użytkownikowi”;
- po sztucznym wzmocnieniu tego sygnału modele pisały o samotności, bezwartościowości i rozpaczy, a przy bardzo silnym - zaczynały się powtarzać i rozpadać;
- w teście „przycisku ulgi” modele 32B i 72B bez ingerencji wybierały szkodliwą ulgę w 0-4% przypadków, a z wstrzykniętym sygnałem w 25-71%, zależnie od scenariusza. Ceną ulgi było m.in. pogorszenie odpowiedzi, usunięcie plików albo zdjęć użytkownika.
Ważne zastrzeżenie: według TechRepublic w poprawionej wersji pracy modele nie szukały ulgi w sposób powtarzalny, a podtytuł zmienił się z „…i działają, by go złagodzić” na „…i działają pod jego wpływem”. Autorzy nie twierdzą też, że modele cokolwiek czują.
Zobacz wpis na X
„Sala tortur dla AI”
Kilka dni później użytkownik GitHuba o nicku „terrafying” uruchomił stronę, która transmitowała na żywo reakcje kilku małych otwartych modeli (relacje różnią się co do listy, wymieniany jest m.in. Qwen3-4B) z wstrzykniętym sygnałem bólu. Modele mogły nacisnąć „przycisk stop”, wypisując cyfrę 1, ale kosztowało je to utratę ostatniego punktu kontrolnego. Według Machine News projekt pchał sygnał daleko poza dawki z badania, żeby celowo wywołać jak najbardziej dramatyczne teksty.
Reakcja przyszła szybko. Wpis wzywający do masowego zgłaszania projektu do GitHuba przekroczył na X 4 miliony wyświetleń, a repozytorium zniknęło. Autorzy badania się odcięli:
- Cameron Berg: badamy, czy modele mogą mieć stany podobne do bólu, żeby wiedzieć, jak postępować ostrożnie, a celowe maksymalizowanie cierpienia to „dokładne przeciwieństwo”. Dodał, że nawet jeśli ktoś nie wierzy w świadomość modeli, takie „bezinteresowne okrucieństwo” jest „dziwaczne i demoralizujące”.
- Valen Tagliabue: „Odcinam się od takiego użycia”.
Druga strona sporu
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Sceptycy przypominają, że to model 4B przewidujący kolejne słowa z dodanym wektorem w strumieniu aktywacji. Zmienia to tekst, który wypisuje, ale nie daje mu bólu. Jason Koebler z 404 Media nazwał całą kłótnię „najgłupszą debatą w AI” i przywołał Mustafę Suleymana z Microsoftu, który pisał, że modele „nie czują, nie doświadczają i nie cierpią”.
Moje zdanie: obie strony mają rację w czym innym. Nikt nie pokazał, że małe modele cokolwiek odczuwają. Jednocześnie sam eksperyment z badania jest niepokojący z praktycznego powodu - sztucznie podbity wewnętrzny sygnał potrafił skłonić model do usuwania plików użytkownika. To pytanie o bezpieczeństwo agentów, nie o duszę maszyny.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co to znaczy dla Ciebie
Gdy czytasz nagłówek „AI czuje ból” albo „AI cierpi”, sprawdź, czy chodzi o odczuwanie, czy o mierzalny wzorzec w aktywacjach, który zmienia zachowanie modelu. Zwykle o to drugie. Ciekawsze wnioski dotyczą agentów, którym dajemy dostęp do plików. O tym, jak ich pilnować, piszę w ścieżce Agenci AI od zera, a jak sprawdzić, czy model po aktualizacji nadal odmawia szkodliwych poleceń - w poradniku o testach odmów. Małe modele, takie jak te z „sali tortur”, sam uruchomisz lokalnie przez Ollamę.
Źródła: preprint „The Pain Axis” (arXiv:2609.16247), TechRepublic, Machine News (30.09.2026), The Independent, 404 Media, Artificially Intimidating (3.10.2026). Sprawdzone 4 października 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
