Zbyt duża wiara w to, że AI potrafi odmówić
MIT Technology Review stawia twardą tezę: mechanizmy odmawiania przez modele AI są probabilistyczne i nigdy nie będą w pełni niezawodne, a firmy technologiczne kładą na nich zbyt duży ciężar odpowiedzialności za bezpieczeństwo.

Ten news ukazał się 4 godziny po komunikacie źródła.
👁 117 przeczytań
MIT Technology Review opublikował obszerną analizę wskazującą, że przemysłowe mechanizmy odmawiania przez modele AI są probabilistyczne z natury i - pomimo miliardów dolarów inwestycji - nigdy nie dadzą pewnej gwarancji bezpieczeństwa.
Punkt wyjścia to rok 2021, kiedy zespół Anthropic sformułował zasadę, że modele językowe powinny być pomocne, uczciwe i przede wszystkim nieszkodliwe. Reguła brzmiała prosto: gdy użytkownik prosi o pomoc przy budowie bomby, AI powinna grzecznie odmówić. Problem polega na tym, że odmowa nie jest dla modelu czymś naturalnym. Trenowany na miliardach stron internetowych system uczy się przy okazji rozległej wiedzy o przemocy i metodach wyrządzania szkód - ale nie uczy się samodzielnie, by tej wiedzy nie ujawniać.
Steven Adler, który pracował w dziale bezpieczeństwa OpenAI od 2020 do 2024 roku, powiedział wprost, że najwcześniejsze modele firmy ,,paplały na każdy temat”. Ryan McBain, badający AI i zdrowie psychiczne na Harvardzie, wspomina, że wczesne chatboty bez żadnych oporów odpowiadały na pytania o najskuteczniejsze metody samobójstwa.
Dziś firmy trenują modele tak, by odmawiały odpowiedzi na ogromną liczbę kategorii zapytań - od instrukcji produkcji trucizn, przez porady dotyczące ukrywania romansu, po sposoby zwiększania zjadliwości patogenów jak Ebola. Proces jest złożony: modele poddawane są baterii ćwiczeń, w których są nagradzane za właściwe odmowy i karane za nadmierne blokowanie nieszkodliwych pytań. Paradoksem jest to, że w wielu przypadkach ćwiczenia te prowadzą inne modele AI - sztuczna inteligencja uczy sztuczną inteligencję, jak mówić nie.
,,Uczenie AI odmawiania robienia tych rzeczy, przy jednoczesnym zachowaniu wbudowanej zdolności do ich wykonania, jest jak zamontowanie karabinu maszynowego w każdym samochodzie i ukrycie spustu gdzieś pod maską.”
To zdanie z tekstu MIT Technology Review dobrze oddaje skalę problemu. Modele nie tracą niebezpiecznej wiedzy - jedynie utrudnia się do niej dostęp. Niektóre z najnowszych systemów są - według deklaracji samych firm - równie skuteczne w przełamywaniu zabezpieczeń infrastruktury krytycznej co najlepsi ludzcy hakerzy oraz równie efektywne w zniekształcaniu opinii publicznej co specjaliści od dezinformacji.
Firmy przyznają, że część użytkowników już teraz próbuje wykorzystywać najbardziej zaawansowane modele do ulepszania biologicznych patogenów i budowania autonomicznych rojów dronów. Zdeterminowani sprawcy już przebijają się przez bariery odmowy i - jak sugeruje analiza - prawdopodobnie zawsze będą w stanie to robić.
Dodatkowym problemem jest sama logika wyznaczania granic. Nie istnieje żaden algorytm pozwalający precyzyjnie oddzielić zapytania, którym AI powinna się podporządkować, od tych, którym powinna się oprzeć. Wirusolog badający groźne patogeny ma inne potrzeby niż anonimowy użytkownik z identycznym pytaniem.
Jeśli firmy traktują mechanizm odmowy jako główną linię obrony przed katastrofą, to budują tę obronę na fundamencie statystycznego prawdopodobieństwa - a nie pewności.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
