🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 7 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Nauka

Gdy pytasz po chińsku, AI odpowiada inaczej. Nowe badanie ujawnia mechanizm propagandy w modelach językowych

Nowe badanie opublikowane w Nature ujawnia, że duże modele językowe wykazują pronacjonalną tendencyjność w językach krajów o niskiej wolności mediów. Gdy pytasz po chińsku, odpowiedzi są bardziej przychylne wobec władz w Pekinie niż te same pytania po angielsku.
pl.

3 min czytania
Ostatnia aktualizacja:
Glowing white orb on a pedestal in a dim, foggy library with dark shelves and leafless vines reaching along the shelves.

👁 121 przeczytań

// w skrócie
  • Modele AI odpowiadają inaczej na pytania po chińsku niż po angielsku, generując odpowiedzi bardziej przychylne wobec władz Pekinu, co ujawniło badanie opublikowane w Nature.
  • Problem występuje w wielu krajach - modele odzwierciedlają dominującą narrację państwową w języku lokalnym, co oznacza że użytkownicy mogą otrzymywać odpowiedzi zabarwione propagandą nawet z neutralnych narzędzi.

Kiedy zadajesz pytanie po angielsku, model językowy odpowiada neutralnie. Gdy przełączasz się na chiński, odpowiedzi stają się wyraźnie bardziej przychylne wobec władz w Pekinie. To nie przypadek, lecz efekt uboczny sposobu, w jaki powstają dane treningowe najpopularniejszych systemów AI. Nowe badanie opublikowane w Nature ujawnia mechanizm, który może wpływać na to, co miliardy ludzi na świecie uznają za prawdę.

Media pod kontrolą państwa kształtują odpowiedzi AI

Międzynarodowy zespół badaczy przeprowadził sześć powiązanych ze sobą eksperymentów, które dowodzą, że stopień kontroli państwa nad mediami w danym kraju bezpośrednio przekłada się na treści generowane przez duże modele językowe. W krajach o niskiej wolności prasy modele wykazują silniejszą pronacjonalną tendencyjność w języku urzędowym niż w tych samych pytaniach zadawanych po angielsku.

Naukowcy skupili się na Chinach jako studium przypadku. Odkryli, że materiały redagowane i koordynowane przez państwowe media chińskie regularnie pojawiają się w zestawach treningowych komercyjnych modeli językowych. Aby sprawdzić, czy ta obecność ma realny wpływ, przeprowadzili eksperyment z modelem o otwartej wadze. Dodatkowe douczenie na chińskich mediach państwowych sprawiło, że model generował wyraźnie bardziej pozytywne odpowiedzi na pytania dotyczące chińskich instytucji politycznych i przywódców.

Język jako kanał wpływu

Najbardziej wymowny okazał się test na komercyjnych modelach. Gdy użytkownicy zadawali pytania po chińsku, odpowiedzi były systematycznie bardziej przychylne wobec Chin niż te same zapytania sformułowane po angielsku. Różnica językowa działa jak filtr, który aktywuje ukrytą tendencyjność modelu.

„Połączenie wpływu i potencjału perswazyjnego w różnych językach sugeruje niepokojący wniosek: państwa i potężne instytucje mają zwiększone strategiczne bodźce, by wykorzystywać kontrolę nad mediami w nadziei na kształtowanie wyników działania LLM-ów” - piszą autorzy w artykule opublikowanym w Nature.

Skala zjawiska i jego konsekwencje

Badanie nie dotyczy wyłącznie Chin. Analiza objęła wiele krajów o różnym poziomie wolności mediów. W każdym przypadku modele językowe odzwierciedlały dominującą narrację państwową w języku lokalnym. Oznacza to, że miliardy ludzi korzystających z AI w swoich ojczystych językach mogą otrzymywać odpowiedzi zabarwione propagandą, nawet jeśli model został zaprojektowany jako neutralne narzędzie.

Problem jest tym poważniejszy, że modele językowe są coraz częściej wykorzystywane jako źródło informacji - od wyszukiwarek po asystentów głosowych. Jeśli ich odpowiedzi są systematycznie przekrzywione w zależności od języka, użytkownicy w różnych częściach świata mogą żyć w równoległych rzeczywistościach informacyjnych, nawet korzystając z tego samego narzędzia.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co można z tym zrobić?

Autorzy badania nie proponują prostych rozwiązań, ale wskazują na konieczność większej transparentności w procesie tworzenia danych treningowych. Obecnie firmy takie jak OpenAI, Google czy Meta nie ujawniają pełnej zawartości swoich zbiorów danych. Bez tego audyt tendencyjności pozostaje zadaniem badaczy zewnętrznych, którzy muszą polegać na pośrednich metodach.

Jednym z postulowanych rozwiązań jest wprowadzenie obowiązkowych testów wielojęzycznych przed wypuszczeniem modelu na rynek. Sprawdzanie, czy odpowiedzi różnią się w zależności od języka, mogłoby stać się standardem podobnym do testów bezpieczeństwa w innych branżach. Innym pomysłem jest tworzenie zestawów danych treningowych, które celowo równoważą narracje z różnych źródeł, aby zminimalizować wpływ pojedynczej propagandy.

Niezależnie od wybranej ścieżki, jedno jest pewne: modele językowe nie są neutralnymi odbiciami rzeczywistości. Są produktami danych, które je zasilają, a te dane - jak pokazuje to badanie - są głęboko polityczne.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Dlaczego AI odpowiada inaczej na pytania po chińsku?

Ponieważ zestawy treningowe zawierają więcej materiałów z państwowych mediów chińskich niż materiałów angielskojęzycznych z takim samym nastawieniem. Język działa jak filtr, który aktywuje ukrytą tendencyjność modelu wbudowaną poprzez dane treningowe.

Jak naukowcy przeprowadzili badanie nad tendencyjnością AI?

Przeprowadzili sześć powiązanych ze sobą eksperymentów oraz test na modelu o otwartej wadze, któremu udzielili dodatkowego douczenia na materiałach chińskich mediów państwowych. Następnie porównali odpowiedzi na te same pytania zadane po chińsku i angielsku w modelach komercyjnych.

Czy problem dotyczy tylko Chin?

Nie, badanie objęło wiele krajów o różnym poziomie wolności mediów i w każdym przypadku modele odzwierciedlały dominującą narrację państwową w języku lokalnym. Oznacza to, że zjawisko dotyczy użytkowników AI na całym świecie.

Jakie rozwiązania proponują autorzy badania?

Postulują większą transparentność w procesie tworzenia danych treningowych, obowiązkowe testy wielojęzyczne przed wypuszczeniem modelu na rynek oraz tworzenie zestawów danych, które celowo równoważą narracje z różnych źródeł, aby zminimalizować wpływ pojedynczej propagandy.

$ źródłoCzytaj oryginał na noktus.pl
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie