🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 7 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Nauka

Zaraza modeli. Czy jedna ludzka informacja może uratować AI przed samozagładą?

Modele językowe wkrótce wyczerpią zasoby ludzkich danych. Nowe badanie wskazuje, że wystarczy jeden prawdziwy punkt odniesienia, by uchronić je przed katastrofalnym „załamaniem modelu”. Czy to ratunek dla sztucznej inteligencji?
pl.

3 min czytania
Ostatnia aktualizacja:
Long hallway lined with identical framed portraits on both walls and floor, with a yellow brush stroke highlighting a central portrait at the end.

👁 124 przeczytań

// w skrócie
  • Jedna ludzka informacja dodana do puli danych syntetycznych wystarczy, by model językowy uniknął zjawiska zwanego 'model collapse'.
  • Badanie opublikowane 14 maja w Physical Review Letters przeprowadzili naukowcy z KCL, Norweskiego Uniwersytetu Nauki i Technologii oraz Centrum Fizyki Teoretycznej im. Abdusa Salama we Włoszech.
  • Część ekspertów szacuje, że zasób wysokiej jakości danych tworzonych przez człowieka wyczerpie się jeszcze w 2025 roku, co zmusi twórców AI do korzystania z danych syntetycznych.

Wyobraź sobie, że uczysz się wyłącznie od kogoś, kto sam nie wie, o czym mówi. Z pokolenia na pokolenie błąd narasta, aż w końcu zaczynasz bełkotać. Dokładnie to grozi dzisiejszym modelom językowym. Gdy skończą się ludzkie dane, AI będą zmuszone uczyć się od siebie nawzajem - a to prosta droga do zjawiska nazywanego „model collapse”. Najnowsze badania sugerują jednak zaskakująco prosty sposób, by tego uniknąć.

Cyfrowy kanibalizm

Wielkie modele językowe (LLM) pożerają ogromne ilości tekstu, by nauczyć się składać zdania. Problem w tym, że zasób wysokiej jakości danych stworzonych przez człowieka szybko się kurczy. Jak donosi Live Science, część ekspertów szacuje, że wyczerpiemy go jeszcze w tym roku. Gdy to nastąpi, twórcy AI sięgną po dane generowane przez same maszyny. To jak karmienie zwierzęcia jego własnym mięsem - z każdą iteracją jakość informacji spada, aż w końcu model zaczyna produkować kompletny bełkot.

„To szczególnie niepokojące, biorąc pod uwagę, że niektórzy eksperci uważają, że do końca roku zabraknie wysokiej jakości danych generowanych przez człowieka” - mówi Yasser Roudi, profesor systemów nieuporządkowanych na Wydziale Matematyki King’s College London (KCL). Skutki mogą być dramatyczne. „Gdybyśmy mieli LLM używane w szpitalach do analizy skanów mózgu i wykrywania nowotworów, a podczas trenowania kolejnego modelu doszłoby do załamania, te maszyny mogłyby błędnie diagnozować pacjentów” - dodaje Roudi.

Jak wygląda agonista modelu?

Załamanie modelu nie pojawia się z dnia na dzień. Roudi i jego zespół wyróżniają dwa etapy tego procesu. W fazie wczesnej AI traci zdolność do obsługi rzadkich, niszowych informacji - odpowiedzi stają się płaskie, syntetyczne, pozbawione niuansów. To ten moment, gdy chatbot zaczyna udzielać banalnych, ogólnikowych rad. W fazie późnej model produkuje już czysty bełkot, którego nie da się wykorzystać w żadnym praktycznym zastosowaniu.

Badacze z KCL, Norweskiego Uniwersytetu Nauki i Technologii oraz Międzynarodowego Centrum Fizyki Teoretycznej im. Abdusa Salama we Włoszech postanowili zbadać ten mechanizm od podstaw. Opublikowane 14 maja w czasopiśmie Physical Review Letters badanie wykorzystało mniejsze modele, które łatwiej analizować. Pozwoliło to odpowiedzieć na pytania „jak” i „dlaczego” dochodzi do załamania - a także znaleźć sposób, by mu zapobiec.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Jedna kropla w morzu danych

Odkrycie naukowców jest zaskakująco proste. Wystarczy dodać jeden ludzki punkt danych do puli danych syntetycznych, by model uniknął załamania. Nawet jeśli pozostałe miliony wpisów pochodzą z poprzednich generacji AI, ta pojedyncza, potwierdzona przez człowieka informacja działa jak kotwica. Roudi tłumaczy: „Ten punkt danych byłby powiązany z 'prawdziwą rzeczywistością’ - czymś, co wiemy, że jest niepodważalnie prawdziwe i niezależnie weryfikowalne”.

Przykład? Wyobraź sobie klasyfikator obrazów trenowany na milionie zdjęć. Wśród nich może być jedno prawdziwe zdjęcie, poprawnie opisane przez człowieka. To wystarczy, by cały system nie zboczył z kursu. To tak, jakby w morzu kopii wrzucić jedną oryginalną monetę - i nagle wszystkie kopie zaczynają do niej pasować.

Naukowcy podkreślają, że to dopiero pierwszy krok. Kolejnym etapem będzie sprawdzenie, czy ta zasada działa w przypadku ogromnych, komercyjnych modeli. Jeśli tak, inżynierowie pracujący nad kolejnymi wersjami ChatGPT mogą wykorzystać tę wiedzę, by budować systemy odporne na samozagładę. „To badanie jest pierwszym krokiem w ustalaniu podstawowych zasad zapobiegania temu zjawisku w przyszłości” - podsumowuje Roudi.

Stawka jest ogromna. Nie chodzi tylko o to, by chatboty nie pisały bzdur. Chodzi o systemy medyczne, autonomiczne pojazdy, analizy finansowe - wszędzie tam, gdzie błąd AI może kosztować ludzkie zdrowie, a nawet życie. Jedna prawdziwa informacja może być cienką nicią, która utrzymuje przy zdrowych zmysłach cały gmach sztucznej inteligencji.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Co to jest model collapse i dlaczego jest groźny dla AI?

Model collapse to zjawisko stopniowego degradowania jakości modeli językowych trenowanych na danych generowanych przez inne AI zamiast przez ludzi. Roudi z KCL ostrzega, że w fazie końcowej model produkuje czysty bełkot, a w zastosowaniach medycznych - np. przy wykrywaniu nowotworów - mógłby błędnie diagnozować pacjentów.

Jak zapobiec załamaniu modeli językowych?

Wystarczy dodać jeden ludzki punkt danych do puli danych syntetycznych, by model nie uległ załamaniu. Taki punkt powiązany jest z weryfikowalną rzeczywistością i działa jak kotwica dla całego systemu, nawet gdy pozostałe miliony wpisów pochodzą z poprzednich generacji AI.

Kiedy może zabraknąć ludzkich danych do trenowania modeli AI?

Część ekspertów szacuje, że wysokiej jakości dane generowane przez człowieka wyczerpią się jeszcze w 2025 roku. Podaje to Yasser Roudi, profesor systemów nieuporządkowanych na Wydziale Matematyki King's College London.

Jakie są etapy załamania modelu językowego?

Roudi i jego zespół wyróżniają dwa etapy: wczesny, w którym AI traci zdolność obsługi rzadkich informacji i zaczyna udzielać ogólnikowych, banalnych odpowiedzi, oraz późny, gdy model produkuje całkowity bełkot nienadający się do żadnego praktycznego zastosowania.

$ źródłoCzytaj oryginał na noktus.pl
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie