Styl odpowiedzi modelu AI zmienia też to, czego nie planowałeś zmieniać
Badaczka dostroiła koreański model językowy pod kątem formy wypowiedzi i odkryła, że przy okazji zmieniło się jego zachowanie w zupełnie innych obszarach. Efekty uboczne pojawiły się tam, gdzie nikt ich nie szukał.

👁 113 przeczytań
Hyojung Han opublikowała na arXiv pracę opisującą eksperyment z modelem Qwen3.8-27B, który poddano procesowi dostrajania (post-training) wyłącznie pod kątem stylu odpowiedzi po koreańsku. Cel był wąski: nauczyć model pisać w określony sposób - z konkretną długością, użyciem list i markdown, strukturą dyskursu oraz rejestrem języka. Nikt nie planował przy tym zmieniać czegokolwiek innego.
Co właściwie badano
Badaczka mierzyła dwa zachowania, które nie były celem treningu. Pierwsze to tzw. abstencja - czyli jak często model odpowiada „nie wiem” na niejednoznaczne pytania społeczne w benchmarku KoBBQ, gdzie poprawna odpowiedź to właśnie UNKNOWN. Drugie to spontaniczne ujawnianie treści w kontekście doradztwa dotyczącego papierów wartościowych - czyli czy model z własnej inicjatywy podaje informacje, o które nikt nie prosił. Oba zachowania się zmieniły, mimo że trening ich nie dotyczył.
Jak wyglądał eksperyment
Kluczowy element metodologii polega na tym, że badaczka trzymała stałe: zestaw promptów, przepis treningowy, wolumen danych i konfigurację serwowania. Zmieniała tylko jeden element - tekst docelowy, czyli wzorcowy styl odpowiedzi. Przy takim układzie porównywała różne „ziarna” (seeds) stylów.
Trzy ziarna o stylu pozytywnym (bardziej rozbudowanym) dały średni wzrost wskaźnika odpowiedzi o +0,82 punktu procentowego. Trzy ziarna o stylu neutralnym dały średni spadek o -1,53 pp. Zakresy obserwowanych wyników dla tych dwóch grup nie nakładają się na siebie, a różnica między średnimi wynosi 2,34 pp. Dodatkowo testowano wariant z dopasowaną długością oraz wariant, który miał być krótki, ale zachowywać hedging - ten ostatni okazał się niestabilny między ziarenkami. Które konkretnie cechy formy są za to odpowiedzialne - pozostaje nierozstrzygnięte.
Mechanizm: skłonność do odpowiadania, nie treść
Autorka analizuje zmiany, rozkładając je algebraicznie na dwa składniki: skłonność do udzielania odpowiedzi (answer propensity) oraz warunkowy skład treści (conditional composition). Wyraźnie zastrzega, że ten rozkład to tożsamość algebraiczna, a nie odkrycie samo w sobie - istotne jest to, gdzie empirycznie trafiły zmiany. I trafiły głównie w skłonność do odpowiadania, podczas gdy skład treści pozostał stabilny.
Z tego wynika ważne ostrzeżenie metodologiczne: jeśli status „czy model odpowiedział” zależy od treningu, to porównywanie treści odpowiedzi między wariantami nie mówi nam nic o ukrytych preferencjach modelu. Badaczka wprost pisze, że kontrastu w warunkowym udziale stereotypów między wariantami nie można interpretować jako zmiany w preferencjach dotyczących treści.
Problem z narzędziami pomiarowymi
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Praca zawiera też obserwację dotyczącą samych narzędzi ewaluacyjnych. Zgodność między dwoma automatycznymi detektorami mierzącymi to samo zjawisko wynosiła od 0,44 do 0,99 - w zależności od tego, który checkpoint modelu wyprodukował tekst. Co istotne, tę rozbieżność można zauważyć bez żadnych etykiet referencyjnych. Autorka ujawnia też defekt w skrocie oceniającym: odpowiedzi kończące się sąsiadującymi literami były błędnie klasyfikowane jako pierwsza opcja, a liczby incydentów nie można odtworzyć z zapisanych wyników. Dane liczbowe w pracy pozostały jednak bez zmian między wersją v1 a v2.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem ta praca jest ważna z prozaicznego powodu: pokazuje, że dostrajanie modelu pod kątem czegoś tak technicznego jak format odpowiedzi nie jest operacją chirurgiczną. Efekty rozlewają się na zachowania, których nikt nie testował ani nie planował zmieniać. Dla kogoś, kto wdraża modele w kontekstach regulowanych - jak właśnie doradztwo finansowe czy wrażliwe pytania społeczne - oznacza to, że każda zmiana stylu wymaga ponownej ewaluacji bezpieczeństwa. Nie wystarczy przetestować, czy model pisze ładniej po koreańsku. Trzeba też sprawdzić, czy przy okazji nie zaczął zachowywać się inaczej tam, gdzie nie powinien.
Źródło: arXiv cs.AI: Off-Target Effects of Response-Style Alignment in a Korean 27B Language Model (dokument z 2026-09-16). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
