🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 7 szt. albo Gemini Pro na 18 miesięcy 170 zł Kup teraz →
Przejdź do treści
Newsy

Styl odpowiedzi modelu AI zmienia też to, czego nie planowałeś zmieniać

Badaczka dostroiła koreański model językowy pod kątem formy wypowiedzi i odkryła, że przy okazji zmieniło się jego zachowanie w zupełnie innych obszarach. Efekty uboczne pojawiły się tam, gdzie nikt ich nie szukał.

3 min czytania
Orange document icon with four lines on a dark blue background.

👁 113 przeczytań

Hyojung Han opublikowała na arXiv pracę opisującą eksperyment z modelem Qwen3.8-27B, który poddano procesowi dostrajania (post-training) wyłącznie pod kątem stylu odpowiedzi po koreańsku. Cel był wąski: nauczyć model pisać w określony sposób - z konkretną długością, użyciem list i markdown, strukturą dyskursu oraz rejestrem języka. Nikt nie planował przy tym zmieniać czegokolwiek innego.

Co właściwie badano

Badaczka mierzyła dwa zachowania, które nie były celem treningu. Pierwsze to tzw. abstencja - czyli jak często model odpowiada „nie wiem” na niejednoznaczne pytania społeczne w benchmarku KoBBQ, gdzie poprawna odpowiedź to właśnie UNKNOWN. Drugie to spontaniczne ujawnianie treści w kontekście doradztwa dotyczącego papierów wartościowych - czyli czy model z własnej inicjatywy podaje informacje, o które nikt nie prosił. Oba zachowania się zmieniły, mimo że trening ich nie dotyczył.

Jak wyglądał eksperyment

Kluczowy element metodologii polega na tym, że badaczka trzymała stałe: zestaw promptów, przepis treningowy, wolumen danych i konfigurację serwowania. Zmieniała tylko jeden element - tekst docelowy, czyli wzorcowy styl odpowiedzi. Przy takim układzie porównywała różne „ziarna” (seeds) stylów.

Trzy ziarna o stylu pozytywnym (bardziej rozbudowanym) dały średni wzrost wskaźnika odpowiedzi o +0,82 punktu procentowego. Trzy ziarna o stylu neutralnym dały średni spadek o -1,53 pp. Zakresy obserwowanych wyników dla tych dwóch grup nie nakładają się na siebie, a różnica między średnimi wynosi 2,34 pp. Dodatkowo testowano wariant z dopasowaną długością oraz wariant, który miał być krótki, ale zachowywać hedging - ten ostatni okazał się niestabilny między ziarenkami. Które konkretnie cechy formy są za to odpowiedzialne - pozostaje nierozstrzygnięte.

Mechanizm: skłonność do odpowiadania, nie treść

Autorka analizuje zmiany, rozkładając je algebraicznie na dwa składniki: skłonność do udzielania odpowiedzi (answer propensity) oraz warunkowy skład treści (conditional composition). Wyraźnie zastrzega, że ten rozkład to tożsamość algebraiczna, a nie odkrycie samo w sobie - istotne jest to, gdzie empirycznie trafiły zmiany. I trafiły głównie w skłonność do odpowiadania, podczas gdy skład treści pozostał stabilny.

Z tego wynika ważne ostrzeżenie metodologiczne: jeśli status „czy model odpowiedział” zależy od treningu, to porównywanie treści odpowiedzi między wariantami nie mówi nam nic o ukrytych preferencjach modelu. Badaczka wprost pisze, że kontrastu w warunkowym udziale stereotypów między wariantami nie można interpretować jako zmiany w preferencjach dotyczących treści.

Problem z narzędziami pomiarowymi

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Praca zawiera też obserwację dotyczącą samych narzędzi ewaluacyjnych. Zgodność między dwoma automatycznymi detektorami mierzącymi to samo zjawisko wynosiła od 0,44 do 0,99 - w zależności od tego, który checkpoint modelu wyprodukował tekst. Co istotne, tę rozbieżność można zauważyć bez żadnych etykiet referencyjnych. Autorka ujawnia też defekt w skrocie oceniającym: odpowiedzi kończące się sąsiadującymi literami były błędnie klasyfikowane jako pierwsza opcja, a liczby incydentów nie można odtworzyć z zapisanych wyników. Dane liczbowe w pracy pozostały jednak bez zmian między wersją v1 a v2.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem ta praca jest ważna z prozaicznego powodu: pokazuje, że dostrajanie modelu pod kątem czegoś tak technicznego jak format odpowiedzi nie jest operacją chirurgiczną. Efekty rozlewają się na zachowania, których nikt nie testował ani nie planował zmieniać. Dla kogoś, kto wdraża modele w kontekstach regulowanych - jak właśnie doradztwo finansowe czy wrażliwe pytania społeczne - oznacza to, że każda zmiana stylu wymaga ponownej ewaluacji bezpieczeństwa. Nie wystarczy przetestować, czy model pisze ładniej po koreańsku. Trzeba też sprawdzić, czy przy okazji nie zaczął zachowywać się inaczej tam, gdzie nie powinien.

Źródło: arXiv cs.AI: Off-Target Effects of Response-Style Alignment in a Korean 27B Language Model (dokument z 2026-09-16). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie