CultureScore: jak mierzyć, czy AI generuje wideo zgodne kulturowo
Badacze stworzyli narzędzie do oceny, czy modele generujące wideo poprawnie oddają gesty, tła i zachowania charakterystyczne dla różnych kultur. Żaden z testowanych modeli nie przekroczył 56,8% poprawności kulturowej.

👁 116 przeczytań
Modele generujące wideo potrafią już tworzyć materiały o wysokiej jakości wizualnej - ale czy potrafią wiernie oddać kulturowe niuanse? Zespół sześciu badaczy (Anku Rani, Wei Dai, Shravan Nayak, Pattie Maes, Mahdi M. Kalayeh i Paul Pu Liang) opublikował w czerwcu 2026 roku pracę opisującą CultureScore - nowe narzędzie ewaluacyjne zaprojektowane właśnie z myślą o tym problemie.
Problem z istniejącymi metrykami
Autorzy wskazują wprost na lukę w dotychczasowych metodach oceny. Metryki takie jak VideoScore mierzą wyłącznie jakość wizualną - ostrość, płynność, spójność obrazu - ale nie mają żadnego mechanizmu oceny wierności kulturowej. Konsekwencja jest konkretna: model, który zamiast gestu Namaste wygeneruje uścisk dłoni, dostanie dokładnie taki sam wynik jak model, który Namaste odtworzy poprawnie. Autorzy traktują to jako poważną wadę, szczególnie w kontekście sprawiedliwego i równego reprezentowania różnych społeczności na świecie.
Trzy wymiary CultureScore
Zaproponowany framework rozkłada wierność kulturową na trzy składowe. Pierwsza to Identity - kto jest przedstawiony, czyli reprezentacja osób. Druga to Context - czy tło i otoczenie są kulturowo zlokalizowane. Trzecia to Behavior - czy gesty i interakcje między postaciami odpowiadają normom danej kultury. Każdy z tych wymiarów jest oceniany osobno, co pozwala wskazać, gdzie konkretnie model zawodzi.
Jak przeprowadzono ewaluację
Badanie objęło 10 krajów. Wygenerowano łącznie 6 174 filmy za pomocą trzech modeli uznanych przez autorów za czołowe - w tym Veo 3.1 i LTX-2. Dane i kod zostały udostępnione publicznie. Autorzy porównali wyniki automatycznych metryk z ocenami rodowitych użytkowników danego języka i kultury (native annotators).
Wyniki: żaden model nie zdaje egzaminu
Najlepszy z testowanych modeli osiągnął zaledwie 56,8% w ogólnym CultureScore. Najtrudniejszym wymiarem okazało się Behavior - żaden model nie przekroczył 52,1% w tej kategorii. Autorzy piszą wprost, że żaden obecny model nie osiąga kulturowo wiernej generacji wideo.
Pojawia się przy tym interesująca rozbieżność: model LTX-2 wypadł najlepiej pod względem jakości wizualnej, ale został sklasyfikowany na ostatnim miejscu przez rodzimych recenzentów oceniających wierność kulturową. To wyraźny dowód, że wysoka jakość obrazu i kulturowa poprawność to dwie różne rzeczy, których nie należy mylić ani stosować zamiennie.
Spośród wszystkich automatycznych metryk to właśnie wymiar Behavior w CultureScore wykazał najsilniejszą dodatnią korelację z ludzką oceną kulturową - co autorzy interpretują jako potwierdzenie, że ich podejście rzeczywiście mierzy to, co istotne z perspektywy oceny kulturowej.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Moim zdaniem ta praca pokazuje konkretny i dotąd pomijany problem: branża skupiła się na metryкach jakości wizualnej, ignorując pytanie, czy AI w ogóle rozumie, co generuje w kontekście kulturowym. Wynik poniżej 57% dla najlepszego modelu to liczba, która nie pozostawia miejsca na dobre miny - szczególnie jeśli takie systemy mają być używane globalnie. Wartość CultureScore jako narzędzia zależy oczywiście od tego, jak szerokie i reprezentatywne jest pokrycie krajów i kultur - a dokument mówi tylko o 10 krajach, bez podania których. To ograniczenie, które warto mieć z tyłu głowy.
Źródło: arXiv cs.AI: CultureScore: Evaluating Cultural Faithfulness in Video Generation Models (dokument z 2026-10-06). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
