Przejdź do treści
Newsy

CultureScore: jak mierzyć, czy AI generuje wideo zgodne kulturowo

Badacze stworzyli narzędzie do oceny, czy modele generujące wideo poprawnie oddają gesty, tła i zachowania charakterystyczne dla różnych kultur. Żaden z testowanych modeli nie przekroczył 56,8% poprawności kulturowej.

3 min czytania
CultureScore: jak mierzyć, czy AI generuje wideo zgodne kulturowo

👁 116 przeczytań

Modele generujące wideo potrafią już tworzyć materiały o wysokiej jakości wizualnej - ale czy potrafią wiernie oddać kulturowe niuanse? Zespół sześciu badaczy (Anku Rani, Wei Dai, Shravan Nayak, Pattie Maes, Mahdi M. Kalayeh i Paul Pu Liang) opublikował w czerwcu 2026 roku pracę opisującą CultureScore - nowe narzędzie ewaluacyjne zaprojektowane właśnie z myślą o tym problemie.

Problem z istniejącymi metrykami

Autorzy wskazują wprost na lukę w dotychczasowych metodach oceny. Metryki takie jak VideoScore mierzą wyłącznie jakość wizualną - ostrość, płynność, spójność obrazu - ale nie mają żadnego mechanizmu oceny wierności kulturowej. Konsekwencja jest konkretna: model, który zamiast gestu Namaste wygeneruje uścisk dłoni, dostanie dokładnie taki sam wynik jak model, który Namaste odtworzy poprawnie. Autorzy traktują to jako poważną wadę, szczególnie w kontekście sprawiedliwego i równego reprezentowania różnych społeczności na świecie.

Trzy wymiary CultureScore

Zaproponowany framework rozkłada wierność kulturową na trzy składowe. Pierwsza to Identity - kto jest przedstawiony, czyli reprezentacja osób. Druga to Context - czy tło i otoczenie są kulturowo zlokalizowane. Trzecia to Behavior - czy gesty i interakcje między postaciami odpowiadają normom danej kultury. Każdy z tych wymiarów jest oceniany osobno, co pozwala wskazać, gdzie konkretnie model zawodzi.

Jak przeprowadzono ewaluację

Badanie objęło 10 krajów. Wygenerowano łącznie 6 174 filmy za pomocą trzech modeli uznanych przez autorów za czołowe - w tym Veo 3.1 i LTX-2. Dane i kod zostały udostępnione publicznie. Autorzy porównali wyniki automatycznych metryk z ocenami rodowitych użytkowników danego języka i kultury (native annotators).

Wyniki: żaden model nie zdaje egzaminu

Najlepszy z testowanych modeli osiągnął zaledwie 56,8% w ogólnym CultureScore. Najtrudniejszym wymiarem okazało się Behavior - żaden model nie przekroczył 52,1% w tej kategorii. Autorzy piszą wprost, że żaden obecny model nie osiąga kulturowo wiernej generacji wideo.

Pojawia się przy tym interesująca rozbieżność: model LTX-2 wypadł najlepiej pod względem jakości wizualnej, ale został sklasyfikowany na ostatnim miejscu przez rodzimych recenzentów oceniających wierność kulturową. To wyraźny dowód, że wysoka jakość obrazu i kulturowa poprawność to dwie różne rzeczy, których nie należy mylić ani stosować zamiennie.

Spośród wszystkich automatycznych metryk to właśnie wymiar Behavior w CultureScore wykazał najsilniejszą dodatnią korelację z ludzką oceną kulturową - co autorzy interpretują jako potwierdzenie, że ich podejście rzeczywiście mierzy to, co istotne z perspektywy oceny kulturowej.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co z tego wynika

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Moim zdaniem ta praca pokazuje konkretny i dotąd pomijany problem: branża skupiła się na metryкach jakości wizualnej, ignorując pytanie, czy AI w ogóle rozumie, co generuje w kontekście kulturowym. Wynik poniżej 57% dla najlepszego modelu to liczba, która nie pozostawia miejsca na dobre miny - szczególnie jeśli takie systemy mają być używane globalnie. Wartość CultureScore jako narzędzia zależy oczywiście od tego, jak szerokie i reprezentatywne jest pokrycie krajów i kultur - a dokument mówi tylko o 10 krajach, bez podania których. To ograniczenie, które warto mieć z tyłu głowy.

Źródło: arXiv cs.AI: CultureScore: Evaluating Cultural Faithfulness in Video Generation Models (dokument z 2026-10-06). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Replit Core 119 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›