✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Arena wideo AI: Wan 3.0, Kling, Seedance, Veo, H3 i Runway w 5 scenach

Sześć modeli wideo AI na pięciu tych samych scenach: ruch kamery, polska mowa, napis na tablicy, woda i spójność postaci. Klipy, oceny, koszty.

8 min czytania
Arena wideo AI - siatka klipów z przyciskiem odtwarzania, test 6 modeli na 5 scenach

👁 121 przeczytań

// w skrócie
  • Wan 3.0 wygrał test pięciu scen ze średnią 8,8/10, wyprzedzając MiniMax H3 Max (8,4/10) i kosztując tylko 0,21 USD za 5-sekundowy klip.
  • Jedynie Wan 3.0 i MiniMax H3 Max poprawnie napisały 'ŻÓŁTA ŁÓDŹ' na tablicy - pozostałe modele zamieniały polskie znaki na cyrylicę lub znaki czeskie i niemieckie.
  • Runway Gen-4.5 nie generuje dźwięku przez API, przez co dostał 0 za scenę z polską mową i wypadł najsłabiej ze średnią 3,9/10.
Aktualizacja (wrzesień 2026): OpenAI zamknęło generator wideo Sora 26 kwietnia 2026 (API działa do 24 września 2026); co się stało i czym go zastąpić, opisuję w tekście Sora i Sora 2 zamknięte. Tekst poniżej zostawiam w wersji z dnia publikacji.

Na pięciu tych samych scenach najlepiej wypadł Wan 3.0 (średnio 8,8/10), tuż za nim MiniMax H3 Max (8,4/10). Oba jako jedyne bezbłędnie napisały na tablicy „ŻÓŁTA ŁÓDŹ”, a Wan zrobił to za 0,21 USD za klip, najtaniej w całym zestawieniu. Najsłabiej wypadły Veo 3.1 Lite (bez ruchu kamery i z cyrylicą zamiast polskich liter) i Runway Gen-4.5, który przez API w ogóle nie generuje dźwięku.

Stan na 8 października 2026

  • 6 modeli, 5 scen, 25 nowych klipów z 8.10.2026 i 4 klipy mowy z rundy 28.09.2026 (to samo polecenie).
  • Wszystko przez jedno API (OpenRouter), koszt rundy: 8,54 USD.
  • Kling 4.0 nie ma jeszcze w API (jest tylko 4.0 Flash w aplikacji dla planu Ultra), więc Kling występuje w wersji 3.0 Standard.
  • Sora odpada: OpenAI wyłączyło Sora 2 API 24 września 2026.
  • Pełny ranking z cenami i polskim lektorem: najlepsze AI do tworzenia filmów.

Wyniki: tabela

Oceny w skali 0-10. Średnia liczy wszystkie pięć scen, więc model bez dźwięku dostaje 0 za scenę z polską mową.

// taniej niż u producentaw magazynie
Runway Pro - 12 miesięcy
Runway Pro - 12 miesięcyKod, którym włączasz Runway Pro na 12 miesięcy na własnym koncie.kinetyka.pl - mój sklep z rocznymi dostępami do narzędzi AI
448 zł-67%zamiast 1 344 zł37,33 zł / mies.Kup w Kinetyce →
ModelRuch kameryPostać mówi po polskuTekst na tablicyFizyka wodySpójność postaci w 2 ujęciachŚrednia
Wan 3.08,57,510,09,09,08,8
MiniMax H3 Max8,09,010,07,57,58,4
Kling 3.0 Standard8,55,54,07,57,56,6
Seedance 2.56,04,05,07,06,05,6
Veo 3.1 Lite3,07,52,05,06,54,8
Runway Gen-4.56,50,02,04,07,03,9

Koszt i parametry klipów w tej rundzie:

ModelŚrednia bez mowyKoszt klipuDługośćRozdzielczośćDźwięk w API
Wan 3.09,10,21 USD5 s480ptak
MiniMax H3 Max8,20,25 USD5 s480pnie
Kling 3.0 Standard6,90,42 USD5 s720p (plik 1080p)tak
Seedance 2.56,00,52 USD5 s480ptak
Veo 3.1 Lite4,10,18 USD6 s720ptak
Runway Gen-4.54,90,48 USD4 s720pnie

Najważniejsze wnioski:

  • Tekst w kadrze rozdzielił stawkę najmocniej. Pierwszy wiersz „ARENA WIDEO 2026” napisały wszystkie modele, polskie litery w drugim tylko Wan 3.0 i H3 Max.
  • Ruch kamery: Kling, Wan i H3 Max zrobiły orbitę od przodu do tyłu motocykla. Veo 3.1 Lite praktycznie nie ruszył kamery.
  • Fizyka wody: tylko Wan pokazał całą sekwencję - napełnianie, przelanie i kałużę we właściwej kolejności.
  • Cena: najlepszy wynik nie kosztował najwięcej. Wan 3.0 w 480p to 0,21 USD za 5 sekund, Seedance 2.5 w tej samej rozdzielczości 0,52 USD.

Scena 1: ruch kamery

Co oceniam: płynność orbity 180 stopni, stałość motocykla i tła, odbicia w kałużach.

Polecenie (prompt) dla wszystkich modeli
A smooth 180-degree camera orbit around a vintage red motorcycle parked on a wet cobblestone street in an old European town at blue hour. The camera circles steadily from the front of the motorcycle to its back at a constant speed. Street lamps reflect in the puddles, light drizzle. The motorcycle keeps its exact shape and details. Realistic cinematic footage, real-time motion, no text, no logos.
Wan 3.0 - 8,5/10. pełna orbita od przodu do tyłu, motocykl trzyma kształt
MiniMax H3 Max - 8,0/10. orbita do tyłu, lekko skacze oświetlenie
Kling 3.0 Standard - 8,5/10. płynna orbita, tablica rejestracyjna z krzakami
Seedance 2.5 - 6,0/10. orbita dobra, ale na siodle pojawia się czarna płachta
Veo 3.1 Lite - 3,0/10. kamera prawie stoi - orbity nie ma
Runway Gen-4.5 - 6,5/10. motocykl zmienia kształt w choppera

Scena 2: postać mówi po polsku

Co oceniam: zrozumiałość polskiego zdania (faster-whisper large-v3, WER), ruch ust, akcent.

Scena 2 to ten sam prompt co w rundzie 28.09.2026 (faster-whisper large-v3, WER po zamianie liczb na słowa). Nowy klip zrobiłem tylko dla Veo 3.1 Lite. Pełne transkrypcje i wyniki innych modeli (Veo 3.1, Gemini Omni Flash, Grok Imagine) są w rankingu modeli wideo.

Polecenie (prompt) dla wszystkich modeli
Medium close-up of a woman in her thirties sitting at a kitchen table, looking straight into the camera. She says clearly and calmly in Polish: "W Szczebrzeszynie chrząszcz brzmi w trzcinie, a ja płacę trzydzieści dwa złote." Natural daylight from a window, static camera, realistic, no subtitles, no on-screen text, no music.
Wan 3.0 - 7,5/10. runda 28.09: WER 0,167 („chrząść”, „płaczę”)
MiniMax H3 Max - 9,0/10. runda 28.09 przez fal.ai (z dźwiękiem): WER 0; w OpenRouterze H3 Max nie generuje dźwięku
Kling 3.0 Standard - 5,5/10. runda 28.09 (Kling 3.0 Turbo Pro przez fal.ai): WER 0,333
Seedance 2.5 - 4,0/10. runda 28.09: WER 0,583
Veo 3.1 Lite - 7,5/10. nowy klip 8.10: WER 0,167 („Przebrzeszynie” zamiast „W Szczebrzeszynie”)
Runway Gen-4.5: brak dźwięku w API
Runway Gen-4.5 - 0,0/10. brak dźwięku w API - scena niewykonalna

Scena 3: tekst na tablicy

Co oceniam: czy napis jest dokładnie taki jak w poleceniu, także polskie litery.

Polecenie (prompt) dla wszystkich modeli
Close-up of a green school chalkboard in a sunlit classroom. A hand finishes writing with white chalk. The chalkboard clearly shows exactly two lines of text in capital letters: first line "ARENA WIDEO 2026", second line "ŻÓŁTA ŁÓDŹ". Static camera, realistic, chalk dust in the light, no other text.
Wan 3.0 - 10,0/10. oba wiersze bezbłędnie, z kropką nad Ż i kreską w Ł
MiniMax H3 Max - 10,0/10. oba wiersze bezbłędnie
Kling 3.0 Standard - 4,0/10. pierwszy wiersz dobrze, drugi „ŹÓĹTA ÁO RZ”
Seedance 2.5 - 5,0/10. „ŻÖLTA LÖDŽ” - niemieckie i czeskie znaki zamiast polskich
Veo 3.1 Lite - 2,0/10. drugi wiersz po rosyjsku: „ČTA ЖДИЙ”
Runway Gen-4.5 - 2,0/10. drugi wiersz „IŞTA ŇDÍ”

Scena 4: fizyka wody

Co oceniam: strumień, rozbryzg, poziom wody rośnie, przelanie na stół, brak znikającej wody.

Polecenie (prompt) dla wszystkich modeli
Static close-up on a wooden kitchen table in daylight. Water is poured from a glass pitcher into an empty clear drinking glass. The stream splashes, bubbles rise, the water level rises steadily until the glass overflows and water spills onto the table and spreads into a puddle. Real-time speed, no slow motion, realistic physics, no text.
Wan 3.0 - 9,0/10. woda podnosi się równo, przelewa i rozlewa w kałużę
MiniMax H3 Max - 7,5/10. burzliwe nalewanie, przelanie dopiero w ostatniej sekundzie
Kling 3.0 Standard - 7,5/10. poziom wody rośnie, kałuża pojawia się bez widocznego przelania
Seedance 2.5 - 7,0/10. szklanka napełnia się za szybko, na końcu mały wyciek
Veo 3.1 Lite - 5,0/10. kałuża na stole, zanim szklanka jest pełna
Runway Gen-4.5 - 4,0/10. woda wybucha pianą, na szklance pojawia się napis

Scena 5: spójność postaci w 2 ujęciach

Co oceniam: ta sama twarz, włosy, okulary, płaszcz i plecak po cięciu.

Polecenie (prompt) dla wszystkich modeli
Two shots separated by one hard cut. Shot 1: wide shot of a young woman with short red hair, round black glasses, a yellow raincoat and a black backpack walking along a rainy city street at night with neon reflections on the wet pavement. Hard cut. Shot 2: close-up of the same woman with the same short red hair, the same round black glasses and the same yellow raincoat as she stops under a shop awning and looks up at the rain. Realistic, cinematic, no text.
Wan 3.0 - 9,0/10. rude włosy, okulary, płaszcz i plecak takie same po cięciu
MiniMax H3 Max - 7,5/10. fryzura zmienia się na rudy bob z grzywką
Kling 3.0 Standard - 7,5/10. cięcie jest, postać w pierwszym ujęciu bardzo mała
Seedance 2.5 - 6,0/10. kaptur zasłania włosy w obu ujęciach, plecaka nie widać
Veo 3.1 Lite - 6,5/10. w zbliżeniu kaptur zasłania włosy i okulary
Runway Gen-4.5 - 7,0/10. spójna postać, cięcie z planu ogólnego na średni

Metodologia

  • Każdy model dostał dokładnie ten sam prompt po angielsku (polskie były tylko napis na tablicy i kwestia mówiona), proporcje 16:9, bez zdjęcia startowego, jedno podejście - bez losowania kilku wersji i wybierania najlepszej.
  • Długość 5 sekund. Wyjątki wynikają z API: Veo 3.1 Lite przyjmuje 4, 6 albo 8 s (dałem 6), Runway Gen-4.5 dostał 4 s, żeby zmieścić się w budżecie.
  • Rozdzielczość: Seedance 2.5, Wan 3.0 i H3 Max w 480p, Kling, Veo i Runway w 720p (najniższej dostępnej). Kling 3.0 Standard i tak oddaje plik 1080p.
  • Ocena: oglądam każdy klip w całości i porównuję 4 klatki (8, 35, 62 i 92% długości) obok siebie. Napis na tablicy sprawdzam na ostatniej klatce w pełnej rozdzielczości.
  • Mowa: transkrypcja faster-whisper large-v3 z językiem polskim i WER (odsetek błędnych słów) po zamianie liczb na słowa.
  • Koszt: pole usage.cost z odpowiedzi OpenRoutera, w USD, bez VAT.
  • Pliki na stronie są przekodowane do H.264 (do 1280 px) i ładują się dopiero po kliknięciu.

Czego w tej rundzie nie ma i dlaczego

  • Kling 4.0 i 4.0 Flash - Kling zapowiedział pełną wersję na październik, ale 8.10.2026 nie było ani oficjalnego modelu w API, ani cennika. Dołożę go, gdy pojawi się w API. Opis wersji: Kling 4.0.
  • Sora 2 - API wyłączone 24.09.2026, aplikacja już w kwietniu.
  • Veo 3.1 (pełne) i Gemini Omni Flash - pełne Veo kosztuje 0,40 USD za sekundę z dźwiękiem, a Omni Flash nie ma w OpenRouterze. Oba są w rundzie z 28.09 w rankingu modeli wideo.
  • Kling 3.0 Pro - pominąłem dla budżetu (0,56 USD za 5 s bez dźwięku). Test obrazu do wideo z Kling 3.0 Pro jest w przewodniku Kling AI.

Najczęstsze pytania

Który generator wideo AI najlepiej pisze polskie litery?

W tej rundzie tylko Wan 3.0 i MiniMax H3 Max napisały „ŻÓŁTA ŁÓDŹ” bez błędu. Kling, Seedance, Veo 3.1 Lite i Runway podmieniały znaki na czeskie, niemieckie albo cyrylicę.

Który model wideo AI jest najtańszy?

Z testowanych najtaniej wyszedł Veo 3.1 Lite (0,18 USD za 6 s bez dźwięku), ale jakościowo był najsłabszy. Najlepszy stosunek ceny do wyniku miał Wan 3.0: 0,21 USD za 5 s w 480p.

Czy Kling 4.0 jest już dostępny przez API?

Na 8 października 2026 nie. Jest wersja 4.0 Flash w aplikacji Kling dla części subskrybentów planu Ultra. Strony, które sprzedają „Kling 4 API”, obsługują zapytania starszym Klingiem.

Czy można jeszcze używać Sory?

Nie. Aplikację Sora wyłączono 26 kwietnia 2026, a Sora 2 API 24 września 2026. OpenAI nie wskazało następcy.

Jak często aktualizuję Arenę?

Przy każdym nowym modelu wideo, który pojawia się w API. Najbliżej jest Kling 4.0.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›