Arena wideo AI: Wan 3.0, Kling, Seedance, Veo, H3 i Runway w 5 scenach
Sześć modeli wideo AI na pięciu tych samych scenach: ruch kamery, polska mowa, napis na tablicy, woda i spójność postaci. Klipy, oceny, koszty.

👁 121 przeczytań
- Wan 3.0 wygrał test pięciu scen ze średnią 8,8/10, wyprzedzając MiniMax H3 Max (8,4/10) i kosztując tylko 0,21 USD za 5-sekundowy klip.
- Jedynie Wan 3.0 i MiniMax H3 Max poprawnie napisały 'ŻÓŁTA ŁÓDŹ' na tablicy - pozostałe modele zamieniały polskie znaki na cyrylicę lub znaki czeskie i niemieckie.
- Runway Gen-4.5 nie generuje dźwięku przez API, przez co dostał 0 za scenę z polską mową i wypadł najsłabiej ze średnią 3,9/10.
Na pięciu tych samych scenach najlepiej wypadł Wan 3.0 (średnio 8,8/10), tuż za nim MiniMax H3 Max (8,4/10). Oba jako jedyne bezbłędnie napisały na tablicy „ŻÓŁTA ŁÓDŹ”, a Wan zrobił to za 0,21 USD za klip, najtaniej w całym zestawieniu. Najsłabiej wypadły Veo 3.1 Lite (bez ruchu kamery i z cyrylicą zamiast polskich liter) i Runway Gen-4.5, który przez API w ogóle nie generuje dźwięku.
Stan na 8 października 2026
- 6 modeli, 5 scen, 25 nowych klipów z 8.10.2026 i 4 klipy mowy z rundy 28.09.2026 (to samo polecenie).
- Wszystko przez jedno API (OpenRouter), koszt rundy: 8,54 USD.
- Kling 4.0 nie ma jeszcze w API (jest tylko 4.0 Flash w aplikacji dla planu Ultra), więc Kling występuje w wersji 3.0 Standard.
- Sora odpada: OpenAI wyłączyło Sora 2 API 24 września 2026.
- Pełny ranking z cenami i polskim lektorem: najlepsze AI do tworzenia filmów.
Wyniki: tabela
Oceny w skali 0-10. Średnia liczy wszystkie pięć scen, więc model bez dźwięku dostaje 0 za scenę z polską mową.

| Model | Ruch kamery | Postać mówi po polsku | Tekst na tablicy | Fizyka wody | Spójność postaci w 2 ujęciach | Średnia |
|---|---|---|---|---|---|---|
| Wan 3.0 | 8,5 | 7,5 | 10,0 | 9,0 | 9,0 | 8,8 |
| MiniMax H3 Max | 8,0 | 9,0 | 10,0 | 7,5 | 7,5 | 8,4 |
| Kling 3.0 Standard | 8,5 | 5,5 | 4,0 | 7,5 | 7,5 | 6,6 |
| Seedance 2.5 | 6,0 | 4,0 | 5,0 | 7,0 | 6,0 | 5,6 |
| Veo 3.1 Lite | 3,0 | 7,5 | 2,0 | 5,0 | 6,5 | 4,8 |
| Runway Gen-4.5 | 6,5 | 0,0 | 2,0 | 4,0 | 7,0 | 3,9 |
Koszt i parametry klipów w tej rundzie:
| Model | Średnia bez mowy | Koszt klipu | Długość | Rozdzielczość | Dźwięk w API |
|---|---|---|---|---|---|
| Wan 3.0 | 9,1 | 0,21 USD | 5 s | 480p | tak |
| MiniMax H3 Max | 8,2 | 0,25 USD | 5 s | 480p | nie |
| Kling 3.0 Standard | 6,9 | 0,42 USD | 5 s | 720p (plik 1080p) | tak |
| Seedance 2.5 | 6,0 | 0,52 USD | 5 s | 480p | tak |
| Veo 3.1 Lite | 4,1 | 0,18 USD | 6 s | 720p | tak |
| Runway Gen-4.5 | 4,9 | 0,48 USD | 4 s | 720p | nie |
Najważniejsze wnioski:
- Tekst w kadrze rozdzielił stawkę najmocniej. Pierwszy wiersz „ARENA WIDEO 2026” napisały wszystkie modele, polskie litery w drugim tylko Wan 3.0 i H3 Max.
- Ruch kamery: Kling, Wan i H3 Max zrobiły orbitę od przodu do tyłu motocykla. Veo 3.1 Lite praktycznie nie ruszył kamery.
- Fizyka wody: tylko Wan pokazał całą sekwencję - napełnianie, przelanie i kałużę we właściwej kolejności.
- Cena: najlepszy wynik nie kosztował najwięcej. Wan 3.0 w 480p to 0,21 USD za 5 sekund, Seedance 2.5 w tej samej rozdzielczości 0,52 USD.
Scena 1: ruch kamery
Co oceniam: płynność orbity 180 stopni, stałość motocykla i tła, odbicia w kałużach.
Polecenie (prompt) dla wszystkich modeli
A smooth 180-degree camera orbit around a vintage red motorcycle parked on a wet cobblestone street in an old European town at blue hour. The camera circles steadily from the front of the motorcycle to its back at a constant speed. Street lamps reflect in the puddles, light drizzle. The motorcycle keeps its exact shape and details. Realistic cinematic footage, real-time motion, no text, no logos.
Scena 2: postać mówi po polsku
Co oceniam: zrozumiałość polskiego zdania (faster-whisper large-v3, WER), ruch ust, akcent.
Scena 2 to ten sam prompt co w rundzie 28.09.2026 (faster-whisper large-v3, WER po zamianie liczb na słowa). Nowy klip zrobiłem tylko dla Veo 3.1 Lite. Pełne transkrypcje i wyniki innych modeli (Veo 3.1, Gemini Omni Flash, Grok Imagine) są w rankingu modeli wideo.
Polecenie (prompt) dla wszystkich modeli
Medium close-up of a woman in her thirties sitting at a kitchen table, looking straight into the camera. She says clearly and calmly in Polish: "W Szczebrzeszynie chrząszcz brzmi w trzcinie, a ja płacę trzydzieści dwa złote." Natural daylight from a window, static camera, realistic, no subtitles, no on-screen text, no music.
Scena 3: tekst na tablicy
Co oceniam: czy napis jest dokładnie taki jak w poleceniu, także polskie litery.
Polecenie (prompt) dla wszystkich modeli
Close-up of a green school chalkboard in a sunlit classroom. A hand finishes writing with white chalk. The chalkboard clearly shows exactly two lines of text in capital letters: first line "ARENA WIDEO 2026", second line "ŻÓŁTA ŁÓDŹ". Static camera, realistic, chalk dust in the light, no other text.
Scena 4: fizyka wody
Co oceniam: strumień, rozbryzg, poziom wody rośnie, przelanie na stół, brak znikającej wody.
Polecenie (prompt) dla wszystkich modeli
Static close-up on a wooden kitchen table in daylight. Water is poured from a glass pitcher into an empty clear drinking glass. The stream splashes, bubbles rise, the water level rises steadily until the glass overflows and water spills onto the table and spreads into a puddle. Real-time speed, no slow motion, realistic physics, no text.
Scena 5: spójność postaci w 2 ujęciach
Co oceniam: ta sama twarz, włosy, okulary, płaszcz i plecak po cięciu.
Polecenie (prompt) dla wszystkich modeli
Two shots separated by one hard cut. Shot 1: wide shot of a young woman with short red hair, round black glasses, a yellow raincoat and a black backpack walking along a rainy city street at night with neon reflections on the wet pavement. Hard cut. Shot 2: close-up of the same woman with the same short red hair, the same round black glasses and the same yellow raincoat as she stops under a shop awning and looks up at the rain. Realistic, cinematic, no text.
Metodologia
- Każdy model dostał dokładnie ten sam prompt po angielsku (polskie były tylko napis na tablicy i kwestia mówiona), proporcje 16:9, bez zdjęcia startowego, jedno podejście - bez losowania kilku wersji i wybierania najlepszej.
- Długość 5 sekund. Wyjątki wynikają z API: Veo 3.1 Lite przyjmuje 4, 6 albo 8 s (dałem 6), Runway Gen-4.5 dostał 4 s, żeby zmieścić się w budżecie.
- Rozdzielczość: Seedance 2.5, Wan 3.0 i H3 Max w 480p, Kling, Veo i Runway w 720p (najniższej dostępnej). Kling 3.0 Standard i tak oddaje plik 1080p.
- Ocena: oglądam każdy klip w całości i porównuję 4 klatki (8, 35, 62 i 92% długości) obok siebie. Napis na tablicy sprawdzam na ostatniej klatce w pełnej rozdzielczości.
- Mowa: transkrypcja faster-whisper large-v3 z językiem polskim i WER (odsetek błędnych słów) po zamianie liczb na słowa.
- Koszt: pole
usage.costz odpowiedzi OpenRoutera, w USD, bez VAT. - Pliki na stronie są przekodowane do H.264 (do 1280 px) i ładują się dopiero po kliknięciu.
Czego w tej rundzie nie ma i dlaczego
- Kling 4.0 i 4.0 Flash - Kling zapowiedział pełną wersję na październik, ale 8.10.2026 nie było ani oficjalnego modelu w API, ani cennika. Dołożę go, gdy pojawi się w API. Opis wersji: Kling 4.0.
- Sora 2 - API wyłączone 24.09.2026, aplikacja już w kwietniu.
- Veo 3.1 (pełne) i Gemini Omni Flash - pełne Veo kosztuje 0,40 USD za sekundę z dźwiękiem, a Omni Flash nie ma w OpenRouterze. Oba są w rundzie z 28.09 w rankingu modeli wideo.
- Kling 3.0 Pro - pominąłem dla budżetu (0,56 USD za 5 s bez dźwięku). Test obrazu do wideo z Kling 3.0 Pro jest w przewodniku Kling AI.
Najczęstsze pytania
Który generator wideo AI najlepiej pisze polskie litery?
W tej rundzie tylko Wan 3.0 i MiniMax H3 Max napisały „ŻÓŁTA ŁÓDŹ” bez błędu. Kling, Seedance, Veo 3.1 Lite i Runway podmieniały znaki na czeskie, niemieckie albo cyrylicę.
Który model wideo AI jest najtańszy?
Z testowanych najtaniej wyszedł Veo 3.1 Lite (0,18 USD za 6 s bez dźwięku), ale jakościowo był najsłabszy. Najlepszy stosunek ceny do wyniku miał Wan 3.0: 0,21 USD za 5 s w 480p.
Czy Kling 4.0 jest już dostępny przez API?
Na 8 października 2026 nie. Jest wersja 4.0 Flash w aplikacji Kling dla części subskrybentów planu Ultra. Strony, które sprzedają „Kling 4 API”, obsługują zapytania starszym Klingiem.
Czy można jeszcze używać Sory?
Nie. Aplikację Sora wyłączono 26 kwietnia 2026, a Sora 2 API 24 września 2026. OpenAI nie wskazało następcy.
Jak często aktualizuję Arenę?
Przy każdym nowym modelu wideo, który pojawia się w API. Najbliżej jest Kling 4.0.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła i data sprawdzenia
- Cennik i parametry modeli: OpenRouter, lista modeli wideo (8.10.2026).
- Kling 4.0: nota wydania Kling.
- Wyłączenie Sora 2 API: OpenAI, deprecations.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
