Przejdź do treści
Warsztat

Wan 3.0 po polsku: test modelu nr 1 w rankingu wideo - dialog, neon i film z PDF

Mówi po polsku słowo w słowo i pisze polskie neony z ogonkami. Drobny tekst się sypie, a filtr treści zablokował niewinną scenę na targu.

8 min czytania

👁 119 przeczytań

// w skrócie
  • Wan 3.0 od Alibaby zajmuje 1. miejsce w rankingu wideo Artificial Analysis z wynikiem 1335 punktów Elo, wyprzedzając Gemini Omni Flash Google o zaledwie 3 punkty.
  • Polskie kwestie dialogowe zostały wypowiedziane słowo w słowo, a neon z napisem ŻÓŁTA GĘŚ wyszedł bezbłędnie ze wszystkimi znakami diakrytycznymi - drobny tekst na kartkach już się sypie.
  • Pięć testowych klipów o łącznej długości 71 sekund kosztowało 7,10 USD, a czas generowania wahał się od 3 do prawie 14 minut za jeden klip.

Wan 3.0 od Alibaby prowadzi w rankingu wideo Artificial Analysis: 1335 punktów Elo w kategorii tekst na wideo, przed Gemini Omni Flash i MiniMax H3. Robi do 30 sekund wideo w jednym przebiegu, z dźwiękiem, i potrafi zrobić film z dokumentu. Wydałem na testy 7,10 dolara: pięć klipów, w tym dialog po polsku, polski neon, jedno ujęcie na 30 sekund i film z pliku PDF. Poniżej wszystko, co wyszło - razem z tym, co nie wyszło.

Werdykt w jednym akapicie

Wan 3.0 mówi po polsku i pisze po polsku. Dialog „Nie wyjadę bez ciebie. Słyszysz? Nie wyjadę.” wyszedł słowo w słowo, a neon „ŻÓŁTA GĘŚ” - ze wszystkimi ogonkami. 30-sekundowe ujęcie bez cięcia utrzymało postać i kolejność akcji od początku do końca. Słabe strony: drobny tekst się sypie, generowanie trwa od 3 do 14 minut, filtr treści zablokował niewinną scenę na targu, a funkcja „wideo ze strony internetowej” w moich dwóch próbach nie zadziałała ani razu. Wideo z pliku PDF - zadziałało i to bardzo dobrze.

Cztery kadry z moich testów Wan 3.0: dialog po polsku, neon ŻÓŁTA GĘŚ, ujęcie 30-sekundowe i nalewanie kawy. 720p, bez poprawek.

Cztery kadry z moich testów Wan 3.0: dialog po polsku, neon ŻÓŁTA GĘŚ, ujęcie 30-sekundowe i nalewanie kawy. 720p, bez poprawek.

Wan 3.0 w liczbach

ParametrWan 3.0
ProducentAlibaba (Alibaba Cloud)
Ogłoszenie13 sierpnia 2026
Maksymalna długość30 sekund w jednym przebiegu
Rozdzielczość480p, 720p, 1080p
Wejścietekst, obrazy, dźwięk, wideo i dokumenty: PDF, DOC, XLS, PPT, TXT, MD, Keynote, Pages, Numbers - 1 plik do 100 MB i 50 stron
Dźwiękgenerowany razem z obrazem
Cena w Alibaba Cloud Model Studio0,05 / 0,10 / 0,20 USD za sekundę (480p / 720p / 1080p)
30 sekund w 1080p6 USD (~22,70 zł)
Otwarte waginie - tylko przez API
Ranking Artificial Analysis, tekst na wideo1. miejsce, 1335 Elo

Ta sama stawka obowiązuje na fal.ai, przez które robiłem testy. Jest tam też wariant Wan 3.0 Prime - szybszy, za 0,14 USD za sekundę w 720p. Przeliczenie na złote po kursie 3,78 zł.

Ranking: prowadzenie o włos

MiejsceModelProducentElo
1Wan 3.0Alibaba1335
2Gemini Omni FlashGoogle1332
3MiniMax H3MiniMax1302
4HappyHorse-1.0Alibaba (ATH)1286

Trzy punkty przewagi nad Gemini Omni Flash to w rankingu opartym na głosowaniach ludzi praktycznie remis. Ciekawostka: czwarty HappyHorse to też Alibaba, ale inna jednostka firmy (ATH) - dwa niezależne zespoły jednego koncernu w pierwszej czwórce.

Test 1: dialog po polsku

Polecenie opisywało kawiarnię w Warszawie w deszczowy wieczór i dwie kwestie po polsku: kobieta mówi „Nie wyjadę bez ciebie. Słyszysz? Nie wyjadę.”, mężczyzna odpowiada „Wiem.”.

Cztery klatki z 8-sekundowego klipu. Postacie, stolik, lampa i deszcz za oknem są spójne przez całe ujęcie.

Cztery klatki z 8-sekundowego klipu. Postacie, stolik, lampa i deszcz za oknem są spójne przez całe ujęcie.

Przepuściłem ścieżkę dźwiękową przez rozpoznawanie mowy Whisper. Wynik: „Nie wyjadę bez Ciebie, słyszysz? Nie wyjadę.” i „Wiem.” - słowo w słowo, język rozpoznany jako polski z pewnością 99%. Kwestie padają w kolejności z polecenia: pierwsza od 0 do 4 sekundy, druga w 5. sekundzie. To realna przewaga: w moich wcześniejszych pracach z Seedance polskie kwestie w ogóle nie wchodziły w grę.

Koszt: 0,80 USD. Czas generowania: 3 minuty 38 sekund.

Test 2: polski napis w kadrze

Nocna ulica starego miasta, czerwony neon z napisem „ŻÓŁTA GĘŚ” i kartka w oknie „Otwarte do północy”. Wszystkie polskie litery naraz: Ż, Ó, Ł, Ę, Ś.

Neon ŻÓŁTA GĘŚ z poprawnymi ogonkami - dwa razy, bo model sam dodał drugi neon w witrynie. Szyld nad oknem ma dopisane liczby, których nie było w poleceniu.

Neon ŻÓŁTA GĘŚ z poprawnymi ogonkami - dwa razy, bo model sam dodał drugi neon w witrynie. Szyld nad oknem ma dopisane liczby, których nie było w poleceniu.

Neon wyszedł bezbłędnie - wszystkie znaki diakrytyczne na miejscu, i to w dwóch miejscach, bo model sam dołożył drugi neon w witrynie. Dopisał też szyld „100 ŻÓŁTA 121 GĘŚ” - poprawna pisownia, ale liczby wziął znikąd.

Kartka w oknie, powiększona. Słowo Otwarte jest czytelne, dalsza część napisu już nie.

Kartka w oknie, powiększona. Słowo Otwarte jest czytelne, dalsza część napisu już nie.

Kartka pokazuje granicę: „Otwarte” jest czytelne, „do północy” - zniekształcone. Przy 720p i literach wysokości kilkunastu pikseli model nie utrzymał pisowni. Sama Alibaba przyznaje w ogłoszeniu, że dokładność tekstu w kadrze „wciąż się poprawia”. Wniosek praktyczny: duże napisy tak, drobny druk nie.

Test 3: fizyka i dłonie

Statyczne ujęcie z bliska: dłonie nalewają kawę ze szklanego dzbanka, strumień cienieje i się urywa, jedna dłoń podnosi filiżankę, druga wrzuca kostkę cukru.

Dziesięć klatek, co sekundę. Strumień urywa się około 6. sekundy, dłoń podnosi filiżankę, kostka cukru wpada w 9. sekundzie.

Dziesięć klatek, co sekundę. Strumień urywa się około 6. sekundy, dłoń podnosi filiżankę, kostka cukru wpada w 9. sekundzie.

Strumień kawy, jego urwanie, para i ruch dłoni wyglądają naturalnie, a kolejność zdarzeń zgadza się z poleceniem. W klatkach, które przejrzałem co sekundę, dłonie wyglądają poprawnie. Koszt: 1,00 USD, czas: 4 minuty.

Test 4: 30 sekund bez cięcia

Najtrudniejszy test: jedno ciągłe ujęcie z ręki, 30 sekund. Chłopak w żółtej kurtce przechodzi przez targ, mija stragany z jabłkami i rybami, kupuje chleb, płaci, kiwa głową i wychodzi na ulicę, gdzie przejeżdża tramwaj.

Dziesięć klatek co 3 sekundy z jednego 30-sekundowego ujęcia. Jabłka, ryby, zakup chleba, wyjście na ulicę i tramwaj - w kolejności z polecenia.

Dziesięć klatek co 3 sekundy z jednego 30-sekundowego ujęcia. Jabłka, ryby, zakup chleba, wyjście na ulicę i tramwaj - w kolejności z polecenia.

Wszystkie elementy są w kolejności z polecenia, a postać jest spójna przez całe 30 sekund - ta sama twarz, kurtka i chleb w dłoni. Detektor zmian sceny w ffmpeg zareagował tylko między 20. a 22. sekundą - obejrzałem te klatki co ćwierć sekundy i to szybka, płynna panorama za bohaterem, a nie cięcie. Jedyne odstępstwo: zamiast słonecznej ulicy jest pochmurno.

Ale ten klip ma drugą historię. Za pierwszym razem filtr treści fal.ai zablokował wynik z komunikatem, że materiał „został oznaczony przez system kontroli treści”. W scenie nie ma niczego poza targiem, chlebem i tramwajem. Druga próba z identycznym poleceniem przeszła. Filtr jest więc niedeterministyczny i daje fałszywe alarmy - a dowiadujesz się o tym po kilkunastu minutach czekania. Udana wersja generowała się 13 minut 35 sekund i kosztowała 3 USD.

Test 5: film z dokumentu

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

To funkcja, którą Alibaba stawia w centrum premiery: podajesz plik albo adres strony, a model robi z niego film. Sprawdziłem obie drogi.

PróbaWynik
Adres artykułu na promptowy.combłąd: „nie udało się odczytać strony” - po około 20 minutach
Adres hasła „Żubr” w polskiej Wikipediibłąd po stronie dostawcy
Adres PDF z Wikipedii bez rozszerzenia .pdf w adresieodrzucone od razu - adres musi kończyć się rozszerzeniem pliku
Ten sam PDF wgrany do magazynu fal.aidziała - 15 s wideo, 10,5 minuty generowania, 1,50 USD
Klatki z 15-sekundowego filmu zrobionego z PDF hasła Żubr z polskiej Wikipedii. Cztery ujęcia, w tym czarno-białe przy zdaniu o tym, że gatunek prawie wyginął.

Klatki z 15-sekundowego filmu zrobionego z PDF hasła Żubr z polskiej Wikipedii. Cztery ujęcia, w tym czarno-białe przy zdaniu o tym, że gatunek prawie wyginął.

Efekt z PDF jest najciekawszy z całego testu. Model sam zmontował cztery ujęcia (detektor ffmpeg znalazł trzy cięcia: w 2,8, 8,2 i 10,2 sekundzie): żubr w zbliżeniu, stado w brzozowym lesie, czarno-biały kadr stylizowany na archiwalny i matka z młodym. Dodał lektora: „Meet the European bison, Europe’s largest land mammal. Once nearly extinct, they now roam these primeval forests.” - fakty zgodne z hasłem. Lektor mówi po angielsku, bo po angielsku było moje polecenie, choć dokument był polski. To jest moja interpretacja: żeby dostać polskiego lektora, trzeba o niego poprosić wprost.

Wniosek: wideo z dokumentu działa, ale tylko z plikiem. Na adresach stron w moich próbach nie zadziałało ani razu - przynajmniej przez fal.ai.

Ile to wszystko kosztowało

KlipDługośćKosztCzas generowania
Dialog po polsku8 s0,80 USD3 min 38 s
Kawa10 s1,00 USD4 min 4 s
Neon8 s0,80 USD3 min 17 s
30 sekund bez cięcia30 s3,00 USD13 min 35 s
Film z PDF15 s1,50 USD10 min 27 s
Razem71 s7,10 USD (~26,80 zł)

Koszt według stawki 0,10 USD za sekundę wideo w 720p. Średnio generowanie trwało około 25 sekund na każdą sekundę wideo. Do pracy „na żywo” to za wolno, do produkcji reklam i materiałów w social mediach - do przyjęcia.

Dla kogo jest Wan 3.0

  • Dla twórców treści po polsku - dialog i duże napisy po polsku to rzadkość wśród modeli wideo. Opinia na podstawie jednego klipu z dialogiem.
  • Dla firm robiących filmy z materiałów - prezentacja albo PDF zamienione w krótki film to realna oszczędność czasu.
  • Nie dla niecierpliwych - 3-14 minut na klip i ryzyko fałszywego alarmu filtra.
  • Nie do drobnego tekstu - napisy na kartkach, cenach czy etykietach się rozsypią.

Więcej o cenach wideo z AI: ile kosztuje sekunda wideo z AI. Inne chińskie premiery tego miesiąca: test pięciu modeli językowych po polsku.

Najczęstsze pytania

Czy Wan 3.0 mówi po polsku?

Tak. W moim teście postacie wypowiedziały polskie kwestie słowo w słowo - rozpoznawanie mowy Whisper potwierdziło to z pewnością 99%.

Ile kosztuje Wan 3.0?

0,05 USD za sekundę w 480p, 0,10 USD w 720p i 0,20 USD w 1080p. Klip 30-sekundowy w 1080p kosztuje 6 USD.

Czy Wan 3.0 jest open source?

Nie. W przeciwieństwie do wcześniejszych wersji Wan nie ma otwartych wag - działa tylko przez API, m.in. w Alibaba Cloud Model Studio i na fal.ai.

Jak długie wideo robi Wan 3.0?

Do 30 sekund w jednym przebiegu. Mój 30-sekundowy klip był jednym ujęciem bez cięcia i generował się 13,5 minuty.

Czy Wan 3.0 zrobi film z PDF?

Tak - w moim teście zrobił 15-sekundowy film z lektorem z hasła Wikipedii w PDF. Adres musi kończyć się rozszerzeniem pliku. Z adresów stron internetowych nie udało mi się uzyskać filmu.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Data ogłoszenia, długość, rozdzielczości, obsługiwane dokumenty, limity plików, stawki i uwaga o tekście w kadrze - z ogłoszenia na blogu Alibaba Cloud. Stawki Wan 3.0 Prime i parametry wywołania - z dokumentacji modelu na fal.ai. Ranking tekst na wideo - z danych Artificial Analysis pobieranych przez Megaherc. Wszystko odczytane 24 września 2026. Wszystkie klipy wygenerowałem sam 24 września 2026 przez fal.ai w 720p, z włączonym dźwiękiem, po jednej udanej próbie na test. Transkrypcje z Whisper (model small). Obrazy w tekście to klatki z tych klipów bez retuszu; cięcia w klipach sprawdziłem filtrem scdet w ffmpeg i ręcznie, klatka po klatce. Przeliczenia na złote po kursie 3,78 zł.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Czy Wan 3.0 obsługuje język polski w dialogach i napisach?

Tak, Wan 3.0 poprawnie generuje polski dialog i duże napisy. Rozpoznawanie mowy Whisper potwierdziło zgodność kwestii dialogowych z poleceniem z pewnością 99%, a neon ŻÓŁTA GĘŚ wyświetlił wszystkie ogonki poprawnie. Drobny tekst, jak napisy na kartkach, jest jednak zniekształcony już przy literach wysokości kilkunastu pikseli.

Ile kosztuje generowanie wideo w Wan 3.0?

Cena wynosi 0,05 USD za sekundę w 480p, 0,10 USD w 720p i 0,20 USD w 1080p. Klip 30-sekundowy w 1080p kosztuje 6 USD, co odpowiada około 22,70 zł po kursie 3,78 zł. Te same stawki obowiązują na fal.ai, przez które przeprowadzono testy.

Czy Wan 3.0 potrafi zrobić film z pliku PDF?

Tak, funkcja działa przy wgraniu pliku bezpośrednio - w teście powstał 15-sekundowy film z lektorem na podstawie hasła o żubrze z polskiej Wikipedii w formacie PDF. Adres URL musi kończyć się rozszerzeniem pliku, a adresy zwykłych stron internetowych w obu próbach nie zadziałały. Generowanie 15-sekundowego klipu z PDF zajęło 10 minut 27 sekund i kosztowało 1,50 USD.

Jak długo trwa generowanie wideo w Wan 3.0?

Czas generowania wynosi od 3 do ponad 13 minut w zależności od długości klipu. Średnio model potrzebuje około 25 sekund na każdą sekundę gotowego wideo. Najdłużej trwało wygenerowanie 30-sekundowego ujęcia - 13 minut 35 sekund, przy czym pierwsza próba zakończyła się fałszywym alarmem filtra treści i wymagała ponowienia.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie