Przejdź do treści
Artykuły

Wan 2.2 lokalnie: wideo z AI na własnej karcie - czas, VRAM, próbki

Cztery klipy 5 s w 720p z Wan 2.2 5B na RTX 4090: ok. 4 minuty na klip, 2 grosze prądu. Co wychodzi dobrze, a gdzie model gubi fizykę.

5 min czytania
Wan 2.2 lokalnie: wideo z AI na własnej karcie - czas, VRAM, próbki

👁 115 przeczytań

Wan 2.2 to darmowy model wideo od Alibaby, który można uruchomić na własnym komputerze i używać komercyjnie. 26 września 2026 roku wygenerowałem nim cztery 5-sekundowe klipy 720p na karcie RTX 4090, w ComfyUI, w najmniejszej wersji TI2V 5B. Jeden klip zajmował karcie około 4 minut. Poniżej wszystkie cztery klipy bez poprawek, z czasem, zużyciem pamięci i błędami, które widać gołym okiem.

W skrócie

Wan 2.2 5B robi przyzwoite 5-sekundowe ujęcia 1280×704 w około 4 minuty i praktycznie za darmo (około 2 grosze prądu za klip). Najlepiej wychodzą statyczne ujęcia z nastrojem: deszczowa ulica, pejzaż, prosta animacja 2D. Model gubi się w fizyce i szczegółach. Kawa w filiżance prześwitywała przez porcelanę, a lama zamiast odwrócić głowę zaczęła się paść. Do szkiców, tła i materiałów roboczych jest w porządku. Do reklamy klienta weź płatny generator, np. Wan 3.0 w chmurze.

~4 minna klip 5 s 1280x704, model wczytany
~20 GBpamięci karty w szczycie
18,1 GBpliki: model, koder tekstu, VAE
Apache 2.0wolno użyć komercyjnie

Co to jest Wan 2.2 i która wersja działa w domu

Wan 2.2 to rodzina otwartych modeli wideo zespołu Wan-AI z Alibaby, udostępniona na licencji Apache 2.0. Większe warianty (14 mld parametrów) potrzebują znacznie więcej pamięci niż ma typowa karta dla graczy. Wersja TI2V 5B ma 5 mld parametrów i robi wideo zarówno z tekstu, jak i z obrazka startowego. Ją da się uruchomić na jednej karcie dla graczy. Użyłem gotowych plików przygotowanych przez zespół ComfyUI:

  • model wan2.2_ti2v_5B_fp16.safetensors - 10,0 GB,
  • koder tekstu umt5_xxl_fp8_e4m3fn_scaled.safetensors - 6,7 GB,
  • VAE wan2.2_vae.safetensors - 1,4 GB.

Pliki trafiają do folderów models/diffusion_models, models/text_encoders i models/vae w ComfyUI. Jak postawić samo ComfyUI, opisuję w poradniku ComfyUI od zera.

Ustawienia i pomiary

Każdy klip: 1280×704, 121 klatek przy 24 kl./s (5,04 s), 20 kroków, CFG 5, sampler uni_pc, przesunięcie 8. To ustawienia z oficjalnego szablonu ComfyUI dla Wan 2.2 5B. Karta: RTX 4090 24 GB, Windows 11, ComfyUI 0.37.

KlipCzas generowaniaSzczyt pamięci kartyŚredni pobór mocy
Kawa (pierwszy, z wczytaniem modelu)574 s23,6 GB141 W
Tramwaj w deszczu (pierwszy w drugiej serii)592 s23,6 GB146 W
Lama na łące239 s23,9 GB312 W
Animacja 2D z kotem232 s23,4 GB319 W

Pierwszy klip w serii trwa ponad dwa razy dłużej, bo model wczytuje się z dysku do pamięci. Kolejne to około 4 minuty. Szczyt pamięci obejmuje około 3,4 GB zajętych wcześniej przez system i przeglądarkę, więc sam Wan potrzebował około 20 GB. Na kartach z 12-16 GB ComfyUI przeniesie część modelu do pamięci RAM. To działa, ale generowanie potrwa dłużej. Nie mierzyłem tego.

Klipy: co wyszło, a co nie

1. Kawa nalewana do filiżanki

Wan 2.2 5B, 5 s. Światło i para wyglądają dobrze, ale kawa prześwituje przez ściankę porcelanowej filiżanki, jakby była ze szkła.

2. Warszawski tramwaj w deszczu

Najlepszy klip w teście: mokry bruk, odbicia latarni, parasole i tramwaj wjeżdżający z głębi kadru. Statyczna kamera, o którą prosiło polecenie, pomaga modelowi.

3. Lama na górskiej łące

Anatomia i sierść bez zarzutu, ale lama zamiast odwrócić głowę i przeżuwać schyla się do trawy. Zieleń jest przesycona, a kamera nie „drży z ręki”, choć polecenie o to prosiło.

4. Animacja 2D: praca nocą i kot

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Płaska ilustracja w dwóch kolorach, kot przechodzi po biurku pod koniec klipu. Ruch postaci jest minimalny, ale styl trzyma się od pierwszej do ostatniej klatki.

Wzór jest wyraźny: im mniej ruchu i fizyki, tym lepiej. Ujęcia „ze statywu” z ruchem w tle (deszcz, tramwaj, liście) wychodzą przekonująco. Precyzyjne czynności, jak nalewanie płynu czy konkretny gest zwierzęcia, model upraszcza albo przekręca.

Wan 2.2 lokalnie czy generator w chmurze

Wan 2.2 5B lokalniePłatne generatory (Kling, Veo, Wan 3.0)
Koszt klipu 5 sok. 2 gr prądu (karta 315 W przez 4 min)od kilkudziesięciu groszy do kilku złotych
Czasok. 4 minzwykle 1-3 min w kolejce
Rozdzielczość1280×704, 24 kl./sdo 1080p i więcej
Dźwiękbrakw części modeli tak
Prywatnośćnic nie wychodzi z komputerapolecenia i obrazy idą na serwer
Cenzura i limitybrak limitów dziennychlimity kredytów i filtry treści

Ceny generatorów w chmurze zmieniają się co tydzień. Aktualne porównanie jest w hubie generatory wideo AI. To opinia redakcji: Wan 2.2 5B lokalnie opłaca się, gdy potrzebujesz dziesiątek ujęć roboczych, tła albo materiału do montażu, a nie jednego efektownego klipu.

Najczęstsze pytania

Jaka karta graficzna jest potrzebna do Wan 2.2?

W moim teście Wan 2.2 TI2V 5B zajął około 20 GB pamięci RTX 4090 przy wideo 1280×704. Na kartach z 12-16 GB działa wolniej, z częścią modelu w pamięci RAM. Większe warianty 14B wymagają dużo więcej pamięci.

Ile trwa wygenerowanie filmu w Wan 2.2?

Około 4 minut na 5-sekundowy klip 720p (121 klatek, 20 kroków) na RTX 4090, gdy model jest już wczytany. Pierwszy klip po starcie trwał 574 s, bo doszło wczytanie 18 GB plików z dysku.

Czy Wan 2.2 jest darmowy i czy można go używać komercyjnie?

Tak. Wagi są na Hugging Face na licencji Apache 2.0, która pozwala na użytek komercyjny. Płacisz tylko za prąd, około 2 groszy za klip.

Czy Wan 2.2 robi wideo z dźwiękiem?

Nie. Wersja 5B generuje sam obraz. Dźwięk trzeba dodać w montażu.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Test własny 26.09.2026: RTX 4090 24 GB, ComfyUI 0.37, pomiar nvidia-smi co 0,5 s. Model i licencja: Wan-AI/Wan2.2-TI2V-5B. Pliki dla ComfyUI: Comfy-Org/Wan_2.2_ComfyUI_Repackaged. Sprawdzone 26 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›