Jak zainstalować Qwen-Image-2.1 lokalnie na Windowsie - krok po kroku
Po instalacji obraz 1024×1024 powstaje w 8 sekund. Najgorsza pułapka: requirements.txt nadpisuje sterowaną kartę wersją procesorową.

👁 114 przeczytań
- Qwen-Image-2.1 instaluje się lokalnie na Windowsie w czterech poleceniach, ale wymaga pobrania 16,6 GB plików modelu w wariancie int8 i karty z co najmniej 16 GB pamięci.
- Największa pułapka instalacji to plik requirements.txt w ComfyUI, który nadpisuje wersję PyTorch z obsługą karty graficznej wersją procesorową - bez żadnego ostrzeżenia.
- Na RTX 4090 z 24 GB model generuje obraz 1024x1024 w 8 sekund, a 2048x2048 w 44 sekundy przy 25 krokach i ustawieniu cfg 1.0.
Postawiłem Qwen-Image-2.1 na Windowsie z kartą RTX 4090 i zmierzyłem każdy krok. Cała instalacja to cztery polecenia i 17 gigabajtów pobierania, ale po drodze są trzy pułapki, przez które model uruchomi się na procesorze albo nie uruchomi wcale. Na wszystkich trzech się przejechałem, więc opisuję je razem z obejściami.
Werdykt w jednym akapicie
Najkrótsza droga: ComfyUI plus trzy pliki modelu w wariancie int8 - razem 16,6 GB. Wchodzi w całości na kartę z 24 GB i nie wymaga przerzucania niczego na procesor. Po instalacji obraz 1024×1024 powstaje w 8 sekund, a 2048×2048 w 44. Najważniejsza pułapka: plik requirements.txt w ComfyUI zawiera samo torch, więc nadpisuje wersję z obsługą karty graficznej wersją procesorową. Kolejność instalacji ma tu znaczenie i nikt o tym nie uprzedza.
Czego potrzebujesz
| Element | Wymóg | U mnie |
|---|---|---|
| Karta graficzna | 16 GB pamięci wystarcza | RTX 4090, 24 564 MB |
| Python | 3.13 (nie 3.14) | 3.13.15 |
| Miejsce na dysku | 30 GB z zapasem | osobny dysk, nie systemowy |
| Pliki modelu | 16,6 GB w wariancie int8 | pobrane w 10 minut |
Uwaga o Pythonie: biblioteki z obsługą karty graficznej nie mają jeszcze wydań dla 3.14. Jeśli masz obie wersje, wymuś 3.13 przy tworzeniu środowiska.
Krok 1. ComfyUI
git clone --depth 1 https://github.com/comfyanonymous/ComfyUI.git D:ComfyUI
Wersja z 22 września 2026 obsługuje Qwen-Image-2.1 od razu, bez żadnych dodatków. Nie instaluj niczego spoza tej listy - wszystkie potrzebne węzły są wbudowane.
Krok 2. Środowisko i biblioteki - w tej kolejności
To jest miejsce, w którym instalacja najczęściej się psuje. Kolejność poniżej jest odwrotna do intuicyjnej i taka ma być:
cd D:ComfyUI
py -3.13 -m venv venv
venvScriptspython -m pip install -r requirements.txt
venvScriptspython -m pip install --force-reinstall torch torchvision --index-url https://download.pytorch.org/whl/cu132
Pułapka 1: requirements.txt zabija obsługę karty
W requirements.txt jest linijka torch - bez wersji i bez wskazania źródła. Jeśli zainstalujesz najpierw wersję z obsługą karty, a potem uruchomisz instalację wymagań, pip uzna, że pakiet trzeba pobrać ze zwykłego repozytorium i podmieni go na wersję procesorową. Nie zobaczysz żadnego ostrzeżenia.
Objaw: model działa, ale generuje obraz kilkadziesiąt razy wolniej. Sprawdzenie zajmuje pięć sekund:
venvScriptspython -c "import torch; print(torch.__version__, torch.cuda.is_available())"
Ma wypisać wersję z dopiskiem +cu i True. Jeśli widzisz +cpu i False - to właśnie ta pułapka. U mnie wyglądało to tak: 2.14.0+cpu, False zamiast 2.14.0+cu132, True.
Pułapka 2: torchaudio wywala całe polecenie
Wszystkie poradniki każą instalować trzy pakiety naraz: torch torchvision torchaudio. Na najnowszym kanale nie ma wydania torchaudio, więc pip przerywa całe polecenie komunikatem o braku pasującej dystrybucji - i nie instaluje też dwóch pozostałych, które akurat są.
ComfyUI nie potrzebuje torchaudio do generowania obrazów. Instaluj dwa pakiety, nie trzy.
Pułapka 3: numer kanału musi pasować
Adres z cu132 w mojej instrukcji to konkretna wersja zestawu narzędzi. Kanały się zmieniają - jeśli ten nie zadziała, sprawdź, które wydania są dostępne dla Twojej wersji Pythona pod adresem download.pytorch.org/whl/. U mnie cu134 jeszcze nie miał wydań dla Pythona 3.13, a cu132 miał.
Krok 3. Pliki modelu
Trzy pliki z repozytorium przygotowanego przez zespół ComfyUI. Każdy trafia do innego katalogu:
| Plik | Rozmiar | Katalog |
|---|---|---|
qwen_image_2.1_int8_convrot.safetensors | 6,76 GB | modelsdiffusion_models |
qwen3vl_8b_int8_convrot.safetensors | 8,71 GB | modelstext_encoders |
qwen_image_2.1_vae_bf16.safetensors | 0,63 GB | modelsvae |
Pobierasz je z repozytorium Comfy-Org/Qwen-Image-2.1 na Hugging Face. U mnie komplet zszedł w około dziesięć minut przy 31 MB na sekundę.
Dlaczego akurat int8: wersje pełnej precyzji ważą 14,2 GB i 17,5 GB, czyli razem 31,7 GB - to już nie wchodzi na kartę z 24 GB. Warianty int8 dają 16,6 GB i mieszczą się z zapasem. Pełną rozpiskę wariantów zrobiłem osobno.
Krok 4. Uruchomienie
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
venvScriptspython main.py
Interfejs czeka pod adresem http://127.0.0.1:8188. W bibliotece szablonów jest gotowy układ o nazwie Text to Image (Qwen Image 2.1) - wybierasz go, wpisujesz polecenie i gotowe.
Gotowy skrypt do generowania wsadowego
Klikanie w interfejsie jest dobre do pojedynczych obrazów. Do serii wygodniejszy jest skrypt rozmawiający z ComfyUI po jego własnym interfejsie programistycznym. Poniżej układ węzłów, który u mnie działa - odpowiada dokładnie szablonowi producenta:
| Węzeł | Ustawienie |
|---|---|
UNETLoader | plik int8, typ wagi: domyślny |
CLIPLoader | koder tekstu, typ: qwen_image |
TextEncodeQwenImage21 | polecenie i polecenie negatywne w jednym węźle |
EmptyLatentImage | szerokość, wysokość, partia 1 |
KSampler | 25 kroków, cfg 1.0, euler, simple, denoise 1.0 |
VAEDecode i SaveImage | dekodowanie i zapis |
Rzecz, która zaskakuje przy pisaniu własnego skryptu: węzeł kodujący tekst przyjmuje polecenie pozytywne i negatywne razem, a zwraca dwa osobne wyjścia - pozytywne i negatywne. Nie ma tu dwóch osobnych węzłów kodujących, jak w starszych układach. Drugie zaskoczenie: cfg ustawia się na 1.0, nie na typowe 7-8.
Moje czasy po instalacji
| Rozdzielczość | Kroki | Czas |
|---|---|---|
| 1024×1024 | 12 | 8,4 s |
| 1536×1536 | 25 | 18 s |
| 2048×2048 | 25 | 44 s |
| 2752×1536 | 25 | 46 s |
Pierwsze uruchomienie jest wolniejsze o kilka sekund, bo model się inicjalizuje. Przy 1024×1024 karta wyrabiała 4,8 kroku na sekundę.
Najczęstsze pytania
Czy Qwen-Image-2.1 działa na Windowsie?
Tak. Cała instalacja opisana wyżej to Windows 11 z kartą NVIDIA, bez warstwy linuksowej.
Ile pamięci karty potrzeba?
W wariancie int8 model zajmuje 16,6 GB, więc karta z 16 GB jest na granicy, a z 24 GB ma zapas. Warianty dla słabszych kart opisałem osobno.
Dlaczego generowanie jest bardzo wolne?
Najczęściej dlatego, że zainstalowana jest procesorowa wersja biblioteki. Sprawdź poleceniem z kroku drugiego - ma pokazać True.
Czy trzeba instalować dodatki do ComfyUI?
Nie. Wszystkie węzły potrzebne do tego modelu są wbudowane w wersję z września 2026.
Jakie ustawienia próbnika?
25 kroków, cfg 1.0, próbnik euler, rozkład simple. Tak wygląda oficjalny szablon i tak to u mnie działa.
Czy mogę używać wygenerowanych obrazów w pracy zarobkowej?
Nie bez osobnej zgody producenta - licencja ogranicza użycie do badań i oceny. Rozbieram to w osobnym tekście, bo to najczęściej pomijany element tej premiery.
Źródła i data sprawdzenia
Instalacja przeprowadzona i zmierzona 22 września 2026 na Windows 11 z RTX 4090 (24 564 MB), Python 3.13.15, ComfyUI w wersji z tego samego dnia. Pliki modelu z repozytorium Comfy-Org/Qwen-Image-2.1. Wszystkie czasy, rozmiary i opisane pułapki to moje własne pomiary i błędy, nie materiały producenta. Numery kanałów bibliotek zmieniają się co kilka tygodni - jeśli podany adres nie zadziała, sprawdź aktualną listę u źródła.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Jak zainstalować Qwen-Image-2.1 lokalnie na Windowsie?
Instalacja sprowadza się do sklonowania ComfyUI, utworzenia środowiska Python 3.13, zainstalowania bibliotek we właściwej kolejności i pobrania trzech plików modelu z repozytorium Comfy-Org/Qwen-Image-2.1 na Hugging Face. Kluczowe jest zainstalowanie torch z obsługą CUDA po uruchomieniu requirements.txt, nie przed, bo inaczej pip nadpisze wersję GPU wersją CPU.
Ile pamięci GPU potrzeba do uruchomienia Qwen-Image-2.1?
W wariancie int8 model zajmuje łącznie 16,6 GB, więc karta z 16 GB jest na granicy, a z 24 GB ma zapas. Warianty pełnej precyzji ważą razem 31,7 GB i nie mieszczą się na karcie z 24 GB.
Dlaczego Qwen-Image-2.1 w ComfyUI generuje obrazy bardzo wolno?
Najczęstszą przyczyną jest zainstalowanie procesorowej wersji biblioteki PyTorch zamiast wersji z obsługą CUDA. Sprawdzenie zajmuje pięć sekund - polecenie powinno zwrócić wersję z dopiskiem +cu132 i wartość True, a nie +cpu i False.
Czy do uruchomienia Qwen-Image-2.1 w ComfyUI trzeba instalować dodatkowe węzły?
Nie, wszystkie potrzebne węzły są wbudowane w wersję ComfyUI z 22 września 2026. W bibliotece szablonów dostępny jest gotowy układ o nazwie Text to Image (Qwen Image 2.1).
