Przejdź do treści
Warsztat

Jak zainstalować Qwen-Image-2.1 lokalnie na Windowsie - krok po kroku

Po instalacji obraz 1024×1024 powstaje w 8 sekund. Najgorsza pułapka: requirements.txt nadpisuje sterowaną kartę wersją procesorową.

5 min czytania

👁 114 przeczytań

// w skrócie
  • Qwen-Image-2.1 instaluje się lokalnie na Windowsie w czterech poleceniach, ale wymaga pobrania 16,6 GB plików modelu w wariancie int8 i karty z co najmniej 16 GB pamięci.
  • Największa pułapka instalacji to plik requirements.txt w ComfyUI, który nadpisuje wersję PyTorch z obsługą karty graficznej wersją procesorową - bez żadnego ostrzeżenia.
  • Na RTX 4090 z 24 GB model generuje obraz 1024x1024 w 8 sekund, a 2048x2048 w 44 sekundy przy 25 krokach i ustawieniu cfg 1.0.

Postawiłem Qwen-Image-2.1 na Windowsie z kartą RTX 4090 i zmierzyłem każdy krok. Cała instalacja to cztery polecenia i 17 gigabajtów pobierania, ale po drodze są trzy pułapki, przez które model uruchomi się na procesorze albo nie uruchomi wcale. Na wszystkich trzech się przejechałem, więc opisuję je razem z obejściami.

Werdykt w jednym akapicie

Najkrótsza droga: ComfyUI plus trzy pliki modelu w wariancie int8 - razem 16,6 GB. Wchodzi w całości na kartę z 24 GB i nie wymaga przerzucania niczego na procesor. Po instalacji obraz 1024×1024 powstaje w 8 sekund, a 2048×2048 w 44. Najważniejsza pułapka: plik requirements.txt w ComfyUI zawiera samo torch, więc nadpisuje wersję z obsługą karty graficznej wersją procesorową. Kolejność instalacji ma tu znaczenie i nikt o tym nie uprzedza.

Czego potrzebujesz

ElementWymógU mnie
Karta graficzna16 GB pamięci wystarczaRTX 4090, 24 564 MB
Python3.13 (nie 3.14)3.13.15
Miejsce na dysku30 GB z zapasemosobny dysk, nie systemowy
Pliki modelu16,6 GB w wariancie int8pobrane w 10 minut

Uwaga o Pythonie: biblioteki z obsługą karty graficznej nie mają jeszcze wydań dla 3.14. Jeśli masz obie wersje, wymuś 3.13 przy tworzeniu środowiska.

Krok 1. ComfyUI

git clone --depth 1 https://github.com/comfyanonymous/ComfyUI.git D:ComfyUI

Wersja z 22 września 2026 obsługuje Qwen-Image-2.1 od razu, bez żadnych dodatków. Nie instaluj niczego spoza tej listy - wszystkie potrzebne węzły są wbudowane.

Krok 2. Środowisko i biblioteki - w tej kolejności

To jest miejsce, w którym instalacja najczęściej się psuje. Kolejność poniżej jest odwrotna do intuicyjnej i taka ma być:

cd D:ComfyUI
py -3.13 -m venv venv
venvScriptspython -m pip install -r requirements.txt
venvScriptspython -m pip install --force-reinstall torch torchvision --index-url https://download.pytorch.org/whl/cu132

Pułapka 1: requirements.txt zabija obsługę karty

W requirements.txt jest linijka torch - bez wersji i bez wskazania źródła. Jeśli zainstalujesz najpierw wersję z obsługą karty, a potem uruchomisz instalację wymagań, pip uzna, że pakiet trzeba pobrać ze zwykłego repozytorium i podmieni go na wersję procesorową. Nie zobaczysz żadnego ostrzeżenia.

Objaw: model działa, ale generuje obraz kilkadziesiąt razy wolniej. Sprawdzenie zajmuje pięć sekund:

venvScriptspython -c "import torch; print(torch.__version__, torch.cuda.is_available())"

Ma wypisać wersję z dopiskiem +cu i True. Jeśli widzisz +cpu i False - to właśnie ta pułapka. U mnie wyglądało to tak: 2.14.0+cpu, False zamiast 2.14.0+cu132, True.

Pułapka 2: torchaudio wywala całe polecenie

Wszystkie poradniki każą instalować trzy pakiety naraz: torch torchvision torchaudio. Na najnowszym kanale nie ma wydania torchaudio, więc pip przerywa całe polecenie komunikatem o braku pasującej dystrybucji - i nie instaluje też dwóch pozostałych, które akurat są.

ComfyUI nie potrzebuje torchaudio do generowania obrazów. Instaluj dwa pakiety, nie trzy.

Pułapka 3: numer kanału musi pasować

Adres z cu132 w mojej instrukcji to konkretna wersja zestawu narzędzi. Kanały się zmieniają - jeśli ten nie zadziała, sprawdź, które wydania są dostępne dla Twojej wersji Pythona pod adresem download.pytorch.org/whl/. U mnie cu134 jeszcze nie miał wydań dla Pythona 3.13, a cu132 miał.

Krok 3. Pliki modelu

Trzy pliki z repozytorium przygotowanego przez zespół ComfyUI. Każdy trafia do innego katalogu:

PlikRozmiarKatalog
qwen_image_2.1_int8_convrot.safetensors6,76 GBmodelsdiffusion_models
qwen3vl_8b_int8_convrot.safetensors8,71 GBmodelstext_encoders
qwen_image_2.1_vae_bf16.safetensors0,63 GBmodelsvae

Pobierasz je z repozytorium Comfy-Org/Qwen-Image-2.1 na Hugging Face. U mnie komplet zszedł w około dziesięć minut przy 31 MB na sekundę.

Dlaczego akurat int8: wersje pełnej precyzji ważą 14,2 GB i 17,5 GB, czyli razem 31,7 GB - to już nie wchodzi na kartę z 24 GB. Warianty int8 dają 16,6 GB i mieszczą się z zapasem. Pełną rozpiskę wariantów zrobiłem osobno.

Krok 4. Uruchomienie

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

venvScriptspython main.py

Interfejs czeka pod adresem http://127.0.0.1:8188. W bibliotece szablonów jest gotowy układ o nazwie Text to Image (Qwen Image 2.1) - wybierasz go, wpisujesz polecenie i gotowe.

Gotowy skrypt do generowania wsadowego

Klikanie w interfejsie jest dobre do pojedynczych obrazów. Do serii wygodniejszy jest skrypt rozmawiający z ComfyUI po jego własnym interfejsie programistycznym. Poniżej układ węzłów, który u mnie działa - odpowiada dokładnie szablonowi producenta:

WęzełUstawienie
UNETLoaderplik int8, typ wagi: domyślny
CLIPLoaderkoder tekstu, typ: qwen_image
TextEncodeQwenImage21polecenie i polecenie negatywne w jednym węźle
EmptyLatentImageszerokość, wysokość, partia 1
KSampler25 kroków, cfg 1.0, euler, simple, denoise 1.0
VAEDecode i SaveImagedekodowanie i zapis

Rzecz, która zaskakuje przy pisaniu własnego skryptu: węzeł kodujący tekst przyjmuje polecenie pozytywne i negatywne razem, a zwraca dwa osobne wyjścia - pozytywne i negatywne. Nie ma tu dwóch osobnych węzłów kodujących, jak w starszych układach. Drugie zaskoczenie: cfg ustawia się na 1.0, nie na typowe 7-8.

Moje czasy po instalacji

RozdzielczośćKrokiCzas
1024×1024128,4 s
1536×15362518 s
2048×20482544 s
2752×15362546 s

Pierwsze uruchomienie jest wolniejsze o kilka sekund, bo model się inicjalizuje. Przy 1024×1024 karta wyrabiała 4,8 kroku na sekundę.

Najczęstsze pytania

Czy Qwen-Image-2.1 działa na Windowsie?

Tak. Cała instalacja opisana wyżej to Windows 11 z kartą NVIDIA, bez warstwy linuksowej.

Ile pamięci karty potrzeba?

W wariancie int8 model zajmuje 16,6 GB, więc karta z 16 GB jest na granicy, a z 24 GB ma zapas. Warianty dla słabszych kart opisałem osobno.

Dlaczego generowanie jest bardzo wolne?

Najczęściej dlatego, że zainstalowana jest procesorowa wersja biblioteki. Sprawdź poleceniem z kroku drugiego - ma pokazać True.

Czy trzeba instalować dodatki do ComfyUI?

Nie. Wszystkie węzły potrzebne do tego modelu są wbudowane w wersję z września 2026.

Jakie ustawienia próbnika?

25 kroków, cfg 1.0, próbnik euler, rozkład simple. Tak wygląda oficjalny szablon i tak to u mnie działa.

Czy mogę używać wygenerowanych obrazów w pracy zarobkowej?

Nie bez osobnej zgody producenta - licencja ogranicza użycie do badań i oceny. Rozbieram to w osobnym tekście, bo to najczęściej pomijany element tej premiery.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Instalacja przeprowadzona i zmierzona 22 września 2026 na Windows 11 z RTX 4090 (24 564 MB), Python 3.13.15, ComfyUI w wersji z tego samego dnia. Pliki modelu z repozytorium Comfy-Org/Qwen-Image-2.1. Wszystkie czasy, rozmiary i opisane pułapki to moje własne pomiary i błędy, nie materiały producenta. Numery kanałów bibliotek zmieniają się co kilka tygodni - jeśli podany adres nie zadziała, sprawdź aktualną listę u źródła.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Jak zainstalować Qwen-Image-2.1 lokalnie na Windowsie?

Instalacja sprowadza się do sklonowania ComfyUI, utworzenia środowiska Python 3.13, zainstalowania bibliotek we właściwej kolejności i pobrania trzech plików modelu z repozytorium Comfy-Org/Qwen-Image-2.1 na Hugging Face. Kluczowe jest zainstalowanie torch z obsługą CUDA po uruchomieniu requirements.txt, nie przed, bo inaczej pip nadpisze wersję GPU wersją CPU.

Ile pamięci GPU potrzeba do uruchomienia Qwen-Image-2.1?

W wariancie int8 model zajmuje łącznie 16,6 GB, więc karta z 16 GB jest na granicy, a z 24 GB ma zapas. Warianty pełnej precyzji ważą razem 31,7 GB i nie mieszczą się na karcie z 24 GB.

Dlaczego Qwen-Image-2.1 w ComfyUI generuje obrazy bardzo wolno?

Najczęstszą przyczyną jest zainstalowanie procesorowej wersji biblioteki PyTorch zamiast wersji z obsługą CUDA. Sprawdzenie zajmuje pięć sekund - polecenie powinno zwrócić wersję z dopiskiem +cu132 i wartość True, a nie +cpu i False.

Czy do uruchomienia Qwen-Image-2.1 w ComfyUI trzeba instalować dodatkowe węzły?

Nie, wszystkie potrzebne węzły są wbudowane w wersję ComfyUI z 22 września 2026. W bibliotece szablonów dostępny jest gotowy układ o nazwie Text to Image (Qwen Image 2.1).

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie