Przejdź do treści
Warsztat

Ile pamięci karty potrzebuje Qwen-Image-2.1? Tabela wszystkich wariantów

Koder tekstu jest większy od samego modelu obrazowego. To na nim się oszczędza, nie na generatorze.

4 min czytania

👁 114 przeczytań

// w skrócie
  • Wariant int8 modelu Qwen-Image-2.1 zajmuje łącznie 16,6 GB, co mieści się na karcie 24 GB z zapasem, a na 16 GB jest na granicy.
  • Koder tekstu w pełnej precyzji waży 17,5 GB i jest większy od samego modelu obrazowego (14,2 GB), bo to osobny model o 8 miliardach parametrów.
  • Na kartach z 12 GB i mniej można przenieść koder tekstu na procesor - zestaw na karcie spada wtedy do 7,9 GB, ale każde nowe polecenie trwa kilka sekund dłużej.

Qwen-Image-2.1 występuje w kilku wariantach precyzji, a różnica między najcięższym a najlżejszym zestawem to 31,7 GB wobec 13,6 GB. Od tego, który wybierzesz, zależy, czy model w ogóle wejdzie na Twoją kartę. Zebrałem wszystkie pliki z rozmiarami i policzyłem, co się gdzie mieści.

Werdykt w jednym akapicie

Na karcie z 24 GB bierz wariant int8: 16,6 GB i zapas na resztę. Zmierzyłem u siebie - ComfyUI melduje 6 920 MB na model obrazowy i 644 MB na dekoder, więc miejsca zostaje sporo. Na karcie z 16 GB zejdź z koderem tekstu do wariantu czterobitowego, co daje 13,6 GB. Na 12 GB i mniej trzeba przerzucić koder tekstu do pamięci komputera - model wtedy zadziała, ale każde nowe polecenie kosztuje kilka sekund więcej. Pełna precyzja to 31,7 GB i nie wejdzie na żadną kartę konsumencką.

Wszystkie pliki z rozmiarami

Model generujący obraz

PlikPrecyzjaRozmiar
qwen_image_2.1_bf16pełna14,2 GB
qwen_image_2.1_int8_convrotośmiobitowa7,26 GB

Koder tekstu - to on decyduje o rachunku za pamięć

PlikPrecyzjaRozmiar
qwen3vl_8b_bf16pełna17,5 GB
qwen3vl_8b_int8_convrotośmiobitowa9,35 GB
qwen3vl_8b_w4a8czterobitowa6,31 GB

To jest rzecz, którą warto zauważyć: w pełnej precyzji koder tekstu jest większy od samego modelu obrazowego - 17,5 GB wobec 14,2 GB. Model obrazowy ma 7 miliardów parametrów, a koder to osobny model wielomodalny o ośmiu miliardach.

Dekoder i warianty z ulepszaczem poleceń

PlikRozmiarPo co
qwen_image_2.1_vae_bf16676 MBObowiązkowy, jeden wariant
qwen3.5_9b_...pe_t2i.int89,47 GBUlepszacz poleceń, tekst na obraz
qwen3.5_9b_...pe_i2i.int89,47 GBUlepszacz poleceń, obraz na obraz

Dwa ostatnie to wariant dziewięciomiliardowy przepisujący Twoje polecenie na bogatsze. Nie są konieczne - u mnie model działa bez nich i wszystkie zmierzone czasy dotyczą zestawu bez ulepszacza.

Co wejdzie na Twoją kartę

ZestawRazemKarta
Pełna precyzja31,7 GBPoza zasięgiem kart konsumenckich
Model pełny + koder int824,2 GBNa granicy nawet przy 24 GB
Oba int816,6 GB24 GB z zapasem, 16 GB na styk
Model int8 + koder czterobitowy13,6 GB16 GB z zapasem
Model int8, koder na procesorze7,9 GB8-12 GB

Rozmiary plików to nie to samo co zużycie pamięci w trakcie pracy - dochodzą jeszcze dane pośrednie, rosnące z rozdzielczością. Do każdego wiersza doliczaj około 2 GB zapasu przy pracy w 2K.

Moje pomiary na RTX 4090

Karta ma 24 564 MB. Wariant int8, 25 kroków, próbnik euler:

  • ComfyUI zameldował 6 920 MB przygotowane na model obrazowy i 644 MB na dekoder.
  • Obraz 2048×2048 - 44 sekundy. 2752×1536 - 46 sekund. 1024×1024 przy 12 krokach - 8,4 sekundy, czyli 4,8 kroku na sekundę.
  • Przy żadnej rozdzielczości nie było przerzucania danych między kartą a pamięcią komputera.

Sztuczka dla słabszych kart: koder tekstu na procesor

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Koder tekstu wykonuje swoją pracę raz na polecenie, a potem stoi bezczynnie przez wszystkie kroki generowania. To najlepszy kandydat do przeniesienia poza kartę.

W ComfyUI węzeł ładujący koder ma ustawienie urządzenia - przestawiasz je z domyślnego na procesor. Zyskujesz od 6,31 do 17,5 GB pamięci karty zależnie od wariantu, a tracisz kilka sekund na każde nowe polecenie.

Kiedy to się opłaca: gdy generujesz wiele obrazów z tego samego polecenia - koder liczy raz, a Ty dostajesz całą pamięć karty na generowanie. Kiedy nie: gdy przy każdym obrazie zmieniasz opis.

Trzy zasady doboru wariantu

  1. Zaczynaj od int8. Różnica jakości wobec pełnej precyzji jest przy większości zastosowań niewidoczna, a pamięci zajmuje o połowę mniej.
  2. Oszczędzaj na koderze, nie na modelu obrazowym. To koder jest większy, a jego udział w wyglądzie obrazu jest pośredni.
  3. Nie mieszaj pełnej precyzji z int8 na karcie 24 GB. Zestaw 24,2 GB jest teoretycznie w zasięgu, ale w praktyce zabraknie miejsca na dane pośrednie przy 2K.

Jak to wszystko poskładać w działającą instalację, opisałem w osobnej instrukcji - razem z pułapką, przez którą model uruchamia się na procesorze mimo dobrej karty.

Najczęstsze pytania

Ile VRAM potrzebuje Qwen-Image-2.1?

16,6 GB w wariancie int8 na komplet plików. Karta z 24 GB ma zapas, z 16 GB jest na granicy, poniżej trzeba przenieść koder tekstu na procesor.

Czy zadziała na karcie z 12 GB?

Tak, z koderem tekstu na procesorze - na karcie zostaje wtedy 7,9 GB plików. Każde nowe polecenie kosztuje kilka sekund więcej.

Czy wariant int8 psuje jakość?

W moich testach nie zauważyłem różnic przy typowych zastosowaniach, ale nie porównywałem obu wariantów na tym samym ziarnie - to jest obserwacja, nie pomiar.

Po co są pliki z ulepszaczem poleceń?

Przepisują Twoje polecenie na bogatsze przed podaniem go modelowi. Nie są konieczne, model działa bez nich.

Dlaczego koder tekstu jest większy od modelu obrazowego?

Bo to osobny model wielomodalny o ośmiu miliardach parametrów, a część generująca obraz ma siedem miliardów i prostszą budowę.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Rozmiary plików odczytane 22 września 2026 z repozytorium Comfy-Org/Qwen-Image-2.1. Zużycie pamięci, czasy generowania i obserwacje o przerzucaniu danych to moje pomiary na RTX 4090 z 24 564 MB. Sumy w tabeli zestawów to proste dodawanie rozmiarów plików i nie uwzględniają danych pośrednich w trakcie pracy.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile pamięci karty graficznej potrzebuje Qwen-Image-2.1 w wariancie int8?

Wariant int8 zajmuje łącznie 16,6 GB pamięci karty. Składa się na to 7,26 GB dla modelu obrazowego i 9,35 GB dla kodera tekstu, plus około 2 GB zapasu na dane pośrednie przy pracy w 2K.

Czy Qwen-Image-2.1 zadziała na karcie z 12 GB VRAM?

Tak, ale tylko po przeniesieniu kodera tekstu na procesor - wtedy na karcie zostają pliki zajmujące 7,9 GB. Każde nowe polecenie kosztuje kilka sekund więcej, bo koder liczy poza kartą.

Ile wynosi pełny rozmiar plików Qwen-Image-2.1 w pełnej precyzji?

Pełna precyzja to łącznie 31,7 GB i nie mieści się na żadnej karcie konsumenckiej. Model obrazowy waży 14,2 GB, a koder tekstu 17,5 GB.

Do czego służą pliki z ulepszaczem poleceń w Qwen-Image-2.1?

Pliki qwen3.5_9b pe_t2i.int8 i pe_i2i.int8 (każdy po 9,47 GB) przepisują polecenie użytkownika na bogatsze przed podaniem go modelowi. Nie są konieczne - model działa bez nich, a wszystkie czasy generowania podane w artykule dotyczą zestawu bez ulepszacza.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie