Qwen-Image-2.1: przewodnik po modelu, który mieści się na jednej karcie
Obraz 2048×2048 w 44 sekundy na RTX 4090, komplet plików 16,6 GB. Wszystko, co sprawdziłem, w jednym miejscu.

👁 116 przeczytań
- Qwen-Image-2.1 mieści się na jednej karcie GPU z 24 GB pamięci dzięki zaledwie 7 miliardom parametrów, zajmując 16,6 GB miejsca.
- Na RTX 4090 obraz w rozdzielczości 2048×2048 powstaje w 44 sekundy, a model przy ładowaniu zajmuje 6920 MB pamięci karty.
- Licencja Qwen Research zakazuje użycia komercyjnego - do produkcji zarobkowej wymagana jest osobna umowa z producentem.
Qwen-Image-2.1 wyszedł 20 września 2026 i jest pierwszym otwartym modelem obrazowym, który realnie zmienia rachunek: 7 miliardów parametrów, mieści się na jednej karcie z 24 GB pamięci, a w rankingu producenta wyprzedza modele czterokrotnie większe. Postawiłem go u siebie, zmierzyłem czasy i zebrałem wszystko w jednym miejscu.
Werdykt w jednym akapicie
Ten model warto postawić lokalnie i nie jest to opinia z broszury - sprawdziłem. Na RTX 4090 obraz 2048×2048 powstaje w 44 sekundy, komplet plików waży 16,6 GB i mieści się w pamięci karty bez przerzucania czegokolwiek na procesor. Napisy renderuje bezbłędnie, portrety wychodzą bez „plastikowego AI”, a przezroczystość działa naprawdę, nie na niby. Jest jedno „ale” i jest poważne: licencja zakazuje użycia komercyjnego. Do nauki, testów i własnych projektów - proszę bardzo. Do produkcji zarobkowej trzeba osobnej umowy z producentem.
Co znajdziesz w tym przewodniku
| Temat | Co tam jest |
|---|---|
| Premiera i benchmarki | Pełny ranking 29 modeli z wykresu producenta, z liczbami |
| Instalacja krok po kroku | ComfyUI na Windowsie, gotowy skrypt, trzy pułapki |
| Ile pamięci potrzeba | Tabela wariantów i co wejdzie na Twoją kartę |
| Licencja | Dlaczego nie użyjesz go zarobkowo bez zgody |
| Przezroczyste PNG | Kanał alfa prosto z modelu, zmierzony |
| Ile to kosztuje | Pół grosza za obraz lokalnie wobec 25 groszy po API |
| Polskie napisy | Pięć szyldów z ogonkami, sprawdzone znak po znaku |
| Plakaty w ośmiu stylach | Co model potrafi w plakacie, a czego nie potrafi wcale |
| Wersje „bez cenzury” | Dlaczego lokalnie nie ma czego zdejmować |
Cztery rzeczy, które ten model wnosi
1. Jest mały i to jest cała pointa
Część generująca obraz ma 7 miliardów parametrów i 32 warstwy DiT w układzie jednostrumieniowym. Dla porównania: poprzednik z tej samej rodziny miał 20 miliardów, a Hunyuan Image 3.0 - osiemdziesiąt. W rankingu producenta Qwen-Image-2.1 dostaje 60,28 punktu, a ten osiemdziesięciomiliardowy - 50,81.
Producent tłumaczy to dwiema rzeczami: mieszanym poziomem ziarnistości uwagi (tekst dostaje maskę przyczynową na poziomie tokenów, obraz - na poziomie bloków) oraz ponownym wykorzystaniem pamięci podręcznej kluczy i wartości, dzięki czemu obrazy wejściowe i polecenie edycji liczone są raz i potem służą jako stały kontekst.
2. Przezroczystość wbudowana w model
To jest funkcja, której nie ma prawie nigdzie indziej: model sam decyduje na podstawie polecenia, czy zwrócić zwykły obraz, czy obraz z kanałem alfa. Sprawdziłem to pomiarem, nie na oko: przy poleceniu o przezroczystości 22,7 procent pikseli wyszło w pełni przezroczystych, a kanał alfa rozłożył się na pełnym zakresie od 0 do 255.
Model potrafi też wyciąć obiekt ze zwykłego zdjęcia i oddać go jako warstwę z przezroczystym tłem. Rozbieram to osobno, bo to najbardziej praktyczna nowość w tym wydaniu.
3. Do dziesięciu obrazów odniesienia
Producent pokazuje grupowe zdjęcie złożone z sześciu osobnych portretów, kompletną stylizację z pięciu wejść (modelka, ubranie, buty, torba, kapelusz) i wnętrze zbudowane z dziesięciu zdjęć mebli. Do tego edycja miejscowa wskazywana kółkiem, zamalowaniem albo osobną maską.
4. Napisy, które naprawdę się zgadzają
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
To sprawdziłem pierwszym testem. Poprosiłem o neon z napisem PROMPTOWY w rozdzielczości 2048×2048 - wyszedł bezbłędnie, litera w literę, z poprawnym odbiciem w mokrym betonie. W modelach obrazowych to wciąż rzadkość.
Moje pomiary na RTX 4090
Wszystko poniżej to czasy zmierzone u mnie, na wariancie int8, przy 25 krokach, próbniku euler i rozkładzie simple:
| Rozdzielczość | Format | Czas |
|---|---|---|
| 1024×1024 (12 kroków) | 1:1 | 8,4 s |
| 1536×1536 | 1:1 | 18 s |
| 2048×2048 | 1:1, natywne 2K | 44 s |
| 1792×2400 | 3:4 pionowe | 44-46 s |
| 2752×1536 | 16:9 panoramiczne | 46 s |
ComfyUI zameldował przy ładowaniu 6 920 MB na model i 644 MB na dekoder. Karta ma 24 564 MB, więc zapasu było sporo. Pełną rozpiskę pamięci zrobiłem osobno, razem z wariantami dla słabszych kart.
Obsługiwane proporcje
| Proporcja | Rozdzielczość | Do czego |
|---|---|---|
| 1:1 | 2048 × 2048 | Kwadrat na społecznościówki |
| 4:3 | 2400 × 1792 | Klasyczne poziome |
| 3:4 | 1792 × 2400 | Portret, okładka pionowa |
| 3:2 | 2528 × 1696 | Kadr fotograficzny |
| 2:3 | 1696 × 2528 | Plakat |
| 16:9 | 2752 × 1536 | Nagłówek, miniatura wideo |
| 9:16 | 1536 × 2752 | Rolka, relacja |
Czego ten model nie załatwi
- Nie użyjesz go zarobkowo. Licencja Qwen Research ogranicza użycie do badań i oceny. To nie jest drobiazg do przemilczenia - opisałem to osobno.
- Nie ma go na OpenRouterze. Sprawdziłem wszystkie 444 modele dostępne tam 22 września: obrazy zwraca jedenaście, wszystkie od Google i OpenAI. Żadnego Qwena.
- Wiek postaci potrafi odpłynąć. Poprosiłem o portret kobiety po trzydziestce, dostałem osobę wyraźnie starszą. Zdjęcie świetne technicznie, ale polecenie nie zostało dotrzymane.
- Potrzebujesz miejsca na dysku. Same pliki modelu to 16,6 GB w wariancie oszczędnym, a razem z ComfyUI i bibliotekami rezerwuj 30 GB.
Od czego zacząć
- Sprawdź, czy Twoja karta udźwignie model - tabela pamięci odpowiada w minutę.
- Przeczytaj warunki licencji, zanim zaplanujesz, do czego go użyjesz.
- Postaw go według instrukcji krok po kroku - jest tam gotowy skrypt i trzy pułapki, na których sam się przejechałem.
Źródła i data sprawdzenia
Opis architektury, funkcji i proporcji pochodzi z ogłoszenia producenta qwen.ai i z karty modelu Qwen/Qwen-Image-2.1, odczytanych 22 września 2026. Wyniki rankingu odczytałem z wykresu Qwen-Image-Bench opublikowanego przez producenta. Czasy generowania, zużycie pamięci i pomiar kanału alfa to moje własne pomiary na RTX 4090 z 24 GB, na wariancie int8 przez ComfyUI - nie pochodzą od producenta.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Ile pamięci GPU potrzeba do uruchomienia Qwen-Image-2.1?
Model mieści się na karcie z 24 GB pamięci bez przerzucania danych na procesor. Przy ładowaniu przez ComfyUI zajmuje 6920 MB na model i 644 MB na dekoder, a pełne pliki modelu w wariancie oszczędnym ważą 16,6 GB.
Czy Qwen-Image-2.1 można używać komercyjnie?
Nie - licencja Qwen Research ogranicza użycie wyłącznie do badań i oceny. Do zastosowań zarobkowych wymagana jest osobna umowa z producentem.
Jak Qwen-Image-2.1 wypada w porównaniu z większymi modelami obrazowymi?
W rankingu producenta Qwen-Image-2.1 dostaje 60,28 punktu, podczas gdy osiemdziesięciomiliardowy Hunyuan Image 3.0 uzyskuje 50,81 punktu. Model ma 7 miliardów parametrów wobec 80 miliardów konkurenta, czyli jest ponad czterokrotnie mniejszy, a osiąga lepszy wynik.
Czy Qwen-Image-2.1 generuje obrazy PNG z przezroczystością?
Tak - model sam rozpoznaje na podstawie polecenia, czy zwrócić obraz z kanałem alfa. W przeprowadzonym pomiarze 22,7 procent pikseli wyszło w pełni przezroczystych, a kanał alfa rozłożył się na pełnym zakresie od 0 do 255.
