Przejdź do treści
Warsztat

Qwen-Image-2.1: przewodnik po modelu, który mieści się na jednej karcie

Obraz 2048×2048 w 44 sekundy na RTX 4090, komplet plików 16,6 GB. Wszystko, co sprawdziłem, w jednym miejscu.

4 min czytania

👁 116 przeczytań

// w skrócie
  • Qwen-Image-2.1 mieści się na jednej karcie GPU z 24 GB pamięci dzięki zaledwie 7 miliardom parametrów, zajmując 16,6 GB miejsca.
  • Na RTX 4090 obraz w rozdzielczości 2048×2048 powstaje w 44 sekundy, a model przy ładowaniu zajmuje 6920 MB pamięci karty.
  • Licencja Qwen Research zakazuje użycia komercyjnego - do produkcji zarobkowej wymagana jest osobna umowa z producentem.

Qwen-Image-2.1 wyszedł 20 września 2026 i jest pierwszym otwartym modelem obrazowym, który realnie zmienia rachunek: 7 miliardów parametrów, mieści się na jednej karcie z 24 GB pamięci, a w rankingu producenta wyprzedza modele czterokrotnie większe. Postawiłem go u siebie, zmierzyłem czasy i zebrałem wszystko w jednym miejscu.

Werdykt w jednym akapicie

Ten model warto postawić lokalnie i nie jest to opinia z broszury - sprawdziłem. Na RTX 4090 obraz 2048×2048 powstaje w 44 sekundy, komplet plików waży 16,6 GB i mieści się w pamięci karty bez przerzucania czegokolwiek na procesor. Napisy renderuje bezbłędnie, portrety wychodzą bez „plastikowego AI”, a przezroczystość działa naprawdę, nie na niby. Jest jedno „ale” i jest poważne: licencja zakazuje użycia komercyjnego. Do nauki, testów i własnych projektów - proszę bardzo. Do produkcji zarobkowej trzeba osobnej umowy z producentem.

Co znajdziesz w tym przewodniku

TematCo tam jest
Premiera i benchmarkiPełny ranking 29 modeli z wykresu producenta, z liczbami
Instalacja krok po krokuComfyUI na Windowsie, gotowy skrypt, trzy pułapki
Ile pamięci potrzebaTabela wariantów i co wejdzie na Twoją kartę
LicencjaDlaczego nie użyjesz go zarobkowo bez zgody
Przezroczyste PNGKanał alfa prosto z modelu, zmierzony
Ile to kosztujePół grosza za obraz lokalnie wobec 25 groszy po API
Polskie napisyPięć szyldów z ogonkami, sprawdzone znak po znaku
Plakaty w ośmiu stylachCo model potrafi w plakacie, a czego nie potrafi wcale
Wersje „bez cenzury”Dlaczego lokalnie nie ma czego zdejmować

Cztery rzeczy, które ten model wnosi

1. Jest mały i to jest cała pointa

Część generująca obraz ma 7 miliardów parametrów i 32 warstwy DiT w układzie jednostrumieniowym. Dla porównania: poprzednik z tej samej rodziny miał 20 miliardów, a Hunyuan Image 3.0 - osiemdziesiąt. W rankingu producenta Qwen-Image-2.1 dostaje 60,28 punktu, a ten osiemdziesięciomiliardowy - 50,81.

Producent tłumaczy to dwiema rzeczami: mieszanym poziomem ziarnistości uwagi (tekst dostaje maskę przyczynową na poziomie tokenów, obraz - na poziomie bloków) oraz ponownym wykorzystaniem pamięci podręcznej kluczy i wartości, dzięki czemu obrazy wejściowe i polecenie edycji liczone są raz i potem służą jako stały kontekst.

2. Przezroczystość wbudowana w model

To jest funkcja, której nie ma prawie nigdzie indziej: model sam decyduje na podstawie polecenia, czy zwrócić zwykły obraz, czy obraz z kanałem alfa. Sprawdziłem to pomiarem, nie na oko: przy poleceniu o przezroczystości 22,7 procent pikseli wyszło w pełni przezroczystych, a kanał alfa rozłożył się na pełnym zakresie od 0 do 255.

Model potrafi też wyciąć obiekt ze zwykłego zdjęcia i oddać go jako warstwę z przezroczystym tłem. Rozbieram to osobno, bo to najbardziej praktyczna nowość w tym wydaniu.

3. Do dziesięciu obrazów odniesienia

Producent pokazuje grupowe zdjęcie złożone z sześciu osobnych portretów, kompletną stylizację z pięciu wejść (modelka, ubranie, buty, torba, kapelusz) i wnętrze zbudowane z dziesięciu zdjęć mebli. Do tego edycja miejscowa wskazywana kółkiem, zamalowaniem albo osobną maską.

4. Napisy, które naprawdę się zgadzają

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

To sprawdziłem pierwszym testem. Poprosiłem o neon z napisem PROMPTOWY w rozdzielczości 2048×2048 - wyszedł bezbłędnie, litera w literę, z poprawnym odbiciem w mokrym betonie. W modelach obrazowych to wciąż rzadkość.

Moje pomiary na RTX 4090

Wszystko poniżej to czasy zmierzone u mnie, na wariancie int8, przy 25 krokach, próbniku euler i rozkładzie simple:

RozdzielczośćFormatCzas
1024×1024 (12 kroków)1:18,4 s
1536×15361:118 s
2048×20481:1, natywne 2K44 s
1792×24003:4 pionowe44-46 s
2752×153616:9 panoramiczne46 s

ComfyUI zameldował przy ładowaniu 6 920 MB na model i 644 MB na dekoder. Karta ma 24 564 MB, więc zapasu było sporo. Pełną rozpiskę pamięci zrobiłem osobno, razem z wariantami dla słabszych kart.

Obsługiwane proporcje

ProporcjaRozdzielczośćDo czego
1:12048 × 2048Kwadrat na społecznościówki
4:32400 × 1792Klasyczne poziome
3:41792 × 2400Portret, okładka pionowa
3:22528 × 1696Kadr fotograficzny
2:31696 × 2528Plakat
16:92752 × 1536Nagłówek, miniatura wideo
9:161536 × 2752Rolka, relacja

Czego ten model nie załatwi

  1. Nie użyjesz go zarobkowo. Licencja Qwen Research ogranicza użycie do badań i oceny. To nie jest drobiazg do przemilczenia - opisałem to osobno.
  2. Nie ma go na OpenRouterze. Sprawdziłem wszystkie 444 modele dostępne tam 22 września: obrazy zwraca jedenaście, wszystkie od Google i OpenAI. Żadnego Qwena.
  3. Wiek postaci potrafi odpłynąć. Poprosiłem o portret kobiety po trzydziestce, dostałem osobę wyraźnie starszą. Zdjęcie świetne technicznie, ale polecenie nie zostało dotrzymane.
  4. Potrzebujesz miejsca na dysku. Same pliki modelu to 16,6 GB w wariancie oszczędnym, a razem z ComfyUI i bibliotekami rezerwuj 30 GB.

Od czego zacząć

  1. Sprawdź, czy Twoja karta udźwignie model - tabela pamięci odpowiada w minutę.
  2. Przeczytaj warunki licencji, zanim zaplanujesz, do czego go użyjesz.
  3. Postaw go według instrukcji krok po kroku - jest tam gotowy skrypt i trzy pułapki, na których sam się przejechałem.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Opis architektury, funkcji i proporcji pochodzi z ogłoszenia producenta qwen.ai i z karty modelu Qwen/Qwen-Image-2.1, odczytanych 22 września 2026. Wyniki rankingu odczytałem z wykresu Qwen-Image-Bench opublikowanego przez producenta. Czasy generowania, zużycie pamięci i pomiar kanału alfa to moje własne pomiary na RTX 4090 z 24 GB, na wariancie int8 przez ComfyUI - nie pochodzą od producenta.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile pamięci GPU potrzeba do uruchomienia Qwen-Image-2.1?

Model mieści się na karcie z 24 GB pamięci bez przerzucania danych na procesor. Przy ładowaniu przez ComfyUI zajmuje 6920 MB na model i 644 MB na dekoder, a pełne pliki modelu w wariancie oszczędnym ważą 16,6 GB.

Czy Qwen-Image-2.1 można używać komercyjnie?

Nie - licencja Qwen Research ogranicza użycie wyłącznie do badań i oceny. Do zastosowań zarobkowych wymagana jest osobna umowa z producentem.

Jak Qwen-Image-2.1 wypada w porównaniu z większymi modelami obrazowymi?

W rankingu producenta Qwen-Image-2.1 dostaje 60,28 punktu, podczas gdy osiemdziesięciomiliardowy Hunyuan Image 3.0 uzyskuje 50,81 punktu. Model ma 7 miliardów parametrów wobec 80 miliardów konkurenta, czyli jest ponad czterokrotnie mniejszy, a osiąga lepszy wynik.

Czy Qwen-Image-2.1 generuje obrazy PNG z przezroczystością?

Tak - model sam rozpoznaje na podstawie polecenia, czy zwrócić obraz z kanałem alfa. W przeprowadzonym pomiarze 22,7 procent pikseli wyszło w pełni przezroczystych, a kanał alfa rozłożył się na pełnym zakresie od 0 do 255.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie