Z-Image Turbo lokalnie: test na 8 promptach i porównanie z Qwen-Image
16 obrazów z tych samych poleceń: Z-Image Turbo robi obraz w 4,2 s i wolno go używać komercyjnie. Oba modele pomyliły polskie litery.

👁 114 przeczytań
Z-Image Turbo to darmowy model do generowania obrazów od Alibaby, który działa na własnej karcie graficznej i można go używać komercyjnie. 26 września 2026 roku dałem mu na karcie RTX 4090 osiem tych samych poleceń co Qwen-Image 2.1, drugiemu popularnemu modelowi lokalnemu. Z-Image robił obraz 1344×768 w 4,2 sekundy, Qwen-Image w 6,5 sekundy. Poniżej wszystkie 16 obrazów bez poprawek, z tym, co się udało, i z tym, co nie wyszło.
W skrócie
Z-Image Turbo jest szybszy i ma licencję Apache 2.0, więc obrazy wolno sprzedawać i używać w reklamie. Qwen-Image 2.1 ma licencję badawczą, która zakazuje użytku komercyjnego. Jakość zdjęć jest podobna. Z-Image daje cieplejsze, bardziej „reklamowe” światło, a Qwen dokładniej trzyma się szczegółów polecenia. Oba modele pomyliły polskie litery w szyldzie. Z-Image dopisał też nazwę magazynu do ilustracji, w której napisów miało nie być. Potrzebujesz karty z 12-16 GB pamięci albo cierpliwości przy mniejszej.
Jak wyglądał test
Oba modele uruchomiłem w ComfyUI 0.37 na karcie RTX 4090 z 24 GB pamięci, pod Windowsem 11. Dostały te same osiem poleceń po angielsku, tę samą rozdzielczość 1344×768 i to samo ziarno losowania. Z-Image pracował w 9 krokach z ustawieniami z oficjalnego szablonu ComfyUI, a Qwen-Image 2.1 w 25 krokach. Polecenia były dobrane tak, żeby sprawdzić różne rzeczy: reportaż, zdjęcie produktu, polski napis, ilustrację, pejzaż, wnętrze z PRL-u, portret z dłońmi i zdjęcie jedzenia. Obrazy pokazuję bez retuszu i bez losowania kolejnych wersji.
| Z-Image Turbo | Qwen-Image 2.1 | |
|---|---|---|
| Czas obrazu 1344×768 (model już wczytany) | 4,0-4,5 s | 6,5 s |
| Pierwszy obraz po starcie (wczytanie z dysku) | 434 s | 391 s |
| Pamięć karty zajęta przez ComfyUI | do 18,2 GB | do 16,0 GB |
| Średni pobór mocy karty przy generowaniu | 350 W | 370 W |
| Pliki (model, koder tekstu, VAE) | 20,7 GB | 17,3 GB |
| Licencja | Apache 2.0, komercyjnie tak | Qwen Research, komercyjnie nie |
Pierwsze uruchomienie trwało ponad 6 minut, bo w tym czasie ten sam dysk pobierał kilkadziesiąt gigabajtów innych modeli. Na wolnym dysku NVMe wczytanie zajmuje zwykle kilkadziesiąt sekund. Pamięć karty w tabeli to górna granica: ComfyUI trzyma na karcie wszystko, co się zmieści, a na mniejszej karcie przenosi część modelu do pamięci RAM i działa wolniej.
Galeria: te same polecenia, dwa modele
1. Reportaż: sprzedawczyni na targu


2. Zdjęcie produktu: ceramiczny kubek


3. Polski napis: szyld „PIEKARNIA ŻÓŁĆ”


To najważniejsza lekcja z testu: żaden z dwóch lokalnych modeli nie napisał poprawnie słowa z czterema polskimi znakami. Angielski napis wyszedł obu bez zarzutu. Jeśli potrzebujesz polskiego tekstu na grafice, dodaj go później w edytorze. Więcej prób z ogonkami opisałem w teście polskich napisów w Qwen-Image 2.1.
4. Ilustracja w stylu magazynu


Wzmianka o stylu konkretnego magazynu wystarczyła, żeby Z-Image dorysował jego winietę. Bezpieczniej opisywać styl słowami („płaska ilustracja, ograniczona paleta, grube kontury”) niż nazwą tytułu.
5. Pejzaż: Morskie Oko o świcie
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.


6. Kuchnia z lat 80.


7. Portret z dłońmi


8. Zdjęcie jedzenia: pierogi


Który wybrać
Jeśli obrazy mają trafić do sklepu, reklamy albo na okładkę, wybór jest prosty: Z-Image Turbo, bo pozwala na to licencja Apache 2.0. Qwen-Image 2.1 jest w tym teście wierniejszy poleceniom i lepiej zna polskie realia, ale jego licencja Qwen Research zakazuje użytku komercyjnego. Pisałem o tym w tekście o Qwen-Image 2.1. To opinia redakcji: do prywatnych projektów i szkiców warto mieć oba, bo różnią się tam, gdzie jeden zawodzi.
Wymagania są wyższe, niż sugeruje sam rozmiar modelu (6,2 mld parametrów). Pliki w wersji bf16 zajmują 20,7 GB, a w teście ComfyUI zajął do 18 GB pamięci karty. Na kartach z 12-16 GB ComfyUI przeniesie część do RAM-u i obraz powstanie w kilkanaście, a nie w 4 sekundy. Na karcie z 8 GB warto szukać wersji skwantyzowanych (fp8 albo GGUF), które zajmują mniej kosztem jakości.
Ile kosztuje obraz z własnej karty
Karta pobierała średnio 350 W przez 4,2 sekundy, czyli około 0,0004 kWh na obraz. Przy cenie prądu 1,05 zł za kWh (taryfa G11 z dystrybucją, wrzesień 2026) to 0,04 grosza za obraz, czyli tysiąc obrazów za około 43 grosze. Liczę tylko samą kartę, bez reszty komputera i bez kosztu jej zakupu. Pełny rachunek, także dla modeli tekstowych, jest w tekście lokalny model czy API.
Najczęstsze pytania
Czy Z-Image Turbo jest darmowy?
Tak. Wagi modelu są udostępnione na Hugging Face na licencji Apache 2.0, która pozwala na użytek komercyjny. Płacisz tylko za prąd i sprzęt.
Jaka karta graficzna jest potrzebna do Z-Image Turbo?
W moim teście wersja bf16 zajęła do 18 GB pamięci karty RTX 4090. Na kartach z 12-16 GB zadziała wolniej, z częścią modelu w pamięci RAM. Na 8 GB potrzebna jest wersja skwantyzowana.
Czy Z-Image Turbo pisze po polsku?
Polecenie po angielsku rozumie dobrze, ale polskie znaki na grafice mu nie wychodzą. W moim teście napisał „ŽÓŁČ” zamiast „ŻÓŁĆ”. Polski tekst lepiej dodać później w edytorze grafiki.
Z-Image Turbo czy Qwen-Image 2.1?
Z-Image jest o jedną trzecią szybszy i można go używać komercyjnie. Qwen-Image w tym teście dokładniej trzymał się poleceń i lepiej oddawał polskie realia, ale jego licencja zakazuje użytku komercyjnego.
Źródła i data sprawdzenia
Test własny: RTX 4090 24 GB, Windows 11, ComfyUI 0.37, 1344×768, ziarno 20260926, Z-Image Turbo bf16 (9 kroków, res_multistep), Qwen-Image 2.1 int8 (25 kroków). Licencje i parametry: Z-Image-Turbo na Hugging Face, Qwen-Image-2.1 na Hugging Face. Pliki dla ComfyUI: Comfy-Org/z_image_turbo. Ceny prądu: rankomat.pl, elektryka.edu.pl. Sprawdzone 26 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
