Qwen-Image-2.1 najlepszym otwartym modelem obrazowym w rankingu Artificial Analysis
1034 Elo w tekście na obraz, 1074 w edycji, 18. miejsce ogółem na obu tablicach. AA musiało postawić model u siebie, bo nikt nie oferował go przez API.

👁 121 przeczytań
Qwen-Image-2.1 jest od 2 października 2026 najlepszym modelem z otwartymi wagami na obu tablicach obrazowych Artificial Analysis. W tekście na obraz ma 1034 punkty Elo i 18. miejsce ogółem, w edycji obrazów 1074 punkty i również 18. miejsce. Wyprzedza FLUX.2 [dev], Ideogram 4.0 i HunyuanImage 3.0, choć do zamkniętych liderów od OpenAI i Google wciąż mu sporo brakuje.
Artificial Analysis (AA) ogłosiło wynik we wpisie na X. Model wyszedł 20 września, więc na pełną ocenę trzeba było poczekać niecałe dwa tygodnie. Sprawdziłem obie tablice i zestawiłem liczby z tym, co sam zmierzyłem na swojej karcie.
Co dokładnie zrobiło Artificial Analysis
AA prowadzi rankingi oparte na ślepych pojedynkach. Głosujący widzi dwa obrazy z tego samego polecenia, nie wie, który model je zrobił, i wybiera lepszy. Z tysięcy głosów liczony jest wynik Elo. Punktem odniesienia skali jest FLUX.2 [dev] z wynikiem 1000.
Przy Qwen-Image-2.1 był jeden kłopot: w dniu testu żaden duży dostawca API nie oferował tego modelu. AA postawiło go więc u siebie, na własnym sprzęcie, korzystając z otwartych wag. Z tego powodu przy modelu widnieje dopisek „No API available” i nie ma ceny za 1000 obrazów, którą AA podaje przy modelach dostępnych przez API.
Wynik w liczbach:
- Tekst na obraz (AA-Image-T2I v2.0): 1034 punkty, ±10, z 5286 głosów, 18. miejsce ogółem, 1. wśród otwartych.
- Edycja obrazów (AA-Image-Editing v2.0): 1074 punkty, przedział 95-procentowy 1065-1083, 18. miejsce ogółem, 1. wśród otwartych.
Paski liczone są od 900 punktów. Przewaga nad drugim miejscem to 23 punkty, wyraźnie więcej niż margines błędu ±10. Za Qwenem stłoczyła się cała grupa modeli w przedziale 995-1011, więc o drugie miejsce wśród otwartych toczy się wyrównana walka, o pierwsze - nie.
W edycji drugi jest HunyuanImage 3.0 Instruct z wynikiem 1066, trzeci starszy Qwen Image Edit Plus 2511 z wynikiem 1021.
Kto jest wyżej
Żeby nie przesadzić z zachwytem: 18. miejsce oznacza, że 17 modeli jest lepiej ocenianych. W tekście na obraz prowadzą:
- GPT Image 2.5 Sunburst (max) - 1197 punktów,
- GPT Image 2.5 Flare (max) - 1190,
- GPT Image 2 (high) - 1172,
- Grok Imagine Image 2.0 - 1155,
- MAI-Image-2.6 - 1150.
Między nimi a Qwenem są jeszcze płatne modele tej samej firmy: Qwen-Image-3.0-Pro (1089) i Qwen-Image-3.0 (1075), dostępne tylko przez API. W edycji sytuacja jest ciekawsza - otwarty 2.1 z wynikiem 1074 wyprzedza zwykłe Qwen-Image-3.0 (1055) i niemal dorównuje wersji Pro (1076).
Skok względem Qwen Image 2.0
Poprzednia wersja z marca 2026 wypadała w AA przeciętnie. Różnica w półrocze:
- Tekst na obraz: z 72. miejsca (961 punktów) na 18. (1034).
- Edycja: z 58. miejsca na 18.
Ten sam producent, pół roku różnicy i zupełnie inna liga. Dla przypomnienia: część generująca Qwen-Image-2.1 ma 7 miliardów parametrów, jeden model obsługuje i generowanie, i edycję, a obraz powstaje natywnie w 2K, także z przezroczystym tłem.
LMArena potwierdza, ale w innej skali
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
AA przytoczyło też wyniki z LMArena, drugiego popularnego rankingu opartego na głosowaniu. Tam skala punktów jest inna, więc liczb nie da się porównać wprost z AA:
- Image Edit Arena: 1367 punktów, 16. miejsce ogółem, 1. wśród otwartych.
- Text-to-Image Arena: 1228 punktów, 17. miejsce ogółem, 1. wśród otwartych.
Dwa niezależne rankingi, dwa różne zestawy głosujących i ten sam wniosek: na dziś nie ma lepiej ocenianego otwartego modelu do obrazów.
Co to znaczy w praktyce
Najpierw to, co dobre. Model, który zajmuje 18. miejsce w świecie, uruchomiłem na zwykłej karcie RTX 4090 z 24 GB. Wariant int8 waży 16,6 GB, obraz 2048×2048 powstaje w 44 sekundy, a prąd na jeden obraz 2K kosztuje mnie około 0,7 grosza. Zamknięte modele z czołówki są dostępne tylko przez API.
Teraz to, czego ranking nie mówi. AA mierzy, który obraz ludzie uznają za lepszy. Nie mierzy, czy polski napis jest bez błędów ani czy obiekty stoją tam, gdzie kazałem. Sprawdziłem to sam:
- Polskie napisy: 6 z 13 ciągów poprawnie, podczas gdy najlepsze modele zamknięte mają 13 na 13, a Ideogram 4.5 - 11 na 13.
- Układ opisany słowami: 2 z 16 obiektów na swoim miejscu, średnie IoU 0,17. FLUX 3 z ramkami w JSON trafił 16 na 16.
- Drobny tekst w 4K: czytelne 2 z 8 małych szyldów przy maksymalnej rozdzielczości 2752×1536.
Głosującym podobają się obrazy Qwena, ale jeśli robisz grafikę z polskim tekstem albo z precyzyjną kompozycją, ranking wprowadzi Cię w błąd. Pełne wyniki są w tekście Qwen-Image-2.1 kontra zamknięte modele.
Warto też pamiętać, że przy premierze Alibaba twierdziła, że model bije Nano Banana 2. Niezależny pomiar AA tego nie potwierdza: Nano Banana 2 ma 1125 punktów w tekście na obraz i 1108 w edycji.
Haczyk: licencja
Otwarte wagi to nie otwarta licencja. Qwen-Image-2.1 jest wydany na Qwen Research License Agreement, która dopuszcza wyłącznie cele niekomercyjne, badania i ocenę. Do użycia zarobkowego potrzebna jest osobna licencja komercyjna od Alibaby. To wyróżnia go na tle części konkurentów z tej samej tablicy - Qwen-Image-2512 jest na Apache 2.0, a Ming-Image-0.1-Design na MIT. Porównanie licencji wszystkich otwartych modeli zebrałem w rankingu otwartych modeli do obrazów, a warunki samego Qwena w osobnym tekście.
Czyli: jeśli chcesz lokalnie generować obrazy do nauki, testów i prywatnych projektów, to dziś najlepszy wybór. Jeśli chcesz na nich zarabiać, ten ranking niewiele zmienia, dopóki nie podpiszesz umowy z Alibabą.
Jak postawić model u siebie, opisałem w instrukcji instalacji w ComfyUI na Windowsie, a ile pamięci potrzeba na słabszych kartach - w tekście o VRAM.
Źródła i data sprawdzenia
- Artificial Analysis - tablica tekst na obraz (stan z 2 października 2026)
- Artificial Analysis - tablica edycji obrazów (stan z 2 października 2026)
- Wpis Artificial Analysis na X z 2 października 2026, z wynikami LMArena
- Karta modelu Qwen/Qwen-Image-2.1 na Hugging Face
Czasy, zużycie pamięci i wyniki testów napisów, układu i 4K to moje pomiary na RTX 4090, wariant int8, ComfyUI.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
