Zenek Martyniuk w dziesięciu epokach. Jedno zdjęcie, dziesięć minut, dziesięć groszy prądu
Wziąłem jedno zdjęcie portretowe i przebrałem tę samą twarz w dziesięć epok, od rzymskiej togi po neony lat osiemdziesiątych. Wszystko lokalnie na RTX 4090, bez trenowania modelu i bez jednego zapytania do płatnego API. Policzyłem czas, prąd i to, czego w tej zabawie nie wolno zrobić.

👁 117 przeczytań
Wziąłem jedno zdjęcie twarzy i przebrałem ją w dziesięć epok: rzymska toga, gotycka kolczuga, renesansowy aksamit, kontusz sarmaty, mundur ułana, wiktoriański surdut, frak z lat dwudziestych, skóra rockandrollowca, sztruks z PRL-u i pastelowa marynarka z lat osiemdziesiątych. Wszystko na własnej karcie graficznej, w niecałe dziesięć minut, bez trenowania czegokolwiek i bez jednego zapytania do płatnego API. Modelem był Qwen-Image-2.1, który postawiłem lokalnie dwa dni po premierze. Poniżej pokazuję efekt, liczby i miejsce, w którym ta zabawa robi się poważna.
Dziesięć portretów, jedna twarz, żadnej wtyczki do podmiany twarzy
Punktem wyjścia było pojedyncze zdjęcie portretowe Zenona Martyniuka - tak zwane zdjęcie referencyjne. Nie wycinałem z niego twarzy, nie robiłem maski, nie uruchamiałem żadnego face swapa. Model dostał fotografię jako materiał poglądowy i polecenie w stylu „ten sam człowiek, ta sama budowa czaszki, ten sam wiek, zmienia się tylko fryzura, ubiór, poza, sceneria i nośnik”. Resztę, czyli dziesięć różnych opisów epok, napisałem ręcznie i puściłem jeden po drugim.


Najciekawsze jest to, czego tu nie widać. Nie ma sklejki, nie ma wklejonego owalu twarzy na cudzy portret, nie ma charakterystycznej granicy na linii żuchwy, po której poznaje się tanie przeróbki. Oświetlenie na twarzy zgadza się ze sceną, bo twarz powstała razem z całą resztą obrazu, w jednym przebiegu.
Model sam pilnuje podobieństwa, bo widzi zdjęcie, a nie tylko tekst
Jeszcze rok temu taki efekt wymagał albo wytrenowania własnej LoRA na kilkunastu zdjęciach jednej osoby, albo dołożenia osobnego mechanizmu, który wstrzykuje rysy twarzy do generowania. Qwen-Image-2.1 potrafi to sam, bo jego enkoder tekstu jest jednocześnie modelem widzącym obrazy. Zdjęcie referencyjne trafia dwiema drogami naraz: do enkodera, który je po prostu ogląda i opisuje sobie w tej samej przestrzeni co polecenie, i do wariacyjnego autoenkodera, który zamienia je na warstwę liczb doklejaną do warunkowania. Model nie tyle „kopiuje twarz”, co przez cały czas generowania ma ją przed oczami.
Praktycznie sprowadza się to do jednego węzła w ComfyUI. W wersji przez API wpina się obraz pod klucz images.image_1 i podpina do tego samego węzła enkoder obrazu, a sam model działa przy sile prowadzenia równej 1,0 - czyli przy wartości, przy której starsze modele nie potrafiły utrzymać nic sensownego. Referencja była kwadratowa, a wszystkie efekty mają kadr pionowy 4:5, i to też nie stanowi problemu: proporcje wyjścia są niezależne od proporcji zdjęcia wejściowego.


Sprawdziłem też, jak daleko można odejść od fotografii. Gotycki portret tablicowy na złotym tle i renesansowy olej na desce to zupełnie inne reguły niż zdjęcie: płaska perspektywa, spękany werniks, brak cieni na złocie. Podobieństwo przeżyło i to. Im bardziej malarska konwencja, tym bardziej twarz jest „namalowana”, ale rozpoznawalna zostaje.


Dziesięć groszy prądu kontra dwa i pół złotego przez API
Czas jest zmierzony, nie oszacowany. Jeden obraz 1152 na 1440 pikseli przy 28 krokach schodzi na RTX 4090 w około sześćdziesiąt sekund, komplet dziesięciu razem z jednym powtórzeniem zajął jedenaście przebiegów i niecały kwadrans z pisaniem opisów włącznie. Przy poborze rzędu pół kilowata z gniazdka i stawce około 1,10 zł za kilowatogodzinę wychodzi mniej więcej grosz za obraz, czyli dziesięć groszy za całą serię.
Dla porównania mam własny pomiar z tego samego miesiąca: generowanie jednej ilustracji przez OpenRouter modelem google/gemini-3.1-flash-image kosztuje 0,067 dolara, czyli około 25 groszy. Te same dziesięć obrazów to 2,50 zł i zero kontroli nad tym, co dostawca zrobi ze zdjęciem referencyjnym. Różnica na jednej serii jest śmieszna, ale pipeline’y liczy się w tysiącach obrazów miesięcznie i wtedy proporcja dwadzieścia pięć do jednego zaczyna znaczyć.
Drugą walutą jest tu prywatność. Wgranie cudzego wizerunku do usługi w chmurze to przekazanie danych biometrycznych podmiotowi trzeciemu, z jego regulaminem i jego polityką trenowania na danych użytkowników. Lokalnie zdjęcie nie opuszcza dysku.

Neon „Kodacheiny”, czyli gdzie to jeszcze pęka
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Pierwsze podejście do lat pięćdziesiątych wróciło z czerwonym neonem nad barem, na którym świeciło słowo „Kodacheiny”. Model nie miał tego w poleceniu - sam uznał, że skoro jest amerykański bar przy drodze, to musi być szyld, a skoro ma być szyld, to trzeba coś na nim napisać. Litery w generatorach obrazu są dziś poprawne tylko wtedy, gdy się je jawnie podyktuje. Wystarczyło dopisać do listy odrzuceń napisy i szyldy, a w samym opisie zaznaczyć, że neon ma być świecącą rurką bez liter, i drugie podejście weszło od razu.

Druga rzecz, która wymagała pilnowania, to wiek. Model ma silną skłonność do odmładzania, zwłaszcza w konwencjach kojarzonych z młodością, jak rock and roll czy lata osiemdziesiąte. Bez wyraźnego „ten sam wiek” w poleceniu twarz potrafi zgubić dziesięć lat i przestaje być tą samą osobą. Trzecia to dłonie przy instrumentach - gitara i klawisze wyszły poprawnie, ale to właśnie ten typ kadru, w którym najczęściej pojawia się szósty palec.

Najtrudniejsza część to nie generowanie, tylko licencja i cudza twarz
Technicznie to jest piętnaście minut pracy. Prawnie - dwie osobne sprawy, z których żadna nie rozwiązuje się sama.
Pierwsza to licencja modelu. Qwen-Image w wersji 1.0 był wydany na Apache 2.0, czyli pozwalał na wszystko, łącznie z zarabianiem. Wersja 2.1 wyszła na Qwen Research License, która ogranicza użycie do badań i oceny, a ścieżkę komercyjną odsyła do osobnej umowy z wydawcą. Na Hugging Face wiszą pod modelem dwa wątki, w których ludzie proszą o powrót do poprzedniej licencji albo o wariant w stylu licencji społecznościowej Meta. Dla kogoś, kto chce mieć darmowy generator ilustracji do firmowego bloga, to jest twardy blokad: wagi można pobrać, uruchomić i ocenić, ale nie można na nich zbudować produktu.
Druga sprawa to wizerunek. Artykuł 81 ustawy o prawie autorskim i prawach pokrewnych mówi wprost, że rozpowszechnianie wizerunku wymaga zgody osoby na nim przedstawionej, a wyjątek dla osób powszechnie znanych dotyczy wizerunku wykonanego w związku z pełnieniem funkcji. Zdjęcie ze sceny mieści się w tym wyjątku. Wygenerowany portret tej samej osoby w todze rzymskiej - już nie, bo nie ma żadnego związku z wykonywaniem zawodu. Do tego od 2 sierpnia 2026 obowiązuje artykuł 50 unijnego aktu o sztucznej inteligencji, który nakazuje oznaczać treści wygenerowane lub zmodyfikowane przez AI przedstawiające istniejące osoby. Dlatego każdy obraz w tym tekście ma podpis mówiący wprost, skąd pochodzi, i dlatego ta seria jest tym, czym jest: testem możliwości modelu, a nie materiałem promocyjnym.

Rok temu ten sam efekt oznaczał trening własnego modelu na kilkunastu zdjęciach, kilka godzin na karcie i portfolio kompromisów. Dziś to jedno zdjęcie, dziesięć zdań po angielsku i dziesięć minut, a cała trudność przesunęła się z pytania „czy da się to zrobić” na pytanie „czy wolno to opublikować”. To jest zmiana, która w praktyce znaczy więcej niż kolejne dwa punkty w benchmarku.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła
Sprawdzone 22 września 2026: karta modelu i plik licencji Qwen-Image-2.1 na Hugging Face oraz treść Qwen Research License, wątek społeczności o prośbie o bardziej otwartą licencję, ustawa o prawie autorskim i prawach pokrewnych (art. 81) oraz rozporządzenie 2024/1689, akt o sztucznej inteligencji (art. 50 i art. 113). Czasy generowania i zużycie prądu to pomiary własne na RTX 4090, koszt API to realne rozliczenie OpenRouter z września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
