Przejdź do treści
Newsy

Zenek Martyniuk w dziesięciu epokach. Jedno zdjęcie, dziesięć minut, dziesięć groszy prądu

Wziąłem jedno zdjęcie portretowe i przebrałem tę samą twarz w dziesięć epok, od rzymskiej togi po neony lat osiemdziesiątych. Wszystko lokalnie na RTX 4090, bez trenowania modelu i bez jednego zapytania do płatnego API. Policzyłem czas, prąd i to, czego w tej zabawie nie wolno zrobić.

7 min czytania

👁 115 przeczytań

Wziąłem jedno zdjęcie twarzy i przebrałem ją w dziesięć epok: rzymska toga, gotycka kolczuga, renesansowy aksamit, kontusz sarmaty, mundur ułana, wiktoriański surdut, frak z lat dwudziestych, skóra rockandrollowca, sztruks z PRL-u i pastelowa marynarka z lat osiemdziesiątych. Wszystko na własnej karcie graficznej, w niecałe dziesięć minut, bez trenowania czegokolwiek i bez jednego zapytania do płatnego API. Modelem był Qwen-Image-2.1, który postawiłem lokalnie dwa dni po premierze. Poniżej pokazuję efekt, liczby i miejsce, w którym ta zabawa robi się poważna.

Dziesięć portretów, jedna twarz, żadnej wtyczki do podmiany twarzy

Punktem wyjścia było pojedyncze zdjęcie portretowe Zenona Martyniuka - tak zwane zdjęcie referencyjne. Nie wycinałem z niego twarzy, nie robiłem maski, nie uruchamiałem żadnego face swapa. Model dostał fotografię jako materiał poglądowy i polecenie w stylu „ten sam człowiek, ta sama budowa czaszki, ten sam wiek, zmienia się tylko fryzura, ubiór, poza, sceneria i nośnik”. Resztę, czyli dziesięć różnych opisów epok, napisałem ręcznie i puściłem jeden po drugim.

Wygenerowany portret mężczyzny w todze i wieńcu laurowym na tle marmurowej kolumnady
Rzym, I wiek. Toga z purpurową bordiurą, wieniec laurowy, gest mówcy. Wszystkie obrazy w tym tekście wygenerowała sztuczna inteligencja.
Wygenerowany barokowy portret szlachcica w kontuszu z szablą
Sarmata, XVII wiek. Żupan, kontusz z wylotami, pas i szabla. Model sam dołożył podgoloną głowę i wąsy, bo tak brzmiał opis epoki.

Najciekawsze jest to, czego tu nie widać. Nie ma sklejki, nie ma wklejonego owalu twarzy na cudzy portret, nie ma charakterystycznej granicy na linii żuchwy, po której poznaje się tanie przeróbki. Oświetlenie na twarzy zgadza się ze sceną, bo twarz powstała razem z całą resztą obrazu, w jednym przebiegu.

Model sam pilnuje podobieństwa, bo widzi zdjęcie, a nie tylko tekst

Jeszcze rok temu taki efekt wymagał albo wytrenowania własnej LoRA na kilkunastu zdjęciach jednej osoby, albo dołożenia osobnego mechanizmu, który wstrzykuje rysy twarzy do generowania. Qwen-Image-2.1 potrafi to sam, bo jego enkoder tekstu jest jednocześnie modelem widzącym obrazy. Zdjęcie referencyjne trafia dwiema drogami naraz: do enkodera, który je po prostu ogląda i opisuje sobie w tej samej przestrzeni co polecenie, i do wariacyjnego autoenkodera, który zamienia je na warstwę liczb doklejaną do warunkowania. Model nie tyle „kopiuje twarz”, co przez cały czas generowania ma ją przed oczami.

Praktycznie sprowadza się to do jednego węzła w ComfyUI. W wersji przez API wpina się obraz pod klucz images.image_1 i podpina do tego samego węzła enkoder obrazu, a sam model działa przy sile prowadzenia równej 1,0 - czyli przy wartości, przy której starsze modele nie potrafiły utrzymać nic sensownego. Referencja była kwadratowa, a wszystkie efekty mają kadr pionowy 4:5, i to też nie stanowi problemu: proporcje wyjścia są niezależne od proporcji zdjęcia wejściowego.

Wygenerowany portret w stylu dawnej fotografii sepiowej, mężczyzna w surducie z laską
1875, mokra płyta kolodionowa. Prosiłem o sepię, płytką głębię ostrości i rysy na kliszy - wszystkie trzy elementy naraz są w kadrze.
Wygenerowane czarno-białe zdjęcie mężczyzny we fraku przy fortepianie
1927, klub art déco. Twarde światło żarowe i drobne ziarno srebra zamiast gładkiego cyfrowego portretu.

Sprawdziłem też, jak daleko można odejść od fotografii. Gotycki portret tablicowy na złotym tle i renesansowy olej na desce to zupełnie inne reguły niż zdjęcie: płaska perspektywa, spękany werniks, brak cieni na złocie. Podobieństwo przeżyło i to. Im bardziej malarska konwencja, tym bardziej twarz jest „namalowana”, ale rozpoznawalna zostaje.

Wygenerowany gotycki portret tablicowy rycerza w kolczudze na złotym tle
XV wiek, tempera na desce. Złote tło bez cieni, spękany werniks, sztywna poza - konwencja zrobiona, a twarz dalej ta sama.
Wygenerowany renesansowy portret mężczyzny w czarnym kaftanie ze złotym łańcuchem
XVI wiek, olej na desce. Aksamit, futro i złoty łańcuch, światło z jednego okna z lewej strony.

Dziesięć groszy prądu kontra dwa i pół złotego przez API

Czas jest zmierzony, nie oszacowany. Jeden obraz 1152 na 1440 pikseli przy 28 krokach schodzi na RTX 4090 w około sześćdziesiąt sekund, komplet dziesięciu razem z jednym powtórzeniem zajął jedenaście przebiegów i niecały kwadrans z pisaniem opisów włącznie. Przy poborze rzędu pół kilowata z gniazdka i stawce około 1,10 zł za kilowatogodzinę wychodzi mniej więcej grosz za obraz, czyli dziesięć groszy za całą serię.

Dla porównania mam własny pomiar z tego samego miesiąca: generowanie jednej ilustracji przez OpenRouter modelem google/gemini-3.1-flash-image kosztuje 0,067 dolara, czyli około 25 groszy. Te same dziesięć obrazów to 2,50 zł i zero kontroli nad tym, co dostawca zrobi ze zdjęciem referencyjnym. Różnica na jednej serii jest śmieszna, ale pipeline’y liczy się w tysiącach obrazów miesięcznie i wtedy proporcja dwadzieścia pięć do jednego zaczyna znaczyć.

Drugą walutą jest tu prywatność. Wgranie cudzego wizerunku do usługi w chmurze to przekazanie danych biometrycznych podmiotowi trzeciemu, z jego regulaminem i jego polityką trenowania na danych użytkowników. Lokalnie zdjęcie nie opuszcza dysku.

Wygenerowane zdjęcie w stylu wyblakłego filmu z lat siedemdziesiątych, mężczyzna w sztruksowej marynarce na kanapie
1978, film ORWO. Przesunięta kolorystyka, płaski flesz i meblościanka - najbardziej „polski” kadr z całej dziesiątki.

Neon „Kodacheiny”, czyli gdzie to jeszcze pęka

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Pierwsze podejście do lat pięćdziesiątych wróciło z czerwonym neonem nad barem, na którym świeciło słowo „Kodacheiny”. Model nie miał tego w poleceniu - sam uznał, że skoro jest amerykański bar przy drodze, to musi być szyld, a skoro ma być szyld, to trzeba coś na nim napisać. Litery w generatorach obrazu są dziś poprawne tylko wtedy, gdy się je jawnie podyktuje. Wystarczyło dopisać do listy odrzuceń napisy i szyldy, a w samym opisie zaznaczyć, że neon ma być świecącą rurką bez liter, i drugie podejście weszło od razu.

Wygenerowane kolorowe zdjęcie mężczyzny w skórzanej kurtce z gitarą przy czerwonym samochodzie
1957, Kodachrome. Wersja po poprawce - neon świeci, ale nie próbuje już niczego napisać.

Druga rzecz, która wymagała pilnowania, to wiek. Model ma silną skłonność do odmładzania, zwłaszcza w konwencjach kojarzonych z młodością, jak rock and roll czy lata osiemdziesiąte. Bez wyraźnego „ten sam wiek” w poleceniu twarz potrafi zgubić dziesięć lat i przestaje być tą samą osobą. Trzecia to dłonie przy instrumentach - gitara i klawisze wyszły poprawnie, ale to właśnie ten typ kadru, w którym najczęściej pojawia się szósty palec.

Wygenerowany kadr w stylu kasety wideo, mężczyzna w pastelowej marynarce za klawiszami w neonach
1986, klatka z kasety wideo. Rozsunięte kanały koloru i linie skanowania robią tu więcej niż same neony.

Najtrudniejsza część to nie generowanie, tylko licencja i cudza twarz

Technicznie to jest piętnaście minut pracy. Prawnie - dwie osobne sprawy, z których żadna nie rozwiązuje się sama.

Pierwsza to licencja modelu. Qwen-Image w wersji 1.0 był wydany na Apache 2.0, czyli pozwalał na wszystko, łącznie z zarabianiem. Wersja 2.1 wyszła na Qwen Research License, która ogranicza użycie do badań i oceny, a ścieżkę komercyjną odsyła do osobnej umowy z wydawcą. Na Hugging Face wiszą pod modelem dwa wątki, w których ludzie proszą o powrót do poprzedniej licencji albo o wariant w stylu licencji społecznościowej Meta. Dla kogoś, kto chce mieć darmowy generator ilustracji do firmowego bloga, to jest twardy blokad: wagi można pobrać, uruchomić i ocenić, ale nie można na nich zbudować produktu.

Druga sprawa to wizerunek. Artykuł 81 ustawy o prawie autorskim i prawach pokrewnych mówi wprost, że rozpowszechnianie wizerunku wymaga zgody osoby na nim przedstawionej, a wyjątek dla osób powszechnie znanych dotyczy wizerunku wykonanego w związku z pełnieniem funkcji. Zdjęcie ze sceny mieści się w tym wyjątku. Wygenerowany portret tej samej osoby w todze rzymskiej - już nie, bo nie ma żadnego związku z wykonywaniem zawodu. Do tego od 2 sierpnia 2026 obowiązuje artykuł 50 unijnego aktu o sztucznej inteligencji, który nakazuje oznaczać treści wygenerowane lub zmodyfikowane przez AI przedstawiające istniejące osoby. Dlatego każdy obraz w tym tekście ma podpis mówiący wprost, skąd pochodzi, i dlatego ta seria jest tym, czym jest: testem możliwości modelu, a nie materiałem promocyjnym.

Wygenerowany portret oficera w mundurze z epoki napoleońskiej na tle pola bitwy
1812, mundur ułana. Dziesiąty i ostatni kadr z serii, jedyny, w którym poprosiłem o tło z akcją zamiast pustej ściany.

Rok temu ten sam efekt oznaczał trening własnego modelu na kilkunastu zdjęciach, kilka godzin na karcie i portfolio kompromisów. Dziś to jedno zdjęcie, dziesięć zdań po angielsku i dziesięć minut, a cała trudność przesunęła się z pytania „czy da się to zrobić” na pytanie „czy wolno to opublikować”. To jest zmiana, która w praktyce znaczy więcej niż kolejne dwa punkty w benchmarku.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła

Sprawdzone 22 września 2026: karta modelu i plik licencji Qwen-Image-2.1 na Hugging Face oraz treść Qwen Research License, wątek społeczności o prośbie o bardziej otwartą licencję, ustawa o prawie autorskim i prawach pokrewnych (art. 81) oraz rozporządzenie 2024/1689, akt o sztucznej inteligencji (art. 50 i art. 113). Czasy generowania i zużycie prądu to pomiary własne na RTX 4090, koszt API to realne rozliczenie OpenRouter z września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie