✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Benchmarki

Kompozycja z ramek: FLUX 3 kontra 5 modeli

FLUX 3 trzyma ramki z JSON prawie co do piksela, Seedream 5 Pro jest blisko, a Nano Banana Pro wrysował w zdjęcia strzałki z procentami.

8 min czytania
FLUX 3 Image - Kompozycja z ramek: FLUX 3 kontra 5 modeli

👁 118 przeczytań

// w skrócie
  • FLUX 3 Image osiągnął średnie IoU 0,890 i umieścił wszystkie 16 obiektów w zadanych miejscach, wygrywając z pięcioma konkurentami.
  • FLUX 3 Image jest najtańszy w promocji (0,024 USD za obraz 1K do 8 października), ale najwolniejszy - generowanie jednego obrazu trwa od 60 do 247 sekund.

FLUX 3 Image układa obiekty tam, gdzie każesz, wyraźnie lepiej niż konkurencja. W czterech scenach po cztery obiekty średnie pokrycie zadanej i faktycznej ramki (IoU) wyniosło 0,890, a wszystkie 16 obiektów trafiło w swoje miejsce. Drugi był Seedream 5 Pro (0,788, 15 z 16), daleko za nimi GPT Image 2.5 (0,536), Nano Banana Pro (0,479), Ideogram 4.5 (0,370) i Qwen Image 3 (0,346). Haczyk: FLUX potrzebował na jeden obraz 1K od 60 do 247 sekund, a sceny wychodzą mu poprawne, ale dość sztywne.

Najciekawsza nowość FLUX 3 Image to polecenie w formacie JSON, w którym każdy obiekt dostaje identyfikator, krótki opis i ramkę na siatce od 0 do 1000. Black Forest Labs twierdzi, że model jest uczony na takim układzie i trzyma się współrzędnych. Sprawdziłem, czy to prawda i czy inne modele nie zrobią tego samego, gdy opiszę im układ zwykłymi słowami.

Ta funkcja ma znaczenie przy pracy dla klienta: makieta reklamy z produktem w określonym miejscu, miejsce na logo, kadr pod tekst na banerze. Dotąd przy generatorach obrazów takie rzeczy załatwiało się losowaniem kilkunastu wersji albo poprawkami w Photoshopie.

Hub FLUX - modele Black Forest Labs, testy i prompty: FLUX 3 Image i FLUX.2.

Jak testowałem

  • Data: 1 października 2026, dzień premiery FLUX 3 Image.
  • Dostęp: wszystkie modele przez API fal.ai, rozdzielczość około 1 Mpx, proporcje 3:2.
  • Jedno podejście: jeden obraz na scenę i model, bez losowania i wybierania lepszych wersji.
  • Ten sam układ: FLUX 3 dostał oficjalny format JSON z ramkami. Pozostałe modele ten sam układ opisany słowami w procentach szerokości i wysokości, bo nie mają formatu z ramkami.
  • Cztery sceny: biurko, plaża w Sopocie, kuchnia i reklama wody mineralnej, w każdej cztery obiekty.
  • Pomiar: model wizyjny Gemini 3.8 Flash zaznaczał na każdym obrazie, gdzie obiekt naprawdę jest, a ja liczyłem IoU z ramką zadaną.
  • Wyjątek: Ideogram 4.5 przez fal.ai odrzucił rozmiar 1536 × 1024 („Unsupported text-to-image size”), więc dostał najbliższy gotowy format 4:3 (1152 × 864 px). Ramki liczę na siatce 0-1000, czyli względnie do boków obrazu, więc wyniki da się porównać.

Co to jest IoU

IoU (intersection over union) mówi, jak bardzo dwa prostokąty się pokrywają. Bierzesz pole części wspólnej i dzielisz przez pole, które zajmują oba prostokąty razem.

  • 1,0 - obiekt leży idealnie w zadanej ramce i ma dokładnie jej rozmiar.
  • 0,5 i więcej - obiekt jest we właściwym miejscu, najwyżej trochę za duży, za mały albo przesunięty. Ten próg przyjmuję za „trafienie”.
  • 0 - obiekt jest zupełnie gdzie indziej albo go nie ma.

Przykład: jeśli kazałem postawić kubek w lewym dolnym rogu, a model postawił go w tym rogu, ale dwa razy mniejszy, IoU wyniesie około 0,5. Jeśli postawił go na środku stołu, IoU spadnie do zera.

Polecenie z ramkami dla FLUX 3

Tak wyglądała scena „biurko” wpisana w pole prompt na fal.ai. Kolejność współrzędnych to [y_min, x_min, y_max, x_max], a siatka ma zawsze 0-1000 niezależnie od proporcji obrazu:

{"caption": "Editorial photo of a wooden desk by a window in a Warsaw apartment, soft morning light.",
 "elements": [
  {"id": "lampa", "bbox": [60, 40, 480, 280], "desc": "a brass desk lamp"},
  {"id": "roslina", "bbox": [250, 720, 950, 980], "desc": "a tall monstera plant in a white pot"},
  {"id": "laptop", "bbox": [430, 330, 860, 690], "desc": "an open silver laptop"},
  {"id": "kubek", "bbox": [700, 60, 920, 240], "desc": "a red coffee mug"}]}

Pozostałe modele dostały tę samą scenę słowami:

Editorial photo of a wooden desk by a window in a Warsaw apartment, soft morning light. Exact layout (percent of image width and height, measured from the top-left corner): a brass desk lamp occupies the area from 4% to 28% of the width and from 6% to 48% of the height. a tall monstera plant in a white pot occupies the area from 72% to 98% of the width and from 25% to 95% of the height. an open silver laptop occupies the area from 33% to 69% of the width and from 43% to 86% of the height. a red coffee mug occupies the area from 6% to 24% of the width and from 70% to 92% of the height. Follow the layout precisely.

Wyniki

ModelBiurkoPlażaKuchniaReklamaŚrednie IoUTrafione (IoU > 0,5)
FLUX 3 Image (JSON)0,9380,8220,8620,9410,89016/16
Seedream 5 Pro0,8870,6720,7810,8140,78815/16
GPT Image 2.5 Sunburst0,5610,5920,2720,7170,53611/16
Nano Banana Pro0,3470,5310,3340,7060,4797/16
Ideogram 4.5 (4:3)0,3670,3990,1820,5310,3707/16
Qwen Image 30,3140,3890,2550,4280,3466/16
Średnie IoU z 16 obiektów (1 = idealnie)
FLUX 3 Image0,890
Seedream 5 Pro0,788
GPT Image 2.5 Sunburst0,536
Nano Banana Pro0,479
Ideogram 4.50,370
Qwen Image 30,346
Obiekty we właściwym miejscu (IoU > 0,5, na 16)
FLUX 3 Image16
Seedream 5 Pro15
GPT Image 2.5 Sunburst11
Nano Banana Pro7
Ideogram 4.57
Qwen Image 36

FLUX 3: ramki trzymane prawie co do piksela

Białe przerywane prostokąty to ramki, które zadałem. Na biurku laptop ma IoU 0,988, lampa 0,944, kubek 0,933. Najsłabszy obiekt w całym teście FLUX 3 to parasol na plaży (0,629): model zrobił go większym, niż kazałem, i parasol wyszedł poza dolną krawędź ramki.

FLUX 3 Image: biurko z lampą, laptopem, monsterą i czerwonym kubkiem, obiekty w zadanych ramkachlamparoslinalaptopkubek
FLUX 3 Image: plaża w Sopocie z parasolem, leżakiem, golden retrieverem i żółtym latawcem w zadanych ramkachparasolpiesleżaklatawiec
FLUX 3 Image: kuchnia z zegarem, miedzianym czajnikiem, miską jabłek i szarym kotem
FLUX 3 · kuchnia · IoU 0,862
FLUX 3 Image: reklama wody mineralnej z butelką, cytryną, miętą i kostkami lodu
FLUX 3 · reklama · IoU 0,941

Uczciwie trzeba dodać, co widać gołym okiem. Kuchnia FLUX 3 wygląda jak dekoracja: pusta ściana, zegar, czajnik i miska ułożone w równych odstępach, kot siedzi przed szafkami prawie jak wklejony. Model trzyma ramki, ale scena traci naturalność, której nie brakuje w wersjach GPT Image 2.5 czy Seedream 5 Pro. Przy reklamie na jednolitym tle to zaleta, przy zdjęciu wnętrza już mniej.

Seedream 5 Pro: drugi i blisko

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Seedream 5 Pro nie ma formatu z ramkami, a i tak zrozumiał procenty bardzo dobrze. Pomylił się tylko przy latawcu (IoU 0,467): zrobił go węższym, niż kazałem. Na biurku osiągnął 0,887, prawie jak FLUX.

Seedream 5 Pro: plaża z parasolem w paski, leżakiem, psem i latawcem na tle zadanych ramekparasolpiesleżaklatawiec

Nano Banana Pro narysował linijkę

Najdziwniejszy wynik testu. W trzech z czterech scen Nano Banana Pro potraktował opis układu jak zlecenie na rysunek techniczny i wrysował w zdjęcie czerwone strzałki z procentami („28%”, „72%”, „95%”), a w kuchni czerwone prostokąty wokół obiektów. Do tego obiekty i tak nie stoją tam, gdzie powinny: lampa na biurku ma IoU 0,189.

Nano Banana Pro: biurko z wrysowanymi czerwonymi strzałkami i procentami, obiekty poza zadanymi ramkamilamparoslinalaptopkubek

Wniosek praktyczny: jeśli używasz Nano Banana Pro, nie wpisuj w prompt liczb w procentach. Lepiej działają opisy w rodzaju „lampa w lewym górnym rogu”, a precyzyjny układ trzeba wymusić szkicem lub obrazem referencyjnym.

GPT Image 2.5, Ideogram 4.5 i Qwen Image 3

Te trzy modele trzymały ogólny kierunek („coś po lewej, coś po prawej”), ale nie skalę i nie wysokość. Najwięcej kłopotów sprawiła kuchnia: GPT Image 2.5, Ideogram 4.5 i Qwen Image 3 postawiły czajnik i jabłka na blacie wyżej i dalej, niż kazałem, więc te obiekty mają IoU równe zero albo bliskie zera. Na plaży Ideogram umieścił latawiec w zupełnie innym miejscu (IoU 0,008), a Qwen Image 3 w reklamie przeniósł miętę z prawego górnego rogu na dół, pod cytrynę i kostki lodu.

GPT Image 2.5: kuchnia, czajnik i jabłka na blacie wyżej niż w zadanym układzie
GPT Image 2.5 · kuchnia · IoU 0,272
Qwen Image 3: reklama wody, mięta przeniesiona na dół kadru
Qwen Image 3 · reklama · IoU 0,428
Ideogram 4.5: plaża w formacie 4:3, latawiec w złym miejscu
Ideogram 4.5 · plaża · IoU 0,399
GPT Image 2.5: biurko z widokiem na Pałac Kultury, obiekty mniej więcej w zadanych strefach
GPT Image 2.5 · biurko · IoU 0,561

GPT Image 2.5 rekompensuje to klimatem: na biurku sam dodał widok na Pałac Kultury za oknem, bo w prompcie było „Warsaw apartment”. To najładniejszy obraz w tej scenie, ale układ tylko przybliżony.

Czas i koszt

  • FLUX 3 Image: od 60 do 247 sekund na obraz 1K, cena na fal.ai 0,024 USD za obraz 1K do 8 października, potem 0,048 USD.
  • Nano Banana Pro: około 22 sekund, 0,15 USD.
  • GPT Image 2.5 Sunburst: 29-37 sekund, 0,041 USD (1536 × 1024, high). Jedno zapytanie (kuchnia) za pierwszym razem zwróciło błąd, udało się przy ponownym uruchomieniu.
  • Seedream 5 Pro: 37-75 sekund, 0,0675 USD.
  • Ideogram 4.5: 11-15 sekund, 0,22 USD (quality high).
  • Qwen Image 3: 14-79 sekund, 0,04 USD (1K).

W promocji FLUX 3 jest więc najtańszy i najdokładniejszy, ale najwolniejszy. Przy kilkuset makietach dziennie te minuty zaczną boleć.

Jak pisać polecenia z ramkami

  1. Myśl w siatce 0-1000. Lewy górny róg to [0, 0], prawy dolny [1000, 1000], niezależnie od tego, czy obraz jest 16:9 czy 9:16. Nie przeliczaj na piksele.
  2. Pilnuj kolejności y, x. Format to [y_min, x_min, y_max, x_max], czyli najpierw góra, potem lewa krawędź. Zamiana kolejności to najczęstszy błąd: obiekt ląduje odbity po przekątnej.
  3. Nadawaj krótkie identyfikatory. „lamp_1”, „kubek”, „logo” - ułatwiają późniejszą edycję konkretnego obiektu.
  4. Opis w desc trzymaj krótki. Jeden obiekt, kilka słów: „a red coffee mug”. Styl i światło nie pasują do desc.
  5. Styl całości daj do caption. Oświetlenie, obiektyw, rodzaj zdjęcia i nastrój opisz raz, w polu caption.
  6. Kontekst sceny pisz w caption. Jeśli kot ma siedzieć na podłodze, a czajnik stać na blacie, warto, żeby caption wspominał o podłodze i blacie. W moim teście FLUX 3 postawił kota na drewnianej powierzchni przed szafkami, która wygląda jak drugi blat.

Gotowe układy do skopiowania zebrałem w ośmiu grafikach z promptami JSON.

Pozostałe testy FLUX 3

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

FAQ

Jak podać ramki w FLUX 3 Image?

W polu prompt wpisujesz JSON z polem caption (opis całej sceny) i listą elements. Każdy element ma id, bbox w formacie [y_min, x_min, y_max, x_max] na siatce 0-1000 i krótki opis desc. Na fal.ai działa to w zwykłym endpointcie text-to-image.

Czy inne modele rozumieją ramki?

Nie mają takiego formatu, ale część z nich rozumie opis w procentach. Seedream 5 Pro osiągnął średnie IoU 0,788, blisko FLUX 3. Nano Banana Pro, Ideogram 4.5 i Qwen Image 3 trzymały układ słabo, a Nano Banana Pro wrysowywał w obraz strzałki z procentami.

Co oznacza IoU 0,890?

Że obiekty FLUX 3 pokrywały się z zadanymi ramkami średnio w 89%. W praktyce każdy obiekt stał we właściwym miejscu i miał zbliżony rozmiar, najwyżej lekko większy lub przesunięty o kilka procent kadru.

Czy ramki działają w 4K?

Siatka 0-1000 jest niezależna od rozdzielczości, więc ten sam JSON zadziała w 1K, 2K i 4K. Ten test robiłem w 1K, bo przy 4K jeden obraz FLUX 3 trwał ponad sześć minut (szczegóły w teście pod lupą).

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model AI najlepiej trzyma się zadanego układu obiektów na obrazie?

FLUX 3 Image osiągnął najlepszy wynik - średnie IoU 0,890 i 16 z 16 obiektów trafionych. Drugi był Seedream 5 Pro z IoU 0,788 i 15 trafieniami, a pozostałe cztery modele uzyskały wyniki poniżej 0,540.

Jak działa format JSON z ramkami w FLUX 3 Image?

Każdy obiekt dostaje identyfikator, krótki opis i ramkę w formacie [y_min, x_min, y_max, x_max] na siatce od 0 do 1000. Model był uczony na takim układzie i trzyma się podanych współrzędnych - laptop na biurku osiągnął IoU 0,988, lampa 0,944.

Ile kosztuje generowanie obrazu w FLUX 3 Image na fal.ai?

Do 8 października cena wynosi 0,024 USD za obraz 1K, po tej dacie wzrośnie do 0,048 USD. Dla porównania Nano Banana Pro kosztuje 0,15 USD, Ideogram 4.5 - 0,22 USD, a GPT Image 2.5 - 0,041 USD.

Dlaczego Nano Banana Pro wpisał procenty i strzałki na obrazek zamiast ułożyć obiekty?

Model potraktował opis układu z liczbami procentowymi jak zlecenie na rysunek techniczny i wrysował czerwone strzałki z opisami w stylu '28%' oraz czerwone prostokąty wokół obiektów. Zamiast procentów lepiej używać opisów słownych w rodzaju 'lampa w lewym górnym rogu', a precyzyjny układ wymuszać szkicem lub obrazem referencyjnym.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›