Kompozycja z ramek: FLUX 3 kontra 5 modeli
FLUX 3 trzyma ramki z JSON prawie co do piksela, Seedream 5 Pro jest blisko, a Nano Banana Pro wrysował w zdjęcia strzałki z procentami.

👁 118 przeczytań
- FLUX 3 Image osiągnął średnie IoU 0,890 i umieścił wszystkie 16 obiektów w zadanych miejscach, wygrywając z pięcioma konkurentami.
- FLUX 3 Image jest najtańszy w promocji (0,024 USD za obraz 1K do 8 października), ale najwolniejszy - generowanie jednego obrazu trwa od 60 do 247 sekund.
FLUX 3 Image układa obiekty tam, gdzie każesz, wyraźnie lepiej niż konkurencja. W czterech scenach po cztery obiekty średnie pokrycie zadanej i faktycznej ramki (IoU) wyniosło 0,890, a wszystkie 16 obiektów trafiło w swoje miejsce. Drugi był Seedream 5 Pro (0,788, 15 z 16), daleko za nimi GPT Image 2.5 (0,536), Nano Banana Pro (0,479), Ideogram 4.5 (0,370) i Qwen Image 3 (0,346). Haczyk: FLUX potrzebował na jeden obraz 1K od 60 do 247 sekund, a sceny wychodzą mu poprawne, ale dość sztywne.
Najciekawsza nowość FLUX 3 Image to polecenie w formacie JSON, w którym każdy obiekt dostaje identyfikator, krótki opis i ramkę na siatce od 0 do 1000. Black Forest Labs twierdzi, że model jest uczony na takim układzie i trzyma się współrzędnych. Sprawdziłem, czy to prawda i czy inne modele nie zrobią tego samego, gdy opiszę im układ zwykłymi słowami.
Ta funkcja ma znaczenie przy pracy dla klienta: makieta reklamy z produktem w określonym miejscu, miejsce na logo, kadr pod tekst na banerze. Dotąd przy generatorach obrazów takie rzeczy załatwiało się losowaniem kilkunastu wersji albo poprawkami w Photoshopie.
Jak testowałem
- Data: 1 października 2026, dzień premiery FLUX 3 Image.
- Dostęp: wszystkie modele przez API fal.ai, rozdzielczość około 1 Mpx, proporcje 3:2.
- Jedno podejście: jeden obraz na scenę i model, bez losowania i wybierania lepszych wersji.
- Ten sam układ: FLUX 3 dostał oficjalny format JSON z ramkami. Pozostałe modele ten sam układ opisany słowami w procentach szerokości i wysokości, bo nie mają formatu z ramkami.
- Cztery sceny: biurko, plaża w Sopocie, kuchnia i reklama wody mineralnej, w każdej cztery obiekty.
- Pomiar: model wizyjny Gemini 3.8 Flash zaznaczał na każdym obrazie, gdzie obiekt naprawdę jest, a ja liczyłem IoU z ramką zadaną.
- Wyjątek: Ideogram 4.5 przez fal.ai odrzucił rozmiar 1536 × 1024 („Unsupported text-to-image size”), więc dostał najbliższy gotowy format 4:3 (1152 × 864 px). Ramki liczę na siatce 0-1000, czyli względnie do boków obrazu, więc wyniki da się porównać.
Co to jest IoU
IoU (intersection over union) mówi, jak bardzo dwa prostokąty się pokrywają. Bierzesz pole części wspólnej i dzielisz przez pole, które zajmują oba prostokąty razem.
- 1,0 - obiekt leży idealnie w zadanej ramce i ma dokładnie jej rozmiar.
- 0,5 i więcej - obiekt jest we właściwym miejscu, najwyżej trochę za duży, za mały albo przesunięty. Ten próg przyjmuję za „trafienie”.
- 0 - obiekt jest zupełnie gdzie indziej albo go nie ma.
Przykład: jeśli kazałem postawić kubek w lewym dolnym rogu, a model postawił go w tym rogu, ale dwa razy mniejszy, IoU wyniesie około 0,5. Jeśli postawił go na środku stołu, IoU spadnie do zera.
Polecenie z ramkami dla FLUX 3
Tak wyglądała scena „biurko” wpisana w pole prompt na fal.ai. Kolejność współrzędnych to [y_min, x_min, y_max, x_max], a siatka ma zawsze 0-1000 niezależnie od proporcji obrazu:
{"caption": "Editorial photo of a wooden desk by a window in a Warsaw apartment, soft morning light.",
"elements": [
{"id": "lampa", "bbox": [60, 40, 480, 280], "desc": "a brass desk lamp"},
{"id": "roslina", "bbox": [250, 720, 950, 980], "desc": "a tall monstera plant in a white pot"},
{"id": "laptop", "bbox": [430, 330, 860, 690], "desc": "an open silver laptop"},
{"id": "kubek", "bbox": [700, 60, 920, 240], "desc": "a red coffee mug"}]}Pozostałe modele dostały tę samą scenę słowami:
Editorial photo of a wooden desk by a window in a Warsaw apartment, soft morning light. Exact layout (percent of image width and height, measured from the top-left corner): a brass desk lamp occupies the area from 4% to 28% of the width and from 6% to 48% of the height. a tall monstera plant in a white pot occupies the area from 72% to 98% of the width and from 25% to 95% of the height. an open silver laptop occupies the area from 33% to 69% of the width and from 43% to 86% of the height. a red coffee mug occupies the area from 6% to 24% of the width and from 70% to 92% of the height. Follow the layout precisely.Wyniki
| Model | Biurko | Plaża | Kuchnia | Reklama | Średnie IoU | Trafione (IoU > 0,5) |
|---|---|---|---|---|---|---|
| FLUX 3 Image (JSON) | 0,938 | 0,822 | 0,862 | 0,941 | 0,890 | 16/16 |
| Seedream 5 Pro | 0,887 | 0,672 | 0,781 | 0,814 | 0,788 | 15/16 |
| GPT Image 2.5 Sunburst | 0,561 | 0,592 | 0,272 | 0,717 | 0,536 | 11/16 |
| Nano Banana Pro | 0,347 | 0,531 | 0,334 | 0,706 | 0,479 | 7/16 |
| Ideogram 4.5 (4:3) | 0,367 | 0,399 | 0,182 | 0,531 | 0,370 | 7/16 |
| Qwen Image 3 | 0,314 | 0,389 | 0,255 | 0,428 | 0,346 | 6/16 |
FLUX 3: ramki trzymane prawie co do piksela
Białe przerywane prostokąty to ramki, które zadałem. Na biurku laptop ma IoU 0,988, lampa 0,944, kubek 0,933. Najsłabszy obiekt w całym teście FLUX 3 to parasol na plaży (0,629): model zrobił go większym, niż kazałem, i parasol wyszedł poza dolną krawędź ramki.
lamparoslinalaptopkubek
parasolpiesleżaklatawiec

Uczciwie trzeba dodać, co widać gołym okiem. Kuchnia FLUX 3 wygląda jak dekoracja: pusta ściana, zegar, czajnik i miska ułożone w równych odstępach, kot siedzi przed szafkami prawie jak wklejony. Model trzyma ramki, ale scena traci naturalność, której nie brakuje w wersjach GPT Image 2.5 czy Seedream 5 Pro. Przy reklamie na jednolitym tle to zaleta, przy zdjęciu wnętrza już mniej.
Seedream 5 Pro: drugi i blisko
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Seedream 5 Pro nie ma formatu z ramkami, a i tak zrozumiał procenty bardzo dobrze. Pomylił się tylko przy latawcu (IoU 0,467): zrobił go węższym, niż kazałem. Na biurku osiągnął 0,887, prawie jak FLUX.
parasolpiesleżaklatawiecNano Banana Pro narysował linijkę
Najdziwniejszy wynik testu. W trzech z czterech scen Nano Banana Pro potraktował opis układu jak zlecenie na rysunek techniczny i wrysował w zdjęcie czerwone strzałki z procentami („28%”, „72%”, „95%”), a w kuchni czerwone prostokąty wokół obiektów. Do tego obiekty i tak nie stoją tam, gdzie powinny: lampa na biurku ma IoU 0,189.
lamparoslinalaptopkubekWniosek praktyczny: jeśli używasz Nano Banana Pro, nie wpisuj w prompt liczb w procentach. Lepiej działają opisy w rodzaju „lampa w lewym górnym rogu”, a precyzyjny układ trzeba wymusić szkicem lub obrazem referencyjnym.
GPT Image 2.5, Ideogram 4.5 i Qwen Image 3
Te trzy modele trzymały ogólny kierunek („coś po lewej, coś po prawej”), ale nie skalę i nie wysokość. Najwięcej kłopotów sprawiła kuchnia: GPT Image 2.5, Ideogram 4.5 i Qwen Image 3 postawiły czajnik i jabłka na blacie wyżej i dalej, niż kazałem, więc te obiekty mają IoU równe zero albo bliskie zera. Na plaży Ideogram umieścił latawiec w zupełnie innym miejscu (IoU 0,008), a Qwen Image 3 w reklamie przeniósł miętę z prawego górnego rogu na dół, pod cytrynę i kostki lodu.




GPT Image 2.5 rekompensuje to klimatem: na biurku sam dodał widok na Pałac Kultury za oknem, bo w prompcie było „Warsaw apartment”. To najładniejszy obraz w tej scenie, ale układ tylko przybliżony.
Czas i koszt
- FLUX 3 Image: od 60 do 247 sekund na obraz 1K, cena na fal.ai 0,024 USD za obraz 1K do 8 października, potem 0,048 USD.
- Nano Banana Pro: około 22 sekund, 0,15 USD.
- GPT Image 2.5 Sunburst: 29-37 sekund, 0,041 USD (1536 × 1024, high). Jedno zapytanie (kuchnia) za pierwszym razem zwróciło błąd, udało się przy ponownym uruchomieniu.
- Seedream 5 Pro: 37-75 sekund, 0,0675 USD.
- Ideogram 4.5: 11-15 sekund, 0,22 USD (quality high).
- Qwen Image 3: 14-79 sekund, 0,04 USD (1K).
W promocji FLUX 3 jest więc najtańszy i najdokładniejszy, ale najwolniejszy. Przy kilkuset makietach dziennie te minuty zaczną boleć.
Jak pisać polecenia z ramkami
- Myśl w siatce 0-1000. Lewy górny róg to [0, 0], prawy dolny [1000, 1000], niezależnie od tego, czy obraz jest 16:9 czy 9:16. Nie przeliczaj na piksele.
- Pilnuj kolejności y, x. Format to [y_min, x_min, y_max, x_max], czyli najpierw góra, potem lewa krawędź. Zamiana kolejności to najczęstszy błąd: obiekt ląduje odbity po przekątnej.
- Nadawaj krótkie identyfikatory. „lamp_1”, „kubek”, „logo” - ułatwiają późniejszą edycję konkretnego obiektu.
- Opis w desc trzymaj krótki. Jeden obiekt, kilka słów: „a red coffee mug”. Styl i światło nie pasują do desc.
- Styl całości daj do caption. Oświetlenie, obiektyw, rodzaj zdjęcia i nastrój opisz raz, w polu caption.
- Kontekst sceny pisz w caption. Jeśli kot ma siedzieć na podłodze, a czajnik stać na blacie, warto, żeby caption wspominał o podłodze i blacie. W moim teście FLUX 3 postawił kota na drewnianej powierzchni przed szafkami, która wygląda jak drugi blat.
Gotowe układy do skopiowania zebrałem w ośmiu grafikach z promptami JSON.
Pozostałe testy FLUX 3
- FLUX 3 Image - premiera, ceny i nowości
- FLUX 3 pod lupą: 4K kontra 6 modeli
- 5 zmian jednym poleceniem: FLUX 3 kontra 6 modeli
- Tapety 4K z FLUX 3
- Wizualizacje wnętrz w FLUX 3
- Reklamy i packshoty w FLUX 3
- Ranking generatorów obrazów AI
- GPT Image 2.5 i Ideogram - osobne huby z testami
FAQ
Jak podać ramki w FLUX 3 Image?
W polu prompt wpisujesz JSON z polem caption (opis całej sceny) i listą elements. Każdy element ma id, bbox w formacie [y_min, x_min, y_max, x_max] na siatce 0-1000 i krótki opis desc. Na fal.ai działa to w zwykłym endpointcie text-to-image.
Czy inne modele rozumieją ramki?
Nie mają takiego formatu, ale część z nich rozumie opis w procentach. Seedream 5 Pro osiągnął średnie IoU 0,788, blisko FLUX 3. Nano Banana Pro, Ideogram 4.5 i Qwen Image 3 trzymały układ słabo, a Nano Banana Pro wrysowywał w obraz strzałki z procentami.
Co oznacza IoU 0,890?
Że obiekty FLUX 3 pokrywały się z zadanymi ramkami średnio w 89%. W praktyce każdy obiekt stał we właściwym miejscu i miał zbliżony rozmiar, najwyżej lekko większy lub przesunięty o kilka procent kadru.
Czy ramki działają w 4K?
Siatka 0-1000 jest niezależna od rozdzielczości, więc ten sam JSON zadziała w 1K, 2K i 4K. Ten test robiłem w 1K, bo przy 4K jeden obraz FLUX 3 trwał ponad sześć minut (szczegóły w teście pod lupą).
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model AI najlepiej trzyma się zadanego układu obiektów na obrazie?
FLUX 3 Image osiągnął najlepszy wynik - średnie IoU 0,890 i 16 z 16 obiektów trafionych. Drugi był Seedream 5 Pro z IoU 0,788 i 15 trafieniami, a pozostałe cztery modele uzyskały wyniki poniżej 0,540.
Jak działa format JSON z ramkami w FLUX 3 Image?
Każdy obiekt dostaje identyfikator, krótki opis i ramkę w formacie [y_min, x_min, y_max, x_max] na siatce od 0 do 1000. Model był uczony na takim układzie i trzyma się podanych współrzędnych - laptop na biurku osiągnął IoU 0,988, lampa 0,944.
Ile kosztuje generowanie obrazu w FLUX 3 Image na fal.ai?
Do 8 października cena wynosi 0,024 USD za obraz 1K, po tej dacie wzrośnie do 0,048 USD. Dla porównania Nano Banana Pro kosztuje 0,15 USD, Ideogram 4.5 - 0,22 USD, a GPT Image 2.5 - 0,041 USD.
Dlaczego Nano Banana Pro wpisał procenty i strzałki na obrazek zamiast ułożyć obiekty?
Model potraktował opis układu z liczbami procentowymi jak zlecenie na rysunek techniczny i wrysował czerwone strzałki z opisami w stylu '28%' oraz czerwone prostokąty wokół obiektów. Zamiast procentów lepiej używać opisów słownych w rodzaju 'lampa w lewym górnym rogu', a precyzyjny układ wymuszać szkicem lub obrazem referencyjnym.
