🎬 Higgsfield Plus na rok 549 zł 1 990 zł -72% zostało 8 szt. albo Gemini Pro na 18 miesięcy 170 zł Kup teraz →
Przejdź do treści
Newsy

Black Forest Labs wypuszcza FLUX 3 - model do generowania obrazów i 20-sekundowych filmów z dźwiękiem

Black Forest Labs ogłosiło premierę FLUX 3, nowego modelu multimodalnego zdolnego do generowania obrazów oraz 20-sekundowych klipów wideo z dźwiękiem - na razie w ograniczonym dostępie.

4 min czytania
Ostatnia aktualizacja:
Black Forest Labs wypuszcza FLUX 3 - model do generowania obrazów i 20-sekundowych filmów z dźwiękiem

👁 114 przeczytań

Black Forest Labs ogłosiło premierę FLUX 3 - modelu multimodalnego, który potrafi generować zarówno obrazy, jak i klipy wideo o długości do 20 sekund z towarzyszącym dźwiękiem. Premiera odbywa się jednak w trybie ograniczonego dostępu, co oznacza, że na pełne udostępnienie trzeba będzie jeszcze poczekać.

Od obrazów do wideo z dźwiękiem

Poprzednie modele z rodziny FLUX - w tym FLUX.1 Pro, FLUX.1 Dev i FLUX.1 Schnell - zbudowały reputację Black Forest Labs przede wszystkim na jakości generowania obrazów. Studio, założone przez część zespołu odpowiedzialnego za Stable Diffusion, błyskawicznie stało się jednym z najważniejszych graczy w segmencie modeli do syntezy wizualnej. FLUX.1 zadebiutował w sierpniu 2024 roku i niemal natychmiast zaczął pojawiać się jako silnik napędzający kolejne aplikacje i platformy kreatywne.

FLUX 3 to jakościowy skok w innym kierunku: model wychodzi poza nieruchomy obraz i wkracza w przestrzeń wideo oraz audio. Dwadzieścia sekund może brzmieć skromnie, ale w kontekście generatywnego wideo to całkowicie użyteczna długość - wystarczająca do tworzenia krótkich zajawek, materiałów reklamowych, animacji produktowych czy treści na social media. Kluczowym wyróżnikiem jest jednak dźwięk generowany razem z obrazem, nie osobno - to podejście, które skraca przepaść między narzędziem a gotowym materiałem do użycia.

Rynek, który rośnie w tempie niemożliwym do zignorowania

Black Forest Labs wchodzi na pole zarezerwowane dotąd dla Sory od OpenAI, Runway ML, Pika Labs czy Kling AI od chińskiego Kuaishou. Każdy z tych graczy oferuje własne podejście do generowania wideo - różnią się długością klipów, realizmem ruchu, możliwościami edycji i polityką dostępu. OpenAI przez długi czas utrzymywało Sorę w bardzo ograniczonej dystrybucji, co stworzyło lukę, którą agresywnie wypełniły narzędzia azjatyckich firm.

Dołączenie dźwięku do wideo to wciąż rzadkość w tej klasie narzędzi. Większość dostępnych rozwiązań wymaga od twórcy osobnego etapu: wygenerowania obrazu lub klipu, a następnie nałożenia muzyki, efektów dźwiękowych lub lektora z osobnego modelu. FLUX 3, przynajmniej według zapowiedzi, ma obsługiwać tę warstwę natywnie - co, jeśli jakość dźwięku okaże się porównywalna z wizualiami, może realnie zmienić workflow w produkcjach o niskim i średnim budżecie.

Ograniczony dostęp - co to oznacza w praktyce

Premiera w trybie limited release to w branży modeli generatywnych standard, który ma kilka uzasadnień naraz. Po pierwsze, pozwala zebrać feedback od wybranej grupy użytkowników zanim model trafi na serwery obsługujące miliony zapytań. Po drugie, daje czas na dopracowanie moderacji treści - generowanie wideo z dźwiękiem otwiera nowe możliwości tworzenia deepfake’ów i materiałów dezinformacyjnych, więc odpowiedzialne studio musi mieć systemy bezpieczeństwa gotowe przed masowym wdrożeniem. Po trzecie, ograniczona dostępność buduje oczekiwanie i pozwala kontrolować narrację medialną wokół premiery.

Dla twórców i deweloperów czekających w kolejce najważniejsze pytanie brzmi: kiedy pojawi się pełny dostęp i na jakich warunkach cenowych.

Black Forest Labs stosował dotąd model mieszany: modele Dev i Schnell trafiły na licencje otwarte (z zastrzeżeniami), podczas gdy Pro pozostało w pełni komercyjne. Nie wiadomo jeszcze, czy FLUX 3 pójdzie tą samą ścieżką - czy pojawi się jakaś wersja open-weight dla społeczności, czy model pozostanie wyłącznie za paywallem lub przez API.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co to zmienia dla rynku kreatywnego

Konwergencja obrazu, wideo i dźwięku w jednym modelu to nie tylko wygoda - to zmiana w architekturze całych pipeline’ów produkcyjnych. Agencje reklamowe, twórcy na YouTube i TikToku, małe studia gamingowe, firmy e-commerce produkujące dziesiątki krótkich materiałów tygodniowo - wszystkie te grupy operują dziś na zestawach różnych narzędzi spinanych skryptami i ręczną pracą. Model, który wygeneruje spójny klip z naturalnie brzmiącym dźwiękiem na podstawie jednego promptu, skraca ten proces dramatycznie.

Pytanie o jakość pozostaje otwarte do czasu, aż niezależni testerzy dostaną dostęp i zaczną publikować porównania. Black Forest Labs zbudowało wiarygodność na obrazach - FLUX.1 regularnie wygrywał benchmarki z Midjourney i DALL-E 3 w ocenach estetycznych i wierności promptowi. Przeniesienie tej jakości na wideo jest wyzwaniem nieporównywalnie większym: ruch, spójność obiektów między klatkami, synchronizacja dźwięku z obrazem - to problemy, z którymi zmagają się wszyscy producenci wideo AI, włącznie z OpenAI.

Jeśli FLUX 3 choćby zbliży się do poziomu poprzedników w swoich kategoriach, Black Forest Labs stanie się jedynym studio oferującym spójny ekosystem generatywny od obrazu po wideo z dźwiękiem - i to z otwartą architekturą przynajmniej części swoich modeli. To pozycja, o którą w tej chwili walczą wszyscy.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie