🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 7 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Tutoriale

Google Veo 3.1 - jak generować wideo z kilku zdjęć (krok po kroku)

Veo 3.1 obsługuje do 3 obrazów referencyjnych - tak zwane „Ingredients to Video”. Tutorial krok po kroku: jak kontrolować styl postaci i sceny, żeby wielokadrowość była spójna.

12 min czytania
Google Veo 3.1 - jak generować wideo z kilku zdjęć (krok po kroku)

👁 116 przeczytań

// w skrócie
  • Google Veo 3.1 obsługuje do trzech obrazów referencyjnych jednocześnie, z których model składa 8-sekundowy klip w rozdzielczości 1080p z natywnym dźwiękiem.
  • Dostęp do Veo 3.1 kosztuje od 19,99 USD miesięcznie w planie Google AI Pro, a darmowego dostępu nie ma - VideoFX ma tylko listę oczekujących.
  • Przez funkcję Extend można rozszerzać klipy do około 148 sekund przez Gemini API lub do 60 sekund przez Flow bez utraty spójności wyglądu postaci.

Google Veo 3.1 obsługuje do trzech obrazów referencyjnych jednocześnie. Nazywają to Ingredients to Video - i w praktyce to pierwszy model, który potrafi utrzymać postać, ubiór i akcesoria spójne w wielu scenach bez gimnastyki z promptami. Możesz wrzucić zdjęcie bohatera, zdjęcie tła i zdjęcie przedmiotu - Veo poskłada z tego 8-sekundowy klip z natywnym dźwiękiem. Wcześniej musiałeś się namęczyć, żeby ta sama twarz pojawiła się na dwóch klipach. Teraz wrzucasz referencje raz i działasz.

Tutorial obejmuje przygotowanie obrazów, strukturę promptu, ustawienia techniczne i konkretne przykłady do skopiowania. Na końcu porównamy, jak to wygląda względem Runway Gen-4.5 i promptowy.com/wlasnie-przetestowalem-kling-3-0-to-koniec-tradycyjnej-produkcji-wideo/">Kling 3.0. Zaczynamy.

Co osiągniesz po tym tutorialu

Po 20 minutach pracy będziesz potrafił wygenerować 8-sekundowy klip w 1080p z zachowaniem spójności postaci, tła i stylu. Konkretnie:

Stworzysz serię 3 obrazów referencyjnych z neutralnym tłem - bez konfliktów wizualnych w finalnym klipie. Napiszesz prompt kontrolujący kamerę, ruch, oświetlenie i dźwięk bez walki z modelem. Wykorzystasz rozszerzanie sceny (Extend) do 60 sekund lub więcej bez gubienia tożsamości postaci. Dostaniesz 5-8 konkretnych promptów do skopiowania - od prostego ujęcia po złożone dialogi.

Czego potrzebujesz przed startem

Zanim wygenerujesz pierwszy klip, upewnij się, że masz:

Dostęp do Veo 3.1: Google AI Pro ($19.99/miesiąc), Google AI Ultra, Vertex AI (płatny podgląd), Flow (przedpłata 1000 kredytów/miesiąc) lub Gemini API. Darmowego dostępu nie ma - VideoFX ma listę oczekujących. Trzy wysokiej jakości obrazy referencyjne: PNG lub JPEG, idealne 1024×1024 px lub więcej. Spójne oświetlenie i neutralne tło (białe, szare, rozmyte) - bez dodatkowych elementów w tle. Czas: 10-25 minut na pierwszy klip z iteracjami. Specyfikacje techniczne: Rozdzielczość 720p lub 1080p (4K w podglądzie Vertex AI/Flow/Gemini API), 24 FPS, 4/6/8 sekund natywnie, rozszerzanie do ~148 sekund przez API.

Protip ✅

W Europejskim Obszarze Gospodarczym, Szwajcarii i Wielkiej Brytanii funkcja generowania wideo z obrazu (Image-to-Video) jest ograniczona ze względu na lokalne przepisy AI. Sprawdź dostępność w swojej lokalizacji przed zakupem planu.

Krok 1: Przygotuj 3 obrazy referencyjne

To najważniejszy etap. Źle przygotowane obrazy = chaos w klipie. Veo 3.1 akceptuje do trzech obrazów referencyjnych na jedno wideo. Każdy obraz definiuje inny aspekt:

Obraz 1 - postać lub główny podmiot: Portret en face lub 3/4, neutralne tło, spójny ubiór (np. czerwony szalik, skórzana kurtka, złote kolczyki). Obraz 2 - tło lub scenografia: Lokalizacja bez postaci. Czyste ujęcie lokacji (ulica, kawiarnia, las). Obraz 3 - styl lub obiekt dodatkowy: Przedmiot (np. logo marki, butelka szamponu, samochód) lub tekstura stylizująca (np. neonowe światła, nocny klimat).

Kluczowe zasady przygotowania:

Neutralne tło na obrazach postaci i przedmiotów. Jeśli na zdjęciu stroju widać drzewa w tle, Veo wkomponuje je w finalny klip - nawet jeśli nie chciałeś. Spójne oświetlenie. Normalizuj światło na referencjach (dobrze oświetlone, neutralna temperatura barwowa). Model nie lubi walczyć z cieniami lub kolorowymi odcieniami. Wysoką rozdzielczość. Minimum 1024×1024 px. Niższa rozdzielczość wejścia = mniej detali na wyjściu. Unikaj filtrów stylizowanych na referencjach. Styl przenieś promptem, nie filtrem na obrazie.

Uwaga ⚠️

Veo 3.1 nie ma pamięci postaci. Każdy prompt jest interpretowany od nowa - bez konsekwentnego inputu dostaniesz dryf postaci (subtelne lub drastyczne zmiany wyglądu między klipami).

Krok 2: Strukturuj prompt dla Ingredients to Video

Prompt powinien zawierać trzy warstwy: opis wizualny, kontrolę kamery i wskazówki audio. Użyj tej formuły:

Warstwa 1 - Podmiot i akcja: Krótkie zdanie opisujące, co się dzieje (1-2 zdania). Warstwa 2 - Kamera i ruch: Typ ujęcia (medium shot, close-up), ruch kamery (dolly-in, pan left, tracking shot), obiektyw (35mm, 85mm), głębia ostrości (shallow focus, deep focus). Warstwa 3 - Oświetlenie i atmosfera: Pora dnia (golden hour, night), typ światła (backlight, neon-lit, soft diffused), nastrój (cinematic, noir, dreamy). Warstwa 4 - Dźwięk (opcjonalnie): Ambient (soft rain, distant traffic), efekty dźwiękowe (footsteps on marble, door creaking), dialogi (Woman says: „What did you find?”).

Przykład pełnego promptu:

A young woman with shoulder-length wavy black hair and green bomber jacket walks through a neon-lit alley at night. Medium shot, 35mm lens, shallow depth of field. Light rain, reflective pavement. Color contrast: teal and magenta neon accents. Audio: soft rain ambience, distant traffic, footsteps on wet concrete.

Analiza parametrów: Subject consistency anchor: „young woman with shoulder-length wavy black hair and green bomber jacket” - identyczny opis w każdym prompcie zachowuje tożsamość. Camera control: „Medium shot, 35mm lens, shallow depth of field” - precyzyjne sterowanie kompozycją kadru. Lighting cues: „neon-lit alley at night, light rain, reflective pavement” - atmosfera i nastrój. Audio layer: „soft rain ambience, distant traffic, footsteps” - natywny dźwięk zsynchronizowany z wizualizacją.

Protip ✅

Opisuj trwałe elementy tożsamości postaci identycznie w każdym prompcie: „ta sama kobieta, falowane czarne włosy do ramion, zielona kurtka pilotka, złote kolczyki.” Powtarzaj te linie dosłownie - nawet jeśli zmieniasz lokację lub akcję.

Krok 3: Wygeneruj pierwszy klip (8 sekund)

Otwórz Flow, Gemini API, Vertex AI lub aplikację Gemini. Wybierz tryb Ingredients to Video (lub Reference-to-Video w niektórych interfejsach). Prześlij trzy przygotowane obrazy referencyjne. Wklej prompt z Kroku 2. Ustaw parametry: Długość: 8 sekund, Rozdzielczość: 1080p (lub 720p jeśli testujesz), Proporcje: 16:9 (landscape) lub 9:16 (portrait dla YouTube Shorts), Liczba wyników: 2-4 warianty (domyślnie 1).

Kliknij Generate. Czas generacji: 1-2 minuty na klip w standardowym trybie, ~60-90 sekund w trybie Fast.

Przykład promptu dla pierwszego ujęcia:

Same woman from reference images, shoulder-length wavy black hair, green bomber jacket, gold hoop earrings. She walks slowly through a crowded city street during golden hour. Handheld tracking shot, 35mm lens, shallow focus on her face. Warm backlight, soft shadows. Audio: urban ambience, distant chatter, footsteps, light jazz in the background.

Co tutaj działa: Kotwica tożsamości: „Same woman from reference images” + pełny opis - Veo wie, że ma użyć referencji. Kontrola kamery: „Handheld tracking shot, 35mm lens” - nie abstrakty, konkretne parametry. Oświetlenie: „golden hour, warm backlight, soft shadows” - model rozumie kinową terminologię. Dźwięk: „urban ambience, distant chatter, footsteps, light jazz” - natywny audio bez potrzeby postprodukcji.

Krok 4: Iteruj i testuj warianty

Pierwszy klip nie będzie idealny. Veo 3.1 generuje od 1 do 4 wariantów jednorazowo - obejrzyj wszystkie i wybierz najlepszy. Co może pójść nie tak:

Dryf postaci: Twarz zmienia się między klipami. Rozwiązanie: Zamroź opis tożsamości (dosłownie kopiuj-wklej ten sam fragment opisu w każdym prompcie). Konflikt tła: Elementy z obrazu referencyjnego pojawiają się w nieoczekiwanych miejscach. Rozwiązanie: Użyj neutralnego tła na wszystkich referencjach postaci/przedmiotów. Zbyt szybki/wolny ruch: Kamera porusza się nienaturalnie. Rozwiązanie: Zmień tempo w prompcie: „slow dolly-in” zamiast „dolly-in.”

Przykład promptu z korektą tempa:

Same woman from reference, shoulder-length wavy black hair, green bomber jacket. She sits in a dimly lit cafe, sipping coffee and looking out the window. Static shot, 50mm lens, deep focus. Warm tungsten lighting, soft bokeh from window. Audio: cafe ambience, quiet jazz, coffee cup placed on table. Slow, contemplative pacing.

Zmiana: Dodano „Static shot” i „Slow, contemplative pacing” - model zwalnia akcję i trzyma kamerę w miejscu. To uczy model, że nie każde ujęcie musi mieć dynamiczny ruch.

Protip ✅

Zmieniaj jedną zmienną na raz (obiektyw, ruch lub światło), żebyś mógł się nauczyć z wyniku. Jeśli zmieniasz wszystko naraz, nie będziesz wiedział, co zadziałało.

Krok 5: Rozszerz klip do 60 sekund

Veo 3.1 natywnie generuje 4, 6 lub 8 sekund. Żeby stworzyć dłuższy klip, użyj funkcji Extend (Rozszerzenie Sceny). Jak to działa:

Model bierze ostatnią sekundę poprzedniego klipu i traktuje ją jako pierwszą klatkę nowego segmentu. Generuje kolejne 7-8 sekund rozszerzenia. Możesz powtórzyć proces do ~148 sekund (przez Gemini API) lub ~60 sekund (przez Flow/Gemini App).

Przykładowy scenariusz rozszerzania:

Ujęcie 1 (8 sekund):

Same woman walks through city street during golden hour. Tracking shot, 35mm lens. Audio: urban ambience.

Rozszerzenie 1 (7 sekund):

She stops in front of a street performer playing saxophone. Camera pans right to follow her gaze. Audio: saxophone melody, crowd applause.

Rozszerzenie 2 (7 sekund):

She smiles and drops a coin into the performer's hat. Close-up on her face, shallow focus. Audio: coin clink, soft "thank you" from performer.

Łączny czas: 8 + 7 + 7 = 22 sekundy spójnej narracji z zachowaniem tożsamości postaci.

Uwaga ⚠️

Utrzymywanie idealnej spójności postaci przez wiele rozszerzeń (powyżej 60 sekund) jest trudne. Subtelne różnice w rysach twarzy, szczegółach ubrania lub proporcjach mogą się pojawić. Zawsze przeglądaj wyniki i regeneruj klipy, które nie pasują.

Krok 6: Używaj Ingredients to Video do marek i produktów

Ingredients to Video świetnie sprawdza się w brandingu. Możesz wrzucić logo firmy jako obraz referencyjny i Veo utrzyma go konsekwentnie w każdym ujęciu - jako intro kinowe lub watermark.

Przykład promptu dla spotu brandingowego:

A sleek silver sports car drives through a mountain road at sunset. Low-angle tracking shot, 24mm wide lens. Brand logo visible on the side of the car. Golden hour lighting, lens flare from setting sun. Audio: engine roar, wind rushing, cinematic orchestral score.

Co dodać do referencji: Obraz 1: Logo marki (PNG z przezroczystym tłem). Obraz 2: Samochód (zdjęcie produktu z neutralnym tłem). Obraz 3: Górska droga (lokalizacja bez pojazdów).

Veo złoży te elementy w spójny klip, gdzie logo pozostaje czytelne, a produkt - rozpoznawalny.

Przykładowe prompty - gotowe do skopiowania

Poniżej znajdziesz 8 konkretnych promptów dla różnych scenariuszy. Skopiuj, zmień zmienne (opis postaci, lokacja, dźwięk) i generuj.

1. Dialog dwóch postaci w kawiarni

Medium shot of two people sitting at a cafe table, engaged in conversation. A woman with short blonde hair and red sweater leans forward, speaking. A man with dark hair and glasses listens, nodding. 50mm lens, shallow focus on woman's face. Warm tungsten lighting, soft bokeh from window. Woman says: "This must be it. That's the secret code." Man replies: "What did you find?" Audio: cafe ambience, quiet chatter, coffee cups clinking.

2. Postać w deszczu - neonowe światła

A young man with black leather jacket and scarf walks through a rainy alley at night. Slow dolly-in, 35mm lens, shallow depth of field. Neon signs reflect on wet pavement. Teal and magenta color grading. Audio: heavy rain, distant traffic, footsteps splashing in puddles.

3. Produkt - butelka szamponu w dłoni

Close-up of a woman's hand holding a bottle of shampoo, rotating it slowly to show the label. 85mm macro lens, shallow focus. Soft diffused lighting, white background. Audio: gentle whoosh as bottle rotates, soft background music (calm, spa-like).

4. Postać w lesie - atmosfera grozy

A hooded figure walks through a foggy forest at dawn. Handheld tracking shot, 24mm wide lens. Low-key lighting, silhouette against mist. Branches snap underfoot. Audio: wind rustling leaves, distant crow cawing, heavy breathing.

5. Sportowiec - trening na bieżni

A male athlete runs on a treadmill in a modern gym. Side tracking shot, 35mm lens. High-key lighting, clean white walls. Slow-motion effect. Audio: rhythmic footsteps, heavy breathing, electronic workout music.

6. Logo intro - kinowe ujęcie

A company logo appears in the center of the frame, glowing with soft light. Camera slowly pushes in, 50mm lens. Dark background with subtle light rays. Audio: deep cinematic bass, orchestral swell, logo "whoosh" sound effect.

7. Postać śpiewa - ujęcie z tyłu na scenę

Over-the-shoulder shot of a female singer on stage, microphone in hand. Camera performs a 180-degree arc shot, starting front-facing and circling to POV from behind her. Dramatic spotlight, dark stage. Singer sings: "When you look me in the eyes, I can see a million stars." Audio: live singing, crowd cheering, soft instrumental backing.

8. Postać na dachu - timelapse zachodu słońca

A woman stands on a rooftop at sunset, arms outstretched. Static wide shot, 24mm lens, deep focus. Sky transitions from orange to purple as clouds move. Audio: city ambience below, wind blowing, soft emotional piano score.

Porównanie z konkurencją

Jak Veo 3.1 Ingredients to Video wypada względem Runway Gen-4.5, Kling 3.0 i Sora 2?

Runway Gen-4.5: Silniejsza kontrola stylizacyjna, ale słabsza spójność postaci między ujęciami. Nie ma natywnego dźwięku - musisz dodać audio w postprodukcji. Szybsza generacja (~60 sekund na klip). Kling 3.0: Obsługuje dłuższe klipy (do 10 sekund bez rozszerzania), ale powyżej tego progu zaczyna halucynować ruch. Spójność postaci lepsza niż w Kling 2.0, ale wciąż gorsza niż w Veo 3.1. Brak natywnego audio. Sora 2: Najwyższa jakość wizualna, ale brak funkcji referencyjnych obrazów w publicznej wersji (tylko tekst-do-wideo). Generacja trwa 3-5 minut na klip. Brak natywnego audio. Veo 3.1: Najlepsza spójność postaci dzięki Ingredients to Video (do 3 obrazów referencyjnych). Natywny dźwięk (dialogi, efekty, ambient) zsynchronizowany z wizualizacją. Rozszerzanie do ~148 sekund przez API. Obsługa pionowego formatu 9:16 bez kadrowania. Przeskalowanie do 4K (w podglądzie Vertex AI/Flow/Gemini API).

Protip ✅

Jeśli tworzysz YouTube Shorts, TikToki lub Instagram Reels, Veo 3.1 to jedyny model z natywnym wsparciem dla 9:16 bez utraty jakości. Runway i Kling wymagają kadrowania lub postprodukcji.

Najczęstsze problemy i jak je naprawić

Problem: Postać zmienia wygląd między klipami. Rozwiązanie: Użyj 2-3 wysokiej jakości obrazów referencyjnych tego samego stroju i fryzury. Powtarzaj identyczny opis tożsamości w każdym prompcie. Problem: Tło z obrazu referencyjnego miesza się z innym tłem. Rozwiązanie: Używaj neutralnego tła na obrazach postaci i przedmiotów (białe, szare, rozmyte). Problem: Ruch kamery jest zbyt szybki lub chaotyczny. Rozwiązanie: Dodaj tempo do promptu: „slow dolly-in,” „static shot,” „gentle pan left.” Problem: Dźwięk nie pasuje do wizualizacji. Rozwiązanie: Opisz dźwięk szczegółowo w prompcie: „footsteps on gravel, not on pavement,” „soft rain, not heavy downpour.” Problem: Generacja zajmuje więcej niż 2 minuty. Rozwiązanie: Użyj Veo 3.1 Fast zamiast Standard (generacja ~60 sekund, niewielki spadek jakości). Problem: Nie mogę wygenerować wideo dłuższego niż 8 sekund. Rozwiązanie: Użyj funkcji Extend w Flow lub API do łączenia segmentów (do ~60 sekund w Flow, ~148 sekund przez API).

Co dalej - praktyczne zastosowania

Veo 3.1 Ingredients to Video to nie tylko zabawka - to narzędzie produkcyjne. Kto już z tego korzysta:

Marketerzy: Tworzą spoty reklamowe z konsekwentnym brandingiem (logo, produkt, postać) za ułamek kosztu tradycyjnej produkcji. Przykład: Ratusz w Ulianopolis (Brazylia) stworzył spot promocyjny za 52 USD zamiast 17 000 USD. Twórcy YouTube Shorts i TikTok: Natywne wsparcie 9:16 i integracja z YouTube Shorts/YouTube Create umożliwia tworzenie treści mobilnych bez kadrowania. Agencje kreatywne: Szybkie prototypowanie konceptów wideo przed pełną produkcją. Klient widzi wersję roboczą w 10 minut, nie w 2 tygodnie. Filmowcy niezależni: Wstępna wizualizacja scen (previz) z kontrolą oświetlenia, ruchu kamery i stylu - przed wyjściem na plan. Twórcy AI influencerów: Konsekwentna postać wirtualna w różnych lokacjach i scenach - bez zmiany twarzy między klipami.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

I co z tego dla Ciebie

Veo 3.1 Ingredients to Video nie wymaga szczęścia - wymaga metody. Przygotuj referencje raz, naucz się struktury promptu i powtarzaj proces. Spójność postaci przestała być loterią. Natywny dźwięk oszczędza godziny postprodukcji. Rozszerzanie sceny do 60 sekund (lub więcej przez API) daje swobodę narracyjną.

Czy to zastępuje tradycyjną produkcję wideo? Nie dla dużych, złożonych projektów. Ale do prototypowania, treści na media społecznościowe, spotów z niskim budżetem i wstępnej wizualizacji - Veo 3.1 to przełom. Zaczynaj od małych ujęć, zapisuj co działa, rozszerzaj małymi krokami.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile obrazów referencyjnych przyjmuje Google Veo 3.1 przy generowaniu wideo?

Veo 3.1 przyjmuje maksymalnie trzy obrazy referencyjne jednocześnie. Można wrzucić osobno zdjęcie postaci, zdjęcie tła i zdjęcie przedmiotu lub stylu - model składa z tego jeden klip.

Jak długie wideo generuje Veo 3.1 i czy można je przedłużyć?

Natywnie Veo 3.1 generuje klipy o długości 4, 6 lub 8 sekund. Funkcja Extend pozwala rozszerzać nagranie do około 148 sekund przez Gemini API lub do około 60 sekund przez Flow i aplikację Gemini.

Jakie wymagania muszą spełniać zdjęcia referencyjne dla Veo 3.1?

Obrazy powinny mieć format PNG lub JPEG i rozdzielczość co najmniej 1024x1024 pikseli. Zalecane jest neutralne tło (białe, szare lub rozmyte) oraz spójne oświetlenie bez kolorowych odcieni i filtrów stylizowanych.

Czy Veo 3.1 działa w Polsce i innych krajach Unii Europejskiej?

W Europejskim Obszarze Gospodarczym, Szwajcarii i Wielkiej Brytanii funkcja generowania wideo z obrazu jest ograniczona ze względu na lokalne przepisy dotyczące AI. Przed zakupem planu trzeba sprawdzić dostępność w swojej lokalizacji.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie