Przejdź do treści
Warsztat

Grok Imagine Video 1.5: siedem referencji, ta sama twarz i głos w każdej scenie

Do siedmiu obrazów referencyjnych na generację rozwiązuje problem ciągłości między ujęciami. Prompty do wklejenia i cztery zasady z własnych klipów.

5 min czytania
Grok Imagine Video 1.5: siedem referencji, ta sama twarz i głos w każdej scenie

👁 112 przeczytań

// w skrócie
  • Imagine Video 1.5 pozwala podać do siedmiu obrazów referencyjnych na jedną generację, a każdy blokuje osobno twarz, produkt lub lokację.
  • Referencja głosu sprawia, że postać zachowuje tę samą twarz i ten sam głos w każdej scenie, co umożliwia budowanie spójnej serii ujęć.
  • Model generuje natywne wideo w rozdzielczości 1080p zarówno z tekstu, jak i z obrazu, bez konieczności podawania obrazu startowego.

Imagine Video 1.5 daje do siedmiu obrazów referencyjnych na jedną generację, a każdy blokuje jedną rzecz: twarz, produkt albo lokację. Do tego referencja głosu, więc postać ma tę samą twarz i ten sam głos w każdej scenie. To jest różnica między pojedynczym klipem a serią, która się klei.

Werdykt w jednym akapicie

Referencje rozwiązują problem, który do tej pory przekreślał generowane wideo w poważnej pracy: brak ciągłości. Dotąd druga scena miała inną twarz, inne światło i inny produkt. Teraz każda referencja blokuje jeden element - możesz zatrzymać postać i zmienić scenę, zatrzymać scenę i zmienić postać, albo zatrzymać oba i zmienić tylko akcję. Dochodzi do tego natywne 1080p i generowanie z samego tekstu, bez obrazu startowego.

Co dokładnie doszło

FunkcjaCo daje
Referencje obrazuDo siedmiu na generację, każda blokuje jeden element
Referencja głosuTa sama twarz i ten sam głos w każdej scenie
Tekst na wideoOpisujesz ujęcie, nie potrzebujesz obrazu startowego
Natywne 1080pDla generowania z tekstu i z obrazu

Jak myśleć o referencjach - to jest sedno

Najłatwiej zrozumieć to jako trzy suwaki, z których każdy można zablokować osobno:

  • Trzymasz postać, zmieniasz scenę - ta sama osoba w pięciu różnych miejscach
  • Trzymasz scenę, zmieniasz postać - różni ludzie w tym samym wnętrzu
  • Trzymasz oba, zmieniasz akcję - ta sama osoba w tym samym miejscu robi coś innego

Ten trzeci wariant jest najcenniejszy przy serii. Pozwala zbudować scenę po ujęciu, zamiast generować pięć niezależnych klipów i liczyć, że do siebie pasują.

Gotowe prompty do sprawdzenia

1. Ujęcie ze statywu - test podstawowy

Static tripod shot, no camera movement. A leather suitcase stands alone on an empty bus station bench at night. Steam drifts slowly across the frame from the left. Cold blue light from a single overhead lamp. 6 seconds, 16:9, 1080p.

Dlaczego statyw: ruch kamery jest najszybszą drogą do efektu taniej generacji. Model musi wtedy utrzymać spójność geometrii sceny w ruchu, a na tym najczęściej się wykłada. Nieruchoma kamera i ruch w kadrze wyglądają dużo lepiej przy tym samym modelu.

2. Postać w serii ujęć

Najpierw wygeneruj obraz postaci, potem użyj go jako referencji:

Scena 1: Slow push-in on the character standing at a rain-streaked window, looking out. She does not move. 5 seconds.
Scena 2: Same character, now seated at a kitchen table, turning a coffee cup slowly in both hands. Static shot. 5 seconds.
Scena 3: Same character walking away down a narrow corridor, seen from behind. Static shot. 5 seconds.

W każdej generacji podajesz ten sam obraz referencyjny postaci. Twarz zostaje.

3. Produkt w ruchu

Static macro shot. A matte black cosmetic bottle on a white surface. A single drop of water runs down the label. Soft studio light from the left, one long shadow. No hands, no text, no people. 4 seconds, 1:1.

Cztery zasady, których nauczyłem się na własnych klipach

To są moje obserwacje z pracy z generatorami wideo, nie zalecenia producenta:

  1. Pisz prompty po angielsku, zawsze. Polskie prompty dają wyraźnie słabsze wyniki w każdym generatorze, z którym pracowałem.
  2. Nigdy nie proś o napisy ani tekst w kadrze. Generatory wideo robią z liter bełkot. Tekst dokładaj w montażu.
  3. Cztery do sześciu sekund na ujęcie. Dłuższe generacje rozjeżdżają się pod koniec - postać zaczyna się zmieniać, tło płynie.
  4. Statyw zamiast ruchu kamery. Powtarzam to celowo drugi raz, bo to jest jedna zmiana, która daje największą poprawę.

Przez API

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

Model nazywa się grok-imagine-video-1.5. Wywołanie przyjmuje prompt, listę adresów obrazów referencyjnych, długość, proporcje i rozdzielczość:

client.video.generate(prompt="...", model="grok-imagine-video-1.5", reference_image_urls=[...], duration=6, aspect_ratio="16:9", resolution="720p")

Referencje obrazu, generowanie z tekstu i natywne 1080p są w API. Referencja głosu jest dostępna na żądanie, czyli trzeba o nią poprosić osobno.

Czego nie oczekiwać

  • Nie zrobisz z tego filmu w jednym kliknięciu. To narzędzie do ujęć, nie do scen. Montaż nadal jest po Twojej stronie.
  • Dźwięk wymaga sprawdzenia. Producent pisze o lepszym audio, ale przy poważnej pracy i tak podkładasz własne.
  • Referencja głosu nie jest domyślnie w API - dostępna na żądanie.
  • Długie ujęcia nadal się rozjeżdżają. To ograniczenie całej kategorii, nie tego modelu.

Realny układ pracy

  1. Wygeneruj postać jako obraz w generatorze grafiki i zapisz go - to Twoja referencja na całą serię.
  2. Zrób to samo z lokacją, jeśli ma się powtarzać.
  3. Generuj ujęcia po 4-6 sekund, za każdym razem z tymi samymi referencjami.
  4. Montuj i dokładaj dźwięk poza generatorem.
  5. Napisy dopiero w montażu, nigdy w promptcie.

Ta kolejność wygląda na oczywistą, ale większość ludzi zaczyna od generowania ujęć i dopiero przy trzecim odkrywa, że nic do siebie nie pasuje.

Najczęstsze pytania

Ile referencji mogę podać?

Do siedmiu na jedną generację. Każda blokuje jeden element - twarz, produkt albo lokację.

Czy da się zrobić wideo bez obrazu startowego?

Tak, generowanie z samego tekstu jest ogólnie dostępne na grok.com/imagine oraz w aplikacjach na iOS i Androida.

Jaka rozdzielczość?

Natywne 1080p dla generowania z tekstu i z obrazu.

Czy postać zachowa ten sam głos?

Tak, przy podaniu obrazu postaci i referencji głosu oba trzymają się w każdej scenie. W API ta funkcja jest dostępna na żądanie.

Jak długie mogą być ujęcia?

Parametr długości ustawiasz w wywołaniu. Z praktyki: cztery do sześciu sekund daje najbardziej stabilny wynik, dłuższe generacje rozjeżdżają się pod koniec.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Funkcje, limit siedmiu referencji, nazwa modelu w API i parametry wywołania odczytane 21 września 2026 z oficjalnego ogłoszenia z 31 lipca 2026: x.ai/news/grok-imagine-video-1-5-references. Prompty przykładowe oraz cztery zasady i układ pracy pochodzą z mojej pracy z generatorami wideo, nie z materiałów producenta. Nie testowałem jeszcze tego konkretnego modelu - gdy to zrobię, dopiszę pomiar.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile obrazów referencyjnych można podać w Imagine Video 1.5?

Można podać do siedmiu obrazów referencyjnych na jedną generację. Każda referencja blokuje jeden konkretny element - twarz, produkt albo lokację.

Jak wygląda wywołanie modelu grok-imagine-video-1.5 przez API?

Wywołanie przyjmuje parametry: prompt, listę adresów obrazów referencyjnych, długość, proporcje i rozdzielczość. Referencja głosu nie jest domyślna - trzeba o nią poprosić osobno.

Czy Imagine Video 1.5 pozwala generować wideo bez obrazu startowego?

Tak, generowanie z samego tekstu jest ogólnie dostępne na grok.com/imagine oraz w aplikacjach na iOS i Androida. Model obsługuje natywne 1080p zarówno dla generowania z tekstu, jak i z obrazu.

Jak długie ujęcia warto generować w Imagine Video 1.5?

Najbardziej stabilny wynik dają ujęcia trwające cztery do sześciu sekund. Dłuższe generacje rozjeżdżają się pod koniec - postać zaczyna się zmieniać, a tło płynie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie