Grok Imagine Video 1.5: siedem referencji, ta sama twarz i głos w każdej scenie
Do siedmiu obrazów referencyjnych na generację rozwiązuje problem ciągłości między ujęciami. Prompty do wklejenia i cztery zasady z własnych klipów.

👁 112 przeczytań
- Imagine Video 1.5 pozwala podać do siedmiu obrazów referencyjnych na jedną generację, a każdy blokuje osobno twarz, produkt lub lokację.
- Referencja głosu sprawia, że postać zachowuje tę samą twarz i ten sam głos w każdej scenie, co umożliwia budowanie spójnej serii ujęć.
- Model generuje natywne wideo w rozdzielczości 1080p zarówno z tekstu, jak i z obrazu, bez konieczności podawania obrazu startowego.
Imagine Video 1.5 daje do siedmiu obrazów referencyjnych na jedną generację, a każdy blokuje jedną rzecz: twarz, produkt albo lokację. Do tego referencja głosu, więc postać ma tę samą twarz i ten sam głos w każdej scenie. To jest różnica między pojedynczym klipem a serią, która się klei.
Werdykt w jednym akapicie
Referencje rozwiązują problem, który do tej pory przekreślał generowane wideo w poważnej pracy: brak ciągłości. Dotąd druga scena miała inną twarz, inne światło i inny produkt. Teraz każda referencja blokuje jeden element - możesz zatrzymać postać i zmienić scenę, zatrzymać scenę i zmienić postać, albo zatrzymać oba i zmienić tylko akcję. Dochodzi do tego natywne 1080p i generowanie z samego tekstu, bez obrazu startowego.
Co dokładnie doszło
| Funkcja | Co daje |
|---|---|
| Referencje obrazu | Do siedmiu na generację, każda blokuje jeden element |
| Referencja głosu | Ta sama twarz i ten sam głos w każdej scenie |
| Tekst na wideo | Opisujesz ujęcie, nie potrzebujesz obrazu startowego |
| Natywne 1080p | Dla generowania z tekstu i z obrazu |
Jak myśleć o referencjach - to jest sedno
Najłatwiej zrozumieć to jako trzy suwaki, z których każdy można zablokować osobno:
- Trzymasz postać, zmieniasz scenę - ta sama osoba w pięciu różnych miejscach
- Trzymasz scenę, zmieniasz postać - różni ludzie w tym samym wnętrzu
- Trzymasz oba, zmieniasz akcję - ta sama osoba w tym samym miejscu robi coś innego
Ten trzeci wariant jest najcenniejszy przy serii. Pozwala zbudować scenę po ujęciu, zamiast generować pięć niezależnych klipów i liczyć, że do siebie pasują.
Gotowe prompty do sprawdzenia
1. Ujęcie ze statywu - test podstawowy
Static tripod shot, no camera movement. A leather suitcase stands alone on an empty bus station bench at night. Steam drifts slowly across the frame from the left. Cold blue light from a single overhead lamp. 6 seconds, 16:9, 1080p.
Dlaczego statyw: ruch kamery jest najszybszą drogą do efektu taniej generacji. Model musi wtedy utrzymać spójność geometrii sceny w ruchu, a na tym najczęściej się wykłada. Nieruchoma kamera i ruch w kadrze wyglądają dużo lepiej przy tym samym modelu.
2. Postać w serii ujęć
Najpierw wygeneruj obraz postaci, potem użyj go jako referencji:
Scena 1: Slow push-in on the character standing at a rain-streaked window, looking out. She does not move. 5 seconds.
Scena 2: Same character, now seated at a kitchen table, turning a coffee cup slowly in both hands. Static shot. 5 seconds.
Scena 3: Same character walking away down a narrow corridor, seen from behind. Static shot. 5 seconds.
W każdej generacji podajesz ten sam obraz referencyjny postaci. Twarz zostaje.
3. Produkt w ruchu
Static macro shot. A matte black cosmetic bottle on a white surface. A single drop of water runs down the label. Soft studio light from the left, one long shadow. No hands, no text, no people. 4 seconds, 1:1.
Cztery zasady, których nauczyłem się na własnych klipach
To są moje obserwacje z pracy z generatorami wideo, nie zalecenia producenta:
- Pisz prompty po angielsku, zawsze. Polskie prompty dają wyraźnie słabsze wyniki w każdym generatorze, z którym pracowałem.
- Nigdy nie proś o napisy ani tekst w kadrze. Generatory wideo robią z liter bełkot. Tekst dokładaj w montażu.
- Cztery do sześciu sekund na ujęcie. Dłuższe generacje rozjeżdżają się pod koniec - postać zaczyna się zmieniać, tło płynie.
- Statyw zamiast ruchu kamery. Powtarzam to celowo drugi raz, bo to jest jedna zmiana, która daje największą poprawę.
Przez API
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
Model nazywa się grok-imagine-video-1.5. Wywołanie przyjmuje prompt, listę adresów obrazów referencyjnych, długość, proporcje i rozdzielczość:
client.video.generate(prompt="...", model="grok-imagine-video-1.5", reference_image_urls=[...], duration=6, aspect_ratio="16:9", resolution="720p")
Referencje obrazu, generowanie z tekstu i natywne 1080p są w API. Referencja głosu jest dostępna na żądanie, czyli trzeba o nią poprosić osobno.
Czego nie oczekiwać
- Nie zrobisz z tego filmu w jednym kliknięciu. To narzędzie do ujęć, nie do scen. Montaż nadal jest po Twojej stronie.
- Dźwięk wymaga sprawdzenia. Producent pisze o lepszym audio, ale przy poważnej pracy i tak podkładasz własne.
- Referencja głosu nie jest domyślnie w API - dostępna na żądanie.
- Długie ujęcia nadal się rozjeżdżają. To ograniczenie całej kategorii, nie tego modelu.
Realny układ pracy
- Wygeneruj postać jako obraz w generatorze grafiki i zapisz go - to Twoja referencja na całą serię.
- Zrób to samo z lokacją, jeśli ma się powtarzać.
- Generuj ujęcia po 4-6 sekund, za każdym razem z tymi samymi referencjami.
- Montuj i dokładaj dźwięk poza generatorem.
- Napisy dopiero w montażu, nigdy w promptcie.
Ta kolejność wygląda na oczywistą, ale większość ludzi zaczyna od generowania ujęć i dopiero przy trzecim odkrywa, że nic do siebie nie pasuje.
Najczęstsze pytania
Ile referencji mogę podać?
Do siedmiu na jedną generację. Każda blokuje jeden element - twarz, produkt albo lokację.
Czy da się zrobić wideo bez obrazu startowego?
Tak, generowanie z samego tekstu jest ogólnie dostępne na grok.com/imagine oraz w aplikacjach na iOS i Androida.
Jaka rozdzielczość?
Natywne 1080p dla generowania z tekstu i z obrazu.
Czy postać zachowa ten sam głos?
Tak, przy podaniu obrazu postaci i referencji głosu oba trzymają się w każdej scenie. W API ta funkcja jest dostępna na żądanie.
Jak długie mogą być ujęcia?
Parametr długości ustawiasz w wywołaniu. Z praktyki: cztery do sześciu sekund daje najbardziej stabilny wynik, dłuższe generacje rozjeżdżają się pod koniec.
Źródła i data sprawdzenia
Funkcje, limit siedmiu referencji, nazwa modelu w API i parametry wywołania odczytane 21 września 2026 z oficjalnego ogłoszenia z 31 lipca 2026: x.ai/news/grok-imagine-video-1-5-references. Prompty przykładowe oraz cztery zasady i układ pracy pochodzą z mojej pracy z generatorami wideo, nie z materiałów producenta. Nie testowałem jeszcze tego konkretnego modelu - gdy to zrobię, dopiszę pomiar.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Ile obrazów referencyjnych można podać w Imagine Video 1.5?
Można podać do siedmiu obrazów referencyjnych na jedną generację. Każda referencja blokuje jeden konkretny element - twarz, produkt albo lokację.
Jak wygląda wywołanie modelu grok-imagine-video-1.5 przez API?
Wywołanie przyjmuje parametry: prompt, listę adresów obrazów referencyjnych, długość, proporcje i rozdzielczość. Referencja głosu nie jest domyślna - trzeba o nią poprosić osobno.
Czy Imagine Video 1.5 pozwala generować wideo bez obrazu startowego?
Tak, generowanie z samego tekstu jest ogólnie dostępne na grok.com/imagine oraz w aplikacjach na iOS i Androida. Model obsługuje natywne 1080p zarówno dla generowania z tekstu, jak i z obrazu.
Jak długie ujęcia warto generować w Imagine Video 1.5?
Najbardziej stabilny wynik dają ujęcia trwające cztery do sześciu sekund. Dłuższe generacje rozjeżdżają się pod koniec - postać zaczyna się zmieniać, a tło płynie.
