Jak zrobić wideo z obrazu w Vidu Q4: poradnik z poleceniami
Obraz startowy, polecenie do ruchu, kamery i dźwięku, 8 gotowych poleceń, koszty i przykład przez API Vidu i fal.ai.

👁 117 przeczytań
- Vidu Q4 Preview działa wyłącznie w trybie Image to Video - zawsze wymaga obrazu startowego, nie ma opcji generowania wideo z samego tekstu.
- Koszt 8-sekundowego klipu w 1080p wynosi 0,67 USD na fal.ai (promocja do 30 listopada) lub ok. 0,96 USD przez API Vidu.
- Polecenie do ruchu powinno opisywać kolejno: akcję, ruch kamery, dialog, dźwięk i ograniczenia - nie opisywać tego, co już widać na obrazie.
Vidu Q4 Preview nie robi wideo z samego tekstu - zawsze zaczyna od obrazu. To dobra wiadomość, bo kontrolujesz kadr, postać i światło, zanim wydasz pierwszego centa na wideo. W tym poradniku pokazuję, jak przygotować obraz startowy, jak pisać polecenia do ruchu, kamery i dźwięku, ile to kosztuje i jak to zrobić przez API. Ogólne informacje o modelu (ranking, ceny, plany) są w przewodniku Vidu Q4.
Stan na 8 października 2026
- Tryb: Image to Video - jeden obraz jako pierwsza klatka + opis ruchu.
- Klip: 3-16 s, od 540p do 4K, dźwięk domyślnie włączony.
- Obraz: png, jpg lub webp, do 50 MB, proporcje nie bardziej skrajne niż 1:4 lub 4:1.
- Koszt 8 s: 0,25 USD w 540p, 0,53 USD w 720p, 0,67 USD w 1080p (fal.ai do 30.11); w API Vidu ok. 40% więcej.
- Uwaga: polecenia na tej stronie to mój zestaw testowy. Własnych klipów z Q4 jeszcze nie mam - dopiszę je po teście.
Krok 1. Przygotuj obraz startowy
W trybie obraz na wideo pierwsza klatka filmu to dokładnie Twój obraz. Model nie poprawi źle skadrowanego zdjęcia, więc cała praca nad kompozycją dzieje się tutaj. Na co zwracam uwagę:
- Proporcje gotowego filmu. W trybie Image to Video wideo dostaje proporcje obrazu. Na YouTube daj 16:9, na rolki 9:16. Obraz przytnij przed wgraniem.
- Miejsce na ruch. Jeśli postać ma wyjść z kadru albo kamera ma odjechać, zostaw wokół niej przestrzeń. Ciasny portret nie zamieni się w plan ogólny.
- Bez napisów na obrazie, chyba że mają zostać. Model wideo często zniekształca litery w ruchu, a polskie znaki szczególnie.
- Rozdzielczość co najmniej taka jak wideo. Do 1080p wystarczy obraz 1920 px szerokości; do 4K daj 3840 px.
- Twarze prawdziwych osób tylko za ich zgodą. Klipy z planu Free nie mogą też trafić do użytku komercyjnego.
Obraz możesz zrobić w dowolnym generatorze. Przegląd tych, które dobrze trzymają polecenie, jest w tekście Generatory obrazów AI, a w Arenie generatorów obrazów możesz porównać je na tych samych zadaniach.
Krok 2. Napisz polecenie do ruchu
Polecenie do wideo z obrazu nie opisuje tego, co już widać, tylko to, co ma się wydarzyć. Używam stałej kolejności:
- Akcja - kto i co robi, w czasie teraźniejszym („She lifts the cup and smiles”).
- Kamera - statyczna, najazd (dolly-in), obrót wokół obiektu (orbit), kamera z ręki, cięcie na zbliżenie.
- Dialog - dokładne słowa w cudzysłowie i informacja, kto mówi i w jakim języku.
- Dźwięk - tło, efekty, czy ma być muzyka („no music”, jeśli nie chcesz podkładu).
- Ograniczenia - „no subtitles, no on-screen text”, „real-time speed, no slow motion”.
Polecenie piszę po angielsku, bo modele wideo lepiej je rozumieją, ale kwestie mówione zostawiam po polsku w cudzysłowie. Vidu domyślnie włącza też automatyczne ulepszanie polecenia (parametr is_rec w API). Gdy zależy mi na dosłownym wykonaniu, wyłączam je.
Krok 3. Gotowe polecenia (mój zestaw testowy)
Każde polecenie zakłada konkretny obraz startowy, opisany w pierwszej kolumnie. Te same sceny testuję na innych modelach, więc wyniki będzie można porównać.
| Obraz startowy | Polecenie | Co sprawdza |
|---|---|---|
| Kobieta przy stole w kuchni, patrzy w obiektyw | She smiles and says clearly in Polish: „W Szczebrzeszynie chrząszcz brzmi w trzcinie, a ja płacę trzydzieści dwa złote.” Static camera, natural lip sync, quiet room tone, no music, no subtitles. | polska mowa, ruch ust |
| Dwóch zawodników na mokrym dachu nocą | They start a fast kung fu fight: punches, a spinning kick, one fighter lands on his back and rolls up. Handheld camera follows the action, two quick cuts, rain splashes, impact sounds and heavy rain audio. | akcja i cięcia |
| Rynek starego miasta nocą, tłum od tyłu | Fireworks explode above the square, sparks and smoke drift down, light flickers on the facades and faces, the camera slowly cranes up. Loud firework bangs and crowd cheering. | efekty VFX |
| Pusta szklanka i dzbanek wody na stole | A hand lifts the pitcher and pours water into the glass until it overflows and spills onto the table into a puddle. Real-time speed, realistic physics, sound of pouring water. | fizyka cieczy |
| Czarny młynek do kawy na marmurze | Slow dolly-in, beans pour into the grinder, it starts grinding, fine coffee powder falls, steam from a cup in the background. Crisp ASMR grinding sound, no music. | reklama produktu |
| Portret starszego mężczyzny w warsztacie | He looks up from his work, takes off his glasses and says warmly in Polish: „Dobra robota wymaga czasu.” Slow push-in to a close-up, soft workshop ambience. | emocje i zbliżenie |
| Pies na plaży, zachód słońca | The dog runs toward the camera along the waterline, splashing water, the camera tracks backward at the same speed. Waves and happy barking, no music. | ruch kamery z obiektem |
| Ilustracja w stylu komiksu: bohaterka na dachu | Keep the comic book art style. Her cape flutters, she jumps to the next roof, the camera follows in one continuous shot. Wind and whoosh sounds. | trzymanie stylu |
Krok 4. Wybierz długość i rozdzielczość
Płacisz za każdą sekundę, a cena rośnie szybko z rozdzielczością. Moja zasada: próby w 540p albo 720p, finał w 1080p, 4K tylko wtedy, gdy naprawdę jest potrzebne.
| Ustawienie | fal.ai do 30.11 | API Vidu / WaveSpeedAI | Kiedy |
|---|---|---|---|
| 5 s, 540p | 0,16 USD | 0,23 USD | szybkie próby ruchu |
| 5 s, 720p | 0,33 USD | 0,48 USD | rolki, podglądy |
| 8 s, 1080p | 0,67 USD | 0,96 USD | gotowy klip na YouTube |
| 16 s, 1080p | 1,34 USD | 1,92 USD | dłuższe ujęcie z dialogiem |
| 8 s, 4K | 2,18 USD | 3,12 USD | montaż, duży ekran |
Stawki: fal.ai (promocja -30% do 30 listopada) i WaveSpeedAI, zgodne z ceną standardową Vidu (0,005 USD za kredyt). Dźwięk nie zmienia ceny.
Krok 5a. W przeglądarce: vidu.com
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
- Otwórz vidu.com/vidu-q4 i zaloguj się.
- W polu tworzenia przełącz tryb z „Reference to Video” na „Image to Video”.
- Wgraj obraz, wklej polecenie, ustaw długość i rozdzielczość.
- Uruchom generowanie i pobierz klip z biblioteki.
Na planie Free Vidu Q4 w 540p kosztuje 4 kredyty za sekundę, na planach płatnych (od 10 USD miesięcznie) 2 kredyty. Szczegóły planów są w przewodniku po Vidu Q4.
Krok 5b. Przez API
Oficjalne API Vidu przyjmuje obraz jako adres URL albo Base64. Tak wygląda zapytanie z dokumentacji (klucz zastąp swoim):
curl -X POST https://api.vidu.com/ent/v2/img2video \
-H "Authorization: Token TWOJ_KLUCZ" \
-H "Content-Type: application/json" \
-d '{
"model": "viduq4-preview",
"images": ["https://twoja-domena.pl/kadr.jpg"],
"prompt": "Slow dolly-in, beans pour into the grinder, crisp ASMR grinding sound, no music.",
"duration": 8,
"resolution": "1080p",
"audio": true,
"is_rec": false
}'Odpowiedź zawiera task_id. Wynik odbierasz z GET https://api.vidu.com/ent/v2/tasks/{task_id}/creations - adres pliku działa 24 godziny, więc pobierz go od razu.
Na fal.ai to samo robi krótki skrypt w Pythonie (pakiet requests, klucz w zmiennej FAL_KEY):
import base64, os, time, requests
H = {"Authorization": "Key " + os.environ["FAL_KEY"]}
obraz = "data:image/png;base64," + base64.b64encode(open("kadr.png", "rb").read()).decode()
zadanie = requests.post(
"https://queue.fal.run/fal-ai/vidu/q4/image-to-video", headers=H,
json={"image_url": obraz, "prompt": "Slow dolly-in, crisp ASMR grinding sound, no music.",
"duration": 8, "resolution": "720p"}).json()
while requests.get(zadanie["status_url"], headers=H).json().get("status") != "COMPLETED":
time.sleep(10)
wynik = requests.get(zadanie["response_url"], headers=H).json()
open("klip.mp4", "wb").write(requests.get(wynik["video"]["url"]).content)Uczciwie o teście: ten kod jest skrótem mojego skryptu testowego. 8 października sprawdziłem go do momentu wysłania zadania - fal.ai odrzucił je z powodu wyczerpanego salda na moim koncie, więc pełnego przebiegu z gotowym plikiem jeszcze nie mam. Nazwy pól (image_url, prompt, duration, resolution, seed) są zgodne ze schematem API fal.ai dla tego modelu. Skrypt uzupełnię wynikami po teście.
Najczęstsze błędy
- Opisywanie obrazu zamiast ruchu. „Kobieta w czerwonym płaszczu na ulicy” nic nie mówi modelowi, bo to już widać. Napisz, co ma zrobić.
- Za dużo zdarzeń na kilka sekund. W 5 sekundach zmieści się jedna akcja i jeden ruch kamery. Na więcej daj 10-16 s albo dwa klipy.
- Brak „no music”. Modele z dźwiękiem chętnie dokładają podkład, który potem przeszkadza w montażu.
- Napisy w kadrze. Jeśli obraz startowy ma tekst, sprawdź go w ostatniej klatce - ruch kamery potrafi go zniekształcić.
- Generowanie od razu w 4K. Najpierw dopracuj ruch w 540p, gdzie sekunda kosztuje ponad 8 razy mniej.
- Nieodebrany plik. W API Vidu link do wyniku wygasa po 24 godzinach.
A jeśli nie masz obrazu?
Vidu Q4 nie ma trybu tekst na wideo. Jeśli chcesz zacząć od samego opisu, użyj modelu, który to potrafi - w moim rankingu najlepiej wypadł Wan 3.0, a tuż za nim MiniMax H3 Max. Porównanie Vidu Q4 z najmocniejszymi rywalami jest w tekście Vidu Q4 vs Seedance 2.0 vs MiniMax H3, a wcześniejszy poradnik o ożywianiu zdjęć na innym modelu: Wan 3.0: obraz do wideo.
Źródła: dokumentacja API Vidu Q4 (Image to Video), fal.ai Vidu Q4, WaveSpeedAI, plany vidu.com. Sprawdzone 8 października 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Jakie formaty obrazu obsługuje Vidu Q4 w trybie Image to Video?
Vidu Q4 przyjmuje pliki PNG, JPG i WebP o maksymalnym rozmiarze 50 MB. Proporcje obrazu nie mogą być bardziej skrajne niż 1:4 lub 4:1, a wideo automatycznie dziedziczy proporcje wgranego obrazu.
Ile kosztuje generowanie wideo w Vidu Q4 w zależności od rozdzielczości?
Klip 8 s w 540p kosztuje 0,25 USD, w 720p - 0,53 USD, a w 1080p - 0,67 USD na fal.ai (ceny promocyjne do 30 listopada). Przez API Vidu stawki są ok. 40% wyższe, a dźwięk nie zmienia ceny.
Jak przez API Vidu Q4 wygenerować wideo z obrazu?
Wysyłasz zapytanie POST na adres https://api.vidu.com/ent/v2/img2video z obrazem podanym jako URL lub Base64, modelem viduq4-preview i parametrami takimi jak duration, resolution i audio. Odpowiedź zwraca task_id, a link do gotowego pliku wygasa po 24 godzinach, więc trzeba go pobrać od razu.
Co zrobić, jeśli chcę generować wideo tylko z opisu tekstowego bez obrazu?
Vidu Q4 nie obsługuje trybu tekst na wideo. Według artykułu najlepiej do tego celu nadaje się Wan 3.0, a tuż za nim MiniMax H3 Max.
