✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Jak zrobić wideo z obrazu w Vidu Q4: poradnik z poleceniami

Obraz startowy, polecenie do ruchu, kamery i dźwięku, 8 gotowych poleceń, koszty i przykład przez API Vidu i fal.ai.

7 min czytania
Logo Vidu i napis Vidu Q4 - poradnik: wideo z obrazu krok po kroku

👁 116 przeczytań

// w skrócie
  • Vidu Q4 Preview działa wyłącznie w trybie Image to Video - zawsze wymaga obrazu startowego, nie ma opcji generowania wideo z samego tekstu.
  • Koszt 8-sekundowego klipu w 1080p wynosi 0,67 USD na fal.ai (promocja do 30 listopada) lub ok. 0,96 USD przez API Vidu.
  • Polecenie do ruchu powinno opisywać kolejno: akcję, ruch kamery, dialog, dźwięk i ograniczenia - nie opisywać tego, co już widać na obrazie.

Vidu Q4 Preview nie robi wideo z samego tekstu - zawsze zaczyna od obrazu. To dobra wiadomość, bo kontrolujesz kadr, postać i światło, zanim wydasz pierwszego centa na wideo. W tym poradniku pokazuję, jak przygotować obraz startowy, jak pisać polecenia do ruchu, kamery i dźwięku, ile to kosztuje i jak to zrobić przez API. Ogólne informacje o modelu (ranking, ceny, plany) są w przewodniku Vidu Q4.

Stan na 8 października 2026

  • Tryb: Image to Video - jeden obraz jako pierwsza klatka + opis ruchu.
  • Klip: 3-16 s, od 540p do 4K, dźwięk domyślnie włączony.
  • Obraz: png, jpg lub webp, do 50 MB, proporcje nie bardziej skrajne niż 1:4 lub 4:1.
  • Koszt 8 s: 0,25 USD w 540p, 0,53 USD w 720p, 0,67 USD w 1080p (fal.ai do 30.11); w API Vidu ok. 40% więcej.
  • Uwaga: polecenia na tej stronie to mój zestaw testowy. Własnych klipów z Q4 jeszcze nie mam - dopiszę je po teście.

Krok 1. Przygotuj obraz startowy

W trybie obraz na wideo pierwsza klatka filmu to dokładnie Twój obraz. Model nie poprawi źle skadrowanego zdjęcia, więc cała praca nad kompozycją dzieje się tutaj. Na co zwracam uwagę:

  • Proporcje gotowego filmu. W trybie Image to Video wideo dostaje proporcje obrazu. Na YouTube daj 16:9, na rolki 9:16. Obraz przytnij przed wgraniem.
  • Miejsce na ruch. Jeśli postać ma wyjść z kadru albo kamera ma odjechać, zostaw wokół niej przestrzeń. Ciasny portret nie zamieni się w plan ogólny.
  • Bez napisów na obrazie, chyba że mają zostać. Model wideo często zniekształca litery w ruchu, a polskie znaki szczególnie.
  • Rozdzielczość co najmniej taka jak wideo. Do 1080p wystarczy obraz 1920 px szerokości; do 4K daj 3840 px.
  • Twarze prawdziwych osób tylko za ich zgodą. Klipy z planu Free nie mogą też trafić do użytku komercyjnego.

Obraz możesz zrobić w dowolnym generatorze. Przegląd tych, które dobrze trzymają polecenie, jest w tekście Generatory obrazów AI, a w Arenie generatorów obrazów możesz porównać je na tych samych zadaniach.

Krok 2. Napisz polecenie do ruchu

Polecenie do wideo z obrazu nie opisuje tego, co już widać, tylko to, co ma się wydarzyć. Używam stałej kolejności:

  1. Akcja - kto i co robi, w czasie teraźniejszym („She lifts the cup and smiles”).
  2. Kamera - statyczna, najazd (dolly-in), obrót wokół obiektu (orbit), kamera z ręki, cięcie na zbliżenie.
  3. Dialog - dokładne słowa w cudzysłowie i informacja, kto mówi i w jakim języku.
  4. Dźwięk - tło, efekty, czy ma być muzyka („no music”, jeśli nie chcesz podkładu).
  5. Ograniczenia - „no subtitles, no on-screen text”, „real-time speed, no slow motion”.

Polecenie piszę po angielsku, bo modele wideo lepiej je rozumieją, ale kwestie mówione zostawiam po polsku w cudzysłowie. Vidu domyślnie włącza też automatyczne ulepszanie polecenia (parametr is_rec w API). Gdy zależy mi na dosłownym wykonaniu, wyłączam je.

Krok 3. Gotowe polecenia (mój zestaw testowy)

Każde polecenie zakłada konkretny obraz startowy, opisany w pierwszej kolumnie. Te same sceny testuję na innych modelach, więc wyniki będzie można porównać.

Obraz startowyPolecenieCo sprawdza
Kobieta przy stole w kuchni, patrzy w obiektywShe smiles and says clearly in Polish: „W Szczebrzeszynie chrząszcz brzmi w trzcinie, a ja płacę trzydzieści dwa złote.” Static camera, natural lip sync, quiet room tone, no music, no subtitles.polska mowa, ruch ust
Dwóch zawodników na mokrym dachu nocąThey start a fast kung fu fight: punches, a spinning kick, one fighter lands on his back and rolls up. Handheld camera follows the action, two quick cuts, rain splashes, impact sounds and heavy rain audio.akcja i cięcia
Rynek starego miasta nocą, tłum od tyłuFireworks explode above the square, sparks and smoke drift down, light flickers on the facades and faces, the camera slowly cranes up. Loud firework bangs and crowd cheering.efekty VFX
Pusta szklanka i dzbanek wody na stoleA hand lifts the pitcher and pours water into the glass until it overflows and spills onto the table into a puddle. Real-time speed, realistic physics, sound of pouring water.fizyka cieczy
Czarny młynek do kawy na marmurzeSlow dolly-in, beans pour into the grinder, it starts grinding, fine coffee powder falls, steam from a cup in the background. Crisp ASMR grinding sound, no music.reklama produktu
Portret starszego mężczyzny w warsztacieHe looks up from his work, takes off his glasses and says warmly in Polish: „Dobra robota wymaga czasu.” Slow push-in to a close-up, soft workshop ambience.emocje i zbliżenie
Pies na plaży, zachód słońcaThe dog runs toward the camera along the waterline, splashing water, the camera tracks backward at the same speed. Waves and happy barking, no music.ruch kamery z obiektem
Ilustracja w stylu komiksu: bohaterka na dachuKeep the comic book art style. Her cape flutters, she jumps to the next roof, the camera follows in one continuous shot. Wind and whoosh sounds.trzymanie stylu

Krok 4. Wybierz długość i rozdzielczość

Płacisz za każdą sekundę, a cena rośnie szybko z rozdzielczością. Moja zasada: próby w 540p albo 720p, finał w 1080p, 4K tylko wtedy, gdy naprawdę jest potrzebne.

Ustawieniefal.ai do 30.11API Vidu / WaveSpeedAIKiedy
5 s, 540p0,16 USD0,23 USDszybkie próby ruchu
5 s, 720p0,33 USD0,48 USDrolki, podglądy
8 s, 1080p0,67 USD0,96 USDgotowy klip na YouTube
16 s, 1080p1,34 USD1,92 USDdłuższe ujęcie z dialogiem
8 s, 4K2,18 USD3,12 USDmontaż, duży ekran

Stawki: fal.ai (promocja -30% do 30 listopada) i WaveSpeedAI, zgodne z ceną standardową Vidu (0,005 USD za kredyt). Dźwięk nie zmienia ceny.

Krok 5a. W przeglądarce: vidu.com

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

  1. Otwórz vidu.com/vidu-q4 i zaloguj się.
  2. W polu tworzenia przełącz tryb z „Reference to Video” na „Image to Video”.
  3. Wgraj obraz, wklej polecenie, ustaw długość i rozdzielczość.
  4. Uruchom generowanie i pobierz klip z biblioteki.

Na planie Free Vidu Q4 w 540p kosztuje 4 kredyty za sekundę, na planach płatnych (od 10 USD miesięcznie) 2 kredyty. Szczegóły planów są w przewodniku po Vidu Q4.

Krok 5b. Przez API

Oficjalne API Vidu przyjmuje obraz jako adres URL albo Base64. Tak wygląda zapytanie z dokumentacji (klucz zastąp swoim):

curl -X POST https://api.vidu.com/ent/v2/img2video \
  -H "Authorization: Token TWOJ_KLUCZ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "viduq4-preview",
    "images": ["https://twoja-domena.pl/kadr.jpg"],
    "prompt": "Slow dolly-in, beans pour into the grinder, crisp ASMR grinding sound, no music.",
    "duration": 8,
    "resolution": "1080p",
    "audio": true,
    "is_rec": false
  }'

Odpowiedź zawiera task_id. Wynik odbierasz z GET https://api.vidu.com/ent/v2/tasks/{task_id}/creations - adres pliku działa 24 godziny, więc pobierz go od razu.

Na fal.ai to samo robi krótki skrypt w Pythonie (pakiet requests, klucz w zmiennej FAL_KEY):

import base64, os, time, requests

H = {"Authorization": "Key " + os.environ["FAL_KEY"]}
obraz = "data:image/png;base64," + base64.b64encode(open("kadr.png", "rb").read()).decode()
zadanie = requests.post(
    "https://queue.fal.run/fal-ai/vidu/q4/image-to-video", headers=H,
    json={"image_url": obraz, "prompt": "Slow dolly-in, crisp ASMR grinding sound, no music.",
          "duration": 8, "resolution": "720p"}).json()
while requests.get(zadanie["status_url"], headers=H).json().get("status") != "COMPLETED":
    time.sleep(10)
wynik = requests.get(zadanie["response_url"], headers=H).json()
open("klip.mp4", "wb").write(requests.get(wynik["video"]["url"]).content)

Uczciwie o teście: ten kod jest skrótem mojego skryptu testowego. 8 października sprawdziłem go do momentu wysłania zadania - fal.ai odrzucił je z powodu wyczerpanego salda na moim koncie, więc pełnego przebiegu z gotowym plikiem jeszcze nie mam. Nazwy pól (image_url, prompt, duration, resolution, seed) są zgodne ze schematem API fal.ai dla tego modelu. Skrypt uzupełnię wynikami po teście.

Najczęstsze błędy

  • Opisywanie obrazu zamiast ruchu. „Kobieta w czerwonym płaszczu na ulicy” nic nie mówi modelowi, bo to już widać. Napisz, co ma zrobić.
  • Za dużo zdarzeń na kilka sekund. W 5 sekundach zmieści się jedna akcja i jeden ruch kamery. Na więcej daj 10-16 s albo dwa klipy.
  • Brak „no music”. Modele z dźwiękiem chętnie dokładają podkład, który potem przeszkadza w montażu.
  • Napisy w kadrze. Jeśli obraz startowy ma tekst, sprawdź go w ostatniej klatce - ruch kamery potrafi go zniekształcić.
  • Generowanie od razu w 4K. Najpierw dopracuj ruch w 540p, gdzie sekunda kosztuje ponad 8 razy mniej.
  • Nieodebrany plik. W API Vidu link do wyniku wygasa po 24 godzinach.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

A jeśli nie masz obrazu?

Vidu Q4 nie ma trybu tekst na wideo. Jeśli chcesz zacząć od samego opisu, użyj modelu, który to potrafi - w moim rankingu najlepiej wypadł Wan 3.0, a tuż za nim MiniMax H3 Max. Porównanie Vidu Q4 z najmocniejszymi rywalami jest w tekście Vidu Q4 vs Seedance 2.0 vs MiniMax H3, a wcześniejszy poradnik o ożywianiu zdjęć na innym modelu: Wan 3.0: obraz do wideo.

Źródła: dokumentacja API Vidu Q4 (Image to Video), fal.ai Vidu Q4, WaveSpeedAI, plany vidu.com. Sprawdzone 8 października 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Jakie formaty obrazu obsługuje Vidu Q4 w trybie Image to Video?

Vidu Q4 przyjmuje pliki PNG, JPG i WebP o maksymalnym rozmiarze 50 MB. Proporcje obrazu nie mogą być bardziej skrajne niż 1:4 lub 4:1, a wideo automatycznie dziedziczy proporcje wgranego obrazu.

Ile kosztuje generowanie wideo w Vidu Q4 w zależności od rozdzielczości?

Klip 8 s w 540p kosztuje 0,25 USD, w 720p - 0,53 USD, a w 1080p - 0,67 USD na fal.ai (ceny promocyjne do 30 listopada). Przez API Vidu stawki są ok. 40% wyższe, a dźwięk nie zmienia ceny.

Jak przez API Vidu Q4 wygenerować wideo z obrazu?

Wysyłasz zapytanie POST na adres https://api.vidu.com/ent/v2/img2video z obrazem podanym jako URL lub Base64, modelem viduq4-preview i parametrami takimi jak duration, resolution i audio. Odpowiedź zwraca task_id, a link do gotowego pliku wygasa po 24 godzinach, więc trzeba go pobrać od razu.

Co zrobić, jeśli chcę generować wideo tylko z opisu tekstowego bez obrazu?

Vidu Q4 nie obsługuje trybu tekst na wideo. Według artykułu najlepiej do tego celu nadaje się Wan 3.0, a tuż za nim MiniMax H3 Max.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›