Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Co potrafi MAGI-2: 8 przykładów i oficjalne polecenia z osią czasu

Trzy filmy producenta, trzy oficjalne polecenia z GitHuba i dwa wzorce z osią czasu. Uczciwie: oficjalnych klipów do poleceń nie ma, moich też nie.

9 min czytania
Logo Magi i napis MAGI-2 - 8 przykładów i oś czasu

👁 117 przeczytań

Co potrafi MAGI-2 Preview, widać dziś tylko z dwóch źródeł: trzech filmów pokazowych Sand.ai i oficjalnych poleceń z repozytorium na GitHubie. Zebrałem 8 przykładów - 3 klipy producenta, 3 polecenia z repozytorium i 2 wzorce do własnych prób. Wszystko o modelu, ranking i wymagania są w przewodniku MAGI-2 Preview.

Werdykt w skrócie (11 października 2026)

  • Klipy producenta: 3 filmy ze strony sand.ai, bez poleceń. Pliki mają 4K i 5-6 s, więc to zmontowane pokazy, a nie surowe 10-sekundowe klipy z modelu.
  • Oficjalne polecenia: 3 w repozytorium (anime, plastelina, kawiarnia z osią czasu w JSON). Wyrenderowanych oficjalnych klipów do nich producent nie opublikował.
  • Moje klipy: nie mam żadnego. MAGI-2 nie ma publicznego API z ceną, a lokalnie wymaga 8 kart GPU po 80 GB.
  • Najciekawsze: polecenie z osią czasu, w którym każda sekunda ma swoją akcję, dźwięk i kwestię dialogu.
NrPrzykładŹródłoJest wideo?
1Gra postaci i śpiewsand.ai, materiał producentatak, bez polecenia
2Synchronizacja obrazu i dźwiękusand.ai, materiał producentatak, bez polecenia
3Ruchy kamerysand.ai, materiał producentatak, bez polecenia
4Anime: z lasu nad oceanrepozytorium, sample_000.txtnie
5Plastelina: szukanie piłkirepozytorium, sample_001.txtnie
6Kawiarnia z osią czasu (JSON)repozytorium, sample_enhanced_t2v.jsonnie
7Krótkie polecenie z READMEREADMEnie
8Mój wzorzec z osią czasuszablon na bazie przykładównie

Filmy pokazowe Sand.ai

Na stronie głównej sand.ai, w sekcji „Features MAGI-2 Preview”, są trzy filmy. Sprawdziłem je 11 października: wszystkie trzy adresy odpowiadają kodem 200, pliki są z 28 sierpnia 2026, mają 3840 x 2160 pikseli, 30 kl./s i ścieżkę dźwiękową. Model według README robi tylko klipy 10-sekundowe w 1080p, a te trwają 5-6 s w 4K - producent musiał je przyciąć i przeskalować. Poleceń nie podał.

1. Gra postaci: dialog, śpiew, emocje

Zastosowanie: sceny z mówiącą albo śpiewającą postacią, teledyski, krótkie formy z aktorem AI.

Polecenie: producent nie podał. Opis sekcji na stronie: „Precisely generates dialogue, singing, and emotional shifts” (generuje dialog, śpiew i zmiany emocji z dopasowanym ruchem ust).

„Character Performance”, 5,5 s, 3840 x 2160. Materiał producenta ze strony sand.ai (nie mój klip).

Komentarz: to pokaz wybrany przez producenta, więc trudno z niego wnioskować o typowym wyniku. W ślepych porównaniach Artificial Analysis MAGI-2 jest 10. w obrazie na wideo - poziom Groka Imagine 1.5, a nie czołówki.

2. Synchronizacja obrazu i dźwięku

Zastosowanie: efekty dźwiękowe zgrane z akcją, otoczenie reagujące na zmiany w kadrze.

Polecenie: producent nie podał. Opis sekcji: „Visuals and audio are generated jointly by a single model” (obraz i dźwięk generuje jeden model jednocześnie).

„High-Fidelity Audio-Visual Synchronization”, 5,8 s, 3840 x 2160. Materiał producenta ze strony sand.ai (nie mój klip). Włącz dźwięk - odtwarzacz startuje wyciszony.

Komentarz: MAGI-2 nie dokleja dźwięku osobnym modelem. Tekst, obraz i audio idą przez ten sam transformer, a w poleceniu można podać czas każdego zdarzenia dźwiękowego co do dziesiątej części sekundy (przykład 6).

3. Ruchy kamery

Zastosowanie: ujęcia z najazdem, śledzeniem postaci, orbitą wokół obiektu.

Polecenie: producent nie podał. Opis sekcji: model rozumie plan, kompozycję i ruch kamery, w tym „zooming in, tracking, and orbiting” (zbliżenie, śledzenie, orbita).

„Cinematography”, 5,1 s, 3840 x 2160. Materiał producenta ze strony sand.ai (nie mój klip).

Komentarz: w oficjalnych poleceniach ruch kamery opisuje się osobno dla każdego segmentu: typ (push-in), kierunek i intensywność. To więcej kontroli niż jedno zdanie w stylu „kamera powoli najeżdża”.

Oficjalne polecenia z repozytorium

Plik assets/demo_samples.json uruchamia 5 generacji: dwa polecenia jako obraz na wideo (z dołączonymi obrazami startowymi), te same dwa jako tekst na wideo i jedno polecenie w JSON. README wspomina też plik sample_002.txt, ale 11 października zwracał błąd 404. Wszystkie polecenia są po angielsku i bardzo długie (9-11 tys. znaków) - pokazuję fragmenty. Repozytorium jest na licencji Apache-2.0.

4. Anime: dziewczyna wychodzi z lasu nad ocean

Zastosowanie: krótka scena narracyjna w stylu japońskiej animacji 2D, z jednym cięciem i samym dźwiękiem otoczenia.

core_caption: A 10-second continuous animated sequence following a young girl
from a dark, mist-filled forest to a sudden, bright clearing overlooking
a vast ocean...
audio_design: Completely ambient and naturalistic. [...] No dialogue
or background music.

shot_timeline1  time_range_seconds: 0.0 | 8.0   (las, przejście nad ocean)
shot_timeline2  time_range_seconds: 8.0 | 10.0  (zbliżenie twarzy, oddech)
audio_event_timeline: kroki 0-5 s, wiatr 3-8 s, gałęzie 5-6,5 s,
fale 4-10 s, oddech 8-9,5 s, mewy 8,5-10 s

Po polsku: 10-sekundowa animacja, w której dziewczyna przechodzi z mrocznego lasu na jasną polanę nad oceanem, z krokami, wiatrem i falami zamiast muzyki.

Materiał: oficjalnego wyrenderowanego klipu brak. W repozytorium jest tylko obraz startowy sample_000.jpeg (polecenie na GitHubie).

Komentarz: polecenie ma osobne sekcje na postacie i miejsca (reference_bank), ujęcia i zdarzenia dźwiękowe. Do tego zakazy: bez przejść „flash-to-white”, bez nowoczesnych przedmiotów, bez zmiany stylu na 3D. Tak wygląda polecenie po automatycznym rozwinięciu (prompt enhancement), które README zaleca.

5. Plastelina: figurka szuka czerwonej piłki

Zastosowanie: animacja poklatkowa z muzyką i efektami foley, pięć ujęć w 10 sekundach.

core_caption: A 10-second stop-motion style 3D clay animation where a small
clay figure searches a cozy room for a lost red ball...
audio_design: Cheerful, warm ukulele and xylophone background music,
layered with animated Foley [...] No dialogue.

Po polsku: plastelinowa figurka szuka zgubionej piłki w przytulnym pokoju, najpierw znajduje niebieski guzik, a na końcu piłkę, przy muzyce ukulele i ksylofonu.

Podział 10 sekund na ujęcia w przykładzie z plasteliną
Ujęcie 1: odkrycie0-2 s
Ujęcie 2: szukanie2-5 s
Ujęcie 3: guzik5-7 s
Ujęcie 4: piłka7-9 s
Ujęcie 5: radość9-10 s

Długość paska to czas ujęcia (pełny pasek = 10 s), według pól time_range_seconds w pliku sample_001.txt.

Materiał: oficjalnego klipu brak, jest tylko obraz startowy sample_001.jpeg.

Komentarz: pięć ujęć w 10 sekundach to dużo. Polecenie wymusza też „sztywne” ruchy typowe dla animacji poklatkowej i stałą objętość piłki w rękach postaci. Czy model to utrzyma, nie wiem - nie wygenerowałem tego klipu.

6. Kawiarnia w deszczu: oś czasu w JSON i jedna kwestia dialogu

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Zastosowanie: scena z aktorem, który wykonuje czynność, a potem mówi jedno zdanie, przy powolnym najeździe kamery. Pasuje do reklam i scen fabularnych.

To jedyny oficjalny przykład w formacie JSON. Ma dwie warstwy: global_layer (styl, światło, postać, obiektyw 50 mm, proporcje 16:9) i dynamic_layer z segmentami osi czasu. Skrócona struktura:

{
  "global_layer": {
    "context": "A single continuous take inside a small corner cafe on a rainy afternoon.",
    "video_metadata": { "duration": 10.0, "aspect_ratio": "16:9" },
    "camera_cinematography": { "lens_focal_length": "50mm" }
  },
  "dynamic_layer": {
    "timeline_segments": [
      { "segment_basic_info": { "timestamp_range": "00:00.0-00:05.0",
          "camera_delta": { "camera_movement": { "type": "push-in" } } },
        "audio": { "special_audio_events": [
          { "timestamp": "00:02.4",
            "sound_description": "a short soft ceramic tap..." } ] } },
      { "segment_basic_info": { "timestamp_range": "00:05.0-00:10.0" },
        "audio": { "dialogue_lines": [
          { "timestamp": "00:05.6-00:07.4",
            "speaker": "<subject 1>",
            "text": "Careful, it's still very hot." } ] } }
    ]
  }
}

Po polsku: barista stawia filiżankę na spodku, w 2,4 s słychać stuknięcie porcelany, a między 5,6 a 7,4 s mówi „Ostrożnie, jeszcze bardzo gorąca”.

Materiał: oficjalnego klipu brak (plik na GitHubie).

Komentarz: pełny plik ma 9,5 tys. znaków i opisuje nawet pierścionek na prawej dłoni baristki. W polu dialogu jest "language": "English". Producent nie podaje listy innych języków, więc polskiej kwestii nie obiecuję.

Wzorce do własnych prób

7. Najkrótsze polecenie z README

Zastosowanie: test, czy instalacja na serwerze działa.

torchrun --nproc_per_node=8 inference/pipeline/entry.py \
    --prompt "a red fox in snow" --output output/

Po polsku: rudy lis na śniegu.

Materiał: brak. Komentarz: README ostrzega, że krótkie polecenie „underuses” model, bo był uczony na długich, ustrukturyzowanych opisach. Dlatego w potoku jest opcjonalny krok rozwijania polecenia przez zewnętrzny model językowy.

8. Mój wzorzec: reklama produktu z osią czasu

Zastosowanie: 10-sekundowa reklama z ujęciem produktu, dźwiękiem i hasłem. Zbudowałem ten szablon na strukturze z przykładu 6, ale go nie uruchomiłem - to punkt wyjścia, nie sprawdzony wynik.

{
  "global_layer": {
    "context": "A single continuous product shot on a dark kitchen counter at night.",
    "video_metadata": { "duration": 10.0, "aspect_ratio": "16:9" },
    "camera_cinematography": { "overall_camera_style": "slow orbit around the product",
                               "lens_focal_length": "85mm" }
  },
  "dynamic_layer": {
    "timeline_segments": [
      { "segment_basic_info": { "timestamp_range": "00:00.0-00:04.0",
          "segment_description": "A hand presses the button of a steel coffee grinder." },
        "audio": { "special_audio_events": [
          { "timestamp": "00:01.2", "sound_description": "a sharp mechanical click" } ] } },
      { "segment_basic_info": { "timestamp_range": "00:04.0-00:10.0",
          "segment_description": "Ground coffee falls into a glass jar as the camera orbits." },
        "audio": { "dialogue_lines": [
          { "timestamp": "00:07.0-00:09.0", "speaker": "<narrator>",
            "text": "Fresh every morning." } ] } }
    ]
  }
}

Po polsku: dłoń włącza młynek do kawy (klik w 1,2 s), kawa sypie się do słoika przy orbicie kamery, a lektor mówi „Świeża każdego ranka”.

Komentarz: zasady, które biorę z oficjalnych przykładów:

  • segmenty pokrywają całe 10 s bez przerw, bo to jedyna długość klipu;
  • każde zdarzenie dźwiękowe ma własny znacznik czasu i opis „co słychać”;
  • dialog ma osobne pole z czasem i mówcą, a nie jest wpleciony w opis sceny;
  • styl, światło i wygląd postaci są raz w global_layer, a w segmentach tylko zmiany.

Dlaczego nie ma moich klipów

Przy innych modelach testuję na tych samych scenach w Arenie wideo. Z MAGI-2 się nie da:

  • API: Artificial Analysis podaje cenę jako „Coming soon”. Nie ma go na fal.ai, Replicate, WaveSpeedAI ani OpenRouterze (11.10.2026).
  • Lokalnie: wagi mają ok. 307 GB, README wymaga 8 kart NVIDIA Hopper. Mój RTX 4090 ma 24 GB.
  • Serwer w chmurze: według szacunku bloga mushroom.cv to 15-30 minut i 25-42 USD za jeden klip na AWS. Za tyle zrobię kilkadziesiąt klipów modelem z czołówki przez API.

Gdy pojawi się API z ceną albo wersja destylowana, dopiszę tu wyniki dla przykładów 4-8. Jeśli szukasz otwartego modelu, który ruszy w domu, zobacz Wan 2.2 i porównanie otwartych modeli wideo. Gotowe klipy innych modeli z tej aktualizacji rankingu: HappyHorse 1.1 i HiDream-O1-Video.

Najczęstsze pytania

Czy filmy na stronie Sand.ai są z MAGI-2?

Trzy filmy z sekcji „Features MAGI-2 Preview” tak, według producenta. Klipy w „Creative Partners” niżej na stronie to prace twórców bez informacji, którym modelem powstały (Sand.ai ma też aplikację VidMuse) - nie traktuję ich jako przykładów MAGI-2.

Jak napisać polecenie do MAGI-2?

Długo i w strukturze: opis całości, postacie i miejsca, ujęcia z czasem, zdarzenia dźwiękowe z czasem. Oficjalne wzory są w folderze assets/ repozytorium.

Czy MAGI-2 robi dialogi?

Tak, przykład z kawiarnią ma kwestię z dokładnym czasem. Dialog jest po angielsku. Innych języków producent nie wymienia.

Ile trwa klip z MAGI-2?

Zawsze 10 sekund. README: to jedyna długość, jaką model obecnie obsługuje.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 450 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›