Co potrafi MAGI-2: 8 przykładów i oficjalne polecenia z osią czasu
Trzy filmy producenta, trzy oficjalne polecenia z GitHuba i dwa wzorce z osią czasu. Uczciwie: oficjalnych klipów do poleceń nie ma, moich też nie.

👁 117 przeczytań
Co potrafi MAGI-2 Preview, widać dziś tylko z dwóch źródeł: trzech filmów pokazowych Sand.ai i oficjalnych poleceń z repozytorium na GitHubie. Zebrałem 8 przykładów - 3 klipy producenta, 3 polecenia z repozytorium i 2 wzorce do własnych prób. Wszystko o modelu, ranking i wymagania są w przewodniku MAGI-2 Preview.
Werdykt w skrócie (11 października 2026)
- Klipy producenta: 3 filmy ze strony sand.ai, bez poleceń. Pliki mają 4K i 5-6 s, więc to zmontowane pokazy, a nie surowe 10-sekundowe klipy z modelu.
- Oficjalne polecenia: 3 w repozytorium (anime, plastelina, kawiarnia z osią czasu w JSON). Wyrenderowanych oficjalnych klipów do nich producent nie opublikował.
- Moje klipy: nie mam żadnego. MAGI-2 nie ma publicznego API z ceną, a lokalnie wymaga 8 kart GPU po 80 GB.
- Najciekawsze: polecenie z osią czasu, w którym każda sekunda ma swoją akcję, dźwięk i kwestię dialogu.
| Nr | Przykład | Źródło | Jest wideo? |
|---|---|---|---|
| 1 | Gra postaci i śpiew | sand.ai, materiał producenta | tak, bez polecenia |
| 2 | Synchronizacja obrazu i dźwięku | sand.ai, materiał producenta | tak, bez polecenia |
| 3 | Ruchy kamery | sand.ai, materiał producenta | tak, bez polecenia |
| 4 | Anime: z lasu nad ocean | repozytorium, sample_000.txt | nie |
| 5 | Plastelina: szukanie piłki | repozytorium, sample_001.txt | nie |
| 6 | Kawiarnia z osią czasu (JSON) | repozytorium, sample_enhanced_t2v.json | nie |
| 7 | Krótkie polecenie z README | README | nie |
| 8 | Mój wzorzec z osią czasu | szablon na bazie przykładów | nie |
Filmy pokazowe Sand.ai
Na stronie głównej sand.ai, w sekcji „Features MAGI-2 Preview”, są trzy filmy. Sprawdziłem je 11 października: wszystkie trzy adresy odpowiadają kodem 200, pliki są z 28 sierpnia 2026, mają 3840 x 2160 pikseli, 30 kl./s i ścieżkę dźwiękową. Model według README robi tylko klipy 10-sekundowe w 1080p, a te trwają 5-6 s w 4K - producent musiał je przyciąć i przeskalować. Poleceń nie podał.
1. Gra postaci: dialog, śpiew, emocje
Zastosowanie: sceny z mówiącą albo śpiewającą postacią, teledyski, krótkie formy z aktorem AI.
Polecenie: producent nie podał. Opis sekcji na stronie: „Precisely generates dialogue, singing, and emotional shifts” (generuje dialog, śpiew i zmiany emocji z dopasowanym ruchem ust).
Komentarz: to pokaz wybrany przez producenta, więc trudno z niego wnioskować o typowym wyniku. W ślepych porównaniach Artificial Analysis MAGI-2 jest 10. w obrazie na wideo - poziom Groka Imagine 1.5, a nie czołówki.
2. Synchronizacja obrazu i dźwięku
Zastosowanie: efekty dźwiękowe zgrane z akcją, otoczenie reagujące na zmiany w kadrze.
Polecenie: producent nie podał. Opis sekcji: „Visuals and audio are generated jointly by a single model” (obraz i dźwięk generuje jeden model jednocześnie).
Komentarz: MAGI-2 nie dokleja dźwięku osobnym modelem. Tekst, obraz i audio idą przez ten sam transformer, a w poleceniu można podać czas każdego zdarzenia dźwiękowego co do dziesiątej części sekundy (przykład 6).
3. Ruchy kamery
Zastosowanie: ujęcia z najazdem, śledzeniem postaci, orbitą wokół obiektu.
Polecenie: producent nie podał. Opis sekcji: model rozumie plan, kompozycję i ruch kamery, w tym „zooming in, tracking, and orbiting” (zbliżenie, śledzenie, orbita).
Komentarz: w oficjalnych poleceniach ruch kamery opisuje się osobno dla każdego segmentu: typ (push-in), kierunek i intensywność. To więcej kontroli niż jedno zdanie w stylu „kamera powoli najeżdża”.
Oficjalne polecenia z repozytorium
Plik assets/demo_samples.json uruchamia 5 generacji: dwa polecenia jako obraz na wideo (z dołączonymi obrazami startowymi), te same dwa jako tekst na wideo i jedno polecenie w JSON. README wspomina też plik sample_002.txt, ale 11 października zwracał błąd 404. Wszystkie polecenia są po angielsku i bardzo długie (9-11 tys. znaków) - pokazuję fragmenty. Repozytorium jest na licencji Apache-2.0.
4. Anime: dziewczyna wychodzi z lasu nad ocean
Zastosowanie: krótka scena narracyjna w stylu japońskiej animacji 2D, z jednym cięciem i samym dźwiękiem otoczenia.
core_caption: A 10-second continuous animated sequence following a young girl from a dark, mist-filled forest to a sudden, bright clearing overlooking a vast ocean... audio_design: Completely ambient and naturalistic. [...] No dialogue or background music. shot_timeline1 time_range_seconds: 0.0 | 8.0 (las, przejście nad ocean) shot_timeline2 time_range_seconds: 8.0 | 10.0 (zbliżenie twarzy, oddech) audio_event_timeline: kroki 0-5 s, wiatr 3-8 s, gałęzie 5-6,5 s, fale 4-10 s, oddech 8-9,5 s, mewy 8,5-10 s
Po polsku: 10-sekundowa animacja, w której dziewczyna przechodzi z mrocznego lasu na jasną polanę nad oceanem, z krokami, wiatrem i falami zamiast muzyki.
Materiał: oficjalnego wyrenderowanego klipu brak. W repozytorium jest tylko obraz startowy sample_000.jpeg (polecenie na GitHubie).
Komentarz: polecenie ma osobne sekcje na postacie i miejsca (reference_bank), ujęcia i zdarzenia dźwiękowe. Do tego zakazy: bez przejść „flash-to-white”, bez nowoczesnych przedmiotów, bez zmiany stylu na 3D. Tak wygląda polecenie po automatycznym rozwinięciu (prompt enhancement), które README zaleca.
5. Plastelina: figurka szuka czerwonej piłki
Zastosowanie: animacja poklatkowa z muzyką i efektami foley, pięć ujęć w 10 sekundach.
core_caption: A 10-second stop-motion style 3D clay animation where a small clay figure searches a cozy room for a lost red ball... audio_design: Cheerful, warm ukulele and xylophone background music, layered with animated Foley [...] No dialogue.
Po polsku: plastelinowa figurka szuka zgubionej piłki w przytulnym pokoju, najpierw znajduje niebieski guzik, a na końcu piłkę, przy muzyce ukulele i ksylofonu.
Długość paska to czas ujęcia (pełny pasek = 10 s), według pól time_range_seconds w pliku sample_001.txt.
Materiał: oficjalnego klipu brak, jest tylko obraz startowy sample_001.jpeg.
Komentarz: pięć ujęć w 10 sekundach to dużo. Polecenie wymusza też „sztywne” ruchy typowe dla animacji poklatkowej i stałą objętość piłki w rękach postaci. Czy model to utrzyma, nie wiem - nie wygenerowałem tego klipu.
6. Kawiarnia w deszczu: oś czasu w JSON i jedna kwestia dialogu
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Zastosowanie: scena z aktorem, który wykonuje czynność, a potem mówi jedno zdanie, przy powolnym najeździe kamery. Pasuje do reklam i scen fabularnych.
To jedyny oficjalny przykład w formacie JSON. Ma dwie warstwy: global_layer (styl, światło, postać, obiektyw 50 mm, proporcje 16:9) i dynamic_layer z segmentami osi czasu. Skrócona struktura:
{
"global_layer": {
"context": "A single continuous take inside a small corner cafe on a rainy afternoon.",
"video_metadata": { "duration": 10.0, "aspect_ratio": "16:9" },
"camera_cinematography": { "lens_focal_length": "50mm" }
},
"dynamic_layer": {
"timeline_segments": [
{ "segment_basic_info": { "timestamp_range": "00:00.0-00:05.0",
"camera_delta": { "camera_movement": { "type": "push-in" } } },
"audio": { "special_audio_events": [
{ "timestamp": "00:02.4",
"sound_description": "a short soft ceramic tap..." } ] } },
{ "segment_basic_info": { "timestamp_range": "00:05.0-00:10.0" },
"audio": { "dialogue_lines": [
{ "timestamp": "00:05.6-00:07.4",
"speaker": "<subject 1>",
"text": "Careful, it's still very hot." } ] } }
]
}
}Po polsku: barista stawia filiżankę na spodku, w 2,4 s słychać stuknięcie porcelany, a między 5,6 a 7,4 s mówi „Ostrożnie, jeszcze bardzo gorąca”.
Materiał: oficjalnego klipu brak (plik na GitHubie).
Komentarz: pełny plik ma 9,5 tys. znaków i opisuje nawet pierścionek na prawej dłoni baristki. W polu dialogu jest "language": "English". Producent nie podaje listy innych języków, więc polskiej kwestii nie obiecuję.
Wzorce do własnych prób
7. Najkrótsze polecenie z README
Zastosowanie: test, czy instalacja na serwerze działa.
torchrun --nproc_per_node=8 inference/pipeline/entry.py \
--prompt "a red fox in snow" --output output/Po polsku: rudy lis na śniegu.
Materiał: brak. Komentarz: README ostrzega, że krótkie polecenie „underuses” model, bo był uczony na długich, ustrukturyzowanych opisach. Dlatego w potoku jest opcjonalny krok rozwijania polecenia przez zewnętrzny model językowy.
8. Mój wzorzec: reklama produktu z osią czasu
Zastosowanie: 10-sekundowa reklama z ujęciem produktu, dźwiękiem i hasłem. Zbudowałem ten szablon na strukturze z przykładu 6, ale go nie uruchomiłem - to punkt wyjścia, nie sprawdzony wynik.
{
"global_layer": {
"context": "A single continuous product shot on a dark kitchen counter at night.",
"video_metadata": { "duration": 10.0, "aspect_ratio": "16:9" },
"camera_cinematography": { "overall_camera_style": "slow orbit around the product",
"lens_focal_length": "85mm" }
},
"dynamic_layer": {
"timeline_segments": [
{ "segment_basic_info": { "timestamp_range": "00:00.0-00:04.0",
"segment_description": "A hand presses the button of a steel coffee grinder." },
"audio": { "special_audio_events": [
{ "timestamp": "00:01.2", "sound_description": "a sharp mechanical click" } ] } },
{ "segment_basic_info": { "timestamp_range": "00:04.0-00:10.0",
"segment_description": "Ground coffee falls into a glass jar as the camera orbits." },
"audio": { "dialogue_lines": [
{ "timestamp": "00:07.0-00:09.0", "speaker": "<narrator>",
"text": "Fresh every morning." } ] } }
]
}
}Po polsku: dłoń włącza młynek do kawy (klik w 1,2 s), kawa sypie się do słoika przy orbicie kamery, a lektor mówi „Świeża każdego ranka”.
Komentarz: zasady, które biorę z oficjalnych przykładów:
- segmenty pokrywają całe 10 s bez przerw, bo to jedyna długość klipu;
- każde zdarzenie dźwiękowe ma własny znacznik czasu i opis „co słychać”;
- dialog ma osobne pole z czasem i mówcą, a nie jest wpleciony w opis sceny;
- styl, światło i wygląd postaci są raz w
global_layer, a w segmentach tylko zmiany.
Dlaczego nie ma moich klipów
Przy innych modelach testuję na tych samych scenach w Arenie wideo. Z MAGI-2 się nie da:
- API: Artificial Analysis podaje cenę jako „Coming soon”. Nie ma go na fal.ai, Replicate, WaveSpeedAI ani OpenRouterze (11.10.2026).
- Lokalnie: wagi mają ok. 307 GB, README wymaga 8 kart NVIDIA Hopper. Mój RTX 4090 ma 24 GB.
- Serwer w chmurze: według szacunku bloga mushroom.cv to 15-30 minut i 25-42 USD za jeden klip na AWS. Za tyle zrobię kilkadziesiąt klipów modelem z czołówki przez API.
Gdy pojawi się API z ceną albo wersja destylowana, dopiszę tu wyniki dla przykładów 4-8. Jeśli szukasz otwartego modelu, który ruszy w domu, zobacz Wan 2.2 i porównanie otwartych modeli wideo. Gotowe klipy innych modeli z tej aktualizacji rankingu: HappyHorse 1.1 i HiDream-O1-Video.
Najczęstsze pytania
Czy filmy na stronie Sand.ai są z MAGI-2?
Trzy filmy z sekcji „Features MAGI-2 Preview” tak, według producenta. Klipy w „Creative Partners” niżej na stronie to prace twórców bez informacji, którym modelem powstały (Sand.ai ma też aplikację VidMuse) - nie traktuję ich jako przykładów MAGI-2.
Jak napisać polecenie do MAGI-2?
Długo i w strukturze: opis całości, postacie i miejsca, ujęcia z czasem, zdarzenia dźwiękowe z czasem. Oficjalne wzory są w folderze assets/ repozytorium.
Czy MAGI-2 robi dialogi?
Tak, przykład z kawiarnią ma kwestię z dokładnym czasem. Dialog jest po angielsku. Innych języków producent nie wymienia.
Ile trwa klip z MAGI-2?
Zawsze 10 sekund. README: to jedyna długość, jaką model obecnie obsługuje.
Źródła i data sprawdzenia
- sand.ai - trzy filmy pokazowe, nagłówki HTTP i parametry plików (11.10.2026)
- GitHub: SandAI-org/MAGI-2-preview - README, demo_samples.json, sample_000.txt, sample_001.txt, sample_enhanced_t2v.json (11.10.2026)
- Artificial Analysis: obraz na wideo (odczyt 11.10.2026)
- mushroom.cv - szacunek czasu i kosztu (7.08.2026)
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
