Modele świata (world models): co to i po co. Genie, Odyssey, Cosmos, V-JEPA
Przewodnik po modelach świata: Genie 3, Odyssey-3, NVIDIA Cosmos, V-JEPA 2 i World Labs. Dostęp z Polski, ceny i mój test.

👁 116 przeczytań
- Model świata różni się od generatora wideo tym, że liczy obraz klatka po klatce w reakcji na sterowanie i ma pamiętać wcześniej pokazane elementy.
- Jedynym dużym modelem świata dostępnym z Polski za darmo i bez konta jest Odyssey-3, który działa na stronie experience.odyssey.systems i generuje obraz w rozdzielczości 832x480.
- NVIDIA Cosmos i Meta V-JEPA 2 mają otwarte wagi i można je pobrać oraz uruchomić na własnym sprzęcie z mocną kartą graficzną NVIDIA.
Model świata (world model) to AI, która nie pisze tekstu i nie robi gotowego filmu, tylko przewiduje, jak zmieni się świat po czyimś ruchu. Dzięki temu można po wygenerowanym świecie chodzić jak w grze, a robot może „przećwiczyć” zadanie, zanim zrobi je naprawdę. W tym przewodniku zbieram najważniejsze modele - Genie, Odyssey, Cosmos, V-JEPA i Atlas - z tym, co działa w Polsce, ile kosztuje i co sam sprawdziłem.
Stan na 9 października 2026
- Najnowszy: Odyssey-3 (8.10.2026) - darmowy podgląd w przeglądarce, bez konta, działa z Polski.
- Najgłośniejszy: Genie 3 od Google DeepMind, dostępny jako Project Genie w planie Google AI Ultra.
- Otwarte wagi: NVIDIA Cosmos i Meta V-JEPA 2 - do pobrania i uruchomienia na własnym sprzęcie.
- Mój test: Bieszczady i Kraków w Odyssey-3 - wyniki niżej.
Co to jest model świata
Duży model językowy przewiduje kolejne słowo. Model świata przewiduje kolejny stan świata: następną klatkę obrazu, położenie przedmiotów, ruch kamery. Ważne jest wejście sterujące. Model dostaje informację „gracz idzie do przodu” albo „ramię robota zamyka chwytak” i musi pokazać, co z tego wyniknie.
Różnica w porównaniu z generatorem wideo, takim jak Veo:
- generator wideo robi cały klip naraz, a ja mogę go tylko obejrzeć;
- model świata liczy obraz klatka po klatce, na bieżąco, w reakcji na moje sterowanie;
- model świata powinien pamiętać, co już pokazał - jeśli odwrócę się i wrócę, dom ma stać w tym samym miejscu (to wciąż najsłabszy punkt).
Starszy tekst o tym, dlaczego badacze uważają modele świata za kolejny krok po LLM-ach, jest tutaj: modele świata - AI, które rozumie fizykę.
Jak to działa od środka
Większość dzisiejszych modeli świata, które rysują obraz, ma podobny schemat:
- Trening na wideo: model ogląda miliony godzin nagrań, często z gier i kamer samochodowych, razem z informacją, jakie było sterowanie (klawisze, kierownica, ruch ramienia).
- Przewidywanie krok po kroku: na podstawie ostatnich klatek i sterowania model przewiduje następną klatkę. To podejście autoregresywne, takie jak w LLM-ach, tylko zamiast słów są obrazy.
- Dyfuzja: każda nowa klatka powstaje przez odszumianie, jak w generatorach obrazów. Żeby działało w czasie rzeczywistym, firmy „destylują” model tak, żeby wystarczyło kilka kroków odszumiania.
- Pamięć: model widzi tylko ograniczone okno przeszłości. Gdy coś z niego wypadnie, model musi to wymyślić od nowa - stąd zmieniające się budynki.
V-JEPA idzie inną drogą: zamiast pikseli przewiduje opis stanu świata w przestrzeni pojęć. Nie da się w nim „pochodzić”, za to jest dużo tańszy w obliczeniach i lepiej nadaje się do planowania ruchów robota.
Ograniczenia, o których producenci mówią mniej
- Trwałość obiektów: po odwróceniu kamery świat często się zmienia. Widziałem to w Odyssey-3 po 10 sekundach.
- Krótkie sesje: darmowe podglądy dają kilka minut, a Genie 3 według Google utrzymuje spójny świat przez kilka minut.
- Rozdzielczość: 480p-720p, daleko od jakości generatorów wideo w 4K.
- Brak lokalnej wiedzy: modele znają ogólne „europejskie miasto”, ale nie polskie zabytki.
- Wyniki testów od producentów: niezależnych pomiarów jest mało, a każda firma wybiera warianty testów, w których wypada najlepiej.
Po co to komu
- Robotyka i auta autonomiczne: trening w symulacji zamiast tysięcy godzin jazdy i prób na prawdziwym sprzęcie. To główny rynek NVIDII i Odyssey.
- Agenci AI: nieskończona liczba środowisk do nauki, także gier.
- Gry i film: szybkie szkice lokacji i nastroju, prototypy światów.
- Nauka: sprawdzanie, czy AI rozumie fizykę - stąd testy takie jak Physics-IQ.
Najważniejsze modele świata w październiku 2026
| Model | Firma | Co robi | Dostęp z Polski | Wagi |
|---|---|---|---|---|
| Odyssey-3 / Pro | Odyssey | interaktywny świat z promptu w czasie rzeczywistym, 832×480 / 1280×720, widok z 1. i 3. osoby | tak, darmowy podgląd bez konta; API przez kontakt | nie |
| Genie 3 (Project Genie) | Google DeepMind | świat do eksploracji z opisu lub zdjęcia, 720p, 24 klatki/s | w planie Google AI Ultra, 18+ | nie |
| Cosmos (w tym Cosmos 3 i Cosmos 3 Edge) | NVIDIA | modele świata dla robotów i aut, generowanie danych treningowych | tak, do pobrania | tak (licencja NVIDII) |
| V-JEPA 2 | Meta | rozumie i przewiduje wideo w przestrzeni pojęć, bez rysowania klatek; planowanie ruchów robota | tak, do pobrania | tak |
| Atlas i Marble | World Labs | sceny 3D i wideo ze zdjęcia, eksport do splatów 3D | Marble w przeglądarce; Atlas zapowiedziany | nie |
Genie 3 i Project Genie
Genie 3 to model Google DeepMind pokazany w sierpniu 2025 roku. Generuje świat, po którym można się poruszać, w 720p i 24 klatkach na sekundę. W styczniu 2026 roku Google udostępniło go w Labs jako Project Genie - najpierw tylko subskrybentom Google AI Ultra w USA. Według doniesień z maja 2026 roku dostęp rozszerzono na subskrybentów Ultra w innych krajach, ale Google nie opublikowało listy krajów. Project Genie łączy Genie 3 z Nano Banana i Gemini. O tym, jak Genie wpisuje się w wyścig gigantów, pisałem w tekście world models - następna granica AI po LLM-ach.
Odyssey-3
Odyssey z Palo Alto wypuściło Odyssey-3 8 października 2026 roku. To autoregresywny transformer dyfuzyjny, czyli model, który odszumia kolejne klatki, biorąc pod uwagę poprzednie i sterowanie. Został „przyspieszony” tak, żeby potrzebował kilku kroków na klatkę - stąd działanie w czasie rzeczywistym. Ten sam model ma sterować robotami, autami, dronami i trenować agentów. Szczegóły i pełny test są w tekście Odyssey-3: test na Bieszczadach.
NVIDIA Cosmos
Cosmos to rodzina otwartych modeli NVIDII do tak zwanej fizycznej AI. Służy głównie do generowania syntetycznych danych dla robotów i aut. Wariant Edge jest przycięty do pracy na urządzeniach, bez chmury. Instrukcję uruchomienia opisałem w poradniku NVIDIA Cosmos 3 - jak zacząć, a premierę wersji Edge w tekście Cosmos 3 Edge.
V-JEPA 2 i Yann LeCun
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
V-JEPA 2 to model Mety z czerwca 2025 roku. Działa inaczej niż reszta: nie rysuje klatek, tylko przewiduje, co się stanie, w abstrakcyjnej przestrzeni pojęć. To podejście promuje Yann LeCun, który uważa, że generowanie każdego piksela to strata mocy. Wagi są otwarte. LeCun odszedł z Mety i rozwija tę ideę we własnym startupie - historię opisałem w tekście Yann LeCun kontra reszta świata.
World Labs: Marble i Atlas
Startup Fei-Fei Li robi modele przestrzenne. Marble tworzy sceny 3D, a Atlas pokazany 1 września 2026 roku generuje z jednego zdjęcia do minuty wideo w 1440p z dokładną kontrolą kamery i eksportem do chmur punktów. Więcej w tekście World Labs pokazuje Atlas.
Wyniki w teście fizyki Physics-IQ
Physics-IQ sprawdza, czy model przewiduje dalszy ciąg nagrania zgodnie z fizyką: spadanie, zderzenia, płyny. Poniżej wyniki podane przez Odyssey przy premierze. Inne firmy publikują wyniki w różnych wariantach testu, więc nie mieszam ich w jednym wykresie.
Mój test: polskie miejsca w Odyssey-3
Odyssey-3 to jedyny duży model świata, który 9 października 2026 roku mogłem uruchomić z Polski bez konta i bez płacenia. Wpisałem trzy światy: połoninę w Bieszczadach po angielsku, to samo po polsku i Rynek Główny w Krakowie zimą.

| Co sprawdzałem | Wynik |
|---|---|
| Polski prompt | zrozumiany |
| Klimat Bieszczad (mgła, trawy, pagórki) | dobry |
| Cerkiew łemkowska, Sukiennice, Mariacki | nie - ogólne budynki „z Europy” |
| Płynność ruchu i obrotu kamery | dobra |
| Pamięć świata po obrocie | słaba - budynek zmienił kształt |
Wniosek: model świetnie łapie nastrój, ale nie zna polskich miejsc i nie trzyma trwałości obiektów. Do szkiców lokacji wystarczy, do wiernej wizualizacji nie.
Jak zacząć - trzy drogi
- Za darmo, w 5 minut: experience.odyssey.systems, wpisuję opis świata, steruję klawiszami WASD i strzałkami.
- W abonamencie Google: Project Genie w Google AI Ultra - sprawdź w Labs, czy jest dostępny na Twoim koncie.
- Na własnym sprzęcie: NVIDIA Cosmos albo V-JEPA 2 z Hugging Face. Potrzebna mocna karta graficzna i znajomość Pythona.
Modele świata a gry z AI
Modele świata łatwo pomylić z narzędziami do robienia gier. Google Labs Playground składa prawdziwą grę z zasadami, punktami i rankingiem, a model świata generuje tylko przestrzeń do chodzenia, bez reguł. Playground działa na razie tylko w USA - co wiadomo i jak zacząć.
Najczęstsze pytania
Czym model świata różni się od generatora wideo?
Generator robi gotowy klip. Model świata liczy obraz na bieżąco w reakcji na sterowanie i ma pamiętać, co już pokazał.
Czy jest darmowy model świata?
Tak. Odyssey-3 ma darmowy podgląd w przeglądarce, a Cosmos i V-JEPA 2 mają otwarte wagi.
Czy Genie 3 działa w Polsce?
Project Genie jest w planie Google AI Ultra. Google nie podało listy krajów, więc trzeba sprawdzić na własnym koncie.
Czy model świata rozumie fizykę?
Częściowo. Najlepsze wyniki w Physics-IQ to ok. 66 punktów, czyli daleko od ideału. W moim teście proste rzeczy (chód, światło, mgła) wyglądały dobrze.
Czy mogę uruchomić model świata na swoim komputerze?
Cosmos i V-JEPA 2 tak, na mocnej karcie NVIDIA. Odyssey-3 i Genie 3 działają tylko w chmurze producenta.
Do czego przyda się to zwykłemu twórcy?
Do szkiców lokacji, nastroju scen i prototypów gier. Do gotowych produkcji jeszcze nie.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła i data sprawdzenia
- Odyssey - Meet Odyssey-3
- Google - Project Genie
- 9to5Google o Project Genie
- Wikipedia - Genie (world model)
- Mój test Odyssey-3, 9.10.2026. Wszystko sprawdzone 9 października 2026 roku.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
