Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Modele świata (world models): co to i po co. Genie, Odyssey, Cosmos, V-JEPA

Przewodnik po modelach świata: Genie 3, Odyssey-3, NVIDIA Cosmos, V-JEPA 2 i World Labs. Dostęp z Polski, ceny i mój test.

8 min czytania
Logo Odyssey i napis Modele świata - przewodnik po Genie, Odyssey, Cosmos i V-JEPA

👁 119 przeczytań

// w skrócie
  • Model świata różni się od generatora wideo tym, że liczy obraz klatka po klatce w reakcji na sterowanie i ma pamiętać wcześniej pokazane elementy.
  • Jedynym dużym modelem świata dostępnym z Polski za darmo i bez konta jest Odyssey-3, który działa na stronie experience.odyssey.systems i generuje obraz w rozdzielczości 832x480.
  • NVIDIA Cosmos i Meta V-JEPA 2 mają otwarte wagi i można je pobrać oraz uruchomić na własnym sprzęcie z mocną kartą graficzną NVIDIA.

Model świata (world model) to AI, która nie pisze tekstu i nie robi gotowego filmu, tylko przewiduje, jak zmieni się świat po czyimś ruchu. Dzięki temu można po wygenerowanym świecie chodzić jak w grze, a robot może „przećwiczyć” zadanie, zanim zrobi je naprawdę. W tym przewodniku zbieram najważniejsze modele - Genie, Odyssey, Cosmos, V-JEPA i Atlas - z tym, co działa w Polsce, ile kosztuje i co sam sprawdziłem.

Stan na 9 października 2026

  • Najnowszy: Odyssey-3 (8.10.2026) - darmowy podgląd w przeglądarce, bez konta, działa z Polski.
  • Najgłośniejszy: Genie 3 od Google DeepMind, dostępny jako Project Genie w planie Google AI Ultra.
  • Otwarte wagi: NVIDIA Cosmos i Meta V-JEPA 2 - do pobrania i uruchomienia na własnym sprzęcie.
  • Mój test: Bieszczady i Kraków w Odyssey-3 - wyniki niżej.

Co to jest model świata

Duży model językowy przewiduje kolejne słowo. Model świata przewiduje kolejny stan świata: następną klatkę obrazu, położenie przedmiotów, ruch kamery. Ważne jest wejście sterujące. Model dostaje informację „gracz idzie do przodu” albo „ramię robota zamyka chwytak” i musi pokazać, co z tego wyniknie.

Różnica w porównaniu z generatorem wideo, takim jak Veo:

  • generator wideo robi cały klip naraz, a ja mogę go tylko obejrzeć;
  • model świata liczy obraz klatka po klatce, na bieżąco, w reakcji na moje sterowanie;
  • model świata powinien pamiętać, co już pokazał - jeśli odwrócę się i wrócę, dom ma stać w tym samym miejscu (to wciąż najsłabszy punkt).

Starszy tekst o tym, dlaczego badacze uważają modele świata za kolejny krok po LLM-ach, jest tutaj: modele świata - AI, które rozumie fizykę.

Jak to działa od środka

Większość dzisiejszych modeli świata, które rysują obraz, ma podobny schemat:

  • Trening na wideo: model ogląda miliony godzin nagrań, często z gier i kamer samochodowych, razem z informacją, jakie było sterowanie (klawisze, kierownica, ruch ramienia).
  • Przewidywanie krok po kroku: na podstawie ostatnich klatek i sterowania model przewiduje następną klatkę. To podejście autoregresywne, takie jak w LLM-ach, tylko zamiast słów są obrazy.
  • Dyfuzja: każda nowa klatka powstaje przez odszumianie, jak w generatorach obrazów. Żeby działało w czasie rzeczywistym, firmy „destylują” model tak, żeby wystarczyło kilka kroków odszumiania.
  • Pamięć: model widzi tylko ograniczone okno przeszłości. Gdy coś z niego wypadnie, model musi to wymyślić od nowa - stąd zmieniające się budynki.

V-JEPA idzie inną drogą: zamiast pikseli przewiduje opis stanu świata w przestrzeni pojęć. Nie da się w nim „pochodzić”, za to jest dużo tańszy w obliczeniach i lepiej nadaje się do planowania ruchów robota.

Ograniczenia, o których producenci mówią mniej

  • Trwałość obiektów: po odwróceniu kamery świat często się zmienia. Widziałem to w Odyssey-3 po 10 sekundach.
  • Krótkie sesje: darmowe podglądy dają kilka minut, a Genie 3 według Google utrzymuje spójny świat przez kilka minut.
  • Rozdzielczość: 480p-720p, daleko od jakości generatorów wideo w 4K.
  • Brak lokalnej wiedzy: modele znają ogólne „europejskie miasto”, ale nie polskie zabytki.
  • Wyniki testów od producentów: niezależnych pomiarów jest mało, a każda firma wybiera warianty testów, w których wypada najlepiej.

Po co to komu

  • Robotyka i auta autonomiczne: trening w symulacji zamiast tysięcy godzin jazdy i prób na prawdziwym sprzęcie. To główny rynek NVIDII i Odyssey.
  • Agenci AI: nieskończona liczba środowisk do nauki, także gier.
  • Gry i film: szybkie szkice lokacji i nastroju, prototypy światów.
  • Nauka: sprawdzanie, czy AI rozumie fizykę - stąd testy takie jak Physics-IQ.

Najważniejsze modele świata w październiku 2026

ModelFirmaCo robiDostęp z PolskiWagi
Odyssey-3 / ProOdysseyinteraktywny świat z promptu w czasie rzeczywistym, 832×480 / 1280×720, widok z 1. i 3. osobytak, darmowy podgląd bez konta; API przez kontaktnie
Genie 3 (Project Genie)Google DeepMindświat do eksploracji z opisu lub zdjęcia, 720p, 24 klatki/sw planie Google AI Ultra, 18+nie
Cosmos (w tym Cosmos 3 i Cosmos 3 Edge)NVIDIAmodele świata dla robotów i aut, generowanie danych treningowychtak, do pobraniatak (licencja NVIDII)
V-JEPA 2Metarozumie i przewiduje wideo w przestrzeni pojęć, bez rysowania klatek; planowanie ruchów robotatak, do pobraniatak
Atlas i MarbleWorld Labssceny 3D i wideo ze zdjęcia, eksport do splatów 3DMarble w przeglądarce; Atlas zapowiedzianynie

Genie 3 i Project Genie

Genie 3 to model Google DeepMind pokazany w sierpniu 2025 roku. Generuje świat, po którym można się poruszać, w 720p i 24 klatkach na sekundę. W styczniu 2026 roku Google udostępniło go w Labs jako Project Genie - najpierw tylko subskrybentom Google AI Ultra w USA. Według doniesień z maja 2026 roku dostęp rozszerzono na subskrybentów Ultra w innych krajach, ale Google nie opublikowało listy krajów. Project Genie łączy Genie 3 z Nano Banana i Gemini. O tym, jak Genie wpisuje się w wyścig gigantów, pisałem w tekście world models - następna granica AI po LLM-ach.

Odyssey-3

Odyssey z Palo Alto wypuściło Odyssey-3 8 października 2026 roku. To autoregresywny transformer dyfuzyjny, czyli model, który odszumia kolejne klatki, biorąc pod uwagę poprzednie i sterowanie. Został „przyspieszony” tak, żeby potrzebował kilku kroków na klatkę - stąd działanie w czasie rzeczywistym. Ten sam model ma sterować robotami, autami, dronami i trenować agentów. Szczegóły i pełny test są w tekście Odyssey-3: test na Bieszczadach.

NVIDIA Cosmos

Cosmos to rodzina otwartych modeli NVIDII do tak zwanej fizycznej AI. Służy głównie do generowania syntetycznych danych dla robotów i aut. Wariant Edge jest przycięty do pracy na urządzeniach, bez chmury. Instrukcję uruchomienia opisałem w poradniku NVIDIA Cosmos 3 - jak zacząć, a premierę wersji Edge w tekście Cosmos 3 Edge.

V-JEPA 2 i Yann LeCun

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

V-JEPA 2 to model Mety z czerwca 2025 roku. Działa inaczej niż reszta: nie rysuje klatek, tylko przewiduje, co się stanie, w abstrakcyjnej przestrzeni pojęć. To podejście promuje Yann LeCun, który uważa, że generowanie każdego piksela to strata mocy. Wagi są otwarte. LeCun odszedł z Mety i rozwija tę ideę we własnym startupie - historię opisałem w tekście Yann LeCun kontra reszta świata.

World Labs: Marble i Atlas

Startup Fei-Fei Li robi modele przestrzenne. Marble tworzy sceny 3D, a Atlas pokazany 1 września 2026 roku generuje z jednego zdjęcia do minuty wideo w 1440p z dokładną kontrolą kamery i eksportem do chmur punktów. Więcej w tekście World Labs pokazuje Atlas.

Wyniki w teście fizyki Physics-IQ

Physics-IQ sprawdza, czy model przewiduje dalszy ciąg nagrania zgodnie z fizyką: spadanie, zderzenia, płyny. Poniżej wyniki podane przez Odyssey przy premierze. Inne firmy publikują wyniki w różnych wariantach testu, więc nie mieszam ich w jednym wykresie.

Physics-IQ Verified (wyżej = lepiej), dane Odyssey z 8.10.2026
Odyssey-3 Pro, wideo do wideo66,1
FLUX 3, wideo do wideo64,35
Odyssey-3 Pro, obraz do wideo54,7

Mój test: polskie miejsca w Odyssey-3

Odyssey-3 to jedyny duży model świata, który 9 października 2026 roku mogłem uruchomić z Polski bez konta i bez płacenia. Wpisałem trzy światy: połoninę w Bieszczadach po angielsku, to samo po polsku i Rynek Główny w Krakowie zimą.

Odyssey-3, mój test: mgła nad bieszczadzką doliną, rude trawy, kamienny murek
Odyssey-3 z polskim promptem o połoninie w Bieszczadach - kadr po obrocie kamery.
Co sprawdzałemWynik
Polski promptzrozumiany
Klimat Bieszczad (mgła, trawy, pagórki)dobry
Cerkiew łemkowska, Sukiennice, Mariackinie - ogólne budynki „z Europy”
Płynność ruchu i obrotu kamerydobra
Pamięć świata po obrociesłaba - budynek zmienił kształt

Wniosek: model świetnie łapie nastrój, ale nie zna polskich miejsc i nie trzyma trwałości obiektów. Do szkiców lokacji wystarczy, do wiernej wizualizacji nie.

Jak zacząć - trzy drogi

  1. Za darmo, w 5 minut: experience.odyssey.systems, wpisuję opis świata, steruję klawiszami WASD i strzałkami.
  2. W abonamencie Google: Project Genie w Google AI Ultra - sprawdź w Labs, czy jest dostępny na Twoim koncie.
  3. Na własnym sprzęcie: NVIDIA Cosmos albo V-JEPA 2 z Hugging Face. Potrzebna mocna karta graficzna i znajomość Pythona.

Modele świata a gry z AI

Modele świata łatwo pomylić z narzędziami do robienia gier. Google Labs Playground składa prawdziwą grę z zasadami, punktami i rankingiem, a model świata generuje tylko przestrzeń do chodzenia, bez reguł. Playground działa na razie tylko w USA - co wiadomo i jak zacząć.

Najczęstsze pytania

Czym model świata różni się od generatora wideo?

Generator robi gotowy klip. Model świata liczy obraz na bieżąco w reakcji na sterowanie i ma pamiętać, co już pokazał.

Czy jest darmowy model świata?

Tak. Odyssey-3 ma darmowy podgląd w przeglądarce, a Cosmos i V-JEPA 2 mają otwarte wagi.

Czy Genie 3 działa w Polsce?

Project Genie jest w planie Google AI Ultra. Google nie podało listy krajów, więc trzeba sprawdzić na własnym koncie.

Czy model świata rozumie fizykę?

Częściowo. Najlepsze wyniki w Physics-IQ to ok. 66 punktów, czyli daleko od ideału. W moim teście proste rzeczy (chód, światło, mgła) wyglądały dobrze.

Czy mogę uruchomić model świata na swoim komputerze?

Cosmos i V-JEPA 2 tak, na mocnej karcie NVIDIA. Odyssey-3 i Genie 3 działają tylko w chmurze producenta.

Do czego przyda się to zwykłemu twórcy?

Do szkiców lokacji, nastroju scen i prototypów gier. Do gotowych produkcji jeszcze nie.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›