NVIDIA Cosmos 3 - jak zacząć: poradnik krok po kroku
Otwarty model świata NVIDIA do fizycznego AI - czym jest Cosmos 3 i jak go uruchomić: od testu w przeglądarce, przez kod w Pythonie, po wdrożenie i dostrajanie.

NVIDIA udostępniła 31 maja 2026 roku Cosmos 3 - otwarty model świata (world foundation model) do tak zwanego fizycznego AI: robotów, pojazdów autonomicznych i symulacji. To pierwszy w pełni otwarty model „omni”, który w jednej sieci łączy rozumienie sceny z generowaniem obrazu, wideo, dźwięku i konkretnych ruchów. W tym poradniku tłumaczę, czym Cosmos 3 jest w praktyce i jak uruchomić go u siebie - od kliknięcia w przeglądarce po własny kod.
- NVIDIA Cosmos 3 to otwarty model świata (licencja OpenMDW 1.1) wydany 31 maja 2026 roku, który łączy rozumienie sceny z generowaniem wideo, dźwięku i trajektorii ruchu robotów.
- Cosmos 3 występuje w dwóch wariantach: Nano (16 mld parametrów) dla prototypów oraz Super (64 mld parametrów) dla produkcji wymagającej serwerowego GPU.
- Model zajmuje pierwsze miejsce na benchmarkach fizycznego AI, m.in. Physics-IQ, VANTAGE-Bench, R-Bench i PAI-Bench, a korzystają z niego już Agile Robots i Linker Vision.
Czym właściwie jest Cosmos 3
Sercem modelu jest architektura mixture-of-transformers: jeden transformer „rozumuje” - analizuje scenę, obiekty, ruch i relacje przestrzenno-czasowe - a drugi na tej podstawie „generuje” wideo i trajektorie ruchu. NVIDIA opisuje to jako „myślenie, zanim model zadziała”. Cosmos 3 jest przy tym modelem omni: przyjmuje i tworzy treści w wielu formatach naraz - tekst, obraz, wideo, dźwięk otoczenia oraz akcję, czyli dane liczbowe sterujące robotem (kąty stawów, pozycje chwytaka, punkty trajektorii).
Model jest otwarty na licencji OpenMDW 1.1 (Linux Foundation), a według NVIDIA zajmuje pierwsze miejsce na kilku benchmarkach fizycznego AI, m.in. Physics-IQ, VANTAGE-Bench, R-Bench i PAI-Bench.
Dwa warianty - który wybrać
- Cosmos3-Nano - 16 mld parametrów (8 mld część rozumująca + 8 mld generująca). Lżejszy, na start, eksperymenty i prototypy.
- Cosmos3-Super - 64 mld parametrów (32 + 32). Najwyższa jakość, ale wymaga mocnego, serwerowego GPU.
Jeśli dopiero zaczynasz, zacznij od wariantu Nano - uruchomisz go znacznie mniejszym kosztem, a dopiero gdy zweryfikujesz pomysł, przeskoczysz na Super.
Krok 1: wypróbuj bez instalacji
Najszybsza droga to przeglądarka. Wejdź na build.nvidia.com i wyszukaj „cosmos” - przetestujesz model online, bez własnej karty graficznej. To dobry sposób, żeby w kilka minut zobaczyć, co Cosmos 3 realnie potrafi, zanim cokolwiek instalujesz.
Krok 2: uruchom lokalnie (Python + Diffusers)
Do uruchomienia u siebie potrzebujesz karty NVIDIA z obsługą formatu bfloat16, Pythona oraz biblioteki Diffusers od Hugging Face. Najpierw instalacja zależności:
pip install -U git+https://github.com/huggingface/diffusers
pip install -U torch transformers accelerateNastępnie wczytujesz model i generujesz pierwszy wynik. Poniżej oficjalny przykład z dokumentacji (tu: obraz z opisu tekstowego, na wariancie Nano):
import torch
from diffusers import Cosmos3OmniPipeline
pipe = Cosmos3OmniPipeline.from_pretrained(
"nvidia/Cosmos3-Nano", torch_dtype=torch.bfloat16, device_map="cuda"
)
result = pipe(prompt=prompt, num_frames=1, height=720, width=1280)
result.video[0].save("cosmos3_t2i.jpg", format="JPEG", quality=85)Modele pobierzesz z Hugging Face: nvidia/Cosmos3-Nano oraz nvidia/Cosmos3-Super. Pełną dokumentację potoku znajdziesz w dokumentacji Diffusers.
Krok 3: wdrożenie produkcyjne i dostrajanie
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
- Wdrożenie: do produkcji najprościej użyć mikroserwisów NVIDIA NIM - dostają gotowe API do modelu, bez ręcznego stawiania całej infrastruktury.
- Dostrajanie i dane syntetyczne: kod do trenowania pod własne zadania oraz generowania danych syntetycznych jest w repozytoriach github.com/nvidia/Cosmos i Cosmos-Framework.
Do czego to realnie służy
Cosmos 3 najmocniej świeci tam, gdzie brakuje danych ze świata fizycznego. Pozwala generować dane syntetyczne do trenowania robotów i pojazdów (w tym rzadkie, „długoogonowe” scenariusze, których trudno nagrać w realu), przewidywać zachowanie sceny oraz budować modele sterowania (action). Z modelu korzystają już m.in. Agile Robots (dane do akcji robotów) i Linker Vision (analiza obrazu w mieście).
Podsumowanie
Cosmos 3 mocno obniża próg wejścia w fizyczne AI: zamiast zbierać własny ogromny zbiór danych, dostajesz gotowy, otwarty fundament, który rozumie świat i potrafi go generować. Zacznij od testu w przeglądarce, potem uruchom wariant Nano lokalnie, a po walidacji pomysłu wejdź na Super i NIM.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła oficjalne
- Blog NVIDIA: Cosmos 3
- NVIDIA Cosmos - strona produktu
- Modele Cosmos 3 na Hugging Face
- Repozytorium GitHub
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Jak uruchomić NVIDIA Cosmos 3 lokalnie bez wiedzy o infrastrukturze?
Najszybciej można przetestować Cosmos 3 w przeglądarce na build.nvidia.com, wpisując w wyszukiwarce "cosmos" - nie wymaga to własnej karty graficznej. Do lokalnego uruchomienia potrzebna jest karta NVIDIA z obsługą bfloat16, Python oraz biblioteka Diffusers od Hugging Face instalowana przez pip.
Jakie są wymagania sprzętowe do uruchomienia Cosmos 3 Nano?
Cosmos 3 Nano wymaga karty graficznej NVIDIA z obsługą formatu bfloat16. Wariant Nano ma 16 mld parametrów (8 mld część rozumująca i 8 mld generująca), więc jest znacznie lżejszy od wariantu Super, który ma 64 mld parametrów i wymaga mocnego serwerowego GPU.
Gdzie pobrać modele Cosmos 3 i jaką mają licencję?
Modele dostępne są na Hugging Face pod adresami nvidia/Cosmos3-Nano oraz nvidia/Cosmos3-Super. Cosmos 3 jest opublikowany na licencji OpenMDW 1.1 wydanej przez Linux Foundation.
Do czego konkretnie służy Cosmos 3 w robotyce i pojazdach autonomicznych?
Cosmos 3 pozwala generować syntetyczne dane treningowe dla robotów i pojazdów, w tym rzadkie scenariusze trudne do nagrania w rzeczywistości. Umożliwia też przewidywanie zachowania sceny i budowanie modeli sterowania - z funkcji tych korzystają już Agile Robots (dane do akcji robotów) i Linker Vision (analiza obrazu w mieście).



