NVIDIA Vera Rubin NVL72 debiutuje w MLPerf z wynikiem 3,7x lepszym od poprzednika
NVIDIA zaprezentowała pierwsze wyniki swojego systemu Vera Rubin NVL72 w benchmarku MLPerf Inference v6.1, osiągając przepustowość do 3,7 raza wyższą niż poprzednia generacja GB300 NVL72.

👁 112 przeczytań
NVIDIA ujawniła 16 września 2026 roku pierwsze wyniki swojego systemu Vera Rubin NVL72 w benchmarku MLPerf Inference v6.1, notując przepustowość do 3,7 raza wyższą niż poprzednia flagowa platforma GB300 NVL72. To nie jest kolejny incremental update - to sygnał, że wyścig o dominację w inferencji wielkoskalowej wchodzi w zupełnie nową fazę.
Co konkretnie zmierzono i jak
MLPerf Inference jest branżowym benchmarkiem prowadzonym przez MLCommons Association, który testuje systemy AI w warunkach zbliżonych do produkcyjnych. Wersja v6.1 obejmuje scenariusze offline, server oraz interactive - każdy z nich symuluje inne wzorce obciążenia, od przetwarzania wsadowego po odpowiedzi w czasie rzeczywistym.
NVIDIA zgłosiła Vera Rubin NVL72 jako submisję preview na dwóch benchmarkach: DeepSeek-R1 oraz Qwen3-VL. Wybór tych konkretnych modeli nie jest przypadkowy - oba to ogromne architektury mixture-of-experts (MoE), które przez swoją strukturę szczególnie mocno obciążają pamięć i magistrale komunikacyjne między akceleratorami. Właśnie na nich widać różnicę między platformami najwyraźniej.
Na Qwen3-VL wynik to 3,7x wyższa przepustowość niż GB300 NVL72, uzyskana przy użyciu vLLM z frameworkiem NVIDIA Dynamo. Na DeepSeek-R1, gdzie pracuje TensorRT-LLM, przewaga wynosi 2,5x. Oba rezultaty mierzą tokeny generowane per sekundę - a więc bezpośrednio przekładają się na liczbę obsługiwanych użytkowników i generowany przychód z jednego racka sprzętu.
Skąd bierze się ta różnica wydajności
Za wynikami stoją trzy warstwy zmian. Po pierwsze, sam krzem: Vera Rubin wprowadza ulepszone Tensor Cores i nową wersję Transformer Engine, które przyspieszają zarówno fazę prefill (przetwarzanie kontekstu wejściowego), jak i decode (generowanie kolejnych tokenów). To fundamentalne dla modeli rozumowania, gdzie długi kontekst to norma, nie wyjątek.
Po drugie, precyzja obliczeniowa: Vera Rubin domyślnie wykorzystuje NVFP4 - format o mniejszym zajęciu pamięci niż dotychczas stosowany FP8. Redukuje to footprint wag modelu, mechanizmu attention i KV cache, co przy modelach liczących setki miliardów parametrów oznacza realne zwiększenie efektywnej pojemności pamięci HBM. Efekt: więcej requestów obsługiwanych równolegle, niższy koszt tokenu.
Po trzecie, komunikacja między GPU: NVLink szóstej generacji z NVLink Switch zapewnia 10x wyższy packet rate niż poprzednia generacja. W architekturze MoE, gdzie dane muszą być routowane między ekspertami rozłożonymi na dziesiątkach kart, to wąskie gardło potrafi dominować nad samą mocą obliczeniową. Vera Rubin NVL72 adresuje je bezpośrednio.
Do tego dochodzi disaggregated serving - separacja faz prefill i decode na różne pule zasobów, połączona z large-scale expert parallelism. To podejście architektoniczne, które NVIDIA mocno forsuje w swoim frameworku Dynamo i które widać w topowych submisji v6.1.
Skalowanie i software - dwa ciche czynniki ekonomiczne
Vera Rubin NVL72 to tylko jeden z elementów wyników opublikowanych przez NVIDIA. Równolegle firma pokazała dane dla GB300 NVL72 działającego w konfiguracji czterech racków - 288 GPU łącznie. Osiągnięto tam 99% efektywności skalowania: przepustowość rośnie niemal dokładnie proporcjonalnie do liczby dodanych akceleratorów.
To liczba, której znaczenia łatwo nie docenić. W praktyce większość systemów wielorackowych traci kilka do kilkunastu procent przepustowości na komunikację i synchronizację - i te straty kumulują się z każdym kolejnym rackiem. 99% scaling efficiency oznacza, że operator centrum danych może planować pojemność z matematyczną przewidywalnością: chcesz dwukrotnie więcej tokenów, kupujesz dwa razy więcej sprzętu i rzeczywiście je dostajesz.
Osobna historia to samo oprogramowanie. Między v6.0 a v6.1 NVIDIA uzyskała do 1,6x wyższy performance wyłącznie przez optymalizacje software’owe - bez zmiany sprzętu. I co ważne: firma zaznacza, że dalsze optymalizacje kontynuowano już po zamknięciu submisji, co oznacza, że wyniki produkcyjne na identycznym sprzęcie będą wyższe od opublikowanych benchmarkowych.
To pokazuje pewien mechanizm, który odróżnia NVIDIA od konkurencji pracującej nad własnymi chipami do AI: platforma CUDA z całym ekosystemem narzędzi (TensorRT-LLM, Dynamo, NIM) pozwala wyciągać coraz więcej z tego samego krzemu bez konieczności wymiany infrastruktury. Dla operatora hiperskali, który kupił tysiące kart przed rokiem, każdy taki update to realna wartość finansowa.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co to zmienia dla tych, którzy podejmują decyzje infrastrukturalne
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Dla centrów danych i dostawców cloud wyniki MLPerf v6.1 mają konkretne przełożenie na kalkulacje biznesowe. Koszt obsługi jednego miliona tokenów - metryka, która w 2025 i 2026 roku stała się faktycznym wskaźnikiem rentowności usług AI - zależy wprost od tego, ile tokenów wygeneruje jeden rack na godzinę. Jeśli Vera Rubin NVL72 daje 3,7x więcej tokenów per rack niż GB300 NVL72, to koszt per token spada proporcjonalnie - przy założeniu zbliżonej ceny energii i dzierżawy przestrzeni.
Dla polskich przedsiębiorstw i organizacji, które korzystają z API opartych na infrastrukturze hiperskali, te wyniki przełożą się na niższe ceny usług AI w perspektywie kilkunastu miesięcy - nie dlatego, że dostawcy nagle staną się hojniejsi, ale dlatego, że ich własne koszty marginalnej obsługi requestu będą niższe.
NVIDIA zaznacza wprost, że platforma jest zaprojektowana pod fungibility - ten sam sprzęt obsługuje trening, inferencję, modele językowe, wideo, systemy rekomendacyjne i modele rozumowania. W środowisku, gdzie modele zmieniają się co kilka miesięcy, a workloady są trudne do przewidzenia, to argument równie ważny co surowe FLOPS.
Wyniki v6.1 to dopiero preview submisja dla Vera Rubin - pełne testy przyjdą w kolejnych rundach. Ale nawet te wczesne liczby pokazują, że generacyjna luka między kolejnymi platformami NVIDIA nie maleje.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
