Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Newsy

Jak Ai2 naprawiło kolejkowanie zadań na tysiącach GPU H100, B200 i B300

Allen Institute for AI opisał, jak zastąpił priorytetowy scheduler systemem budżetów czasu GPU i hierarchicznego fair-share, eliminując patologie takie jak 'GPU squatting’ i inflację priorytetów na klastrach złożonych z tysięcy kart H100, B200 i B300.

3 min czytania
Jak Ai2 naprawiło kolejkowanie zadań na tysiącach GPU H100, B200 i B300Źródło: Hugging Face (materiały prasowe)

Ten news ukazał się 10 min po komunikacie źródła.

👁 121 przeczytań

Allen Institute for AI (Ai2) opublikował szczegółowy opis przebudowy systemu kolejkowania zadań na własnych klastrach GPU - i to, co w nim opisano, to klasyczna historia o tym, jak dobrze zaprojektowana infrastruktura potrafi rozpaść się pod presją prawdziwego użytkowania.

Nadwyżka popytu na czas GPU w klastrach Ai2
Minimalne zapotrzebowanie2 x podaży
Maksymalne zapotrzebowanie3 x podaży

dane: Ai2 Infrastructure Team, Hugging Face Blog, październik 2026

Ai2 zarządza tysiącami kart NVIDIA H100, B200 i B300, zorganizowanych w klastry o rozmiarach od 88 do 1024 GPU. Z tej infrastruktury korzysta około 150 wewnętrznych badaczy zajmujących się bardzo różnymi zadaniami: od trenowania dużych modeli językowych (LLM) i modeli wizualno-językowych (VLM), przez symulacje reinforcement learning dla robotyki, aż po post-training dla naukowych zastosowań agentowych. To zakres prac, który wymaga zarówno długich, stabilnych sesji treningowych, jak i szybkiego dostępu do debugowania w czasie rzeczywistym - a te dwa wymagania trudno pogodzić jednym mechanizmem priorytetów.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Tragedia wspólnych zasobów

Problem nie był nowy ani zaskakujący - popyt na czas GPU przekraczał podaż od dawna. W każdej chwili w kolejce czekały zadania wymagające łącznie 2 do 3 razy więcej kart, niż było dostępnych. Innymi słowy, na każdą wolną godzinę obliczeniową przypadały dwa lub trzy różne projekty badawcze ubiegające się o te same zasoby.

Stary system opierał się na priorytetach i pozwalał zadaniom rezygnować z preemptowalności, czyli możliwości wymuszenia ich przerwania na rzecz ważniejszego zadania. Każdy zespół miał limit jednoczesnych GPU chronionych przed przerwaniem; preemptowalne zadania mogły natomiast korzystać z bezczynnych kart ponad ten limit. Na papierze brzmi to rozsądnie. W praktyce pojawiły się przewidywalne patologie.

Pierwsza to tzw. GPU squatting - badacze „parkowali” puste zadania (no-op workloads), do których mogli się szybko podłączyć, gdy potrzebowali debugować kod. Robili to, bo uruchomienie nowego zadania z wystarczająco niskim opóźnieniem po prostu nie było możliwe. Druga patologia to inflacja priorytetów: w pewnym momencie 100% zaplanowanych zadań używało najwyższego poziomu priorytetu HIGH. Niższe priorytety zostały całkowicie wygłodzone z czasu GPU. Trzecia - może najbardziej kosztowna operacyjnie - to fakt, że inżynierowie dyżurni spędzali większość czasu odpowiedzi na zgłoszenia na ręcznym negocjowaniu wyłączenia niepreemptowalnych zadań biegnących na hostach z wykrytymi problemami sprzętowymi.

Jak Ai2 naprawiło kolejkowanie zadań na tysiącach GPU H100, B200 i B300
Źródło: Hugging Face (materiały prasowe)

Ai2 przyznaje, że przez pewien czas nie dostrzegało źródłowej przyczyny tych problemów. Pierwsze próby naprawcze skupiały się na ściślejszej kontroli nadawania priorytetów, a następnie na obchodzeniu schedulera przez ręczne przyznawanie wybranych klastrów konkretnym projektom jako monopolu GPU. Dopiero później zespół rozpoznał w tym układzie klasyczną tragedię wspólnych zasobów - sytuację, w której każdy uczestnik, działając racjonalnie we własnym interesie, degraduje zasób wspólny w sposób, którego nikt indywidualnie nie chciał.

Rozwiązaniem okazało się zastąpienie priorytetowego schedulera systemem złożonym z trzech elementów: budżetów czasu GPU przydzielanych projektom z góry, hierarchicznego fair-share allocation oraz tzw. kontraktu na time-slicing - jawnej umowy o tym, w jakich oknach czasowych dany projekt ma prawo do zasobów. Kluczowa zmiana była jednak organizacyjna, nie tylko techniczna: debata o tym, ile czasu GPU należy się danemu projektowi badawczemu, przestała być doraźną negocjacją operacyjną, a stała się przejrzystym procesem budżetowania administracyjnego.

Jak Ai2 naprawiło kolejkowanie zadań na tysiącach GPU H100, B200 i B300
Źródło: Hugging Face (materiały prasowe)

To rozróżnienie jest ważne dla każdego, kto zarządza współdzieloną infrastrukturą obliczeniową. Problem Ai2 nie był problemem złego algorytmu szeregowania zadań - był problemem błędnie zaprojektowanych bodźców. Kiedy badacz może zablokować GPU bez ponoszenia widocznego kosztu, zrobi to. Kiedy priorytet nie ma żadnej ceny, wszyscy ustawiają go na maksimum. Nowy system sprawia, że te decyzje mają mierzalne konsekwencje budżetowe widoczne dla całej organizacji - a to zmienia zachowanie skuteczniej niż jakikolwiek algorytm preempcji.

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›