Ten sam klaster GPU, o 33 punkty procentowe lepsze wykorzystanie - wystarczyło zmienić kolejność zadań
Zespół Dharma AI opisał, jak sama zmiana kolejności kolejkowania zadań na klastrze GPU podniosła jego wykorzystanie o 33 punkty procentowe - bez dokupowania sprzętu.
👁 127 przeczytań
Zespół Dharma AI opublikował na Hugging Face opis eksperymentu, który pokazuje, ile mocy obliczeniowej można odzyskać bez wydawania ani grosza na nowy sprzęt. Ten sam klaster GPU, ta sama liczba zadań - a wykorzystanie zasobów wzrosło o 33 punkty procentowe. Jedyna zmiana: kolejność, w jakiej zadania trafiały do kolejki.
To druga część serii o zarządzaniu GPU. W praktyce duże klastry obliczeniowe bardzo rzadko pracują na pełnych obrotach - harmonogramy zadań generują przestoje, gdy krótkie joby czekają za długimi, albo gdy zasoby stoją bezczynnie między kolejnymi przebiegami treningowymi. Dharma AI pokazuje, że przemyślane szeregowanie zadań - uwzględniające ich szacowany czas trwania i zależności między nimi - pozwala te luki eliminować bez żadnej rozbudowy infrastruktury.
Wpis dotyczy modelu z kategorii image-text-to-text o rozmiarze 4B parametrów i zebrał ponad tysiąc wyświetleń w ciągu kilku dni od publikacji. Liczby są konkretne i łatwe do zweryfikowania, co w dyskusjach o optymalizacji GPU zdarza się rzadziej, niż powinno.
Dla firm płacących za czas GPU w chmurze albo zarządzających własnymi klastrami to rodzaj wyniku, który trudno zignorować - potencjalne oszczędności liczone są w dziesiątkach procent budżetu obliczeniowego, a inwestycja sprowadza się do zmiany logiki schedulera.
Jeśli połowa problemów z wydajnością klastrów AI wynika nie z braku sprzętu, ale ze złego harmonogramowania, to ten wpis powinien trafić na biurko każdego, kto podpisuje faktury za GPU.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


