Olmo-core 3: otwarty system do trenowania modeli MoE w skali biliona parametrów
Allen AI opublikował Olmo-core 3 - przeprojektowany, otwarty framework do trenowania wielkich modeli językowych w architekturze Mixture-of-Experts, skalujący się do ponad biliona parametrów.

Ten news ukazał się 4 min po komunikacie źródła.
👁 116 przeczytań
Allen AI wypuściło 1 października 2026 roku Olmo-core 3 - gruntownie przeprojektowany, w pełni otwarty framework do trenowania wielkich modeli językowych w architekturze Mixture-of-Experts (MoE), który ma skalować się do ponad biliona parametrów.
MoE to architektura, w której model zawiera wiele wyspecjalizowanych komponentów - ekspertów - ale dla każdego fragmentu wejścia aktywuje tylko ich część. To pozwala budować modele o ogromnej pojemności parametrów bez proporcjonalnego wzrostu kosztów obliczeniowych przy każdym przebiegu. Problem polega na tym, że wraz ze wzrostem liczby ekspertów rośnie też koszt koordynacji i komunikacji między węzłami klastra GPU - i ta cena potrafi zniwelować większość zysku z selektywnej aktywacji.
Nowy silnik pod maską
Kluczowa zmiana w Olmo-core 3 to porzucenie w MoE modelu fully sharded data parallelism (FSDP) na rzecz distributed data parallelism (DDP). W poprzednim podejściu framework zbierał i redystrybuował wagi modelu przy każdej małej partii danych treningowych. Nowe rozwiązanie trzyma ekspertów stale na przypisanych GPU i kieruje do nich odpowiednie dane - zamiast odwrotnie. Efekt jest mierzalny: na ośmiu kartach NVIDIA B300 model o 47 miliardach parametrów osiągnął 52 000 tokenów na sekundę na GPU wobec 19 400 w poprzedniej implementacji, czyli 2,7 razy więcej.
W praktycznym teście skalowalności pula ekspertów wzrosła z 8 do 128, przy czym dla każdego tokenu nadal aktywowane były tylko cztery z nich. Liczba aktywnych parametrów na token pozostała zbliżona - około 3,2 miliarda - natomiast całkowita pojemność modelu skoczyła z 4,6 miliarda do 47 miliardów parametrów. Przepustowość trenowania spadła przy tym o mniej niż 5%. Ta sama infrastruktura była testowana przy ponad biliona łącznych parametrów.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Otwartość jako wyróżnik
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Allen AI podkreśla, że Olmo-core 3 to jeden z kluczowych elementów kolejnej generacji modelu Olmo i że cały kod jest publicznie dostępny. W środowisku, gdzie duże laboratoria zazwyczaj trenują swoje MoE-e na zamkniętych stosach infrastruktury - jak NVIDIA Megatron-Core - otwarty framework z taką wydajnością może realnie obniżyć barierę wejścia dla mniejszych ośrodków akademickich i niezależnych laboratoriów.
Jeśli liczby z benchmarków potwierdzą się w produkcyjnych przebiegach treningowych, Olmo-core 3 będzie jednym z niewielu naprawdę otwartych narzędzi, które dotrzymują kroku zamkniętym rozwiązaniom w tej skali.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
