✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Newsy

Olmo-core 3: otwarty system do trenowania modeli MoE w skali biliona parametrów

Allen AI opublikował Olmo-core 3 - przeprojektowany, otwarty framework do trenowania wielkich modeli językowych w architekturze Mixture-of-Experts, skalujący się do ponad biliona parametrów.

2 min czytania
Olmo-core 3: otwarty system do trenowania modeli MoE w skali biliona parametrów

Ten news ukazał się 4 min po komunikacie źródła.

👁 116 przeczytań

Allen AI wypuściło 1 października 2026 roku Olmo-core 3 - gruntownie przeprojektowany, w pełni otwarty framework do trenowania wielkich modeli językowych w architekturze Mixture-of-Experts (MoE), który ma skalować się do ponad biliona parametrów.

MoE to architektura, w której model zawiera wiele wyspecjalizowanych komponentów - ekspertów - ale dla każdego fragmentu wejścia aktywuje tylko ich część. To pozwala budować modele o ogromnej pojemności parametrów bez proporcjonalnego wzrostu kosztów obliczeniowych przy każdym przebiegu. Problem polega na tym, że wraz ze wzrostem liczby ekspertów rośnie też koszt koordynacji i komunikacji między węzłami klastra GPU - i ta cena potrafi zniwelować większość zysku z selektywnej aktywacji.

Nowy silnik pod maską

Kluczowa zmiana w Olmo-core 3 to porzucenie w MoE modelu fully sharded data parallelism (FSDP) na rzecz distributed data parallelism (DDP). W poprzednim podejściu framework zbierał i redystrybuował wagi modelu przy każdej małej partii danych treningowych. Nowe rozwiązanie trzyma ekspertów stale na przypisanych GPU i kieruje do nich odpowiednie dane - zamiast odwrotnie. Efekt jest mierzalny: na ośmiu kartach NVIDIA B300 model o 47 miliardach parametrów osiągnął 52 000 tokenów na sekundę na GPU wobec 19 400 w poprzedniej implementacji, czyli 2,7 razy więcej.

W praktycznym teście skalowalności pula ekspertów wzrosła z 8 do 128, przy czym dla każdego tokenu nadal aktywowane były tylko cztery z nich. Liczba aktywnych parametrów na token pozostała zbliżona - około 3,2 miliarda - natomiast całkowita pojemność modelu skoczyła z 4,6 miliarda do 47 miliardów parametrów. Przepustowość trenowania spadła przy tym o mniej niż 5%. Ta sama infrastruktura była testowana przy ponad biliona łącznych parametrów.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Otwartość jako wyróżnik

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Allen AI podkreśla, że Olmo-core 3 to jeden z kluczowych elementów kolejnej generacji modelu Olmo i że cały kod jest publicznie dostępny. W środowisku, gdzie duże laboratoria zazwyczaj trenują swoje MoE-e na zamkniętych stosach infrastruktury - jak NVIDIA Megatron-Core - otwarty framework z taką wydajnością może realnie obniżyć barierę wejścia dla mniejszych ośrodków akademickich i niezależnych laboratoriów.

Jeśli liczby z benchmarków potwierdzą się w produkcyjnych przebiegach treningowych, Olmo-core 3 będzie jednym z niewielu naprawdę otwartych narzędzi, które dotrzymują kroku zamkniętym rozwiązaniom w tej skali.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›