› Olmo-core 3 zwiększa przepustowość trenowania 2,7-krotnie względem poprzedniej implementacji - z 19 400 do 52 000 tokenów na sekundę na GPU.
› Framework przeszedł z FSDP na DDP, co pozwala trzymać ekspertów stale na GPU zamiast wielokrotnie zbierać i redystrybuować wagi modelu.
› W testach pula ekspertów wzrosła ze 128 do 128, a całkowita pojemność parametrów z 4,6 mld do 47 mld, przy spadku przepustowości trenowania poniżej 5%.