PROMPTOWY_
Newsy

Olmo-core 3: otwarty system do trenowania modeli MoE w skali biliona parametrów

promptowy@ai:~$ cat news_1

› Olmo-core 3 zwiększa przepustowość trenowania 2,7-krotnie względem poprzedniej implementacji - z 19 400 do 52 000 tokenów na sekundę na GPU.

promptowy@ai:~$ cat news_2

› Framework przeszedł z FSDP na DDP, co pozwala trzymać ekspertów stale na GPU zamiast wielokrotnie zbierać i redystrybuować wagi modelu.

promptowy@ai:~$ cat news_3

› W testach pula ekspertów wzrosła ze 128 do 128, a całkowita pojemność parametrów z 4,6 mld do 47 mld, przy spadku przepustowości trenowania poniżej 5%.

promptowy@ai:~$ open --full
Czytaj całość

Olmo-core 3: otwarty system do trenowania modeli MoE w skali biliona parametrów

Otwórz artykuł na promptowy.com