Skompresowany model 4-bitowy, który bije swój oryginał na pełnej precyzji
Multiverse Computing zaprezentowało technikę Quantization-Aware Healing, dzięki której skompresowany do 4 bitów model językowy osiąga lepsze wyniki niż jego wersja na pełnej precyzji.
👁 140 przeczytań
Firma Multiverse Computing opublikowała na Hugging Face opis techniki Quantization-Aware Healing (QAH) - metody kompresji modeli językowych, która pozwala uzyskać wersję 4-bitową działającą lepiej niż oryginał na pełnej precyzji liczb zmiennoprzecinkowych.
To wynik nieoczywisty. Kwantyzacja, czyli redukcja precyzji reprezentacji wag modelu, od zawsze wiązała się z kompromisem: mniejszy, szybszy model to gorszy model. Im agresywniej kompresujemy - a 4 bity to kompresja bardzo agresywna w porównaniu ze standardowym FP16 czy BF16 - tym więcej informacji tracimy i tym bardziej spada jakość odpowiedzi. QAH ma ten kompromis odwrócić.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Na czym polega „leczenie” modelu
Kluczem jest dodatkowy etap treningu przeplatany z kwantyzacją. Zamiast skompresować model jednorazowo i zaakceptować straty, technika wielokrotnie symuluje efekty kwantyzacji podczas uczenia i pozwala sieci „nauczyć się” działać w obniżonej precyzji. Ten etap odbudowywania sprawności - stąd nazwa healing, czyli leczenie - sprawia, że model nie tylko odrabia straty wynikające z kompresji, ale potrafi je przekroczyć. W efekcie model 4-bitowy może generować lepsze odpowiedzi niż jego nieskompresowany odpowiednik.
Opublikowany model liczy 59 miliardów parametrów i w ciągu osiemnastu dni od publikacji zebrał prawie 4 tysiące pobrań. To stosunkowo duża architektura, co czyni wynik szczególnie interesującym - przy mniejszych modelach efekty kwantyzacji są zazwyczaj mniej dotkliwe; przy 59 miliardach parametrów różnice w jakości między wersjami pełno- i niskoprecyzyjną są znaczące i łatwiej je zmierzyć.
Praktyczne znaczenie tej techniki wykracza poza sam wynik benchmarkowy. Modele skwantyzowane do 4 bitów zajmują kilkakrotnie mniej pamięci i działają szybciej przy wnioskowaniu, co obniża koszty infrastruktury i otwiera możliwość uruchamiania dużych modeli na sprzęcie, który dotąd był do tego za słaby. Jeśli przy okazji kompresja nie pogarsza, a poprawia jakość, argument za wdrożeniem kwantyzacji staje się zdecydowanie mocniejszy.
Multiverse Computing to firma specjalizująca się w obliczeniach dla sektora finansowego i obronnego, znana dotąd głównie z zastosowań obliczeń kwantowych. Publikacja modelu i opisu techniki na Hugging Face sugeruje poszerzenie obszaru działalności o optymalizację klasycznych modeli językowych.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


