🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Skompresowany model 4-bitowy, który bije swój oryginał na pełnej precyzji

Multiverse Computing zaprezentowało technikę Quantization-Aware Healing, dzięki której skompresowany do 4 bitów model językowy osiąga lepsze wyniki niż jego wersja na pełnej precyzji.

2 min czytania
Skompresowany model 4-bitowy, który bije swój oryginał na pełnej precyzji

👁 140 przeczytań

Firma Multiverse Computing opublikowała na Hugging Face opis techniki Quantization-Aware Healing (QAH) - metody kompresji modeli językowych, która pozwala uzyskać wersję 4-bitową działającą lepiej niż oryginał na pełnej precyzji liczb zmiennoprzecinkowych.

To wynik nieoczywisty. Kwantyzacja, czyli redukcja precyzji reprezentacji wag modelu, od zawsze wiązała się z kompromisem: mniejszy, szybszy model to gorszy model. Im agresywniej kompresujemy - a 4 bity to kompresja bardzo agresywna w porównaniu ze standardowym FP16 czy BF16 - tym więcej informacji tracimy i tym bardziej spada jakość odpowiedzi. QAH ma ten kompromis odwrócić.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Na czym polega „leczenie” modelu

Kluczem jest dodatkowy etap treningu przeplatany z kwantyzacją. Zamiast skompresować model jednorazowo i zaakceptować straty, technika wielokrotnie symuluje efekty kwantyzacji podczas uczenia i pozwala sieci „nauczyć się” działać w obniżonej precyzji. Ten etap odbudowywania sprawności - stąd nazwa healing, czyli leczenie - sprawia, że model nie tylko odrabia straty wynikające z kompresji, ale potrafi je przekroczyć. W efekcie model 4-bitowy może generować lepsze odpowiedzi niż jego nieskompresowany odpowiednik.

Opublikowany model liczy 59 miliardów parametrów i w ciągu osiemnastu dni od publikacji zebrał prawie 4 tysiące pobrań. To stosunkowo duża architektura, co czyni wynik szczególnie interesującym - przy mniejszych modelach efekty kwantyzacji są zazwyczaj mniej dotkliwe; przy 59 miliardach parametrów różnice w jakości między wersjami pełno- i niskoprecyzyjną są znaczące i łatwiej je zmierzyć.

Praktyczne znaczenie tej techniki wykracza poza sam wynik benchmarkowy. Modele skwantyzowane do 4 bitów zajmują kilkakrotnie mniej pamięci i działają szybciej przy wnioskowaniu, co obniża koszty infrastruktury i otwiera możliwość uruchamiania dużych modeli na sprzęcie, który dotąd był do tego za słaby. Jeśli przy okazji kompresja nie pogarsza, a poprawia jakość, argument za wdrożeniem kwantyzacji staje się zdecydowanie mocniejszy.

Multiverse Computing to firma specjalizująca się w obliczeniach dla sektora finansowego i obronnego, znana dotąd głównie z zastosowań obliczeń kwantowych. Publikacja modelu i opisu techniki na Hugging Face sugeruje poszerzenie obszaru działalności o optymalizację klasycznych modeli językowych.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie