Google przyspiesza Gemini Nano na Pixelach metodą Multi-Token Prediction
Google opisał, jak doklejając lekką głowicę MTP do zamrożonych modeli Gemini Nano v3 przyspieszył generowanie tekstu na Pixelach 9 i 10.
- Google dołożył lekką głowicę Multi-Token Prediction do zamrożonych modeli Gemini Nano v3, by przyspieszyć generowanie tekstu na urządzeniu.
- Metoda trafiła już do serii Pixel 9 i 10 i działa jako przyspieszenie funkcji takich jak podsumowania powiadomień i korekta tekstu.
- Rozwiązanie eliminuje osobny model wspomagający, który zajmował cenną pamięć RAM telefonu.
👁 154 przeczytań
Google · Twoje źródłaDodaj promptowy.com do preferowanych źródeł w Google→Google opisał nową architekturę, która przyspiesza działanie modeli Gemini Nano na telefonach Pixel, doklejając do gotowego, "zamrożonego" modelu Gemini Nano v3 lekką głowicę Multi-Token Prediction (MTP). Rozwiązanie trafiło już do serii Pixel 9 i Pixel 10, gdzie ma działać jako przyspieszenie bez potrzeby dodatkowej konfiguracji.
Problem, który firma próbuje rozwiązać, jest typowy dla modeli działających lokalnie. Telefon ma ostry limit zużycia energii i pamięci RAM, a standardowe modele językowe generują tekst "autoregresyjnie" - słowo po słowie. Działanie krok po kroku tworzy wąskie gardło: procesor jest niedociążony, a pasmo pamięci obciążone, co spowalnia działanie funkcji i szybciej rozładowuje baterię.
MTP rozwija ideę dekodowania spekulatywnego. W klasycznym podejściu osobny, mniejszy model "szkicownik" (np. 128 mln parametrów) generuje kilku kandydatów na kolejne słowa, a duży model weryfikuje je równolegle i odrzuca, jeśli się nie zgadzają. Problem w tym, że osobny szkicownik rywalizuje o ograniczoną pamięć RAM i jest "ślepy" na bogaty wewnętrzny stan głównego modelu - przewiduje wyłącznie na podstawie samej historii tekstu.
Zamiast trenować osobny mały model, Google dokleja do istniejącego modelu lekką głowicę Transformera. Praca opiera się na wcześniejszych podejściach, takich jak framework EAGLE i Confident Adaptive Language Modeling (CALM). Wcześniej firma zastosowała MTP przy przyspieszaniu Gemmy 4, a teraz przenosi to na skrajne ograniczenia urządzeń brzegowych.
W praktyce użytkownicy Pixeli mają zauważyć, że funkcje takie jak podsumowania powiadomień AI i korekta tekstu generują się wyraźnie szybciej i przy mniejszym zużyciu energii. Dla programistów, którzy budują na Gemini Nano, znika konieczność dostrajania osobnych, pamięciożernych modeli pomocniczych do każdego nowego zadania.
To dobry przykład inżynierii, która nie dorzuca kolejnego wielkiego modelu, tylko wyciska więcej z tego, co już działa na telefonie.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
