Przejdź do treści
Newsy

Google przyspiesza Gemini Nano na Pixelach metodą Multi-Token Prediction

Google opisał, jak doklejając lekką głowicę MTP do zamrożonych modeli Gemini Nano v3 przyspieszył generowanie tekstu na Pixelach 9 i 10.

2 min czytania
Blue abstract illustration of a smartphone with a glowing starburst and streaming notification bars emanating from the screen.
W skrócie
  • Google dołożył lekką głowicę Multi-Token Prediction do zamrożonych modeli Gemini Nano v3, by przyspieszyć generowanie tekstu na urządzeniu.
  • Metoda trafiła już do serii Pixel 9 i 10 i działa jako przyspieszenie funkcji takich jak podsumowania powiadomień i korekta tekstu.
  • Rozwiązanie eliminuje osobny model wspomagający, który zajmował cenną pamięć RAM telefonu.

👁 154 przeczytań

Google · Twoje źródłaDodaj promptowy.com do preferowanych źródeł w Google

Google opisał nową architekturę, która przyspiesza działanie modeli Gemini Nano na telefonach Pixel, doklejając do gotowego, "zamrożonego" modelu Gemini Nano v3 lekką głowicę Multi-Token Prediction (MTP). Rozwiązanie trafiło już do serii Pixel 9 i Pixel 10, gdzie ma działać jako przyspieszenie bez potrzeby dodatkowej konfiguracji.

Problem, który firma próbuje rozwiązać, jest typowy dla modeli działających lokalnie. Telefon ma ostry limit zużycia energii i pamięci RAM, a standardowe modele językowe generują tekst "autoregresyjnie" - słowo po słowie. Działanie krok po kroku tworzy wąskie gardło: procesor jest niedociążony, a pasmo pamięci obciążone, co spowalnia działanie funkcji i szybciej rozładowuje baterię.

MTP rozwija ideę dekodowania spekulatywnego. W klasycznym podejściu osobny, mniejszy model "szkicownik" (np. 128 mln parametrów) generuje kilku kandydatów na kolejne słowa, a duży model weryfikuje je równolegle i odrzuca, jeśli się nie zgadzają. Problem w tym, że osobny szkicownik rywalizuje o ograniczoną pamięć RAM i jest "ślepy" na bogaty wewnętrzny stan głównego modelu - przewiduje wyłącznie na podstawie samej historii tekstu.

Zamiast trenować osobny mały model, Google dokleja do istniejącego modelu lekką głowicę Transformera. Praca opiera się na wcześniejszych podejściach, takich jak framework EAGLE i Confident Adaptive Language Modeling (CALM). Wcześniej firma zastosowała MTP przy przyspieszaniu Gemmy 4, a teraz przenosi to na skrajne ograniczenia urządzeń brzegowych.

W praktyce użytkownicy Pixeli mają zauważyć, że funkcje takie jak podsumowania powiadomień AI i korekta tekstu generują się wyraźnie szybciej i przy mniejszym zużyciu energii. Dla programistów, którzy budują na Gemini Nano, znika konieczność dostrajania osobnych, pamięciożernych modeli pomocniczych do każdego nowego zadania.

To dobry przykład inżynierii, która nie dorzuca kolejnego wielkiego modelu, tylko wyciska więcej z tego, co już działa na telefonie.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Wypisujesz się jednym kliknięciem.
// Zapytaj AI o ten news
Co o tym sądzisz?
Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

$ sitemap --all Cała strona w jednym miejscu - żeby się nie pogubić.
🛒 Sklep Kinetyka X Premium+ & SuperGrok 699 zł/rok CapCut Pro 600 zł/rok LinkedIn Premium od 149 zł/rok Zobacz wszystko → 💙 wspieraj
Redaguje
× powiększenie