Google DeepMind wypuściło EmbeddingGemma 2 - multimodalny model do osadzania tekstu, obrazu, dźwięku i wideo na urządzeniu
Google DeepMind opublikował EmbeddingGemma 2 - model o 740 milionach parametrów, który jako pierwszy w klasie sub-1B łączy tekst, kod, obrazy, wideo i audio w jednej przestrzeni osadzeń i działa bezpośrednio na urządzeniu.
Źródło: Google (materiały prasowe)👁 111 przeczytań
Google DeepMind opublikował 6 października 2026 roku EmbeddingGemma 2 - model osadzający o 740 milionach parametrów, który mapuje tekst, kod, obrazy, wideo i audio do jednej wspólnej przestrzeni wektorowej. To pierwsza wersja zdolna do pełnej multimodalności przy zachowaniu rozmiarów przeznaczonych do działania bezpośrednio na urządzeniu użytkownika.
Model zbudowano na architekturze Gemma 4 i wydano na licencji Apache 2.0, co pozwala na zastosowania komercyjne bez dodatkowych opłat. Według DeepMind stanowi on bezpośrednią pochodną tej samej technologii, która leży u podstaw pełnowymiarowych modeli Gemini Embedding.
Modułowa budowa i oszczędność pamięci
Konstrukcja EmbeddingGemma 2 jest modułowa: rdzeń tekstowy wymaga tylko 270 milionów parametrów, a do niego opcjonalnie można dołączyć enkoder wizyjny (170 mln parametrów) lub audio (300 mln), uzyskując pełną wersję multimodalną. Na smartfonie Google Pixel 11 Pro model potrzebuje po kwantyzacji zaledwie około 191 MB aktywnej pamięci RAM dla trybu tekstowego i około 567 MB dla pełnego trybu multimodalnego - to wartości realistyczne nawet dla przeciętnego telefonu klasy średniej.
Dodatkową oszczędność przestrzeni dyskowej daje technika Matryoshka Representation Learning (MRL), która pozwala programiście dynamicznie skracać wektory wyjściowe z 768 do 512, 256 lub 128 wymiarów. Według DeepMind daje to do sześciokrotnej redukcji rozmiaru lokalnych baz wektorowych.
Okno kontekstu czterokrotnie większe niż w poprzedniku
EmbeddingGemma 2 obsługuje okno kontekstowe 8K tokenów - cztery razy więcej niż pierwsza wersja. W praktyce oznacza to zdolność do przetworzenia w jednym wywołaniu do 5,5 minuty nagrania audio, 29 obrazów, 58 klatek wideo lub ich przeplatanych kombinacji - wszystko lokalnie, bez wysyłania danych do chmury.
W benchmarku MTEB Code model uzyskał wynik 78,68 punktu wobec 68,76 w poprzedniej wersji, co daje poprawę o 9,92 punktu. DeepMind podkreśla, że EmbeddingGemma 2 przewyższa przy tym niektóre modele specjalistyczne o ponad dwukrotnie większej liczbie parametrów w zadaniach z obszaru obrazów, wideo, dokumentów i audio.
dane: Google DeepMind
Poprzednia wersja pobrana ponad 20 milionów razy
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Sukces pierwszej edycji był zdaniem DeepMind zaskoczeniem: EmbeddingGemma 1 przekroczyła 20 milionów pobrań i trafiła do aplikacji wyszukiwania na urządzeniu oraz prywatnych potoków RAG (retrieval augmented generation). To właśnie ta popularność skłoniła zespół do rozszerzenia możliwości modelu poza sam tekst.
Praktyczne zastosowania EmbeddingGemma 2 obejmują wyszukiwanie konkretnego klipu wideo na podstawie notatki głosowej, przeszukiwanie wielogodzinnych nagrań audio za pomocą zapytania tekstowego czy semantyczne indeksowanie lokalnych repozytoriów kodu - wszystko bez opuszczania urządzenia przez jakiekolwiek dane.
Dla twórców aplikacji mobilnych, którzy szukają sensownej alternatywy dla chmurowych API osadzeń, to propozycja trudna do przeoczenia.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
