✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Newsy

Google DeepMind wypuściło EmbeddingGemma 2 - multimodalny model do osadzania tekstu, obrazu, dźwięku i wideo na urządzeniu

Google DeepMind opublikował EmbeddingGemma 2 - model o 740 milionach parametrów, który jako pierwszy w klasie sub-1B łączy tekst, kod, obrazy, wideo i audio w jednej przestrzeni osadzeń i działa bezpośrednio na urządzeniu.

2 min czytania
Google DeepMind wypuścił EmbeddingGemma 2 - multimodalny model do osadzania tekstu, obrazu, dźwięku i wideo na urządzeniuŹródło: Google (materiały prasowe)

👁 111 przeczytań

Google DeepMind opublikował 6 października 2026 roku EmbeddingGemma 2 - model osadzający o 740 milionach parametrów, który mapuje tekst, kod, obrazy, wideo i audio do jednej wspólnej przestrzeni wektorowej. To pierwsza wersja zdolna do pełnej multimodalności przy zachowaniu rozmiarów przeznaczonych do działania bezpośrednio na urządzeniu użytkownika.

wideo: Introducing EmbeddingGemma: The Best-in-Class Open Model for On-Device Embeddings

Model zbudowano na architekturze Gemma 4 i wydano na licencji Apache 2.0, co pozwala na zastosowania komercyjne bez dodatkowych opłat. Według DeepMind stanowi on bezpośrednią pochodną tej samej technologii, która leży u podstaw pełnowymiarowych modeli Gemini Embedding.

Modułowa budowa i oszczędność pamięci

Konstrukcja EmbeddingGemma 2 jest modułowa: rdzeń tekstowy wymaga tylko 270 milionów parametrów, a do niego opcjonalnie można dołączyć enkoder wizyjny (170 mln parametrów) lub audio (300 mln), uzyskując pełną wersję multimodalną. Na smartfonie Google Pixel 11 Pro model potrzebuje po kwantyzacji zaledwie około 191 MB aktywnej pamięci RAM dla trybu tekstowego i około 567 MB dla pełnego trybu multimodalnego - to wartości realistyczne nawet dla przeciętnego telefonu klasy średniej.

Dodatkową oszczędność przestrzeni dyskowej daje technika Matryoshka Representation Learning (MRL), która pozwala programiście dynamicznie skracać wektory wyjściowe z 768 do 512, 256 lub 128 wymiarów. Według DeepMind daje to do sześciokrotnej redukcji rozmiaru lokalnych baz wektorowych.

Okno kontekstu czterokrotnie większe niż w poprzedniku

EmbeddingGemma 2 obsługuje okno kontekstowe 8K tokenów - cztery razy więcej niż pierwsza wersja. W praktyce oznacza to zdolność do przetworzenia w jednym wywołaniu do 5,5 minuty nagrania audio, 29 obrazów, 58 klatek wideo lub ich przeplatanych kombinacji - wszystko lokalnie, bez wysyłania danych do chmury.

W benchmarku MTEB Code model uzyskał wynik 78,68 punktu wobec 68,76 w poprzedniej wersji, co daje poprawę o 9,92 punktu. DeepMind podkreśla, że EmbeddingGemma 2 przewyższa przy tym niektóre modele specjalistyczne o ponad dwukrotnie większej liczbie parametrów w zadaniach z obszaru obrazów, wideo, dokumentów i audio.

Wyniki EmbeddingGemma w benchmarku MTEB Code
EmbeddingGemma 168,8 pkt
EmbeddingGemma 278,7 pkt

dane: Google DeepMind

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Poprzednia wersja pobrana ponad 20 milionów razy

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Sukces pierwszej edycji był zdaniem DeepMind zaskoczeniem: EmbeddingGemma 1 przekroczyła 20 milionów pobrań i trafiła do aplikacji wyszukiwania na urządzeniu oraz prywatnych potoków RAG (retrieval augmented generation). To właśnie ta popularność skłoniła zespół do rozszerzenia możliwości modelu poza sam tekst.

Praktyczne zastosowania EmbeddingGemma 2 obejmują wyszukiwanie konkretnego klipu wideo na podstawie notatki głosowej, przeszukiwanie wielogodzinnych nagrań audio za pomocą zapytania tekstowego czy semantyczne indeksowanie lokalnych repozytoriów kodu - wszystko bez opuszczania urządzenia przez jakiekolwiek dane.

Dla twórców aplikacji mobilnych, którzy szukają sensownej alternatywy dla chmurowych API osadzeń, to propozycja trudna do przeoczenia.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›