🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Google DeepMind uruchamia agentowe rozumienie wideo w Gemini - do 88% mniej tokenów

Google DeepMind uruchomiło agentowe rozumienie wideo dla modeli Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite, redukując zużycie tokenów nawet o 88% i koszty o 66%.

2 min czytania
Google DeepMind uruchamia agentowe rozumienie wideo w Gemini - do 88% mniej tokenów

👁 125 przeczytań

Google DeepMind uruchomiło agentowe rozumienie wideo dla modeli Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite, redukując zużycie tokenów o do 88% i koszty analizy o do 66% w porównaniu z dotychczasowym podejściem. Nowa funkcja jest dostępna od razu - przez API w Google AI Studio oraz na platformie Gemini Enterprise Agent Platform, zarówno dla wgranych plików wideo, jak i filmów z YouTube.

Dotychczasowe przetwarzanie wideo w modelach działało statycznie: model pobierał klatki w stałym tempie (domyślnie 1 FPS) i analizował je sekwencyjnie. Przy krótkich materiałach to wystarczało, ale przy długich filmach - wykładach, nagraniach z kamer, wielogodzinnych rejestracjach - deweloperzy musieli wybierać między wysokimi kosztami tokenów a technikami, które pomijają istotne szczegóły.

materiał wideo ze źródła
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Jak to działa

Agentowe rozumienie wideo zmienia to podejście fundamentalnie. Model nie konsumuje już materiału klatka po klatce w stałym rytmie, lecz samodzielnie decyduje, które fragmenty obejrzeć, w jakim tempie i przez jaką modalność - wizualną, audio lub transkrypt. Działa to w pętli agentowej: Gemini wywołuje wewnętrzne narzędzie, które ładuje tylko te momenty wideo, które są potrzebne do realizacji konkretnego zadania. Wcześniej taki wybór musiał wykonywać ręcznie deweloper; teraz robi to sam model.

Efekty mierzone na standardowych benchmarkach analizy wideo są znaczące: przy promptowy.com/google-deepmind-gemini-3-7-flash-kodowanie-agenty/">Gemini 3.7 Flash zużycie tokenów spada o do 88%, koszty o do 66%, a dokładność rośnie o do 7%. Google DeepMind wskazuje, że Gemini 3.7 Flash z aktywowaną funkcją osiąga najlepszy stosunek jakości do kosztu spośród testowanych modeli i plasuje się na tzw. pareto frontier dla analizy wideo.

Nowe możliwości obejmują między innymi wyszukiwanie momentów z rozdzielczością poniżej sekundy, dokładniejsze wykrywanie anomalii oraz precyzyjne zliczanie obiektów. To funkcje szczególnie przydatne w zastosowaniach przemysłowych, monitoringu czy automatycznej indeksacji treści wideo.

Pełny opis techniczny i instrukcje aktywacji - wystarczy ustawić konfigurację API na „agentic” w Google AI Studio - opublikował Google DeepMind w oficjalnym ogłoszeniu. Funkcja jest dostępna natychmiast, bez potrzeby czekania na aktualizację modelu.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie