Google DeepMind uruchamia agentowe rozumienie wideo w Gemini - do 88% mniej tokenów
Google DeepMind uruchomiło agentowe rozumienie wideo dla modeli Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite, redukując zużycie tokenów nawet o 88% i koszty o 66%.
👁 125 przeczytań
Google DeepMind uruchomiło agentowe rozumienie wideo dla modeli Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite, redukując zużycie tokenów o do 88% i koszty analizy o do 66% w porównaniu z dotychczasowym podejściem. Nowa funkcja jest dostępna od razu - przez API w Google AI Studio oraz na platformie Gemini Enterprise Agent Platform, zarówno dla wgranych plików wideo, jak i filmów z YouTube.
Dotychczasowe przetwarzanie wideo w modelach działało statycznie: model pobierał klatki w stałym tempie (domyślnie 1 FPS) i analizował je sekwencyjnie. Przy krótkich materiałach to wystarczało, ale przy długich filmach - wykładach, nagraniach z kamer, wielogodzinnych rejestracjach - deweloperzy musieli wybierać między wysokimi kosztami tokenów a technikami, które pomijają istotne szczegóły.
Jak to działa
Agentowe rozumienie wideo zmienia to podejście fundamentalnie. Model nie konsumuje już materiału klatka po klatce w stałym rytmie, lecz samodzielnie decyduje, które fragmenty obejrzeć, w jakim tempie i przez jaką modalność - wizualną, audio lub transkrypt. Działa to w pętli agentowej: Gemini wywołuje wewnętrzne narzędzie, które ładuje tylko te momenty wideo, które są potrzebne do realizacji konkretnego zadania. Wcześniej taki wybór musiał wykonywać ręcznie deweloper; teraz robi to sam model.
Efekty mierzone na standardowych benchmarkach analizy wideo są znaczące: przy promptowy.com/google-deepmind-gemini-3-7-flash-kodowanie-agenty/">Gemini 3.7 Flash zużycie tokenów spada o do 88%, koszty o do 66%, a dokładność rośnie o do 7%. Google DeepMind wskazuje, że Gemini 3.7 Flash z aktywowaną funkcją osiąga najlepszy stosunek jakości do kosztu spośród testowanych modeli i plasuje się na tzw. pareto frontier dla analizy wideo.
Nowe możliwości obejmują między innymi wyszukiwanie momentów z rozdzielczością poniżej sekundy, dokładniejsze wykrywanie anomalii oraz precyzyjne zliczanie obiektów. To funkcje szczególnie przydatne w zastosowaniach przemysłowych, monitoringu czy automatycznej indeksacji treści wideo.
Pełny opis techniczny i instrukcje aktywacji - wystarczy ustawić konfigurację API na „agentic” w Google AI Studio - opublikował Google DeepMind w oficjalnym ogłoszeniu. Funkcja jest dostępna natychmiast, bez potrzeby czekania na aktualizację modelu.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
Gemini Spark i agentowa wyszukiwarka. Google chce, żeby internet pracował za użytkownikaGemini
Google DeepMind pokazuje SIMA 2 - agenta AI do gier 3D, który gra, rozumuje i uczy się razem z graczemNewsy
Google Workspace domyślnie udostępnia dane firmowe Gemini - oto jak to wyłączyćNewsy
