Google DeepMind prezentuje Gemini 3.8 Live - nowe modele do rozmów głosowych z rozumowaniem w czasie rzeczywistym
Google DeepMind udostępniło dwa nowe modele głosowe - Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking - które łączą płynne prowadzenie dialogu z wieloetapowym rozumowaniem w czasie rzeczywistym.

👁 112 przeczytań
Google DeepMind 15 września 2026 roku ogłosiło premierę dwóch nowych modeli głosowych: Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking. Oba są dostępne od razu - przez Gemini API, Google Workspace i aplikację Gemini.
Modele nie są wariantami tego samego rozwiązania - różnią się przeznaczeniem i optymalizacją. Gemini 3.8 Live to propozycja dla twórców aplikacji i przedsiębiorstw, którzy potrzebują skalowalnego i kosztowo efektywnego silnika dialogowego. Gemini 3.8 Live Extended Thinking celuje w zadania wysokiej złożoności, gdzie liczy się wieloetapowe rozumowanie - i potrafi je przeprowadzać równolegle, bez przerywania bieżącej rozmowy.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Liczby z benchmarków
Wyniki Extended Thinking na opublikowanych benchmarkach są konkretne. Model zajął pierwsze miejsce w Artificial Analysis’ Speech to Speech Quality Index z wynikiem 82,6 punktu. W agentic task completion - czyli zdolności do samodzielnego wykonywania złożonych zadań - uzyskał 68,6% na benchmarku τ-Voice. Na bardziej wyspecjalizowanym Sierra’s τ-Voice-banking benchmark, testującym obsługę procesów bankowych w dialogu głosowym, osiągnął 35,1%. Do tego dochodzi wynik 97,7% na Big Bench Audio, mierzącym rozumienie i rozumowanie na materiale dźwiękowym.
Gemini 3.8 Live plasuje się na drugim miejscu w Speech Agent Arena - to ranking preferencji użytkowników, w którym oceniają oni jakość rozmowy w czasie rzeczywistym. Google podkreśla, że ten model zachowuje przy tym wysoką efektywność kosztową, co ma znaczenie dla firm wdrażających agentów głosowych na dużą skalę. Wyniki na ServiceNow’s EVA-Bench - benchmarku oceniającym skuteczność automatyzacji głosowej w środowiskach korporacyjnych - pojawiają się w materiałach źródłowych, choć dokładna liczba końcowa nie została w pełni ujawniona.
Kontekst tej premiery jest ważny. Rynek głosowych agentów AI przeżywa intensywne przyspieszenie - ElevenLabs, OpenAI z modelem Realtime API czy Hume AI walczą o podobny segment. Google wchodzi w ten wyścig z modelami zaprojektowanymi z myślą o wdrożeniach produkcyjnych, nie tylko demonstracjach badawczych. Kluczowa różnica architektoniczna to możliwość prowadzenia równoległego rozumowania w tle - model może analizować problem i obsługiwać narzędzia bez wymuszania pauzy w rozmowie. Użytkownik nie czeka, aż system „pomyśli” - dialog toczy się dalej.
Z perspektywy konsumentów Gemini 3.8 Live trafia do aplikacji Gemini i Google Search, a Gemini 3.8 Live Extended Thinking - do Google Workspace. To oznacza, że użytkownicy Workspace mogą korzystać z zaawansowanego wnioskowania głosowego bezpośrednio w środowisku pracy, bez przechodzenia do osobnego interfejsu.
Modele obsługują przełączanie języków w trakcie rozmowy i interpretację kontekstu wizualnego w czasie rzeczywistym - kamera lub udostępniony ekran mogą służyć jako dodatkowe źródło informacji podczas dialogu głosowego. To rozszerza użyteczność daleko poza klasycznego asystenta głosowego.
Wyniki na kluczowych benchmarkach i natychmiastowa dostępność przez API sugerują, że Google tym razem nie prezentuje prototypu, lecz gotowe narzędzie produkcyjne.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.
