🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 9 szt. albo Gemini Pro na 18 miesięcy 170 zł Kup teraz →
Przejdź do treści
Newsy

Google DeepMind prezentuje Gemini 3.8 Live - nowe modele do rozmów głosowych z rozumowaniem w czasie rzeczywistym

Google DeepMind udostępniło dwa nowe modele głosowe - Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking - które łączą płynne prowadzenie dialogu z wieloetapowym rozumowaniem w czasie rzeczywistym.

3 min czytania
Google DeepMind prezentuje Gemini 3.8 Live - nowe modele do rozmów głosowych z rozumowaniem w czasie rzeczywistym

👁 112 przeczytań

Google DeepMind 15 września 2026 roku ogłosiło premierę dwóch nowych modeli głosowych: Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking. Oba są dostępne od razu - przez Gemini API, Google Workspace i aplikację Gemini.

Modele nie są wariantami tego samego rozwiązania - różnią się przeznaczeniem i optymalizacją. Gemini 3.8 Live to propozycja dla twórców aplikacji i przedsiębiorstw, którzy potrzebują skalowalnego i kosztowo efektywnego silnika dialogowego. Gemini 3.8 Live Extended Thinking celuje w zadania wysokiej złożoności, gdzie liczy się wieloetapowe rozumowanie - i potrafi je przeprowadzać równolegle, bez przerywania bieżącej rozmowy.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Liczby z benchmarków

Wyniki Extended Thinking na opublikowanych benchmarkach są konkretne. Model zajął pierwsze miejsce w Artificial Analysis’ Speech to Speech Quality Index z wynikiem 82,6 punktu. W agentic task completion - czyli zdolności do samodzielnego wykonywania złożonych zadań - uzyskał 68,6% na benchmarku τ-Voice. Na bardziej wyspecjalizowanym Sierra’s τ-Voice-banking benchmark, testującym obsługę procesów bankowych w dialogu głosowym, osiągnął 35,1%. Do tego dochodzi wynik 97,7% na Big Bench Audio, mierzącym rozumienie i rozumowanie na materiale dźwiękowym.

Gemini 3.8 Live plasuje się na drugim miejscu w Speech Agent Arena - to ranking preferencji użytkowników, w którym oceniają oni jakość rozmowy w czasie rzeczywistym. Google podkreśla, że ten model zachowuje przy tym wysoką efektywność kosztową, co ma znaczenie dla firm wdrażających agentów głosowych na dużą skalę. Wyniki na ServiceNow’s EVA-Bench - benchmarku oceniającym skuteczność automatyzacji głosowej w środowiskach korporacyjnych - pojawiają się w materiałach źródłowych, choć dokładna liczba końcowa nie została w pełni ujawniona.

Kontekst tej premiery jest ważny. Rynek głosowych agentów AI przeżywa intensywne przyspieszenie - ElevenLabs, OpenAI z modelem Realtime API czy Hume AI walczą o podobny segment. Google wchodzi w ten wyścig z modelami zaprojektowanymi z myślą o wdrożeniach produkcyjnych, nie tylko demonstracjach badawczych. Kluczowa różnica architektoniczna to możliwość prowadzenia równoległego rozumowania w tle - model może analizować problem i obsługiwać narzędzia bez wymuszania pauzy w rozmowie. Użytkownik nie czeka, aż system „pomyśli” - dialog toczy się dalej.

Z perspektywy konsumentów Gemini 3.8 Live trafia do aplikacji Gemini i Google Search, a Gemini 3.8 Live Extended Thinking - do Google Workspace. To oznacza, że użytkownicy Workspace mogą korzystać z zaawansowanego wnioskowania głosowego bezpośrednio w środowisku pracy, bez przechodzenia do osobnego interfejsu.

Modele obsługują przełączanie języków w trakcie rozmowy i interpretację kontekstu wizualnego w czasie rzeczywistym - kamera lub udostępniony ekran mogą służyć jako dodatkowe źródło informacji podczas dialogu głosowego. To rozszerza użyteczność daleko poza klasycznego asystenta głosowego.

Wyniki na kluczowych benchmarkach i natychmiastowa dostępność przez API sugerują, że Google tym razem nie prezentuje prototypu, lecz gotowe narzędzie produkcyjne.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie