Awatar z twarzą AI: Google DeepMind pokazuje wirtualnego rozmówcę w czasie rzeczywistym
Google DeepMind uruchomiło Gemini 3.8 Live with Live Avatar - system generujący animowanego rozmówcę wideo w czasie rzeczywistym, zsynchronizowanego z mową w 97 językach, dostępny od dziś w Gemini Enterprise.

👁 117 przeczytań
Recepcjonistka hotelu patrzy prosto w oko kamery, słucha pytania gościa o wolny pokój i odpowiada - bez zacięcia, z naturalnym uśmiechem, na bieżąco sprawdzając dostępność w systemie rezerwacji. Tyle że ta recepcjonistka nie istnieje. To animowany awatar generowany w czasie rzeczywistym przez model językowy, który jednocześnie prowadzi rozmowę, synchronizuje ruchy warg z mową i wywołuje narzędzia backendowe - wszystko bez przerywania dialogu.
Właśnie taki scenariusz Google DeepMind pokazuje jako jeden z przykładów zastosowania Gemini 3.8 Live with Live Avatar, ogłoszonego 24 września 2026 roku. To bezpośrednia kontynuacja premiery Gemini 3.8 Live sprzed tygodnia - tym razem uzupełnionej o warstwę wideo.
Skąd się bierze „żywy” rozmówca
Sercem systemu jest natywne połączenie dwóch strumieni: generowania mowy i generowania wideo w niskim opóźnieniu. Poprzednie rozwiązania tego typu zwykle nakładały animację twarzy na gotowe nagranie jako osobny krok przetwarzania - stąd brały się charakterystyczne przeskoki, rozmyte kontury ust i sztuczny rytm mówienia. DeepMind opisuje inne podejście: model procesuje wejście wizualne i audio jednocześnie, a wyjściem jest zsynchronizowany strumień wideo z ekspresją twarzy dopasowaną do tonu i treści wypowiedzi.
Shuo-yiin Chang, badaczka w DeepMind, oraz CJ Zheng, inżynier w zespole Gemini Audio, podpisali się pod wpisem opisującym system. Autorzy podkreślają, że celem było odwzorowanie tego, jak działa ludzka rozmowa - wielomodalnie, czyli przez słuchanie, patrzenie i mówienie naraz. „Conversation is inherently multimodal: we listen, look, speak, and use facial expressions to communicate” - piszą wprost, uzasadniając, dlaczego sam głos to za mało dla przekonującego agenta enterprise.
97 języków, jedno wideo, żadnych dryfów
Liczba, która robi wrażenie: Live Avatar obsługuje natywną synchronizację mowy na 97 językach i potrafi przełączać się między nimi w trakcie tej samej rozmowy. To nie jest proste podmienienie ścieżki dźwiękowej - system dynamicznie dostosowuje lip-sync i mimikę do fonetyki każdego języka z osobna, bez „visual drift”, czyli rozmycia lub przesunięcia obrazu twarzy, które pojawia się w tańszych rozwiązaniach przy zmianie języka.
Dla firm działających globalnie to zmiana jakościowa. Dotychczas multilingual chatbot z twarzą oznaczał albo oddzielne wersje wideo dla każdego języka, albo kompromis jakościowy przy dubblowaniu. Tu jeden awatar obsługuje całe portfolio rynków bez przebudowy.
Równie istotna jest funkcja asynchronicznego wywoływania narzędzi. Kiedy użytkownik pyta awatara o dostępność pokoju, system nie milknie i nie pokazuje paska ładowania - wywołuje API hotelowego systemu rezerwacji w tle, a awatar w tym czasie kontynuuje rozmowę, zadaje pytania doprecyzowujące albo po prostu podtrzymuje kontakt wzrokowy. Dopiero gdy dane wrócą, płynnie wplata odpowiedź do dialogu. W demonstracji check-inu hotelowego widać to wyraźnie: rozmowa nie ma przerw, choć za kulisami system odwołuje się do zewnętrznych baz danych.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Marka z twarzą: customizacja i ograniczenia
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Google DeepMind udostępnia bibliotekę gotowych, zróżnicowanych awatarów - każdy z innym wyglądem, głosem i ekspresją. Ale firmy mogą też tworzyć własne postaci. Wystarczy jedno wysokiej jakości zdjęcie referencyjne, żeby system wygenerował w pełni animowanego, responsywnego awatara zachowującego podobizną, styl brandingu albo tożsamość fikcyjnej postaci. Ta funkcja jest jednak na razie dostępna wyłącznie przez enterprise allowlisting - trzeba się ubiegać o dostęp, nie jest otwarta dla wszystkich.
Twórcy zaznaczają, że system ma wbudowane zabezpieczenia dotyczące tożsamości i transparentności treści generowanych przez AI. Szczegółów technicznych tych mechanizmów we wpisie nie ma, ale sam fakt ich wymienienia jako osobnej sekcji - „Trust and transparency at its core” - sugeruje, że DeepMind spodziewa się pytań o możliwość nadużyć. Awatar generowany z jednego zdjęcia to narzędzie, które w złych rękach mogłoby posłużyć do tworzenia deepfake’ów bez zgody osoby na zdjęciu - stąd model allowlistingu dla tej funkcji zamiast otwartego dostępu.
Od dziś Gemini 3.8 Live with Live Avatar jest dostępny w Gemini Enterprise. To ważne zastrzeżenie: nie ma go w konsumenckiej wersji Gemini ani w Gemini Advanced. DeepMind pozycjonuje go jednoznacznie jako produkt dla firm budujących własnych agentów - obsługę klienta, interaktywne prezentacje produktów, wirtualnych asystentów w branży zdrowotnej czy edukacyjnej.
Rok 2025 był rokiem głosowych asystentów AI. Rok 2026 - sądząc po tempie ogłoszeń - zapowiada się jako rok awatarów. OpenAI, Microsoft i kilka mniejszych startupów pracuje nad podobnymi rozwiązaniami, ale DeepMind jako pierwsza duża firma pokazuje produkt enterprise gotowy do wdrożenia, z obsługą prawie stu języków i asynchronicznym backendem. Czy ta recepcjonistka przekona gości hotelowych bardziej niż chatbox z kursorem - to już zależy od tego, jak szybko firmy zdecydują się ją zatrudnić.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
