Przejdź do treści
Newsy

Awatar z twarzą AI: Google DeepMind pokazuje wirtualnego rozmówcę w czasie rzeczywistym

Google DeepMind uruchomiło Gemini 3.8 Live with Live Avatar - system generujący animowanego rozmówcę wideo w czasie rzeczywistym, zsynchronizowanego z mową w 97 językach, dostępny od dziś w Gemini Enterprise.

4 min czytania
Awatar z twarzą AI: Google DeepMind pokazuje wirtualnego rozmówcę w czasie rzeczywistym

👁 117 przeczytań

Recepcjonistka hotelu patrzy prosto w oko kamery, słucha pytania gościa o wolny pokój i odpowiada - bez zacięcia, z naturalnym uśmiechem, na bieżąco sprawdzając dostępność w systemie rezerwacji. Tyle że ta recepcjonistka nie istnieje. To animowany awatar generowany w czasie rzeczywistym przez model językowy, który jednocześnie prowadzi rozmowę, synchronizuje ruchy warg z mową i wywołuje narzędzia backendowe - wszystko bez przerywania dialogu.

Właśnie taki scenariusz Google DeepMind pokazuje jako jeden z przykładów zastosowania Gemini 3.8 Live with Live Avatar, ogłoszonego 24 września 2026 roku. To bezpośrednia kontynuacja premiery Gemini 3.8 Live sprzed tygodnia - tym razem uzupełnionej o warstwę wideo.

Skąd się bierze „żywy” rozmówca

Sercem systemu jest natywne połączenie dwóch strumieni: generowania mowy i generowania wideo w niskim opóźnieniu. Poprzednie rozwiązania tego typu zwykle nakładały animację twarzy na gotowe nagranie jako osobny krok przetwarzania - stąd brały się charakterystyczne przeskoki, rozmyte kontury ust i sztuczny rytm mówienia. DeepMind opisuje inne podejście: model procesuje wejście wizualne i audio jednocześnie, a wyjściem jest zsynchronizowany strumień wideo z ekspresją twarzy dopasowaną do tonu i treści wypowiedzi.

Shuo-yiin Chang, badaczka w DeepMind, oraz CJ Zheng, inżynier w zespole Gemini Audio, podpisali się pod wpisem opisującym system. Autorzy podkreślają, że celem było odwzorowanie tego, jak działa ludzka rozmowa - wielomodalnie, czyli przez słuchanie, patrzenie i mówienie naraz. „Conversation is inherently multimodal: we listen, look, speak, and use facial expressions to communicate” - piszą wprost, uzasadniając, dlaczego sam głos to za mało dla przekonującego agenta enterprise.

97 języków, jedno wideo, żadnych dryfów

Liczba, która robi wrażenie: Live Avatar obsługuje natywną synchronizację mowy na 97 językach i potrafi przełączać się między nimi w trakcie tej samej rozmowy. To nie jest proste podmienienie ścieżki dźwiękowej - system dynamicznie dostosowuje lip-sync i mimikę do fonetyki każdego języka z osobna, bez „visual drift”, czyli rozmycia lub przesunięcia obrazu twarzy, które pojawia się w tańszych rozwiązaniach przy zmianie języka.

Dla firm działających globalnie to zmiana jakościowa. Dotychczas multilingual chatbot z twarzą oznaczał albo oddzielne wersje wideo dla każdego języka, albo kompromis jakościowy przy dubblowaniu. Tu jeden awatar obsługuje całe portfolio rynków bez przebudowy.

Równie istotna jest funkcja asynchronicznego wywoływania narzędzi. Kiedy użytkownik pyta awatara o dostępność pokoju, system nie milknie i nie pokazuje paska ładowania - wywołuje API hotelowego systemu rezerwacji w tle, a awatar w tym czasie kontynuuje rozmowę, zadaje pytania doprecyzowujące albo po prostu podtrzymuje kontakt wzrokowy. Dopiero gdy dane wrócą, płynnie wplata odpowiedź do dialogu. W demonstracji check-inu hotelowego widać to wyraźnie: rozmowa nie ma przerw, choć za kulisami system odwołuje się do zewnętrznych baz danych.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Marka z twarzą: customizacja i ograniczenia

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Google DeepMind udostępnia bibliotekę gotowych, zróżnicowanych awatarów - każdy z innym wyglądem, głosem i ekspresją. Ale firmy mogą też tworzyć własne postaci. Wystarczy jedno wysokiej jakości zdjęcie referencyjne, żeby system wygenerował w pełni animowanego, responsywnego awatara zachowującego podobizną, styl brandingu albo tożsamość fikcyjnej postaci. Ta funkcja jest jednak na razie dostępna wyłącznie przez enterprise allowlisting - trzeba się ubiegać o dostęp, nie jest otwarta dla wszystkich.

Twórcy zaznaczają, że system ma wbudowane zabezpieczenia dotyczące tożsamości i transparentności treści generowanych przez AI. Szczegółów technicznych tych mechanizmów we wpisie nie ma, ale sam fakt ich wymienienia jako osobnej sekcji - „Trust and transparency at its core” - sugeruje, że DeepMind spodziewa się pytań o możliwość nadużyć. Awatar generowany z jednego zdjęcia to narzędzie, które w złych rękach mogłoby posłużyć do tworzenia deepfake’ów bez zgody osoby na zdjęciu - stąd model allowlistingu dla tej funkcji zamiast otwartego dostępu.

Od dziś Gemini 3.8 Live with Live Avatar jest dostępny w Gemini Enterprise. To ważne zastrzeżenie: nie ma go w konsumenckiej wersji Gemini ani w Gemini Advanced. DeepMind pozycjonuje go jednoznacznie jako produkt dla firm budujących własnych agentów - obsługę klienta, interaktywne prezentacje produktów, wirtualnych asystentów w branży zdrowotnej czy edukacyjnej.

Rok 2025 był rokiem głosowych asystentów AI. Rok 2026 - sądząc po tempie ogłoszeń - zapowiada się jako rok awatarów. OpenAI, Microsoft i kilka mniejszych startupów pracuje nad podobnymi rozwiązaniami, ale DeepMind jako pierwsza duża firma pokazuje produkt enterprise gotowy do wdrożenia, z obsługą prawie stu języków i asynchronicznym backendem. Czy ta recepcjonistka przekona gości hotelowych bardziej niż chatbox z kursorem - to już zależy od tego, jak szybko firmy zdecydują się ją zatrudnić.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie