Przejdź do treści
Newsy

Google DeepMind wprowadza Gemini 3.8 TTS - modele zamieniające tekst w ekspresywne głosy

Google DeepMind zaprezentowało dwa nowe modele zamieniające tekst na mowę - Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS - które pozwalają tworzyć i personalizować głosy od podstaw za pomocą zwykłego języka naturalnego.

3 min czytania
Google DeepMind wprowadza Gemini 3.8 TTS - modele zamieniające tekst w ekspresywne głosy

👁 114 przeczytań

Google DeepMind opublikowało oficjalny wpis na blogu prezentujący dwa nowe modele text-to-speech: Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS. Według firmy są to najbardziej ekspresywne modele generowania audio, jakie do tej pory trafiły do rodziny Gemini.

Dotychczasowe systemy TTS działały na bazie statycznych presetów głosowych. Nowe modele zrywają z tym podejściem - zamiast wybierać spośród gotowych głosów, użytkownicy mogą opisywać pożądany głos językiem naturalnym, podobnie jak ktoś wydający wskazówki aktorom. Poprzednia oferta Gemini obejmowała 30 oryginalnych głosów. Teraz firma mówi o nieograniczonej bibliotece głosów generowanych na żądanie.

materiał wideo ze źródła
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Dwa modele, dwa zastosowania

Podział na dwa warianty nie jest przypadkowy. Gemini 3.8 Flash TTS powstał z myślą o kreatywnym kierowaniu głosem i projektowaniu postaci. Działa w ponad 100 językach i dialektach, a twórcy mogą generować kompletnie nowe głosy - od dramatycznego, ziejącego ogniem smoka po narratora z wyraźnym regionalnym akcentem. W materiałach demonstracyjnych Google pokazuje między innymi głos energicznego DJ-a z Melbourne oraz przesadnie metalicznego, monotonnego robota - oba wygenerowane wyłącznie z opisu tekstowego. Model daje też kontrolę linia po linii: można określać wskazówki aktorskie, tempo wypowiedzi, zmianę dialektu w trakcie nagrania oraz tzw. backchanneling, czyli naturalne wtrącenia potwierdzające uwagę rozmówcy.

Gemini 3.8 Flash-Lite TTS celuje natomiast w zastosowania masowe. Jest zoptymalizowany pod kątem wysokiej przepustowości i niższych kosztów, co czyni go bardziej odpowiednim do masowego dubbingu, tworzenia treści audio na dużą skalę oraz budowania ekspresywnych agentów głosowych w czasie rzeczywistym. Szczegółowa kontrola nad tonem, tempem i niuansami ekspresji pozostaje, ale priorytetem jest tu efektywność kosztowa przy dużych wolumenach.

Oba modele są dostępne w Google AI Studio, przez Gemini API, a także w Gemini Enterprise, Gemini Notebook i Google Vids. To ostatnie narzędzie - czyli wideo platforma dla firm - zyskuje w ten sposób możliwość generowania lektoratów bez zatrudniania aktorów głosowych.

Modele wpisują się w szybko rozrastającą się rodzinę Gemini Audio. W jej skład wchodzą już: 3.5 Live Translate, 3.5 Transcribe, 3.8 Live oraz 3.8 Live Extended Thinking. Nowe TTS-y są kolejnym krokiem, tym razem w stronę generowania - a nie tylko rozumienia - mowy.

Kwestia bezpieczeństwa pojawia się tutaj w sposób konkretny: modele mają wbudowane znakowanie wodne generowanego audio. To ważny sygnał, bo realistyczny głos tworzony z opisu to technologia, która może być nadużywana do deepfake’ów głosowych lub dezinformacji. Google nie podaje szczegółów technicznych dotyczących watermarkingu, ale samo jego uwzględnienie w premierze pokazuje, że firma zdaje sobie sprawę z ryzyka.

Praktyczne zastosowania, które Google wymienia wprost, to audiobooki, podcasty i interaktywne media - wszędzie tam, gdzie liczy się jakość głosu i możliwość dopasowania go do konkretnej postaci lub marki. Przejście od statycznych presetów do studia wokalnego opartego na opisie tekstowym to istotna zmiana dla twórców treści audio, choć realne możliwości obu modeli zweryfikuje dopiero szeroka praktyka.

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie