🔥 Gemini Pro 170 zł -43% CapCut Pro 450 zł -25% do niedzieli Zobacz →
Przejdź do treści
Premium

Gigant z Mountain View atakuje polskiego jednorożca. Nowy model Google uderza w rdzeń ElevenLabs

Google wprowadziło Gemini 3.1 Flash TTS, nowy model syntezy głosu, który potrafi szeptać, śmiać się i płakać. Konkuruje on z polskim jednorożcem ElevenLabs, wycenianym na 11 miliardów dolarów.

5 min czytania
promptowy_ujcie_mikrofonu_studyjnego_z_wizualizacj_fal_dwikowyc_d8dfc714-e52c-4301-8b95-59d28d9dde5f
👁 135 przeczytań

Google przez długi czas pozostawał w tyle za ElevenLabs w syntezie głosu. Zmieniło się to 16 kwietnia 2026 roku wraz z premierą Gemini 3.1 Flash TTS. Nowy model potrafi szeptać, śmiać się i płakać w ponad 200 stylach ekspresji. Dla warszawskiej spółki wycenianej na 11 miliardów dolarów konkurencja stała się boleśnie konkretna.

// w skrócie
  • Google 16 kwietnia 2026 roku wypuścił Gemini 3.1 Flash TTS z ponad 200 znacznikami audio, co bezpośrednio uderza w ElevenLabs wyceniany na 11 miliardów dolarów.
  • ElevenLabs, założony w 2022 roku przez Matiego Staniszewskiego i Piotra Dąbkowskiego, obsługuje ponad 70 języków i zebrał 180 milionów dolarów finansowania.
  • Unijny AI Act nałoży pełne obowiązki oznaczania treści generowanych przez AI od 2 sierpnia 2026 roku, co dotyczy też syntezy mowy.

Segment generatywnego głosu był do niedawna jednym z nielicznych obszarów sztucznej inteligencji, w którym europejska firma wyraźnie wyprzedzała amerykańskich gigantów.

ElevenLabs, założony w 2022 roku przez dwóch Polaków - Matiego Staniszewskiego, byłego inżyniera Palantir, oraz Piotra Dąbkowskiego, wcześniej związanego z Google - w ciągu czterech lat zbudował platformę obsługującą ponad 70 języków. Spółka generuje miliony fragmentów mowy dziennie.

Premiera modelu Eleven v3 w czerwcu 2025 roku, potrafiącego reagować na znaczniki stylu takie jak szept, śmiech czy westchnienie, ugruntowała pozycję jako lidera jakościowego. Firma, według danych z początku 2025 roku, zebrała 180 milionów dolarów finansowania przy wycenie 3,3 miliarda dolarów. Na początku 2026 roku wycena miała sięgnąć 11 miliardów dolarów.

Pozycja jednorożca z Warszawy została wystawiona na próbę. Google w połowie kwietnia 2026 roku zaprezentował model Gemini 3.1 Flash TTS. Redakcja dziennika „Rzeczpospolita” opisała go 16 kwietnia jako bezpośrednie uderzenie w ElevenLabs.

Amerykanie przestali ścigać. Zaczęli prowadzić.

Ponad dwieście znaczników audio

Kluczowa przewaga nowego modelu Google, według opisu opublikowanego w „Rzeczpospolitej”, to biblioteka ponad 200 znaczników audio. Deweloperzy korzystający z Gemini API mogą wprost w tekście wejściowym zaszyć instrukcje dotyczące sposobu wypowiedzi.

AI nie tylko odczyta zdanie. Na żądanie wypowie je z determinacją, nutą ciekawości, szeptem, śmiechem lub płaczem.

Dotychczas poziom takiej kontroli emocjonalnej oferowała głównie warszawska spółka. Model Google działa także w języku polskim, co ma istotne znaczenie rynkowe.

Dla lokalnych podcasterów, twórców audiobooków, studiów dubbingowych oraz firm budujących asystentów głosowych różnica między syntezą „poprawną” a „emocjonalnie wiarygodną” decyduje o możliwości zastosowania technologii w rzeczywistej produkcji komercyjnej.

Rynek rośnie szybciej niż którykolwiek gracz

Rywalizacja toczy się w dynamicznie rosnącym segmencie. Według szacunków branżowych przytoczonych przez portal VentureBeat w marcu 2026 roku rynek sztucznej inteligencji głosowej przekroczył w 2026 roku 22 miliardy dolarów.

Sam segment agentów głosowych AI ma według tych samych analityków osiągnąć 47,5 miliarda dolarów do 2034 roku. Skala popytu sprawia, że żaden z dotychczasowych liderów nie może pozwolić sobie na techniczny zastój.

Oprócz Google do gry włączył się francuski Mistral AI. W marcu 2026 roku zaprezentował model Voxtral TTS. Jego przewaga polega na fundamentalnie innym modelu biznesowym - firma udostępnia pełne wagi modelu na otwartej licencji, zapraszając przedsiębiorstwa do uruchamiania go we własnej infrastrukturze.

Dla europejskich klientów zaniepokojonych zależnością od amerykańskich dostawców chmurowych taka propozycja ma znaczenie nie tylko technologiczne, ale i polityczne. Komisja Europejska szacuje, że Unia sprowadza ponad 80 procent usług cyfrowych od dostawców zagranicznych, głównie amerykańskich.

IBM w kwietniu 2026 roku ogłosił z kolei partnerstwo z ElevenLabs, które ma zintegrować technologię spółki z platformą watsonx Orchestrate. Rozwija się także Chirp 3 HD, linia głosów Google Cloud, oraz OpenAI, które kontynuuje iteracje własnego silnika syntezy mowy.

Polski ekosystem w cieniu

W cieniu pojedynku ElevenLabs z Google rośnie inny polski gracz. Spółka Revoize, założona w 2023 roku, pozyskała dotychczas 458 tysięcy euro finansowania. Buduje infrastrukturę AI do transformacji mowy w czasie rzeczywistym.

Może zmienić akcent, poprawić jakość nagrania, a wszystko to lokalnie na urządzeniu, bez wysyłania dźwięku do chmury. Dla call center, obsługi klienta czy gier wideo to istotna propozycja.

W zestawieniach obiecujących polskich startupów technologicznych publikowanych na początku 2026 roku przez portale branżowe Revoize pojawia się regularnie obok takich nazw jak BioCam, FinQbit czy Orbotix.

Warto pamiętać, że ElevenLabs formalnie zarejestrowany jest w Londynie, a nie w Warszawie. Założyciele jednak publicznie deklarują polskie korzenie i zatrudniają w kraju sporą część zespołu technicznego. Dla polskiej branży technologicznej spółka jest traktowana jak narodowe osiągnięcie - porównywalnie do UiPath dla Rumunów czy Spotify dla Szwedów.

Przemysł dubbingowy

Jedną z najbardziej bezpośrednich konsekwencji premiery Gemini 3.1 Flash TTS może być zmiana ekonomii polskiego dubbingu. Stawki za dubbing zagranicznych produkcji na polski rynek filmowy i streamingowy od lat utrzymują się na stabilnym poziomie, a dostępność najpopularniejszych głosów aktorskich tworzy wąskie gardło.

Syntetyczne głosy o jakości „emocjonalnie wiarygodnej” stanowią dla platform streamingowych pokusę optymalizacji kosztów. Netflix i Disney+ od 2024 roku eksperymentują z dubbingiem AI dla produkcji drugoliniowych w mniejszych językach.

W Polsce największe studia dubbingowe - Sun Studio, Start International Polska, Master Film - obserwują rynek, ale na razie nie wprowadziły AI do produkcji oficjalnie dystrybuowanych treści.

Związek Zawodowy Aktorów Polskich w grudniu 2024 roku wystosował apel o regulacyjne zabezpieczenie praw do głosu jako dobra osobistego. Problem pozostaje nierozwiązany.

Technologia podwójnego ostrza

Rosnący realizm syntezy mowy generuje też coraz poważniejsze ryzyka. Modele klasy Eleven v3 i Gemini 3.1 Flash TTS potrafią stworzyć nagranie głosu nie do odróżnienia od oryginału.

Przestępcy wykorzystują tę technologię do ataków typu „fałszywy wnuczek” z klonem głosu członka rodziny. Do wyłudzeń korporacyjnych, w których zmanipulowany dźwięk głosu prezesa instruuje dział finansowy do przelewu. Do tworzenia dezinformacji politycznej.

Wszyscy główni dostawcy wdrożyli mechanizmy znakowania wodnego dźwięku oraz systemy weryfikacji tożsamości przy klonowaniu głosu. Tempo rozwoju technologii wyprzedza jednak możliwości jej kontroli.

Unijny AI Act, którego przepisy dotyczące systemów wysokiego ryzyka zaczną obowiązywać w pełni 2 sierpnia 2026 roku, nakłada na twórców generatywnej AI obowiązek oznaczania treści wygenerowanych przez maszynę.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co dalej

ElevenLabs nie opublikował oficjalnej odpowiedzi na premierę Gemini 3.1 Flash TTS. Historia branży pokazuje, że Staniszewski i Dąbkowski nie są skłonni do długich milczeń. Kolejna wersja modelu firmy, jeszcze bardziej ekspresyjna i z rozszerzoną obsługą języków, jest szeroko oczekiwana.

Dla polskiego sektora technologicznego wynik tej rywalizacji będzie miał znaczenie wykraczające poza losy jednej spółki. ElevenLabs pozostaje największym polskim sukcesem eksportowym w dziedzinie sztucznej inteligencji i jednym z nielicznych europejskich startupów grających w światowej lidze.

Rynek zdecyduje w przeciągu najbliższych miesięcy, czy przewaga jakościowa warszawskiego jednorożca wytrzyma atak firmy z zasobami miliard razy większymi.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Czym różni się Gemini 3.1 Flash TTS od modeli ElevenLabs?

Gemini 3.1 Flash TTS oferuje bibliotekę ponad 200 znaczników audio pozwalających zaszyć instrukcje emocjonalne wprost w tekście wejściowym - szept, śmiech, płacz czy determinację. Do tej pory taki poziom kontroli emocjonalnej oferowała głównie warszawska spółka ElevenLabs ze swoim modelem Eleven v3 premiery z czerwca 2025 roku.

Ile jest wart rynek sztucznej inteligencji głosowej w 2026 roku?

Rynek sztucznej inteligencji głosowej przekroczył w 2026 roku 22 miliardy dolarów według szacunków branżowych przytoczonych przez VentureBeat w marcu 2026 roku. Sam segment agentów głosowych AI ma osiągnąć 47,5 miliarda dolarów do 2034 roku.

Co to jest Revoize i czym się zajmuje?

Revoize to polska spółka założona w 2023 roku, która pozyskała 458 tysięcy euro finansowania i buduje infrastrukturę AI do transformacji mowy w czasie rzeczywistym. Może zmieniać akcent i poprawiać jakość nagrania lokalnie na urządzeniu, bez wysyłania dźwięku do chmury.

Czy polskie studia dubbingowe używają już AI do produkcji?

Największe polskie studia dubbingowe - Sun Studio, Start International Polska i Master Film - na razie nie wprowadziły AI do oficjalnie dystrybuowanych treści. Netflix i Disney+ eksperymentują z dubbingiem AI od 2024 roku, ale tylko dla produkcji drugoliniowych w mniejszych językach.

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 450 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
× powiększenie