🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Google DeepMind prezentuje Gemini 3.5 Transcribe - najdokładniejszy model zamiany mowy na tekst

Google DeepMind udostępniło Gemini 3.5 Transcribe - nowy model do zamiany mowy na tekst osiągający wskaźnik błędów na poziomie 2,6% dla nagrań i 4,0% dla strumieniowania na żywo.

2 min czytania
Google DeepMind prezentuje Gemini 3.5 Transcribe - najdokładniejszy model zamiany mowy na tekst

👁 143 przeczytań

Google DeepMind ogłosiło 26 sierpnia 2026 roku premierę Gemini 3.5 Transcribe - modelu do zamiany mowy na tekst, który według pomiarów firmy Artificial Analysis osiąga średni Word Error Rate na poziomie 2,6% dla nagrań i 4,0% dla transkrypcji strumieniowej w czasie rzeczywistym.

To wynik wyraźnie lepszy od poprzednich modeli transkrypcji Google’a, choć firma nie podaje bezpośredniego porównania z konkurencją - ani z Whisperem OpenAI, ani z usługami AWS czy Azure. Punktem odniesienia pozostają tutaj własne poprzednie systemy rozpoznawania mowy.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co odróżnia go od klasycznego ASR

Standardowe systemy rozpoznawania mowy (ASR) przekształcają dźwięk w surowy tekst - dosłownie, słowo po słowie, z błędami i szumem włącznie. Gemini 3.5 Transcribe idzie o krok dalej: model samodzielnie usuwa słowa-wypełniacze (typu ,,yyy” czy ,,eee”), obsługuje samopoprawki mówcy (np. ,,spotkajmy się we wtorek - nie, w środę”) i automatycznie formatuje gotowy tekst. Według Google’a model dobrze radzi sobie z hałaśliwym otoczeniem i precyzyjnie rozpoznaje ciągi alfanumeryczne - kody pocztowe, numery zamówień czy identyfikatory.

Dodatkową funkcją jest wywoływanie funkcji zewnętrznych - model może delegować złożone zadania, takie jak generowanie obrazów czy analiza plików, do innych modeli z rodziny Gemini. Na razie ta opcja działa wyłącznie w aplikacji Gemini na macOS.

Model obsługuje ponad 85 języków, automatycznie je wykrywa i radzi sobie z regionalnymi akcentami. W trybie przetwarzania nagrań przypisuje wypowiedzi do konkretnych mówców (do trzech osób, a obsługa większej liczby jest oznaczona jako eksperymentalna) i dodaje znaczniki czasu na poziomie pojedynczych słów.

Deweloperzy mają do dyspozycji dwa interfejsy API. Pierwszy to Live API z modelem gemini-3.5-transcribe-live - strumieniowanie dwukierunkowe z opóźnieniem poniżej sekundy, przeznaczone do interaktywnych aplikacji głosowych. Drugi to Interactions API z modelem gemini-3.5-transcribe - do przetwarzania gotowych nagrań, transkrypcji spotkań i analizy rozmów telefonicznych. Oba są dostępne w Gemini API przez Google AI Studio i Gemini Enterprise Agent Platform.

Konsumenci mieli już okazję korzystać z modelu pośrednio - zasila on funkcję Rambler na Androidzie oraz transkrypcję w aplikacji Gemini na macOS. Teraz Google otwiera ten sam silnik dla zewnętrznych deweloperów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie