Google DeepMind prezentuje Gemini 3.5 Transcribe - najdokładniejszy model zamiany mowy na tekst
Google DeepMind udostępniło Gemini 3.5 Transcribe - nowy model do zamiany mowy na tekst osiągający wskaźnik błędów na poziomie 2,6% dla nagrań i 4,0% dla strumieniowania na żywo.
👁 143 przeczytań
Google DeepMind ogłosiło 26 sierpnia 2026 roku premierę Gemini 3.5 Transcribe - modelu do zamiany mowy na tekst, który według pomiarów firmy Artificial Analysis osiąga średni Word Error Rate na poziomie 2,6% dla nagrań i 4,0% dla transkrypcji strumieniowej w czasie rzeczywistym.
To wynik wyraźnie lepszy od poprzednich modeli transkrypcji Google’a, choć firma nie podaje bezpośredniego porównania z konkurencją - ani z Whisperem OpenAI, ani z usługami AWS czy Azure. Punktem odniesienia pozostają tutaj własne poprzednie systemy rozpoznawania mowy.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co odróżnia go od klasycznego ASR
Standardowe systemy rozpoznawania mowy (ASR) przekształcają dźwięk w surowy tekst - dosłownie, słowo po słowie, z błędami i szumem włącznie. Gemini 3.5 Transcribe idzie o krok dalej: model samodzielnie usuwa słowa-wypełniacze (typu ,,yyy” czy ,,eee”), obsługuje samopoprawki mówcy (np. ,,spotkajmy się we wtorek - nie, w środę”) i automatycznie formatuje gotowy tekst. Według Google’a model dobrze radzi sobie z hałaśliwym otoczeniem i precyzyjnie rozpoznaje ciągi alfanumeryczne - kody pocztowe, numery zamówień czy identyfikatory.
Dodatkową funkcją jest wywoływanie funkcji zewnętrznych - model może delegować złożone zadania, takie jak generowanie obrazów czy analiza plików, do innych modeli z rodziny Gemini. Na razie ta opcja działa wyłącznie w aplikacji Gemini na macOS.
Model obsługuje ponad 85 języków, automatycznie je wykrywa i radzi sobie z regionalnymi akcentami. W trybie przetwarzania nagrań przypisuje wypowiedzi do konkretnych mówców (do trzech osób, a obsługa większej liczby jest oznaczona jako eksperymentalna) i dodaje znaczniki czasu na poziomie pojedynczych słów.
Deweloperzy mają do dyspozycji dwa interfejsy API. Pierwszy to Live API z modelem gemini-3.5-transcribe-live - strumieniowanie dwukierunkowe z opóźnieniem poniżej sekundy, przeznaczone do interaktywnych aplikacji głosowych. Drugi to Interactions API z modelem gemini-3.5-transcribe - do przetwarzania gotowych nagrań, transkrypcji spotkań i analizy rozmów telefonicznych. Oba są dostępne w Gemini API przez Google AI Studio i Gemini Enterprise Agent Platform.
Konsumenci mieli już okazję korzystać z modelu pośrednio - zasila on funkcję Rambler na Androidzie oraz transkrypcję w aplikacji Gemini na macOS. Teraz Google otwiera ten sam silnik dla zewnętrznych deweloperów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


