Google predstavil Gemini 3.5 Transcribe pre živý aj dávkový prepis reči
Google uviedol model Gemini 3.5 Transcribe pre priebežný prepis zvuku aj spracovanie nahrávok. Verejný preview je dostupný cez Gemini API a vybrané produkty spoločnosti.

Google 26. augusta predstavil Gemini 3.5 Transcribe, nový model typu speech-to-text určený na prepis reči v reálnom čase aj zo zvukových záznamov. Firma ho sprístupnila vo verejnom preview cez Gemini API v Google AI Studio a cez Gemini Enterprise Agent Platform.

Novinka má dve samostatné varianty. Model gemini-3.5-transcribe-live je navrhnutý pre priebežný prepis prostredníctvom Gemini Live API. Dokumentácia pri ňom uvádza nízku latenciu a streamovaný textový výstup. Druhý model, gemini-3.5-transcribe, je určený na spracovanie nahrávok a podporuje priradenie jednotlivých častí záznamu hovoriacim aj časové značky na úrovni slov.
Gemini 3.5 Transcribe ponúka dva režimy prepisu
Google pri novom rozhraní kombinuje samotné rozpoznávanie reči s možnosťami následnej úpravy textu. API podporuje automatickú detekciu jazyka, vlastný slovník a dva režimy výstupu: doslovný a upravený prepis.
Doslovný režim má zachovať hovorený prejav vrátane výplňových slov. Upravený režim, označovaný aj ako Smart transcription, môže výplňové slová odstrániť a upraviť formátovanie výsledného textu. Takýto výstup môže byť praktický napríklad pre zápisy z porád alebo diktovanie, nemusí však vyhovovať situáciám, kde je potrebný presný doslovný záznam výpovede.
V dokumentácii podporovaných jazykov je uvedená aj slovenčina s označením sk-SK. Google však neuvádza samostatné výsledky presnosti pre slovenský jazyk. Praktická kvalita môže závisieť od kvality nahrávky, okolitého šumu, používaných odborných názvov, počtu hovoriacich a zvolenej konfigurácie.
Živý prepis aj analýza nahrávok
Variant Live je zacielený na aplikácie, ktoré potrebujú text počas prebiehajúceho rozhovoru alebo diktovania. Streamovaný výstup môže využiť hlasový agent, titulkovanie či používateľské rozhranie zobrazujúce priebežný prepis.
Model pre nahrávky je naopak určený na spracovanie už existujúceho zvuku. Okrem textu má poskytnúť časové značky na úrovni slov a priradenie segmentov jednotlivým hovoriacim. Tieto funkcie sú relevantné pre tvorbu zápisov z rozhovorov, podcastov alebo pracovných stretnutí.
Google uvádza, že Gemini 3.5 Transcribe je dostupný aj v aplikácii Gemini pre macOS, zatiaľ v angličtine. Funkciu Rambler má firma nasadzovať v klávesnici Gboard pre Android, ale iba vo vybraných krajinách a jazykoch. Integrácia do prehliadača Chrome je podľa oznámenia pripravovaná, bez potvrdeného dátumu všeobecného sprístupnenia diktovania do webových polí.
Výkonnostné tvrdenia zatiaľ bez nezávislého overenia
Google v oznámení odkazuje na meranie Artificial Analysis a pripisuje mu údaje o Word Error Rate medzi 2,6 a 4,0 percenta aj 70-percentnom zrýchlení finalizácie prepisu. Tieto hodnoty neboli v dostupných podkladoch nezávisle reprodukované. Rovnako nie je potvrdené, ako sa deklarované parametre prejavia pri slovenskom prejave alebo pri nahrávkach s väčším počtom hovoriacich.
Pre vývojárov je podstatné, že rozhranie je zatiaľ vo verejnom preview. Google v oznámených materiáloch neuvádza kompletné informácie o cenníku, limitoch používania ani o podmienkach spracovania hlasových dát počas tejto fázy. Práve tieto detaily, spolu s nezávislými testami latencie a presnosti, budú dôležité pri posudzovaní nasadenia modelu v produkčných službách.
Zdroje
- Google Blog — Intelligent transcription with Gemini 3.5 Transcribe – Potvrdzuje oznámenie z 26. augusta 2026, varianty modelu, preview dostupnosť, produktové integrácie a Googlom deklarované vlastnosti.
- Google AI for Developers — Live transcription with Gemini Live API – Potvrdzuje model `gemini-3.5-transcribe-live`, streamovaný prepis, technické rozhranie, funkcie prepisu a podporované jazyky vrátane slovenčiny.
- Google AI for Developers — Audio transcription – Dokumentuje samostatné API pre prepis zvukových nahrávok.
Overené a aktualizované: 27. 08. 2026 20:15



