Google predstavil Gemini 3.8 Live pre hlasové AI aplikácie v reálnom čase

Google uviedol modely Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking. Sú určené pre hlasové aplikácie s obrazovými, video a textovými vstupmi.

Google 15. septembra 2026 oznámil Gemini 3.8 Live a variant Gemini 3.8 Live Extended Thinking, dva modely určené pre hlasové AI aplikácie v reálnom čase. Pracujú s priebežnou hlasovou konverzáciou a okrem zvuku dokážu prijímať aj obrazové, video a textové vstupy.

Novinky rozširujú ponuku Googlu pre vývojárov hlasových agentov. Modely sú dostupné cez Gemini API a Google AI Studio. Rozsah dostupnosti v ďalších produktoch Googlu sa podľa firmy zavádza postupne a môže sa líšiť podľa regiónu, typu predplatného či firemného náhľadu.

Gemini 3.8 Live pre hlasové AI aplikácie

Základný model Gemini 3.8 Live je navrhnutý pre nízkolatenčné, priebežné interakcie. Nejde teda len o jednorazové odoslanie nahrávky na prepis alebo vytvorenie odpovede. Rozhranie má slúžiť pre aplikácie, v ktorých používateľ a model vedú rozhovor a AI zároveň dostáva kontext z kamery, videa alebo textu.

Google pri modeli uvádza aj asynchrónne volanie funkcií a externých nástrojov. Táto možnosť má umožniť, aby hlasový dialóg pokračoval, kým sa úloha vykonáva na pozadí. V praxi môže ísť o scenáre, kde agent počas rozhovoru potrebuje pracovať so službou alebo funkciou pripojenou vývojárom.

Variant Extended Thinking pridáva konfigurovateľné premýšľanie pre zložitejšie úlohy s viacerými krokmi. Google ho tak odlišuje od modelu orientovaného najmä na rýchlu priebežnú konverzáciu. Konkrétna spoľahlivosť takéhoto spracovania pri produkčnom používaní však bude vyžadovať nezávislé testovanie, predovšetkým pri samostatnom používaní externých nástrojov.

Viac vstupov v jednom rozhraní

Podľa model card dokážu modely pracovať so zvukom, obrazom, videom a textom. Kombinácia týchto formátov môže byť dôležitá pre aplikácie, ktoré nereagujú len na vyslovenú požiadavku, ale aj na situáciu zachytenú kamerou alebo na obsah zobrazený používateľovi.

Pre vývojárov je podstatné, že hlasový dialóg, vizuálny kontext, odpovede modelu a volanie nástrojov sú súčasťou jedného rozhrania. Hlasové rozhrania sa tým posúvajú od jednoduchého prevodu reči na text smerom k agentom, ktoré majú počas konverzácie vykonávať viac-krokové úlohy.

Google zároveň uvádza, že audio generované jeho AI produktmi označuje vodoznakom SynthID. Ide o mechanizmus určený na identifikáciu obsahu vytvoreného umelou inteligenciou Googlu.

Limity uvádzané v dokumentácii

Google v model card otvorene uvádza aj viacero obmedzení. Modely môžu halucinovať, teda vytvárať nesprávne alebo nepodložené odpovede. Pri používaní sa môže objaviť spomalenie a timeouty. Znalostný cut-off je stanovený na január 2025, preto model bez doplneného aktuálneho kontextu nemusí poznať udalosti po tomto dátume.

Pri firemnom nasadení sú tieto limity relevantné najmä vtedy, ak hlasový agent získava prístup k externým nástrojom. Vývojári budú musieť samostatne overiť presnosť odpovedí, správanie pri neúspešnom vykonaní nástroja aj vhodnosť kontrol pred vykonaním akcií.

Google prezentuje vlastné hodnotenia schopností modelov, no tvrdenia o benchmarkovom prvenstve, cenovej konkurencieschopnosti alebo preferencii používateľov zatiaľ neboli v dostupných podkladoch nezávisle overené.

Čo bude nasledovať

Dôležité bude, kedy sa nové funkcie objavia mimo vývojárskych kanálov, napríklad v Gemini app, Search Live a Google Workspace, a v ktorých krajinách. Vývojári budú sledovať aj ceny, limity používania a podmienky pre Vertex AI a podnikové nasadenia.

Ďalšou otázkou budú nezávislé porovnania latencie, presnosti a úspešnosti viac-krokových úloh s konkurenčnými hlasovými modelmi. Reálne nasadenie zároveň ukáže, či sa objavia prípady halucinácií, zlyhaní napojených nástrojov alebo bezpečnostné incidenty.

Zdroje

  • Google Blog / Google DeepMind – Potvrdzuje oznámenie, hlavné funkcie, kanály postupného sprístupnenia a deklarované označovanie audia pomocou SynthID.
  • Google Blog / Google DeepMind – Potvrdzuje dostupnosť cez Gemini API a Google AI Studio, funkcie pre vývojárov a Googlom uvádzané orientačné ceny audia.
  • Google DeepMind Model Card – Potvrdzuje vstupy a výstupy modelov, distribučné kanály, známe obmedzenia a bezpečnostné hodnotenie Googlu.
  • Google AI for Developers – Potvrdzuje technický charakter Live API ako nízkolatenčného rozhrania pre priebežné hlasové a obrazové interakcie.

Overené a aktualizované: 16. 09. 2026 06:19

Zdieľanie