Google pridáva agentic video understanding do vybraných modelov Gemini
Google sprístupnil agentný spôsob analýzy videa v modeloch Gemini 3.7 Flash, 3.6 Flash a 3.5 Flash-Lite cez Gemini API.

Google 1. septembra 2026 oznámil funkciu agentic video understanding pre modely Gemini 3.7 Flash, 3.6 Flash a 3.5 Flash-Lite. Je určená na analýzu nahraných videí aj videí z YouTube prostredníctvom Gemini API v službách Google AI Studio a Gemini Enterprise Agent Platform.

Nový režim má zmeniť spôsob, akým model pri práci s videom vyhľadáva potrebné informácie. Namiesto spracovania obsahu pri vopred stanovenej snímkovej frekvencii má dynamicky hľadať a kontrolovať relevantné pasáže vo vizuálnych snímkach, zvukovej stope a prepisoch.
Čo prináša agentic video understanding
Pri bežnom statickom spracovaní videa vývojár nastavuje, akú časť obsahu alebo koľko snímok model vyhodnotí. Pri dlhých záznamoch tak rastie počet spracovaných tokenov aj náklady, pričom dôležitý detail môže zostať mimo vybranej vzorky.
Google opisuje nový postup ako interný agentný proces modelu. Gemini má podľa zadanej otázky najprv vyhľadávať potenciálne relevantné úseky a následne ich overovať naprieč obrazom, zvukom a textovým prepisom. Výber pasáží sa tak presúva z ručnej implementácie vo vývojárskej aplikácii do samotného modelu.
Funkcia sa aktivuje nastavením spracovania na hodnotu „agentic“ v konfigurácii API. Google uvádza, že za tento režim nebude účtovať samostatný príplatok: používať sa majú štandardné tokenové ceny Gemini API.
Dostupné modely a spôsob nasadenia
Agentný režim videoanalýzy Google oznámil pre tri modely z rady Flash:
- Gemini 3.7 Flash,
- Gemini 3.6 Flash,
- Gemini 3.5 Flash-Lite.
Vývojári ho môžu použiť pri videách nahratých do systému aj pri videách z YouTube. Podľa oznámenia je dostupný cez Gemini API v Google AI Studio a Gemini Enterprise Agent Platform. Oznámenie neuvádza podrobné limity funkcie ani kompletné parametre spracovania.
Benchmarky zatiaľ pochádzajú od Google
Google pri predstavení uvádza zníženie spotreby tokenov až o 88 % a nákladov až o 66 %, spolu so zvýšením presnosti až o 7 %. Ide však o benchmarkové hodnoty výrobcu. K oznámeniu nebolo predložené nezávislé overenie metodiky ani výsledkov, preto nie je jasné, ako sa tieto čísla prenesú do rôznych typov videí a praktických nasadení.
Význam funkcie spočíva najmä v tom, že videoanalýza v multimodálnych modeloch býva tokenovo náročná. Ak sa deklarované výsledky potvrdia aj mimo interných benchmarkov, vývojári by mohli pri dlhších videách lacnejšie vyhľadávať konkrétne udalosti, zvukové informácie alebo detaily v obraze.
Čo bude nasledovať
Google zároveň avizuje budúce rozšírenie funkcie do aplikácie Gemini a do služby YouTube „Ask YouTube“. Termín ani rozsah tejto dostupnosti firma zatiaľ nepotvrdila nad rámec vlastného oznámenia.
Pri ďalšom nasadzovaní bude dôležité sledovať nezávislé porovnania presnosti, latencie a reálnych nákladov so statickým spracovaním videa. Otvorené zostávajú aj otázky limitov API, dokumentácie a ochrany súkromia pri spracovaní videoobsahu.
Zdroje
- Google Blog / Google DeepMind – Primárne oznámenie z 1. septembra 2026 potvrdzuje spustenie funkcie, podporované modely, kanály dostupnosti, spôsob aktivácie a výrobcove benchmarkové tvrdenia.
Overené a aktualizované: 01. 09. 2026 22:31



