stamatios
← Voltar ao feed
Rolo de filme penteado por dedos robóticos que separam quadros, análise agêntica de vídeo no Gemini do Google
IA & Modelos

Gemini ganha análise de vídeo agêntica e corta consumo de tokens em 88%

resumo de ~3 min

Lançamento

A Google anunciou o agentic video understanding, novo recurso de análise de vídeo para os modelos Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. A funcionalidade está disponível para uploads de vídeo e vídeos do YouTube via API Gemini no Google AI Studio e no Gemini Enterprise Agent Platform. Segundo os autores Rohan Doshi e Mario Lučić, do Google DeepMind, o recurso usa as ferramentas nativas de vídeo do Gemini, de forma semelhante ao agentic vision, que combina execução de código com o entendimento nativo de imagens.

Como funciona

No processamento 'estático' atual, o modelo ingere o vídeo a uma taxa fixa de quadros por segundo (padrão de 1 FPS, ajustável via API). Com o modo agêntico, o Gemini assume um papel ativo e orientado a objetivos, decidindo o que assistir, em qual velocidade e por qual modalidade (quadros visuais, áudio ou transcrição), buscando apenas os momentos e sinais necessários por meio de um loop agêntico que invoca uma ferramenta interna para carregar trechos do arquivo. Os desenvolvedores já podiam fazer isso manualmente; o novo recurso elimina essa sobrecarga de desenvolvimento.

Resultados e benchmarks

Em benchmarks padrão de análise de vídeo, os modelos com entendimento agêntico reduzem o consumo de tokens em até 88%, cortam custos em até 66% e melhoram a precisão em até 7%. Esses ganhos são mais pronunciados em vídeos longos - de guias de 10 minutos a aulas de 90 minutos e gravações de várias horas -, caso em que o processamento estático força os desenvolvedores a escolher entre custos altos de tokens ou técnicas que perdem detalhes importantes. O Google afirma que o Gemini 3.7 Flash com o recurso oferece a melhor combinação de qualidade e eficiência de custo, posicionando-o na fronteira de Pareto de precisão-custo entre os modelos testados.

Casos de uso

A empresa destaca quatro aplicações: recuperação de momentos em escala de menos de um segundo (mudanças de estado e cortes rápidos que passam despercebidos a 1 FPS, viabilizando edição automatizada); busca do tipo 'agulha em palheiros' em vídeos de várias horas sem consumir milhões de tokens; detecção de anomalias, com reamostragem de janelas de interesse em FPS mais alto para inspecionar movimento rápido e artefatos visuais; e contagem precisa de ações e objetos repetidos ao longo do tempo.

Disponibilidade e próximos passos

Para ativar o recurso, basta definir o processamento como "agentic" na configuração da API. Ele usa o preço padrão de tokens da API Gemini, sem taxa adicional pelo recurso. A eficiência e a melhoria de qualidade também chegarão a todos os usuários do aplicativo Gemini nos modelos Flash e Flash-Lite em breve. Nos próximos meses, o entendimento agêntico de vídeo vai alimentar o recurso 'Ask YouTube' na página de exibição de vídeos, usando o Gemini para gerar respostas de maior qualidade baseadas nas imagens.