Google revela Agentic Vision no Gemini 3 Flash para avançar compreensão de imagens com processos agentic - blog.google
Logan Kilpatrick, do Google DeepMind, anunciou em 11 de dezembro de 2024 o Gemini 2.0 Flash Experimental no Gemini API, desbloqueando capacidades de visão para apps agentic. É o modelo mais eficiente em custo, com baixa latência, alta throughput e multimodalidade nativa para texto, áudio, imagens, vídeo e código. Agentic vision permite agentes autônomos que observam, decidem e adaptam visualmente. Recursos: vídeo ao vivo até 30 FPS, raciocínio em imagens complexas, tool calling com visão, 1M tokens de contexto. Preços: texto input $0.10/M tokens, output $0.40/M; imagem $0.0265/imagem; vídeo $0.001/segundo. Disponível no Gemini API e Google AI Studio.
De onde veio esta notícia
Texto em português produzido com apoio de inteligência artificial a partir da publicação original de Google. Os fatos, números e nomes são os da fonte — se quiser conferir, o link abaixo leva ao original.
Ler a publicação original em Google