A AWS publicou um guia técnico sobre como construir uma solução de inteligência de vídeo com IA agente. A proposta é permitir que usuários enviem vídeos e façam perguntas em linguagem natural, recebendo respostas sem precisar assistir ao conteúdo inteiro.

No centro da abordagem está um único agente criado com o Strands Agents SDK. Ele decide, na hora, quais serviços chamar de acordo com a pergunta: Amazon Transcribe para conteúdo falado, Amazon Rekognition para análise visual e Amazon Bedrock Data Automation quando a análise completa em um passo fizer sentido. O texto diz que, em vídeos já processados, as respostas podem sair em menos de um segundo; na análise inicial de vídeos novos, o tempo típico fica entre 5 e 10 minutos, variando com a duração do arquivo e os serviços usados.
A AWS também cita um caso de uso em que uma empresa de mídia e entretenimento aplicou essa abordagem com o apoio do AWS Professional Services. Segundo a companhia, houve redução de cerca de 80% no tempo gasto em revisão manual de mais de 200 gravações longas, com base em comparação interna de horas por gravação, sem verificação independente.
O guia contrasta esse modelo com fluxos fixos, nos quais todo vídeo passa pelos mesmos passos. Aqui, o agente verifica se já existe análise armazenada, escolhe apenas o que precisa executar e combina os resultados. A publicação ainda recomenda o uso do Amazon Bedrock Guardrails em produção, sobretudo em cenários de reconhecimento facial e vigilância.