Pular para o conteúdo
← Todas as notícias

AWS detalha avaliação automática de agentes no GitHub Actions com Bedrock AgentCore

Guia mostra como usar o Amazon Bedrock AgentCore e o GitHub Actions para avaliar agentes de IA, medir respostas e barrar PRs quando o comportamento piora.

A Amazon Web Services publicou um guia para montar uma etapa de qualidade no GitHub Actions que avalia um agente de IA durante o desenvolvimento e barra pull requests quando as notas caem. O exemplo usa o Amazon Bedrock AgentCore para publicar o agente, executar testes com prompts de avaliação e comparar os resultados com limites definidos.

AWS detalha avaliação automática de agentes no GitHub Actions com Bedrock AgentCore

A proposta tenta resolver um problema comum em equipes que mexem em prompts, modelos ou ferramentas do agente: mudanças pequenas podem piorar as respostas sem aviso imediato. Com essa automação, a checagem acontece antes da integração do código, em vez de depender só de revisão manual.

O texto também mostra três caminhos para lidar com a autenticação OAuth em pipelines sem usuário humano. Um deles usa traces salvos em arquivos JSON; outro cria um usuário de teste com token de atualização guardado no AWS Secrets Manager; o terceiro, foco do guia, faz o servidor MCP aceitar tanto tokens machine-to-machine quanto tokens de usuário, para que o CI consiga rodar sem abrir o fluxo interativo de consentimento.

Na demonstração, o pipeline usa quatro avaliadores do AgentCore — GoalSuccessRate, Correctness, ToolSelectionAccuracy e ToolParameterAccuracy — e inclui um teste em que um prompt ruim derruba a pontuação e faz o PR falhar. O guia observa ainda que avaliações com LLM têm variação, então o limite de aprovação precisa de margem.

← Todas as notícias