A Amazon Web Services publicou um guia para montar uma etapa de qualidade no GitHub Actions que avalia um agente de IA durante o desenvolvimento e barra pull requests quando as notas caem. O exemplo usa o Amazon Bedrock AgentCore para publicar o agente, executar testes com prompts de avaliação e comparar os resultados com limites definidos.

A proposta tenta resolver um problema comum em equipes que mexem em prompts, modelos ou ferramentas do agente: mudanças pequenas podem piorar as respostas sem aviso imediato. Com essa automação, a checagem acontece antes da integração do código, em vez de depender só de revisão manual.
O texto também mostra três caminhos para lidar com a autenticação OAuth em pipelines sem usuário humano. Um deles usa traces salvos em arquivos JSON; outro cria um usuário de teste com token de atualização guardado no AWS Secrets Manager; o terceiro, foco do guia, faz o servidor MCP aceitar tanto tokens machine-to-machine quanto tokens de usuário, para que o CI consiga rodar sem abrir o fluxo interativo de consentimento.
Na demonstração, o pipeline usa quatro avaliadores do AgentCore — GoalSuccessRate, Correctness, ToolSelectionAccuracy e ToolParameterAccuracy — e inclui um teste em que um prompt ruim derruba a pontuação e faz o PR falhar. O guia observa ainda que avaliações com LLM têm variação, então o limite de aprovação precisa de margem.