A AWS detalha como medir agentes que usam skills, os conjuntos reutilizáveis de instruções para tarefas como revisar contratos, reconciliar faturas ou seguir regras internas. O ponto central é separar duas falhas que uma resposta convincente pode esconder: o agente escolher a skill errada ou usar a skill certa sem cumprir o procedimento inteiro.

Para isso, o texto apresenta dois avaliadores principais: Skill Selection Accuracy e Skill Instruction Following. O primeiro verifica se a skill invocada combina com a tarefa. O segundo mede o quanto o agente seguiu os passos previstos na skill, inclusive quando ele acerta o encaminhamento, mas deixa instruções importantes de fora.
A avaliação pode ser feita a partir de uma trajetória registrada no Strands Evals ou de traces OpenTelemetry no Amazon Bedrock AgentCore Evaluations. No Strands Evals, há ainda o SkillInvoked, um verificador determinístico útil quando o teste já sabe qual skill precisa ser acionada.
A AWS também diferencia os usos: Strands Evals é mais indicado quando a equipe controla os casos de teste e pode repetir execuções durante o desenvolvimento; AgentCore Evaluations serve para analisar sessões armazenadas, avaliar sob demanda ou acompanhar tráfego em amostras ao longo do tempo. O próprio texto alerta que, sem registros confiáveis da execução, a leitura das notas pode ficar errada.