Pular para o conteúdo
← Todas as notícias

AWS detalha avaliadores que medem escolha e execução de skills em agentes de IA

Strands Evals e Amazon Bedrock AgentCore Evaluations passam a medir, separadamente, se o agente escolheu a skill certa e se seguiu seus passos, em vez de confiar só na resposta final.

A AWS detalha como medir agentes que usam skills, os conjuntos reutilizáveis de instruções para tarefas como revisar contratos, reconciliar faturas ou seguir regras internas. O ponto central é separar duas falhas que uma resposta convincente pode esconder: o agente escolher a skill errada ou usar a skill certa sem cumprir o procedimento inteiro.

AWS detalha avaliadores que medem escolha e execução de skills em agentes de IA

Para isso, o texto apresenta dois avaliadores principais: Skill Selection Accuracy e Skill Instruction Following. O primeiro verifica se a skill invocada combina com a tarefa. O segundo mede o quanto o agente seguiu os passos previstos na skill, inclusive quando ele acerta o encaminhamento, mas deixa instruções importantes de fora.

A avaliação pode ser feita a partir de uma trajetória registrada no Strands Evals ou de traces OpenTelemetry no Amazon Bedrock AgentCore Evaluations. No Strands Evals, há ainda o SkillInvoked, um verificador determinístico útil quando o teste já sabe qual skill precisa ser acionada.

A AWS também diferencia os usos: Strands Evals é mais indicado quando a equipe controla os casos de teste e pode repetir execuções durante o desenvolvimento; AgentCore Evaluations serve para analisar sessões armazenadas, avaliar sob demanda ou acompanhar tráfego em amostras ao longo do tempo. O próprio texto alerta que, sem registros confiáveis da execução, a leitura das notas pode ficar errada.

← Todas as notícias