Pular para o conteúdo
← Todas as notícias

IBM Research detalha método para medir e reduzir a inconsistência de agentes de IA

No AppWorld, o método elevou de 53,0% para 69,0% a taxa de tarefas resolvidas em todas as cinco tentativas e reduziu a lacuna de consistência.

A IBM Research detalha um método para medir quando um agente de IA acerta uma vez, mas não repete o resultado na mesma tarefa. O artigo parte de um problema prático: em ambientes de negócio, a mesma solicitação pode ser concluída numa execução e falhar na seguinte, sem qualquer mudança no pedido.

IBM Research detalha método para medir e reduzir a inconsistência de agentes de IA

No benchmark AppWorld, um agente ReAct com GPT-4.1 teve Mean@5 de 77,4%, mas Pass^5 de 53,0%. Em outras palavras, o sistema acertou em média, porém só concluiu as mesmas tarefas em todas as cinco tentativas em pouco mais da metade dos casos. A diferença, de 24,4 pontos percentuais, é o que os autores chamam de lacuna de consistência.

Para medir esse comportamento, a IBM criou o Consistency Analyzer, que reexecuta cada decisão de uma trajetória gravada e mede o quanto a resposta varia. Quando identifica etapas instáveis, o sistema gera diretrizes de consistência, incorporadas ao fluxo do ALTK-Evolve, para orientar decisões futuras. O ponto central não é encontrar falhas raras, mas estabilizar etapas que às vezes saem certas e às vezes não.

Nos testes, as diretrizes elevaram o Pass^5 para 69,0% e o Mean@5 para 81,0%, reduzindo a lacuna para 12,0 pontos percentuais. A abordagem também funcionou em uma tarefa relacionada e no modelo gpt-oss-120b, com ganho de 10,1% para 16,1% em Pass^5. O repositório aberto ALTK-Evolve inclui o Consistency Analyzer e a geração dessas diretrizes.

Redação em português com apoio de IA, a partir de Hugging Face. Curadoria de Thiago Felizola.

Ler a notícia original
← Todas as notícias