A Microsoft publicou no Hugging Face um guia sobre o ThinkingBox, um benchmark para avaliar agentes de IA pelo que eles deixam gravado no sistema, não só pelas respostas ou pelas chamadas de ferramenta. A proposta é checar o estado final e os efeitos colaterais de cada tarefa.

O exemplo usado no texto mostra um agente que trata corretamente a consulta de uma cliente sobre um produto de US$ 745 atrasado, mas fecha o ticket como resolvido quando o estado exigido era “em espera”. O problema não aparece na resposta final do agente; só fica claro quando o sistema verifica o registro alterado.
O benchmark cobre 507 fluxos de trabalho de negócios e executa cada um 20 vezes, sempre a partir de um estado limpo. Em uma amostra com 121.680 tentativas válidas, 79.853 falharam nas verificações executáveis. Entre essas falhas, 67,24% terminaram sem erro aparente, mas ainda assim 77,61% tinham valores errados, 43,30% criavam efeitos extras e 25,36% deixavam de produzir o efeito exigido.
Nos resultados, há uma diferença grande entre conseguir fazer uma tarefa uma vez e fazê-la sempre. Kimi-K3 resolveu 93,89% das tarefas ao menos uma vez, mas só 13,41% em todas as 20 tentativas. Já Claude Opus 5.5 aparece como o modelo com o maior número de tarefas consistentes, 241, enquanto GPT-5.4 tem o menor custo por tarefa confiável entre os modelos citados, US$ 6,80. O texto conclui que a maior parte das falhas vem do tratamento das ferramentas, não do raciocínio em si.