Pular para o conteúdo
← Todas as notícias

NVIDIA detalha como avaliar agentes de IA pela conclusão de tarefas, não por chamadas isoladas

Guia técnico da NVIDIA defende medir agentes pelo resultado final e pelo rastreamento por etapa, com exemplos como BFCL, E2E e o benchmark PinchBench.

A NVIDIA publicou um guia técnico sobre avaliação de agentes de inteligência artificial e sustenta que a pergunta principal não é se o modelo “soa certo”, mas se consegue concluir uma sequência de trabalho em um ambiente real, lidando com falhas no meio do caminho.

NVIDIA detalha como avaliar agentes de IA pela conclusão de tarefas, não por chamadas isoladas

O texto diz que avaliações antigas foram feitas para tarefas estáticas e, por isso, uma única saída não basta quando o sistema chama ferramentas, observa resultados e tenta seguir adiante. Nesse contexto, o Berkeley Function-Calling Leaderboard (BFCL) aparece como uma forma de medir a escolha da função e o preenchimento dos argumentos, mas ainda em chamadas individuais. A própria NVIDIA ressalta que uma chamada correta, como `issue_refund`, pode falhar se verificações ou atualizações necessárias forem ignoradas.

Para a empresa, a avaliação completa precisa de um ambiente que execute cada chamada, acompanhe o estado entre as etapas e verifique o resultado final. O guia contrapõe a análise por etapa, útil para localizar onde a sequência quebrou, à avaliação de ponta a ponta, que reúne o efeito de todo o fluxo e mostra o que de fato aconteceu ao final.

Entre os exemplos citados estão o PinchBench, no qual Nemotron 3.5 Lightning aparece com 86% de precisão e conclusão de 10.000 tarefas 30% mais rápida que Qwen3.6 35B, e o aviso de que pontuações públicas não devem virar critério único de liberação. A NVIDIA também diz que adaptar o modelo ao próprio caso de uso continua essencial.

← Todas as notícias