A NVIDIA publicou um guia técnico sobre avaliação de agentes de inteligência artificial e sustenta que a pergunta principal não é se o modelo “soa certo”, mas se consegue concluir uma sequência de trabalho em um ambiente real, lidando com falhas no meio do caminho.

O texto diz que avaliações antigas foram feitas para tarefas estáticas e, por isso, uma única saída não basta quando o sistema chama ferramentas, observa resultados e tenta seguir adiante. Nesse contexto, o Berkeley Function-Calling Leaderboard (BFCL) aparece como uma forma de medir a escolha da função e o preenchimento dos argumentos, mas ainda em chamadas individuais. A própria NVIDIA ressalta que uma chamada correta, como `issue_refund`, pode falhar se verificações ou atualizações necessárias forem ignoradas.
Para a empresa, a avaliação completa precisa de um ambiente que execute cada chamada, acompanhe o estado entre as etapas e verifique o resultado final. O guia contrapõe a análise por etapa, útil para localizar onde a sequência quebrou, à avaliação de ponta a ponta, que reúne o efeito de todo o fluxo e mostra o que de fato aconteceu ao final.
Entre os exemplos citados estão o PinchBench, no qual Nemotron 3.5 Lightning aparece com 86% de precisão e conclusão de 10.000 tarefas 30% mais rápida que Qwen3.6 35B, e o aviso de que pontuações públicas não devem virar critério único de liberação. A NVIDIA também diz que adaptar o modelo ao próprio caso de uso continua essencial.