A NVIDIA detalha resultados de desempenho do NIM 2.0.12 aplicado ao modelo Nemotron 3 Ultra em um sistema com quatro GPUs B200. No cenário descrito pela empresa, a configuração otimizada consegue atender até 2,5 vezes mais usuários do que a base sem otimizações, mantendo 50 TPS por usuário.

O material explica que o NIM reúne escolhas validadas de configuração para combinações específicas de modelo, GPU e precisão, em vez de partir de um ambiente vazio. As melhorias vêm da interação entre precisão, kernels, paralelismo, agendamento, agrupamento de requisições, uso de memória, reaproveitamento de prefixo, cache de estado do modelo e estratégia de geração.
A NVIDIA ressalta que os ganhos publicados não valem como promessa para qualquer aplicação. O resultado depende do tráfego real e da meta de latência de cada caso, por isso a orientação é repetir consultas representativas com o AIPerf e comparar os pontos de desempenho.
Para uso em produção, o texto também cita o NIM Certified, que inclui atualizações regulares da pilha de inferência, tratamento de CVEs, validação de hardware mais ampla e suporte comercial via NVIDIA AI Enterprise.