Pular para o conteúdo
← Todas as notícias

NVIDIA detalha como medir o custo da computação confidencial na inferência de IA

Guia técnico mostra como comparar inferência com e sem confidencialidade no TensorRT LLM e relata retenção de 96,1% a 98,2% da taxa de tokens em testes com oito B200.

A NVIDIA publicou um guia técnico sobre inferência de modelos de linguagem em computação confidencial, uma forma de proteger dados enquanto eles são processados. O texto mostra como o TensorRT LLM se adapta para esse ambiente e como medir o impacto dessas mudanças no desempenho.

NVIDIA detalha como medir o custo da computação confidencial na inferência de IA

Segundo a empresa, a computação confidencial combina máquinas virtuais com memória criptografada, GPUs confidenciais e NVLink criptografado. O ponto central do guia é que essa proteção muda a movimentação de memória, o tempo de execução e a comunicação entre GPUs, o que pode criar custo extra se o software não for ajustado junto com o ambiente.

Para isolar esse efeito, a equipe de engenharia de desempenho comparou a mesma inferência com a confidencialidade desligada e ligada, mantendo modelo, hardware, versão do framework, comprimentos de sequência, paralelismo e concorrência constantes. No teste citado, com o modelo DeepSeek-R1 em oito GPUs B200, a configuração confidencial reteve de 96,1% a 98,2% da taxa de geração de tokens da linha de base e deixou o tempo por token entre 1,2% e 4,3% acima do original.

O texto também descreve três adaptações do TensorRT LLM: transferências entre CPU e GPU passam por um buffer criptografado por software; o ajuste automático de kernels perdeu a referência confiável dos eventos CUDA; e o NVLS não está disponível na configuração B200 CC. A recomendação final é tratar segurança e desempenho como parte da mesma preparação de produção e medir o sistema com e sem confidencialidade no workload exato que será usado.

← Todas as notícias