A NVIDIA publicou uma demonstração do TensorRT multi-device, recurso que permite executar uma única rede do TensorRT em várias GPUs com coletivas distribuídas via NCCL, sem perder as otimizações de inferência. O suporte é informado como disponível a partir do TensorRT 11.0, e a integração aparece no Dynamo-Triton 26.07, antes chamado Triton Inference Server.

No exemplo, uma instância do Dynamo-Triton assume várias GPUs, cria os contextos de execução e os comunicadores necessários e dispara os ranks juntos a cada requisição. A aplicação chama um único modelo por um endpoint gRPC, em vez de coordenar cada GPU diretamente.
A demonstração usa o Cosmos 3 Nano, um modelo de geração de vídeo. Com oito GPUs em paralelismo de contexto, a latência de ponta a ponta caiu de 156,595 segundos para 34,183 segundos, e as chamadas ao transformador ficaram 6,09 vezes mais rápidas. O teste manteve a mesma configuração de saída: 1.280×720, 189 quadros a 24 FPS e 35 passos de denoising.
A validação comparou as saídas com a execução em uma única GPU. As versões com duas, quatro e oito GPUs passaram nos limites de MAE de até 25 e PSNR de pelo menos 18 dB. A NVIDIA também informa que o teste não mede vazão com várias requisições, custo por vídeo ou custo total de propriedade.