A NVIDIA publicou um artigo técnico sobre o NVLink 6, a interconexão usada na plataforma Vera Rubin para ligar as GPUs Rubin. O texto apresenta a rede como parte de uma arquitetura voltada a manter clusters de IA em operação contínua, mesmo quando surgem erros de sinal, degradação de links ou falhas de nós em instalações grandes.

A proteção começa na camada física, onde o NVLink combina correção de erros no hardware com retransmissão no próprio nível físico. Quando a degradação é mais séria, o mecanismo UPHY recalibra parâmetros enquanto os dados ficam guardados em buffer, para evitar perda de informação.
Na camada de enlace, o controle baseado em créditos só permite enviar dados quando o próximo salto tem espaço disponível. Segundo a NVIDIA, isso evita descartes de pacotes por projeto e reduz problemas comuns em alternativas baseadas em Ethernet, como bloqueios e acúmulo de tráfego.
No software, o destaque é o Shadow Engine Recovery, do NVIDIA Dynamo. Ele mantém uma réplica pronta do motor de inferência e, se o processo principal falhar, assume a tarefa sem precisar reconstruir toda a configuração. Em GPUs B200, a NVIDIA diz que o tempo de recuperação caiu de 283 segundos para 7,3 segundos.
O material também menciona apoio a checkpointing com CRIU e uma versão protótipo do NCCL com cuda-checkpoint, com disponibilidade geral esperada até o fim do ano, para acelerar reinícios de motores de inferência.