Pular para o conteúdo
← Todas as notícias

NVIDIA detalha como o NVLink 6 tenta reduzir falhas em clusters de IA

Artigo técnico descreve resiliência em camadas do NVLink 6, com correção de erros, controle de fluxo por créditos e recuperação em software para treinamento e inferência em grande escala.

A NVIDIA publicou um artigo técnico sobre o NVLink 6, a interconexão usada na plataforma Vera Rubin para ligar as GPUs Rubin. O texto apresenta a rede como parte de uma arquitetura voltada a manter clusters de IA em operação contínua, mesmo quando surgem erros de sinal, degradação de links ou falhas de nós em instalações grandes.

NVIDIA detalha como o NVLink 6 tenta reduzir falhas em clusters de IA

A proteção começa na camada física, onde o NVLink combina correção de erros no hardware com retransmissão no próprio nível físico. Quando a degradação é mais séria, o mecanismo UPHY recalibra parâmetros enquanto os dados ficam guardados em buffer, para evitar perda de informação.

Na camada de enlace, o controle baseado em créditos só permite enviar dados quando o próximo salto tem espaço disponível. Segundo a NVIDIA, isso evita descartes de pacotes por projeto e reduz problemas comuns em alternativas baseadas em Ethernet, como bloqueios e acúmulo de tráfego.

No software, o destaque é o Shadow Engine Recovery, do NVIDIA Dynamo. Ele mantém uma réplica pronta do motor de inferência e, se o processo principal falhar, assume a tarefa sem precisar reconstruir toda a configuração. Em GPUs B200, a NVIDIA diz que o tempo de recuperação caiu de 283 segundos para 7,3 segundos.

O material também menciona apoio a checkpointing com CRIU e uma versão protótipo do NCCL com cuda-checkpoint, com disponibilidade geral esperada até o fim do ano, para acelerar reinícios de motores de inferência.

← Todas as notícias