A NVIDIA publicou um guia de implantação do Topograph, um kit de código aberto que descobre a topologia física de clusters de GPU e a converte para formatos que gerenciadores de tarefas conseguem ler, como rótulos do Kubernetes, configuração do Slurm e ConfigMaps do Slinky. A proposta é dar ao escalonador uma visão atual da rede para que ele prefira recursos mais próximos e evite tráfego desnecessário entre domínios distantes.

O texto explica que, em treinamento e inferência distribuídos, as GPUs trocam dados o tempo todo. Quando as tarefas ficam espalhadas por partes distantes do cluster, o tráfego cruza mais enlaces compartilhados e comutadores, o que aumenta contenção e latência. O Topograph lida com isso ao descobrir a topologia a partir de APIs de nuvem ou sistemas locais, normalizá-la em um modelo comum e publicá-la de novo sempre que o cluster muda.
O guia cita integrações já funcionais com Google Cloud, Lambda, Nebius, Nscale e OCI, além de uso local com InfiniBand por meio de ibnetdiscover ou com NetQ para Spectrum-X e domínios Multi-Node NVLink. Também mostra o uso com Kubernetes, Slurm e Slinky, incluindo suporte a KAI Scheduler, Kueue e Node Feature Discovery. A própria NVIDIA observa que o Topograph reflete a topologia reportada pelos sistemas, não a intenção do operador, e que a visibilidade de mudanças depende do provedor e dos eventos que o acionam.