A NVIDIA detalha o Cluster Readiness Engine (NVCRE), um controlador open source para Kubernetes que verifica se um cluster de GPUs está pronto para rodar cargas reais de IA. Em vez de confiar só em exames de saúde, ele executa testes distribuídos, mede o comportamento e aponta quais nós falharam em cada etapa.

A proposta é cobrir um problema que aparece justamente quando o cluster parece saudável: um treinamento com 512 GPUs pode ficar lento ou falhar por causa de uma GPU degradada, de um enlace de rede ruim ou de uma configuração que desvia tráfego por um caminho mais lento. A fonte diz que o NVCRE ajuda a encurtar essa investigação, porque identifica os nós envolvidos antes da produção.
O projeto organiza a validação em três camadas da API. Uma certificação cria um workflow por categoria, e cada workflow gera o seu trabalho. O resultado volta com o nó que falhou e o motivo, além de agrupar os testes por categoria.
O catálogo embutido cobre cinco variantes de NCCL, o conjunto de diagnósticos DCGM nível 4 e pré-treinamento com modelos Nemotron 5 de 8B e 56B parâmetros. Para falhas difíceis de isolar, o modo diagnose divide o grupo, repete o teste nas metades e continua até chegar ao tamanho mínimo, marcando os grupos ainda problemáticos como suspeitos.
A fonte também informa que o NVCRE exige Kubernetes 1.29 ou posterior, kubectl, Helm 3.x e NVIDIA GPU Operator no cluster-alvo.