Pular para o conteúdo
← Todas as notícias

AWS mostra como usar NVRx com PyTorch FSDP no Amazon EKS

Guia detalha checkpoint assíncrono e duas formas de retomada após falhas no treinamento distribuído, com resultados em H100 de 2 a 8 nós.

A AWS publicou um guia técnico que mostra como integrar a NVIDIA Resiliency Extension (NVRx) ao treinamento distribuído com PyTorch FSDP no Amazon EKS. A proposta é enfrentar duas fontes de perda de tempo: falhas em um dos workers e checkpoints síncronos, que podem bloquear toda a execução por uma parcela relevante do tempo em clusters grandes.

AWS mostra como usar NVRx com PyTorch FSDP no Amazon EKS

O NVRx é uma camada Python instalada via `pip` que adiciona recursos de tolerância a falhas sem exigir recompilação do PyTorch. O guia destaca três peças. No checkpoint assíncrono, a gravação do estado sai da linha principal de execução e continua em segundo plano, para que o treinamento avance enquanto o arquivo é salvo. Na retomada em processo, um wrapper tenta recuperar a execução após exceções ou travamentos detectados, sem encerrar o interpretador Python. Já o `ft_launcher` cobre falhas mais graves, como `SIGKILL` e falta de memória, acompanhando sinais de atividade e recriando os workers no mesmo job quando há timeout.

Os testes citados rodaram em instâncias p5.48xlarge, com 8 GPUs H100 por nó, de 2 a 8 nós, usando Amazon FSx for Lustre para armazenar checkpoints. Nos números do guia, o checkpoint assíncrono manteve eficiência acima de 99% em todas as escalas, enquanto o síncrono ficou entre 57% e 61%. Em uma frequência de checkpoint a cada 100 passos, o síncrono caiu para 14,7% e o assíncrono marcou 29,6%.

O material também ressalta que as três camadas de recuperação são independentes: a escolha depende do tipo de falha que a equipe quer cobrir, e o checkpoint assíncrono pode ser usado com ou sem uma camada de retomada.

← Todas as notícias