A AWS publicou um guia com um teste de treinamento de IA em que o cálculo roda em uma região da nuvem e os dados ficam em outra. A configuração combina Amazon SageMaker HyperPod, Cloud Native Qumulo (CNQ) e Cloud Data Fabric (CDF) para ler o mesmo conjunto de dados sem copiá-lo entre regiões.

No experimento, a AWS executou o mesmo treinamento de um modelo LLaMA v3 de 1,02 bilhão de parâmetros em dois clusters com duas instâncias ml.p5.48xlarge cada, somando 16 GPUs H100. O cluster em US East (Ohio) ficou próximo aos dados; o cluster em US West (Oregon) acessou o conjunto remotamente, com 60 ms de latência de rede.
Nos primeiros 100 a 150 lotes, o desempenho do cluster remoto ficou 15% a 20% abaixo durante o aquecimento do NeuralCache, que antecipa os blocos de 4 KB que o treinamento vai pedir. Depois disso, o texto diz que ele convergiu para o nível do cluster local. Em execuções seguintes, com o cache já aquecido, 94% a 96% das leituras vieram do armazenamento local em menos de 5 ms, e a utilização das GPUs passou de 99%.
A publicação também descreve a arquitetura com um hub CNQ na região dos dados e um spoke CNQ na região do treino, ligados por VPC peering. Segundo o texto, o CDF projeta um único conjunto de dados para o spoke sem replicação completa, e a validação cobre esse cenário, não uma regra geral para qualquer carga de trabalho.