A AWS publicou um guia sobre uma arquitetura que combina Amazon Elastic Kubernetes Service (EKS), Elastic Fabric Adapter (EFA), Amazon S3 e DeepEP para escalar o pós-treinamento de modelos Mixture-of-Experts (MoE) com reinforcement learning. O texto foca em RLHF e GRPO, onde a geração de experiências e o treino da política precisam avançar ao mesmo tempo sem travar um ao outro.

Segundo a AWS, esse tipo de carga divide o sistema em tarefas com exigências diferentes: geração de rollout, treino da política e comunicação entre aceleradores. Em modelos MoE, o ponto de pressão passa a ser menos o cálculo e mais a troca de dados, porque o Expert Parallelism faz tokens circularem dinamicamente entre dispositivos.
A arquitetura proposta usa o EKS para separar grupos de nós para geração, inferência e treino, com instâncias GPU para as etapas principais, CPU para ambientes e pré-processamento, e nós com mais memória para buffers e caches de checkpoints. O S3 entra como armazenamento durável para conjuntos de dados, checkpoints e artefatos finais.
No tráfego entre GPUs, o DeepEP substitui coletivas genéricas por kernels específicos de envio e combinação de tokens, usando NVLink dentro da máquina e EFA entre máquinas. Em um teste com 48 instâncias P5en, sendo 16 para treino e 32 para inferência, a AWS diz que o uso do DeepEP sobre EFA elevou em 40% a vazão agregada de rollout.