Pular para o conteúdo
← Todas as notícias

AWS detalha EKS, EFA e DeepEP para escalar RL em modelos MoE

Post da AWS mostra uma arquitetura com EKS, EFA, S3 e DeepEP para pós-treinamento de modelos MoE, e cita ganho de 40% na vazão de rollout em um teste com 48 instâncias P5en.

A AWS publicou um guia sobre uma arquitetura que combina Amazon Elastic Kubernetes Service (EKS), Elastic Fabric Adapter (EFA), Amazon S3 e DeepEP para escalar o pós-treinamento de modelos Mixture-of-Experts (MoE) com reinforcement learning. O texto foca em RLHF e GRPO, onde a geração de experiências e o treino da política precisam avançar ao mesmo tempo sem travar um ao outro.

AWS detalha EKS, EFA e DeepEP para escalar RL em modelos MoE

Segundo a AWS, esse tipo de carga divide o sistema em tarefas com exigências diferentes: geração de rollout, treino da política e comunicação entre aceleradores. Em modelos MoE, o ponto de pressão passa a ser menos o cálculo e mais a troca de dados, porque o Expert Parallelism faz tokens circularem dinamicamente entre dispositivos.

A arquitetura proposta usa o EKS para separar grupos de nós para geração, inferência e treino, com instâncias GPU para as etapas principais, CPU para ambientes e pré-processamento, e nós com mais memória para buffers e caches de checkpoints. O S3 entra como armazenamento durável para conjuntos de dados, checkpoints e artefatos finais.

No tráfego entre GPUs, o DeepEP substitui coletivas genéricas por kernels específicos de envio e combinação de tokens, usando NVLink dentro da máquina e EFA entre máquinas. Em um teste com 48 instâncias P5en, sendo 16 para treino e 32 para inferência, a AWS diz que o uso do DeepEP sobre EFA elevou em 40% a vazão agregada de rollout.

← Todas as notícias