A AWS publicou um guia mostrando como executar o SkyRL, framework de aprendizado por reforço de código aberto, no Amazon SageMaker HyperPod. O passo a passo usa o modelo de visão e linguagem Qwen3-VL-8B e o método GRPO para pós-treiná-lo em uma tarefa de navegação por labirintos visuais.

No exemplo, o modelo parte de um checkpoint de fine-tuning supervisionado no ambiente VisGym, onde precisa escolher movimentos a partir de imagens do labirinto. O texto explica que o GRPO gera várias tentativas para cada posição inicial e compara os resultados entre si, reforçando as melhores sequências sem usar um modelo crítico separado.
A configuração descrita usa três nós com GPU e um nó de CPU no papel de coordenação, além de armazenamento compartilhado Amazon FSx for Lustre. O artigo também mostra como o SkyRL divide geração de trajetórias e atualização do modelo entre os mesmos GPUs, com pesos LoRA sincronizados pelo armazenamento compartilhado após cada etapa de otimização.
Segundo a AWS, o guia inclui a criação do cluster no SageMaker Studio, o envio do trabalho com o endereço sagemaker_ray:// e o acompanhamento no Ray Dashboard e no Amazon Managed Grafana. O post cita ainda um resultado do experimento: a taxa de sucesso passou de 43,75% para mais de 95% em uma avaliação fixa com 64 labirintos.