A AWS publicou um guia sobre como montar uma fábrica de modelos de IA Física com NVIDIA Cosmos 3 no Amazon SageMaker HyperPod. O texto parte de um caso de uso comum a robôs e veículos autônomos: transformar dados do mundo real em ações físicas, sem tratar isso como um único treinamento.

A proposta é manter um pipeline contínuo com três etapas principais: gerar dados sintéticos, fazer o pós-treinamento dos modelos de percepção e de política, e avaliar o resultado em simulação de loop fechado. O Cosmos 3 entra como a base desse fluxo porque usa a mesma família de modelos para gerar, treinar e avaliar, em vez de exigir estruturas separadas para cada fase.
O guia também destaca a métrica de GPU goodput, definida como o progresso útil do pipeline por hora de GPU reservada. A ideia é evitar a troca constante de infraestrutura entre etapas e manter as GPUs em um conjunto persistente e resiliente, algo que o SageMaker HyperPod sobre Amazon EKS foi desenhado para fornecer.
Como referência, a AWS usa instâncias p5en.48xlarge, com 8 GPUs NVIDIA H200, e informa que o repositório awsome-distributed-ai no GitHub reúne os manifestos, as configurações e o código executável do exemplo.