A AWS publicou um guia para implantar o Qwen3.8-2.4T-A95B no Amazon SageMaker HyperPod usando vLLM. O modelo, da equipe Qwen da Alibaba, foi lançado em 12 de agosto de 2026 como a primeira versão de classe Qwen-Max disponibilizada em pesos abertos.

Segundo a postagem, o Qwen3.8-2.4T-A95B tem 2,4 trilhões de parâmetros no total, com 95 bilhões ativados por token, e suporta contexto nativo de até 262 mil tokens, extensível a 1 milhão. A AWS aponta que a combinação de atenção híbrida e quantização NVFP4 permite rodá-lo em uma instância ml.p6-b300.48xlarge, com 8 GPUs NVIDIA B300 Blackwell Ultra.
O guia vai do provisionamento do cluster até a criação de um endpoint compatível com a API da OpenAI. Também mostra como habilitar raciocínio pelo parâmetro reasoning_effort, chamada de ferramentas e decodificação especulativa com MTP. Para ambientes desse porte, a própria AWS recomenda usar reserva de capacidade via Flexible Training Plans, já que a ml.p6-b300.48xlarge não está disponível sob demanda.
A publicação traz ainda resultados de teste em uma única instância p6-b300, com 512 requisições de 1.024 tokens de entrada e 1.024 de saída, a 32 tarefas concorrentes. Nessa comparação, a combinação de Expert Parallelism e MTP ficou com o melhor perfil de latência e vazão em relação ao uso apenas de TP.