Pular para o conteúdo
← Todas as notícias

AWS publica benchmarks no SageMaker AI e compara G7, G6 e G5 em inferência de LLMs

A empresa testou dois modelos MoE de 30 bilhões no SageMaker AI e diz que as instâncias G7 tiveram melhor relação preço-desempenho nos cenários avaliados.

A AWS publicou um texto com benchmarks de inferência de LLMs no Amazon SageMaker AI, comparando instâncias das famílias G5, G6, G6e e G7. O material usa dois modelos Mixture-of-Experts de 30 bilhões de parâmetros — Qwen3-Coder-30B e NVIDIA Nemotron-3-Nano-30B — para medir throughput, latência e custo por token em configurações diferentes.

AWS publica benchmarks no SageMaker AI e compara G7, G6 e G5 em inferência de LLMs

No cenário com Qwen3-Coder-30B, a comparação foi feita entre ml.g5.12xlarge, ml.g6.12xlarge e ml.g7.12xlarge usando o container DJL Large Model Inference 28.0. Com uma carga sintética de 100 requisições e concorrência de quatro, a ml.g7.12xlarge chegou a 391,3 tokens de saída por segundo, acima da G6 e da G5. A AWS também informa que a G7 reduziu a latência média e a latência no percentil 99 nesses testes, além de registrar 118 ms para o tempo mediano até o primeiro token e 8,9 ms de latência entre tokens no modo de streaming.

No outro caso, com NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 e vLLM, o recurso Amazon SageMaker AI Generative AI Inference Recommendations avaliou configurações candidatas e retornou recomendações com base nas métricas medidas. Para a carga de 512 tokens de entrada e 256 de saída, a g7.48xlarge teve o maior throughput, enquanto a g7.2xlarge teve o menor custo estimado por milhão de tokens de saída, de US$ 0,90.

A AWS diz ainda que os resultados são específicos para os modelos, cargas e configurações testados. O texto observa que as instâncias G7 só têm suporte nativo a FP4 e estão disponíveis apenas nas regiões US East (Ohio) e US West (Oregon).

← Todas as notícias