Pular para o conteúdo
← Todas as notícias

AWS compara custo real de modelos OpenAI no Bedrock, além do preço por token

Um guia da AWS detalha um benchmark de código aberto que mede custo por resposta correta, trajetória de agentes e qualidade de entregas em cinco modelos OpenAI.

A AWS detalha um benchmark de código aberto para comparar modelos OpenAI no Amazon Bedrock pelo custo do resultado, e não só pelo preço por milhão de tokens. O repositório openai-on-aws/benchmarks-openai testa gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol no Bedrock, além de gpt-5.4-mini e gpt-5.4-nano na API da OpenAI, usados como referências mais baratas.

AWS compara custo real de modelos OpenAI no Bedrock, além do preço por token

O teste mede três frentes: acerto e custo em AIME, GPQA Diamond e MMLU-Pro; trajetórias de agentes em tarefas reais de pesquisa na web; e qualidade de entregas profissionais avaliadas por rubrica. Nos modelos do Bedrock, o raciocínio foi desativado; nas referências da OpenAI, foram mantidas as configurações padrão. A própria AWS diz que isso compara configurações de uso, não capacidade intrínseca dos modelos.

Nos testes de agente com 50 perguntas do DeepSearchQA, o gpt-5.4-mini fez em média 7,6 etapas por questão e acumulou 114 mil tokens de entrada por pergunta, ante 50 mil no terra. O custo por resposta aprovada foi de US$ 0,40 para o mini e US$ 0,31 para o terra; o luna ficou em US$ 0,05 por resposta aprovada.

Em 48 tarefas do GDPval, o luna passou em 27, contra 20 do mini, com custo de US$ 0,010 por entrega aprovada, ante US$ 0,030 do mini. A AWS ressalta que as amostras são pequenas e que os números devem ser lidos como indicativos. O material também registra uma medição de julho de 2026: no Bedrock, o luna teve tempo até o primeiro token 21% menor, mas a empresa trata isso como um retrato daquele teste, não como garantia.

← Todas as notícias