A AWS detalha um benchmark de código aberto para comparar modelos OpenAI no Amazon Bedrock pelo custo do resultado, e não só pelo preço por milhão de tokens. O repositório openai-on-aws/benchmarks-openai testa gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol no Bedrock, além de gpt-5.4-mini e gpt-5.4-nano na API da OpenAI, usados como referências mais baratas.

O teste mede três frentes: acerto e custo em AIME, GPQA Diamond e MMLU-Pro; trajetórias de agentes em tarefas reais de pesquisa na web; e qualidade de entregas profissionais avaliadas por rubrica. Nos modelos do Bedrock, o raciocínio foi desativado; nas referências da OpenAI, foram mantidas as configurações padrão. A própria AWS diz que isso compara configurações de uso, não capacidade intrínseca dos modelos.
Nos testes de agente com 50 perguntas do DeepSearchQA, o gpt-5.4-mini fez em média 7,6 etapas por questão e acumulou 114 mil tokens de entrada por pergunta, ante 50 mil no terra. O custo por resposta aprovada foi de US$ 0,40 para o mini e US$ 0,31 para o terra; o luna ficou em US$ 0,05 por resposta aprovada.
Em 48 tarefas do GDPval, o luna passou em 27, contra 20 do mini, com custo de US$ 0,010 por entrega aprovada, ante US$ 0,030 do mini. A AWS ressalta que as amostras são pequenas e que os números devem ser lidos como indicativos. O material também registra uma medição de julho de 2026: no Bedrock, o luna teve tempo até o primeiro token 21% menor, mas a empresa trata isso como um retrato daquele teste, não como garantia.