O Ai2 detalha o AstaBrief 8B, um modelo de 8 bilhões de parâmetros voltado a transformar uma pergunta de pesquisa e trechos recuperados da literatura em um relatório científico com citações. O texto não apresenta apenas o modelo: também explica como ele foi treinado e por que a equipe quis torná-lo mais rápido para uso em pesquisas científicas.

Segundo a postagem, o AstaBrief já aparece no recurso “Generate a report” da plataforma Asta, como a opção Fast ao lado do modo Thinking, baseado em Claude. A equipe diz ter partido do Qwen3-8B e usado ajuste fino supervisionado e otimização direta de preferência, em vez de aprendizado por reforço, para reduzir custo e simplificar o processo.
A maior parte do trabalho foi dedicada aos dados. O Ai2 usou consultas reais enviadas por pesquisadores, filtrou as amostras e gerou exemplos de treinamento com apoio de modelos como Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1, DeepSeek-V3 e DeepSeek-R1. Na etapa de preferência, dois modelos julgadores, GPT-4.1 e DeepSeek-R1, compararam pares de respostas e só os casos em que ambos concordaram foram mantidos.
O post afirma que o modo Fast leva em média 51,1 segundos por relatório, ante 178,5 segundos no modo Thinking, uma diferença de 3,5 vezes. O Ai2 também vai liberar os pesos, os dados de treinamento e um exemplo de fluxo para que instituições possam rodar o modelo localmente, algo útil quando as perguntas envolvem trabalho sensível ou ainda não publicado.