A ServiceNow CoreAI detalha o AutoSynthData em uma publicação no Hugging Face. A proposta é transformar falhas de um modelo-alvo em tarefas sintéticas de treinamento para agentes em ambientes empresariais, usando também um modelo mais forte para indicar o que ainda precisa ser aprendido.

O método parte de um diagnóstico no ambiente real do agente: se o modelo erra um fluxo de trabalho, combina mal ferramentas ou ignora uma restrição, essas falhas viram base para novas tarefas. O sistema cria um enunciado, um conjunto de regras do ambiente e um verificador para cada caso, mas só aceita o que for executável, plausível e útil para treinar o modelo naquele momento.
O AutoSynthData também valida as amostras antes de incorporá-las ao conjunto de treino. Ele executa a solução de referência, testa se respostas erradas realmente falham e usa um crítico para apontar problemas como estado incompatível, tarefa impossível ou verificador fraco. Além disso, revisa os lotes para evitar repetição excessiva e ampliar a cobertura dos tipos de tarefa.
No exemplo com o EnterpriseOps Gym, a ServiceNow diz ter gerado 2.000 amostras em cerca de 18 horas, usando Gemma-4-26B-A4B-it como modelo-alvo e Qwen3.8-27B como professor. No ajuste fino supervisionado, o melhor checkpoint foi o da época 5, com ganho de 7,2 pontos percentuais em Pass@1 e aumento da taxa de sucesso do verificador de 63,01% para 68,55%.