Pular para o conteúdo
← Todas as notícias

SWE-Serve mostra que patches de agentes de IA podem passar em testes e falhar no servidor real

Criado com ajuda da equipe do SGLang, o benchmark compara a aprovação em verificações comuns e em testes com servidor ativo, onde a taxa cai de 69,4% para 45,9%.

A NVIDIA detalha o SWE-Serve, um benchmark para medir a diferença entre passar em testes locais e funcionar quando o sistema realmente carrega um modelo e responde por sua interface pública. O trabalho foi feito com contribuição da equipe do SGLang, sistema de código aberto para servir grandes modelos de linguagem.

SWE-Serve mostra que patches de agentes de IA podem passar em testes e falhar no servidor real

O conjunto reúne 53 tarefas extraídas de 83 pull requests já mesclados no SGLang, cobrindo seis famílias de engenharia de inferência. Cada tarefa começa com uma cópia do repositório antes da mudança-alvo e pede que o agente implemente o ajuste sem comparar sua saída com a implementação de referência. A solução de referência mediana altera 553 linhas em sete arquivos.

O ponto central é a verificação com servidor ativo. Nas 19 tarefas que exigem carregar o modelo e testar a mudança pela interface de serviço, os mesmos 627 patches passaram 45,9% das vezes com o verificador completo. Quando esses testes são retirados, a taxa sobe para 69,4%, e 147 patches deixam de falhar.

Um exemplo é a tarefa do Gemma 4 MoE: 16 das 33 submissões passaram em todos os demais testes, mas falharam em pelo menos um teste com o serviço em execução. A própria NVIDIA ressalta que um resultado positivo no SWE-Serve não significa que o patch esteja pronto para produção nem que seja endossado pelos mantenedores do SGLang.

← Todas as notícias