Pular para o conteúdo
← Todas as notícias

AWS detalha ajuste de agente de busca com reforço multiturno no SageMaker AI

Publicação mostra como o MTRL foi usado para treinar um Qwen3.6-27B em busca empresarial e relata ganhos de nDCG@10 e queda de falhas em um benchmark.

A Amazon Web Services publicou um guia sobre como usar o aprendizado por reforço multiturno (MTRL) no Amazon SageMaker AI para ajustar um agente de busca baseado em modelo de linguagem. O foco é ensinar o sistema a decidir o que pesquisar, qual ferramenta usar e quando parar, ao longo de várias rodadas de interação.

AWS detalha ajuste de agente de busca com reforço multiturno no SageMaker AI

O texto contrapõe esse método ao ajuste supervisionado, que depende de exemplos ideais de interação, e ao reforço de turno único, que avalia apenas uma resposta por vez. No MTRL, a recompensa acompanha a sequência inteira de ações e, neste caso, foi definida diretamente pela qualidade da recuperação medida por nDCG@10.

No exemplo descrito, a AWS treinou o modelo Qwen3.6-27B com duas ferramentas de busca e limitou o número de turnos para evitar respostas longas demais. Quando o agente alcançava o limite de turnos ou de tokens, recebia recompensa -1 para desencorajar esse tipo de falha. A publicação diz ainda que a configuração exigiu só três hiperparâmetros alterados; o restante ficou no padrão.

Segundo os resultados relatados, o modelo ajustado melhorou em três dos quatro benchmarks avaliados. O maior avanço foi no BrowseComp-Plus, com alta de 23,7% no nDCG@10, e o WixQA avançou 18,4%. Nesse mesmo BrowseComp-Plus, a taxa de falhas caiu de 22,89% para 0,68%.

← Todas as notícias