A AWS publicou um guia sobre Retrieval Augmented Generation com LangChain e Amazon Bedrock Managed Knowledge Base, comparando a busca tradicional com a recuperação agêntica para perguntas que juntam várias intenções em uma só consulta.

No exemplo, a mesma pergunta passa pelos dois caminhos. A API Retrieve faz uma busca híbrida única e devolve trechos com pontuação. Já a API AgenticRetrieveStream entra em um ciclo de planejamento: separa a pergunta em subconsultas, executa cada uma e decide se precisa buscar de novo antes de fechar a resposta. O guia mostra os eventos de rastreamento para acompanhar esse processo.
A demonstração usa uma pergunta que compara dois produtos em três dimensões, o que equivale a seis intenções ao mesmo tempo. A busca com um único vetor tende a capturar apenas parte disso: com cinco resultados, duas intenções ficam de fora; com dez, todas aparecem, mas com repetição desnecessária. O ponto central do texto é esse limite estrutural, não uma equivalência entre os dois métodos.
O material também explica como o pacote langchain-aws expõe as duas opções e observa que a recuperação agêntica não é um retriever comum do LangChain. Para ver o plano, é preciso chamar agentic_retrieve_stream diretamente no cliente bedrock-agent-runtime, porque o atalho da biblioteca não mostra os eventos de rastreamento.
A AWS cita ainda sua avaliação no benchmark MuSiQue: houve melhora na recuperação de informação em perguntas mais difíceis, enquanto perguntas simples ganharam pouco. O guia ressalta que a busca única continua sendo a escolha mais barata para consultas de uma única intenção.