Todas as notícias
Amazon2 min de leitura

Amazon reduz custo de IA com filtro inteligente de informações

Nova técnica da Amazon corta em até 36% o gasto com sistemas que combinam busca e geração de texto, sem perder qualidade nas respostas.

Amazon reduz custo de IA com filtro inteligente de informações

A Amazon anunciou uma técnica para reduzir o custo de sistemas de inteligência artificial que combinam busca de informações com geração de texto, conhecidos como RAG (sigla em inglês para Geração Aumentada por Recuperação). A novidade usa um modelo de IA mais simples e barato para filtrar os dados antes de enviá-los ao modelo principal, que produz a resposta final. O resultado é uma economia de até 36% no custo por consulta, sem comprometer a qualidade.

Sistemas RAG funcionam em duas etapas: primeiro, um mecanismo de busca localiza trechos relevantes em uma base de documentos; depois, um modelo de IA grande e potente usa esses trechos para gerar uma resposta. O problema é que, quanto mais trechos são enviados ao modelo grande, mais caro fica o processo. A solução da Amazon insere um passo intermediário: um modelo menor e mais barato (como o Claude Haiku, da Anthropic) examina os trechos encontrados e descarta aqueles que não são úteis para responder à pergunta do usuário. O modelo grande só recebe o material filtrado, o que reduz o volume de dados processados e, consequentemente, o custo.

A técnica, chamada de compressão sensível à consulta, foi testada pela Amazon em um conjunto de documentos e perguntas. Os resultados mostraram uma redução de 33% no custo com a compressão simples, e de 36% quando combinada com uma ferramenta de reordenamento (que classifica os trechos por relevância). Além da economia, o filtro também diminuiu a taxa de alucinações — respostas que inventam informações — de 51% para 38% no melhor cenário. A desvantagem é um pequeno aumento no tempo de resposta, já que uma etapa extra é adicionada ao processo.

Para empresas que usam IA para responder perguntas com base em manuais, contratos ou bases técnicas, a novidade pode representar uma economia significativa na conta de computação em nuvem. A Amazon recomenda o uso da técnica em situações onde a busca retorna muitos trechos e a pergunta é específica. Para quem usa chatbots de conversação rápida, com poucos trechos recuperados, o ganho pode não compensar o atraso extra. A funcionalidade está disponível no Amazon Bedrock, plataforma de IA da empresa, e pode ser testada com um ajuste simples nas configurações.

De onde veio esta notícia

Texto em português produzido com apoio de inteligência artificial a partir da publicação original de Amazon. Os fatos, números e nomes são os da fonte — se quiser conferir, o link abaixo leva ao original.

Ler a publicação original em Amazon