Imagine pedir para um sistema de busca encontrar "sofá verde com pés de madeira e almofadas arredondadas". Um modelo tradicional de IA comprime toda essa descrição em um único resumo numérico — e nessa compressão, detalhes como o tipo de pé ou o formato da almofada podem se misturar e se perder. O resultado? Um sofá verde, mas com pés errados, aparece como resposta.

Uma nova abordagem, chamada de modelo multi-vetor (ou interação tardia), resolve esse problema de um jeito simples: em vez de resumir tudo em um único vetor (um conjunto de números que representa o texto), ela mantém um vetor para cada palavra do documento. Na hora da busca, cada termo da sua pergunta é comparado individualmente com todas as palavras do texto, encontrando a melhor correspondência para cada um. Isso permite que a IA entenda que "pés de madeira" e "almofadas arredondadas" são exigências separadas, e não uma sopa de informações.
A técnica não é nova — foi proposta no artigo acadêmico ColBERT — mas agora está disponível de forma prática para qualquer desenvolvedor. A empresa LightOn criou uma ferramenta chamada PyLate que integra esses modelos ao ecossistema Sentence Transformers, e a versão mais recente já vem com suporte nativo. O ganho é maior em consultas com múltiplos requisitos, documentos longos ou buscas em áreas diferentes daquelas em que o modelo foi treinado. Por exemplo, em um teste com documentos em vários idiomas, o modelo multi-vetor teve desempenho 50% superior ao modelo tradicional.
O preço a pagar é o tamanho do índice de busca: em vez de guardar um vetor por documento, é preciso guardar um vetor por palavra — o que pode multiplicar o armazenamento por 40 vezes. Mas técnicas de compressão reduzem esse custo para perto do que já se usa hoje com modelos densos. Para o usuário final, a diferença é sutil: as buscas continuam rápidas, mas os resultados tendem a ser mais precisos, especialmente quando o que importa é um detalhe específico, como um código de produto ou um nome próprio. Para quem desenvolve sistemas de busca, porém, a troca entre qualidade e armazenamento é a principal decisão.