Todas as notícias
Amazon2 min de leitura

AWS cria cache em rede que acelera respostas de IAs e reduz custos

Nova arquitetura da AWS permite que modelos de IA compartilhem um cache distribuído entre servidores, reduzindo tempo de resposta e permitindo uso de máquinas mais baratas.

AWS cria cache em rede que acelera respostas de IAs e reduz custos

A Amazon Web Services (AWS) anunciou uma forma mais eficiente de rodar grandes modelos de inteligência artificial. O problema é que, quando um usuário faz uma pergunta, o modelo precisa recalcular tudo de novo, mesmo que já tenha respondido algo parecido antes. Isso gasta memória cara e deixa a resposta mais lenta. A nova solução cria um cache compartilhado entre vários servidores, guardando resultados já calculados para reutilizá-los rapidamente.

Na prática, o sistema divide a memória em três níveis. O primeiro fica na placa de vídeo (GPU), o mais rápido. O segundo, na memória RAM do computador. O terceiro é um disco NVMe (um tipo de SSD muito veloz) compartilhado entre todas as máquinas. Quando uma pergunta chega, o sistema busca a resposta já calculada nesse cache, em vez de refazer o trabalho. Se outro servidor já tiver processado uma pergunta parecida, o resultado é reaproveitado. Isso é possível graças a um software chamado Curvine, que organiza esses discos como se fossem uma única pasta acessível por todos.

Essa novidade é importante porque empresas que oferecem chatbots, assistentes virtuais ou sistemas de busca baseados em IA gastam muito dinheiro com servidores potentes. Com o cache compartilhado, dá para usar máquinas mais baratas (como as G6e, com 48 GB de memória) em vez das caríssimas P5. Em testes, a AWS conseguiu reduzir em até 2,7 vezes o tempo para gerar a primeira palavra da resposta. O ganho aparece principalmente quando várias perguntas começam com o mesmo texto, como um prompt padrão de sistema.

Para quem usa IA no dia a dia, a mudança é invisível, mas traz benefícios: respostas mais rápidas em apps de conversa e custos menores para as empresas, o que pode baratear ou melhorar serviços gratuitos. Para o mercado, a novidade mostra que é possível rodar modelos grandes sem precisar de supercomputadores individuais, usando uma rede de máquinas mais modestas que trabalham juntas. A AWS já disponibiliza a arquitetura para clientes do SageMaker HyperPod.

De onde veio esta notícia

Texto em português produzido com apoio de inteligência artificial a partir da publicação original de Amazon. Os fatos, números e nomes são os da fonte — se quiser conferir, o link abaixo leva ao original.

Ler a publicação original em Amazon