•cerebras.ai•
0 visualizações
AMD e Cerebras unem forças em inferência de IA ultrarrápida
Parceria técnica combina os servidores AMD Helios com o chip Wafer-Scale Engine da Cerebras para acelerar a geração de tokens em aplicações de IA, prometendo até 5x mais eficiência energética.

A AMD e a Cerebras Systems anunciaram uma parceria técnica para criar uma solução conjunta de inferência de IA com latência ultrabaixa. O anúncio foi feito durante o evento Advancing AI 2026, em São Francisco e Sunnyvale, Califórnia. A solução integra os racks AMD Helios com o Wafer-Scale Engine (WSE) da Cerebras em um único fluxo de trabalho, combinando alto throughput com geração rápida de tokens.
A proposta é atender a demandas cada vez mais distintas dentro da inferência de IA. Enquanto cargas de trabalho de alto volume priorizam a maximização da geração de tokens, aplicações como codificação, copilotos em tempo real, agentes autônomos e fluxos agentivos exigem respostas quase instantâneas. A solução adota uma abordagem de inferência desagregada: o AMD Helios processa prompts e contextos longos com alta vazão, enquanto o Cerebras WSE acelera a etapa de geração de tokens, que é intensiva em largura de banda de memória. Segundo as empresas, a combinação pode entregar até 5x mais tokens por segundo por watt (T/s/W).
A geração rápida de tokens se torna cada vez mais crítica à medida que a IA avança para áreas como desenvolvimento de software, robótica, descoberta científica e agentes autônomos, onde o tempo de resposta impacta diretamente a experiência do usuário e a utilidade do sistema. A AMD fornece a base para cargas de trabalho de inferência de alto throughput e balanceadas em datacenters, enquanto a Cerebras contribui com a capacidade de decodificação e latência ultrabaixa. A Cerebras planeja implantar sistemas AMD Helios em seus próprios datacenters, e a solução conjunta deve ficar disponível inicialmente via Cerebras Cloud no segundo semestre de 2026.
A parceria reflete a tendência do setor de buscar infraestrutura heterogênea, capaz de combinar diferentes tecnologias de computação para atender requisitos específicos de cada carga de trabalho. Em vez de uma abordagem única, a solução AMD-Cerebras otimiza separadamente as duas principais etapas da inferência, o que pode representar um diferencial competitivo em um mercado onde latência e eficiência energética são fatores cada vez mais decisivos.