Alibaba libera preview do Qwen4 com modelo que promete custo
A Alibaba disponibilizou o Qwen3.8-Flash-Next, uma prévia da arquitetura Qwen4 que combina dois tipos de memória para reduzir drasticamente o custo de processamento de textos longos.

A Alibaba, gigante chinesa de tecnologia, liberou os pesos de um novo modelo de inteligência artificial chamado Qwen3.8-Flash-Next. Ele é uma prévia do que virá com o Qwen4, a próxima geração da família de modelos da empresa. O modelo já está disponível para desenvolvedores testarem em seus próprios computadores ou em servidores da NVIDIA.
O grande diferencial do Qwen3.8-Flash-Next é como ele lida com textos muito longos, como documentos de centenas de páginas ou conversas extensas com um robô. Modelos comuns de IA têm um problema: quanto maior o texto, mais memória e poder de processamento eles consomem, o que encarece e torna o uso mais lento. A Alibaba resolveu isso com uma arquitetura híbrida — três quartos das camadas do modelo usam um mecanismo que comprime o histórico da conversa em um estado fixo, sem crescer conforme o texto aumenta. A cada quatro camadas, uma usa um sistema de atenção esparsa que só olha para os trechos mais relevantes do texto, em vez de ler tudo de novo.
Essa combinação, segundo a Alibaba, pode acelerar tarefas com 1 milhão de tokens (unidades de texto) em até 7,6 vezes na fase de preenchimento inicial e 4,9 vezes na geração de respostas, comparado a modelos tradicionais. Em testes simulando um servidor com muita reutilização de cache de contexto, o novo modelo foi 8,6 vezes mais rápido que a versão anterior da própria Alibaba. Tudo isso foi validado rodando em um supercomputador da NVIDIA com 72 GPUs Blackwell Ultra, capaz de trocar dados entre si a 130 TB/s — o que evita gargalos comuns quando o tráfego de informações precisa passar por redes convencionais.
Na prática, para um usuário comum, o impacto ainda é indireto. Esse modelo foi feito para aplicações de alto volume, como programação assistida por IA, processamento de documentos enormes e ferramentas que combinam várias ações. Quem desenvolve essas ferramentas poderá testar o Qwen3.8-Flash-Next em computadores potentes locais (como estações de trabalho com GPUs da NVIDIA) e depois escalar para o servidor gigante da NVIDIA quando for colocar em produção. O download dos pesos do modelo está disponível no Hugging Face e no ModelScope. Se a promessa de custo menor se confirmar, podemos ver aplicações de IA mais baratas e rápidas no futuro, mas por enquanto é coisa de desenvolvedor.
De onde veio esta notícia
Texto em português produzido com apoio de inteligência artificial a partir da publicação original de Nvidia. Os fatos, números e nomes são os da fonte — se quiser conferir, o link abaixo leva ao original.
Ler a publicação original em Nvidia