Todas as notícias
Nvidia2 min de leitura

NVIDIA lança versão compacta de modelo de IA que é 4 vezes mais rápida

Nova técnica reduz tamanho do Nemotron 3.5 Lightning de 66 GB para 22 GB sem perder qualidade, permitindo rodar IA avançada em hardware mais simples e barato.

NVIDIA lança versão compacta de modelo de IA que é 4 vezes mais rápida

A NVIDIA apresentou uma versão turbinada e mais enxuta de um de seus modelos de inteligência artificial, o Nemotron 3.5 Lightning. O novo checkpoint NVFP4 ocupa apenas 22 GB — um terço do tamanho original de 66 GB — e consegue processar informações até quatro vezes mais rápido. Tudo isso sem perder a precisão nas respostas.

O segredo está em uma técnica chamada destilação com quantização (QAD, na sigla em inglês). Basicamente, o modelo original (o "professor") ensina uma versão compactada (o "aluno") a imitar seu comportamento. Durante o treinamento, o aluno aprende a lidar com a perda de precisão causada pela compressão dos dados — os pesos do modelo foram reduzidos de 16 bits para apenas 4 bits. O resultado é um modelo que cabe em menos memória e roda mais rápido, mas ainda entrega respostas de alta qualidade.

Essa inovação é importante porque modelos de IA gigantescos são caros para rodar — exigem servidores potentes e consomem muita energia. Com versões menores e igualmente competentes, empresas e desenvolvedores podem usar inteligência artificial avançada em hardware mais acessível, como um único servidor com poucas GPUs. A NVIDIA já disponibilizou o código e as receitas para que outros times reproduzam o processo em seus próprios modelos.

Para quem usa IA no dia a dia, a novidade significa que ferramentas baseadas em modelos como o Nemotron podem se tornar mais rápidas e baratas. Um chatbot ou assistente que antes demorava segundos para responder pode agora fazê-lo em fração do tempo, sem perder a qualidade das respostas. Para o mercado, a técnica abre caminho para que mais empresas adotem IA generativa sem precisar investir em infraestrutura pesada.

De onde veio esta notícia

Texto em português produzido com apoio de inteligência artificial a partir da publicação original de Nvidia. Os fatos, números e nomes são os da fonte — se quiser conferir, o link abaixo leva ao original.

Ler a publicação original em Nvidia