Voltar para notícias
bfl.ai
1 visualizações

FLUX 3: novo modelo multimodal integra imagem, vídeo e áudio

A Black Forest Labs lançou o FLUX 3, um modelo de fundação que aprende simultaneamente a partir de imagens, vídeos e áudio em uma arquitetura unificada. Em early access, o sistema já supera concorrentes em avaliações iniciais e promete avanços em criação de conteúdo e robótica.

FLUX 3: novo modelo multimodal integra imagem, vídeo e áudio
A Black Forest Labs apresentou o FLUX 3, seu mais novo modelo de fundação multimodal. Diferente de abordagens que tratam cada tipo de mídia separadamente, o FLUX 3 aprende de forma conjunta a partir de imagens, vídeos e áudio dentro de uma única arquitetura. A ideia central é que um modelo de inteligência artificial precisa construir uma representação do mundo real — como objetos se mantêm coesos, como as coisas se movem e como os eventos soam — e não apenas processar uma modalidade isolada. A abordagem se apoia no princípio de que nenhuma modalidade isolada oferece uma descrição completa do mundo. Imagens capturam estruturas espaciais em um instante; vídeos revelam dinâmicas temporais e leis físicas; áudio expõe relações causais entre fenômenos mecânicos e acústica que a visão sozinha não detecta. A linguagem, por sua vez, conecta essas percepções a objetivos e instruções. Ao aprender com todas essas fontes simultaneamente, as restrições mútuas entre elas — o som deve corresponder ao impacto, o movimento deve obedecer à massa — criam evidências mais robustas sobre a realidade subjacente. Em avaliações preliminares com vídeos de 10 segundos em 720p, o FLUX 3 foi preferido em 77% das comparações frente ao Runway Gen-4.5 e em 93% contra o Luma Ray 3.2. Também superou Grok Imagine Video em até 69% dos testes. O modelo é capaz de gerar vídeos com áudio de até 20 segundos em uma única passagem, com destaque para expressões faciais humanas, associação de sons a eventos físicos e su multilíngue. Além disso, é possível combinar cenas para criar sequências de vários minutos mantendo a consistência dos personagens. O FLUX 3 está disponível em early access para geração de vídeo. A versão para imagens será liberada nas próximas semanas. A Black Forest Labs também testa o modelo em robótica: em parceria com a startup mimic, desenvolveu o FLUX-mimic, um modelo de vídeo-ação para manipulação robótica, já sendo testado em tarefas reais na Audi. A empresa afirma que o FLUX 3 é apenas o primeiro passo para unificar percepção, ação e linguagem em um único sistema — um caminho que considera essencial para a inteligência artificial visual de mundo real.