
Black Forest Labs lança FLUX 3 multimodal com áudio-vídeo
FLUX 3: modelo multimodal unificado
A Black Forest Labs lançou em 23 de julho de 2026 o FLUX 3, seu primeiro modelo de fundação multimodal que aprende conjuntamente a partir de imagens, vídeos e áudio em uma arquitetura unificada. A premissa central é que nenhuma modalidade isolada descreve completamente a realidade - cada uma é uma projeção do mesmo mundo subjacente, e as restrições mútuas entre elas (o som deve corresponder ao impacto, o movimento deve obedecer à massa) fornecem mais informação do que qualquer uma sozinha.
O modelo é construído sobre o Self-Flow, abordagem da empresa para alinhar geração e compreensão multimodal na mesma arquitetura, com escala significativamente maior de computação e dados.
Capacidades de vídeo
O FLUX 3 gera vídeos com áudio nativo de até 20 segundos em uma única geração. As capacidades incluem:
- Texto-para-vídeo e imagem-para-vídeo (animação ou referência visual)
- Vídeo-para-vídeo (transferindo elementos como personagens para novos contextos)
- Continuação generativa de vídeo+áudio a partir de input
- Geração a partir de keyframes para transições controladas
- Diálogo multilíngue, ampla diversidade de estilos e aspect ratios
- Encadeamento agêntico de clipes em sequências multi-shot de vários minutos
Avaliações preliminares
Em comparações iniciais (clips de 10 segundos em 720p com áudio), o FLUX 3 foi preferido em relação a concorrentes nas seguintes proporções:
- 93% vs. Luma Ray 3.2
- 77% vs. Runway Gen-4.5
- 69% vs. Grok Imagine Video
- 60% vs. Kling v3 Pro
- 59% vs. Happy Horse v1
- 52% vs. Seedance 2.0 e Gemini Omni Flash
A empresa ressalta que os resultados são preliminares e devem melhorar durante a fase de early access.
Imagem e ação
Para imagens, o FLUX 3 mostra melhoria significativa sobre versões anteriores em prompts complexos e geração de texto em múltiplos idiomas. O early access para FLUX 3 Image será aberto nas semanas seguintes.
No campo de ação (physical AI), a empresa integrou predição de ação nativa ao modelo e também usa o backbone de vídeo pré-treinado como fundação para modelos de ação especializados. A mimic robotics foi uma das primeiras parceiras, resultando no FLUX-mimic, um modelo vídeo-ação para manipulação robótica dexa. A Audi é citada como caso de teste em tarefas de produção real.
Plano de lançamento
O rollout será gradual, com early access antes de cada capacidade:
- FLUX 3 Video - geração e edição de vídeo/áudio via API e pesos privados
- FLUX-mimic e FLUX 3 Action - predição de ação via parceiros selecionados
- FLUX 3 Image - síntese e edição de imagens via API e pesos privados
- FLUX 3 Dev - acesso open-weight ao backbone multimodal para criação de conteúdo e predição de ação
A empresa afirma que já trabalha na próxima geração, com o objetivo de unificar predição perceptual, de ação e de linguagem no mesmo modelo.