stamatios
← Voltar ao feed
Black Forest Labs lança FLUX 3 multimodal com áudio-vídeo
IA & Modelos · Open Source

Black Forest Labs lança FLUX 3 multimodal com áudio-vídeo

resumo de ~3 min

FLUX 3: modelo multimodal unificado

A Black Forest Labs lançou em 23 de julho de 2026 o FLUX 3, seu primeiro modelo de fundação multimodal que aprende conjuntamente a partir de imagens, vídeos e áudio em uma arquitetura unificada. A premissa central é que nenhuma modalidade isolada descreve completamente a realidade - cada uma é uma projeção do mesmo mundo subjacente, e as restrições mútuas entre elas (o som deve corresponder ao impacto, o movimento deve obedecer à massa) fornecem mais informação do que qualquer uma sozinha.

O modelo é construído sobre o Self-Flow, abordagem da empresa para alinhar geração e compreensão multimodal na mesma arquitetura, com escala significativamente maior de computação e dados.

Capacidades de vídeo

O FLUX 3 gera vídeos com áudio nativo de até 20 segundos em uma única geração. As capacidades incluem:

  • Texto-para-vídeo e imagem-para-vídeo (animação ou referência visual)
  • Vídeo-para-vídeo (transferindo elementos como personagens para novos contextos)
  • Continuação generativa de vídeo+áudio a partir de input
  • Geração a partir de keyframes para transições controladas
  • Diálogo multilíngue, ampla diversidade de estilos e aspect ratios
  • Encadeamento agêntico de clipes em sequências multi-shot de vários minutos

Avaliações preliminares

Em comparações iniciais (clips de 10 segundos em 720p com áudio), o FLUX 3 foi preferido em relação a concorrentes nas seguintes proporções:

  • 93% vs. Luma Ray 3.2
  • 77% vs. Runway Gen-4.5
  • 69% vs. Grok Imagine Video
  • 60% vs. Kling v3 Pro
  • 59% vs. Happy Horse v1
  • 52% vs. Seedance 2.0 e Gemini Omni Flash

A empresa ressalta que os resultados são preliminares e devem melhorar durante a fase de early access.

Imagem e ação

Para imagens, o FLUX 3 mostra melhoria significativa sobre versões anteriores em prompts complexos e geração de texto em múltiplos idiomas. O early access para FLUX 3 Image será aberto nas semanas seguintes.

No campo de ação (physical AI), a empresa integrou predição de ação nativa ao modelo e também usa o backbone de vídeo pré-treinado como fundação para modelos de ação especializados. A mimic robotics foi uma das primeiras parceiras, resultando no FLUX-mimic, um modelo vídeo-ação para manipulação robótica dexa. A Audi é citada como caso de teste em tarefas de produção real.

Plano de lançamento

O rollout será gradual, com early access antes de cada capacidade:

  1. FLUX 3 Video - geração e edição de vídeo/áudio via API e pesos privados
  2. FLUX-mimic e FLUX 3 Action - predição de ação via parceiros selecionados
  3. FLUX 3 Image - síntese e edição de imagens via API e pesos privados
  4. FLUX 3 Dev - acesso open-weight ao backbone multimodal para criação de conteúdo e predição de ação

A empresa afirma que já trabalha na próxima geração, com o objetivo de unificar predição perceptual, de ação e de linguagem no mesmo modelo.