stamatios
← Voltar ao feed
Cronômetro preso a câmera de vídeo com foguete cruzando linha de chegada, modelo H3 Max da fal
IA & Modelos

fal lança H3 Max, versão do MiniMax-H3 focada em velocidade máxima

resumo de ~3 min

O que é o H3 Max

A fal anunciou o H3 Max, uma versão pós-treinada do modelo de vídeo de pesos abertos MiniMax H3. Desenvolvido pela equipe de pesquisa da fal e otimizado por seu time de inferência, o modelo foi concebido para combinar qualidade visual, compreensão de prompts e velocidade de geração. Segundo avaliações de preferência humana da empresa, o H3 Max ficou em primeiro lugar nas três dimensões analisadas, diante de 12 modelos de vídeo, incluindo o endpoint oficial do MiniMax H3, Gemini Omni Flash, Wan 3.0, Seedance 2.5, Kling 3 e Veo 3.1.

A fal afirma que o H3 Max gera um vídeo de cinco segundos em aproximadamente três segundos. Esse desempenho equivaleria a cerca de 35 vezes o throughput do endpoint oficial do MiniMax H3 e, em média, a uma velocidade 15 vezes maior que a de modelos de qualidade comparável. A empresa apresenta o resultado como um questionamento ao trade-off comum em vídeo generativo, no qual maior qualidade costuma exigir inferência mais lenta.

Pós-treinamento e engenharia de inferência

A equipe começou com o MiniMax H3 e acrescentou dados substanciais durante o pós-treinamento, priorizando adesão aos prompts e qualidade visual. A fal diz ter preservado as capacidades centrais do modelo original ao reduzir significativamente a latência. Durante o processo, diferentes versões foram avaliadas continuamente em comparações diretas, com as dimensões de qualidade geral, compreensão do prompt e estética analisadas separadamente.

O desenvolvimento combinou pesquisa de modelos e otimização de sistemas. A equipe de inferência, que trabalha há quatro anos com cargas de difusão e mídia generativa, participou da arquitetura de execução enquanto o modelo ainda era desenvolvido. O H3 Max foi treinado e servido inteiramente em sistemas NVIDIA GB200 NVL72; segundo a fal, esses aceleradores oferecem até o dobro do desempenho por chip em relação à geração anterior usada pela empresa.

A otimização não se limitou a reduzir precisão, eliminar etapas de amostragem ou aproximar operações custosas. A fal afirma que cada mudança só era mantida quando o modelo preservava sua posição nas avaliações internas de qualidade. O objetivo, portanto, era aumentar o throughput sem perder os ganhos obtidos no pós-treinamento.

Evidências e disponibilidade

Como métricas automáticas capturam apenas parte da qualidade de um vídeo, a avaliação principal usou preferências humanas em comparações par a par. Os resultados foram agregados por classificações Bayesian Elo com intervalos de confiança de 95%. A fal afirma que o H3 Max ficou em primeiro lugar nas três dimensões e venceu a maioria dos confrontos contra todos os modelos testados, inclusive o MiniMax H3 original.

A empresa também cita resultados independentes da Artificial Analysis e da Design Arena, nos quais o H3 Max teria ficado em primeiro lugar. A Design Arena registrou qualidade equivalente à do MiniMax H3 com velocidade superior a 50 vezes, segundo seu benchmark.

O modelo está disponível na fal pelo Playground, pelo fal Agent e por API, para geração de texto para vídeo e de imagem para vídeo. Na primeira semana, a empresa oferece desconto de 50%. A conclusão apresentada pela fal é que, em aplicações de produção, o critério relevante não é apenas vencer um benchmark, mas equilibrar qualidade, latência e custo.