
EchoWM: modelo de mundo omnimodal aberto gera vídeo, som e fala
Um repositório, dois projetos independentes
O repositório JoyAI-Echo, publicado pela organização jd-opensource no GitHub, reúne dois projetos separados, cada um com seu próprio ambiente Python, checkpoints e ponto de entrada. Segundo a documentação, instalar um nunca afeta o outro, já que o módulo echo_wm traz cópias próprias das bibliotecas ltx-core e ltx-pipelines.
O Echo-LongVideo faz geração audiovisual de horizonte longo, com múltiplos planos e duração de até aproximadamente 5 minutos, sustentada por um banco de memória de áudio e vídeo pareado que carrega continuidade entre os trechos.
Já o EchoWM é descrito como um modelo de mundo omnimodal para mídia generativa: ele responde à navegação contínua enquanto vídeo, som ambiente, música e fala evoluem juntos.
Base técnica e roteiro de evolução
Hoje o EchoWM opera sobre o LTX-2.3. A variante Base usa o LTX-2.3 Base, um DiT audiovisual bidirecional que gera clipes de cerca de 10 segundos. Há também uma prévia pública da variante Causal (Flash Preview), com atenção chunk-causal, rollout apoiado em KV-cache e inferência em quatro passos. O roteiro anunciado prevê migrar Base e Causal para o LTX-2.5 - carregando os pesos oficiais, com Gemma 4 TE e VAE/DiT 2.5 - e depois reduzir o custo de rollouts longos com atenção esparsa e uma pilha de cache/runtime mais enxuta.
Entre as otimizações listadas estão SageAttention e kernels esparsos ou de baixa precisão nos ramos de vídeo, áudio e UCPE; FlashAttention e FlashInfer para janelas causais longas; KV-cache paginado, com rebase de RoPE e UCPE quando tokens são removidos; e compilação do forward do DiT em FP8/TensorRT para ganho de throughput.
Uso restrito a pesquisa
A licença deixa claro que o projeto é baseado no LTX-2, da Lightricks: porções do código original foram modificadas pela JD.com exclusivamente para fins acadêmicos e de pesquisa, e o repositório não é destinado ao uso comercial - para explorar comercialmente o LTX-2 ou seus derivados, é preciso contatar a Lightricks. O projeto permanece sujeito ao LTX-2 Community License Agreement.
Na época da captura, o código tinha 1,9 mil estrelas e 169 forks no GitHub. Os checkpoints são baixados separadamente e ficam disponíveis no Hugging Face, em páginas distintas para o modelo de vídeo longo e para o modelo de mundo; há ainda demonstração no ComfyUI e dois artigos associados, incluindo 'EchoWM: Open and Enterable Omnimodal World Models', registrado como preprint no arXiv.