
NVIDIA lança Cosmos 3 Edge, modelo mundial aberto de 4B para robôs
O que é o Cosmos 3 Edge
A NVIDIA lançou o Cosmos 3 Edge, um modelo aberto de 4 bilhões de parâmetros projetado para operar em dispositivos de borda (edge). Ele permite que robôs e agentes de visão computacional compreendam o ambiente ao redor, raciocinem em tempo real e gerem ações de controle diretamente no hardware local - sem depender de data centers. O modelo está disponível no repositório Cosmos 3 da Hugging Face e roda em GPUs NVIDIA RTX PRO, GeForce RTX, DGX e nos módulos Jetson T2000 e T3000.
Entre modelos de tamanho similar (4B), o Cosmos 3 Edge ocupa a primeira posição no VANTAGE-Bench para análise visual e alcança estado da arte em aprendizado de políticas para robótica. Em modo de política, opera em resolução de 640×360, gera 32 ações por inferência no Jetson Thor e atinge controle em tempo real a 15 Hz.
Arquitetura: duas torres, uma representação compartilhada
O modelo combina duas torres transformer. A torre autoregressiva processa tokens de visão e texto para compreensão e raciocínio. A torre de difusão processa tokens de visão, áudio e ação para predição, geração e simulação neural. As duas torres mantêm camadas de normalização e MLPs separadas, mas compartilham camadas de atenção multimodal que alinham informações entre linguagem, vídeo, áudio e ação.
O padrão de atenção é adaptado a cada tipo de informação: linguagem usa atenção causal (cada token atende aos anteriores), enquanto tokens de difusão atendem de forma mais ampla ao contexto disponível. Isso permite que o modelo raciocine sobre uma cena antes de gerar qualquer saída.
Representação comum para ações
Sistemas físicos descrevem ações de formas diferentes - um veículo usa pose e movimento, uma câmera usa movimento de câmera, um braço robótico usa a pose do efetuador final. O Cosmos 3 mapeia todas essas representações em vetores geométricos compactos que capturam translação, rotação e estado de manipulação.
Isso cria uma conexão direta entre controle e estrutura visual do mundo. O vídeo gerado pelo modelo não é apenas uma predição visual, mas representa como o mundo deve mudar em resposta a uma ação, fornecendo dados de treinamento fundamentados em movimento, controle e relação causa-efeito.
Modo política e pós-treinamento
No modo política, o Cosmos 3 Edge prediz uma ação junto com sua consequência visual esperada. A ação pode fluir em ambas as direções: o modelo pode prever os efeitos de uma ação ou inferir uma ação a partir de seus efeitos. A NVIDIA também lançou o Cosmos 3 Edge Policy (DROID), uma política de manipulação robótica pós-treinada no dataset DROID para tarefas de pick-and-place, com scripts de pós-treinamento incluídos.
Além dos modelos base, a NVIDIA disponibiliza checkpoints de referência pós-treinados e receitas de treinamento. O Cosmos 3 Super 4-Step Distillation reduz os passos de difusão de 35-50 para apenas 4, entregando inferência até 25 vezes mais rápida enquanto preserva qualidade de imagem e vídeo. Desenvolvedores podem usar um pequeno cluster de H100 ou DGX Station para fine-tuning antes de deploy em plataformas edge.
Próximos passos
A NVIDIA planeja avanços em geração interativa de mundos, simulação de cenários de direção e políticas de robótica. Também investe em inferência mais rápida e pós-treinamento mais eficiente em hardware diversificado, incluindo otimizações com frameworks abertos como vLLM.