stamatios
← Voltar ao feed
Meta lança Muse Glimmer, modelo aberto de 30B para agentes locais
IA & Modelos · Open Source

Meta lança Muse Glimmer, modelo aberto de 30B para agentes locais

resumo de ~3 min

A Meta Superintelligence Labs lançou o Muse Glimmer, um modelo aberto de 30 bilhões de parâmetros licenciado sob Apache 2.0, otimizado para agentes locais que rodam diretamente em Macs, PCs e GPUs consumer. O foco é permitir workflows sempre ativos sem dependência de nuvem: agentes pessoais, function calling, codificação local e avaliação LLM-as-a-judge, com suporte a entradas multimodais (texto e imagens) e mais de 100 idiomas.

Treinamento

O modelo foi construído para equilibrar capacidade e restrições de hardware local. O pré-treinamento usou destilação de logits a partir do modelo maior Muse Spark; o mid-training adicionou dados de contexto mais longo e traces de raciocínio agentico; o pós-treinamento combinou fine-tuning supervisionado, destilação on-policy e reinforcement learning em domínios gerais, de raciocínio, código e agentes.

Capacidades agenticas

Muse Glimmer foi treinado para tarefas de ponta a ponta, incluindo benchmarks como DeepSearch QA, MCP-Atlas, τ-Bench e SWE-Bench. Ele também oferece uso confiável de ferramentas com schemas precisos, raciocínio multi-etapas em horizontes longos, recuperação de falhas (diagnosticando erros e tentando novamente em vez de parar), compatibilidade com scaffolds como OpenClaw e controle de esforço de raciocínio para equilibrar qualidade e velocidade.

Otimizações para execução local

Para caber em hardware consumer, a Meta usa quantização de aproximadamente 4 bits, reduzindo o modelo de mais de 55 GB em precisão total para menos de 20 GB, deixando espaço para KV cache, encoder de percepção e drafter dentro de envelopes de 24 GB ou 32 GB. A geração é acelerada por speculative decoding com um drafter leve baseado em DFlash, que propõe blocos de tokens para validação paralela, mantendo qualidade de saída idêntica e velocidade suficiente para interação em tempo real. Testes foram feitos em MacBook M4-Max, M5-Max e RTX-5090.

Disponibilidade e ecossistema

Os pesos estão no Hugging Face, com documentação para desenvolvedores. Integrações otimizadas para llama.cpp, MLX e ExecuTorch devem chegar em breve, além de suporte via Ollama, LM Studio, Unsloth, vLLM, SGLang, Together AI, Fireworks AI e OpenRouter. A Meta também trabalha com AMD, Arm, Dell, Intel e NVIDIA para otimizar desempenho em diferentes dispositivos.