stamatios
← Voltar ao feed
Liquid AI lança LFM2.5-2.6B, modelo agentic on-device
Open Source · IA & Modelos

Liquid AI lança LFM2.5-2.6B, modelo agentic on-device

resumo de ~3 min

LFM2.5-2.6B: modelo agentic que roda inteiramente no dispositivo

A Liquid AI lançou o LFM2.5-2.6B, um modelo de 2,6 bilhões de parâmetros projetado para rodar agentes de forma totalmente local - em celulares, laptops e edge devices - sem depender de APIs na nuvem. O modelo é capaz de planejar, chamar ferramentas e executar tarefas multi-etapas, com inferência de 220 tokens/s em um M5 Max, 113 tokens/s em um Ryzen AI Max+ 395 e até 30 tokens/s em um smartphone, ocupando menos de 2,5 GB de memória.

Treinamento

O modelo base foi pré-treinado em aproximadamente 34 trilhões de tokens, com vocabulário estendido para 128K (suportando scripts não-latinos) e fase dedicada de extensão de contexto para 128K tokens. O pós-treinamento segue um pipeline de quatro estágios:

  1. Supervised Fine-Tuning (SFT): duas etapas consecutivas, começando com cobertura ampla e depois foco em tarefas agênticas, raciocínio e uso de ferramentas. O mix de treinamento é cerca de sete vezes maior que o usado no LFM2.5-8B-A1B.
  2. Teacher Specialization: a partir do checkpoint SFT, treina-se um especialista por domínio (instrução, matemática, código, uso de ferramentas, contexto longo, controle de alucinação) via SFT focado + RLVR.
  3. Multi-Domain On-Policy Distillation (MOPD): os especialistas atuam como professores e destilam suas capacidades em um único modelo-aluno, que gera seus próprios rollouts e recebe feedback token a token do professor correspondente ao domínio.
  4. Agentic RL: reinforcement learning multi-turno em ambientes reais de agentes (Hermes Agent, OpenClaw, entre outros), com reward baseado em rubrica LLM-as-a-judge, verificações programáticas e gate de segurança. A infraestrutura separa engine de treino (FSDP), engine de rollout (SGLang) e orquestração (verl), com sandboxes dedicados por tarefa.

Benchmarks

Apesar de ser o menor modelo na comparação, o LFM2.5-2.6B compete e frequentemente supera modelos de até ~4x seu tamanho:

  • Instruction following: lidera em todos os benchmarks (IFBench 59,17; Multi-IF 80,07; IFStruct 85,49).
  • Uso de ferramentas: lidera em ToolSandbox (77,83) e τ³-Bench Banking; fica atrás apenas do Qwen3.5-9B no BFCLv4.
  • Tarefas agênticas: supera ambos os modelos Gemma em todos os cenários e compete de perto com os Qwen.
  • STEM: lidera em AA Omniscience; em matemática (AIME25) e código (LiveCodeBench), os modelos maiores mantêm vantagem.

Inferência e ecossistema

O modelo tem suporte nativo a llama.cpp (GGUF), MLX (Apple Silicon), vLLM, SGLang e ONNX. Em GPU (H100 SXM5), atinge quase 15 mil tokens de saída por segundo em alta concorrência - cerca de 1,3 bilhão de tokens por dia em uma única H100.

Para montar um agente local, basta servir o modelo atrás de um endpoint compatível com a API OpenAI e apontar o harness de agente (Hermes Agent, OpenClaw, Pi) para ele. Os pesos estão disponíveis no Hugging Face, tanto a versão base quanto a pós-treinada.