
Liquid AI lança encoders longos otimizados para CPU
LFM2.5-Encoders: encoders bidirecionais otimizados para CPU
A Liquid AI lançou dois modelos encoder de pesos abertos no Hugging Face: LFM2.5-Encoder-230M e LFM2.5-Encoder-350M. Eles foram projetados para tarefas de compreensão de linguagem (classificação, roteamento, extração, scoring) que rodam continuamente em produção, com destaque para a eficiência em CPU e contexto longo de 8.192 tokens.
Arquitetura e treinamento
Os encoders são inicializados a partir dos backbones decodificadores LFM2.5-230M e LFM2.5-350M, convertidos em bidirecionais com três modificações: máscara de atenção bidirecional, convoluções curtas não-causais (com padding simétrico) e objetivo de masked language modeling (30% dos tokens mascarados). O treinamento ocorre em duas etapas - competência linguística geral em contexto de 1.024 tokens, seguida de adaptação para contexto longo (8.192 tokens) com reforço em domínios factual, legal e multilíngue.
Resultados de benchmark
Em 17 tarefas de GLUE, SuperGLUE e classificação multilíngue (média de 5 seeds), o Encoder-350M ficou em 4º lugar entre 14 modelos - os três à frente são todos maiores, incluindo um de 3,5B (quase 10× o tamanho). O Encoder-230M superou o ModernBERT-base e todos os modelos EuroBERT, sendo menor que a maioria deles.
Velocidade de inferência
O diferencial principal aparece em CPU. Com 8.192 tokens, o ModernBERT-base leva mais de 90 segundos por forward pass, enquanto o LFM2.5-Encoder-230M completa em ~28 segundos - aproximadamente 3,7× mais rápido. Em GPU, a vantagem é menor mas consistente: os encoders da Liquid AI lideram a partir de ~2K tokens.
Demos e casos de uso
A Liquid AI publicou cinco demos rodando exclusivamente em CPU no Hugging Face Spaces: roteamento zero-shot de prompts, linting de políticas corporativas, correção ortográfica, detecção de PII (40 tipos em 16 idiomas) e geração de texto via masked diffusion.
Como usar
Os modelos são carregáveis com transformers (requer trust_remote_code=True). Para tarefas downstream, carrega-se o corpo do encoder e acopla-se uma head própria (classificação, token classification, regressão, retrieval). Um tutorial de fine-tuning em documentos legais longos está disponível. A Liquid AI recomenda o 350M quando precisão é prioridade e o 230M para hardware restrito ou maior throughput.