stamatios
← Voltar ao feed
Elefante gigante passa por porta USB de laptop como balão, metáfora de rodar MoE enormes em hardware modesto
IA & Modelos · Hardware & Chips

FreeToken leva modelos MoE grandes para GPUs de 8 GB

resumo de ~3 min

Proposta

FreeToken é um sistema de serving edge-native para modelos Mixture of Experts (MoE) de pesos abertos, projetado para executar em máquinas pessoais em vez de infraestrutura de data center. O sistema trata o computador local não como uma GPU limitada, mas como uma plataforma de inferência unificada e elástica, coordenando o stack completo de serving: layout e carregamento do modelo, residência de experts, execução CPU-GPU, reuso de estado agêntico e gestão de memória em runtime.

Mecanismo

O sistema parte de duas observações sobre IA local: workloads de agentes mudam continuamente seu padrão de execução, e o hardware de borda expõe recursos heterogêneos cujo equilíbrio varia de máquina para máquina. Em vez de adotar uma estratégia fixa de offloading, o FreeToken mapeia continuamente a computação e o estado do modelo sobre os recursos efetivamente disponíveis, adaptando-se à largura de banda e à capacidade de cada configuração.

Resultados e escopo

O sistema suporta mais de 20 modelos MoE e agentes reais de programação e uso de ferramentas, funcionando em hardware que vai de uma GPU de laptop com 8 GB até uma GPU de workstation. Os exemplos citados incluem servir um modelo de 35B parâmetros em um laptop, um modelo de 284B em um desktop gamer e o GLM-5.2 de 753B em uma única GPU de workstation. O sistema foi disponibilizado publicamente.

Contexto

O trabalho parte da premissa de que modelos frontier de pesos abertos estão cada vez mais disponíveis, mas que servi-los ainda pressupõe amplamente infraestrutura de data center. O FreeToken propõe transformar pesos abertos em software local implantável, tornando as máquinas que os usuários já possuem uma plataforma prática para inteligência em escala frontier.