
FreeToken leva modelos MoE grandes para GPUs de 8 GB
Proposta
FreeToken é um sistema de serving edge-native para modelos Mixture of Experts (MoE) de pesos abertos, projetado para executar em máquinas pessoais em vez de infraestrutura de data center. O sistema trata o computador local não como uma GPU limitada, mas como uma plataforma de inferência unificada e elástica, coordenando o stack completo de serving: layout e carregamento do modelo, residência de experts, execução CPU-GPU, reuso de estado agêntico e gestão de memória em runtime.
Mecanismo
O sistema parte de duas observações sobre IA local: workloads de agentes mudam continuamente seu padrão de execução, e o hardware de borda expõe recursos heterogêneos cujo equilíbrio varia de máquina para máquina. Em vez de adotar uma estratégia fixa de offloading, o FreeToken mapeia continuamente a computação e o estado do modelo sobre os recursos efetivamente disponíveis, adaptando-se à largura de banda e à capacidade de cada configuração.
Resultados e escopo
O sistema suporta mais de 20 modelos MoE e agentes reais de programação e uso de ferramentas, funcionando em hardware que vai de uma GPU de laptop com 8 GB até uma GPU de workstation. Os exemplos citados incluem servir um modelo de 35B parâmetros em um laptop, um modelo de 284B em um desktop gamer e o GLM-5.2 de 753B em uma única GPU de workstation. O sistema foi disponibilizado publicamente.
Contexto
O trabalho parte da premissa de que modelos frontier de pesos abertos estão cada vez mais disponíveis, mas que servi-los ainda pressupõe amplamente infraestrutura de data center. O FreeToken propõe transformar pesos abertos em software local implantável, tornando as máquinas que os usuários já possuem uma plataforma prática para inteligência em escala frontier.