
Liquid AI usa agentes para construir tokenizer de produção
Objetivo do experimento
A Liquid AI conduziu um experimento no final de 2025 para responder se agentes de código podem resolver autonomamente um problema de nível de produção a partir do zero. A tarefa escolhida foi construir um treinador de tokenizer BPE chamado toktoktok, necessário para a pesquisa da empresa sobre impacto do tamanho de vocabulário em LLMs de borda. As ferramentas existentes (sentencepiece, Hugging Face tokenizers e tiktoken) não atendiam aos requisitos de memória, extensão de vocabulário ou orçamento por idioma.
Critérios de avaliação
A Liquid AI definiu três critérios para que o teste fosse honesto. Primeiro, o problema precisava ser genuinamente de produção, não prototipagem nem reimplementação de algo já visto em pré-treino. Segundo, exigia expertise multi-domínio: pesquisadores de ML conheciam tokenizers mas não Rust, e engenheiros de Rust conheciam sistemas mas não treinamento de tokenizers. Terceiro, o resultado deveria ser verificável externamente: o vocabulário treinado precisava ser carregado por tiktoken e Hugging Face tokenizers, software que o agente não poderia modificar.
Configuração
Os dois agentes utilizados foram Claude Opus 4.5 e Codex com GPT-5.2, os modelos de código mais fortes disponíveis publicamente no final de 2025. A meta foi descrita em um único arquivo de especificação (AGENTS.md/CLAUDE.md) com resultados e restrições, não implementação. A verificação usou dados de produção reais em uma máquina AMD EPYC 9755 com 128 núcleos e 2 TB de memória, além de um harness externo de validação.
Resultados
Ambos os agentes produziram um treinador funcional em 30 minutos, passando em testes unitários com dados de brinquedo. Nenhum dos dois sobreviveu ao dataset de produção sem iterações. Os problemas incluíram codificações de arquivo Parquet não previstas, estouro de memória, paralelização inadequada, regex com backtracking quadrático, ordenação incorreta de ranks, merges duplicados e divergência na codificação de números. Após mais de cinco iterações sem progresso, a Liquid AI interrompeu a trilha do Codex/GPT-5.2. O Claude Opus 4.5 convergiu após iterações adicionais e produziu um treinador que processou trilhões de tokens multilíngues e de código em uma única máquina, passando no harness externo.
Lições sobre design de loops
A conclusão central é que a capacidade do agente depende menos de uma resposta individual e mais do loop iterativo contra restrições reais. Duas lições se tornaram prática diária na equipe de engenharia da Liquid AI. Primeiro, especificar metas para especialistas multi-domínio: como o modelo já possui o conhecimento de fundo instalado, a especificação pode ser curta e declarar resultados e restrições em vez de mecanismos. Segundo, verificar contra o mundo real: iterar com dados de produção em escala e usar um harness externo que o agente não pode manipular. O operador nunca leu uma linha do código produzido.
Estado atual
A Liquid AI afirma que essas lições se tornaram prática rotineira. Hoje a empresa executa loops além de construções pontuais, incluindo otimização de kernels, monitoramento de CI, triagem de pull requests e análise de logs de produção. O toktoktok está disponível como código aberto sob licença Apache 2.0.