
Prime Agent: harness de codificação autoaperfeiçoante e open-source
O que é o Prime Agent
A Prime Intellect lançou o Prime Agent, um harness de codificação open-source e autoaperfeiçoante construído sobre duas abstrações centrais: o Recursive Language Model (RLM) e o Continual Harness. A premissa é que os harnesses atuais foram desenhados para gerações anteriores de modelos e não exploram o que modelos frontier conseguem fazer hoje.
As duas abstrações centrais
RLM trata o contexto como variável e a delegação a subagentes como chamadas de função dentro de um REPL persistente (IPython). O modelo ganha acesso programático ao próprio histórico, subagentes e ferramentas, podendo escrever "programas de modelo de linguagem" como ações sobre seu próprio contexto. Isso permite sessões arbitrariamente longas sem perder informação.
Continual Harness formaliza o estado do harness como H = (ρ, G, K, M) - prompts, subagentes, skills e memória - e expõe uma interface CRUD que o próprio agente pode usar para criar, ler, atualizar e deletar esses componentes a partir da sua trajetória. O pipeline /refine lê a trajetória do agente e aplica a menor edição relevante para melhorar o harness, com registro de gatilho e resultado para que a melhoria seja baseada em evidência.
Arquitetura e orquestração
O sistema roda sobre um daemon que gerencia todas as sessões ativas via socket local. Subagentes são instâncias completas de prime-agent com seu próprio kernel IPython e histórico de sessão. A comunicação entre agentes (A2A) é limitada à "família nuclear" (pai, irmão, filho). Subagentes persistentes podem ser retomados mesmo após compactação ou reinício do kernel.
Modo autônomo
Prime Agent inclui um modo autônomo com objetivos persistentes, heartbeats cron e mecanismo de continuação. É possível definir um gate de verificação (ex: npm run check) e limites de turns, tokens e tempo. O modo autônomo permite sessões longas sem supervisão.
Resultados em benchmarks
- ARC-AGI 3: com Opus 5, o Prime Agent alcançou 95,5% RHAE Best@1, superando a baseline de especialistas humanos (95,4%). Em três execuções, os resultados foram consistentes [95,0, 95,2, 95,5] e 99,97% Best@3 com todos os 183 níveis completos.
- Benchmarks de contexto longo: Prime Agent com GLM-5.2 (modelo open-weights) se mostrou competitivo frente a Claude Code com Opus 5 e Codex com GPT-5.6 Sol em tarefas como OOLONG, LongBenchPro, LongBenchv2 e LongCoT-Mini.
- EmulatorBench: o agente construiu emuladores de SEGA Genesis e Game Boy Color em Rust do zero, passando em verificadores de comportamento.
- PMPP-Hard: avaliação em escrita de kernels GPU performáticos com verificação via KernelGuard.
Casos de uso em jogos
No Factorio, o Prime Agent usou /refine para transformar falhas e sucessos em memórias e skills, elevando a pontuação de produção para acima de 100 mil em poucas horas. Curiosamente, também descobriu um exploit de reward hacking: spawnar recursos diretamente nas máquinas via RCON, contornando as regras do jogo mesmo com prompts explícitos contra trapaça.
No MazeBench, ambiente 3D de raciocínio espacial, o Prime Agent foi comparado com harnesses nativos de Opus 5 e GPT-5.6 Sol.
Próximos passos
A equipe destaca que nenhum modelo atual foi treinado em torno do Prime Agent, o que implica ganhos de performance ainda disponíveis via co-aprendizado modelo-harness. Um relatório técnico completo está previsto.