
ContextPilot-14B ensina agentes a gerenciar memória e contexto
O que é o ContextPilot-14B
O ContextPilot-14B é o checkpoint baseado no Qwen3-14B do ContextPilot, uma estrutura de gerenciamento proativo de contexto para agentes de horizonte longo, publicada pela Tencent no Hugging Face e associada a um artigo aceito na EMNLP 2026. O objetivo é ensinar agentes a planejar, manter memória de longo prazo e descarregar contexto menos útil enquanto continuam raciocinando e usando ferramentas.
O problema abordado
Tarefas agênticas de horizonte longo exigem que LLMs recuperem, integrem e mantenham informações dispersas ao longo de múltiplas interações, mas preservar todo o histórico faz o contexto de trabalho crescer continuamente. Métodos anteriores de gerenciamento proativo permitiam que o modelo editasse o próprio contexto com ferramentas, mas apresentavam três limitações apontadas pelos autores: um conjunto de ferramentas restrito a busca, exclusão e sumarização, sem planejamento global, memória de longo prazo ou compressão adaptativa; exploração ineficiente que tratava todas as ações de contexto de forma uniforme apesar de impactos heterogêneos; e atribuição de crédito grosseira, que distribuía a recompensa final de toda a trajetória igualmente entre as ações intermediárias de edição.
Como funciona
O ContextPilot combina três componentes: um conjunto estendido de ferramentas de gerenciamento de contexto, com planejamento, memória estruturada, recuperação e soft offloading de contexto; um rollout parcial sensível ao contexto, que concentra a exploração em decisões críticas de edição; e uma atribuição de crédito de grão fino, que treina instantâneos intermediários usando os resultados de seus ramos posteriores. O método de RL usa variação de contexto e entropia para identificar decisões críticas de edição para amostragem de ramos e estima vantagens por ação a partir das trajetórias ramificadas que passam pela ação correspondente.
Resultados e uso pretendido
Segundo o artigo, experimentos em perguntas e respostas de contexto longo e tarefas de busca profunda mostram desempenho mais forte com um contexto de trabalho mais compacto, superando consistentemente baselines existentes em vários modelos de base e benchmarks. O checkpoint destina-se à pesquisa sobre gerenciamento proativo de contexto, agentes de horizonte longo, QA de contexto longo e busca profunda. Apenas carregar o modelo não executa as ferramentas de contexto: as definições, o runtime do agente e o pipeline de avaliação estão no repositório do projeto, distribuído sob licença própria ("other"). O modelo tem 15 bilhões de parâmetros em BF16 e registrou 152 downloads no último mês.