stamatios
← Voltar ao feed
Bancada de trabalho com vassoura varrendo tokens de contexto velho da borda, metáfora de sessões de Claude Code mais eficientes
Dev & Engenharia · IA & Modelos

Maximize o valor das sessões de Claude Code

resumo de ~3 min

A lógica de custo das sessões

O texto explica que ferramentas de programação agentiva tornam cada tarefa variável em custo: o mesmo conserto pode consumir poucos tokens se Claude Code ler apenas os arquivos necessários, ou muitos se passar por vários arquivos e carregar todo esse material nas interações seguintes. Ser eficiente, portanto, não significa necessariamente usar menos tokens, mas direcionar os tokens usados para o trabalho solicitado.

O preço depende principalmente do modelo escolhido, do tipo de token e do cache. Modelos maiores fazem mais trabalho e devem ser reservados para problemas difíceis ou ambíguos; modelos menores podem atender tarefas rotineiras. Tokens de entrada incluem o prompt do sistema, CLAUDE.md, a mensagem do usuário, arquivos lidos e saídas de comandos. Tokens de saída incluem o raciocínio, chamadas de ferramentas e resposta exibida. Como a fase de geração mantém a GPU ocupada por mais tempo, o texto afirma que o token de saída custa aproximadamente cinco vezes o token de entrada. O nível de esforço controla parte dos tokens de raciocínio; /model e /effort mostram ou alteram essas escolhas, enquanto MAX_THINKING_TOKENS=0 desativa o raciocínio em uma sessão, exceto no Fable 5.

Cache e contexto

Claude Code gerencia automaticamente o cache de prompts. Quando o início exato de uma solicitação coincide com o de uma anterior, essa parte pode ser reutilizada: a leitura em cache custa 0,1 vez o preço do token de entrada, enquanto gravar tokens no cache pode custar até duas vezes esse preço. Em uma correção simples, por exemplo, cada chamada de leitura, edição ou teste acrescenta informação à conversa; nas solicitações seguintes, o histórico é reenviado, mas apenas o conteúdo novo precisa ser processado integralmente.

O cache depende da sequência inicial da solicitação - definições de ferramentas, prompt do sistema, conversa e CLAUDE.md. Trocar modelo, nível de esforço ou ativar o modo rápido no meio da sessão pode invalidá-lo e provocar novo processamento do histórico. /compact também substitui a conversa por um resumo, embora seja mais barato executá-lo antes de uma pausa longa, enquanto o cache ainda existe. O cache expira após uma hora em assinaturas ou cinco minutos com uma chave de API, salvo a configuração indicada para estender esse período. /rewind, por cortar apenas os turnos finais, preserva mais cache que /compact quando o problema está no fim da conversa.

Como reduzir contexto desperdiçado

Tudo que entra no contexto - arquivos e resultados de comandos - permanece nas interações seguintes. Por isso, o texto recomenda usar /clear ao iniciar outra tarefa e /rename antes disso caso a sessão precise ser recuperada. /context, executado no começo, mostra o que foi carregado; instruções específicas devem ficar em CLAUDE.md, enquanto orientações de fluxo podem ser movidas para skills. Servidores MCP desnecessários podem ser desligados com /mcp.

Para evitar buscas e chamadas extras, o usuário deve informar diretamente o arquivo relevante e preferir uma menção com @, que o anexa à primeira mensagem. Comandos barulhentos devem receber opções silenciosas, tail ou ser configurados em CLAUDE.md; saídas acima de 30 mil caracteres são gravadas em arquivo, mas resultados menores continuam no contexto. Loops devem rodar em uma sessão separada, pois cada execução é um turno completo. Subagentes também isolam logs e outras tarefas que geram muito material: só a resposta retorna à sessão principal, embora o subagente possa precisar reler arquivos e tenha seu próprio custo. A orientação final é observar especialmente o tamanho do contexto, a quantidade de turnos que o mantém e o número de sessões simultâneas.