Script de Gerenciamento de Orçamento de Tokens para Evitar Cobranças Excessivas na API do Cloud Code
1. Bloqueando Custos Excessivos Definindo um Limite Superior de Tokens
Se você já rodou um projeto pequeno e levou um susto ao ver a fatura da API, foi porque não havia limite de orçamento. Os agentes mantêm o contexto da conversa muito mais longo do que você imagina e leem o conteúdo de arquivos desnecessários repetidamente. Se deixados sem supervisão, dezenas de milhares de tokens desaparecem em um único dia. Você precisa abrir o arquivo ~/.claude/settings.json para limitar diretamente o uso diário e por sessão.
Veja como adicionar o objeto budget ao arquivo de configuração global do usuário:
- Abra o terminal e use um editor para abrir o arquivo ~/.claude/settings.json.
- Dentro do bloco JSON, defina o valor de sessionLimit como 500000 e dailyLimit como 2000000.
- Defina warningThreshold como 0.75 e autoCompactAt como 0.60, depois salve o arquivo.
Quando a capacidade de contexto atingir 60 por cento, o histórico da conversa será compactado automaticamente, eliminando o desperdício desnecessário de tokens. Como a sessão é bloqueada antes de atingir o limite diário, você pode se livrar da preocupação de estourar o orçamento.
2. Construindo um Quebrador de Loop para Interromper Forçadamente em 3 Erros Consecutivos
Se o agente ficar preso no mesmo gancho devido a erros de sintaxe ou problemas de caminho de arquivo, ele continuará rodando em um loop infinito sem conseguir resolver. Deixar esse estado sem supervisão esgota os tokens da sessão em poucos minutos. Apenas escrever "tenha cuidado" no prompt não adianta. Você deve vincular um sistema de ganchos baseado em script shell para bloqueá-lo fisicamente.
Crie um script de gancho que encerre o processo imediatamente se detectar o mesmo erro 3 vezes seguidas.
- Crie o arquivo .claude/hooks/loop-breaker.sh no diretório do projeto e conceda permissões de execução.
- Dentro do script, consulte um arquivo de estado temporário para incrementar o contador de erros em 1. Se a contagem cumulativa for 3 ou mais, emita um erro padrão e retorne o código de saída 2 para interromper à força a tarefa.
- Registre o caminho do script correspondente no item PostToolUseFailure do arquivo .claude/settings.json para monitorá-lo em tempo real.
Ao configurar esse mecanismo, o fenômeno do agente corrigir código incorreto indefinidamente e queimar tokens desaparece. Você pode economizar o tempo desperdiçado no inferno da depuração.
3. Roteamento de Modelos e Separação de Seções de Aprovação Manual de Acordo com a Natureza da Tarefa
Se você confiar todas as tarefas de programação inteiramente ao Claude, seu orçamento não vai aguentar. Tarefas simples de formatação ou criação de código corriqueiro (boilerplate) devem ser repassadas a modelos mais leves, enquanto tarefas irreversíveis, como migrações de banco de dados, devem ser aprovadas diretamente pelo desenvolvedor. Utilize aliases de shell para construir um ambiente de execução adequado à dificuldade da tarefa.
A configuração para separar os comandos de delegação do agente por natureza de tarefa é a seguinte:
- Abra o arquivo ~/.bashrc ou ~/.zshrc.
- Registre o comando
alias cc-quick='claude --model claude-haiku-3-20250307 --token-budget 100000' para tarefas simples de documentação.
- Adicione o comando
alias cc-dev='claude --model claude-sonnet-4-20250514 --token-budget 500000 --thinking-budget 8000' para o desenvolvimento de recursos gerais e reinicie o terminal.
Aplicando este método, o agente lida com segurança com 90 por cento da programação repetitiva simples, e a taxa de PRs concluídos por milhão de tokens aumenta visivelmente. Esta é a maneira mais realista de reduzir com certeza os custos desnecessários de API pela metade.