Configuração para manter os gastos mensais de API da Anthropic em torno de 200 mil wons após a revisão de preços
Para freelancers ou equipes pequenas que trabalham com um orçamento mensal de desenvolvimento inferior a 50 mil wons, a recente mudança de política da Anthropic é bastante incômoda. O uso de ferramentas de terceiros foi restrito e os créditos restantes de cada mês não são transferidos para o próximo, desaparecendo completamente. No entanto, se você simplesmente usar o cliente oficial sem critério, a fatura da API ultrapassará facilmente centenas de milhares de wons em poucas sessões de código.
O problema não será resolvido apenas trocando de ferramentas. É preciso ajustar a própria estrutura de fluxo dos prompts para proteger o saldo da sua conta bancária.
Verifique os logs de consumo de tokens e corrija a taxa de acerto do cache
As ferramentas de codificação baseadas em agentes enviam dezenas de milhares de tokens de contexto de uma só vez em uma única solicitação. Olhando para a tabela de preços oficial da Anthropic, o custo de entrada padrão para o Claude 3.5 Sonnet é de $3.00 por milhão de tokens, e a saída é de $15.00. Por outro lado, ao aplicar o cache de prompts, o preço unitário de entrada cai para $0.30. É uma diferença de 90%. No momento em que uma extensão de terceiros insere um carimbo de data/hora ou ID de sessão no topo do prompt do sistema, todo esse cache é invalidado e você paga $3.00 a cada vez.
Primeiro, abra os logs dos últimos 3 meses e calcule a proporção de cache_read_input_tokens em relação aos tokens de entrada.
- Em projetos com taxa de acerto de cache inferior a 40%, verifique o método de injeção de prompts.
- Em vez de enviar toda a base de código a cada solicitação, modifique para passar apenas os arquivos alterados com base no
git diff como contexto.
- Coloque regras fixas no topo do prompt do sistema e declare
cache_control: {"type": "ephemeral"}.
Apenas movendo as variáveis dinâmicas para a parte inferior do prompt e armazenando o texto estático em cache, você pode reduzir quase pela metade o desperdício de tokens em segundo plano.
Divida os modelos de acordo com a dificuldade da tarefa usando o LiteLLM Proxy
Você não precisa escrever cada linha de código com o Sonnet ou o Opus. Chamar um modelo de fronteira em nuvem para o preenchimento automático de guias é um desperdício evidente.
| Classificação da Tarefa |
Modelo Chamado |
Local de Execução |
Nível de Custo |
| Design de arquitetura e refatoração em grande escala |
Claude 3.5 Sonnet |
API na Nuvem |
Preço padrão (100%) |
| Funções utilitárias simples e testes unitários |
Claude 3.5 Haiku, DeepSeek-V3 |
API na Nuvem |
Na faixa de 20% a 30% |
| Preenchimento automático de guias em tempo real e boilerplate |
Ollama (Qwen2.5-Coder 14B) |
Local (On-Device) |
$0.00 |
Inicie o LiteLLM na sua máquina local para atuar como gateway de tráfego. Escreva as regras de roteamento de modelos no arquivo config.yaml.
`yaml
model_list:
- model_name: smart-model
litellm_params:
model: anthropic/claude-3-5-sonnet-20241022
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: fast-model
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY
- model_name: local-coder
litellm_params:
model: ollama/qwen2.5-coder:14b
api_base: http://localhost:11434
`
Defina export ANTHROPIC_BASE_URL="http://localhost:4000" no terminal e integre o Continue.dev ou o Claude Code. O preenchimento automático em tempo real é processado pelo modelo Qwen na GPU local, enquanto apenas perguntas de design complexas são encaminhadas para o Sonnet.
O trabalho de redução de tokens de saída também é realizado em paralelo. Se você omitir todas as introduções desnecessárias, saudações e explicações de código no prompt do sistema e escrever para retornar apenas blocos de código, os gastos com tokens de saída de alto preço serão significativamente reduzidos.
Esgote os créditos mensais restantes usando a Batch API
Os créditos mensais da Anthropic simplesmente evaporam após a data de vencimento. Para evitar desperdiçar o saldo restante, você deve executar a Batch API da Anthropic 3 dias antes da expiração.
A Batch API oferece um desconto de 50% em todos os preços de tokens, com a condição de um retorno assíncrono em até 24 horas. Se você combinar isso com o cache de prompts, poderá processá-lo a um nível de 5% do preço original. Reúna tarefas que não exigem respostas em tempo real imediatamente e envie-as de uma só vez.
- Análise estática e verificação de vulnerabilidades de segurança para toda a base de código
- Geração em massa de códigos de teste unitário para código legado
- Atualização automática de especificações de endpoints de API e documentação técnica
Ao agrupar essas tarefas em um arquivo JSONL e enviá-lo para o endpoint de lote, você pode transformar créditos que iriam para o lixo em ativos de código de teste e documentação.
Fixe os limites de gastos e o caminho de desvio local
Para evitar cobranças excessivas, desative o Auto-Recharge (recarregamento automático) nas configurações de faturamento do console da Anthropic e pague manualmente cerca de $150 no início do mês.
Defina o limite de chamadas diretamente para $150 no menu Spend Limits do console e, em seguida, adicione configurações de fallback ao proxy LiteLLM.
`yaml
router_settings:
fallbacks:
- claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]
`
Mesmo que os créditos acabem e ocorra um erro 429, o Ollama local assume imediatamente as chamadas. Se estiver trabalhando em equipe, compartilhe o arquivo .continue/config.json na raiz do repositório Git e defina o limite mensal de chave virtual (Virtual Key) por membro da equipe para $50 na página de administração do LiteLLM. Como apenas o tráfego do desenvolvedor que excedeu o limite é transferido para o modelo local, os gastos gerais da equipe nunca ultrapassarão o orçamento.