TuBrief
Subscribed Channels
Videos
Community

Configuração para manter os gastos mensais de API da Anthropic em torno de 200 mil wons após a revisão de preços

TuBrief Editorial
August 19, 2026
0
Computing/Software

Written with AI assistance from the source video. The video is the authority.

Português한국어EnglishEspañol中文العربيةहिन्दीDeutschFrançaisРусскийBahasa Indonesia

Related Video

O novo sistema de créditos do Claude é uma armadilha para desenvolvedores?6:10

O novo sistema de créditos do Claude é uma armadilha para desenvolvedores?

Better Stack

More from the community

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

September 13, 2026

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

September 13, 2026

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

September 13, 2026

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

September 13, 2026

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

September 12, 2026

Apple Won the AI Race

September 12, 2026

Comments (0)

Log in to leave a comment

No posts yet

© 2026 . All rights reserved.

TuBrief
Subscribed Channels
Videos
Community
Log in

Configuração para manter os gastos mensais de API da Anthropic em torno de 200 mil wons após a revisão de preços

Para freelancers ou equipes pequenas que trabalham com um orçamento mensal de desenvolvimento inferior a 50 mil wons, a recente mudança de política da Anthropic é bastante incômoda. O uso de ferramentas de terceiros foi restrito e os créditos restantes de cada mês não são transferidos para o próximo, desaparecendo completamente. No entanto, se você simplesmente usar o cliente oficial sem critério, a fatura da API ultrapassará facilmente centenas de milhares de wons em poucas sessões de código.

O problema não será resolvido apenas trocando de ferramentas. É preciso ajustar a própria estrutura de fluxo dos prompts para proteger o saldo da sua conta bancária.

Verifique os logs de consumo de tokens e corrija a taxa de acerto do cache

As ferramentas de codificação baseadas em agentes enviam dezenas de milhares de tokens de contexto de uma só vez em uma única solicitação. Olhando para a tabela de preços oficial da Anthropic, o custo de entrada padrão para o Claude 3.5 Sonnet é de $3.00 por milhão de tokens, e a saída é de $15.00. Por outro lado, ao aplicar o cache de prompts, o preço unitário de entrada cai para $0.30. É uma diferença de 90%. No momento em que uma extensão de terceiros insere um carimbo de data/hora ou ID de sessão no topo do prompt do sistema, todo esse cache é invalidado e você paga $3.00 a cada vez.

Primeiro, abra os logs dos últimos 3 meses e calcule a proporção de cache_read_input_tokens em relação aos tokens de entrada.

  • Em projetos com taxa de acerto de cache inferior a 40%, verifique o método de injeção de prompts.
  • Em vez de enviar toda a base de código a cada solicitação, modifique para passar apenas os arquivos alterados com base no git diff como contexto.
  • Coloque regras fixas no topo do prompt do sistema e declare cache_control: {"type": "ephemeral"}.

Apenas movendo as variáveis dinâmicas para a parte inferior do prompt e armazenando o texto estático em cache, você pode reduzir quase pela metade o desperdício de tokens em segundo plano.

Divida os modelos de acordo com a dificuldade da tarefa usando o LiteLLM Proxy

Você não precisa escrever cada linha de código com o Sonnet ou o Opus. Chamar um modelo de fronteira em nuvem para o preenchimento automático de guias é um desperdício evidente.

Classificação da Tarefa Modelo Chamado Local de Execução Nível de Custo
Design de arquitetura e refatoração em grande escala Claude 3.5 Sonnet API na Nuvem Preço padrão (100%)
Funções utilitárias simples e testes unitários Claude 3.5 Haiku, DeepSeek-V3 API na Nuvem Na faixa de 20% a 30%
Preenchimento automático de guias em tempo real e boilerplate Ollama (Qwen2.5-Coder 14B) Local (On-Device) $0.00

Inicie o LiteLLM na sua máquina local para atuar como gateway de tráfego. Escreva as regras de roteamento de modelos no arquivo config.yaml.

`yaml
model_list:

  • model_name: smart-model
    litellm_params:
    model: anthropic/claude-3-5-sonnet-20241022
    api_key: os.environ/ANTHROPIC_API_KEY
  • model_name: fast-model
    litellm_params:
    model: deepseek/deepseek-chat
    api_key: os.environ/DEEPSEEK_API_KEY
  • model_name: local-coder
    litellm_params:
    model: ollama/qwen2.5-coder:14b
    api_base: http://localhost:11434

`

Defina export ANTHROPIC_BASE_URL="http://localhost:4000" no terminal e integre o Continue.dev ou o Claude Code. O preenchimento automático em tempo real é processado pelo modelo Qwen na GPU local, enquanto apenas perguntas de design complexas são encaminhadas para o Sonnet.

O trabalho de redução de tokens de saída também é realizado em paralelo. Se você omitir todas as introduções desnecessárias, saudações e explicações de código no prompt do sistema e escrever para retornar apenas blocos de código, os gastos com tokens de saída de alto preço serão significativamente reduzidos.

Esgote os créditos mensais restantes usando a Batch API

Os créditos mensais da Anthropic simplesmente evaporam após a data de vencimento. Para evitar desperdiçar o saldo restante, você deve executar a Batch API da Anthropic 3 dias antes da expiração.

A Batch API oferece um desconto de 50% em todos os preços de tokens, com a condição de um retorno assíncrono em até 24 horas. Se você combinar isso com o cache de prompts, poderá processá-lo a um nível de 5% do preço original. Reúna tarefas que não exigem respostas em tempo real imediatamente e envie-as de uma só vez.

  1. Análise estática e verificação de vulnerabilidades de segurança para toda a base de código
  2. Geração em massa de códigos de teste unitário para código legado
  3. Atualização automática de especificações de endpoints de API e documentação técnica

Ao agrupar essas tarefas em um arquivo JSONL e enviá-lo para o endpoint de lote, você pode transformar créditos que iriam para o lixo em ativos de código de teste e documentação.

Fixe os limites de gastos e o caminho de desvio local

Para evitar cobranças excessivas, desative o Auto-Recharge (recarregamento automático) nas configurações de faturamento do console da Anthropic e pague manualmente cerca de $150 no início do mês.

Defina o limite de chamadas diretamente para $150 no menu Spend Limits do console e, em seguida, adicione configurações de fallback ao proxy LiteLLM.

`yaml
router_settings:
fallbacks:
- claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]

`

Mesmo que os créditos acabem e ocorra um erro 429, o Ollama local assume imediatamente as chamadas. Se estiver trabalhando em equipe, compartilhe o arquivo .continue/config.json na raiz do repositório Git e defina o limite mensal de chave virtual (Virtual Key) por membro da equipe para $50 na página de administração do LiteLLM. Como apenas o tráfego do desenvolvedor que excedeu o limite é transferido para o modelo local, os gastos gerais da equipe nunca ultrapassarão o orçamento.