Anthropic 价格调整后,将每月 API 支出控制在 20 万韩元左右的设置方法
对于每月开发预算在 50 万韩元以下的自由职业者或小团队来说,Anthropic 的这次政策变更确实让人头疼。第三方工具的使用受到了限制,每月剩余的积分也不会结转到下个月,直接清零。然而,如果盲目只使用官方客户端,写几次代码后,API 账单就会轻松飙升到数十万韩元。
更换工具并不能解决问题。只有修改提示词交互的底层结构,才能保住钱包余额。
检查 Token 消耗日志,首先修复缓存命中率
基于 Agent 的编码工具单次请求就会整块发送数万个 Token 的上下文。根据 Anthropic 官方定价表,Claude 3.5 Sonnet 的基础输入费用为每 100 万 Token 3.00 美元,输出为 15.00 美元。相反,如果应用提示词缓存(Prompt Caching),输入单价会降至 0.30 美元。两者相差 90%。一旦第三方扩展在系统提示词的最上方插入时间戳或会话 ID,这些缓存就会全部失效,每次都需要支付 3.00 美元。
首先,打开过去三个月的日志,计算输入 Token 与 cache_read_input_tokens 的比例。
- 缓存命中率低于 40% 的项目,需要检查提示词注入方式。
- 修改为传递基于
git diff 的变更文件作为上下文,而不是每次请求都传输整个代码库。
- 在系统提示词顶部放置固定规则,并声明
cache_control: {"type": "ephemeral"}。
仅仅将动态变量下移至提示词底部并缓存静态文本,就可以消除近一半的后台 Token 浪费。
通过 LiteLLM 代理根据任务难度分流模型
没有必要用 Sonnet 或 Opus 编写每一行代码。在标签页自动补全时调用云端前沿模型是明显的浪费。
| 任务分类 |
调用模型 |
运行位置 |
费用水平 |
| 架构设计与大规模重构 |
Claude 3.5 Sonnet |
云端 API |
标准费率 (100%) |
| 简单工具函数与单元测试 |
Claude 3.5 Haiku, DeepSeek-V3 |
云端 API |
20% ~ 30% 左右 |
| 实时标签页补全与样板代码 |
Ollama (Qwen2.5-Coder 14B) |
本地端侧 (On-Device) |
$0.00 |
在本地机器上运行 LiteLLM 并将其作为流量网关。在 config.yaml 中编写模型路由规则。
`yaml
model_list:
- model_name: smart-model
litellm_params:
model: anthropic/claude-3-5-sonnet-20241022
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: fast-model
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY
- model_name: local-coder
litellm_params:
model: ollama/qwen2.5-coder:14b
api_base: http://localhost:11434
`
在终端中指定 export ANTHROPIC_BASE_URL="http://localhost:4000" 并集成 Continue.dev 或 Claude Code。实时自动补全由本地 GPU 上的 Qwen 模型处理,复杂的架构问题才传递给 Sonnet。
同时并行开展减少输出 Token 的工作。如果在系统提示词中省略所有不必要的引言、问候和代码解释,仅返回代码块,就能大幅减少单价较高的输出 Token 支出。
将剩余的月度积分转移到批处理 API (Batch API) 中消耗
Anthropic 的月度积分一旦过了到期日就会直接蒸发。为了不浪费剩余余额,必须在到期前 3 天运行 Anthropic 批处理 API。
批处理 API 以 24 小时内异步返回为条件,将所有 Token 价格打 50% 的折扣。如果再加上提示词缓存,甚至可以以原价 5% 左右的水平进行处理。将暂时不需要实时回答的任务收集起来一次性发送:
- 对整个代码库进行静态分析和安全漏洞检查
- 批量生成旧代码的单元测试代码
- 自动更新 API 端点规范和技术文档
将这些任务打包成 JSONL 文件并推送到批处理端点,就可以将原本要浪费的积分转化为测试代码和文档资产。
固定支出限额与本地绕过路径
为了防止过度收费,请在 Anthropic 控制台的账单设置中关闭自动充值(Auto-Recharge),并在月初手动充值 150 美元左右。
在控制台的 Spend Limits 菜单中将直接调用限额限制在 150 美元,然后在 LiteLLM 代理中添加故障转移(Fallback)设置。
`yaml
router_settings:
fallbacks:
- claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]
`
即使积分耗尽导致 429 错误,本地 Ollama 也会立即接管调用。如果是团队协作,可以将 .continue/config.json 共享到 Git 仓库根目录,并在 LiteLLM 管理员页面中将每个团队成员的虚拟密钥(Virtual Key)月度限额指定为 50 美元。超额开发者的流量会自动转换为本地模型,因此整个团队的支出不会超出预算。