TuBrief
Subscribed Channels
Videos
Community

Anthropic 价格调整后,将每月 API 支出控制在 20 万韩元左右的设置方法

TuBrief Editorial
August 19, 2026
0
Computing/Software

Written with AI assistance from the source video. The video is the authority.

中文한국어EnglishEspañolالعربيةहिन्दीDeutschFrançaisPortuguêsРусскийBahasa Indonesia

Related Video

Claude 新推出的积分系统是开发者的陷阱吗?6:10

Claude 新推出的积分系统是开发者的陷阱吗?

Better Stack

More from the community

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

September 13, 2026

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

September 13, 2026

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

September 13, 2026

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

September 13, 2026

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

September 12, 2026

Apple Won the AI Race

September 12, 2026

Comments (0)

Log in to leave a comment

No posts yet

© 2026 . All rights reserved.

TuBrief
Subscribed Channels
Videos
Community
Log in

Anthropic 价格调整后,将每月 API 支出控制在 20 万韩元左右的设置方法

对于每月开发预算在 50 万韩元以下的自由职业者或小团队来说,Anthropic 的这次政策变更确实让人头疼。第三方工具的使用受到了限制,每月剩余的积分也不会结转到下个月,直接清零。然而,如果盲目只使用官方客户端,写几次代码后,API 账单就会轻松飙升到数十万韩元。

更换工具并不能解决问题。只有修改提示词交互的底层结构,才能保住钱包余额。

检查 Token 消耗日志,首先修复缓存命中率

基于 Agent 的编码工具单次请求就会整块发送数万个 Token 的上下文。根据 Anthropic 官方定价表,Claude 3.5 Sonnet 的基础输入费用为每 100 万 Token 3.00 美元,输出为 15.00 美元。相反,如果应用提示词缓存(Prompt Caching),输入单价会降至 0.30 美元。两者相差 90%。一旦第三方扩展在系统提示词的最上方插入时间戳或会话 ID,这些缓存就会全部失效,每次都需要支付 3.00 美元。

首先,打开过去三个月的日志,计算输入 Token 与 cache_read_input_tokens 的比例。

  • 缓存命中率低于 40% 的项目,需要检查提示词注入方式。
  • 修改为传递基于 git diff 的变更文件作为上下文,而不是每次请求都传输整个代码库。
  • 在系统提示词顶部放置固定规则,并声明 cache_control: {"type": "ephemeral"}。

仅仅将动态变量下移至提示词底部并缓存静态文本,就可以消除近一半的后台 Token 浪费。

通过 LiteLLM 代理根据任务难度分流模型

没有必要用 Sonnet 或 Opus 编写每一行代码。在标签页自动补全时调用云端前沿模型是明显的浪费。

任务分类 调用模型 运行位置 费用水平
架构设计与大规模重构 Claude 3.5 Sonnet 云端 API 标准费率 (100%)
简单工具函数与单元测试 Claude 3.5 Haiku, DeepSeek-V3 云端 API 20% ~ 30% 左右
实时标签页补全与样板代码 Ollama (Qwen2.5-Coder 14B) 本地端侧 (On-Device) $0.00

在本地机器上运行 LiteLLM 并将其作为流量网关。在 config.yaml 中编写模型路由规则。

`yaml
model_list:

  • model_name: smart-model
    litellm_params:
    model: anthropic/claude-3-5-sonnet-20241022
    api_key: os.environ/ANTHROPIC_API_KEY
  • model_name: fast-model
    litellm_params:
    model: deepseek/deepseek-chat
    api_key: os.environ/DEEPSEEK_API_KEY
  • model_name: local-coder
    litellm_params:
    model: ollama/qwen2.5-coder:14b
    api_base: http://localhost:11434

`

在终端中指定 export ANTHROPIC_BASE_URL="http://localhost:4000" 并集成 Continue.dev 或 Claude Code。实时自动补全由本地 GPU 上的 Qwen 模型处理,复杂的架构问题才传递给 Sonnet。

同时并行开展减少输出 Token 的工作。如果在系统提示词中省略所有不必要的引言、问候和代码解释,仅返回代码块,就能大幅减少单价较高的输出 Token 支出。

将剩余的月度积分转移到批处理 API (Batch API) 中消耗

Anthropic 的月度积分一旦过了到期日就会直接蒸发。为了不浪费剩余余额,必须在到期前 3 天运行 Anthropic 批处理 API。

批处理 API 以 24 小时内异步返回为条件,将所有 Token 价格打 50% 的折扣。如果再加上提示词缓存,甚至可以以原价 5% 左右的水平进行处理。将暂时不需要实时回答的任务收集起来一次性发送:

  1. 对整个代码库进行静态分析和安全漏洞检查
  2. 批量生成旧代码的单元测试代码
  3. 自动更新 API 端点规范和技术文档

将这些任务打包成 JSONL 文件并推送到批处理端点,就可以将原本要浪费的积分转化为测试代码和文档资产。

固定支出限额与本地绕过路径

为了防止过度收费,请在 Anthropic 控制台的账单设置中关闭自动充值(Auto-Recharge),并在月初手动充值 150 美元左右。

在控制台的 Spend Limits 菜单中将直接调用限额限制在 150 美元,然后在 LiteLLM 代理中添加故障转移(Fallback)设置。

`yaml
router_settings:
fallbacks:
- claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]

`

即使积分耗尽导致 429 错误,本地 Ollama 也会立即接管调用。如果是团队协作,可以将 .continue/config.json 共享到 Git 仓库根目录,并在 LiteLLM 管理员页面中将每个团队成员的虚拟密钥(Virtual Key)月度限额指定为 50 美元。超额开发者的流量会自动转换为本地模型,因此整个团队的支出不会超出预算。