TuBrief
구독 채널
비디오
커뮤니티

Настройка ограничения месячных расходов на API Anthropic в пределах 200 000 вон после изменения цен

TuBrief 편집팀
2026년 8월 19일
0
Computing/Software

원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.

Русский한국어EnglishEspañol中文العربيةहिन्दीDeutschFrançaisPortuguêsBahasa Indonesia

관련 영상

Новая кредитная система Claude: ловушка для разработчиков?6:10

Новая кредитная система Claude: ловушка для разработчиков?

Better Stack

커뮤니티의 다른 글

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

2026년 9월 13일

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

2026년 9월 13일

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

2026년 9월 13일

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

2026년 9월 13일

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

2026년 9월 12일

Apple Won the AI Race

2026년 9월 12일

댓글 (0)

Log in to leave a comment

아직 작성된 글이 없습니다

© 2026 . All rights reserved.

TuBrief
구독 채널
비디오
커뮤니티
로그인

Настройка ограничения месячных расходов на API Anthropic в пределах 200 000 вон после изменения цен

Недавнее изменение политики Anthropic стало довольно серьезной головной болью для фрилансеров и небольших команд, работающих с месячным бюджетом на разработку менее 500 000 вон. Появились ограничения на использование сторонних инструментов, а оставшиеся ежемесячные кредиты больше не переносятся на следующий месяц и просто сгорают. При этом, если слепо пользоваться только официальным клиентом, пара сеансов кодинга легко превышают счета за API в несколько сотен тысяч вон.

Проблема не решится простой сменой инструментов. Чтобы защитить остаток на балансе, необходимо переработать саму структуру прохождения промптов.

Начните с проверки логов потребления токенов и исправления коэффициента попадания в кэш

Инструменты кодинга на базе агентов отправляют десятки тысяч токенов контекста целиком за один запрос. Согласно официальному прайс-листу Anthropic, базовая стоимость ввода для Claude 3.5 Sonnet составляет $3.00 за 1 миллион токенов, а вывода — $15.00. С другой стороны, при применении кэширования промптов цена ввода падает до $0.30. Разница составляет 90%. Как только стороннее расширение добавляет временную метку или идентификатор сеанса в самый верх системного промпта, весь этот кэш сбрасывается, и вам приходится платить $3.00 каждый раз.

Прежде всего, откройте логи за последние 3 месяца и рассчитайте соотношение cache_read_input_tokens к входным токенам.

  • Для проектов с коэффициентом попадания в кэш менее 40% проверьте способ внедрения промптов.
  • Вместо отправки всей кодовой базы при каждом запросе измените логику так, чтобы в качестве контекста передавались только измененные файлы на основе git diff.
  • Установите фиксированные правила в верхней части системного промпта и объявите cache_control: {"type": "ephemeral"}.

Простое перемещение динамических переменных вниз по промпту и кэширование статического текста позволяет сократить почти половину фонового расхода токенов.

Разделение моделей в зависимости от сложности задач с помощью прокси LiteLLM

Нет необходимости писать каждую строчку кода с помощью Sonnet или Opus. Вызов пограничной облачной модели для автодополнения вкладок — это явная трата ресурсов.

Классификация задач Вызываемая модель Место выполнения Уровень затрат
Архитектурное проектирование и масштабный рефакторинг Claude 3.5 Sonnet Облачный API Базовый тариф (100%)
Простые утилитные функции и модульные тесты Claude 3.5 Haiku, DeepSeek-V3 Облачный API Около 20% ~ 30%
Автодополнение вкладок в реальном времени и шаблонный код Ollama (Qwen2.5-Coder 14B) Локальное устройство (On-Device) $0.00

Запустите LiteLLM на локальной машине в качестве шлюза трафика. Напишите правила маршрутизации моделей в файле config.yaml.

`yaml
model_list:

  • model_name: smart-model
    litellm_params:
    model: anthropic/claude-3-5-sonnet-20241022
    api_key: os.environ/ANTHROPIC_API_KEY
  • model_name: fast-model
    litellm_params:
    model: deepseek/deepseek-chat
    api_key: os.environ/DEEPSEEK_API_KEY
  • model_name: local-coder
    litellm_params:
    model: ollama/qwen2.5-coder:14b
    api_base: http://localhost:11434

`

Укажите в терминале export ANTHROPIC_BASE_URL="http://localhost:4000" и подключите Continue.dev или Claude Code. Автодополнение в реальном времени обрабатывается локальной моделью Qwen на GPU, а сложные вопросы проектирования передаются в Sonnet.

Также параллельно выполняйте работу по сокращению выходных токенов. Если настроить системный промпт так, чтобы исключить все ненужные введения, приветствия и объяснения кода, возвращая только блоки кода, расходы на дорогие выходные токены существенно уменьшатся.

Перенос оставшихся месячных кредитов в Batch API для их использования

Месячные кредиты Anthropic просто испаряются после истечения срока действия. Чтобы не терять оставшийся баланс, за 3 дня до сгорания необходимо запустить пакетный API Anthropic (Batch API).

Пакетный API снижает стоимость всех токенов на 50% при условии асинхронного возврата в течение 24 часов. Если объединить это с кэшированием промптов, обработку можно осуществлять на уровне 5% от первоначальной стоимости. Соберите задачи, которые не требуют немедленного ответа в реальном времени, и отправьте их за раз.

  1. Статический анализ всей кодовой базы и проверка уязвимостей безопасности
  2. Массовая генерация кода модульных тестов для устаревшего кода
  3. Автоматическое обновление спецификаций API-эндпоинтов и технической документации

Если упаковать эти задачи в файл JSONL и отправить на пакетный эндпоинт, кредиты, которые грозили сгореть, можно превратить в юнит-тесты и полезную документацию.

Фиксация лимитов расходов и локальных обходных путей

Чтобы предотвратить чрезмерные списания, отключите автопополнение (Auto-Recharge) в настройках выставления счетов консоли Anthropic и в начале месяца вручную пополняйте баланс примерно на $150.

Задайте лимит вызовов непосредственно в меню Spend Limits консоли на уровне $150, а затем добавьте настройки резервного копирования (Fallback) в прокси LiteLLM.

`yaml
router_settings:
fallbacks:
- claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]

`

Даже если кредиты закончатся и возникнет ошибка 429, локальная Ollama мгновенно перехватит вызовы. Если вы работаете в команде, достаточно поделиться .continue/config.json в корне git-репозитория и установить месячный лимит виртуального ключа (Virtual Key) для каждого участника на уровне $50 на странице администратора LiteLLM. Трафик разработчиков, превысивших лимит, будет перенаправляться на локальную модель, поэтому общие расходы команды не выйдут за рамки бюджета.