Настройка ограничения месячных расходов на API Anthropic в пределах 200 000 вон после изменения цен
Недавнее изменение политики Anthropic стало довольно серьезной головной болью для фрилансеров и небольших команд, работающих с месячным бюджетом на разработку менее 500 000 вон. Появились ограничения на использование сторонних инструментов, а оставшиеся ежемесячные кредиты больше не переносятся на следующий месяц и просто сгорают. При этом, если слепо пользоваться только официальным клиентом, пара сеансов кодинга легко превышают счета за API в несколько сотен тысяч вон.
Проблема не решится простой сменой инструментов. Чтобы защитить остаток на балансе, необходимо переработать саму структуру прохождения промптов.
Начните с проверки логов потребления токенов и исправления коэффициента попадания в кэш
Инструменты кодинга на базе агентов отправляют десятки тысяч токенов контекста целиком за один запрос. Согласно официальному прайс-листу Anthropic, базовая стоимость ввода для Claude 3.5 Sonnet составляет $3.00 за 1 миллион токенов, а вывода — $15.00. С другой стороны, при применении кэширования промптов цена ввода падает до $0.30. Разница составляет 90%. Как только стороннее расширение добавляет временную метку или идентификатор сеанса в самый верх системного промпта, весь этот кэш сбрасывается, и вам приходится платить $3.00 каждый раз.
Прежде всего, откройте логи за последние 3 месяца и рассчитайте соотношение cache_read_input_tokens к входным токенам.
- Для проектов с коэффициентом попадания в кэш менее 40% проверьте способ внедрения промптов.
- Вместо отправки всей кодовой базы при каждом запросе измените логику так, чтобы в качестве контекста передавались только измененные файлы на основе
git diff.
- Установите фиксированные правила в верхней части системного промпта и объявите
cache_control: {"type": "ephemeral"}.
Простое перемещение динамических переменных вниз по промпту и кэширование статического текста позволяет сократить почти половину фонового расхода токенов.
Разделение моделей в зависимости от сложности задач с помощью прокси LiteLLM
Нет необходимости писать каждую строчку кода с помощью Sonnet или Opus. Вызов пограничной облачной модели для автодополнения вкладок — это явная трата ресурсов.
| Классификация задач |
Вызываемая модель |
Место выполнения |
Уровень затрат |
| Архитектурное проектирование и масштабный рефакторинг |
Claude 3.5 Sonnet |
Облачный API |
Базовый тариф (100%) |
| Простые утилитные функции и модульные тесты |
Claude 3.5 Haiku, DeepSeek-V3 |
Облачный API |
Около 20% ~ 30% |
| Автодополнение вкладок в реальном времени и шаблонный код |
Ollama (Qwen2.5-Coder 14B) |
Локальное устройство (On-Device) |
$0.00 |
Запустите LiteLLM на локальной машине в качестве шлюза трафика. Напишите правила маршрутизации моделей в файле config.yaml.
`yaml
model_list:
- model_name: smart-model
litellm_params:
model: anthropic/claude-3-5-sonnet-20241022
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: fast-model
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY
- model_name: local-coder
litellm_params:
model: ollama/qwen2.5-coder:14b
api_base: http://localhost:11434
`
Укажите в терминале export ANTHROPIC_BASE_URL="http://localhost:4000" и подключите Continue.dev или Claude Code. Автодополнение в реальном времени обрабатывается локальной моделью Qwen на GPU, а сложные вопросы проектирования передаются в Sonnet.
Также параллельно выполняйте работу по сокращению выходных токенов. Если настроить системный промпт так, чтобы исключить все ненужные введения, приветствия и объяснения кода, возвращая только блоки кода, расходы на дорогие выходные токены существенно уменьшатся.
Перенос оставшихся месячных кредитов в Batch API для их использования
Месячные кредиты Anthropic просто испаряются после истечения срока действия. Чтобы не терять оставшийся баланс, за 3 дня до сгорания необходимо запустить пакетный API Anthropic (Batch API).
Пакетный API снижает стоимость всех токенов на 50% при условии асинхронного возврата в течение 24 часов. Если объединить это с кэшированием промптов, обработку можно осуществлять на уровне 5% от первоначальной стоимости. Соберите задачи, которые не требуют немедленного ответа в реальном времени, и отправьте их за раз.
- Статический анализ всей кодовой базы и проверка уязвимостей безопасности
- Массовая генерация кода модульных тестов для устаревшего кода
- Автоматическое обновление спецификаций API-эндпоинтов и технической документации
Если упаковать эти задачи в файл JSONL и отправить на пакетный эндпоинт, кредиты, которые грозили сгореть, можно превратить в юнит-тесты и полезную документацию.
Фиксация лимитов расходов и локальных обходных путей
Чтобы предотвратить чрезмерные списания, отключите автопополнение (Auto-Recharge) в настройках выставления счетов консоли Anthropic и в начале месяца вручную пополняйте баланс примерно на $150.
Задайте лимит вызовов непосредственно в меню Spend Limits консоли на уровне $150, а затем добавьте настройки резервного копирования (Fallback) в прокси LiteLLM.
`yaml
router_settings:
fallbacks:
- claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]
`
Даже если кредиты закончатся и возникнет ошибка 429, локальная Ollama мгновенно перехватит вызовы. Если вы работаете в команде, достаточно поделиться .continue/config.json в корне git-репозитория и установить месячный лимит виртуального ключа (Virtual Key) для каждого участника на уровне $50 на странице администратора LiteLLM. Трафик разработчиков, превысивших лимит, будет перенаправляться на локальную модель, поэтому общие расходы команды не выйдут за рамки бюджета.