TuBrief
구독 채널
비디오
커뮤니티

앤트로픽 요금 개편 후 월 API 지출을 20만 원대로 묶어두는 설정

TuBrief 편집팀
2026년 8월 19일
0
컴퓨터/소프트웨어

원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.

한국어EnglishEspañol中文العربيةहिन्दीDeutschFrançaisPortuguêsРусскийBahasa Indonesia

관련 영상

Claude의 새로운 크레딧 시스템, 개발자에게 덫일까?6:10

Claude의 새로운 크레딧 시스템, 개발자에게 덫일까?

Better Stack

커뮤니티의 다른 글

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

2026년 9월 13일

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

2026년 9월 13일

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

2026년 9월 13일

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

2026년 9월 13일

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

2026년 9월 12일

Apple Won the AI Race

2026년 9월 12일

댓글 (0)

Log in to leave a comment

아직 작성된 글이 없습니다

© 2026 . All rights reserved.

TuBrief
구독 채널
비디오
커뮤니티
로그인

앤트로픽 요금 개편 후 월 API 지출을 20만 원대로 묶어두는 설정

월 개발 예산 50만 원 미만으로 작업하는 프리랜서나 소규모 팀에게 이번 앤트로픽 정책 변경은 꽤 골치 아픈 일입니다. 서드파티 툴 사용에 제약이 생겼고, 매달 남은 크레딧은 다음 달로 넘어가지 않고 그대로 사라집니다. 그렇다고 무작정 공식 클라이언트만 쓰다 보면 코딩 몇 번에 API 청구액이 수십만 원을 훌쩍 넘깁니다.

도구를 바꾼다고 해결될 문제가 아닙니다. 프롬프트가 오가는 구조 자체를 손봐야 통장 잔고를 지킬 수 있습니다.

토큰 소비 로그를 확인해 캐시 적중률부터 고친다

에이전트 기반 코딩 도구는 요청 한 번에 수만 토큰의 컨텍스트를 통째로 보냅니다. 앤트로픽 공식 요금표를 보면 Claude 3.5 Sonnet의 기본 입력 비용은 100만 토큰당 $3.00, 출력은 $15.00입니다. 반면 프롬프트 캐싱을 적용하면 입력 단가가 $0.30로 떨어집니다. 90% 차이입니다. 서드파티 확장이 시스템 프롬프트 맨 위에 타임스탬프나 세션 ID를 집어넣는 순간, 이 캐시는 전부 깨지고 매번 $3.00를 내게 됩니다.

가장 먼저 지난 3개월치 로그를 열어 입력 토큰 대비 cache_read_input_tokens 비율을 계산해 봅니다.

  • 캐시 적중률이 40% 미만인 프로젝트는 프롬프트 주입 방식을 점검합니다.
  • 매 요청마다 전체 코드베이스를 전송하는 대신, git diff 기반의 변경 파일만 컨텍스트로 넘기도록 수정합니다.
  • 시스템 프롬프트 상단에는 고정 규칙을 두고 cache_control: {"type": "ephemeral"}을 선언합니다.

동적 변수를 프롬프트 하단으로 내리고 정적 텍스트를 캐싱하는 것만으로 백그라운드 토큰 낭비를 절반 가까이 덜어낼 수 있습니다.

LiteLLM 프록시로 작업 난이도에 맞춰 모델을 나눈다

모든 줄의 코드를 Sonnet이나 Opus로 짤 필요는 없습니다. 탭 자동완성에 클라우드 프론티어 모델을 호출하는 건 명백한 낭비입니다.

작업 분류 호출 모델 실행 위치 비용 수준
아키텍처 설계 및 대규모 리팩토링 Claude 3.5 Sonnet 클라우드 API 기준 요금 (100%)
단순 유틸리티 함수 및 단위 테스트 Claude 3.5 Haiku, DeepSeek-V3 클라우드 API 20% ~ 30% 선
실시간 탭 완성 및 보일러플레이트 Ollama (Qwen2.5-Coder 14B) 로컬 On-Device $0.00

로컬 머신에 LiteLLM을 띄워 트래픽 게이트웨이로 둡니다. config.yaml에 모델 라우팅 규칙을 작성합니다.

model_list:
  - model_name: smart-model
    litellm_params:
      model: anthropic/claude-3-5-sonnet-20241022
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: fast-model
    litellm_params:
      model: deepseek/deepseek-chat
      api_key: os.environ/DEEPSEEK_API_KEY
  - model_name: local-coder
    litellm_params:
      model: ollama/qwen2.5-coder:14b
      api_base: http://localhost:11434

터미널에서 export ANTHROPIC_BASE_URL="http://localhost:4000"을 지정하고 Continue.dev나 Claude Code를 연동합니다. 실시간 자동완성은 로컬 GPU의 Qwen 모델로 처리하고, 복잡한 설계 질문만 Sonnet으로 전달합니다.

출력 토큰을 줄이는 작업도 병행합니다. 시스템 프롬프트에 불필요한 서론, 인사말, 코드 해설을 전부 생략하고 코드 블록만 반환하도록 작성하면 단가가 높은 출력 토큰 지출이 크게 줄어듭니다.

남은 월간 크레딧은 배치 API로 넘겨 소진한다

앤트로픽 월간 크레딧은 만료일이 지나면 그냥 증발합니다. 남은 잔액을 버리지 않으려면 소멸 3일 전에 앤트로픽 배치 API(Batch API)를 돌려야 합니다.

배치 API는 24시간 이내 비동기 반환을 조건으로 모든 토큰 가격을 50% 깎아줍니다. 여기에 프롬프트 캐싱까지 묶으면 원래 가격의 5% 수준으로 처리할 수 있습니다. 당장 실시간 답변이 필요 없는 작업들을 모아서 한 번에 넘깁니다.

  1. 전체 코드베이스에 대한 정적 분석 및 보안 취약점 점검
  2. 레거시 코드의 단위 테스트 코드 대량 생성
  3. API 엔드포인트 명세서 및 기술 문서 자동 업데이트

이 작업들을 JSONL 파일로 묶어 배치 엔드포인트에 밀어 넣으면, 버려질 뻔한 크레딧을 테스트 코드와 문서 자산으로 바꿀 수 있습니다.

지출 한도와 로컬 우회 경로를 고정한다

과도한 청구를 막으려면 앤트로픽 콘솔의 결제 설정에서 자동 충전(Auto-Recharge)을 끄고, 월초에 수동으로 $150 안팎만 결제합니다.

콘솔의 Spend Limits 메뉴에서 직접 호출 한도를 $150로 묶어둔 뒤, LiteLLM 프록시에 장애 복구(Fallback) 설정을 추가합니다.

router_settings:
  fallbacks:
    - claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]

크레딧이 다 떨어져서 429 오류가 발생해도 로컬 Ollama가 즉시 호출을 넘겨받습니다. 팀 단위로 작업한다면 .continue/config.json을 깃 저장소 루트에 공유하고, LiteLLM 관리자 페이지에서 팀원별 가상 키(Virtual Key)의 월간 한도를 $50로 지정해 두면 됩니다. 한도를 넘긴 개발자의 트래픽만 로컬 모델로 전환되므로 팀 전체 지출이 예산을 넘길 일이 없습니다.