TuBrief
구독 채널
비디오
커뮤니티

Einstellungen zur Begrenzung der monatlichen API-Ausgaben auf rund 200.000 Won nach Anthropic-Tarifreform

TuBrief 편집팀
2026년 8월 19일
0
Computing/Software

원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.

Deutsch한국어EnglishEspañol中文العربيةहिन्दीFrançaisPortuguêsРусскийBahasa Indonesia

관련 영상

Ist das neue Guthabensystem von Claude eine Falle für Entwickler?6:10

Ist das neue Guthabensystem von Claude eine Falle für Entwickler?

Better Stack

커뮤니티의 다른 글

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

2026년 9월 13일

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

2026년 9월 13일

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

2026년 9월 13일

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

2026년 9월 13일

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

2026년 9월 12일

Apple Won the AI Race

2026년 9월 12일

댓글 (0)

Log in to leave a comment

아직 작성된 글이 없습니다

© 2026 . All rights reserved.

TuBrief
구독 채널
비디오
커뮤니티
로그인

Einstellungen zur Begrenzung der monatlichen API-Ausgaben auf rund 200.000 Won nach Anthropic-Tarifreform

Für Freiberufler oder kleine Teams mit einem monatlichen Entwicklungsbudget von weniger als 500.000 Won ist die jüngste Tarifänderung von Anthropic ziemlich ärgerlich. Die Nutzung von Drittanbietertools wurde eingeschränkt, und jeden Monat verfallen die verbleibenden Guthaben, anstatt in den nächsten Monat übertragen zu werden. Wer jedoch blindlings nur den offiziellen Client nutzt, stellt fest, dass die API-Rechnung nach ein paar Mal Codieren schnell die Marke von Hunderttausenden Won überschreitet.

Das Problem lässt sich nicht einfach durch den Wechsel des Tools lösen. Man muss die Struktur, in der Prompts ausgetauscht werden, direkt anpassen, um den Kontostand zu schützen.

Zuerst die Token-Verbrauchsprotokolle überprüfen und die Cache-Trefferquote korrigieren

Agentenbasierte Codierungstools senden bei einer einzigen Anfrage zigtausend Tokens an Kontext auf einmal. Ein Blick auf die offizielle Preistabelle von Anthropic zeigt, dass die Standard-Eingabekosten für Claude 3.5 Sonnet 3,00 pro1MillionTokensunddieAusgabekosten15,00pro 1 Million Tokens und die Ausgabekosten 15,00pro1MillionTokensunddieAusgabekosten15,00 betragen. Bei Anwendung von Prompt Caching sinkt der Eingabepreis hingegen auf 0,30 $. Das ist ein Unterschied von 90 %. Sobald eine Drittanbieter-Erweiterung einen Zeitstempel oder eine Sitzungs-ID ganz oben in den System-Prompt einfügt, wird dieser Cache komplett zerstört und man zahlt jedes Mal 3,00 $.

Öffnen Sie als Erstes die Protokolle der letzten drei Monate und berechnen Sie das Verhältnis von Eingabe-Tokens zu cache_read_input_tokens.

  • Bei Projekten mit einer Cache-Trefferquote von unter 40 % überprüfen Sie die Methode der Prompt-Einspeisung.
  • Anstatt bei jeder Anfrage die gesamte Codebasis zu senden, modifizieren Sie das System so, etliche Änderungen basierend auf git diff als Kontext übergeben werden.
  • Platzieren Sie feste Regeln oben im System-Prompt und deklarieren Sie cache_control: {"type": "ephemeral"}.

Bereits das Verschieben dynamischer Variablen an das Ende des Prompt und das Cachen des statischen Textes kann die Hintergrund-Token-Verschwendung um fast die Hälfte reduzieren.

Modelle je nach Arbeitsaufwand mit dem LiteLLM-Proxy aufteilen

Es ist nicht notwendig, jede Codezeile mit Sonnet oder Opus zu schreiben. Das Aufrufen eines Cloud-Frontier-Modells für Tab-Autovervollständigungen ist reine Verschwendung.

Arbeitsklassifizierung Aufgerufenes Modell Ausführungsort Kostenstufe
Architekturdesign und großes Refactoring Claude 3.5 Sonnet Cloud-API Standardtarif (100 %)
Einfache Hilfsfunktionen und Unit-Tests Claude 3.5 Haiku, DeepSeek-V3 Cloud-API Ca. 20 % bis 30 %
Echtzeit-Tab-Vervollständigung und Boilerplate Ollama (Qwen2.5-Coder 14B) Lokales On-Device 0,00 $

Starten Sie LiteLLM auf Ihrem lokalen Computer und richten Sie es als Traffic-Gateway ein. Schreiben Sie die Modell-Routing-Regeln in die config.yaml.

`yaml
model_list:

  • model_name: smart-model
    litellm_params:
    model: anthropic/claude-3-5-sonnet-20241022
    api_key: os.environ/ANTHROPIC_API_KEY
  • model_name: fast-model
    litellm_params:
    model: deepseek/deepseek-chat
    api_key: os.environ/DEEPSEEK_API_KEY
  • model_name: local-coder
    litellm_params:
    model: ollama/qwen2.5-coder:14b
    api_base: http://localhost:11434

`

Geben Sie im Terminal export ANTHROPIC_BASE_URL="http://localhost:4000" ein und verknüpfen Sie Continue.dev oder Claude Code. Die Echtzeit-Autovervollständigung wird vom Qwen-Modell der lokalen GPU verarbeitet, während nur komplexe Designfragen an Sonnet weitergeleitet werden.

Führen Sie parallel dazu Maßnahmen zur Reduzierung der Ausgabe-Tokens durch. Wenn Sie im System-Prompt unnötige Einleitungen, Begrüßungen und Code-Erklärungen komplett weglassen und nur Codeblöcke zurückgeben lassen, sinken die Ausgaben für die teuren Ausgabe-Tokens erheblich.

Verbleibendes monatliches Guthaben über die Batch-API aufbrauchen

Das monatliche Anthropic-Guthaben verfällt einfach, sobald das Ablaufdatum überschritten ist. Um das restliche Guthaben nicht zu verschwenden, sollten Sie drei Tage vor Ablauf die Anthropic Batch API ausführen.

Die Batch-API gewährt einen Rabatt von 50 % auf alle Token-Preise unter der Bedingung einer asynchronen Rückgabe innerhalb von 24 Stunden. Wenn Sie dies noch mit Prompt Caching kombinieren, können Sie die Verarbeitung auf etwa 5 % des ursprünglichen Preises reduzieren. Sammeln Sie Aufgaben, die keine sofortige Echtzeit-Antwort erfordern, und senden Sie diese gebündelt ab:

  1. Statische Analyse der gesamten Codebasis und Überprüfung von Sicherheitslücken.
  2. Massenhafte Generierung von Unit-Test-Code für Legacy-Code.
  3. Automatische Aktualisierung von API-Endpunkt-Spezifikationen und technischer Dokumentation.

Wenn Sie diese Aufgaben in einer JSONL-Datei bündeln und an den Batch-Endpunkt senden, können Sie das Guthaben, das andernfalls verfallen wäre, in Testcode und Dokumentationsressourcen umwandeln.

Ausgabenlimits und lokale Umgehungswege festlegen

Um übermäßige Abrechnungen zu verhindern, deaktivieren Sie die automatische Aufladung (Auto-Recharge) in den Zahlungseinstellungen der Anthropic-Konsole und zahlen Sie zu Monatsbeginn manuell nur etwa 150 $ ein.

Begrenzen Sie das direkte Aufruflimit im Menü „Spend Limits“ der Konsole auf 150 $ und fügen Sie anschließend Fallback-Einstellungen zum LiteLLM-Proxy hinzu:

`yaml
router_settings:
fallbacks:
- claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]

`

Sollte das Guthaben aufgebraucht sein und ein 429-Fehler auftreten, übernimmt das lokale Ollama sofort die Aufrufe. Wenn Sie in einem Team arbeiten, teilen Sie .continue/config.json im Stammverzeichnis des Git-Repositorys und legen Sie auf der LiteLLM-Verwaltungsseite das monatliche Limit für den virtuellen Schlüssel (Virtual Key) jedes Teammitglieds auf 50 $ fest. Da nur der Datenverkehr von Entwicklern, die ihr Limit überschritten haben, auf das lokale Modell umgeschaltet wird, werden die Gesamtausgaben des Teams das Budget nicht überschreiten.