Einstellungen zur Begrenzung der monatlichen API-Ausgaben auf rund 200.000 Won nach Anthropic-Tarifreform
Für Freiberufler oder kleine Teams mit einem monatlichen Entwicklungsbudget von weniger als 500.000 Won ist die jüngste Tarifänderung von Anthropic ziemlich ärgerlich. Die Nutzung von Drittanbietertools wurde eingeschränkt, und jeden Monat verfallen die verbleibenden Guthaben, anstatt in den nächsten Monat übertragen zu werden. Wer jedoch blindlings nur den offiziellen Client nutzt, stellt fest, dass die API-Rechnung nach ein paar Mal Codieren schnell die Marke von Hunderttausenden Won überschreitet.
Das Problem lässt sich nicht einfach durch den Wechsel des Tools lösen. Man muss die Struktur, in der Prompts ausgetauscht werden, direkt anpassen, um den Kontostand zu schützen.
Zuerst die Token-Verbrauchsprotokolle überprüfen und die Cache-Trefferquote korrigieren
Agentenbasierte Codierungstools senden bei einer einzigen Anfrage zigtausend Tokens an Kontext auf einmal. Ein Blick auf die offizielle Preistabelle von Anthropic zeigt, dass die Standard-Eingabekosten für Claude 3.5 Sonnet 3,00 pro1MillionTokensunddieAusgabekosten15,00 betragen. Bei Anwendung von Prompt Caching sinkt der Eingabepreis hingegen auf 0,30 $. Das ist ein Unterschied von 90 %. Sobald eine Drittanbieter-Erweiterung einen Zeitstempel oder eine Sitzungs-ID ganz oben in den System-Prompt einfügt, wird dieser Cache komplett zerstört und man zahlt jedes Mal 3,00 $.
Öffnen Sie als Erstes die Protokolle der letzten drei Monate und berechnen Sie das Verhältnis von Eingabe-Tokens zu cache_read_input_tokens.
- Bei Projekten mit einer Cache-Trefferquote von unter 40 % überprüfen Sie die Methode der Prompt-Einspeisung.
- Anstatt bei jeder Anfrage die gesamte Codebasis zu senden, modifizieren Sie das System so, etliche Änderungen basierend auf
git diff als Kontext übergeben werden.
- Platzieren Sie feste Regeln oben im System-Prompt und deklarieren Sie
cache_control: {"type": "ephemeral"}.
Bereits das Verschieben dynamischer Variablen an das Ende des Prompt und das Cachen des statischen Textes kann die Hintergrund-Token-Verschwendung um fast die Hälfte reduzieren.
Modelle je nach Arbeitsaufwand mit dem LiteLLM-Proxy aufteilen
Es ist nicht notwendig, jede Codezeile mit Sonnet oder Opus zu schreiben. Das Aufrufen eines Cloud-Frontier-Modells für Tab-Autovervollständigungen ist reine Verschwendung.
| Arbeitsklassifizierung |
Aufgerufenes Modell |
Ausführungsort |
Kostenstufe |
| Architekturdesign und großes Refactoring |
Claude 3.5 Sonnet |
Cloud-API |
Standardtarif (100 %) |
| Einfache Hilfsfunktionen und Unit-Tests |
Claude 3.5 Haiku, DeepSeek-V3 |
Cloud-API |
Ca. 20 % bis 30 % |
| Echtzeit-Tab-Vervollständigung und Boilerplate |
Ollama (Qwen2.5-Coder 14B) |
Lokales On-Device |
0,00 $ |
Starten Sie LiteLLM auf Ihrem lokalen Computer und richten Sie es als Traffic-Gateway ein. Schreiben Sie die Modell-Routing-Regeln in die config.yaml.
`yaml
model_list:
- model_name: smart-model
litellm_params:
model: anthropic/claude-3-5-sonnet-20241022
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: fast-model
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY
- model_name: local-coder
litellm_params:
model: ollama/qwen2.5-coder:14b
api_base: http://localhost:11434
`
Geben Sie im Terminal export ANTHROPIC_BASE_URL="http://localhost:4000" ein und verknüpfen Sie Continue.dev oder Claude Code. Die Echtzeit-Autovervollständigung wird vom Qwen-Modell der lokalen GPU verarbeitet, während nur komplexe Designfragen an Sonnet weitergeleitet werden.
Führen Sie parallel dazu Maßnahmen zur Reduzierung der Ausgabe-Tokens durch. Wenn Sie im System-Prompt unnötige Einleitungen, Begrüßungen und Code-Erklärungen komplett weglassen und nur Codeblöcke zurückgeben lassen, sinken die Ausgaben für die teuren Ausgabe-Tokens erheblich.
Verbleibendes monatliches Guthaben über die Batch-API aufbrauchen
Das monatliche Anthropic-Guthaben verfällt einfach, sobald das Ablaufdatum überschritten ist. Um das restliche Guthaben nicht zu verschwenden, sollten Sie drei Tage vor Ablauf die Anthropic Batch API ausführen.
Die Batch-API gewährt einen Rabatt von 50 % auf alle Token-Preise unter der Bedingung einer asynchronen Rückgabe innerhalb von 24 Stunden. Wenn Sie dies noch mit Prompt Caching kombinieren, können Sie die Verarbeitung auf etwa 5 % des ursprünglichen Preises reduzieren. Sammeln Sie Aufgaben, die keine sofortige Echtzeit-Antwort erfordern, und senden Sie diese gebündelt ab:
- Statische Analyse der gesamten Codebasis und Überprüfung von Sicherheitslücken.
- Massenhafte Generierung von Unit-Test-Code für Legacy-Code.
- Automatische Aktualisierung von API-Endpunkt-Spezifikationen und technischer Dokumentation.
Wenn Sie diese Aufgaben in einer JSONL-Datei bündeln und an den Batch-Endpunkt senden, können Sie das Guthaben, das andernfalls verfallen wäre, in Testcode und Dokumentationsressourcen umwandeln.
Ausgabenlimits und lokale Umgehungswege festlegen
Um übermäßige Abrechnungen zu verhindern, deaktivieren Sie die automatische Aufladung (Auto-Recharge) in den Zahlungseinstellungen der Anthropic-Konsole und zahlen Sie zu Monatsbeginn manuell nur etwa 150 $ ein.
Begrenzen Sie das direkte Aufruflimit im Menü „Spend Limits“ der Konsole auf 150 $ und fügen Sie anschließend Fallback-Einstellungen zum LiteLLM-Proxy hinzu:
`yaml
router_settings:
fallbacks:
- claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]
`
Sollte das Guthaben aufgebraucht sein und ein 429-Fehler auftreten, übernimmt das lokale Ollama sofort die Aufrufe. Wenn Sie in einem Team arbeiten, teilen Sie .continue/config.json im Stammverzeichnis des Git-Repositorys und legen Sie auf der LiteLLM-Verwaltungsseite das monatliche Limit für den virtuellen Schlüssel (Virtual Key) jedes Teammitglieds auf 50 $ fest. Da nur der Datenverkehr von Entwicklern, die ihr Limit überschritten haben, auf das lokale Modell umgeschaltet wird, werden die Gesamtausgaben des Teams das Budget nicht überschreiten.