Skript zur Token-Budgetverwaltung, um exorbitante Kosten für die Cloud Code API zu verhindern
1. Blockierung von Kosten durch Festlegen von Token-Obergrenzen
Wenn du bei kleinen Projekten nach Erhalt der API-Rechnung schon einmal überrascht warst, lag das daran, dass keine Budgetlimits festgelegt waren. Agenten halten den Gesprächskontext oft länger aufrecht als gedacht und lesen wiederholt unnötige Dateiinhalte ein. Wenn man das unkontrolliert lässt, verschwinden innerhalb eines Tages Hunderttausende von Tokens. Du musst die Datei ~/.claude/settings.json öffnen, um die Sitzungs- und Tagesnutzung direkt einzuschränken.
Das Hinzufügen des Budget-Objekts zur globalen Konfigurationsdatei des Benutzers funktioniert wie folgt:
- Öffne das Terminal und öffne die Datei ~/.claude/settings.json mit einem Editor.
- Gib im JSON-Block den Wert
500000 für sessionLimit und 2000000 für dailyLimit ein.
- Lege
warningThreshold auf 0.75 und autoCompactAt auf 0.60 fest und speichere die Datei.
Wenn das Kontextvolumen 60 Prozent erreicht, wird der Gesprächsverlauf automatisch komprimiert, wodurch unnötige Token-Verschwendung entfällt. Da Sitzungen vor Erreichen des Tageslimits unterbrochen werden, musst du dir keine Sorgen mehr über Budgetüberschreitungen machen.
2. Einrichten eines Loop-Breakers zum erzwungenen Abbruch bei 3 Fehlern in Folge
Wenn ein Agent aufgrund von Syntaxfehlern oder Problemen mit Dateipfaden im selben Hook stecken bleibt, dreht er sich in einer Endlosschleife, ohne das Problem zu lösen. Wenn dieser Zustand unkontrolliert bleibt, sind die Sitzungstokens innerhalb weniger Minuten aufgebraucht. Es nützt nichts, einfach nur in den Prompt zu schreiben, dass man vorsichtig sein soll. Ein auf Shell-Skripten basierendes Hook-System muss integriert werden, um dies physisch zu verhindern.
Erstelle ein Hook-Skript, das den Prozess sofort beendet, wenn derselbe Fehler dreimal hintereinander erkannt wird:
- Erstelle die Datei .claude/hooks/loop-breaker.sh im Projektverzeichnis und erteile ihr Ausführungsrechte.
- Das Skript greift auf eine temporäre Zustandsdatei zu, um den Fehlerzähler um 1 zu erhöhen. Wenn die kumulierte Anzahl 3 oder mehr beträgt, wird ein Standardfehler ausgegeben und der Exit-Code
2 zurückgegeben, um die Arbeit gewaltsam abzubrechen.
- Registriere den entsprechenden Skriptpfad unter dem Eintrag
PostToolUseFailure in der Datei .claude/settings.json, um eine Echtzeitüberwachung zu ermöglichen.
Durch diese Vorkehrung verschwindet das Phänomen, dass der Agent unendlichen Code korrigiert und dabei Tokens verbrennt. Du kannst die Zeit einsparen, die du sonst in der Debugging-Hölle verschwendet hättest.
3. Trennung von Modell-Routing und manuellen Freigabeabschnitten je nach Art der Aufgabe
Wenn du Claude alle Programmieraufgaben vollständig überlässt, wird das Budget nicht ausreichen. Einfaches Formatieren oder das Erstellen von Boilerplates wird an leichtere Modelle übergeben, während unwiderrufliche Aufgaben wie Datenbankmigrationen vom Entwickler direkt genehmigt werden müssen. Nutze Shell-Aliase, um eine Ausführungsumgebung aufzubauen, die dem Schwierigkeitsgrad der Aufgabe entspricht.
Die Konfiguration zur Trennung der Agenten-Delegationsbefehle nach Art der Aufgabe sieht wie folgt aus:
- Öffne die Datei ~/.bashrc oder ~/.zshrc.
- Registriere den Befehl
alias cc-quick='claude --model claude-haiku-3-20250307 --token-budget 100000' für einfache Dokumentationsaufgaben.
- Füge den Befehl
alias cc-dev='claude --model claude-sonnet-4-20250514 --token-budget 500000 --thinking-budget 8000' für die allgemeine Funktionsentwicklung hinzu und starte das Terminal neu.
Wende diesen Ansatz an, damit der Agent 90 Prozent des einfachen repetitiven Codings sicher abwickelt und das Verhältnis von abgeschlossenen PRs pro 1 Million Tokens spürbar steigt. Dies ist der realistischste Weg, um unnötige API-Kosten sicher zu halbieren.