Claude Code Token 20x GÜNSTIGER machen (& 4 weitere Nutzungstricks)

CChase AI
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Du zahlst möglicherweise zwanzigmal mehr für deine Cloud-Code-Token, als nötig ist, ohne es überhaupt zu wissen.
00:00:05Zu verstehen, wie man das Beste aus seinen Cloud-Code-Token herausholt, ist eine der wichtigsten
00:00:08Fähigkeiten, die du erlernen kannst. Das geht weit über den einfachen Satz in deiner Cloud.md-Datei hinaus,
00:00:14in dem steht: Fasse dich kurz. Denn wenn du nicht verstehst, wie Prompt-Caching überhaupt funktioniert,
00:00:19gibst du am Ende viel mehr aus, als nötig ist. In diesem Video zeige ich dir deshalb fünf
00:00:23verschiedene Wege, um deine Cloud-Token besser zu verwalten und das Maximum aus diesen
00:00:27Top-Modellen herauszuholen. Tipp Nummer eins ist dabei der wichtigste. Dieser wird dir mit Abstand
00:00:31am meisten Geld und Verbrauch einsparen – und zwar mehr als alle anderen Tipps zusammen. Es geht darum zu verstehen,
00:00:37wie Prompt-Caching tatsächlich funktioniert. Um das zu begreifen, müssen wir erst einmal klären, wie Token überhaupt arbeiten.
00:00:43Wir machen daher eine ganz kurze Wiederholung von etwa 60 Sekunden, damit wir alle auf demselben Stand sind.
00:00:47Token sind die Währung großer Sprachmodelle. Stark vereinfacht ausgedrückt entspricht dabei im Grunde
00:00:52jedes Wort einem Token. Wenn du als Nutzer in deiner ersten Nachricht an Fable schreibst: Wie geht es dir heute?,
00:01:00hast du fünf Input-Token gesendet. Wenn Fable dir daraufhin antwortet und sagt: Mir geht es gut, danke,
00:01:09hat dir das vier Output-Token eingebracht. Diese werden unterschiedlich bepreist. Tatsächlich kosten Output-Token
00:01:16im Großen und Ganzen das Fünffache eines Input-Tokens. Diese fünf Input- und vier Output-Token
00:01:23sammeln sich nun innerhalb des Kontextfensters an. Wenn Token die Währung sind, dann ist das Kontextfenster unser Budget.
00:01:31Opus, Fable und Sonnet haben alle ein Budget von einer Million Token. Bisher haben wir also erst
00:01:37neun von einer Million verbraucht – noch lange nicht viel. Interessant wird es jedoch, wenn wir Folgenachrichten
00:01:43nach der ersten senden. In unserer zweiten Nachricht sage ich als Nutzer: Baue mir eine App, keine Fehler,
00:01:50sechs Input-Token, oder? Ich schicke Anthropic und Fable doch nur sechs Input-Token. Nun,
00:01:56nicht ganz. Was ich tatsächlich mitschicke, ist alles. Ich sende Anthropic
00:02:04diese gesamte Konversation bis zu diesem Punkt. Ich sende also nicht wirklich nur sechs Input-Token, sondern tatsächlich
00:02:1116 Input-Token, da ich die fünf von vorhin und die vier von eben mitschicke, weil
00:02:16die gesamte Nachricht übertragen wird, damit es den Kontext verstehen kann. Und das gilt
00:02:20für jede einzelne Folgenachricht: Ich sende immer die Gesamtheit der Unterhaltung
00:02:26vor dieser neuesten Nachricht mit. Man sieht schnell, wie sich das extrem rasant summiert, sodass
00:02:32bei jeder einzelnen Nachricht 5.000, 10.000 oder 100.000 Input-Token gesendet werden. Und dafür
00:02:37zahlst du. Wenn dem so ist, warum verbrauchen wir dann nicht sofort unser gesamtes Kontingent?
00:02:43Warum zahlt nicht jeder eine Milliarde Dollar, jedes Mal, wenn er versucht, diese KI-Systeme zu nutzen?
00:02:47Weil wir offensichtlich Nachricht auf Nachricht senden. Es wird also eine Menge
00:02:51an kumulierter Nachricht an die Server geschickt. Die Lösung hierfür ist das Cache-System. Also ja,
00:02:57wenn ich Nachricht Nummer zwei hier drüben sende, schicke ich tatsächlich all das mit. Aber was zu diesem Zeitpunkt
00:03:05erstellt wurde, ist der Nachrichten-Cache. Und für unsere zweite Nachricht besteht dieser Nachrichten-Cache aus den ersten
00:03:12beiden Nachrichten. Stell dir den Nachrichten-Cache einfach wie ein Dokument vor, das Claude vor sich hat
00:03:17und das eure gesamte Unterhaltung bis zu diesem Punkt enthält. Du unterhältst dich hier mit Claude,
00:03:23sendest nun Nachricht Nummer zwei, nämlich „Baue mir eine App, keine Fehler“. Dank des Cache-Systems
00:03:30befindet sich dieser gesamte Abschnitt, diese ersten beiden Nachrichten, nun in diesem Dokument. Claude und Anthropic
00:03:36sind dadurch in der Lage, dieses Dokument beziehungsweise den Cache zu lesen,
00:03:42sich den gesamten bisherigen Nachrichtenverlauf anzusehen, und das zu einem viel günstigeren Tarif, als wenn du
00:03:47alles auf einmal ohne den Cache senden würdest. So werden die Kosten berechnet. Und diese Kosten
00:03:54sind wichtig, denn dieses Cache-System hält nicht ewig. Du musst verstehen, dass wenn
00:04:00du und Claude miteinander sprechen und wir dieses Cache-Dokument zwischen uns haben, das den gesamten
00:04:06Verlauf enthält und sehr günstig gelesen werden kann, dies nur für genau eine Stunde gespeichert bleibt.
00:04:11Wenn du diese Diskussion mit Claude führst, immer wieder hin und her schreibst,
00:04:16eben immer weiter, und dich dann für eine Stunde entfernst – und du hast ein
00:04:21Dokument, das 500.000 Token lang ist, eine Konversation von 500.000 Token –, verschwindet dies nach einer Stunde.
00:04:29Das ist weg. Wenn du also eine Nachricht sendest, sagen wir die 500.001., wird dir ratzfett
00:04:38eine 500.000-Token-Nachricht zum Vollarif berechnet, selbst wenn du nur gesagt hast: „Hey, was geht?“
00:04:46Verstehe bitte, dass der Cache nur eine Stunde lang hält, wenn es keine Aktivität gibt. Bei jeder Nachricht wird er
00:04:52nämlich aktualisiert. Wenn also 59 Minuten seit unserer letzten Nachricht vergangen sind und ich wieder eine absende,
00:04:56wird der Stundenzähler zurückgesetzt. Warum ist das so wichtig? Wegen der Kosten. Ich sprach
00:05:01in der Einleitung über den Unterschied zwischen einem Cache-Read – also dem Lesen dieses gesamten Verlaufs – im Vergleich zum Lesen der 500.000
00:05:08Nachrichten ohne Cache. Das macht buchstäblich das Zwanzigfache aus. Das spiegelt sich auch in der
00:05:16Preisdokumentation wider. Erinnern wir uns: Output-Token, also das, was Claude uns liefert, ändern sich nie.
00:05:22Bei Fable sprechen wir von 50 Dollar pro Million Token und 25 Dollar bei Opus. Aber bei den Input-Token
00:05:27findet sich der springende Punkt dieser Unterhaltung. Wir reden zwar immer von Basis-Input-Token von
00:05:3310 Dollar pro Million, aber das ist irreführend, da wir in der Realität immer Cache-Writes durchführen.
00:05:40Ein einstündiger Cache-Write, wie du ihn bei einem Abonnementplan nutzt, kostet tatsächlich das Doppelte.
00:05:47Wenn wir also das erste Mal in diesen Cache schreiben – wie bei der ersten Nachricht –, kostet das 20 Dollar pro
00:05:54Million Token. Du wirst hier zwar einen Fünf-Minuten-Cache-Write sehen, aber der ist im Grunde nur für Leute gedacht,
00:05:59die die API nutzen. Vergleiche das nun mit Cache-Hits, bei denen Anthropic einfach das Dokument liest,
00:06:05das sich vor ihm befindet und stündlich angesammelt und aktualisiert wurde: Das kostet 1 Dollar – zwanzigmal günstiger. Ein
00:06:13gewaltiger Unterschied! Deswegen ist dieser ganze Punkt, dieser spezielle Tipp zum Verständnis des Prompt-Cachings und
00:06:18des Token-Systems, so wichtig. Es gibt nichts, worüber ich im weiteren Verlauf spreche,
00:06:22das dir auch nur annähernd einen solchen Effizienzgewinn bringen wird. Nichts.
00:06:29Kommen wir nun zu unserem Beispiel mit der Konversation von 500.000 Token zurück,
00:06:35die wir mit Claude Code führen und kurz davor sind, eine Folgenachricht zu senden. In Szenario Nummer eins
00:06:40gehen wir davon aus, dass wir das Cache-System nutzen. Dieser 500k-Verlauf ist also im Cache gespeichert und ich sende
00:06:46diese neue Nachricht. Die Preiskalkulation funktioniert so, dass immer noch der gesamte Konversationsverlauf
00:06:51gelesen werden muss. Das geschieht zum Tarif von 1 Dollar pro Million Token. Für die nächste Nachricht
00:06:58kostet es mich also 50 Cent, um alles inklusive der neuen Nachricht zu lesen. Stell dir vor, diese neue Nachricht wäre tausend
00:07:05Token lang. Diese tausend Token der Folgenachricht werden nicht mit 1 Dollar pro Million berechnet, sondern mit 20 Dollar
00:07:14pro Million. Bei tausend Token macht das was aus? Etwa zwei Cent oder so? Keine Ahnung.
00:07:18Meine Rechnung stimmt wahrscheinlich nicht ganz, aber der Punkt ist: Der Verlauf kostet 1 Dollar, die neue Nachricht 20 Dollar, weil dies im Cache liegt.
00:07:26Wenn wir das nächste Mal eine Nachricht senden – im selben Szenario –, werden diese tausend Token nun Teil dieses
00:07:32Cache-Dokuments sein. Ergibt Sinn, oder? Das war Szenario eins. Szenario zwei: Wir haben keinen Cache. Wir haben eine Stunde gewartet,
00:07:40um sie zu senden. Nun wird uns das Ganze nicht mit 50 Cent berechnet,
00:07:47sondern stattdessen zum Cache-Write-Tarif, der wie gesagt bei 20 Dollar pro Million liegt. Was wird
00:07:54das kosten? Diese eine Nachricht kostet uns jetzt etwa 10 Dollar. Wir sind also von 50 Cent auf
00:08:0010 Dollar hochgeschnellt, nur weil wir eine Stunde gewartet haben. Das sind so die Konsequenzen,
00:08:05wenn man das nicht versteht. Zeit ist jedoch nicht das Einzige, worüber wir nachdenken müssen, wenn es um den Verlust des Caches geht.
00:08:10Es gibt noch andere Dinge, die ihn komplett zurücksetzen. Und das steht direkt in der Cloud-Code-Dokumentation.
00:08:14Wenn du dein Modell wechselst – du nutzt Fable, wechselst zu Opus und bist bei 500.000 Token –, ist das weg.
00:08:20Der Cache wird zurückgesetzt. Auch das Aufwandstreffen, eine Änderung des Fast-Modus, das Verbinden oder Trennen
00:08:26eines MCP-Servers, Plugins, das Ablehnen von Tools, das Kompaktieren der Unterhaltung oder schlicht ein Update von Cloud Code
00:08:32im Allgemeinen: All diese Dinge setzen den Cache zurück, und deine nächste Nachricht wird zwanzigmal teurer sein,
00:08:38als sie sein müsste. Was kannst du also mit diesen Informationen anfangen?
00:08:42Was tust du, wenn du dich in einer Situation befindest, in der du dich von einer Unterhaltung entfernen musst,
00:08:46die viele wichtige Informationen enthält, du aber länger als eine Stunde weg sein wirst
00:08:50oder über eine Stunde weg warst und gerade zurückkommst und merkst: Oh Mist,
00:08:54ich habe da vorher irgendwie nicht drüber nachgedacht? Genau darüber sprechen wir in Tipp Nummer zwei.
00:08:59Aber zuerst ein kurzes Wort vom Sponsor des heutigen Videos: mir selbst. Ich veröffentliche diese Woche eine komplett aktualisierte
00:09:06Version meiner Cloud Code Masterclass innerhalb von Chase AI+. Seit meiner ersten Veröffentlichung hat sich eine Menge geändert.
00:09:12Ich aktualisiere sie ständig. Im Grunde sind wir seit März, als ich damit herauskam, jedoch einen langen Weg gegangen.
00:09:19Wenn du also dein KI-Können verbessern möchtest, definitiv keinen technischen Hintergrund hast
00:09:24und einen Leitfaden suchst, um zu wissen, wie man dieses Tool von Grund auf bedient,
00:09:28und etwas suchst, das sich auf reale Anwendungsfälle konzentriert, dann ist das genau das Richtige für dich. Es ist zu finden
00:09:33in Chase AI+. Ein Link dazu befindet sich im angepinnten Kommentar. Tipp Nummer zwei dreht sich nun ganz um deine
00:09:37Optionen, wenn wir den Cache verlieren. Wir waren zu lange weg. Wir haben eine Konversation,
00:09:42die zwei-, drei-, vier-, fünfhunderttausend Token lang ist, und möchten wissen, was der nächste Schritt sein sollte,
00:09:47anstatt diese astronomischen Kosten zu bezahlen. Das hängt im Grunde ganz von deinem Szenario ab.
00:09:52Unsere erste Option ist sozusagen die nukleare Option, und das ist einfach /clear einzugeben.
00:09:58Mit Forward-slash-clear wird einfach der gesamte Gesprächsverlauf gelöscht. Und das ist nicht immer eine schlechte
00:10:04Sache. Tatsächlich, wenn Sie an einer Codebasis arbeiten, an einem Projekt mit
00:10:10einer Menge Dateien und viel Kontext, möchten Sie wahrscheinlich einfach /clear verwenden. Woran auch immer
00:10:15Sie gearbeitet haben, worüber Sie auch immer gesprochen haben, die Chancen stehen gut, dass es im Projekt selbst Spuren
00:10:20davon gibt, was passiert ist. Cloud Code kann sich das einfach ansehen. Und wenn Sie eine neue Konversation
00:10:25von Grund auf beginnen, kann es die Fäden wieder aufnehmen und Sie dorthin zurückbringen, wo Sie waren. Sie müssen kein Sklave
00:10:31des vorherigen Gesprächs sein. Ihre zweite Option ist nun, die Komprimierung zu nutzen. Es gibt eine Auto-Kompaktfunktion
00:10:38in Cloud Code, sobald Sie eine bestimmte Anzahl von Token erreichen. Ich schlage vor, nicht darauf zu warten,
00:10:42bis Sie diesen Punkt erreichen, denn wenn wir uns im Bereich von sechs-, sieben-, achthunderttausend Token bewegen, haben wir
00:10:47mit Kontextfäulnis zu kämpfen. Das ist nach wie vor ein Problem bei diesen größeren Modellen, diesen mächtigeren Modellen,
00:10:51aber wir können jederzeit /compact ausführen. Und was das für uns tut: Es erstellt eine
00:10:57Zusammenfassung dessen, worüber wir gesprochen haben. Und im Grunde genommen führt es dann /clear aus,
00:11:03startet aber eine neue Konversation mit dieser Zusammenfassung, sozusagen im Speicher. Wenn Sie also
00:11:10wichtige Dinge in diesem Gespräch hatten und nicht glauben, dass das in der Codebasis ausreicht,
00:11:15damit es das versteht, dann machen Sie einfach eine Komprimierung mit /compact. Es wird eine neue Konversation
00:11:20mit dieser Zusammenfassung beginnen. Und diese Zusammenfassung lebt einfach im Nachrichtenverlauf. Ihre dritte Option
00:11:26ist dem Komprimieren sehr ähnlich, und zwar die Verwendung eines benutzerdefinierten Übergabetools. Es gibt eine Reihe von benutzerdefinierten
00:11:32Übergabefunktionen da draußen. Ich habe selbst eine. Sie erhalten diese in meiner kostenlosen Community. Und der Unterschied
00:11:38zwischen Übergabe und Komprimierung liegt darin, wo diese Zusammenfassung gespeichert wird. Wenn ich also eine Übergabe mache, wird das
00:11:46tatsächlich einfach auf meiner Festplatte abgelegt. Es erstellt eine echte Markdown-Datei mit der Zusammenfassung und
00:11:51allem, was ich darin haben möchte. Und dann kann ich ein neues Gespräch beginnen und sagen: Hey Claude Code, sieh dir
00:11:59dieses Übergabedokument auf der Festplatte an, damit du dich auf den Stand bringen kannst, den du wissen musst. Im Gegensatz zu compact,
00:12:04bei dem keinerlei Datei erstellt wird. Es ist einfach eine Nachricht im Nachrichtenverlauf dieses jeweiligen
00:12:10Gesprächs, das Sie führen – ein subtiler Unterschied. Aber für manche Leute soll es eben eine Datei auf der
00:12:15Festplatte geben. Und oft ist das ein lebendiges Dokument, das ständig aktualisiert wird.
00:12:20Das sind also wirklich Ihre drei Optionen. Möchten Sie einfach alles löschen und von vorne beginnen?
00:12:26Oft ist das völlig in Ordnung. Möchten Sie einfach die native Claude-Funktion nutzen, es komprimieren
00:12:31und die Zusammenfassung direkt einfügen lassen? Oder möchten Sie, dass die Zusammenfassung ein echtes Dokument ist, das sich Claude ansehen kann?
00:12:37Verwenden Sie in diesem Fall die Übergabe. Das sind Ihre drei Optionen. Und oft sind sie besser, als einfach
00:12:42eine neue Nachricht zu senden, denn im Großen und Ganzen sollten Sie sich ohnehin nicht in Bereichen von 400.000, 500.000 oder 600.000
00:12:48Token bewegen. Tipp Nummer drei dreht sich nun um das Modell-Routing. Wie wählen wir das richtige Modell
00:12:53für die jeweilige Aufgabe aus? Damit wir nicht für alles einfach Fable verwenden. Können wir für einfachere Aufgaben
00:12:59ein kleineres, günstigeres, weniger kluges Modell nutzen? Die Antwort lautet ja. Und wir können uns das auf verschiedene Weise nähern.
00:13:04Wir können externe Modelle verwenden. Wir könnten zu GPT Sol gehen. Wir könnten zu GPT Luna und Terra gehen, die gerade
00:13:10supergünstig geworden sind. Wir können lokale Modelle verwenden, oder wir haben Optionen, wenn wir im Anthropic-Ökosystem bleiben wollen.
00:13:16Und der einfachste Weg dafür ist meiner Meinung nach der Beratermodus. Was Sie hier sehen, stammt aus dem ursprünglichen
00:13:22Berater-Blogbeitrag, der vor einigen Monaten veröffentlicht wurde. Es zeigt also Opus und Sonnet, aber dasselbe System
00:13:29gilt auch für Modelle wie Fable. Die Idee ist, dass ein intelligentes Modell wie Fable oder sogar Opus ein
00:13:37kleineres Modell wie Sonnet bei der Ausführung von Aufgaben berät. Das große Modell entwirft also einen Plan,
00:13:43das kleine Modell führt ihn aus, und das kleine Modell kann seinen Kontext jedes Mal mit dem größeren Modell teilen,
00:13:50wenn es auf Probleme stößt. Und dieses Modell rühmt sich besserer Ergebnisse bei geringeren Kosten. Um unsere
00:13:54vorherige Diskussion über Prompt-Caching einzubeziehen: Sowohl der Berater als auch der Ausführende haben ihren eigenen Prompt-Cache,
00:14:01der gleichzeitig arbeitet. Ihre zweite Option besteht darin, Aufgaben an Modelle außerhalb von Claude Code zu delegieren.
00:14:06Eine einfache Möglichkeit ist Codex. Es gibt ein Codex-Plugin für Claude Code, das es sehr einfach macht,
00:14:12Codex über die Claude Code-Schnittstelle aufzurufen. Sie könnten also im Grunde Fable diesen gleichen
00:14:18Beratermodus ausführen lassen, aber anstatt Opus oder Sonnet aufzurufen, ruft es die GPT-Modelle auf. Es gibt
00:14:24andere Repositories wie diesen Fable Advisor, die genau das tun. Und letztendlich ist es ziemlich trivial, einen eigenen
00:14:31Skill einzurichten, der genau das tut. Wenn Sie nach diesen günstigeren Modellen suchen, schlage ich Ihnen nochmals vor,
00:14:36sich die GPT-Modelle anzusehen, insbesondere Luna und Terra, denn erstens wurden ihre Kosten erheblich gesenkt
00:14:41und zweitens gibt es in der Anthropic-Familie wirklich kein Modell, das das tut, was sie tun,
00:14:48und das zu diesem Preis. Man kann sogar noch einen Schritt weiter gehen und einige lokale Modelle einbinden, wenn die
00:14:53Aufgaben dafür sinnvoll sind. Tipp Nummer vier dreht sich nun ganz um Ihre Claude-Hygiene. Sie haben vielleicht
00:14:57kürzlich dieses Video gesehen, das die Runde machte, in dem Boris Cherney, der Schöpfer von Claude Code, sagt:
00:15:01Sie müssen Ihre Claude.md-Datei löschen. Nun, müssen Sie diese Claude.md-Datei wirklich löschen? Nun,
00:15:07nicht unbedingt, aber was Sie tun müssen – und das hat in den letzten ein bis zwei Wochen einige Änderungen erfahren –
00:15:12ist den Befehl /doctor auszuführen. Und was hat das mit Token zu tun?
00:15:18Nun, erstens, was dieser Befehl unter anderem tun wird – wobei wir das Thema Token-bezogen halten –,
00:15:23ist, dass er sich Ihre Claude.md ansehen und dieses Ding kürzen wird.
00:15:30Die Art und Weise, wie diese Modelle funktionieren, insbesondere diese Modelle der 5er-Serie, ist, dass sie nicht so viele
00:15:36Anweisungen benötigen. Wenn Sie sich ansehen, was die Leute vor drei, sechs, neun Monaten für die Claude.mds
00:15:42erstellt haben, waren diese sehr präskriptiv und extrem detailliert. Und zu jener Zeit konnte man vielleicht
00:15:46argumentieren, dass sie das brauchten. Das ist heutzutage nicht mehr der Fall. Eine aufgeblähte Claude.md
00:15:53macht es also nicht nur langsamer, sie kostet Sie buchstäblich Token. Und /doctor wird sich das ansehen
00:15:59und Dinge aus Ihrer Claude.md entfernen, die einfach nicht dort sein müssen. Zweitens
00:16:04wird er sich Dinge ansehen, die Ihren Kontext schädigen oder Ihr Kontextfenster aufblähen.
00:16:10Denn selbst wenn Sie ein neues Gespräch beginnen und /context ausführen, gibt es Dinge,
00:16:15die es füllen. Nun, ich habe kürzlich /doctor ausgeführt, also bin ich einen Großteil meines Ballasts losgeworden,
00:16:20aber so sieht mein Kontextfenster direkt zu Beginn eines Gesprächs aus, ohne dass Nachrichten
00:16:25gesendet wurden. Wir haben bereits 40.000 Token verbraucht. Und was verbraucht davon so viel? Nun, ein Teil davon stammt
00:16:31von Dingen wie Skills, wie Sie hier sehen können. Ein Teil davon umfasst auch Dinge wie den System-Prompt sowie
00:16:36Speicherdateien. Was /doctor tun wird, ist, sich Dinge wie Ihre
00:16:41Skills und Ihre MCPs anzusehen und damit zu beginnen, die zu kürzen, die Sie einfach nicht verwendet haben. Ist das eine enorme Token-Einsparung?
00:16:47Nein, aber es ist etwas, es macht sich am Rande bemerkbar und es ist ein so einfacher Fix. Es gibt keinen
00:16:53Grund, es nicht zu tun, insbesondere wenn Sie jemand sind, der in den letzten sechs Monaten einfach 10 Millionen Skills angesammelt
00:16:58hat, ohne jemals durchzugehen und sie zu reduzieren, denn das Tun wird auch
00:17:03dazu führen, dass Ihre Skills effektiver ausgelöst werden. Und es wird seitens Claude keine Verwirrung darüber geben,
00:17:08welchen Skill es aufrufen muss. Ich wetten, Sie haben wahrscheinlich an die 10 Skills dort liegen, die alle
00:17:12mit Frontend-Design zu tun haben, und Sie brauchen nicht all diese. Dieser sehr einfache und leicht auszuführende Tipp
00:17:17hinsichtlich Ihrer Claude-Hygiene ist einer, den Sie nicht verpassen sollten. Führen Sie einfach doctor aus. Und das
00:17:22bringt uns zu unserem letzten Tipp, der heutzutage meiner Meinung nach der am wenigsten wirksame aus der Reihe ist, nämlich
00:17:28den zusätzlichen Skills und dem Gerüstbau, die man überall herumlungern sieht.
00:17:33Der heutzutage beliebteste ist Ponytail, und im Wesentlichen reduziert er die Menge an Code,
00:17:38den Claude schreibt, während seine Effektivität erhalten bleibt, wodurch es billiger und schneller wird. Nun, ich
00:17:44habe dazu ein Video gemacht, in dem ich diese Zahlen mit dem vergleiche, was in der Realität tatsächlich passiert, denn das GitHub-
00:17:51Repository zeigt nur Haiku 4.5, was offensichtlich sehr veraltet ist. Als ich dies mit Fable ausgeführt habe, haben die Zahlen
00:17:56standgehalten. Tatsächlich sahen die Zahlen mit besseren Modellen sogar noch besser aus. Nun, ich habe die Benchmarks verwendet, die
00:18:01mit diesem GitHub-Repository bereitgestellt wurden. Was für Sie in der Realität funktioniert, unterscheidet sich je nach
00:18:06Komplexität Ihres Projekts vielleicht ein wenig. Aber das ist etwas, das Sie an alles anfügen können, worüber wir
00:18:11bis jetzt gesprochen haben, wenn Sie Ihre Token-Nutzung weiter reduzieren möchten. Ein anderer, den man oft sieht, ist Caveman,
00:18:18das heutzutage beansprucht, Ihre Ausgabe-Token um 65% zu reduzieren. Es gibt viele Leute da draußen, die
00:18:25auch einfach von Einzeilern in Claude MD sprechen, etwas so Einfaches wie zu sagen: Fass dich kurz,
00:18:30was ebenfalls Ihre Ausgabe-Token reduziert. Aber denken Sie daran, Ausgabe-Token sind nur ein Teil des Puzzles.
00:18:36Und dieses Puzzle wird, um auf unsere ursprüngliche Diskussion zurückzukommen, vom Prompt-Caching dominiert. Wenn
00:18:41Sie also sonst nichts aus diesem Video mitgenommen haben, hoffe ich, dass Sie das mitnehmen konnten, denn damit
00:18:46werden wir es heute beenden. Lassen Sie mich also wie immer wissen, was Sie dachten. Schauen Sie unbedingt bei
00:18:50ChaseAI Plus vorbei, wenn Sie die Claude Code Masterclass in die Hände bekommen möchten. Ich veröffentliche dort diese Woche
00:18:55wieder ein riesiges Update. Und ansonsten sieht man sich.

핵심 요약

Das Verständnis und die gezielte Aufrechterhaltung des einstündigen Prompt-Cache-Systems senken die Token-Kosten bei der Nutzung von Claude Code um den Faktor zwanzig.

하이라이트

  • Input-Token kosten im Basistarif 10 Dollar pro Million, während Cache-Hits zwanzigmal günstiger bei 1 Dollar pro Million liegen.

  • Ein ungenutzter Cache verfällt nach genau einer Stunde Inaktivität und treibt die Kosten für die nächste Nachricht massiv nach oben.

  • Befehle wie Modellwechsel, Update, das Aktivieren des Fast-Modus oder MCP-Server-Änderungen setzen den Prompt-Cache sofort zurück.

  • Das Löschen des Verlaufs über den Befehl /clear hilft dabei, bei grossen Codebasen ohne Altlasten neu zu starten.

  • Der Befehl /doctor entfernt ungenutzte Skills, bereinigt die Claude.md-Datei und reduziert dadurch den unnötigen Basis-Token-Verbrauch.

타임라인

Grundlagen des Prompt-Cachings und der Token-Kosten

  • Jede Folgenachricht überträgt die gesamte bisherige Unterhaltung an die Server.
  • Output-Token kosten im Vergleich zu Input-Token stets das Fünffache.
  • Cache-Hits reduzieren die Kosten für gelesene Token auf 1 Dollar pro Million.
  • Der Cache verfällt automatisch nach einer Stunde ohne neue Nachrichten.

Token bilden die Währung und das Budget grosser Sprachmodelle. Da bei jeder neuen Nachricht der gesamte bisherige Verlauf mitgeschickt wird, wächst das Volumen rasant an. Ein Cache-System speichert diese Verläufe temporär ab, wodurch sie beim Lesen deutlich günstiger abgerechnet werden. Nach einer Stunde Inaktivität erlischt dieser Speicher jedoch vollständig. Auch technische Eingriffe wie Modellwechsel, Updates oder das Verbinden von MCP-Servern führen zum Verlust des Caches und lassen die Kosten für die nachfolgende Anfrage stark ansteigen.

Optionen bei Cache-Verlust und überfülltem Kontext

  • Der Befehl /clear löscht den gesamten Verlauf für einen sauberen Neustart.
  • Der Befehl /compact fasst die Unterhaltung zusammen und startet einen neuen Speicher.
  • Benutzerdefinierte Übergabetools sichern den Kontext als Markdown-Datei auf der Festplatte.

Wenn ein Gespräch zu lang wird oder der Cache abgelaufen ist, stehen drei effektive Alternativen zur Verfügung. Das vollständige Zurücksetzen über /clear eignet sich besonders bei der Arbeit an bestehenden Codebasen, da das Modell die nötigen Informationen direkt aus den Projektdateien ausliest. Alternativ komprimiert /compact die bisherigen Inhalte oder ein externes Übergabetool legt den Kontext dauerhaft in einer lokalen Datei ab, auf die Claude jederzeit wieder zugreifen kann.

Modell-Routing und Effizienzsteigerung

  • Kleinere Modelle übernehmen einfache Aufgaben zu geringeren Kosten.
  • Der Beratermodus lässt Top-Modelle wie Fable Pläne entwerfen, während günstigere Modelle die Ausführung steuern.
  • Plugins ermöglichen die direkte Anbindung alternativer und günstigerer Modelle.

Nicht jede Aufgabe erfordert den Einsatz der rechenintensivsten und teuersten Modelle. Durch gezieltes Modell-Routing bearbeiten kleinere oder externe Modelle einfachere Teilaufgaben. Im Beratermodus koordiniert ein grosses Modell den Ablauf, während ein effizienteres Modell die eigentliche Ausführung übernimmt und dabei den eigenen Cache nutzt.

Claude-Hygiene und Token-Optimierung

  • Der Befehl /doctor bereinigt aufgeblähte Konfigurationsdateien und veraltete Skills.
  • Kurze und präzise Anweisungen in der Claude.md verhindern unnötigen Token-Verbrauch zu Beginn jedes Gesprächs.
  • Zusätzlicher Gerüstbau reduziert die Menge des geschriebenen Codes und senkt dadurch die Ausgaben.

Angesammelte Altlasten in Form von ungenutzten Skills, MCPs und zu detaillierten Claude.md-Dateien belasten das Kontextfenster bereits vor der ersten Nachricht. Der Befehl /doctor automatisiert die Bereinigung dieser Elemente. Ergänzende Werkzeuge oder prägnante Formatierungsanweisungen helfen zusätzlich dabei, die Anzahl der verbrauchten Token zu minimieren.

커뮤니티 글

모든 글 보기