스크립트
00:00:00Du zahlst möglicherweise zwanzigmal mehr für deine Cloud-Code-Token, als nötig ist, ohne es überhaupt zu wissen.
00:00:05Zu verstehen, wie man das Beste aus seinen Cloud-Code-Token herausholt, ist eine der wichtigsten
00:00:08Fähigkeiten, die du erlernen kannst. Das geht weit über den einfachen Satz in deiner Cloud.md-Datei hinaus,
00:00:14in dem steht: Fasse dich kurz. Denn wenn du nicht verstehst, wie Prompt-Caching überhaupt funktioniert,
00:00:19gibst du am Ende viel mehr aus, als nötig ist. In diesem Video zeige ich dir deshalb fünf
00:00:23verschiedene Wege, um deine Cloud-Token besser zu verwalten und das Maximum aus diesen
00:00:27Top-Modellen herauszuholen. Tipp Nummer eins ist dabei der wichtigste. Dieser wird dir mit Abstand
00:00:31am meisten Geld und Verbrauch einsparen – und zwar mehr als alle anderen Tipps zusammen. Es geht darum zu verstehen,
00:00:37wie Prompt-Caching tatsächlich funktioniert. Um das zu begreifen, müssen wir erst einmal klären, wie Token überhaupt arbeiten.
00:00:43Wir machen daher eine ganz kurze Wiederholung von etwa 60 Sekunden, damit wir alle auf demselben Stand sind.
00:00:47Token sind die Währung großer Sprachmodelle. Stark vereinfacht ausgedrückt entspricht dabei im Grunde
00:00:52jedes Wort einem Token. Wenn du als Nutzer in deiner ersten Nachricht an Fable schreibst: Wie geht es dir heute?,
00:01:00hast du fünf Input-Token gesendet. Wenn Fable dir daraufhin antwortet und sagt: Mir geht es gut, danke,
00:01:09hat dir das vier Output-Token eingebracht. Diese werden unterschiedlich bepreist. Tatsächlich kosten Output-Token
00:01:16im Großen und Ganzen das Fünffache eines Input-Tokens. Diese fünf Input- und vier Output-Token
00:01:23sammeln sich nun innerhalb des Kontextfensters an. Wenn Token die Währung sind, dann ist das Kontextfenster unser Budget.
00:01:31Opus, Fable und Sonnet haben alle ein Budget von einer Million Token. Bisher haben wir also erst
00:01:37neun von einer Million verbraucht – noch lange nicht viel. Interessant wird es jedoch, wenn wir Folgenachrichten
00:01:43nach der ersten senden. In unserer zweiten Nachricht sage ich als Nutzer: Baue mir eine App, keine Fehler,
00:01:50sechs Input-Token, oder? Ich schicke Anthropic und Fable doch nur sechs Input-Token. Nun,
00:01:56nicht ganz. Was ich tatsächlich mitschicke, ist alles. Ich sende Anthropic
00:02:04diese gesamte Konversation bis zu diesem Punkt. Ich sende also nicht wirklich nur sechs Input-Token, sondern tatsächlich
00:02:1116 Input-Token, da ich die fünf von vorhin und die vier von eben mitschicke, weil
00:02:16die gesamte Nachricht übertragen wird, damit es den Kontext verstehen kann. Und das gilt
00:02:20für jede einzelne Folgenachricht: Ich sende immer die Gesamtheit der Unterhaltung
00:02:26vor dieser neuesten Nachricht mit. Man sieht schnell, wie sich das extrem rasant summiert, sodass
00:02:32bei jeder einzelnen Nachricht 5.000, 10.000 oder 100.000 Input-Token gesendet werden. Und dafür
00:02:37zahlst du. Wenn dem so ist, warum verbrauchen wir dann nicht sofort unser gesamtes Kontingent?
00:02:43Warum zahlt nicht jeder eine Milliarde Dollar, jedes Mal, wenn er versucht, diese KI-Systeme zu nutzen?
00:02:47Weil wir offensichtlich Nachricht auf Nachricht senden. Es wird also eine Menge
00:02:51an kumulierter Nachricht an die Server geschickt. Die Lösung hierfür ist das Cache-System. Also ja,
00:02:57wenn ich Nachricht Nummer zwei hier drüben sende, schicke ich tatsächlich all das mit. Aber was zu diesem Zeitpunkt
00:03:05erstellt wurde, ist der Nachrichten-Cache. Und für unsere zweite Nachricht besteht dieser Nachrichten-Cache aus den ersten
00:03:12beiden Nachrichten. Stell dir den Nachrichten-Cache einfach wie ein Dokument vor, das Claude vor sich hat
00:03:17und das eure gesamte Unterhaltung bis zu diesem Punkt enthält. Du unterhältst dich hier mit Claude,
00:03:23sendest nun Nachricht Nummer zwei, nämlich „Baue mir eine App, keine Fehler“. Dank des Cache-Systems
00:03:30befindet sich dieser gesamte Abschnitt, diese ersten beiden Nachrichten, nun in diesem Dokument. Claude und Anthropic
00:03:36sind dadurch in der Lage, dieses Dokument beziehungsweise den Cache zu lesen,
00:03:42sich den gesamten bisherigen Nachrichtenverlauf anzusehen, und das zu einem viel günstigeren Tarif, als wenn du
00:03:47alles auf einmal ohne den Cache senden würdest. So werden die Kosten berechnet. Und diese Kosten
00:03:54sind wichtig, denn dieses Cache-System hält nicht ewig. Du musst verstehen, dass wenn
00:04:00du und Claude miteinander sprechen und wir dieses Cache-Dokument zwischen uns haben, das den gesamten
00:04:06Verlauf enthält und sehr günstig gelesen werden kann, dies nur für genau eine Stunde gespeichert bleibt.
00:04:11Wenn du diese Diskussion mit Claude führst, immer wieder hin und her schreibst,
00:04:16eben immer weiter, und dich dann für eine Stunde entfernst – und du hast ein
00:04:21Dokument, das 500.000 Token lang ist, eine Konversation von 500.000 Token –, verschwindet dies nach einer Stunde.
00:04:29Das ist weg. Wenn du also eine Nachricht sendest, sagen wir die 500.001., wird dir ratzfett
00:04:38eine 500.000-Token-Nachricht zum Vollarif berechnet, selbst wenn du nur gesagt hast: „Hey, was geht?“
00:04:46Verstehe bitte, dass der Cache nur eine Stunde lang hält, wenn es keine Aktivität gibt. Bei jeder Nachricht wird er
00:04:52nämlich aktualisiert. Wenn also 59 Minuten seit unserer letzten Nachricht vergangen sind und ich wieder eine absende,
00:04:56wird der Stundenzähler zurückgesetzt. Warum ist das so wichtig? Wegen der Kosten. Ich sprach
00:05:01in der Einleitung über den Unterschied zwischen einem Cache-Read – also dem Lesen dieses gesamten Verlaufs – im Vergleich zum Lesen der 500.000
00:05:08Nachrichten ohne Cache. Das macht buchstäblich das Zwanzigfache aus. Das spiegelt sich auch in der
00:05:16Preisdokumentation wider. Erinnern wir uns: Output-Token, also das, was Claude uns liefert, ändern sich nie.
00:05:22Bei Fable sprechen wir von 50 Dollar pro Million Token und 25 Dollar bei Opus. Aber bei den Input-Token
00:05:27findet sich der springende Punkt dieser Unterhaltung. Wir reden zwar immer von Basis-Input-Token von
00:05:3310 Dollar pro Million, aber das ist irreführend, da wir in der Realität immer Cache-Writes durchführen.
00:05:40Ein einstündiger Cache-Write, wie du ihn bei einem Abonnementplan nutzt, kostet tatsächlich das Doppelte.
00:05:47Wenn wir also das erste Mal in diesen Cache schreiben – wie bei der ersten Nachricht –, kostet das 20 Dollar pro
00:05:54Million Token. Du wirst hier zwar einen Fünf-Minuten-Cache-Write sehen, aber der ist im Grunde nur für Leute gedacht,
00:05:59die die API nutzen. Vergleiche das nun mit Cache-Hits, bei denen Anthropic einfach das Dokument liest,
00:06:05das sich vor ihm befindet und stündlich angesammelt und aktualisiert wurde: Das kostet 1 Dollar – zwanzigmal günstiger. Ein
00:06:13gewaltiger Unterschied! Deswegen ist dieser ganze Punkt, dieser spezielle Tipp zum Verständnis des Prompt-Cachings und
00:06:18des Token-Systems, so wichtig. Es gibt nichts, worüber ich im weiteren Verlauf spreche,
00:06:22das dir auch nur annähernd einen solchen Effizienzgewinn bringen wird. Nichts.
00:06:29Kommen wir nun zu unserem Beispiel mit der Konversation von 500.000 Token zurück,
00:06:35die wir mit Claude Code führen und kurz davor sind, eine Folgenachricht zu senden. In Szenario Nummer eins
00:06:40gehen wir davon aus, dass wir das Cache-System nutzen. Dieser 500k-Verlauf ist also im Cache gespeichert und ich sende
00:06:46diese neue Nachricht. Die Preiskalkulation funktioniert so, dass immer noch der gesamte Konversationsverlauf
00:06:51gelesen werden muss. Das geschieht zum Tarif von 1 Dollar pro Million Token. Für die nächste Nachricht
00:06:58kostet es mich also 50 Cent, um alles inklusive der neuen Nachricht zu lesen. Stell dir vor, diese neue Nachricht wäre tausend
00:07:05Token lang. Diese tausend Token der Folgenachricht werden nicht mit 1 Dollar pro Million berechnet, sondern mit 20 Dollar
00:07:14pro Million. Bei tausend Token macht das was aus? Etwa zwei Cent oder so? Keine Ahnung.
00:07:18Meine Rechnung stimmt wahrscheinlich nicht ganz, aber der Punkt ist: Der Verlauf kostet 1 Dollar, die neue Nachricht 20 Dollar, weil dies im Cache liegt.
00:07:26Wenn wir das nächste Mal eine Nachricht senden – im selben Szenario –, werden diese tausend Token nun Teil dieses
00:07:32Cache-Dokuments sein. Ergibt Sinn, oder? Das war Szenario eins. Szenario zwei: Wir haben keinen Cache. Wir haben eine Stunde gewartet,
00:07:40um sie zu senden. Nun wird uns das Ganze nicht mit 50 Cent berechnet,
00:07:47sondern stattdessen zum Cache-Write-Tarif, der wie gesagt bei 20 Dollar pro Million liegt. Was wird
00:07:54das kosten? Diese eine Nachricht kostet uns jetzt etwa 10 Dollar. Wir sind also von 50 Cent auf
00:08:0010 Dollar hochgeschnellt, nur weil wir eine Stunde gewartet haben. Das sind so die Konsequenzen,
00:08:05wenn man das nicht versteht. Zeit ist jedoch nicht das Einzige, worüber wir nachdenken müssen, wenn es um den Verlust des Caches geht.
00:08:10Es gibt noch andere Dinge, die ihn komplett zurücksetzen. Und das steht direkt in der Cloud-Code-Dokumentation.
00:08:14Wenn du dein Modell wechselst – du nutzt Fable, wechselst zu Opus und bist bei 500.000 Token –, ist das weg.
00:08:20Der Cache wird zurückgesetzt. Auch das Aufwandstreffen, eine Änderung des Fast-Modus, das Verbinden oder Trennen
00:08:26eines MCP-Servers, Plugins, das Ablehnen von Tools, das Kompaktieren der Unterhaltung oder schlicht ein Update von Cloud Code
00:08:32im Allgemeinen: All diese Dinge setzen den Cache zurück, und deine nächste Nachricht wird zwanzigmal teurer sein,
00:08:38als sie sein müsste. Was kannst du also mit diesen Informationen anfangen?
00:08:42Was tust du, wenn du dich in einer Situation befindest, in der du dich von einer Unterhaltung entfernen musst,
00:08:46die viele wichtige Informationen enthält, du aber länger als eine Stunde weg sein wirst
00:08:50oder über eine Stunde weg warst und gerade zurückkommst und merkst: Oh Mist,
00:08:54ich habe da vorher irgendwie nicht drüber nachgedacht? Genau darüber sprechen wir in Tipp Nummer zwei.
00:08:59Aber zuerst ein kurzes Wort vom Sponsor des heutigen Videos: mir selbst. Ich veröffentliche diese Woche eine komplett aktualisierte
00:09:06Version meiner Cloud Code Masterclass innerhalb von Chase AI+. Seit meiner ersten Veröffentlichung hat sich eine Menge geändert.
00:09:12Ich aktualisiere sie ständig. Im Grunde sind wir seit März, als ich damit herauskam, jedoch einen langen Weg gegangen.
00:09:19Wenn du also dein KI-Können verbessern möchtest, definitiv keinen technischen Hintergrund hast
00:09:24und einen Leitfaden suchst, um zu wissen, wie man dieses Tool von Grund auf bedient,
00:09:28und etwas suchst, das sich auf reale Anwendungsfälle konzentriert, dann ist das genau das Richtige für dich. Es ist zu finden
00:09:33in Chase AI+. Ein Link dazu befindet sich im angepinnten Kommentar. Tipp Nummer zwei dreht sich nun ganz um deine
00:09:37Optionen, wenn wir den Cache verlieren. Wir waren zu lange weg. Wir haben eine Konversation,
00:09:42die zwei-, drei-, vier-, fünfhunderttausend Token lang ist, und möchten wissen, was der nächste Schritt sein sollte,
00:09:47anstatt diese astronomischen Kosten zu bezahlen. Das hängt im Grunde ganz von deinem Szenario ab.
00:09:52Unsere erste Option ist sozusagen die nukleare Option, und das ist einfach /clear einzugeben.
00:09:58Mit Forward-slash-clear wird einfach der gesamte Gesprächsverlauf gelöscht. Und das ist nicht immer eine schlechte
00:10:04Sache. Tatsächlich, wenn Sie an einer Codebasis arbeiten, an einem Projekt mit
00:10:10einer Menge Dateien und viel Kontext, möchten Sie wahrscheinlich einfach /clear verwenden. Woran auch immer
00:10:15Sie gearbeitet haben, worüber Sie auch immer gesprochen haben, die Chancen stehen gut, dass es im Projekt selbst Spuren
00:10:20davon gibt, was passiert ist. Cloud Code kann sich das einfach ansehen. Und wenn Sie eine neue Konversation
00:10:25von Grund auf beginnen, kann es die Fäden wieder aufnehmen und Sie dorthin zurückbringen, wo Sie waren. Sie müssen kein Sklave
00:10:31des vorherigen Gesprächs sein. Ihre zweite Option ist nun, die Komprimierung zu nutzen. Es gibt eine Auto-Kompaktfunktion
00:10:38in Cloud Code, sobald Sie eine bestimmte Anzahl von Token erreichen. Ich schlage vor, nicht darauf zu warten,
00:10:42bis Sie diesen Punkt erreichen, denn wenn wir uns im Bereich von sechs-, sieben-, achthunderttausend Token bewegen, haben wir
00:10:47mit Kontextfäulnis zu kämpfen. Das ist nach wie vor ein Problem bei diesen größeren Modellen, diesen mächtigeren Modellen,
00:10:51aber wir können jederzeit /compact ausführen. Und was das für uns tut: Es erstellt eine
00:10:57Zusammenfassung dessen, worüber wir gesprochen haben. Und im Grunde genommen führt es dann /clear aus,
00:11:03startet aber eine neue Konversation mit dieser Zusammenfassung, sozusagen im Speicher. Wenn Sie also
00:11:10wichtige Dinge in diesem Gespräch hatten und nicht glauben, dass das in der Codebasis ausreicht,
00:11:15damit es das versteht, dann machen Sie einfach eine Komprimierung mit /compact. Es wird eine neue Konversation
00:11:20mit dieser Zusammenfassung beginnen. Und diese Zusammenfassung lebt einfach im Nachrichtenverlauf. Ihre dritte Option
00:11:26ist dem Komprimieren sehr ähnlich, und zwar die Verwendung eines benutzerdefinierten Übergabetools. Es gibt eine Reihe von benutzerdefinierten
00:11:32Übergabefunktionen da draußen. Ich habe selbst eine. Sie erhalten diese in meiner kostenlosen Community. Und der Unterschied
00:11:38zwischen Übergabe und Komprimierung liegt darin, wo diese Zusammenfassung gespeichert wird. Wenn ich also eine Übergabe mache, wird das
00:11:46tatsächlich einfach auf meiner Festplatte abgelegt. Es erstellt eine echte Markdown-Datei mit der Zusammenfassung und
00:11:51allem, was ich darin haben möchte. Und dann kann ich ein neues Gespräch beginnen und sagen: Hey Claude Code, sieh dir
00:11:59dieses Übergabedokument auf der Festplatte an, damit du dich auf den Stand bringen kannst, den du wissen musst. Im Gegensatz zu compact,
00:12:04bei dem keinerlei Datei erstellt wird. Es ist einfach eine Nachricht im Nachrichtenverlauf dieses jeweiligen
00:12:10Gesprächs, das Sie führen – ein subtiler Unterschied. Aber für manche Leute soll es eben eine Datei auf der
00:12:15Festplatte geben. Und oft ist das ein lebendiges Dokument, das ständig aktualisiert wird.
00:12:20Das sind also wirklich Ihre drei Optionen. Möchten Sie einfach alles löschen und von vorne beginnen?
00:12:26Oft ist das völlig in Ordnung. Möchten Sie einfach die native Claude-Funktion nutzen, es komprimieren
00:12:31und die Zusammenfassung direkt einfügen lassen? Oder möchten Sie, dass die Zusammenfassung ein echtes Dokument ist, das sich Claude ansehen kann?
00:12:37Verwenden Sie in diesem Fall die Übergabe. Das sind Ihre drei Optionen. Und oft sind sie besser, als einfach
00:12:42eine neue Nachricht zu senden, denn im Großen und Ganzen sollten Sie sich ohnehin nicht in Bereichen von 400.000, 500.000 oder 600.000
00:12:48Token bewegen. Tipp Nummer drei dreht sich nun um das Modell-Routing. Wie wählen wir das richtige Modell
00:12:53für die jeweilige Aufgabe aus? Damit wir nicht für alles einfach Fable verwenden. Können wir für einfachere Aufgaben
00:12:59ein kleineres, günstigeres, weniger kluges Modell nutzen? Die Antwort lautet ja. Und wir können uns das auf verschiedene Weise nähern.
00:13:04Wir können externe Modelle verwenden. Wir könnten zu GPT Sol gehen. Wir könnten zu GPT Luna und Terra gehen, die gerade
00:13:10supergünstig geworden sind. Wir können lokale Modelle verwenden, oder wir haben Optionen, wenn wir im Anthropic-Ökosystem bleiben wollen.
00:13:16Und der einfachste Weg dafür ist meiner Meinung nach der Beratermodus. Was Sie hier sehen, stammt aus dem ursprünglichen
00:13:22Berater-Blogbeitrag, der vor einigen Monaten veröffentlicht wurde. Es zeigt also Opus und Sonnet, aber dasselbe System
00:13:29gilt auch für Modelle wie Fable. Die Idee ist, dass ein intelligentes Modell wie Fable oder sogar Opus ein
00:13:37kleineres Modell wie Sonnet bei der Ausführung von Aufgaben berät. Das große Modell entwirft also einen Plan,
00:13:43das kleine Modell führt ihn aus, und das kleine Modell kann seinen Kontext jedes Mal mit dem größeren Modell teilen,
00:13:50wenn es auf Probleme stößt. Und dieses Modell rühmt sich besserer Ergebnisse bei geringeren Kosten. Um unsere
00:13:54vorherige Diskussion über Prompt-Caching einzubeziehen: Sowohl der Berater als auch der Ausführende haben ihren eigenen Prompt-Cache,
00:14:01der gleichzeitig arbeitet. Ihre zweite Option besteht darin, Aufgaben an Modelle außerhalb von Claude Code zu delegieren.
00:14:06Eine einfache Möglichkeit ist Codex. Es gibt ein Codex-Plugin für Claude Code, das es sehr einfach macht,
00:14:12Codex über die Claude Code-Schnittstelle aufzurufen. Sie könnten also im Grunde Fable diesen gleichen
00:14:18Beratermodus ausführen lassen, aber anstatt Opus oder Sonnet aufzurufen, ruft es die GPT-Modelle auf. Es gibt
00:14:24andere Repositories wie diesen Fable Advisor, die genau das tun. Und letztendlich ist es ziemlich trivial, einen eigenen
00:14:31Skill einzurichten, der genau das tut. Wenn Sie nach diesen günstigeren Modellen suchen, schlage ich Ihnen nochmals vor,
00:14:36sich die GPT-Modelle anzusehen, insbesondere Luna und Terra, denn erstens wurden ihre Kosten erheblich gesenkt
00:14:41und zweitens gibt es in der Anthropic-Familie wirklich kein Modell, das das tut, was sie tun,
00:14:48und das zu diesem Preis. Man kann sogar noch einen Schritt weiter gehen und einige lokale Modelle einbinden, wenn die
00:14:53Aufgaben dafür sinnvoll sind. Tipp Nummer vier dreht sich nun ganz um Ihre Claude-Hygiene. Sie haben vielleicht
00:14:57kürzlich dieses Video gesehen, das die Runde machte, in dem Boris Cherney, der Schöpfer von Claude Code, sagt:
00:15:01Sie müssen Ihre Claude.md-Datei löschen. Nun, müssen Sie diese Claude.md-Datei wirklich löschen? Nun,
00:15:07nicht unbedingt, aber was Sie tun müssen – und das hat in den letzten ein bis zwei Wochen einige Änderungen erfahren –
00:15:12ist den Befehl /doctor auszuführen. Und was hat das mit Token zu tun?
00:15:18Nun, erstens, was dieser Befehl unter anderem tun wird – wobei wir das Thema Token-bezogen halten –,
00:15:23ist, dass er sich Ihre Claude.md ansehen und dieses Ding kürzen wird.
00:15:30Die Art und Weise, wie diese Modelle funktionieren, insbesondere diese Modelle der 5er-Serie, ist, dass sie nicht so viele
00:15:36Anweisungen benötigen. Wenn Sie sich ansehen, was die Leute vor drei, sechs, neun Monaten für die Claude.mds
00:15:42erstellt haben, waren diese sehr präskriptiv und extrem detailliert. Und zu jener Zeit konnte man vielleicht
00:15:46argumentieren, dass sie das brauchten. Das ist heutzutage nicht mehr der Fall. Eine aufgeblähte Claude.md
00:15:53macht es also nicht nur langsamer, sie kostet Sie buchstäblich Token. Und /doctor wird sich das ansehen
00:15:59und Dinge aus Ihrer Claude.md entfernen, die einfach nicht dort sein müssen. Zweitens
00:16:04wird er sich Dinge ansehen, die Ihren Kontext schädigen oder Ihr Kontextfenster aufblähen.
00:16:10Denn selbst wenn Sie ein neues Gespräch beginnen und /context ausführen, gibt es Dinge,
00:16:15die es füllen. Nun, ich habe kürzlich /doctor ausgeführt, also bin ich einen Großteil meines Ballasts losgeworden,
00:16:20aber so sieht mein Kontextfenster direkt zu Beginn eines Gesprächs aus, ohne dass Nachrichten
00:16:25gesendet wurden. Wir haben bereits 40.000 Token verbraucht. Und was verbraucht davon so viel? Nun, ein Teil davon stammt
00:16:31von Dingen wie Skills, wie Sie hier sehen können. Ein Teil davon umfasst auch Dinge wie den System-Prompt sowie
00:16:36Speicherdateien. Was /doctor tun wird, ist, sich Dinge wie Ihre
00:16:41Skills und Ihre MCPs anzusehen und damit zu beginnen, die zu kürzen, die Sie einfach nicht verwendet haben. Ist das eine enorme Token-Einsparung?
00:16:47Nein, aber es ist etwas, es macht sich am Rande bemerkbar und es ist ein so einfacher Fix. Es gibt keinen
00:16:53Grund, es nicht zu tun, insbesondere wenn Sie jemand sind, der in den letzten sechs Monaten einfach 10 Millionen Skills angesammelt
00:16:58hat, ohne jemals durchzugehen und sie zu reduzieren, denn das Tun wird auch
00:17:03dazu führen, dass Ihre Skills effektiver ausgelöst werden. Und es wird seitens Claude keine Verwirrung darüber geben,
00:17:08welchen Skill es aufrufen muss. Ich wetten, Sie haben wahrscheinlich an die 10 Skills dort liegen, die alle
00:17:12mit Frontend-Design zu tun haben, und Sie brauchen nicht all diese. Dieser sehr einfache und leicht auszuführende Tipp
00:17:17hinsichtlich Ihrer Claude-Hygiene ist einer, den Sie nicht verpassen sollten. Führen Sie einfach doctor aus. Und das
00:17:22bringt uns zu unserem letzten Tipp, der heutzutage meiner Meinung nach der am wenigsten wirksame aus der Reihe ist, nämlich
00:17:28den zusätzlichen Skills und dem Gerüstbau, die man überall herumlungern sieht.
00:17:33Der heutzutage beliebteste ist Ponytail, und im Wesentlichen reduziert er die Menge an Code,
00:17:38den Claude schreibt, während seine Effektivität erhalten bleibt, wodurch es billiger und schneller wird. Nun, ich
00:17:44habe dazu ein Video gemacht, in dem ich diese Zahlen mit dem vergleiche, was in der Realität tatsächlich passiert, denn das GitHub-
00:17:51Repository zeigt nur Haiku 4.5, was offensichtlich sehr veraltet ist. Als ich dies mit Fable ausgeführt habe, haben die Zahlen
00:17:56standgehalten. Tatsächlich sahen die Zahlen mit besseren Modellen sogar noch besser aus. Nun, ich habe die Benchmarks verwendet, die
00:18:01mit diesem GitHub-Repository bereitgestellt wurden. Was für Sie in der Realität funktioniert, unterscheidet sich je nach
00:18:06Komplexität Ihres Projekts vielleicht ein wenig. Aber das ist etwas, das Sie an alles anfügen können, worüber wir
00:18:11bis jetzt gesprochen haben, wenn Sie Ihre Token-Nutzung weiter reduzieren möchten. Ein anderer, den man oft sieht, ist Caveman,
00:18:18das heutzutage beansprucht, Ihre Ausgabe-Token um 65% zu reduzieren. Es gibt viele Leute da draußen, die
00:18:25auch einfach von Einzeilern in Claude MD sprechen, etwas so Einfaches wie zu sagen: Fass dich kurz,
00:18:30was ebenfalls Ihre Ausgabe-Token reduziert. Aber denken Sie daran, Ausgabe-Token sind nur ein Teil des Puzzles.
00:18:36Und dieses Puzzle wird, um auf unsere ursprüngliche Diskussion zurückzukommen, vom Prompt-Caching dominiert. Wenn
00:18:41Sie also sonst nichts aus diesem Video mitgenommen haben, hoffe ich, dass Sie das mitnehmen konnten, denn damit
00:18:46werden wir es heute beenden. Lassen Sie mich also wie immer wissen, was Sie dachten. Schauen Sie unbedingt bei
00:18:50ChaseAI Plus vorbei, wenn Sie die Claude Code Masterclass in die Hände bekommen möchten. Ich veröffentliche dort diese Woche
00:18:55wieder ein riesiges Update. Und ansonsten sieht man sich.