Dieses Open-Source-Repo löst das größte Problem von Claude Code
CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00Kann eine einzige Fähigkeit CloudCode extrem effizient machen?
00:00:03Kann es CloudCode schneller, günstiger machen und weniger Code schreiben,
00:00:06während es uns dennoch dieselben hochwertigen Ergebnisse liefert, die wir gewohnt sind?
00:00:10Nun, genau das behauptet Ponytail leisten zu können,
00:00:13und das hat dazu geführt, dass es nur sieben Tage nach Veröffentlichung 40.000 Sterne erreicht hat.
00:00:18Nun, Ponytail ist nicht das erste Tool, bei dem wir sehen, dass so etwas behauptet wird.
00:00:22Wir haben in der Vergangenheit über Caveman gesprochen, und all diese Tools haben im Grunde dieselbe Idee.
00:00:26Die Idee ist, dass CloudCode von Natur aus sehr gesprächig ist,
00:00:29und wenn wir ihm sagen: Hey, hör auf, so viel zu reden,
00:00:32können wir eine viel prägnantere Antwort erhalten, die letztlich genauso korrekt ist
00:00:36oder, wie wir uns von Caveman erinnern, vielleicht sogar noch korrekter sein könnte.
00:00:40Ponytail ist einfach die neueste Version davon,
00:00:42aber es ist eine Version, die Zahlen beansprucht, die besser sind als alles, was wir bisher gesehen haben.
00:00:45Und wir können diese Zahlen genau hier sehen.
00:00:47Wir sehen Codezeilen im Vergleich zu Token im Vergleich zu Kosten und Zeit.
00:00:52Und durchgehend – Grau ist quasi die Baseline ohne keines dieser Tools
00:00:55und Grün ist Ponytail –
00:00:58führt Ponytail fast überall das Feld an oder kommt dem sehr nahe.
00:01:03Nun, die Zahlen, die ihr hier gesehen habt, sind Durchschnittswerte.
00:01:05Dies ist der Mittelwert aus einer Reihe verschiedener Tests,
00:01:08und das Ganze wurde auch mit Haiku 4.5 durchgeführt.
00:01:11Und keine Sorge, später werden wir A, diese Tests validieren
00:01:14und uns ein echtes Modell ansehen, denn keiner von uns nutzt wirklich Haiku 4.5.
00:01:18Wir nutzen Opus 4.8, schauen wir uns also an, wie diese Zahlen aussehen.
00:01:20Und bei den Codezeilen sind es etwa 50% weniger Zeilen.
00:01:24Und wenn wir auf Token, Kosten und Zeit schauen,
00:01:27sind das etwa 20% bis 30% Verbesserung gegenüber der Baseline.
00:01:31Und das ist keine kleine Menge,
00:01:32vor allem, wenn wir das auf etwas wie Fable hochrechnen,
00:01:36was wahnsinnig teuer ist.
00:01:37Wenn ich euch also sagen könnte: Hey, wenn ihr so etwas wie Fable nutzt,
00:01:40wird es schneller und günstiger sein.
00:01:42Nun, das würden wir doch lieben, oder?
00:01:43Bevor ich nun darauf eingehe, wie das funktioniert
00:01:45und euch zeige, wie die Benchmark-Ergebnisse aussehen,
00:01:47als ich es getestet habe, ein kurzes Wort von unserem heutigen Sponsor: mir.
00:01:50In Chase AI+ habe ich also meine Claude-Code-Masterclass,
00:01:53was der beste Weg ist, um von Null zum KI-Entwickler zu werden,
00:01:56insbesondere wenn man keinen technischen Hintergrund hat.
00:01:59Ich aktualisiere das jede einzelne Woche,
00:02:01und es enthält auch Masterclasses zu Codecs
00:02:03und dazu, wie ihr euer eigenes agentenhaftes OS baut.
00:02:06Einen Link dazu findet ihr im angepinnten Kommentar.
00:02:08Und nochmals, ich aktualisiere dies jede Woche,
00:02:10und wir konzentrieren uns auf reale Anwendungsfälle.
00:02:12Wenn ihr also anfangt, Claude Code zu meistern,
00:02:15ist das hier der richtige Ort für euch.
00:02:16Wie funktioniert Ponytail also?
00:02:17Nun, es durchläuft einen sechstufigen Prozess,
00:02:19bevor es Code schreibt.
00:02:20Die erste Frage lautet also:
00:02:22Muss das überhaupt existieren?
00:02:24Wenn die Antwort nein ist,
00:02:26schreiben wir dafür einfach überhaupt keinen Code.
00:02:28Ziemlich offensichtlich.
00:02:29Danach fragen wir: Erledigt die Standardbibliothek das?
00:02:33Wenn die Antwort ja ist,
00:02:34werden wir die Standardbibliothek nutzen.
00:02:36Das Große, das ihr bei den Benchmarks sehen werdet, ist,
00:02:38dass es Fälle gibt, in denen Claude Code
00:02:41Funktionen von Grund auf neu erstellt, die bereits existieren,
00:02:45entweder innerhalb irgendeiner Bibliothek oder als Plattform-Feature.
00:02:49Claude Code hat also das Problem,
00:02:51dass das Rad bereits erfunden wurde.
00:02:52Wir haben das Rad hier in diesem Programm.
00:02:53Und es denkt sich: Wisst ihr was?
00:02:55Ich werde ein Rad von Grund auf bauen.
00:02:56Und deshalb
00:02:57erhält man dadurch jede Menge Code,
00:02:59wenn man ihn nicht unbedingt braucht.
00:03:01Das ist etwas, das ihr in diesen Benchmarks
00:03:03immer wieder seht.
00:03:04Und um kurz einen Schritt zurückzutreten:
00:03:05Diese sechs Schritte fragen im Grunde alle von Claude Code,
00:03:09ob dieses Feature bereits nativ existiert.
00:03:12Müssen wir etwas Maßgeschneidertes erstellen?
00:03:15Weil Claude gerne maßgeschneiderte Dinge erschafft,
00:03:17selbst wenn es das nicht muss.
00:03:18Wenn die Standardbibliothek es also nicht tut,
00:03:20heißt es: Ist das ein natives Plattform-Feature?
00:03:22Ist das eine installierte Abhängigkeit?
00:03:24Kann das eine Zeile sein?
00:03:26Müssen wir wortreich sein?
00:03:27Und wenn es das alles durchläuft
00:03:28und im Wesentlichen sagt: Nein, nein, nein, nein, nein,
00:03:30dann sagen wir: Was auch immer du schreibst,
00:03:33mach einfach das Minimum, das funktioniert.
00:03:35Übertreib es nicht.
00:03:36Erstelle es nicht, wenn wir es nicht brauchen.
00:03:37Und wenn wir es brauchen, mach das absolute Minimum.
00:03:40Die Idee hier ist also, Claude Code faul zu machen,
00:03:42aber nicht fahrlässig.
00:03:44Alles, was mit der Validierung von Vertrauensgrenzen zu tun hat,
00:03:47Datenverlust, Handhabung, Sicherheit und Barrierefreiheit,
00:03:48steht niemals zur Debatte.
00:03:50Es ist also ziemlich schlau, worauf es diesen Prozess anwendet.
00:03:53Was die Installation angeht: relativ unkompliziert.
00:03:55Ihr kopiert einfach diesen Befehl hier.
00:03:57Und ich werde natürlich einen Link unten in der Beschreibung
00:03:58für dieses Repo platzieren,
00:04:00und das wird es für euch installieren.
00:04:01Und ihr könnt das auch für Codecs verwenden
00:04:03oder eigentlich jeden anderen KI-Agenten da draußen.
00:04:05Es gibt ein paar Befehle, wenn es um Ponytail geht.
00:04:07Namentlich: light, full, ultra und off.
00:04:10Wieder sehr erinnernd an Caveman,
00:04:12also die Stufen von Caveman, die wir anstreben.
00:04:14Wir können unseren Code überprüfen lassen.
00:04:16Wir können ein Repo auditieren lassen.
00:04:18Und dann haben wir noch die debt-, gain- und help-Fähigkeiten.
00:04:20Auch hier könnt ihr tief in diese Details eintauchen,
00:04:22wenn ihr das im GitHub-Repo möchtet.
00:04:24Aber all das spielt keine Rolle,
00:04:24wenn die Benchmarks nicht standhalten.
00:04:26Und das Schöne an diesem Repo ist,
00:04:28dass sie uns die Benchmarks geben.
00:04:29Wir können das selbst ausführen.
00:04:31Und ratet mal?
00:04:32Genau das habe ich getan.
00:04:34Das könnt ihr auch selbst tun.
00:04:36Es gibt eine vollständige Dokumentation
00:04:37darüber, wie sie die Benchmarks erhalten haben,
00:04:39direkt hier in der README.
00:04:40Und es gibt euch auch die Möglichkeit, diese zu reproduzieren.
00:04:43Und was ich euch zeigen werde,
00:04:44sind die Zahlen, die ich erhalten habe,
00:04:45als ich all diese Benchmarks reproduziert habe.
00:04:48Und ich habe sie nicht nur mit Haiku 4.5 reproduziert,
00:04:51was ihr im Repo seht,
00:04:52sondern ich habe es auch mit Opus 4.8 gemacht.
00:04:54Denn nochmal, keiner von uns nutzt Haiku.
00:04:56Mich kümmert Haiku nicht wirklich.
00:04:58Mich kümmert Opus.
00:05:00Und die Ergebnisse waren ehrlich gesagt ziemlich interessant.
00:05:02Hier sind also die Tests und hier sind die Ergebnisse.
00:05:04Ihr seht ihre veröffentlichten Zahlen.
00:05:07Ihr seht unseren Testlauf mit Haiku.
00:05:09Und drüben ganz rechts
00:05:10ist unser Testlauf mit Opus.
00:05:12Unten seht ihr den Gesamtwert.
00:05:14Die 54%, das betrachtet wiederum die Codezeilen.
00:05:17Es sind laut Ponytail 54% weniger Codezeilen.
00:05:21Als wir es laufen ließen, waren es 56% bei Haiku.
00:05:24Im Grunde also exakt dasselbe.
00:05:27Und bei Opus waren es 71 %.
00:05:29Wir sahen also noch größere Gewinne oder effizienteren Code mit Ponytail bei der Nutzung von Opus.
00:05:36Warum ist das so?
00:05:36Weil diese mächtigeren Modelle eben gerne reden, nicht wahr?
00:05:40Sie mögen es, geschwätzig zu sein.
00:05:41Wieder so ein kleiner Rückbezug zu Caveman.
00:05:43Ihr erinnert euch an eine der Studien, die dort besprochen wird,
00:05:45nämlich die Idee, dass sehr wortreiche Modelle dazu neigen, viel zu reden,
00:05:50und zwar so sehr, dass sie sich manchmal um die richtige Antwort herumreden.
00:05:53Also ziemlich interessant und im Grunde wie ein Aufschwung für diese Sache.
00:05:57Und es ist interessant.
00:05:58Und sie sprechen darüber, warum sie Haiku beim Testen verwendet haben, und das waren die Kosten.
00:06:02Ich finde wirklich, sie hätten das Ganze mit Opus machen sollen,
00:06:04denn wenn wir es ausführen, lässt Opus das Ganze eigentlich noch besser aussehen.
00:06:09Wisst ihr, und das ist das Modell, das die Leute nutzen.
00:06:11Wenn überhaupt, haben sie dessen Effizienz bezüglich der Codezeilen also eher heruntergespielt.
00:06:15Und das gilt auch für die Kosten.
00:06:17Als wir uns Haiku 4.5 ansahen, was war der Gesamtwert in unseren Tests?
00:06:21Wir sahen eine Kostenreduktion von etwa 25 % im Vergleich zu Opus 4.8 mit einer Reduktion von 53 %,
00:06:28was der Wahnsinn ist.
00:06:30Es kostet uns 53 % weniger.
00:06:32Stellt euch vor, das wäre Fable.
00:06:33Und ihr könnt alle Tests und Zahlen auf ganzer Linie sehen.
00:06:35Und der niedrigste Wert lag bei 13 %.
00:06:38Und in einigen Fällen waren es bei einem mehrstufigen Assistenten bis zu 73 %.
00:06:42Jetzt fragt ihr euch vielleicht: Brauchen wir für einige davon überhaupt Opus?
00:06:45Guter Punkt.
00:06:45Aber versteht einfach, was hier verdeutlicht werden soll.
00:06:48Was normalerweise 1,39 Dollar bei der Standardnutzung von Opus ohne den Skill kosten würde, kostete uns mit Ponytail 0,38 Dollar.
00:06:55unter Verwendung von Ponytail.
00:06:57Und wenn wir uns Haiku ansehen, kosteten diese kleineren Modelle in einigen Fällen mit Ponytail sogar mehr.
00:07:04Die ganze Idee, Codezeilen zu reduzieren und das Ganze effektiver zu machen, funktioniert also viel besser bei leistungsstärkeren Modellen.
00:07:11In einigen Fällen haben wir bei den kleineren Modellen den gegenteiligen Effekt, weil sie sowieso schon effizient waren, da sie eben etwas simpler und schneller sind.
00:07:18Hier im Benchmark zum Zählen von Elementen war es beispielsweise 21 % teurer, Ponytail mit Haiku zu verwenden.
00:07:27Nun, wir sprechen hier von einem Unterschied von zwei Cent, aber der Punkt bleibt.
00:07:31Je stärker das Modell, desto effektiver ist diese Architektur.
00:07:34Und ich würde zu gerne sehen, wie das mit Fable aussieht.
00:07:37Nochmal, 53 % sind kein Witz.
00:07:39Und was ist mit der Geschwindigkeit?
00:07:40Auch hier sehen wir dasselbe Spiel bei Haiku.
00:07:43Wie viel schneller war es?
00:07:44Etwa 31 % mehr, also 31 % schneller, wenn man Haiku mit Ponytail verwendet anstatt ohne.
00:07:51Mit Opus waren es 71 % schneller.
00:07:5571 % schneller.
00:07:56Und was sehen wir wiederum bei Haiku?
00:07:58Es gibt Fälle, drei an der Zahl, in denen es mit Ponytail langsamer war.
00:08:03Wisst ihr, in einigen Fällen 22 % langsamer im Vergleich zu jedem einzelnen Benchmark auf ganzer Linie bei Opus von bis zu 88 %.
00:08:10In manchen Fällen war es immer schneller, richtig?
00:08:13Wir sehen wiederum den mehrstufigen Assistenten mit 78 %, den Datumsauswähler mit 88 %.
00:08:17Und im schlechtesten Szenario betrug der Unterschied 27 %.
00:08:22Wenn wir uns also diese Zahlen bei Ponytail ansehen, denken wir: Na ja, man muss das mit Vorsicht genießen, selbst wenn ich die Benchmarks ausführen kann, was machen 20 % schon aus?
00:08:31Und dann denkt man sich: Oh, es ist Haiku.
00:08:33Das ist also ziemlicher Blödsinn.
00:08:34Dann testen wir es auf Opus und es ist völlig anders.
00:08:36Es ist weitaus effektiver.
00:08:37Und ich denke, die naheliegende Frage ist: Nun, was ist mit den Benchmarks selbst?
00:08:41Wie effektiv sind diese Benchmarks?
00:08:42Sind sie realistisch?
00:08:44Geht zuallererst zum Repository, testet diese Dinge selbst oder führt eure eigenen Benchmarks aus, die eurer Meinung nach dem entsprechen, was ihr für legitim haltet.
00:08:52So oder so, wenn wir über die schätzungsweise 19 verschiedenen Benchmarks sprechen, die ausgeführt wurden, sehen wir auf ganzer Linie dasselbe.
00:08:59Wenn wir uns ein leistungsstärkeres Modell wie Opus ansehen, meine Güte, ich ignoriere diese Dinge für Haiku im Grunde.
00:09:04Haiku ist mir egal.
00:09:06Es ist billiger.
00:09:07Es ist schneller.
00:09:08Und daher ist es effizienter.
00:09:11Und da wir im Grunde nur über einen Skill sprechen: Was spricht dagegen, das auszuprobieren?
00:09:16Diese Zahlen sehen wirklich gut aus.
00:09:17Ich empfehle euch dringend, dieses Repository zu besuchen, es herunterzuladen und selbst zu nutzen.
00:09:21Im schlimmsten Fall, sagen wir mal für euer spezielles Projekt, ist es so kompliziert, dass die Anweisung, weniger geschwätzig zu sein, tatsächlich nach hinten losgeht.
00:09:30Nun, ich denke, das ist so ein Szenario von wegen keine Gefahr, kein Schaden, oder?
00:09:34Das ist also das Worst-Case-Szenario.
00:09:37Im besten Fall spart ihr etwa 50 % bei eurer Opus-Nutzung und es läuft 70 % schneller.
00:09:43Wirklich sehr interessante Sachen.
00:09:45Ich werde das definitiv in meinem Alltag nutzen.
00:09:47Ich nutze Caveman jetzt seit etwa einem Monat oder zwei ständig, es ist einfach automatisch geladen.
00:09:52Und ich werde zu Ponytail wechseln und schauen, wie es mir gefällt.
00:09:55Ich denke, je mehr solche Sachen herauskommen, desto besser.
00:09:58Heutzutage hört man ständig nur Token-Kosten, Token-Kosten, Token-Kosten.
00:10:03Alles, was diese für uns senken kann, wird also gerne angenommen.
00:10:07An dieser Stelle beende ich dieses Video.
00:10:08Schaut wie immer bei ChaseAI Plus vorbei, wenn ihr Zugriff auf meine Cloud Code Masterclass haben wollt.
00:10:13Lasst mich in den Kommentaren wissen, was ihr denkt, und bis zum nächsten Mal.