Dieses Open-Source-Repo löst das größte Problem von Claude Code

CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Kann eine einzige Fähigkeit CloudCode extrem effizient machen?
00:00:03Kann es CloudCode schneller, günstiger machen und weniger Code schreiben,
00:00:06während es uns dennoch dieselben hochwertigen Ergebnisse liefert, die wir gewohnt sind?
00:00:10Nun, genau das behauptet Ponytail leisten zu können,
00:00:13und das hat dazu geführt, dass es nur sieben Tage nach Veröffentlichung 40.000 Sterne erreicht hat.
00:00:18Nun, Ponytail ist nicht das erste Tool, bei dem wir sehen, dass so etwas behauptet wird.
00:00:22Wir haben in der Vergangenheit über Caveman gesprochen, und all diese Tools haben im Grunde dieselbe Idee.
00:00:26Die Idee ist, dass CloudCode von Natur aus sehr gesprächig ist,
00:00:29und wenn wir ihm sagen: Hey, hör auf, so viel zu reden,
00:00:32können wir eine viel prägnantere Antwort erhalten, die letztlich genauso korrekt ist
00:00:36oder, wie wir uns von Caveman erinnern, vielleicht sogar noch korrekter sein könnte.
00:00:40Ponytail ist einfach die neueste Version davon,
00:00:42aber es ist eine Version, die Zahlen beansprucht, die besser sind als alles, was wir bisher gesehen haben.
00:00:45Und wir können diese Zahlen genau hier sehen.
00:00:47Wir sehen Codezeilen im Vergleich zu Token im Vergleich zu Kosten und Zeit.
00:00:52Und durchgehend – Grau ist quasi die Baseline ohne keines dieser Tools
00:00:55und Grün ist Ponytail –
00:00:58führt Ponytail fast überall das Feld an oder kommt dem sehr nahe.
00:01:03Nun, die Zahlen, die ihr hier gesehen habt, sind Durchschnittswerte.
00:01:05Dies ist der Mittelwert aus einer Reihe verschiedener Tests,
00:01:08und das Ganze wurde auch mit Haiku 4.5 durchgeführt.
00:01:11Und keine Sorge, später werden wir A, diese Tests validieren
00:01:14und uns ein echtes Modell ansehen, denn keiner von uns nutzt wirklich Haiku 4.5.
00:01:18Wir nutzen Opus 4.8, schauen wir uns also an, wie diese Zahlen aussehen.
00:01:20Und bei den Codezeilen sind es etwa 50% weniger Zeilen.
00:01:24Und wenn wir auf Token, Kosten und Zeit schauen,
00:01:27sind das etwa 20% bis 30% Verbesserung gegenüber der Baseline.
00:01:31Und das ist keine kleine Menge,
00:01:32vor allem, wenn wir das auf etwas wie Fable hochrechnen,
00:01:36was wahnsinnig teuer ist.
00:01:37Wenn ich euch also sagen könnte: Hey, wenn ihr so etwas wie Fable nutzt,
00:01:40wird es schneller und günstiger sein.
00:01:42Nun, das würden wir doch lieben, oder?
00:01:43Bevor ich nun darauf eingehe, wie das funktioniert
00:01:45und euch zeige, wie die Benchmark-Ergebnisse aussehen,
00:01:47als ich es getestet habe, ein kurzes Wort von unserem heutigen Sponsor: mir.
00:01:50In Chase AI+ habe ich also meine Claude-Code-Masterclass,
00:01:53was der beste Weg ist, um von Null zum KI-Entwickler zu werden,
00:01:56insbesondere wenn man keinen technischen Hintergrund hat.
00:01:59Ich aktualisiere das jede einzelne Woche,
00:02:01und es enthält auch Masterclasses zu Codecs
00:02:03und dazu, wie ihr euer eigenes agentenhaftes OS baut.
00:02:06Einen Link dazu findet ihr im angepinnten Kommentar.
00:02:08Und nochmals, ich aktualisiere dies jede Woche,
00:02:10und wir konzentrieren uns auf reale Anwendungsfälle.
00:02:12Wenn ihr also anfangt, Claude Code zu meistern,
00:02:15ist das hier der richtige Ort für euch.
00:02:16Wie funktioniert Ponytail also?
00:02:17Nun, es durchläuft einen sechstufigen Prozess,
00:02:19bevor es Code schreibt.
00:02:20Die erste Frage lautet also:
00:02:22Muss das überhaupt existieren?
00:02:24Wenn die Antwort nein ist,
00:02:26schreiben wir dafür einfach überhaupt keinen Code.
00:02:28Ziemlich offensichtlich.
00:02:29Danach fragen wir: Erledigt die Standardbibliothek das?
00:02:33Wenn die Antwort ja ist,
00:02:34werden wir die Standardbibliothek nutzen.
00:02:36Das Große, das ihr bei den Benchmarks sehen werdet, ist,
00:02:38dass es Fälle gibt, in denen Claude Code
00:02:41Funktionen von Grund auf neu erstellt, die bereits existieren,
00:02:45entweder innerhalb irgendeiner Bibliothek oder als Plattform-Feature.
00:02:49Claude Code hat also das Problem,
00:02:51dass das Rad bereits erfunden wurde.
00:02:52Wir haben das Rad hier in diesem Programm.
00:02:53Und es denkt sich: Wisst ihr was?
00:02:55Ich werde ein Rad von Grund auf bauen.
00:02:56Und deshalb
00:02:57erhält man dadurch jede Menge Code,
00:02:59wenn man ihn nicht unbedingt braucht.
00:03:01Das ist etwas, das ihr in diesen Benchmarks
00:03:03immer wieder seht.
00:03:04Und um kurz einen Schritt zurückzutreten:
00:03:05Diese sechs Schritte fragen im Grunde alle von Claude Code,
00:03:09ob dieses Feature bereits nativ existiert.
00:03:12Müssen wir etwas Maßgeschneidertes erstellen?
00:03:15Weil Claude gerne maßgeschneiderte Dinge erschafft,
00:03:17selbst wenn es das nicht muss.
00:03:18Wenn die Standardbibliothek es also nicht tut,
00:03:20heißt es: Ist das ein natives Plattform-Feature?
00:03:22Ist das eine installierte Abhängigkeit?
00:03:24Kann das eine Zeile sein?
00:03:26Müssen wir wortreich sein?
00:03:27Und wenn es das alles durchläuft
00:03:28und im Wesentlichen sagt: Nein, nein, nein, nein, nein,
00:03:30dann sagen wir: Was auch immer du schreibst,
00:03:33mach einfach das Minimum, das funktioniert.
00:03:35Übertreib es nicht.
00:03:36Erstelle es nicht, wenn wir es nicht brauchen.
00:03:37Und wenn wir es brauchen, mach das absolute Minimum.
00:03:40Die Idee hier ist also, Claude Code faul zu machen,
00:03:42aber nicht fahrlässig.
00:03:44Alles, was mit der Validierung von Vertrauensgrenzen zu tun hat,
00:03:47Datenverlust, Handhabung, Sicherheit und Barrierefreiheit,
00:03:48steht niemals zur Debatte.
00:03:50Es ist also ziemlich schlau, worauf es diesen Prozess anwendet.
00:03:53Was die Installation angeht: relativ unkompliziert.
00:03:55Ihr kopiert einfach diesen Befehl hier.
00:03:57Und ich werde natürlich einen Link unten in der Beschreibung
00:03:58für dieses Repo platzieren,
00:04:00und das wird es für euch installieren.
00:04:01Und ihr könnt das auch für Codecs verwenden
00:04:03oder eigentlich jeden anderen KI-Agenten da draußen.
00:04:05Es gibt ein paar Befehle, wenn es um Ponytail geht.
00:04:07Namentlich: light, full, ultra und off.
00:04:10Wieder sehr erinnernd an Caveman,
00:04:12also die Stufen von Caveman, die wir anstreben.
00:04:14Wir können unseren Code überprüfen lassen.
00:04:16Wir können ein Repo auditieren lassen.
00:04:18Und dann haben wir noch die debt-, gain- und help-Fähigkeiten.
00:04:20Auch hier könnt ihr tief in diese Details eintauchen,
00:04:22wenn ihr das im GitHub-Repo möchtet.
00:04:24Aber all das spielt keine Rolle,
00:04:24wenn die Benchmarks nicht standhalten.
00:04:26Und das Schöne an diesem Repo ist,
00:04:28dass sie uns die Benchmarks geben.
00:04:29Wir können das selbst ausführen.
00:04:31Und ratet mal?
00:04:32Genau das habe ich getan.
00:04:34Das könnt ihr auch selbst tun.
00:04:36Es gibt eine vollständige Dokumentation
00:04:37darüber, wie sie die Benchmarks erhalten haben,
00:04:39direkt hier in der README.
00:04:40Und es gibt euch auch die Möglichkeit, diese zu reproduzieren.
00:04:43Und was ich euch zeigen werde,
00:04:44sind die Zahlen, die ich erhalten habe,
00:04:45als ich all diese Benchmarks reproduziert habe.
00:04:48Und ich habe sie nicht nur mit Haiku 4.5 reproduziert,
00:04:51was ihr im Repo seht,
00:04:52sondern ich habe es auch mit Opus 4.8 gemacht.
00:04:54Denn nochmal, keiner von uns nutzt Haiku.
00:04:56Mich kümmert Haiku nicht wirklich.
00:04:58Mich kümmert Opus.
00:05:00Und die Ergebnisse waren ehrlich gesagt ziemlich interessant.
00:05:02Hier sind also die Tests und hier sind die Ergebnisse.
00:05:04Ihr seht ihre veröffentlichten Zahlen.
00:05:07Ihr seht unseren Testlauf mit Haiku.
00:05:09Und drüben ganz rechts
00:05:10ist unser Testlauf mit Opus.
00:05:12Unten seht ihr den Gesamtwert.
00:05:14Die 54%, das betrachtet wiederum die Codezeilen.
00:05:17Es sind laut Ponytail 54% weniger Codezeilen.
00:05:21Als wir es laufen ließen, waren es 56% bei Haiku.
00:05:24Im Grunde also exakt dasselbe.
00:05:27Und bei Opus waren es 71 %.
00:05:29Wir sahen also noch größere Gewinne oder effizienteren Code mit Ponytail bei der Nutzung von Opus.
00:05:36Warum ist das so?
00:05:36Weil diese mächtigeren Modelle eben gerne reden, nicht wahr?
00:05:40Sie mögen es, geschwätzig zu sein.
00:05:41Wieder so ein kleiner Rückbezug zu Caveman.
00:05:43Ihr erinnert euch an eine der Studien, die dort besprochen wird,
00:05:45nämlich die Idee, dass sehr wortreiche Modelle dazu neigen, viel zu reden,
00:05:50und zwar so sehr, dass sie sich manchmal um die richtige Antwort herumreden.
00:05:53Also ziemlich interessant und im Grunde wie ein Aufschwung für diese Sache.
00:05:57Und es ist interessant.
00:05:58Und sie sprechen darüber, warum sie Haiku beim Testen verwendet haben, und das waren die Kosten.
00:06:02Ich finde wirklich, sie hätten das Ganze mit Opus machen sollen,
00:06:04denn wenn wir es ausführen, lässt Opus das Ganze eigentlich noch besser aussehen.
00:06:09Wisst ihr, und das ist das Modell, das die Leute nutzen.
00:06:11Wenn überhaupt, haben sie dessen Effizienz bezüglich der Codezeilen also eher heruntergespielt.
00:06:15Und das gilt auch für die Kosten.
00:06:17Als wir uns Haiku 4.5 ansahen, was war der Gesamtwert in unseren Tests?
00:06:21Wir sahen eine Kostenreduktion von etwa 25 % im Vergleich zu Opus 4.8 mit einer Reduktion von 53 %,
00:06:28was der Wahnsinn ist.
00:06:30Es kostet uns 53 % weniger.
00:06:32Stellt euch vor, das wäre Fable.
00:06:33Und ihr könnt alle Tests und Zahlen auf ganzer Linie sehen.
00:06:35Und der niedrigste Wert lag bei 13 %.
00:06:38Und in einigen Fällen waren es bei einem mehrstufigen Assistenten bis zu 73 %.
00:06:42Jetzt fragt ihr euch vielleicht: Brauchen wir für einige davon überhaupt Opus?
00:06:45Guter Punkt.
00:06:45Aber versteht einfach, was hier verdeutlicht werden soll.
00:06:48Was normalerweise 1,39 Dollar bei der Standardnutzung von Opus ohne den Skill kosten würde, kostete uns mit Ponytail 0,38 Dollar.
00:06:55unter Verwendung von Ponytail.
00:06:57Und wenn wir uns Haiku ansehen, kosteten diese kleineren Modelle in einigen Fällen mit Ponytail sogar mehr.
00:07:04Die ganze Idee, Codezeilen zu reduzieren und das Ganze effektiver zu machen, funktioniert also viel besser bei leistungsstärkeren Modellen.
00:07:11In einigen Fällen haben wir bei den kleineren Modellen den gegenteiligen Effekt, weil sie sowieso schon effizient waren, da sie eben etwas simpler und schneller sind.
00:07:18Hier im Benchmark zum Zählen von Elementen war es beispielsweise 21 % teurer, Ponytail mit Haiku zu verwenden.
00:07:27Nun, wir sprechen hier von einem Unterschied von zwei Cent, aber der Punkt bleibt.
00:07:31Je stärker das Modell, desto effektiver ist diese Architektur.
00:07:34Und ich würde zu gerne sehen, wie das mit Fable aussieht.
00:07:37Nochmal, 53 % sind kein Witz.
00:07:39Und was ist mit der Geschwindigkeit?
00:07:40Auch hier sehen wir dasselbe Spiel bei Haiku.
00:07:43Wie viel schneller war es?
00:07:44Etwa 31 % mehr, also 31 % schneller, wenn man Haiku mit Ponytail verwendet anstatt ohne.
00:07:51Mit Opus waren es 71 % schneller.
00:07:5571 % schneller.
00:07:56Und was sehen wir wiederum bei Haiku?
00:07:58Es gibt Fälle, drei an der Zahl, in denen es mit Ponytail langsamer war.
00:08:03Wisst ihr, in einigen Fällen 22 % langsamer im Vergleich zu jedem einzelnen Benchmark auf ganzer Linie bei Opus von bis zu 88 %.
00:08:10In manchen Fällen war es immer schneller, richtig?
00:08:13Wir sehen wiederum den mehrstufigen Assistenten mit 78 %, den Datumsauswähler mit 88 %.
00:08:17Und im schlechtesten Szenario betrug der Unterschied 27 %.
00:08:22Wenn wir uns also diese Zahlen bei Ponytail ansehen, denken wir: Na ja, man muss das mit Vorsicht genießen, selbst wenn ich die Benchmarks ausführen kann, was machen 20 % schon aus?
00:08:31Und dann denkt man sich: Oh, es ist Haiku.
00:08:33Das ist also ziemlicher Blödsinn.
00:08:34Dann testen wir es auf Opus und es ist völlig anders.
00:08:36Es ist weitaus effektiver.
00:08:37Und ich denke, die naheliegende Frage ist: Nun, was ist mit den Benchmarks selbst?
00:08:41Wie effektiv sind diese Benchmarks?
00:08:42Sind sie realistisch?
00:08:44Geht zuallererst zum Repository, testet diese Dinge selbst oder führt eure eigenen Benchmarks aus, die eurer Meinung nach dem entsprechen, was ihr für legitim haltet.
00:08:52So oder so, wenn wir über die schätzungsweise 19 verschiedenen Benchmarks sprechen, die ausgeführt wurden, sehen wir auf ganzer Linie dasselbe.
00:08:59Wenn wir uns ein leistungsstärkeres Modell wie Opus ansehen, meine Güte, ich ignoriere diese Dinge für Haiku im Grunde.
00:09:04Haiku ist mir egal.
00:09:06Es ist billiger.
00:09:07Es ist schneller.
00:09:08Und daher ist es effizienter.
00:09:11Und da wir im Grunde nur über einen Skill sprechen: Was spricht dagegen, das auszuprobieren?
00:09:16Diese Zahlen sehen wirklich gut aus.
00:09:17Ich empfehle euch dringend, dieses Repository zu besuchen, es herunterzuladen und selbst zu nutzen.
00:09:21Im schlimmsten Fall, sagen wir mal für euer spezielles Projekt, ist es so kompliziert, dass die Anweisung, weniger geschwätzig zu sein, tatsächlich nach hinten losgeht.
00:09:30Nun, ich denke, das ist so ein Szenario von wegen keine Gefahr, kein Schaden, oder?
00:09:34Das ist also das Worst-Case-Szenario.
00:09:37Im besten Fall spart ihr etwa 50 % bei eurer Opus-Nutzung und es läuft 70 % schneller.
00:09:43Wirklich sehr interessante Sachen.
00:09:45Ich werde das definitiv in meinem Alltag nutzen.
00:09:47Ich nutze Caveman jetzt seit etwa einem Monat oder zwei ständig, es ist einfach automatisch geladen.
00:09:52Und ich werde zu Ponytail wechseln und schauen, wie es mir gefällt.
00:09:55Ich denke, je mehr solche Sachen herauskommen, desto besser.
00:09:58Heutzutage hört man ständig nur Token-Kosten, Token-Kosten, Token-Kosten.
00:10:03Alles, was diese für uns senken kann, wird also gerne angenommen.
00:10:07An dieser Stelle beende ich dieses Video.
00:10:08Schaut wie immer bei ChaseAI Plus vorbei, wenn ihr Zugriff auf meine Cloud Code Masterclass haben wollt.
00:10:13Lasst mich in den Kommentaren wissen, was ihr denkt, und bis zum nächsten Mal.

Key Takeaway

Das Open-Source-Repository Ponytail reduziert durch einen sechstufigen Prüfprozess die Codezeilen bei Claude Code mit Opus 4.8 um 71 % und senkt die API-Kosten um 53 %.

Highlights

  • Das Open-Source-Repository Ponytail erreicht nur sieben Tage nach der Veröffentlichung 40.000 Sterne.

  • Ponytail reduziert die Anzahl der Codezeilen bei der Verwendung von Opus 4.8 um durchschnittlich 71 %.

  • Der Einsatz von Ponytail mit Opus 4.8 senkt die Kosten um bis zu 53 %.

  • Die Ausführungsgeschwindigkeit erhöht sich bei komplexen Modellen wie Opus um bis zu 88 %.

  • Ponytail durchläuft vor dem Schreiben von Code einen sechstufigen Prozess zur Prüfung auf vorhandene Bibliotheken und native Features.

Timeline

Einführung von Ponytail und erste Benchmark-Zahlen

  • Ponytail verspricht eine effizientere und kostengünstigere Nutzung von Claude Code.
  • Das Tool verzeichnet 40.000 Sterne sieben Tage nach der Veröffentlichung.
  • Erste Durchschnittstests mit Haiku 4.5 zeigen etwa 50 % weniger Codezeilen und 20 % bis 30 % Verbesserung bei Token, Kosten und Zeit.

Ähnlich wie frühere Tools wie Caveman setzt Ponytail an der gesprächigen Natur von Claude Code an. Ziel ist es, prägnantere Antworten zu erhalten, ohne dass die inhaltliche Korrektur und Qualität darunter leiden. Die ersten Durchschnittswerte basieren auf Tests mit Haiku 4.5 und demonstrieren spürbare Einsparungen bei Codezeilen, Token und Gesamtkosten.

Funktionsweise und der sechstufige Prüfprozess

  • Ponytail verwendet vor dem Schreiben von Code einen sechstufigen Filterprozess.
  • Der Prozess prüft, ob Code überhaupt existieren muss oder ob Standardbibliotheken und native Plattform-Features genügen.
  • Vertrauensgrenzen, Datensicherheit und Barrierefreiheit bleiben von diesen Einsparungen explizit ausgenommen.

Claude Code neigt dazu, Funktionen und Code von Grund auf neu zu erstellen, obwohl diese bereits in Standardbibliotheken oder als native Plattform-Features existieren. Die sechs Schritte prüfen systematisch, ob eine maßgeschneiderte Entwicklung notwendig ist. Das Prinzip zwingt das Modell zu minimalem, aber sicherem Code, ohne Kompromisse bei der Validierung oder Datensicherheit einzugehen.

Installation, Befehle und Opus-Benchmark-Ergebnisse

  • Die Installation erfolgt unkompliziert über einen Befehl für Claude Code und andere KI-Agenten.
  • Bei der Nutzung von Opus 4.8 reduziert Ponytail die Codezeilen um 71 % und senkt die Kosten um 53 %.
  • Leistungsstärkere Modelle profitieren deutlich stärker von der Architektur als kleinere Modelle wie Haiku.

Mit Befehlen wie light, full, ultra und off lässt sich das Verhalten steuern. Tests mit dem leistungsstärkeren Modell Opus 4.8 zeigen deutlich drastischere Effizienzgewinne als die anfänglichen Haiku-Tests, da größere Modelle zu starker Geschwätzigkeit neigen. Die Ausführungsgeschwindigkeit steigt je nach Benchmark um bis zu 88 %, während die Kosten von ehemals 1,39 Dollar auf 0,38 Dollar sinken.

Community Posts

View all posts