Ce dépôt open source résout le plus gros problème de Claude Code

CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Est-ce qu'une seule compétence peut rendre CloudCode extrêmement plus efficace ?
00:00:03Peut-il rendre CloudCode plus rapide, moins cher et écrire moins de code
00:00:06tout en offrant le même genre de résultats de haut niveau auxquels nous sommes habitués ?
00:00:10Eh bien, c'est exactement ce que Ponytail prétend être capable de faire,
00:00:13ce qui lui a valu d'atteindre 40 000 étoiles seulement sept jours après sa sortie.
00:00:18Maintenant, Ponytail n'est pas le premier outil que nous voyons prétendre faire une telle chose.
00:00:22Nous avons parlé de Caveman par le passé, et tous ces outils ont tendance à reposer sur la même idée.
00:00:26L'idée est que CloudCode est naturellement verbeux,
00:00:29et si nous lui disons, hé, arrête de parler autant,
00:00:32nous pouvons obtenir une réponse beaucoup plus concise qui est finalement tout aussi correcte
00:00:36ou, comme nous nous en souvenons avec Caveman, pourrait même s'avérer plus correcte.
00:00:40Ponytail en est simplement la dernière version,
00:00:42mais c'est une version qui revendique des chiffres meilleurs que tout ce que nous avons vu par le passé.
00:00:45Et nous pouvons voir ces chiffres ici même.
00:00:47Nous pouvons voir les lignes de code par rapport aux jetons, au coût et au temps.
00:00:52Et sur tous les plans, le gris représentant la référence sans aucun de ces outils
00:00:55et le vert représentant Ponytail,
00:00:58Ponytail mène pratiquement la danse partout ou s'en approche de très près.
00:01:03Maintenant, les chiffres que vous voyez ici sont des agrégats.
00:01:05Il s'agit de la moyenne calculée sur un certain nombre de tests différents,
00:01:08et cela a également été réalisé en utilisant Haiku 4.5.
00:01:11Et ne vous inquiétez pas, plus tard nous allons A, valider ces tests,
00:01:14et jeter un œil à un vrai modèle, car aucun d'entre nous n'utilise vraiment Haiku 4.5.
00:01:18Nous utilisons Opus 4.8, alors voyons à quoi ressemblent ces chiffres.
00:01:20Et en ce qui concerne les lignes de code, c'est environ 50 % de lignes en moins.
00:01:24Et si l'on regarde en termes de jetons, de coût et de temps,
00:01:27on observe des améliorations d'environ 20 % à 30 % par rapport à la référence.
00:01:31Et ce n'est pas rien,
00:01:32surtout lorsque nous extrapolons cela à quelque chose comme Fable,
00:01:36qui est extrêmement coûteux.
00:01:37Donc si je pouvais vous dire, hé, si vous utilisez un outil comme Fable,
00:01:40ce sera plus rapide et moins cher.
00:01:42Eh bien, nous adorerions ça, n'est-ce pas ?
00:01:43Maintenant, avant de vous expliquer comment cela fonctionne
00:01:45et de vous montrer à quoi ressemblent les scores de référence,
00:01:47lorsque je l'ai testé, un petit mot du sponsor d'aujourd'hui : moi-même.
00:01:50Ainsi, au sein de Chase AI+, je propose ma Masterclass Claude Code,
00:01:53qui est le meilleur moyen de passer de zéro au développement par IA,
00:01:56surtout si vous ne venez pas d'un milieu technique.
00:01:59Je mets cela à jour chaque semaine,
00:02:01et cela comprend également des masterclasses sur Codecs
00:02:03et sur la façon de construire votre propre OS d'agents.
00:02:06Vous trouverez un lien vers celle-ci dans le commentaire épinglé.
00:02:08Et encore une fois, je mets cela à jour chaque semaine,
00:02:10et nous nous concentrons sur des cas d'usage réels.
00:02:12Donc si vous voulez commencer à maîtriser Claude Code,
00:02:15c'est l'endroit idéal pour vous.
00:02:16Alors, comment fonctionne Ponytail ?
00:02:17Eh bien, il passe par un processus en six étapes
00:02:19avant d'écrire le moindre code.
00:02:20La première question est donc :
00:02:22est-ce que cela a seulement besoin d'exister ?
00:02:24Si la réponse est non,
00:02:26eh bien, nous n'écrivons tout simplement pas de code pour cela.
00:02:28C'est relativement évident.
00:02:29Ensuite, nous demandons : est-ce que la bibliothèque standard le fait ?
00:02:33Si la réponse est oui,
00:02:34nous allons utiliser la bibliothèque standard.
00:02:36La grande chose que vous allez remarquer avec les benchmarks,
00:02:38c'est qu'il y a des cas où Claude Code
00:02:41recrée des fonctionnalités de zéro alors qu'elles existent déjà,
00:02:45soit au sein d'une bibliothèque quelconque, soit en tant que fonctionnalité de la plateforme.
00:02:49Claude Code a donc ce problème où,
00:02:51hé, la roue a déjà été inventée.
00:02:52Nous avons la roue ici dans ce programme.
00:02:53Et c'est du genre, tu sais quoi ?
00:02:55Je vais construire une roue à partir de zéro.
00:02:56Et à cause de cela,
00:02:57c'est ainsi que vous vous retrouvez avec beaucoup de code
00:02:59alors que vous n'en avez pas forcément besoin.
00:03:01C'est quelque chose que l'on observe sans cesse
00:03:03dans ces benchmarks.
00:03:04Et pour prendre un peu de recul,
00:03:05ces six étapes reviennent toutes à demander à Claude Code,
00:03:09du genre, hé, est-ce que cette fonctionnalité existe déjà de manière native ?
00:03:12Devons-nous créer quelque chose de personnalisé ?
00:03:15Parce que Claude aime créer des choses personnalisées,
00:03:17même s'il n'y est pas obligé.
00:03:18Donc si la bibliothèque standard ne le fait pas,
00:03:20alors il se dit : est-ce une fonctionnalité native de la plateforme ?
00:03:22Est-ce une dépendance déjà installée ?
00:03:24Cela peut-il tenir en une seule ligne ?
00:03:26Avons-nous besoin d'être verbeux ?
00:03:27Et s'il passe par tout cela
00:03:28et que c'est essentiellement du genre, non, non, non, non, non,
00:03:30alors nous disons : quoi que tu écrives,
00:03:33fais le minimum syndical qui fonctionne.
00:03:35N'en fais pas trop.
00:03:36Ne le crée pas si nous n'en avons pas besoin.
00:03:37Et si nous en avons besoin, fais le strict minimum.
00:03:40L'idée ici est donc de rendre Claude Code paresseux,
00:03:42mais pas négligent.
00:03:44Tout ce qui touche aux validations de frontières de confiance,
00:03:47à la perte de données, à la gestion, à la sécurité et à l'accessibilité
00:03:48n'est jamais remis en cause.
00:03:50Il est donc plutôt intelligent quant aux domaines où il applique ce processus.
00:03:53Maintenant, en ce qui concerne l'installation, c'est relativement simple.
00:03:55Vous allez simplement copier cette commande juste ici.
00:03:57Et je mettrai un lien dans la description
00:03:58pour ce dépôt, évidemment,
00:04:00et cela se chargera de l'installer pour vous.
00:04:01Et vous pouvez également l'utiliser pour codecs,
00:04:03ou vraiment n'importe quel autre agent IA.
00:04:05Il y a quelques commandes en ce qui concerne Ponytail.
00:04:07À savoir : light, full, ultra et off.
00:04:10Encore une fois, cela rappelle beaucoup Caveman,
00:04:12avec des niveaux similaires à ceux que nous visons pour Caveman.
00:04:14Nous pouvons lui demander de relire notre code.
00:04:16Nous pouvons lui faire auditer un dépôt.
00:04:18Et nous disposons également des compétences debt, gain et help.
00:04:20Encore une fois, vous pouvez vraiment creuser tout cela
00:04:22si vous le souhaitez à l'intérieur du dépôt GitHub.
00:04:24Mais tout cela n'a pas vraiment d'importance
00:04:24si les benchmarks ne tiennent pas la route.
00:04:26Et la bonne chose avec ce dépôt,
00:04:28c'est qu'ils nous fournissent les benchmarks.
00:04:29Nous pouvons les exécuter par nous-mêmes.
00:04:31Et devinez quoi ?
00:04:32C'est exactement ce que j'ai fait.
00:04:34Vous pouvez le faire vous-même également.
00:04:36Il y a un compte rendu complet
00:04:37sur la façon dont ils ont obtenu ces benchmarks
00:04:39juste ici dans le fichier README.
00:04:40Et cela vous donne également la possibilité de les reproduire.
00:04:43Et donc ce que je vais vous montrer,
00:04:44ce sont les chiffres que j'ai obtenus
00:04:45quand j'ai reproduit tous ces benchmarks.
00:04:48Et je les ai reproduits non seulement avec Haiku 4.5,
00:04:51ce que vous voyez dans le dépôt,
00:04:52mais je l'ai fait aussi avec Opus 4.8.
00:04:54Parce qu'encore une fois, aucun d'entre nous n'utilise Haiku.
00:04:56Je ne me soucie pas vraiment de Haiku.
00:04:58Je me soucie d'Opus.
00:05:00Et les résultats étaient franchement plutôt intéressants.
00:05:02Voici donc les tests, et voici les scores.
00:05:04Vous voyez leurs chiffres publiés.
00:05:07Vous voyez notre test avec Haiku.
00:05:09Et puis là-bas, tout à droite,
00:05:10se trouve notre test avec Opus.
00:05:12En bas, vous avez l'agrégat.
00:05:14Donc le 54 %, il s'agit encore une fois du nombre de lignes de code.
00:05:17Il y a 54 % de lignes de code en moins, selon Ponytail.
00:05:21Lorsque nous l'avons exécuté, c'était 56 % sur Haiku.
00:05:24Donc, c'est pratiquement la même chose.
00:05:27Et sur Opus, on était à 71 %.
00:05:29On a donc constaté des gains encore plus importants ou un code plus efficace avec Ponytail en utilisant Opus.
00:05:36Pourquoi ça ?
00:05:36Parce que ces modèles plus puissants aiment un peu trop parler, n'est-ce pas ?
00:05:40Ils aiment être verbeux.
00:05:41Encore une fois, c'est un clin d'œil à Caveman.
00:05:43Vous vous souvenez peut-être d'une des études mentionnées là-bas
00:05:45qui aborde cette idée que les modèles très verbeux aiment beaucoup parler,
00:05:50au point qu'ils finissent parfois par s'éloigner de la bonne réponse.
00:05:53C'est donc plutôt intéressant et c'est en quelque sorte un coup de pouce pour cet outil.
00:05:57Et c'est intéressant.
00:05:58Ils expliquent pourquoi ils ont utilisé Haiku pour les tests : c'était une question de coût.
00:06:02Je pense vraiment qu'ils auraient dû faire tout ça avec Opus,
00:06:04parce qu'en l'essayant, Opus met vraiment l'outil en valeur.
00:06:09Vous savez, c'est le modèle que les gens utilisent.
00:06:11Donc, si quoi que ce soit, ils ont plutôt sous-vendu son efficacité en termes de lignes de code.
00:06:15Et cela s'applique aussi aux coûts.
00:06:17Quand on regarde Haiku 4.5, quel était le résultat global sur nos tests ?
00:06:21On a observé environ 25 % de réduction des coûts par rapport à Opus 4.8 qui affiche 53 % de réduction,
00:06:28ce qui est fou.
00:06:30Ça nous coûte 53 % de moins.
00:06:32Imaginez avec Fable.
00:06:33Et vous pouvez voir tous les tests et les chiffres dans l'ensemble.
00:06:35Le plus bas était de 13 %.
00:06:38Et dans certains cas, il montait jusqu'à 73 % pour un assistant en plusieurs étapes.
00:06:42Alors vous vous direz peut-être : a-t-on vraiment besoin d'Opus pour certains d'entre eux ?
00:06:45Bonne remarque.
00:06:45Mais comprenez bien ce qui est illustré ici.
00:06:48Ce qui coûterait normalement 1,39 $ avec l'Opus standard sans la compétence nous a coûté 0,38 $
00:06:55en utilisant Ponytail.
00:06:57Et si l'on regarde Haiku, ces petits modèles ont parfois fini par coûter plus cher avec Ponytail.
00:07:04Donc toute cette idée de réduire les lignes de code et de gagner en efficacité est bien meilleure avec les modèles plus puissants.
00:07:11Dans certains cas, on obtient l'effet inverse avec les petits modèles, car ils étaient déjà efficaces étant un peu plus basiques et rapides.
00:07:18Vous voyez ici dans le test de comptage d'éléments, c'était 21 % plus cher d'utiliser Ponytail avec Haiku.
00:07:27On parle d'une différence de deux centimes, mais l'idée reste la même.
00:07:31Plus le modèle est fort, plus cette architecture est efficace.
00:07:34Et j'adorerais voir ce que cela donne avec Fable.
00:07:37Encore une fois, 53 %, ce n'est pas rien.
00:07:39Et qu'en est-il de la vitesse ?
00:07:40Encore une fois, on observe la même chose avec Haiku.
00:07:43À quel point était-ce plus rapide ?
00:07:44Environ 31 % de plus, 31 % plus rapide d'utiliser Haiku avec Ponytail que sans.
00:07:51Avec Opus, c'est 71 % plus rapide.
00:07:5571 % plus rapide.
00:07:56Et qu'observe-t-on encore avec Haiku ?
00:07:58Il y a des cas, trois en fait, où c'était plus lent avec Ponytail.
00:08:03Vous savez, parfois 22 % plus lent, contrairement à tous les benchmarks pour Opus, qui affichent jusqu'à 88 %.
00:08:10Dans certains cas, c'était toujours plus rapide, n'est-ce pas ?
00:08:13Encore une fois, assistant en plusieurs étapes 78 %, sélecteur de date 88 %.
00:08:17Et dans le pire des scénarios, il y avait une différence de 27 %.
00:08:22Alors on regarde ces chiffres avec Ponytail en se disant, bof, à prendre avec des pincettes, même si je peux faire les benchmarks, c'est quoi 20 % ?
00:08:31Et puis on se dit : ah, c'est Haiku.
00:08:33Donc c'est un peu du pipeau.
00:08:34Ensuite on teste sur Opus et c'est radicalement différent.
00:08:36C'est infiniment plus efficace.
00:08:37Et je pense que la question évidente devient : qu'en est-il des benchmarks eux-mêmes ?
00:08:41Quelle est l'efficacité de ces benchmarks ?
00:08:42Sont-ils réalistes ?
00:08:44Tout d'abord, allez sur le dépôt, testez-les par vous-même ou lancez vos propres benchmarks qui correspondent à ce que vous jugez légitime.
00:08:52Quoi qu'il arrive, je pense que parmi les 19 benchmarks différents effectués, on commence à observer la même tendance générale.
00:08:59Quand on regarde un modèle plus puissant comme Opus, honnêtement, j'ai tendance à ignorer tout ça pour Haiku.
00:09:04Je me fiche de Haiku.
00:09:06C'est moins cher.
00:09:07C'est plus rapide.
00:09:08Et par conséquent, c'est plus efficace.
00:09:11Et encore une fois, puisqu'il s'agit fondamentalement d'une simple compétence, quel est l'inconvénient d'essayer ?
00:09:16Ces chiffres ont l'air vraiment bons.
00:09:17Je vous suggère vivement d'aller sur ce dépôt, de le télécharger et de l'utiliser vous-même.
00:09:21Dans le pire des cas, disons que pour votre projet particulier, c'est tellement complexe que de lui demander d'être moins verbeux se retourne contre vous.
00:09:30Eh bien, je pense que c'est un scénario sans risque, n'est-ce pas ?
00:09:34C'est donc le pire des cas.
00:09:37Le meilleur des cas, c'est d'économiser environ 50 % sur votre utilisation d'Opus avec un gain de rapidité de 70 %.
00:09:43C'est donc vraiment très intéressant.
00:09:45Je vais assurément l'utiliser au quotidien.
00:09:47J'utilise Caveman depuis un mois ou deux tout le temps, il est chargé automatiquement.
00:09:52Et je vais passer à Ponytail pour voir si ça me plaît.
00:09:55Je pense que plus il y a de projets de ce genre qui sortent, mieux c'est.
00:09:58On n'entend parler que de coût de tokens ces derniers temps.
00:10:03Tout ce qui peut réduire cela pour nous sera donc bien accueilli.
00:10:07C'est donc sur ça que je vais conclure cette vidéo.
00:10:08Comme toujours, n'oubliez pas d'aller jeter un œil à ChaseAI Plus si vous souhaitez obtenir ma masterclass Cloud Code.
00:10:13Dites-moi ce que vous en pensez dans les commentaires et à bientôt.

Key Takeaway

Le dépôt open source Ponytail réduit le volume de code de 71 %, baisse les coûts de 53 % et accélère l'exécution de 71 % avec Claude Code en forçant une approche minimaliste.

Highlights

  • Ponytail atteint 40 000 étoiles sur GitHub sept jours après sa sortie.

  • L'utilisation de Ponytail avec le modèle Opus 4.8 réduit les lignes de code de 71 %.

  • Les coûts de génération avec Opus 4.8 diminuent de 53 % grâce à l'outil.

  • La vitesse d'exécution augmente de 71 % avec Opus 4.8 lors de l'utilisation de Ponytail.

  • Le processus en six étapes de l'outil élimine la création de code redondant ou personnalisé non nécessaire.

Timeline

Présentation de Ponytail et des performances initiales

  • Ponytail revendique une réduction drastique de la verbosité de Claude Code.
  • Le dépôt atteint 40 000 étoiles en une semaine.
  • Les tests initiaux avec Haiku 4.5 montrent une baisse de 50 % des lignes de code.

L'outil s'inscrit dans la lignée de projets similaires comme Caveman en ciblant la tendance naturelle de Claude Code à générer du code verbeux. Les chiffres agrégés présentés initialement démontrent des gains de 20 à 30 % sur les jetons, les coûts et le temps avec le modèle Haiku.

Fonctionnement et architecture en six étapes

  • Le processus évalue la nécessité absolue d'écrire du code avant toute action.
  • L'outil vérifie systématiquement si la bibliothèque standard ou une dépendance existante couvre le besoin.
  • Le principe directeur consiste à rendre le modèle paresseux mais rigoureux sur la sécurité.

Avant d'écrire une seule ligne, Ponytail pose une série de questions pour éviter de réinventer la roue. Il privilégie les fonctionnalités natives et la bibliothèque standard tout en préservant les validations de frontières de confiance et la gestion des données.

Reproduction des benchmarks avec Haiku et Opus

  • L'expérimentation avec Opus 4.8 révèle une réduction des lignes de code de 71 %.
  • Les modèles plus puissants bénéficient davantage de cette architecture en raison de leur tendance naturelle à la verbosité.
  • La vitesse d'exécution progresse de 71 % et les coûts baissent de 53 % avec Opus.

La reproduction des tests avec un modèle plus performant comme Opus 4.8 amplifie considérablement l'efficacité de l'outil, contrairement à Haiku où les gains sont plus limités ou parfois négatifs. L'utilisation quotidienne de Ponytail valide une baisse significative des coûts de tokens.

Community Posts

View all posts