Ce dépôt open source résout le plus gros problème de Claude Code
CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00Est-ce qu'une seule compétence peut rendre CloudCode extrêmement plus efficace ?
00:00:03Peut-il rendre CloudCode plus rapide, moins cher et écrire moins de code
00:00:06tout en offrant le même genre de résultats de haut niveau auxquels nous sommes habitués ?
00:00:10Eh bien, c'est exactement ce que Ponytail prétend être capable de faire,
00:00:13ce qui lui a valu d'atteindre 40 000 étoiles seulement sept jours après sa sortie.
00:00:18Maintenant, Ponytail n'est pas le premier outil que nous voyons prétendre faire une telle chose.
00:00:22Nous avons parlé de Caveman par le passé, et tous ces outils ont tendance à reposer sur la même idée.
00:00:26L'idée est que CloudCode est naturellement verbeux,
00:00:29et si nous lui disons, hé, arrête de parler autant,
00:00:32nous pouvons obtenir une réponse beaucoup plus concise qui est finalement tout aussi correcte
00:00:36ou, comme nous nous en souvenons avec Caveman, pourrait même s'avérer plus correcte.
00:00:40Ponytail en est simplement la dernière version,
00:00:42mais c'est une version qui revendique des chiffres meilleurs que tout ce que nous avons vu par le passé.
00:00:45Et nous pouvons voir ces chiffres ici même.
00:00:47Nous pouvons voir les lignes de code par rapport aux jetons, au coût et au temps.
00:00:52Et sur tous les plans, le gris représentant la référence sans aucun de ces outils
00:00:55et le vert représentant Ponytail,
00:00:58Ponytail mène pratiquement la danse partout ou s'en approche de très près.
00:01:03Maintenant, les chiffres que vous voyez ici sont des agrégats.
00:01:05Il s'agit de la moyenne calculée sur un certain nombre de tests différents,
00:01:08et cela a également été réalisé en utilisant Haiku 4.5.
00:01:11Et ne vous inquiétez pas, plus tard nous allons A, valider ces tests,
00:01:14et jeter un œil à un vrai modèle, car aucun d'entre nous n'utilise vraiment Haiku 4.5.
00:01:18Nous utilisons Opus 4.8, alors voyons à quoi ressemblent ces chiffres.
00:01:20Et en ce qui concerne les lignes de code, c'est environ 50 % de lignes en moins.
00:01:24Et si l'on regarde en termes de jetons, de coût et de temps,
00:01:27on observe des améliorations d'environ 20 % à 30 % par rapport à la référence.
00:01:31Et ce n'est pas rien,
00:01:32surtout lorsque nous extrapolons cela à quelque chose comme Fable,
00:01:36qui est extrêmement coûteux.
00:01:37Donc si je pouvais vous dire, hé, si vous utilisez un outil comme Fable,
00:01:40ce sera plus rapide et moins cher.
00:01:42Eh bien, nous adorerions ça, n'est-ce pas ?
00:01:43Maintenant, avant de vous expliquer comment cela fonctionne
00:01:45et de vous montrer à quoi ressemblent les scores de référence,
00:01:47lorsque je l'ai testé, un petit mot du sponsor d'aujourd'hui : moi-même.
00:01:50Ainsi, au sein de Chase AI+, je propose ma Masterclass Claude Code,
00:01:53qui est le meilleur moyen de passer de zéro au développement par IA,
00:01:56surtout si vous ne venez pas d'un milieu technique.
00:01:59Je mets cela à jour chaque semaine,
00:02:01et cela comprend également des masterclasses sur Codecs
00:02:03et sur la façon de construire votre propre OS d'agents.
00:02:06Vous trouverez un lien vers celle-ci dans le commentaire épinglé.
00:02:08Et encore une fois, je mets cela à jour chaque semaine,
00:02:10et nous nous concentrons sur des cas d'usage réels.
00:02:12Donc si vous voulez commencer à maîtriser Claude Code,
00:02:15c'est l'endroit idéal pour vous.
00:02:16Alors, comment fonctionne Ponytail ?
00:02:17Eh bien, il passe par un processus en six étapes
00:02:19avant d'écrire le moindre code.
00:02:20La première question est donc :
00:02:22est-ce que cela a seulement besoin d'exister ?
00:02:24Si la réponse est non,
00:02:26eh bien, nous n'écrivons tout simplement pas de code pour cela.
00:02:28C'est relativement évident.
00:02:29Ensuite, nous demandons : est-ce que la bibliothèque standard le fait ?
00:02:33Si la réponse est oui,
00:02:34nous allons utiliser la bibliothèque standard.
00:02:36La grande chose que vous allez remarquer avec les benchmarks,
00:02:38c'est qu'il y a des cas où Claude Code
00:02:41recrée des fonctionnalités de zéro alors qu'elles existent déjà,
00:02:45soit au sein d'une bibliothèque quelconque, soit en tant que fonctionnalité de la plateforme.
00:02:49Claude Code a donc ce problème où,
00:02:51hé, la roue a déjà été inventée.
00:02:52Nous avons la roue ici dans ce programme.
00:02:53Et c'est du genre, tu sais quoi ?
00:02:55Je vais construire une roue à partir de zéro.
00:02:56Et à cause de cela,
00:02:57c'est ainsi que vous vous retrouvez avec beaucoup de code
00:02:59alors que vous n'en avez pas forcément besoin.
00:03:01C'est quelque chose que l'on observe sans cesse
00:03:03dans ces benchmarks.
00:03:04Et pour prendre un peu de recul,
00:03:05ces six étapes reviennent toutes à demander à Claude Code,
00:03:09du genre, hé, est-ce que cette fonctionnalité existe déjà de manière native ?
00:03:12Devons-nous créer quelque chose de personnalisé ?
00:03:15Parce que Claude aime créer des choses personnalisées,
00:03:17même s'il n'y est pas obligé.
00:03:18Donc si la bibliothèque standard ne le fait pas,
00:03:20alors il se dit : est-ce une fonctionnalité native de la plateforme ?
00:03:22Est-ce une dépendance déjà installée ?
00:03:24Cela peut-il tenir en une seule ligne ?
00:03:26Avons-nous besoin d'être verbeux ?
00:03:27Et s'il passe par tout cela
00:03:28et que c'est essentiellement du genre, non, non, non, non, non,
00:03:30alors nous disons : quoi que tu écrives,
00:03:33fais le minimum syndical qui fonctionne.
00:03:35N'en fais pas trop.
00:03:36Ne le crée pas si nous n'en avons pas besoin.
00:03:37Et si nous en avons besoin, fais le strict minimum.
00:03:40L'idée ici est donc de rendre Claude Code paresseux,
00:03:42mais pas négligent.
00:03:44Tout ce qui touche aux validations de frontières de confiance,
00:03:47à la perte de données, à la gestion, à la sécurité et à l'accessibilité
00:03:48n'est jamais remis en cause.
00:03:50Il est donc plutôt intelligent quant aux domaines où il applique ce processus.
00:03:53Maintenant, en ce qui concerne l'installation, c'est relativement simple.
00:03:55Vous allez simplement copier cette commande juste ici.
00:03:57Et je mettrai un lien dans la description
00:03:58pour ce dépôt, évidemment,
00:04:00et cela se chargera de l'installer pour vous.
00:04:01Et vous pouvez également l'utiliser pour codecs,
00:04:03ou vraiment n'importe quel autre agent IA.
00:04:05Il y a quelques commandes en ce qui concerne Ponytail.
00:04:07À savoir : light, full, ultra et off.
00:04:10Encore une fois, cela rappelle beaucoup Caveman,
00:04:12avec des niveaux similaires à ceux que nous visons pour Caveman.
00:04:14Nous pouvons lui demander de relire notre code.
00:04:16Nous pouvons lui faire auditer un dépôt.
00:04:18Et nous disposons également des compétences debt, gain et help.
00:04:20Encore une fois, vous pouvez vraiment creuser tout cela
00:04:22si vous le souhaitez à l'intérieur du dépôt GitHub.
00:04:24Mais tout cela n'a pas vraiment d'importance
00:04:24si les benchmarks ne tiennent pas la route.
00:04:26Et la bonne chose avec ce dépôt,
00:04:28c'est qu'ils nous fournissent les benchmarks.
00:04:29Nous pouvons les exécuter par nous-mêmes.
00:04:31Et devinez quoi ?
00:04:32C'est exactement ce que j'ai fait.
00:04:34Vous pouvez le faire vous-même également.
00:04:36Il y a un compte rendu complet
00:04:37sur la façon dont ils ont obtenu ces benchmarks
00:04:39juste ici dans le fichier README.
00:04:40Et cela vous donne également la possibilité de les reproduire.
00:04:43Et donc ce que je vais vous montrer,
00:04:44ce sont les chiffres que j'ai obtenus
00:04:45quand j'ai reproduit tous ces benchmarks.
00:04:48Et je les ai reproduits non seulement avec Haiku 4.5,
00:04:51ce que vous voyez dans le dépôt,
00:04:52mais je l'ai fait aussi avec Opus 4.8.
00:04:54Parce qu'encore une fois, aucun d'entre nous n'utilise Haiku.
00:04:56Je ne me soucie pas vraiment de Haiku.
00:04:58Je me soucie d'Opus.
00:05:00Et les résultats étaient franchement plutôt intéressants.
00:05:02Voici donc les tests, et voici les scores.
00:05:04Vous voyez leurs chiffres publiés.
00:05:07Vous voyez notre test avec Haiku.
00:05:09Et puis là-bas, tout à droite,
00:05:10se trouve notre test avec Opus.
00:05:12En bas, vous avez l'agrégat.
00:05:14Donc le 54 %, il s'agit encore une fois du nombre de lignes de code.
00:05:17Il y a 54 % de lignes de code en moins, selon Ponytail.
00:05:21Lorsque nous l'avons exécuté, c'était 56 % sur Haiku.
00:05:24Donc, c'est pratiquement la même chose.
00:05:27Et sur Opus, on était à 71 %.
00:05:29On a donc constaté des gains encore plus importants ou un code plus efficace avec Ponytail en utilisant Opus.
00:05:36Pourquoi ça ?
00:05:36Parce que ces modèles plus puissants aiment un peu trop parler, n'est-ce pas ?
00:05:40Ils aiment être verbeux.
00:05:41Encore une fois, c'est un clin d'œil à Caveman.
00:05:43Vous vous souvenez peut-être d'une des études mentionnées là-bas
00:05:45qui aborde cette idée que les modèles très verbeux aiment beaucoup parler,
00:05:50au point qu'ils finissent parfois par s'éloigner de la bonne réponse.
00:05:53C'est donc plutôt intéressant et c'est en quelque sorte un coup de pouce pour cet outil.
00:05:57Et c'est intéressant.
00:05:58Ils expliquent pourquoi ils ont utilisé Haiku pour les tests : c'était une question de coût.
00:06:02Je pense vraiment qu'ils auraient dû faire tout ça avec Opus,
00:06:04parce qu'en l'essayant, Opus met vraiment l'outil en valeur.
00:06:09Vous savez, c'est le modèle que les gens utilisent.
00:06:11Donc, si quoi que ce soit, ils ont plutôt sous-vendu son efficacité en termes de lignes de code.
00:06:15Et cela s'applique aussi aux coûts.
00:06:17Quand on regarde Haiku 4.5, quel était le résultat global sur nos tests ?
00:06:21On a observé environ 25 % de réduction des coûts par rapport à Opus 4.8 qui affiche 53 % de réduction,
00:06:28ce qui est fou.
00:06:30Ça nous coûte 53 % de moins.
00:06:32Imaginez avec Fable.
00:06:33Et vous pouvez voir tous les tests et les chiffres dans l'ensemble.
00:06:35Le plus bas était de 13 %.
00:06:38Et dans certains cas, il montait jusqu'à 73 % pour un assistant en plusieurs étapes.
00:06:42Alors vous vous direz peut-être : a-t-on vraiment besoin d'Opus pour certains d'entre eux ?
00:06:45Bonne remarque.
00:06:45Mais comprenez bien ce qui est illustré ici.
00:06:48Ce qui coûterait normalement 1,39 $ avec l'Opus standard sans la compétence nous a coûté 0,38 $
00:06:55en utilisant Ponytail.
00:06:57Et si l'on regarde Haiku, ces petits modèles ont parfois fini par coûter plus cher avec Ponytail.
00:07:04Donc toute cette idée de réduire les lignes de code et de gagner en efficacité est bien meilleure avec les modèles plus puissants.
00:07:11Dans certains cas, on obtient l'effet inverse avec les petits modèles, car ils étaient déjà efficaces étant un peu plus basiques et rapides.
00:07:18Vous voyez ici dans le test de comptage d'éléments, c'était 21 % plus cher d'utiliser Ponytail avec Haiku.
00:07:27On parle d'une différence de deux centimes, mais l'idée reste la même.
00:07:31Plus le modèle est fort, plus cette architecture est efficace.
00:07:34Et j'adorerais voir ce que cela donne avec Fable.
00:07:37Encore une fois, 53 %, ce n'est pas rien.
00:07:39Et qu'en est-il de la vitesse ?
00:07:40Encore une fois, on observe la même chose avec Haiku.
00:07:43À quel point était-ce plus rapide ?
00:07:44Environ 31 % de plus, 31 % plus rapide d'utiliser Haiku avec Ponytail que sans.
00:07:51Avec Opus, c'est 71 % plus rapide.
00:07:5571 % plus rapide.
00:07:56Et qu'observe-t-on encore avec Haiku ?
00:07:58Il y a des cas, trois en fait, où c'était plus lent avec Ponytail.
00:08:03Vous savez, parfois 22 % plus lent, contrairement à tous les benchmarks pour Opus, qui affichent jusqu'à 88 %.
00:08:10Dans certains cas, c'était toujours plus rapide, n'est-ce pas ?
00:08:13Encore une fois, assistant en plusieurs étapes 78 %, sélecteur de date 88 %.
00:08:17Et dans le pire des scénarios, il y avait une différence de 27 %.
00:08:22Alors on regarde ces chiffres avec Ponytail en se disant, bof, à prendre avec des pincettes, même si je peux faire les benchmarks, c'est quoi 20 % ?
00:08:31Et puis on se dit : ah, c'est Haiku.
00:08:33Donc c'est un peu du pipeau.
00:08:34Ensuite on teste sur Opus et c'est radicalement différent.
00:08:36C'est infiniment plus efficace.
00:08:37Et je pense que la question évidente devient : qu'en est-il des benchmarks eux-mêmes ?
00:08:41Quelle est l'efficacité de ces benchmarks ?
00:08:42Sont-ils réalistes ?
00:08:44Tout d'abord, allez sur le dépôt, testez-les par vous-même ou lancez vos propres benchmarks qui correspondent à ce que vous jugez légitime.
00:08:52Quoi qu'il arrive, je pense que parmi les 19 benchmarks différents effectués, on commence à observer la même tendance générale.
00:08:59Quand on regarde un modèle plus puissant comme Opus, honnêtement, j'ai tendance à ignorer tout ça pour Haiku.
00:09:04Je me fiche de Haiku.
00:09:06C'est moins cher.
00:09:07C'est plus rapide.
00:09:08Et par conséquent, c'est plus efficace.
00:09:11Et encore une fois, puisqu'il s'agit fondamentalement d'une simple compétence, quel est l'inconvénient d'essayer ?
00:09:16Ces chiffres ont l'air vraiment bons.
00:09:17Je vous suggère vivement d'aller sur ce dépôt, de le télécharger et de l'utiliser vous-même.
00:09:21Dans le pire des cas, disons que pour votre projet particulier, c'est tellement complexe que de lui demander d'être moins verbeux se retourne contre vous.
00:09:30Eh bien, je pense que c'est un scénario sans risque, n'est-ce pas ?
00:09:34C'est donc le pire des cas.
00:09:37Le meilleur des cas, c'est d'économiser environ 50 % sur votre utilisation d'Opus avec un gain de rapidité de 70 %.
00:09:43C'est donc vraiment très intéressant.
00:09:45Je vais assurément l'utiliser au quotidien.
00:09:47J'utilise Caveman depuis un mois ou deux tout le temps, il est chargé automatiquement.
00:09:52Et je vais passer à Ponytail pour voir si ça me plaît.
00:09:55Je pense que plus il y a de projets de ce genre qui sortent, mieux c'est.
00:09:58On n'entend parler que de coût de tokens ces derniers temps.
00:10:03Tout ce qui peut réduire cela pour nous sera donc bien accueilli.
00:10:07C'est donc sur ça que je vais conclure cette vidéo.
00:10:08Comme toujours, n'oubliez pas d'aller jeter un œil à ChaseAI Plus si vous souhaitez obtenir ma masterclass Cloud Code.
00:10:13Dites-moi ce que vous en pensez dans les commentaires et à bientôt.