Ce dépôt open source résout le plus grand problème de Claude

CChase AI
컴퓨터/소프트웨어

스크립트

00:00:00Vous ne pouvez pas faire confiance à Claude pour évaluer son propre travail, ce qui pose un problème majeur, mais que cette compétence
00:00:05résout. Elle s'appelle Claudex Loop, et le principe est simple. Au lieu de confier à Claude
00:00:09la planification, l'exécution et l'évaluation de son propre travail, pourquoi ne pas faire appel à Codex pour examiner
00:00:16lui aussi le plan et l'exécution de Claude, et dire : voilà ce qui va, ce qui ne va pas, et ce que
00:00:22je pense que tu devrais changer. Car l'un des grands problèmes de tous les modèles d'IA actuels
00:00:25est qu'ils jugent leur propre travail de manière très favorable. Lorsque je demande à Claude si le plan qu'il a
00:00:30créé est bon, il va répondre qu'il est génial. Il est donc important de mettre en place des systèmes
00:00:35permettant d'apporter un second regard sur ce que le premier modèle a construit, pour dire si c'est validé
00:00:40ou rejeté, et pourquoi. Aujourd'hui, je vais donc non seulement vous donner cette compétence, mais aussi vous expliquer
00:00:44son fonctionnement interne et vous faire une rapide démo. Cette compétence se décompose en quatre phases,
00:00:48l'idée étant de l'invoquer avant d'ajouter une fonctionnalité quelconque, ou si vous démarrez un tout nouveau
00:00:53projet de zéro. De manière générale, quel que soit le plan imaginé ou exécuté par le premier modèle,
00:00:58nous attendons que le second modèle l'examine et confirme que tout est parfait
00:01:02avant de passer aux choses sérieuses. Lors de la première phase, nous effectuons une reconnaissance. Nous allons
00:01:07partir à la recherche d'informations sur le web, Claude va explorer le terrain pour voir si les réponses
00:01:10existent réellement. Nous pouvons choisir d'activer la recherche approfondie, qui est le flux dynamique intégré, si nous
00:01:15voulons creuser les réponses obtenues. Ensuite, nous passons à la phase d'interrogation.
00:01:20Voyez cela comme un mode plan amélioré avec une série de questions, pour essayer d'être sur la même longueur d'onde
00:01:25que Claude avant qu'il ne rédige son premier plan. Deuxièmement, c'est ici que nous faisons intervenir le deuxième
00:01:28modèle : c'est l'étape de révision. Ainsi, après avoir élaboré un plan basé sur tout ce dont
00:01:34nous avons discuté et recherché, Claude Code va créer votre fichier plan.md standard.
00:01:38À partir de là, Codex examine ce plan dans un environnement isolé en lecture seule, et il indique
00:01:43soit que c'est approuvé, soit qu'il faut modifier x, y et z. Il renvoie ensuite cette réponse
00:01:49avec les révisions à Claude Code. Claude Code l'examine, indique s'il est d'accord ou non,
00:01:55puis renvoie ses modifications. Cette boucle peut se répéter jusqu'à cinq fois. Personnellement,
00:02:01je n'ai jamais eu le cas où cela s'arrêtait à cinq reprises sans qu'un état approuvé ne soit atteint. Cependant,
00:02:06j'ai fixé la limite à cinq, que vous pouvez facilement modifier avec cette compétence pour éviter de vous retrouver coincé dans une boucle
00:02:11sans fin à gaspiller des jetons indéfiniment. Cela pose une limite claire pour vous épargner cette situation.
00:02:15Enfin, une fois que Claude et Codex se sont mis d'accord et qu'un plan a été créé, nous passons à la phase de construction.
00:02:20Cette compétence vous permet non seulement de laisser Claude construire, mais aussi de faire participer Codex.
00:02:24Mais quel que soit le modèle qui réalise la construction, le second modèle va à nouveau examiner ce qui a été créé
00:02:30avant de valider quoi que ce soit. Encore une fois, sous le capot, il y a de nombreuses variables ajustables.
00:02:34Comme je l'ai mentionné, nous avons la section de révision, fixée à cinq. Pour la section de construction,
00:02:38lorsque nous demandons à Codex de vérifier notre travail, j'ai réduit cela à deux boucles,
00:02:43toujours pour éviter de tomber dans des scénarios de boucles sans fin. Je n'ai pas vraiment rencontré
00:02:48de problèmes où j'ai eu l'impression de devoir augmenter cette valeur. Mais vous pouvez faire des essais.
00:02:52D'ailleurs, vous pourriez aller plus loin et intégrer un modèle local à la place de Codex,
00:02:56si c'est l'approche qui vous convient. Si vous utilisiez la version précédente de cette compétence,
00:03:00qui s'appelait Grill Me Codex, les changements notables de Claudix Loop
00:03:04concernent un mode d'interrogation renforcé, qui pousse les questionnements plus loin. Et dans
00:03:08la phase d'exécution, nous avons davantage intégré Codex pour obtenir un regard critique sur
00:03:13le code réellement produit. Passons maintenant à la démo concrète. Mais avant d'y venir,
00:03:18un mot de notre sponsor d'aujourd'hui : moi-même. Je viens de publier une version entièrement mise à jour de ma
00:03:23masterclass Claude Code dans Chase AI Plus, et c'est le meilleur moyen de passer de débutant à développeur IA,
00:03:28surtout si vous n'avez pas de bagage technique. Nous nous concentrons sur des cas d'usage réels,
00:03:33avec des mises à jour chaque semaine. Si vous souhaitez maîtriser cet outil extraordinaire
00:03:38sans venir du monde du développement logiciel, c'est fait pour vous. Le lien vers cette formation
00:03:42se trouve dans le commentaire épinglé. Pour la démo d'aujourd'hui, nous allons utiliser
00:03:47Claudex Loop pour recréer Calendee. Si vous ne savez pas ce qu'est Calendee, c'est une application web de prise de rendez-vous :
00:03:51vous partagez un lien, les gens voient votre calendrier, choisissent un créneau, et l'outil génère automatiquement
00:03:56un lien Zoom ou Google Meet. C'est un service très utilisé et payant.
00:04:00Je me suis dit : pourquoi ne pas le créer nous-mêmes pour économiser une dizaine de dollars par mois,
00:04:05ou quel que soit le montant que je paie – je devrais probablement le savoir. Je vais donc simplement
00:04:09taper la commande Claudex loop et exprimer mes pensées en vrac en disant :
00:04:13je veux utiliser Claudex loop pour créer notre propre version de Calendee.
00:04:18Pour l'instant, je préférerais qu'il utilise Google Meet plutôt que Zoom, mais je veux qu'il soit synchronisé
00:04:25avec mon calendrier et qu'il recrée l'essentiel des fonctionnalités de Calendee. Allons-y.
00:04:32Au début, nous sommes dans la phase zéro, celle de la recherche. L'outil demande :
00:04:38comment souhaitez-vous procéder pour cette recherche ? Soit une recherche web classique
00:04:41où Claude envoie quelques sous-agents, soit une recherche approfondie complète. Avec cette compétence,
00:04:46j'ai configuré par défaut le modèle Opus. Comme vous le savez, lancer une recherche approfondie
00:04:50sollicite des sous-agents qui peuvent faire flamber votre consommation. C'est pourquoi j'utilise Opus directement
00:04:56pour vous faciliter la tâche. Bien entendu, vous pouvez faire autrement. L'outil recommande le web,
00:05:01mais je vais opter pour une recherche approfondie pour voir les résultats. Il va m'afficher
00:05:05la proposition de recherche ainsi que les questions auxquelles il essaie de répondre.
00:05:10Il doit recueillir des informations sur Google Calendar, Meet, les pièges du domaine de la planification
00:05:14et la stack technique globale. Si j'approuve, je lance le processus. Et si je souhaite
00:05:19modifier quelque chose, c'est très simple. Claude a terminé sa recherche approfondie et a généré
00:05:25un registre des hypothèses, qui répertorie tout ce qu'il suppose que vous attendez pour ce projet.
00:05:29Ensuite, il va nous poser d'autres questions pour affiner certains choix. Ce sont des points
00:05:36qui ne font guère de doute. Vous pouvez simplement donner votre accord pour intégrer tout cela
00:05:40dans le plan, ou dire que vous préférez modifier la stack technique ou la gestion
00:05:44des rappels. Mais pour l'instant, nous confirmons, et nous passons à ce qu'il appelle
00:05:48le niveau critique. Nous aimons tous ce terme de « critique » désormais accolé à tout ce que
00:05:53fait Claude. Nous abordons donc ces questions cruciales. La première est :
00:05:57sur quel compte Google se trouve votre véritable calendrier ? Pour chacune de ces questions,
00:06:01l'outil vous fournit une série de propositions accompagnées d'une recommandation.
00:06:05Si vous n'en avez aucune idée, vous pouvez suivre la recommandation. Mais en tant que bonne pratique,
00:06:09si vous ne comprenez pas les explications de Claude concernant les réponses possibles ou la situation,
00:06:13je vous conseille vivement de demander des précisions. C'est de cette façon que l'on progresse
00:06:17en IA et en développement, au lieu de vous contenter d'accepter aveuglément les recommandations.
00:06:23Si vous ne savez pas, demandez à Claude de vous l'expliquer jusqu'à ce que vous compreniez. C'est la seule
00:06:27façon d'apprendre vraiment, même si cela s'éloigne un peu du sujet de cette vidéo. Nous allons donc choisir
00:06:32un Gmail personnel, et je vais sauter directement au moment où j'ai répondu à toutes ces questions,
00:06:35car je pense que vous avez saisi le fonctionnement de cette phase. Après ces questions cruciales,
00:06:40nous passons à des décisions d'ordre cosmétique qui ne modifient pas la fonctionnalité
00:06:44de base de l'application. Ici, elles sont listées comme pour le registre des hypothèses.
00:06:49Vous pouvez valider pour continuer, ou demander à modifier tel ou tel point.
00:06:53J'ai conçu le processus ainsi pour vous permettre d'aller plus vite. Une fois ces questions cosmétiques réglées,
00:06:58nous entrons dans la phase 2. Claude rédige le fichier plan.markdown,
00:07:02puis l'envoie à Codex en utilisant GPT 5.6 Sol. À partir de là,
00:07:08ils échangent pendant un maximum de cinq tours, ou jusqu'à l'obtention d'un accord.
00:07:12Claude et Codex ont donc dialogué pendant cinq tours. Au départ, 27 problèmes
00:07:16avaient été soulevés lors du premier tour, et arrivés au cinquième tour, il reste encore
00:07:20quelques soucis, ils n'ont pas trouvé un accord définitif. J'ai mentionné plus tôt que cela ne m'était jamais
00:07:27arrivé, je suis donc plutôt content que ce soit le cas ici. Nous avons atteint la limite de cinq tours,
00:07:32sans résolution complète. Il reste quelques détails mineurs. Que voulez-vous faire ? Vous avez le choix.
00:07:37Vous pouvez vous arrêter là et conserver l'état actuel, accepter cette situation de blocage, ou prolonger
00:07:43de deux tours. C'est ce que nous allons faire pour voir ce qui se passe lorsqu'ils parviennent enfin
00:07:47à s'entendre. Il est bon de savoir que malgré ces limites strictes, comme les cinq tours de départ,
00:07:51vous n'êtes pas bloqué. Si vous arrivez à ce stade comme nous l'avons fait,
00:07:56vous pouvez très facilement prolonger le processus.
00:08:01de prolonger de deux rounds. C'est ce qu'on va faire, et on verra ce qui se passe lorsqu'ils
00:08:05finiront par se mettre d'accord. Mais c'est bon à savoir et à voir que même avec des limites strictes,
00:08:11par exemple cinq rounds, vous n'y êtes pas bloqués. Si vous arrivez à ce point comme on l'a fait,
00:08:15vous pouvez très facilement prolonger. Donc après sept rounds, ils sont parvenus à un accord, et maintenant
00:08:19l'outil vous demande qui vous voulez voir construire ce truc. Soit on demande à Claude de coder et Codex
00:08:24vérifie, soit on inverse et Codex code pendant que Claude vérifie. Dans certaines situations,
00:08:29selon ce qu'on fait, il propose aussi une construction en tandem. Donc disons
00:08:33qu'on crée quelque chose qui nécessite une génération d'éléments ou l'utilisation d'images GPT
00:08:38dans l'équation. Eh bien, l'outil dira aussi, hé, intégrons Codex pour cette partie spécifique
00:08:43du projet. Mais ici, on va laisser Claude construire. Et maintenant, il va
00:08:47commencer à créer ce qu'on appelle open book. Ainsi, Claude a pu terminer la démo du calendrier,
00:08:51qui est ce qu'on regarde ici. Voyons donc si ça fonctionne réellement. Et ensuite, nous reviendrons
00:08:55pour analyser en détail ce que Codex a apporté à tout ce processus. Nous avons l'appel d'introduction puis une session
00:09:01de travail. Si on va sur l'appel d'intro, on peut voir différents horaires et plannings
00:09:07qui sont synchronisés avec mon calendrier Gmail. Disons que je choisis une heure pour le 31.
00:09:12Je choisis 10 heures. On ajoute mon nom, on met mon e-mail, puis on clique sur conférer la réservation.
00:09:23On peut voir que l'e-mail nous a été envoyé avec un lien de participation. Je peux aussi voir tout mon calendrier,
00:09:28j'ai aussi demandé de créer un simple artefact qui décompose visuellement ce que Codex a ajouté à
00:09:33tout ce processus. On en a parlé plus tôt, cette phase de va-et-vient où Claude avait le plan et
00:09:38où Codex a fait ses ajustements ou proposé des ajustements qui ont duré jusqu'à
00:09:42sept rounds. On a commencé avec 27 problèmes. À chaque round, ce nombre a diminué jusqu'au
00:09:48round sept, où l'on a enfin obtenu un verdict approuvé. Et voici quelques éléments que Codex a
00:09:52effectivement signalés à Claude pendant la phase de planification, comme la contrainte de double réservation
00:09:57qui ne pouvait pas compiler, ou des soucis avec le flux de connexion OAuth. Il y avait aussi des problèmes de concurrence
00:10:03faisant que deux reprogrammations d'une même réservation pouvaient réussir en même temps, et ainsi de suite pour plein de cas
00:10:08particuliers. Ensuite, lors de la phase de construction, Claude a mis en œuvre le plan amélioré obtenu après les
00:10:12sept rounds. Puis une nouvelle session Codex a été lancée avec une mémoire complètement vierge, une nouvelle fenêtre
00:10:17de contexte, sans avoir lu le plan. Il a lu le code par rapport au cahier des charges réel, ce qui a été créé
00:10:23par rapport à ce qui était prévu. Il est donc revenu avec 23 remarques : 19 ont été acceptées et corrigées, 4 ont été
00:10:29rejetées. Voici quelques points trouvés par Codex durant cette phase : la grille horaire se décalait après
00:10:34chaque réunion, le jeton de gestion était en texte brut, tous les événements bloquaient les mauvaises heures.
00:10:39Et encore une fois, d'autres choses qui relèvent de cas limites, mais dont
00:10:44la découverte aurait pris beaucoup de temps à Claude. Si Codex n'avait pas été de la partie dès le début,
00:10:48qu'est-ce que ça aurait donné ? Eh bien, on aurait eu des fonctionnalités cassées, des réservations
00:10:53présentes dans la base de données et nulle part ailleurs, etc. En réalité, est-ce que cela aurait été le cas si
00:10:58on s'était fiés uniquement à Claude ? Probablement qu'au début, il aurait fallu quelques itérations supplémentaires pour
00:11:03arriver à un résultat fonctionnel. Mais avec Codex, on a détecté beaucoup de ces problèmes dès la phase
00:11:08de planification. On a donc évité de gaspiller des jetons, puis d'en regaspiller par la suite. On a pu
00:11:14tester ces aspects avec Codex, les examiner avec lui avant de passer en production. En somme,
00:11:21cela vous fait gagner beaucoup de temps et d'argent. Voilà donc la boucle Claudex en action. Si vous voulez mettre la main
00:11:26là-dessus, je mettrai un lien dans le commentaire épinglé. Sur ce, à bientôt.

핵심 요약

L'utilisation conjointe de deux modèles d'IA via Claudex Loop permet de détecter les erreurs de planification et de code dès l'amont pour économiser du temps et des jetons.

하이라이트

  • La compétence open source Claudex Loop utilise un deuxième modèle pour valider et corriger le plan de travail d'un premier modèle d'IA.

  • Le processus de révision du plan peut s'effectuer en un maximum de cinq tours, extensibles si nécessaire.

  • La création d'une alternative à l'application de prise de rendez-vous Calendee sert de démonstration pratique pour l'outil.

  • Vingt-sept problèmes initiaux ont été détectés et traités lors de la phase de planification du projet de démonstration.

  • Le second modèle analyse le code produit par rapport au cahier des charges initial afin de repérer les failles.

타임라인

Présentation de Claudex Loop

  • Les modèles d'IA ont tendance à juger leur propre travail de manière trop favorable.
  • La compétence se décompose en quatre phases distinctes : recherche, interrogation, révision et construction.
  • Le deuxième modèle examine le plan dans un environnement isolé et renvoie ses corrections.

L'outil résout le problème de l'auto-évaluation des IA en faisant intervenir un second modèle pour valider chaque étape. Cette approche limite les risques d'erreurs en imposant un regard critique externe sur le code et les plans générés.

Démonstration pratique avec Calendee

  • Une recherche approfondie est lancée pour recueillir les informations sur l'intégration Google Calendar et Meet.
  • Le dialogue entre Claude et Codex dure initialement cinq tours avant d'être prolongé de deux tours supplémentaires.
  • Vingt-sept problèmes sont identifiés au premier tour de la phase de révision.

La création d'une application web de prise de rendez-vous similaire à Calendee illustre le fonctionnement de l'outil. Les questions cruciales permettent d'ajuster la configuration technique avant la rédaction effective du code.

Résultats et analyse de la construction

  • L'application générée synchronise correctement les horaires avec le calendrier Gmail.
  • Le second modèle analyse le code produit et remonte dix-neuf corrections acceptées.
  • La vérification précoce évite les fonctionnalités cassées et les pertes de jetons inutiles.

L'évaluation finale du code par Codex met en évidence des anomalies complexes qui auraient nécessité de nombreuses itérations correctives sans cette double vérification. L'intégration de cette méthode automatise la détection des failles de conception.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기