Cette nouvelle compétence résout enfin le raisonnement des agents IA
AAI LABS
Computing/SoftwareInternet Technology
Transcript
00:00:00Claude Code, Codex et presque tous les autres agents que vous utilisez ont tous un problème majeur, et vous vous en rendez compte dès qu'ils doivent prendre une vraie décision.
00:00:08Ces modèles peuvent analyser un problème en profondeur, mais ils ne proposent jamais rien d'inédit.
00:00:12Et peu importe celui que vous utilisez, car tous échouent dès que vous avez besoin de créativité.
00:00:17Résultat : quand vous leur demandez des idées, ils vous sortent la réponse facile, et vous devez insister pour obtenir les angles qu'ils auraient dû trouver eux-mêmes.
00:00:24Tant que vous ne leur mâchez pas le travail, ils ne font preuve d'aucune créativité.
00:00:28Mais curieusement, la solution à ce problème s'inspire du TDAH, ce trouble où l'attention s'éparpille au lieu de rester fixée sur un seul sujet.
00:00:35Et il se trouve que le TDAH devient un super-pouvoir pour un agent IA, et c'est exactement ce qu'on leur apporte aujourd'hui.
00:00:41Il y a un outil très tendance en ce moment qui fait précisément cela.
00:00:44Et si c'est votre première fois ici, nous sommes une entreprise de logiciels et voici notre chaîne AI Labs, où nous vous montrons comment optimiser vos processus avec l'IA, tout comme nous l'avons fait pour les nôtres.
00:00:54Dans cette vidéo, nous allons donc voir en quoi donner le TDAH à votre agent peut réellement l'aider.
00:00:59Avant de découvrir cet outil, vous devez comprendre pourquoi il vous est indispensable.
00:01:03Si vous avez déjà utilisé Claude Code, Codex ou un autre agent, vous savez qu'ils sont très forts pour découper les grosses tâches en sous-éléments.
00:01:10Ils confient ces éléments à des sous-agents afin que chacun travaille dans sa propre fenêtre de contexte sans saturer la session principale.
00:01:16Vous n'avez même pas besoin de le leur demander.
00:01:18Ils créent des listes de tâches et les délèguent dès que possible pour tout exécuter en parallèle.
00:01:22Mais tout ce découpage ne s'applique qu'à l'exécution du travail.
00:01:26Rien de tout cela ne se produit lorsqu'il s'agit d'idéation, et si vous avez déjà essayé de chercher des idées sous différents angles avec eux, vous connaissez la frustration.
00:01:34Vous demandez des variations, et ce qui ressort semble différent au premier abord, mais ce ne sont que des reformulations de la même idée.
00:01:40L'idéation est donc la tâche la plus complexe à déléguer, car explorer des pistes véritablement distinctes n'est pas le fort des agents.
00:01:47En réalité, cela provient de la façon dont ces modèles sont entraînés.
00:01:50Un agent choisit le schéma le plus fréquent dans ses données d'entraînement, car voir la même réponse répétée lui a appris qu'il s'agissait d'une bonne réponse.
00:01:59Cela ne rend pas ses réponses fausses, et ce que vous obtenez est correct, mais il ignore d'autres angles du problème, ce qui gâche tout l'intérêt du brainstorming.
00:02:08Et ces schémas prévisibles ne sont que la moitié du problème, car il n'évalue jamais chaque idée indépendamment.
00:02:13Toutes les possibilités sont traitées dans la même fenêtre de contexte, si bien que les idées se mélangent et que le contexte se remplit de bruit.
00:02:20Le raisonnement se dégrade au lieu d'avancer, ce qui l'empêche d'évaluer clairement les pistes et le pousse à vous réécrire la même idée différemment.
00:02:28La compétence ADHD est sortie récemment et a accumulé énormément d'étoiles en quelques jours.
00:02:33Son nom est très approprié : comme pour le TDAH réel où les pensées s'éparpillent, elle disperse la réflexion au lieu de la suivre en ligne droite.
00:02:42Elle prend donc l'idéation, ou toute tâche offrant plusieurs directions, et la répartit entre plusieurs agents sous forme d'arbre de pensées.
00:02:49Un arbre de pensées est une structure où plusieurs branches de sous-agents travaillent isolément sur différentes idées, à l'image des branches d'un arbre.
00:02:58Puis, une fois que chaque branche a arrêté une possibilité, elle rassemble toutes ces idées et les fusionne dans la réponse finale.
00:03:06Elle lance donc plusieurs agents qui réfléchissent dans leur propre contexte, chacun recevant une formulation différente du problème.
00:03:12Ils sont isolés, ne partagent aucun contexte et aucun ne sait sur quoi les autres travaillent.
00:03:17Mais ici, cet isolement ne sert pas à diviser le travail, il sert à séparer chaque idée pour éviter qu'elles ne s'influencent.
00:03:24Cette séparation repose sur des “cadres”, qui sont en fait différents prismes pour aborder le problème.
00:03:29L'outil contient une bibliothèque de cadres intégrant toutes les directions possibles, et chaque agent choisit le cadre à travers lequel il va travailler.
00:03:37Il reçoit ainsi le prompt de ce cadre en plus du prompt système et du problème à résoudre.
00:03:41Un agent critique évalue ensuite les résultats, car il faut bien déterminer quelles idées méritent d'être conservées.
00:03:48Il note chaque idée selon trois critères.
00:03:50L'originalité, soit le degré de nouveauté et de créativité de l'idée.
00:03:54La faisabilité, c'est-à-dire la capacité à la concrétiser réellement.
00:03:57Et la pertinence, qui mesure son adéquation avec le problème de départ.
00:04:01Cette évaluation est confiée à un agent dédié, guidé par un prompt lui ordonnant d'agir comme un ingénieur senior sceptique.
00:04:07Son rôle unique est donc d'être très exigeant envers chaque proposition.
00:04:10En fonction de la note, il décide si une idée est retenue ou éliminée.
00:04:15À la fin, la compétence sélectionne les meilleures idées et étudie la liste des pièges, c'est-à-dire les problèmes potentiels liés à chaque option.
00:04:23Elle donne ensuite la priorité aux idées identifiées comme non évidentes.
00:04:26Avant de vous montrer des cas d'usage concret très intéressants, n'hésitez pas à vous abonner à la chaîne et à cliquer sur le bouton J'aime.
00:04:33Ce petit geste de soutien nous aide énormément.
00:04:36Voilà pour le fonctionnement interne.
00:04:38Passons maintenant à l'installation.
00:04:40Vous trouverez la commande sur le dépôt GitHub du projet.
00:04:43Copiez-la, ouvrez le terminal dans le projet de votre choix et exécutez-la.
00:04:47Elle demande quel agent IA vous utilisez, sachant qu'elle en prend en charge plus de 45.
00:04:53Sélectionnez simplement celui que vous utilisez au quotidien.
00:04:55Ensuite, choisissez si la compétence doit être limitée au projet actuel (Project Scope) ou accessible partout, quel que soit le projet.
00:05:03Si un seul projet est concerné, optez pour Project Scope.
00:05:06Une fois l'installation terminée, la compétence se trouve dans le dossier .agents.
00:05:10C'est le dossier utilisé par beaucoup d'agents comme Codex pour leur configuration, mais Claude Code ne reconnaît par défaut que le dossier .claude.
00:05:18Si vous utilisez Claude Code, renommez ce dossier en .claude pour qu'il soit détecté.
00:05:22En l'ouvrant, vous y trouverez la compétence.
00:05:25Il s'agit d'un simple fichier skill.md qui gère tout de manière autonome, sans fichier de référence ni dépendance externe.
00:05:31Les instructions poussent l'agent à aller au-delà de ses trois premières réponses.
00:05:36Le fichier précise que ces trois premières options sont les plus banales dans les données d'entraînement,
00:05:41et que n'importe quel agent senior les trouverait immédiatement.
00:05:44Les idées réellement pertinentes d'un agent senior n'apparaissent qu'après ce stade.
00:05:50Mais lancer autant d'agents consomme beaucoup de tokens,
00:05:52une étape de pré-vérification détermine donc s'il faut exécuter la compétence.
00:05:56Si vous la lancez avec la commande slash ou la demandez explicitement, elle s'exécute aussitôt.
00:06:01Si vous ne l'avez pas mentionnée dans votre prompt
00:06:04et que votre agent décide de l'appeler automatiquement,
00:06:07le problème est soumis aux trois questions de l'étape de pré-vérification.
00:06:11La première est de savoir si le problème est ouvert,
00:06:14c'est-à-dire si une personne expérimentée aurait plusieurs solutions valides
00:06:19ou une seule bonne réponse.
00:06:20S'il n'y a qu'une seule réponse correcte,
00:06:22analyser plusieurs angles est inutile et gaspille des tokens,
00:06:26le processus s'arrête donc là.
00:06:27La deuxième question évalue les enjeux realistes,
00:06:29pour savoir si une réponse évidente mais erronée aurait un coût important.
00:06:34La troisième concerne la formulation de votre demande.
00:06:36Si vous avez utilisé des mots comme « rapide » ou « standard »,
00:06:38vous cherchez une réponse directe,
00:06:40l'outil s'arrête donc sans activer la compétence.
00:06:43En dehors de cette étape,
00:06:44vous retrouvez toutes les phases de la boucle et la table des cadres transmise à chaque agent.
00:06:50Le fichier liste aussi les schémas que les agents doivent éviter.
00:06:54Avant de voir ses usages intéressants, un mot de notre sponsor.
00:06:59Top View.
00:06:59Si vous créez des vidéos par IA, vous connaissez le problème.
00:07:02Chaque modèle est sur une plateforme distincte et on génère les clips un par un.
00:07:05Top View règle cela.
00:07:06C'est la première compétence vidéo IA tout-en-un, intégrée directement dans votre agent de code.
00:07:11Claude Code, Cursor, Codex...
00:07:13Elle regroupe tous les meilleurs modèles au même endroit :
00:07:16VO, Kling, Sea Dance, Nano Banana et d'autres.
00:07:19Plus besoin de changer de site ni de cumuler les abonnements.
00:07:22Nous l'avons testée.
00:07:23Nous avons donné une seule instruction à notre agent :
00:07:25“Génère 10 variantes d'une pub TikTok de 15 secondes à partir de cette image produit.”
00:07:29Quelques secondes plus tard, 10 pubs prêtes à publier étaient prêtes.
00:07:32C'est une vraie révolution.
00:07:34Top View transforme votre agent en chaîne de production vidéo.
00:07:36Vous décrivez votre besoin une fois, et l'outil génère des dizaines de vidéos avec différents modèles, styles et formats en une seule session.
00:07:44Il choisit même le modèle adapté à la tâche.
00:07:47Vous passez d'une ligne de texte à des vidéos finales sans quitter votre agent.
00:07:51Essayez la compétence Top View via le lien en description.
00:07:54Voilà pour la configuration.
00:07:54Voyons maintenant où cet outil devient vraiment utile.
00:07:57Un excellent cas d'usage est le développement piloté par les tests (TDD), où l'agent écrit les tests en premier.
00:08:03Il développe ensuite l'application bloc par bloc jusqu'à ce que tous les tests réussissent.
00:08:07Écrire les tests avant le code est essentiel, comme nous l'avons expliqué précédemment,
00:08:12car lorsque vos exigences sont codées de façon stricte, tout changement qui casse l'application est détecté.
00:08:18L'agent est contraint de s'y conformer.
00:08:20Et la rédaction de tests est une tâche parfaite pour cette compétence, car c'est là que les agents manquent de rigueur.
00:08:26Ils ne couvrent pas tous les cas nécessaires parce qu'ils se reposent sur les réponses basiques et ne testent que celles-ci.
00:08:33Ils n'explorent pas les autres parcours utilisateurs dans l'application, qui doivent pourtant être vérifiés.
00:08:37Même avec un prompt détaillé sur la rédaction de tests ou un agent spécialisé dédié uniquement à cette tâche,
00:08:45ils retombent toujours dans les mêmes schémas.
00:08:47Avant de lancer le processus, l'agent doit savoir ce que vous construisez.
00:08:51Vous devez rédiger un PRD, le document définissant le rôle de l'application, le problème résolu, les objectifs visés et le public cible.
00:09:03Joignez-y un document de spécifications techniques qui fixe les choix d'outils pour éviter de devoir les répéter.
00:09:11Liez ces deux documents dans votre fichier Claude.md pour que l'agent intègre ce contexte dès le départ.
00:09:16Appelez la compétence avec sa commande slash, décrivez l'application et demandez de créer des cas de test selon l'approche TDD.
00:09:25En l'invoquant directement, elle ignore la pré-vérification et lance immédiatement cinq agents.
00:09:30Chacun explore sa propre piste grâce au cadre le plus adapté au problème, puis propose une approche de test différente.
00:09:38Elle évalue ensuite chaque proposition selon nos critères, retient les trois meilleures et les approfondit.
00:09:44Une fois le travail des agents terminé, vous obtenez un rapport détaillé des stratégies de test avec leurs notes.
00:09:50Les notes sont abrégées : N9 signifie 9 en nouveauté, V8 équivaut à 8 en faisabilité, et F10 correspond à un score parfait en pertinence.
00:10:00Chaque idée inclut une esquisse d'implémentation, les risques associés et les premières étapes pour démarrer.
00:10:07Les idées obtenues dépassent largement un jeu de tests classique.
00:10:11D'habitude, les tests d'un agent vérifient seulement si l'application fonctionne.
00:10:15Mais ceux proposés ici ciblent beaucoup plus de cas limites et détectent aussi les problèmes de performance.
00:10:21Vous obtenez ainsi une suite de tests bien plus solide, divisée en trois branches explorées en profondeur, chacune testant un parcours précis.
00:10:30Précisons toutefois une chose : la compétence planifie les tests, mais ne les rédige pas.
00:10:34Elle vous fournit la stratégie ; il vous suffit ensuite d'indiquer la direction choisie à l'agent pour qu'il la code.
00:10:40Vous pouvez choisir une seule voie ou lui demander de mettre en œuvre les trois.
00:10:44Si la performance est cruciale, les trois sont recommandées, mais cela prend du temps car l'agent doit traiter chaque axe successivement.
00:10:52Une fois l'opération terminée, les tests s'avèrent bien plus complets qu'à l'accoutumée,
00:10:57car toute la stratégie de test a été pensée en détail avant d'écrire la moindre ligne.
00:11:02C'est donc très efficace avant de coder, car cela balaye le terrain au préalable et évite de casser l'application plus tard.
00:11:09Mais cela ne concerne pas que la phase initiale.
00:11:11On peut aussi l'utiliser juste avant le déploiement.
00:11:14Vous lancez la compétence sur l'application prête à sortir pour évaluer l'expérience utilisateur.
00:11:18Elle signale alors ce qui pourrait désorienter les utilisateurs dans la navigation ou le produit,
00:11:23ainsi que les facteurs d'attrition, c'est-à-dire ce qui pousse les gens à abandonner votre produit après l'avoir essayé.
00:11:29Ce désengagement est fréquent une fois le site en ligne auprès de vrais utilisateurs, surtout s'il est payant.
00:11:34Ils apprécient le produit au début puis partent parce qu'une fonction ne marche pas comme prévu,
00:11:38et ils demandent à être remboursés.
00:11:40Souvent, il s'agit d'un détail négligé pendant le développement,
00:11:44qui a atteint la version en ligne et pose problème par la suite.
00:11:48Nous l'avons testée sur le site de notre communauté alors que nous lancions une nouvelle fonctionnalité.
00:11:53Nous avons déjà de nombreux membres, toute nouveauté doit donc être vérifiée méticuleusement,
00:11:57car nous ne voulons pas sortir un élément qui dégraderait l'expérience des membres actuels.
00:12:01Nous l'avons lancée avec la commande slash, lui avons soumis la fonctionnalité et lui avons demandé d'identifier
00:12:05les points de friction potentiels et les risques de désengagement.
00:12:09Elle a commencé par analyser l'application en profondeur pour assimiler le contexte,
00:12:12a déployé ses agents de la même manière et a fait émerger une trentaine d'idées.
00:12:17Parmi elles, elle a retenu les trois meilleures pistes pour les détailler.
00:12:20Ensuite, elle nous a fourni chaque constat noté selon l'originalité, la faisabilité et la pertinence.
00:12:25Elle a relevé des manques passés complètement inaperçus,
00:12:28comme des fonctions annoncées dans le PRD mais jamais développées.
00:12:32Nous aurions donc livré un produit non conforme à nos promesses,
00:12:35en plus de plusieurs autres observations.
00:12:37Pour chaque point, elle a proposé un correctif tout en listant les pièges et risques associés.
00:12:42Le principe reste le même que pour les tests.
00:12:44Elle ne corrige rien elle-même : vous transmettez les remarques voulues à l'agent,
00:12:48qui se charge alors de les appliquer.
00:12:50Cela vous permet de tout régler avant le lancement plutôt qu'après,
00:12:53ce qui garantit une application bien plus aboutie lors de sa mise en ligne.
00:12:57Toutes les compétences, workflows et ressources présentés dans nos vidéos
00:13:01sont accessibles dans AI Labs Pro, notre communauté.
00:13:04Si vous appréciez notre travail et souhaitez soutenir la chaîne,
00:13:07c'est le meilleur moyen de le faire.
00:13:09Le lien est dans la description.
00:13:10C'est la fin de cette vidéo.
00:13:12Pour soutenir la chaîne et nous aider à produire d'autres contenus de ce type,
00:13:16vous pouvez utiliser le bouton Super Thanks ci-dessous.
00:13:18Comme toujours, merci d'avoir regardé, et à très bientôt dans la prochaine vidéo !