Cette nouvelle compétence résout enfin le raisonnement des agents IA

AAI LABS
Computing/SoftwareInternet Technology

Transcript

00:00:00Claude Code, Codex et presque tous les autres agents que vous utilisez ont tous un problème majeur, et vous vous en rendez compte dès qu'ils doivent prendre une vraie décision.
00:00:08Ces modèles peuvent analyser un problème en profondeur, mais ils ne proposent jamais rien d'inédit.
00:00:12Et peu importe celui que vous utilisez, car tous échouent dès que vous avez besoin de créativité.
00:00:17Résultat : quand vous leur demandez des idées, ils vous sortent la réponse facile, et vous devez insister pour obtenir les angles qu'ils auraient dû trouver eux-mêmes.
00:00:24Tant que vous ne leur mâchez pas le travail, ils ne font preuve d'aucune créativité.
00:00:28Mais curieusement, la solution à ce problème s'inspire du TDAH, ce trouble où l'attention s'éparpille au lieu de rester fixée sur un seul sujet.
00:00:35Et il se trouve que le TDAH devient un super-pouvoir pour un agent IA, et c'est exactement ce qu'on leur apporte aujourd'hui.
00:00:41Il y a un outil très tendance en ce moment qui fait précisément cela.
00:00:44Et si c'est votre première fois ici, nous sommes une entreprise de logiciels et voici notre chaîne AI Labs, où nous vous montrons comment optimiser vos processus avec l'IA, tout comme nous l'avons fait pour les nôtres.
00:00:54Dans cette vidéo, nous allons donc voir en quoi donner le TDAH à votre agent peut réellement l'aider.
00:00:59Avant de découvrir cet outil, vous devez comprendre pourquoi il vous est indispensable.
00:01:03Si vous avez déjà utilisé Claude Code, Codex ou un autre agent, vous savez qu'ils sont très forts pour découper les grosses tâches en sous-éléments.
00:01:10Ils confient ces éléments à des sous-agents afin que chacun travaille dans sa propre fenêtre de contexte sans saturer la session principale.
00:01:16Vous n'avez même pas besoin de le leur demander.
00:01:18Ils créent des listes de tâches et les délèguent dès que possible pour tout exécuter en parallèle.
00:01:22Mais tout ce découpage ne s'applique qu'à l'exécution du travail.
00:01:26Rien de tout cela ne se produit lorsqu'il s'agit d'idéation, et si vous avez déjà essayé de chercher des idées sous différents angles avec eux, vous connaissez la frustration.
00:01:34Vous demandez des variations, et ce qui ressort semble différent au premier abord, mais ce ne sont que des reformulations de la même idée.
00:01:40L'idéation est donc la tâche la plus complexe à déléguer, car explorer des pistes véritablement distinctes n'est pas le fort des agents.
00:01:47En réalité, cela provient de la façon dont ces modèles sont entraînés.
00:01:50Un agent choisit le schéma le plus fréquent dans ses données d'entraînement, car voir la même réponse répétée lui a appris qu'il s'agissait d'une bonne réponse.
00:01:59Cela ne rend pas ses réponses fausses, et ce que vous obtenez est correct, mais il ignore d'autres angles du problème, ce qui gâche tout l'intérêt du brainstorming.
00:02:08Et ces schémas prévisibles ne sont que la moitié du problème, car il n'évalue jamais chaque idée indépendamment.
00:02:13Toutes les possibilités sont traitées dans la même fenêtre de contexte, si bien que les idées se mélangent et que le contexte se remplit de bruit.
00:02:20Le raisonnement se dégrade au lieu d'avancer, ce qui l'empêche d'évaluer clairement les pistes et le pousse à vous réécrire la même idée différemment.
00:02:28La compétence ADHD est sortie récemment et a accumulé énormément d'étoiles en quelques jours.
00:02:33Son nom est très approprié : comme pour le TDAH réel où les pensées s'éparpillent, elle disperse la réflexion au lieu de la suivre en ligne droite.
00:02:42Elle prend donc l'idéation, ou toute tâche offrant plusieurs directions, et la répartit entre plusieurs agents sous forme d'arbre de pensées.
00:02:49Un arbre de pensées est une structure où plusieurs branches de sous-agents travaillent isolément sur différentes idées, à l'image des branches d'un arbre.
00:02:58Puis, une fois que chaque branche a arrêté une possibilité, elle rassemble toutes ces idées et les fusionne dans la réponse finale.
00:03:06Elle lance donc plusieurs agents qui réfléchissent dans leur propre contexte, chacun recevant une formulation différente du problème.
00:03:12Ils sont isolés, ne partagent aucun contexte et aucun ne sait sur quoi les autres travaillent.
00:03:17Mais ici, cet isolement ne sert pas à diviser le travail, il sert à séparer chaque idée pour éviter qu'elles ne s'influencent.
00:03:24Cette séparation repose sur des “cadres”, qui sont en fait différents prismes pour aborder le problème.
00:03:29L'outil contient une bibliothèque de cadres intégrant toutes les directions possibles, et chaque agent choisit le cadre à travers lequel il va travailler.
00:03:37Il reçoit ainsi le prompt de ce cadre en plus du prompt système et du problème à résoudre.
00:03:41Un agent critique évalue ensuite les résultats, car il faut bien déterminer quelles idées méritent d'être conservées.
00:03:48Il note chaque idée selon trois critères.
00:03:50L'originalité, soit le degré de nouveauté et de créativité de l'idée.
00:03:54La faisabilité, c'est-à-dire la capacité à la concrétiser réellement.
00:03:57Et la pertinence, qui mesure son adéquation avec le problème de départ.
00:04:01Cette évaluation est confiée à un agent dédié, guidé par un prompt lui ordonnant d'agir comme un ingénieur senior sceptique.
00:04:07Son rôle unique est donc d'être très exigeant envers chaque proposition.
00:04:10En fonction de la note, il décide si une idée est retenue ou éliminée.
00:04:15À la fin, la compétence sélectionne les meilleures idées et étudie la liste des pièges, c'est-à-dire les problèmes potentiels liés à chaque option.
00:04:23Elle donne ensuite la priorité aux idées identifiées comme non évidentes.
00:04:26Avant de vous montrer des cas d'usage concret très intéressants, n'hésitez pas à vous abonner à la chaîne et à cliquer sur le bouton J'aime.
00:04:33Ce petit geste de soutien nous aide énormément.
00:04:36Voilà pour le fonctionnement interne.
00:04:38Passons maintenant à l'installation.
00:04:40Vous trouverez la commande sur le dépôt GitHub du projet.
00:04:43Copiez-la, ouvrez le terminal dans le projet de votre choix et exécutez-la.
00:04:47Elle demande quel agent IA vous utilisez, sachant qu'elle en prend en charge plus de 45.
00:04:53Sélectionnez simplement celui que vous utilisez au quotidien.
00:04:55Ensuite, choisissez si la compétence doit être limitée au projet actuel (Project Scope) ou accessible partout, quel que soit le projet.
00:05:03Si un seul projet est concerné, optez pour Project Scope.
00:05:06Une fois l'installation terminée, la compétence se trouve dans le dossier .agents.
00:05:10C'est le dossier utilisé par beaucoup d'agents comme Codex pour leur configuration, mais Claude Code ne reconnaît par défaut que le dossier .claude.
00:05:18Si vous utilisez Claude Code, renommez ce dossier en .claude pour qu'il soit détecté.
00:05:22En l'ouvrant, vous y trouverez la compétence.
00:05:25Il s'agit d'un simple fichier skill.md qui gère tout de manière autonome, sans fichier de référence ni dépendance externe.
00:05:31Les instructions poussent l'agent à aller au-delà de ses trois premières réponses.
00:05:36Le fichier précise que ces trois premières options sont les plus banales dans les données d'entraînement,
00:05:41et que n'importe quel agent senior les trouverait immédiatement.
00:05:44Les idées réellement pertinentes d'un agent senior n'apparaissent qu'après ce stade.
00:05:50Mais lancer autant d'agents consomme beaucoup de tokens,
00:05:52une étape de pré-vérification détermine donc s'il faut exécuter la compétence.
00:05:56Si vous la lancez avec la commande slash ou la demandez explicitement, elle s'exécute aussitôt.
00:06:01Si vous ne l'avez pas mentionnée dans votre prompt
00:06:04et que votre agent décide de l'appeler automatiquement,
00:06:07le problème est soumis aux trois questions de l'étape de pré-vérification.
00:06:11La première est de savoir si le problème est ouvert,
00:06:14c'est-à-dire si une personne expérimentée aurait plusieurs solutions valides
00:06:19ou une seule bonne réponse.
00:06:20S'il n'y a qu'une seule réponse correcte,
00:06:22analyser plusieurs angles est inutile et gaspille des tokens,
00:06:26le processus s'arrête donc là.
00:06:27La deuxième question évalue les enjeux realistes,
00:06:29pour savoir si une réponse évidente mais erronée aurait un coût important.
00:06:34La troisième concerne la formulation de votre demande.
00:06:36Si vous avez utilisé des mots comme « rapide » ou « standard »,
00:06:38vous cherchez une réponse directe,
00:06:40l'outil s'arrête donc sans activer la compétence.
00:06:43En dehors de cette étape,
00:06:44vous retrouvez toutes les phases de la boucle et la table des cadres transmise à chaque agent.
00:06:50Le fichier liste aussi les schémas que les agents doivent éviter.
00:06:54Avant de voir ses usages intéressants, un mot de notre sponsor.
00:06:59Top View.
00:06:59Si vous créez des vidéos par IA, vous connaissez le problème.
00:07:02Chaque modèle est sur une plateforme distincte et on génère les clips un par un.
00:07:05Top View règle cela.
00:07:06C'est la première compétence vidéo IA tout-en-un, intégrée directement dans votre agent de code.
00:07:11Claude Code, Cursor, Codex...
00:07:13Elle regroupe tous les meilleurs modèles au même endroit :
00:07:16VO, Kling, Sea Dance, Nano Banana et d'autres.
00:07:19Plus besoin de changer de site ni de cumuler les abonnements.
00:07:22Nous l'avons testée.
00:07:23Nous avons donné une seule instruction à notre agent :
00:07:25“Génère 10 variantes d'une pub TikTok de 15 secondes à partir de cette image produit.”
00:07:29Quelques secondes plus tard, 10 pubs prêtes à publier étaient prêtes.
00:07:32C'est une vraie révolution.
00:07:34Top View transforme votre agent en chaîne de production vidéo.
00:07:36Vous décrivez votre besoin une fois, et l'outil génère des dizaines de vidéos avec différents modèles, styles et formats en une seule session.
00:07:44Il choisit même le modèle adapté à la tâche.
00:07:47Vous passez d'une ligne de texte à des vidéos finales sans quitter votre agent.
00:07:51Essayez la compétence Top View via le lien en description.
00:07:54Voilà pour la configuration.
00:07:54Voyons maintenant où cet outil devient vraiment utile.
00:07:57Un excellent cas d'usage est le développement piloté par les tests (TDD), où l'agent écrit les tests en premier.
00:08:03Il développe ensuite l'application bloc par bloc jusqu'à ce que tous les tests réussissent.
00:08:07Écrire les tests avant le code est essentiel, comme nous l'avons expliqué précédemment,
00:08:12car lorsque vos exigences sont codées de façon stricte, tout changement qui casse l'application est détecté.
00:08:18L'agent est contraint de s'y conformer.
00:08:20Et la rédaction de tests est une tâche parfaite pour cette compétence, car c'est là que les agents manquent de rigueur.
00:08:26Ils ne couvrent pas tous les cas nécessaires parce qu'ils se reposent sur les réponses basiques et ne testent que celles-ci.
00:08:33Ils n'explorent pas les autres parcours utilisateurs dans l'application, qui doivent pourtant être vérifiés.
00:08:37Même avec un prompt détaillé sur la rédaction de tests ou un agent spécialisé dédié uniquement à cette tâche,
00:08:45ils retombent toujours dans les mêmes schémas.
00:08:47Avant de lancer le processus, l'agent doit savoir ce que vous construisez.
00:08:51Vous devez rédiger un PRD, le document définissant le rôle de l'application, le problème résolu, les objectifs visés et le public cible.
00:09:03Joignez-y un document de spécifications techniques qui fixe les choix d'outils pour éviter de devoir les répéter.
00:09:11Liez ces deux documents dans votre fichier Claude.md pour que l'agent intègre ce contexte dès le départ.
00:09:16Appelez la compétence avec sa commande slash, décrivez l'application et demandez de créer des cas de test selon l'approche TDD.
00:09:25En l'invoquant directement, elle ignore la pré-vérification et lance immédiatement cinq agents.
00:09:30Chacun explore sa propre piste grâce au cadre le plus adapté au problème, puis propose une approche de test différente.
00:09:38Elle évalue ensuite chaque proposition selon nos critères, retient les trois meilleures et les approfondit.
00:09:44Une fois le travail des agents terminé, vous obtenez un rapport détaillé des stratégies de test avec leurs notes.
00:09:50Les notes sont abrégées : N9 signifie 9 en nouveauté, V8 équivaut à 8 en faisabilité, et F10 correspond à un score parfait en pertinence.
00:10:00Chaque idée inclut une esquisse d'implémentation, les risques associés et les premières étapes pour démarrer.
00:10:07Les idées obtenues dépassent largement un jeu de tests classique.
00:10:11D'habitude, les tests d'un agent vérifient seulement si l'application fonctionne.
00:10:15Mais ceux proposés ici ciblent beaucoup plus de cas limites et détectent aussi les problèmes de performance.
00:10:21Vous obtenez ainsi une suite de tests bien plus solide, divisée en trois branches explorées en profondeur, chacune testant un parcours précis.
00:10:30Précisons toutefois une chose : la compétence planifie les tests, mais ne les rédige pas.
00:10:34Elle vous fournit la stratégie ; il vous suffit ensuite d'indiquer la direction choisie à l'agent pour qu'il la code.
00:10:40Vous pouvez choisir une seule voie ou lui demander de mettre en œuvre les trois.
00:10:44Si la performance est cruciale, les trois sont recommandées, mais cela prend du temps car l'agent doit traiter chaque axe successivement.
00:10:52Une fois l'opération terminée, les tests s'avèrent bien plus complets qu'à l'accoutumée,
00:10:57car toute la stratégie de test a été pensée en détail avant d'écrire la moindre ligne.
00:11:02C'est donc très efficace avant de coder, car cela balaye le terrain au préalable et évite de casser l'application plus tard.
00:11:09Mais cela ne concerne pas que la phase initiale.
00:11:11On peut aussi l'utiliser juste avant le déploiement.
00:11:14Vous lancez la compétence sur l'application prête à sortir pour évaluer l'expérience utilisateur.
00:11:18Elle signale alors ce qui pourrait désorienter les utilisateurs dans la navigation ou le produit,
00:11:23ainsi que les facteurs d'attrition, c'est-à-dire ce qui pousse les gens à abandonner votre produit après l'avoir essayé.
00:11:29Ce désengagement est fréquent une fois le site en ligne auprès de vrais utilisateurs, surtout s'il est payant.
00:11:34Ils apprécient le produit au début puis partent parce qu'une fonction ne marche pas comme prévu,
00:11:38et ils demandent à être remboursés.
00:11:40Souvent, il s'agit d'un détail négligé pendant le développement,
00:11:44qui a atteint la version en ligne et pose problème par la suite.
00:11:48Nous l'avons testée sur le site de notre communauté alors que nous lancions une nouvelle fonctionnalité.
00:11:53Nous avons déjà de nombreux membres, toute nouveauté doit donc être vérifiée méticuleusement,
00:11:57car nous ne voulons pas sortir un élément qui dégraderait l'expérience des membres actuels.
00:12:01Nous l'avons lancée avec la commande slash, lui avons soumis la fonctionnalité et lui avons demandé d'identifier
00:12:05les points de friction potentiels et les risques de désengagement.
00:12:09Elle a commencé par analyser l'application en profondeur pour assimiler le contexte,
00:12:12a déployé ses agents de la même manière et a fait émerger une trentaine d'idées.
00:12:17Parmi elles, elle a retenu les trois meilleures pistes pour les détailler.
00:12:20Ensuite, elle nous a fourni chaque constat noté selon l'originalité, la faisabilité et la pertinence.
00:12:25Elle a relevé des manques passés complètement inaperçus,
00:12:28comme des fonctions annoncées dans le PRD mais jamais développées.
00:12:32Nous aurions donc livré un produit non conforme à nos promesses,
00:12:35en plus de plusieurs autres observations.
00:12:37Pour chaque point, elle a proposé un correctif tout en listant les pièges et risques associés.
00:12:42Le principe reste le même que pour les tests.
00:12:44Elle ne corrige rien elle-même : vous transmettez les remarques voulues à l'agent,
00:12:48qui se charge alors de les appliquer.
00:12:50Cela vous permet de tout régler avant le lancement plutôt qu'après,
00:12:53ce qui garantit une application bien plus aboutie lors de sa mise en ligne.
00:12:57Toutes les compétences, workflows et ressources présentés dans nos vidéos
00:13:01sont accessibles dans AI Labs Pro, notre communauté.
00:13:04Si vous appréciez notre travail et souhaitez soutenir la chaîne,
00:13:07c'est le meilleur moyen de le faire.
00:13:09Le lien est dans la description.
00:13:10C'est la fin de cette vidéo.
00:13:12Pour soutenir la chaîne et nous aider à produire d'autres contenus de ce type,
00:13:16vous pouvez utiliser le bouton Super Thanks ci-dessous.
00:13:18Comme toujours, merci d'avoir regardé, et à très bientôt dans la prochaine vidéo !

Key Takeaway

La compétence ADHD résout le manque de créativité des agents IA en isolant plusieurs sous-agents dans un arbre de pensées guidé par des cadres d'analyse distincts et évalué par un filtre de pré-vérification à trois critères.

Highlights

  • Les agents IA d'idéation échouent en répétant les réponses les plus fréquentes de leurs données d'entraînement au lieu d'explorer des angles inédits.

  • La compétence ADHD divise le processus de réflexion en un arbre de pensées géré par plusieurs agents isolés dans des contextes distincts.

  • Un agent d'évaluation dédié, configuré comme un ingénieur senior sceptique, note chaque idée sur l'originalité, la faisabilité et la pertinence.

  • Un fichier unique nommé skill.md gère l'ensemble du système sans nécessiter de dépendances externes ni de fichiers de référence.

  • Une étape de pré-vérification basée sur trois critères filtre les requêtes simples afin d'éviter le gaspillage de tokens sur des problèmes fermés.

  • L'application de cette méthode au développement piloté par les tests (TDD) permet de couvrir des cas limites et des problèmes de performance souvent négligés.

  • L'analyse pré-déploiement identifie les facteurs d'attrition utilisateur et les fonctionnalités absentes prévues dans le document de spécifications du produit (PRD).

Timeline

Les limites de l'idéation chez les agents IA

  • Les agents IA actuels excellent dans la décomposition et le traitement parallèle des tâches d'exécution, mais échouent lors des phases d'idéation.
  • Le biais d'entraînement pousse les modèles à sélectionner systématiquement les motifs les plus fréquents et prévisibles.
  • Le traitement de toutes les options au sein d'une même fenêtre de contexte génère du bruit et dégrade la qualité du raisonnement.

Lors de la recherche d'idées, la plupart des agents reformulent la même proposition de base au lieu de proposer des alternatives réellement distinctes. Ce comportement découle directement des données d'entraînement, où les schémas récurrents sont assimilés à des réponses optimales. De plus, la saturation de la fenêtre de contexte par plusieurs pistes simultanées empêche une évaluation objective et indépendante de chaque possibilité.

Architecture et fonctionnement de la compétence ADHD

  • L'outil structure l'idéation sous la forme d'un arbre de pensées distribué entre plusieurs sous-agents autonomes.
  • Chaque agent opère dans un contexte isolé et applique un cadre d'analyse spécifique issu d'une bibliothèque intégrée.
  • Un agent critique dédié note chaque proposition sur l'originalité, la faisabilité et la pertinence.

Pour éviter les interférences mutuelles, la réflexion est fragmentée en plusieurs branches totalement isolées les unes des autres. Chaque sous-agent reçoit une formulation différente du problème assortie d'un cadre méthodologique particulier. Un agent évaluateur, paramétré pour adopter la posture d'un ingénieur senior sceptique, attribue des notes strictes afin d'éliminer les options banales et d'identifier les pièges potentiels.

Installation et structure du fichier de configuration

  • L'installation s'effectue via une commande de terminal compatible avec plus de 45 agents IA.
  • Le dossier d'installation .agents doit être renommé en .claude pour assurer la compatibilité avec Claude Code.
  • La logique complète repose sur un fichier unique skill.md dépourvu de dépendances externes.

L'installation permet de choisir entre une portée limitée au projet (Project Scope) ou une configuration globale. Pour Claude Code, l'ajustement du nom de dossier est nécessaire pour la détection automatique du composant. Le fichier skill.md contient l'ensemble des instructions requises et force explicitement l'agent à abandonner ses trois premières idées, jugées trop génériques.

Mécanisme de pré-vérification et gestion des tokens

  • L'exécution automatique de la compétence est soumise à un filtre préalable en trois questions.
  • Le processus s'interrompt immédiatement si le problème admet une réponse unique ou si l'utilisateur demande une solution rapide.
  • L'étape d'évaluation mesure la nature ouverte du problème, les enjeux réels et la formulation du prompt.

En raison de la consommation importante de tokens liée au lancement simultané de plusieurs sous-agents, une étape de pré-vérification valide l'utilité du processus. Si la requête contient des termes comme « rapide » ou « standard », ou s'il s'agit d'une question fermée sans risque majeur en cas d'erreur, le système désactive l'arbre de pensées pour préserver les ressources compute.

Application au développement piloté par les tests (TDD)

  • La compétence génère des stratégies de test exhaustives basées sur le document de spécifications du produit (PRD) et le fichier de configuration.
  • Les propositions de tests couvrent les cas limites et les problèmes de performance au-delà des vérifications fonctionnelles de base.
  • L'outil fournit le plan d'action structuré, laissant la rédaction finale du code de test à l'agent principal.

Dans un flux TDD, l'agent utilise le PRD et la documentation technique pour lancer cinq sous-agents exploreurs. Le rapport final synthétise les trois meilleures approches sous forme de notes abrégées (par exemple N9 pour la nouveauté, V8 pour la faisabilité, F10 pour la pertinence). Cette préparation structurée avant la phase de codage prévient les régressions et renforce la stabilité de l'application.

Détection des risques d'attrition et vérification pré-déploiement

  • L'exécution de la compétence avant la mise en ligne permet de repérer les points de friction dans l'expérience utilisateur.
  • L'analyse met en évidence les deltas entre les fonctionnalités promises dans le PRD et le code réellement implémenté.
  • Les corrections proposées s'accompagnent d'une liste de pièges potentiels à résoudre avant la publication.

Appliquée à une application prête pour la production, la compétence simule le comportement des utilisateurs pour identifier les facteurs d'abandon et de demande de remboursement. Lors d'un test sur une communauté en ligne, le système a fait émerger une trentaine d'observations et a révélé l'absence complète de fonctions pourtant prévues au cahier des charges. L'équipe peut ainsi appliquer les correctifs nécessaires avant l'impact sur les utilisateurs finaux.

Community Posts

View all posts