Vos agents manquent de contexte : voici comment corriger "Vous avez tout à fait raison !" — Brandon Waselnuk, Unblocked

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Bonjour à tous. J'espère que vous passez une excellente journée ici à l'AIE. Le temps est magnifique,
00:00:17même si l'indice UV est d'environ neuf, alors j'espère que vous avez mis de la crème solaire
00:00:20et que vous vous comportez en adultes responsables. Je suis là pour vous parler d'ingénierie
00:00:24du contexte et j'ai la chance de passer après AJ de LinkedIn, car il
00:00:27a beaucoup parlé du système que nous concevons et vendons réellement à d'autres
00:00:29solutions. Je vais vous présenter un tas d'outils open source, donc si vous avez suivi
00:00:33cette dernière présentation juste avant moi, vous repartirez avec toute une série d'outils que vous pourrez
00:00:36essayer vous-même, et je vais vous enseigner plusieurs techniques aujourd'hui. L'objectif,
00:00:39bien sûr, est de corriger... vous avez tout à fait raison. Je pense qu'ils ont retiré cela
00:00:44des prompts maintenant pour afficher simplement "vous avez raison" ou d'autres choses, mais je suis sûr que vous
00:00:47êtes tous passés par là. Je m'appelle Brandon, je travaille chez Unblocked, oui, j'ai une noix de coco, nous en avons
00:00:53distribué pour du contexte frais, des noix de coco bien fraîches, mais ce dont je veux
00:00:57vous parler, c'est qu'avec ces modèles, en particulier avec les modèles Claude,
00:01:01je crois que Claude 5 revient aujourd'hui, alors ils disent que vous pouvez regarder mon enregistrement d'appel,
00:01:05essayer de réserver ceci, nous allons ignorer cela. Mais ce que je veux que vous fassiez, c'est de penser
00:01:11au fait qu'avec ces outils, le code généré par IA doit donner l'impression d'avoir été
00:01:15écrit par quelqu'un qui fait partie de votre équipe depuis des années. Pour vous mettre dans le bon état d'esprit
00:01:23de ces années, vous devez considérer que c'est vous qui avez été le moteur de contexte. Comment faisiez-vous ?
00:01:27Vous construisiez du contexte en allant au travail, en posant des questions, en soumettant des PR et
00:01:34en vous les faisant rejeter, en allant en réunions, et tout cela a lentement forgé avec le temps
00:01:39le moteur qu'est votre cerveau. Vous comprenez comment les choses fonctionnent ici, vous savez comment le code est déployé,
00:01:42vous étiez d'astreinte cette nuit-là où vous avez fait planté la production et vous savez pourquoi c'est arrivé. Le
00:01:48problème, c'est que ces agents rencontrent exactement ce même problème : à chaque fois que vous créez
00:01:53une nouvelle session de terminal avec un agent dedans, il est très intelligent mais ne possède
00:01:57aucun contexte sur la façon dont votre entreprise fonctionne, il doit donc l'obtenir d'une manière ou d'une autre. Le
00:02:02problème, c'est qu'à mesure que vous faites monter en puissance ces agents, ce coût se multiplie si vous vous trompez
00:02:07au départ. L'effet de levier du contexte et du contenu. Nous allons juste régler ça
00:02:13parce que je crois que des gens veulent prendre des photos. Parfait. Ce problème de contexte va
00:02:20s'amplifier. Donc à l'extrême gauche, nous nous souvenons tous de cette époque lointaine d'il y a
00:02:25deux ans où nous avions des modèles de saisie semi-automatique qui étaient plutôt cool. Ce qui se passait,
00:02:29c'est qu'une suggestion apparaissait en disant "hé, voulez-vous valider ceci ?" et rapidement dans votre tête, avec votre
00:02:32contexte, vous vous disiez "non, c'est nul". Ou alors vous pensiez "oh, génial" et vous validiez. Super. À mesure que
00:02:37nous avançons sur la courbe d'adoption de l'IA, vous vous retrouvez dans
00:02:41davantage de situations où vous avez des agents qui fonctionnent sans humain dans la boucle, ou du moins
00:02:46où vous aimeriez ne pas avoir à y être. Ce dont ils ont besoin, c'est d'un moyen de pouvoir
00:02:50poser les questions nécessaires lorsqu'ils rencontrent des obstacles afin d'écrire du code, de résoudre
00:02:54ou fondamentalement de corriger le problème, et finalement de produire du code qui peut être fusionné
00:02:58dans votre base de code, en particulier avec beaucoup de personnes ici qui travaillent sur des bases de code
00:03:02existantes (brownfield) qui existent depuis longtemps et génèrent de vrais revenus
00:03:06et pas seulement de nouveaux projets (greenfield). Ainsi, ce coût d'un mauvais contexte qui s'accumule
00:03:12au début est faible si l'on pense en amont (shift left), détecter un défaut ou un bogue le plus tôt possible,
00:03:17c'est ce que l'on recherche. C'est la même chose pour le contexte, car à mesure que vous progressez,
00:03:22vous entrez dans des boucles infernales où vous demandez généralement à votre agent de faire quelque chose, il vous répond
00:03:26"hé, j'ai fini" et vous dites "non, mec", puis vous corrigez encore et encore.
00:03:29Ce sont des jetons de recherche gaspillés, c'est aussi du temps de retravail perdu, ce qui n'est
00:03:34pas acceptable avec la tokenomie qui nous attend, et ensuite lorsque vous passez à des agents
00:03:39parallèles, etc., vous commencez à subir une taxe de relecture. Ces réviseurs de code par IA que nous essayons
00:03:43d'utiliser ont également besoin d'un contexte clé pour que ces revues de code puissent
00:03:48essentiellement comprendre le fonctionnement de l'entreprise afin de saisir la logique métier et plus encore.
00:03:52Enfin, si vous espérez vous affranchir totalement de la boucle en disant "agents en arrière-plan, faites le travail sans faire d'erreurs",
00:03:57vous devez vraiment vous assurer de disposer d'un moteur de contexte pour que ces agents puissent le consulter
00:04:02et obtenir toutes les réponses nécessaires pour continuer à fonctionner de manière
00:04:05efficace.
00:04:08Il existe des approches courantes qui ne fonctionnent pas, qui s'apparentent pour l'essentiel à des maximums locaux. Deux d'entre elles,
00:04:16que nous voyons le plus souvent auprès de nos centaines de clients entreprises et de tailles intermédiaires, sont le
00:04:21piège du contexte sélectionné. Si vous vous êtes déjà assis pour configurer un système de fichiers virtuel ou peut-être un système
00:04:26de fichiers local, en y plaçant des fichiers Markdown en vous disant "voici tout le contexte de ce projet, voici comment il fonctionne",
00:04:30vous permettez ensuite à votre agent d'y effectuer des recherches (grep) pour obtenir de bonnes données et améliorer ses performances.
00:04:35Le problème, c'est d'abord qu'il faut diffuser tout cela, peut-être le publier sur GitHub pour que votre équipe puisse le récupérer. Ensuite, ce dépôt va devenir obsolète, exactement comme toute la documentation que vous avez rédigée. Et puis, qui dans votre organisation est l'être omnipotent qui a le bon goût de tenir à jour ce fichier ou ce dépôt pour littéralement tout le monde dans l'entreprise ?
00:04:52On se heurte donc à ces difficultés. Le point suivant est le plateau du protocole MCP. C'est assez clair : nous avons des serveurs MCP, ils sont formidables, vous pouvez les fournir à votre agent pour qu'il récupère des informations depuis un autre système source. Le problème, bien sûr, c'est qu'en fonction de la manière dont vous rédigez la description du serveur et des outils, votre agent ne l'appellera peut-être jamais alors qu'il aurait dû le faire, ou s'il le fait, il existe un biais bien connu appelé le biais de satisfaction de la recherche. Cela signifie que lorsque l'agent trouve
00:05:22la première information qu'il estime correcte, il se dit "j'ai ce dont j'ai besoin" et il continue. Or, dans la plupart des organisations, il y a eu une conversation sur Slack la nuit dernière qui disait qu'il fallait faire A au lieu de B, et l'agent ne le saura jamais s'il est tombé sur un document d'architecture en premier. Il ne prend donc pas réellement en compte l'ensemble du contexte.
00:05:40Le problème ici, c'est que l'accès à l'information ne vaut pas compréhension. Pour apporter de la compréhension à un modèle, il faut recourir à d'autres techniques. Ce que je veux dire par là, c'est que ce que votre agent ne peut pas voir, c'est tout ce qui se trouve sous la surface. Il peut tout à fait obtenir du code qui compile, mais ce code qui compile va faire planter la production, et vous vous retrouverez avec un incident critique à une heure du matin parce qu'il a ignoré le fait que selon votre procédure de déploiement, vous êtes censé désactiver un indicateur de fonctionnalité (feature flag), ou peu importe.
00:06:10Votre équipe a donc besoin d'un moteur de contexte, car son rôle est de comprendre qui vous êtes et où vous travaillez dans l'organisation. Ainsi, si je lui dis que je veux configurer l'authentification, il sait où je travaille, il connaît mes commits Git, il sait qui les relit et il comprend mon contexte, ce qui lui permet de cibler mes besoins et d'utiliser cela comme point de départ pour trouver le reste des informations.
00:06:33Il résout les conflits : comme mentionné, entre un vieux diagramme d'architecture et la conversation sur Slack avec le CTO de la veille au soir, lequel a raison ? Il faut utiliser un ensemble de techniques pour le déterminer.
00:06:44Il respecte les permissions et la gouvernance, bien sûr. Le protocole MCP nous permet d'utiliser OAuth et d'autres portées ainsi que le SSO, mais si quelqu'un pose une question ici alors qu'il n'est pas censé connaître le projet secret A, vous devez veiller à ce que cela ne fuite pas dans la réponse.
00:06:58Et enfin, il fournit le bon contexte au bon moment au modèle d'une manière optimisée en jetons.
00:07:03Nous disposons de plusieurs surfaces d'interaction, car les ingénieurs humains continuent de parler constamment à Unblocked pour obtenir les informations dont ils ont besoin sur Slack ou ailleurs.
00:07:09Mais vous voulez aussi des réponses optimisées en jetons si vous communiquez de machine à machine, afin de ne pas gaspiller une tonne de classes de texte sur votre budget en jetons.
00:07:17Voici comment fonctionne un moteur. Je vais passer rapidement là-dessus, mais pour l'essentiel, sur la gauche, vous voyez toutes les sources de données qui arrivent.
00:07:26En ce qui nous concerne, nous nous concentrons sur les équipes d'ingénierie, et c'est notre public, ainsi que sur les équipes techniquement proches qui les entourent, comme le support, les ventes et autres.
00:07:34Vous ingérez toutes ces données, vous obtenez des données en temps réel provenant d'outils tels que votre chaîne d'outils de gestion des incidents.
00:07:39Elles arrivent dans le moteur, là où le moteur réfléchit au niveau inférieur, je vais développer cette diapositive dans un instant.
00:07:45Mais en gros, il s'appuie sur ces six caractéristiques clés, et sur la droite, vous restituez le contexte pour le flux de travail exact et de la manière requise.
00:07:53Ces six points clés, comme mentionné : le contexte système unifié, il faut ratisser l'ensemble.
00:08:01Dans les grandes organisations, des entreprises de la taille de LinkedIn, Workday, General Motors ou autres, ce type de données est indispensable.
00:08:08Elles ont besoin de comprendre tout ce qui se passe.
00:08:10Et ce matin, Tharik a parlé de la possible sortie de Fable plus tard dans la journée.
00:08:15Il a mentionné qu'il faut en fait fournir une carte, puis laisser Fable explorer le territoire.
00:08:21Pour aider à circonscrire cela, il faut s'assurer que ces modèles ont accès à l'ensemble du contexte, car ils découvriront vos angles morts.
00:08:29Il se passe assurément des choses dans votre entreprise dont vous n'avez pas conscience, mais qui s'avéreraient très utiles pour la tâche que vous essayez d'accomplir.
00:08:35Cela permettra d'avancer plus vite.
00:08:37Mais pour la recherche ciblée, vous devriez pouvoir, si vous fournissez un lien rapidement, le déployer, récupérer ce document et continuer.
00:08:43Donc deux tâches : recherche approfondie, aller loin, très bien.
00:08:46Mais vous avez aussi besoin de rapidité lorsque la rapidité est requise.
00:08:49Résolution des conflits, nous en avons déjà parlé.
00:08:51Un élément dit de faire A, un autre dit de faire B, qui a raison ?
00:08:55Pertinence personnalisée : qui suis-je, où est-ce que je travaille, sur quoi est-ce que je travaille.
00:08:59Optimisation des jetons : s'assurer que la réponse est bonne, efficace et n'encombre pas la fenêtre.
00:09:04Et enfin application des permissions, bien sûr, OAuth, tu ne devrais pas voir ça, tu ne devrais pas voir ça.
00:09:10Ce que nous avons fait avec certains tests, c'est exécuter exactement le même prompt sur le même modèle, une fois avec contexte et une fois sans.
00:09:17Voici le gain de temps horloge, et environ deux heures, ce qui est formidable.
00:09:21Et ensuite, l'économie de jetons.
00:09:23C'était donc une tâche importante.
00:09:25Cela a pris environ 21 millions de jetons sans et puis 18, ou désolé, 10,8 millions de jetons avec.
00:09:31C'est le genre d'expérience que l'on observe généralement lors de l'utilisation d'un moteur de contexte, car la majorité de ces jetons de recherche gaspillés, où le système doit effectuer des recherches au début de chaque session pour comprendre et découvrir des choses, n'existent plus lorsqu'il est alimenté en contexte.
00:09:45Alimenté.
00:09:47Et ensuite, à mesure que vous avancez, vous obtenez ce type de résultats.
00:09:5050 % de jetons en moins, un tri plus rapide, et la qualité des réponses est en fait meilleure parce qu'il savait ce qui se passait au sein de l'entreprise.
00:09:57Maintenant, pour cette prochaine partie, vous voudrez probablement prendre une photo.
00:10:01Si vous ne le savez pas, vous pouvez prendre en photo un code QR, puis plus tard dans vos photos, appuyer dessus pour charger le lien afin de ne pas rester bloqué ici, car je vais vous donner trois codes QR.
00:10:09Ce premier est pour le réseau de commentaires sociaux.
00:10:12Je vais l'afficher pour que vous puissiez prendre une photo.
00:10:14Mais c'est un outil open source que nous avons conçu qui, en utilisant exclusivement de la programmation déterministe, analyse votre GitHub et comprend qui travaille dans votre équipe.
00:10:22Voici ma vraie équipe.
00:10:23Nous appelons Rasheen "la machine" car il publie du code à un rythme fou.
00:10:26Mais à droite, vous voyez ce qu'il commit, où il commit, qui relit son travail.
00:10:30Et dans ces onglets, vous trouverez un graphe d'experts distillé.
00:10:33Vous obtenez une vision complète de ce qui se passe dans votre entreprise.
00:10:35Et si vous ajoutez en option l'une des clés API d'OpenAI ou d'Anthropic, cela déterminera vos équipes en effectuant un étiquetage pour vous.
00:10:44C'est un outil vraiment génial pour comprendre où travaille votre équipe et intégrer ce réseau social afin de cibler un moteur de contexte si vous construisez ces outils vous-même.
00:10:52Le suivant s'appelle l'agent de règles de dépôt.
00:10:55C'est un exemple tiré de notre véritable base de code.
00:10:57Je vais l'afficher de toute façon, donc pas besoin d'en parler.
00:11:00Mais en gros, ce qu'il fait, c'est découvrir tous les endroits où votre équipe a écrit des fichiers de règles, les vérifie tous, puis vous indique les niveaux de gravité et les autres éléments attribués.
00:11:11Est-ce que je devrais juste passer à ça ?
00:11:13Ça vous indique quoi -- oh, salut.
00:11:15Ravi de vous rencontrer tous.
00:11:17Fondamentalement, il va trouver toutes les règles présentes dans votre dépôt et vous dire si vous avez des problèmes en double ou d'autres soucis.
00:11:24Et ensuite, vous pouvez faire un grep dessus comme index.
00:11:26Cet index peut donc être appelé pour supprimer les doublons et améliorer la récupération du contexte.
00:11:32Et enfin, lundi, nous avons animé cet atelier sur l'après-RAG, expliquant comment construire un moteur de contexte relationnel à partir de zéro.
00:11:40Donc, si vous scannez ceci, vous obtiendrez le classeur complet.
00:11:43Il contient six PR empilées qui vous apprennent à faire tout cela pas à pas.
00:11:46Mais en bref, le RAG est une technique incroyable, et vous le voulez.
00:11:49Mais l'autre moitié du problème, c'est ce que les gens demandent réellement :
00:11:53quelles sont les PR ouvertes sur lesquelles j'ai travaillé la semaine dernière concernant l'authentification ?
00:11:57Le RAG ne peut pas répondre à cette question tout seul.
00:12:00Vous avez besoin de requêtes.
00:12:01Cela vous montre donc comment faire une recherche fondamentalement sans schéma qui permet à l'agent de découvrir un schéma,
00:12:08puis d'écrire des requêtes de manière déterministe pour en extraire ce type de données relationnelles.
00:12:13Technique très utile.
00:12:15Les cas d'usage d'un moteur de contexte vont bien sûr au-delà de la génération de code.
00:12:21C'est là que nous vivons beaucoup.
00:12:22Une grande partie de nos clients y passent leur temps.
00:12:24Mais c'est formidable de voir ce qui se passe quand d'autres personnes dans l'entreprise commencent à s'emparer de ces outils.
00:12:30Des équipes de service client résolvant des tickets dès leur arrivée de la part d'un client.
00:12:35Nous avons des commerciaux qui concluent des affaires plus tôt dans leur trimestre parce qu'ils peuvent interroger à la volée le moteur de contexte Unblocked sur le terrain.
00:12:44Et bien d'autres encore.
00:12:45Ce que vous pouvez aussi faire, si vous vous souvenez du graphique en courbe où je parlais des niveaux,
00:12:51c'est que nous avons créé un petit outil sympa où un LLM vous interroge et vous pose des questions sur ce qui se passe,
00:12:55puis il vous situe exactement là où vous en êtes et vous donne des techniques pour progresser
00:13:01si vous cherchez à multiplier vos capacités et à livrer avec des outils d'IA à grande échelle.
00:13:07C'est readiness.getunblocked.com.
00:13:11Le fossé n'est plus l'intelligence.
00:13:13C'est le contexte.
00:13:14Nous continuerons d'obtenir des modèles incroyables comme Mythos, développé par Anthropic,
00:13:19et je suis sûr que Sol, dès que j'aurai le droit de le voir, je l'aurai.
00:13:22Joyeuse fête du Canada, au fait.
00:13:24Mais ce qui se passe, c'est qu'il s'agit du contexte dont vous entourez ces modèles pour qu'ils soient efficaces
00:13:30et optimisés en tokens au sein de votre organisation.
00:13:35J'ai donc une diapositive de questions, mais je ne suis pas sûr d'y avoir droit.
00:13:40Non.
00:13:41Donc ce que vous allez faire, c'est venir me retrouver au stand P16.
00:13:44Vous pouvez chercher la noix de coco.
00:13:46Ce serait super de discuter avec vous tous et d'entrer dans les détails ici si vous en avez besoin.
00:13:49Merci pour votre temps.
00:14:00Merci.

핵심 요약

L'intégration d'un moteur de contexte unifié permet de réduire la consommation de jetons de 50 % tout en améliorant la pertinence du code généré par les agents d'IA.

하이라이트

  • Les agents d'IA génèrent du code qui doit donner l'impression d'avoir été écrit par un membre de l'équipe présent depuis des années.

  • Un mauvais contexte initial entraîne des boucles de recherche gaspillées et des surcoûts importants en jetons.

  • L'accès à l'information ne vaut pas compréhension, ce qui nécessite un moteur de contexte pour éviter les incidents en production.

  • L'utilisation d'un moteur de contexte réduit de moitié le volume de jetons nécessaires et accélère les processus de tri.

  • L'outil open source de réseau de commentaires sociaux analyse le code GitHub pour cartographier les experts et l'activité de l'équipe.

타임라인

Le problème du contexte dans les agents d'IA

  • Les modèles actuels manquent de contexte sur le fonctionnement interne des entreprises.
  • Le coût des erreurs de contexte s'accumule à mesure que les agents gagnent en autonomie.
  • Les sessions de terminal successives isolent l'agent et nécessitent une acquisition externe de données.

L'ingénierie du contexte vise à doter les outils d'IA des connaissances historiques de l'entreprise, similaires à l'expérience acquise par un employé au fil du temps. Sans ce bagage, les agents commettent des erreurs répétées qui gaspillent des jetons et ralentissent la fusion du code dans les bases existantes.

Les limites des approches traditionnelles

  • Les systèmes de fichiers Markdown deviennent rapidement obsolètes et manquent de maintenance centralisée.
  • Les serveurs MCP souffrent du biais de satisfaction de la recherche et ignorent les informations récentes.
  • Un code qui compile peut provoquer des pannes en production s'il ignore les procédures internes.

Les méthodes courantes comme les fichiers de configuration manuels ou les protocoles MCP atteignent des limites structurelles. Elles ne garantissent ni la fraîcheur des données ni la prise en compte des décisions prises récemment dans les canaux de communication de l'entreprise.

Fonctionnement et gains d'un moteur de contexte

  • Le moteur unifie les sources de données en temps réel provenant de la chaîne d'ingénierie.
  • L'utilisation du contexte réduit la consommation de jetons de 21 millions à 10,8 millions sur une tâche complexe.
  • Les requêtes contextuelles génèrent un gain de temps d'environ deux heures par processus.

Le moteur de contexte gère les conflits entre sources d'information, applique les règles de gouvernance et sécurise les permissions d'accès. Les tests démontrent une baisse nette du volume de jetons consommés et une qualité de réponse supérieure grâce à la connaissance globale de l'organisation.

Outils open source et cas d'usage

  • L'outil de réseau de commentaires sociaux analyse GitHub pour cartographier les contributions de l'équipe.
  • Un second outil analyse les fichiers de règles pour éliminer les doublons et structurer l'indexation.
  • Les moteurs de contexte s'étendent au-delà du code pour assister le service client et les équipes commerciales.

Plusieurs ressources open source permettent d'extraire les graphes d'experts et de structurer des moteurs de contexte relationnel sans schéma fixe. Le fossé technologique actuel ne réside plus dans l'intelligence brute des modèles, mais dans la qualité du contexte qui les entoure.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기