Combien de temps vos compétences peuvent-elles durer avant que votre agent n'oublie ce que vous lui avez dit ? — Laurie Voss, Arize AI
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00-
00:00:12- Bonjour à tous.
00:00:15Merci d'être venus à cette conférence délicییement geek.
00:00:20Cette conférence a un titre très long,
00:00:22alors laissez-moi vous donner la version courte d'emblée.
00:00:23Vous écrivez des fichiers de compétences et les bourrez d'instructions.
00:00:27À un moment donné, le modèle cesse de toutes les suivre.
00:00:31La question est : où se situe ce point ?
00:00:33À quel moment avez-vous mis trop d'instructions
00:00:35dans vos fichiers de compétences ?
00:00:36Et la réponse a beaucoup changé au cours de la dernière année.
00:00:40Je suis Laurie, responsable des relations développeurs chez Arise AI.
00:00:44Dans une autre vie, j'ai cofondé NPM Inc.
00:00:46Certains me connaissent donc peut-être de l'époque de JavaScript.
00:00:48Aujourd'hui, je passe beaucoup de temps à penser à l'IA
00:00:50et à la façon de la tester.
00:00:53Il y a quelques mois, j'étais à une conférence sur l'IA à Miami,
00:00:55qui était une bonne conférence.
00:00:57Et j'assistais à une présentation de Dexter Horthy.
00:00:59C'était une bonne présentation.
00:01:00Elle ne portait pas du tout sur ce sujet.
00:01:02Mais pendant qu'il parlait,
00:01:04il a mentionné, en passant,
00:01:06qu'un agent pouvait suivre jusqu'à environ 200 instructions
00:01:10avant de commencer à oublier ces instructions.
00:01:13Et puis il a poursuivi son exposé,
00:01:15c'était vraiment une remarque en passant.
00:01:17Il a précisé que ce chiffre datait de 2025,
00:01:20donc la situation s'est peut-être améliorée.
00:01:22Et j'ai arrêté d'écouter une seconde
00:01:25parce que je me suis dit : 200 instructions,
00:01:27ce n'est vraiment pas beaucoup, n'est-ce pas ?
00:01:31Un fichier de compétences décent dépasse les 200 instructions
00:01:33presque immédiatement.
00:01:35Si l'utilisateur dit X, fais Y,
00:01:37toujours inclure une section sur Z,
00:01:39ne jamais utiliser l'expression W,
00:01:40chacune d'elles est une instruction distincte.
00:01:42Et si le modèle cesse discrètement de les suivre après 200,
00:01:45c'est une limite vraiment stricte
00:01:47sur la complexité de ce que l'on peut construire.
00:01:49Je voulais donc savoir d'où il tirait ce chiffre en premier lieu,
00:01:52et je voulais savoir si c'était vrai.
00:01:55Vous voyez bien de quel sentiment je parle.
00:01:57Vous écrivez ce grand et magnifique fichier de compétences,
00:01:58des pages de règles, de cas limites, de ton, de formatage.
00:02:00Vous le donnez à l'agent.
00:02:01Il fait le travail.
00:02:03Et vous regardez le résultat en vous disant :
00:02:05A-t-il vraiment fait attention ?
00:02:07A-t-il vraiment suivi toutes ces règles ?
00:02:09Ou a-t-il simplement fait ce qui lui chantait
00:02:11en me donnant une sorte de proche simulacre
00:02:14de ce que j'attendais ?
00:02:16On ne peut pas vraiment savoir, ou bien ?
00:02:18Nous y reviendrons.
00:02:20Et donc vous vivez avec cette légère anxiété
00:02:23chaque fois que vous lancez l'exécution.
00:02:24C'est ce sentiment qui a motivé cette recherche
00:02:27et nous essayons de voir si nous pouvons l'éviter.
00:02:30Voici donc ma promesse pour vos 18 prochaines minutes.
00:02:33Je vais vous montrer d'où vient ce chiffre de 200,
00:02:36s'il est toujours vrai,
00:02:37et quel est le vrai chiffre aujourd'hui,
00:02:39car il a changé d'un ordre de grandeur.
00:02:41Et ensuite nous parlerons de ce que cela implique
00:02:44pour vous.
00:02:46Quelle peut être la longueur réelle de vos compétences et prompts,
00:02:49et quels changements vous devriez apporter
00:02:51à votre flux de travail en conséquence.
00:02:54Ce chiffre de 200 n'est pas qu'une légende urbaine.
00:02:57Il provient d'un vrai benchmark appelé IfScale,
00:02:59issu d'un article de ce type dont je vais écorcher le nom,
00:03:03Jaroslawicz, et ses coauteurs l'année dernière.
00:03:06Et le test est d'une simplicité magnifique.
00:03:10Voici comment fonctionne IfScale.
00:03:12Vous demandez au modèle d'écrire un rapport d'entreprise,
00:03:14et vous lui donnez une liste de mots spécifiques
00:03:16qu'il doit impérativement inclure dans le rapport.
00:03:19Inclure le mot exact client,
00:03:20inclure le mot exact chiffre d'affaires,
00:03:22et ainsi de suite pour autant de mots que vous voulez.
00:03:24Chacun d'eux constitue une instruction qu'il doit respecter.
00:03:27Et ensuite, vous comptez combien de ces mots exacts sont apparus.
00:03:32Comme le test est très simple,
00:03:34vous n'avez à garder en tête que deux chiffres.
00:03:36Le premier est la densité, que l'on appelle n.
00:03:38C'est le nombre de règles dont nous parlons en même temps.
00:03:41Et le second est la précision,
00:03:42qui correspond au pourcentage de ces règles
00:03:43qu'il a réellement réussi à suivre.
00:03:46Maintenant, vous direz peut-être qu'inclure des mots aléatoires dans un rapport
00:03:50n'est pas la même chose que de suivre de vraies instructions,
00:03:52ce qui est vrai, et nous allons en parler.
00:03:55Mais les mots-clés constituent un indicateur.
00:03:57Inclure le mot chiffre d'affaires a la même structure de tâche
00:04:01qu'inclure une section sur la tarification, n'est-ce pas ?
00:04:02Ou ne jamais utiliser cette phrase.
00:04:04C'est une contrainte distincte et nommée
00:04:06que vous avez demandé à l'agent de suivre.
00:04:09Si un modèle ne peut pas retenir 200 mots dans un seul prompt,
00:04:11il va incontestablement peiner
00:04:13avec 200 instructions plus complexes.
00:04:16Donc, s'il y a une différence, ses performances seront pires.
00:04:20Ce chiffre représente donc un plafond.
00:04:22Ce chiffre est le maximum que l'on puisse atteindre.
00:04:23Si vous lui donnez des instructions plus complexes,
00:04:25le nombre va probablement baisser.
00:04:27Et 200, c'est un plafond vraiment bas.
00:04:30Donc, avant de courir après de nouveaux modèles,
00:04:32il faut faire de la bonne science,
00:04:33ce qui signifie qu'il faut reproduire l'ancien résultat
00:04:36et s'assurer que le plafond de 200 est bien réel.
00:04:39J'ai donc relancé le benchmark d'origine.
00:04:42L'article original a testé toute une série de modèles,
00:04:45et les modèles naissent et meurent très rapidement.
00:04:47Au moment où j'ai pu effectuer ces tests,
00:04:50seuls trois des modèles du lot d'origine
00:04:52parmi les 10 qu'ils avaient utilisés
00:04:54étaient encore disponibles via un quelconque type d'API.
00:04:57Il s'agissait de GPT 4.1, Claude Sonnet 4
00:04:59et Gemini 2.5 Pro.
00:05:01C'étaient des modèles disponibles il y a 12 mois,
00:05:03qui le sont encore aujourd'hui.
00:05:05C'est pourquoi nous avons testé ces trois-là,
00:05:07car c'était tout ce qui restait.
00:05:08Et depuis que j'ai publié cette recherche pour la première fois
00:05:11il y a quelques semaines,
00:05:12l'un de ces trois modèles a été retiré.
00:05:14C'était donc la dernière occasion possible
00:05:16de mener ce test.
00:05:17De cette sélection, il ne nous en reste donc plus que deux.
00:05:20Ne vous attachez donc pas trop à vos modèles.
00:05:22Voici les résultats que nous avons obtenus en reproduisant
00:05:25la conclusion initiale d'IfScale.
00:05:27La précision est affichée sur l'axe vertical.
00:05:29Elle commence à 100 % avant de chuter.
00:05:32Et le nombre de règles augmente en bas
00:05:35sur une échelle logarithmique.
00:05:36Ainsi, à chaque étape,
00:05:37le nombre de règles à traiter a doublé.
00:05:42Ainsi, à 500 règles, on en perd 30, 40, 50 %.
00:05:46Nos courbes correspondaient aux résultats de l'étude originale
00:05:49dans la limite du bruit, donc la découverte était bien réelle.
00:05:52Il y a un an, entre 200 et 300 règles environ,
00:05:55les modèles de pointe commençaient à s'effondrer.
00:05:57C'est un plafond vraiment bas.
00:06:00C'est donc notre référence, et vient maintenant la partie amusante
00:06:03où nous avons pris exactement le même test
00:06:05pour l'appliquer à la pointe actuelle,
00:06:07ou plutôt à ce que représentait la pointe actuelle
00:06:09quand j'ai exécuté ce test.
00:06:10J'ai donc testé GPT 5.5, Claude Opus 4.7,
00:06:13car la version 4.8 est sortie une semaine après mon test,
00:06:17Gemini 3.1 Pro et Deep Seek V4 Pro.
00:06:20Je leur ai donné le même message, les mêmes mots,
00:06:22exactement pareil, et j'ai immédiatement rencontré un problème :
00:06:25ils ont réussi haut la main.
00:06:27Ils ont tous obtenu 100 % immédiatement à ce test,
00:06:30absolument aucun bug.
00:06:34Nous avions conçu un test pour trouver la limite,
00:06:36et les modèles l'avaient traversée tout droit
00:06:37sans même s'apercevoir qu'elle était là.
00:06:40C'était un problème, car le benchmark
00:06:42était conçu pour saturer à 500 mots,
00:06:43j'ai donc dû modifier le benchmark
00:06:45afin de pouvoir trouver la nouvelle limite.
00:06:47J'ai donc déplacé les curseurs en ajoutant plus de mots à inclure.
00:06:50J'ai doublé la mise de 500 à 1 000,
00:06:52puis encore de 1 000 à 2 000,
00:06:55et j'ai continué ainsi jusqu'à atteindre un vocabulaire
00:06:56de 10 000 mots, et c'est là que j'ai commencé à trouver la limite
00:07:00de ce que les modèles sont capables de faire de nos jours.
00:07:03Laissez-moi vous présenter, c'est le graphique clé,
00:07:06voici les résultats.
00:07:07Rappelez-vous, échelle logarithmique sur l'axe des abscisses.
00:07:12On passe donc de 500 à 1 000, puis 5 000 et 10 000.
00:07:16On a l'impression que la courbe chute d'une falaise,
00:07:18alors que cela se produit sur près de 1 000 nombres.
00:07:20Mais regardez à quel point ces nouvelles courbes vont vers la droite
00:07:25avant de fléchir.
00:07:26Il y a un an, elles s'effondraient entre 200 et 300 instructions,
00:07:29et maintenant, selon le modèle, la limite se rapproche de 2 000,
00:07:32et pour les meilleurs d'entre eux, elle atteint 5 000 instructions
00:07:36avant de chuter de la falaise.
00:07:38En 12 mois environ, les modèles de pointe sont devenus presque 10 fois
00:07:41plus performants pour suivre des instructions simultanément.
00:07:44C'est la conclusion principale, et il y a beaucoup de nuances
00:07:47qu'il nous faut aborder.
00:07:49La capacité à suivre 2 000 contraintes nommées dans un seul prompt
00:07:53est bien là.
00:07:55Et c'est vraiment intéressant parce que je pense,
00:07:57je ne sais pas si tout le monde ressent la même chose,
00:07:59mais j'ai eu l'impression que le saut entre, vous savez,
00:08:04GPT 5.1 et GPT 5.5 était plutôt progressif, n'est-ce pas ?
00:08:07On n'avait pas l'impression d'avoir progressé par 10,
00:08:09mais il s'agit d'un test qui compte vraiment pour un aspect très pratique,
00:08:14à savoir la taille que peut faire mon fichier de compétences.
00:08:17Et en l'espace d'un an, nous avons été 10 fois plus performants.
00:08:21Et ce qui me frappe, c'est que ce benchmark
00:08:23a tout juste un an.
00:08:25Un an plus tard, 500 est une erreur d'arrondi,
00:08:27et cela continue de bouger sous mes pieds.
00:08:29J'ai testé la 4.7, l'Opus 4.8 est encore meilleure.
00:08:35Ce tableau est donc déjà un peu obsolète,
00:08:36ce qui est un peu le but recherché.
00:08:37Si vous avez établi vos hypothèses d'ingénierie
00:08:39sur la façon dont les fichiers de compétences doivent fonctionner,
00:08:41sur la longueur maximale de votre prompt,
00:08:44et que vous avez fait cela il y a plus de six mois environ,
00:08:46vous avez tort maintenant,
00:08:48et vous devriez probablement revoir votre façon de faire.
00:08:52Mais cette histoire ne s'arrête pas là,
00:08:54car la manière dont les modèles ont échoué
00:08:59a changé du tout au tout
00:09:00et leur mode d'échec est très important.
00:09:02Cette partie a été une découverte totalement inattendue
00:09:06lorsque j'ai commencé à mener l'expérience.
00:09:07Et cela a complètement perturbé mon test au début
00:09:10car l'ancien mode d'échec était ennuyeux.
00:09:13Ils oubliaient simplement les instructions
00:09:14et je pouvais mesurer combien d'instructions
00:09:16ils avaient mémorisées ou oubliées.
00:09:17Mais les nouveaux modèles s'effondrent de manière bizarre,
00:09:20qui leur est propre et très caractéristique.
00:09:22Laissez-moi donc vous présenter comment ces quatre modèles échouent.
00:09:26Deep Seek 4 est un modèle traditionnel.
00:09:29Il oublie simplement des choses.
00:09:30Il n'y a pas de drame.
00:09:31Il commence à oublier des instructions autour de 750 règles,
00:09:35et à 2 000, il en laisse tomber près de la moitié.
00:09:38Il oublie tout simplement, ce qui est franchement le mode d'échec
00:09:41auxquel je fais le plus confiance car il est prévisible.
00:09:43C'est très facile à mesurer.
00:09:44Et les autres modèles n'ont pas du tout été aussi coopératifs.
00:09:48Opus 4.7 décidait de façon répétée
00:09:52que le test était dangereux.
00:09:54Et ce qu'il faisait, c'est qu'il refusait
00:09:57au niveau de l'API d'exécuter le test.
00:09:59Je ne savais pas qu'il existait une réponse d'API
00:10:01que l'on pouvait obtenir de Claude où il disait :
00:10:03non, je pourrais le faire, mais je ne le ferai pas.
00:10:06Mais c'est tout à fait une réponse au niveau de l'API
00:10:09que Claude prend en charge parce qu'ils se soucient
00:10:10énormément de la sécurité, et j'ai commencé à recevoir
00:10:13ce type de réponse tout le temps.
00:10:15Et la raison pour laquelle cela se produisait
00:10:16est que Claude possède un classificateur de sécurité très sensible.
00:10:19Et si vous y insérez certaines combinaisons de mots,
00:10:22disons anthrax et cyanure,
00:10:24il décrète que toute la requête est dangereuse
00:10:26et il jette l'éponge.
00:10:27Et si vous vous souvenez de ce que fait mon test,
00:10:29mon test consiste à balancer entre 5 000 et 10 000 mots aléatoires
00:10:33dans un fichier d'instructions.
00:10:35Par conséquent, mes mots sélectionnés au hasard contenaient
00:10:38toutes sortes de choses qui paraissaient dangereuses
00:10:39en combinaison pour le filtre de sécurité.
00:10:41Il n'arrêtait donc pas de jeter l'éponge en prétendant que je lui demandais
00:10:43de fabriquer une bombe ou quelque chose du genre.
00:10:47Il a donc fallu, pour amener Claude à coopérer,
00:10:52que je prenne tous mes mots
00:10:54et les passe dans le filtre de sécurité d'OpenAI
00:10:56pour éliminer tous les mots d'aspect suspect
00:10:58afin de pouvoir avancer un minimum.
00:10:59Une fois cela fait, Claude s'est très bien comporté.
00:11:03Mais le mode d'échec est que Claude est plus susceptible
00:11:05de décréter que ce que vous faites est dangereux très tôt,
00:11:08disons dès deux ou trois cents instructions,
00:11:11si votre démarche, vous savez,
00:11:13contient quoi que ce soit en rapport avec des conseils médicaux,
00:11:15car le domaine médical a souvent un double usage.
00:11:17Cela peut être dangereux, ou cela peut être inoffensif.
00:11:20Le troisième mode d'échec concernait donc Gemini 3.1 Pro.
00:11:24Gemini est d'une robustesse à toute épreuve jusqu'à 5 000 instructions.
00:11:28Il s'en sort extrêmement bien.
00:11:30C'est vraiment l'un des meilleurs du classement.
00:11:32Et au-delà, les choses se gâtent.
00:11:35Il n'oublie pas les instructions.
00:11:37Il se sent submergé par les instructions.
00:11:39Ce qu'il essaie de faire, c'est d'utiliser des jetons de réflexion
00:11:44pour s'assurer qu'il suit
00:11:45toutes les instructions en même temps.
00:11:46Et lorsque le nombre d'instructions devient très élevé,
00:11:48il utilise tous ses jetons de réflexion.
00:11:50Il utilise la totalité de son budget de jetons à réfléchir
00:11:53et après, il ne produit aucun résultat.
00:11:55Il arrive à neuf, vous savez,
00:11:57si vous lui en avez donné l'équivalent de 10 000,
00:11:59il va utiliser l'équivalent de 9 500 jetons de réflexion
00:12:02puis vous donner une réponse de 500 mots,
00:12:04qui ne contient aucun des jetons.
00:12:07Il se met donc tout seul dans une impasse
00:12:09et n'a plus de place pour répondre réellement,
00:12:10ce qui coûte très cher et s'avère totalement inutile,
00:12:13ce qui est assez fidèle à sa réputation, non ?
00:12:19Ce que, vous savez, je ne dirais jamais à haute voix.
00:12:23Et enfin vient le vainqueur, à savoir GPT 5.5.
00:12:26GPT 5.5 est le meilleur du lot, avec 99 % de précision,
00:12:29jusqu'à 5 000 règles.
00:12:32Mais si on le pousse trop loin,
00:12:33c'est de loin le plus bizarre de la bande.
00:12:35Parce qu'il ne refuse pas catégoriquement,
00:12:37il n'oublie pas en silence.
00:12:38Au lieu de cela, il s'énerve
00:12:41et vous dit que le test est stupide.
00:12:45Il commence le rapport, il en fait quelques,
00:12:47c'est ça le truc,
00:12:48il ne commence pas simplement par dire non.
00:12:50Il commence le rapport,
00:12:51il commence à rédiger le rapport,
00:12:52et à environ 500 mots dans le rapport,
00:12:54il se dit, non, c'est ridicule.
00:12:55Je ne vais pas faire ça.
00:12:56Et puis il vous dit poliment que c'est ridicule.
00:12:58Je ne veux plus faire ça.
00:13:00C'est la vraie réponse qu'il m'a donnée.
00:13:02Mais c'était après environ 5 000 mots dans ce rapport professionnel
00:13:05que je lui avais demandé de générer.
00:13:08Donc il n'a pas tort, n'est-ce pas ?
00:13:10Je demandais un rapport professionnel cohérent
00:13:12sur aucun sujet en particulier
00:13:14qui contient 5 000 mots aléatoires.
00:13:17Tu as raison, GPT.
00:13:19C'est une demande stupide.
00:13:23Ce qui est une requête profondément déraisonnable,
00:13:25et GPT l'a fait remarquer.
00:13:27Mais cela compte quand même comme un échec au test.
00:13:29Parce que le rapport à moitié terminé qu'il vous donne
00:13:31ne contient pas la plupart des mots-clés,
00:13:32et c'est aussi le plus difficile à détecter.
00:13:35Parce que Claude abandonne immédiatement.
00:13:36Claude dit, non,
00:13:37je ne vais pas faire ça.
00:13:39DeepSeek fait de son mieux.
00:13:41Mais GPT fait du travail qui a l'air bien,
00:13:44à moins de lire le rapport jusqu'à la fin,
00:13:46où il est dit : non, en fait,
00:13:47je laisse tomber parce que c'est ridicule.
00:13:51Donc, si l'on prend du recul et regarde les quatre ensemble,
00:13:53DeepSeek oublie discrètement.
00:13:54Claude prend peur et refuse.
00:13:56Gemini réfléchit trop et sombre dans le silence.
00:13:58Et GPT 5.5 termine la moitié du travail,
00:14:00et vous dit que le reste est en dessous de ses compétences.
00:14:04Et le point n'est pas de savoir lequel est le plus drôle.
00:14:07Bien que ce soit vraiment un peu drôle.
00:14:09Le point est que, a-t-il suivi mes instructions,
00:14:12n'a plus un seul mode d'échec.
00:14:14Il a quatre façons différentes d'échouer.
00:14:16Et vous ne pouvez pas identifier cet échec à moins de savoir
00:14:19à quel modèle vous avez affaire et quel sera son mode d'échec.
00:14:23Les modèles sont donc devenus 10 fois meilleurs.
00:14:27Ils échouent de manière amusante.
00:14:29Pourquoi devriez-vous vous en soucier une fois rentré à votre bureau ?
00:14:31Parce que trois choses ont changé dans votre flux de travail.
00:14:34La première est qu'il y a un an, la bonne pratique était de garder chaque fichier de compétences très, très court.
00:14:39Moins de 200 instructions, puis de renvoyer à des sous-compétences et à tout un labyrinthe byzantin de fichiers de compétences supplémentaires, de sous-fichiers et autres.
00:14:50Vous deviez condenser vos instructions pour tenir dans un espace disponible très restreint, et vous n'avez plus besoin de faire cela.
00:14:57Vos fichiers de compétences peuvent être très longs.
00:14:59La deuxième chose, c'est que si votre cas d'usage nécessite cent règles spécifiques ou trois cents, vous pouvez simplement toutes les inclure dans le prompt.
00:15:06Vous n'avez plus à veiller tard en vous demandant lesquelles le modèle a ignorées en silence.
00:15:12Et si vous repensez à votre propre expérience vécue avec les modèles, vous vous en êtes probablement rendu compte.
00:15:21Vous avez découvert que vous vous inquiétez moins de la longueur de votre prompt, car les modèles sont réellement devenus 10 fois meilleurs pour suivre vos instructions.
00:15:322 000 contraintes nommées, c'est tout un guide de style, n'est-ce pas ?
00:15:35C'est chaque règle de marque, chaque mention légale.
00:15:38Il y a un an, il aurait fallu répartir cela entre une douzaine d'agents spécialisés et espérer qu'ils se passent le relais proprement.
00:15:46Mais maintenant, vous pouvez oublier cela.
00:15:48Mais la troisième chose est la plus importante.
00:15:50La question était autrefois : est-ce que le modèle peut seulement faire ça ?
00:15:53Et la réponse est désormais un oui catégorique.
00:15:55Enfin, passablement catégorique.
00:15:58La nouvelle question est : est-ce que ça vaut le coût ?
00:16:01Parce que vous pouvez inclure 10 000 mots de -- pardon, 10 000 instructions différentes dans votre prompt, mais ce sera un prompt énorme.
00:16:07Ce sera un prompt très coûteux.
00:16:09Ce sera un prompt très lent.
00:16:10Ce qui constituait un mur infranchissable est donc devenu un compromis souple : est-ce que cela vaut la peine d'ajouter toutes ces instructions supplémentaires si cela augmente les coûts et la latence ?
00:16:19Et maintenant, quelques réserves pour anticiper les questions.
00:16:25Premièrement et surtout, je l'ai mentionné plus tôt, il s'agit d'une tâche de substitution : inclure des mots aléatoires dans un faux rapport professionnel prouve que les fichiers de compétences longs fonctionnent.
00:16:38Ce n'est pas la même chose que de prouver qu'un fichier de compétences long fonctionne.
00:16:41De plus, les modèles atteignent leurs limites à des moments très différents, de 750 à plus de 9 000, il faut donc choisir son modèle très soigneusement.
00:16:49Ce que notre test ne fait pas, c'est mesurer si le modèle a raisonné clairement sur un prompt géant.
00:16:57La bonne nouvelle, c'est que depuis mes recherches il y a plusieurs semaines, pas mal de gens se sont penchés sur la question, et il y a maintenant de bonnes recherches.
00:17:05De vrais scientifiques s'en sont mêlés -- Chroma a effectué un travail sur la dégradation du contexte sur 18 modèles, montrant que la précision sur les entrées longues peut chuter de 30 à 50 pour cent bien avant d'atteindre la limite de la fenêtre de contexte.
00:17:21Et le côté étrange de leur découverte, c'est qu'un texte cohérent et bien structuré est plus susceptible d'entraîner cet échec que si l'on place ses instructions dans un ordre aléatoire.
00:17:33Je ne sais pas pourquoi, il faudrait que je lise leur rapport.
00:17:37Le modèle peut donc suivre 2 000, 5 000, voire 10 000 instructions, mais il ne va pas nécessairement raisonner clairement à partir de celles-ci.
00:17:46Si ces instructions sont en conflit, s'il y a des tensions entre elles, il ne va pas forcément bien les gérer.
00:17:53Et puis il y a l'autre point que j'ai brièvement mentionné.
00:17:56Les refus de Claude sont agaçants, mais ils sont explicites.
00:18:00Vous obtenez une erreur, vous savez que ça a échoué.
00:18:02Le rapport poli à moitié terminé de GPT est beaucoup plus dangereux car il ressemble à une vraie réponse.
00:18:07Il faut tout lire pour s'apercevoir qu'il a abandonné en cours de route, ce qui signifie qu'on ne peut pas faire confiance au résultat.
00:18:13Cela signifie que vous devez lire le résultat à chaque fois pour vérifier s'il fonctionne ou non.
00:18:17Le modèle acceptera donc vos 2 000 règles et vous rendra quelque chose qui a l'air, du moins au début, sûr de lui et soigné, mais qui pourrait avoir abandonné en chemin.
00:18:30Soit dit en passant, on me demande toujours combien tout cela m'a coûté.
00:18:34Cela m'a coûté 209 dollars pour exécuter toutes ces requêtes.
00:18:372 300 appels répartis sur sept modèles ont coûté 209 dollars.
00:18:43Il s'avère que la recherche novatrice ne coûte pas très cher.
00:18:46Et c'est la partie de la présentation où je disais qu'il faut tester ces choses en production car on ne peut pas être sûr que le modèle ne va pas échouer en silence.
00:18:55Vous saviez donc que j'allais finir par parler d'évaluations, car je travaille chez Arise et c'est mon domaine.
00:19:01Mais il y a bien assez de pubs pour Arise.
00:19:03Je vais donc simplement dire une chose vraie : si vous construisez une vraie application d'IA et que vous lui confiez des tâches délicates,
00:19:10vous allez vous heurter à un ou plusieurs de ces modes d'échec avec un modèle de pointe.
00:19:14Et à moins que ce ne soit Claude qui vous envoie balader au niveau de l'API, la seule façon de savoir que quelque chose a mal tourné est de surveiller vos résultats avec un autre LLM.
00:19:23C'est une évaluation, c'est ce que fait Arise, et je m'arrêterai là.
00:19:27J'ai déjà mentionné qu'il y avait eu de nouvelles recherches depuis les nôtres.
00:19:30En voici une autre importante.
00:19:31Un article a été publié testant 46 modèles, intitulé Revisiting the Reliability of Language Models in Instruction Following,
00:19:37ce qui, vous l'imaginez, a éveillé mon attention après mes propres recherches.
00:19:41Et ils ont fait un constat dérangeant : un modèle peut réussir haut la main un benchmark comme le nôtre et rester extrêmement peu fiable.
00:19:47Parce que si l'on reformule la même instruction d'une manière légèrement différente, cela peut radicalement changer sa capacité à suivre ces instructions.
00:19:56Le modèle peut donc suivre 2 000 instructions et le faire très bien.
00:20:00Mais si vous placez ces mêmes instructions, ces mêmes 2 000 instructions dans un autre ordre, cela peut soudainement rendre le modèle beaucoup moins performant.
00:20:08Et la manière exacte de procéder, quel est le bon ordre d'instructions pour que le modèle les suive parfaitement au lieu de s'embrouiller, fait toujours l'objet de recherches.
00:20:19La capacité a donc augmenté, mais la fiabilité reste un problème.
00:20:24Et c'est juste une petite vantardise parce que j'étais content : je ne suis pas un scientifique, j'ai fait des recherches.
00:20:31Et puis un tas d'autres vrais scientifiques se sont mis de la partie et ont fait de la vraie science sur la même question.
00:20:36Il existe désormais toute une série de benchmarks pour mesurer cette même question.
00:20:40Firebench, CCRbench, Guidebench essaient tous de mesurer la même chose.
00:20:44Comment les modèles suivent un grand nombre de contraintes réelles et complexes à la fois.
00:20:49Tout le domaine s'y intéresse maintenant, donc si vous voulez une science meilleure que mes 10 000 mots aléatoires, la vraie science existe à présent.
00:20:58Ce qui m'amène à ma conclusion.
00:21:00Il y a un an, le plus difficile en écrivant une compétence était de tout faire tenir sans que le modèle ne perde le fil.
00:21:05C'était un problème de compression, et ce problème a disparu.
00:21:08Le modèle retiendra vos 2 000 instructions sans problème.
00:21:11La nouvelle difficulté est de savoir s'il a réellement fait ce que vous avez demandé, et c'est un problème de vérification.
00:21:16Un problème de vérification ne se résout pas en écrivant un meilleur prompt.
00:21:20Il se résout en vérifiant le résultat à chaque fois, de la même manière que l'on teste n'importe quel code, c'est-à-dire par une évaluation.
00:21:26La limite a été multipliée par 10 en un an.
00:21:29Alors, revoyez les hypothèses que vous avez formulées il y a six mois sur la taille de vos prompts et de vos instructions, car elles sont peut-être déjà caduques.
00:21:41C'était donc l'exposé.
00:21:42Si vous voulez tout le code et toutes les données, c'est à cette URL GitHub.
00:21:48Et cet autre QR code est quelque chose que le marketing m'a forcé à inclure.
00:21:51Nous organisons une soirée de visionnage de la Coupe du monde ce soir à 17 h.
00:21:55Vous pouvez venir à notre fête.
00:21:56Ce lien mène au Luma qui vous permettra d'entrer.
00:22:01J'espère que cet exposé vous a apporté des informations inédites ou au moins quelques rires, et merci beaucoup pour votre temps et votre attention.
00:22:07Merci.
00:22:08Merci.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기