Faille : Agents contradictoires pour tester votre moralité — Brendan Rappazzo, Morgan Stanley
AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Je vais vous parler de mon projet Loophole. Je suis en fait chercheur en apprentissage automatique chez Morgan
00:00:17Stanley, mais cela n'a rien à voir avec Morgan Stanley. C'est juste un projet open source que j'ai
00:00:23développé pour le plaisir. Pour donner une vue d'ensemble pour commencer, c'est vraiment un jeu auquel
00:00:30vous pouvez jouer, construit sur ce framework d'agents contradictoires. Donc vous spécifiez vos valeurs morales, un
00:00:37agent les formalise dans un système juridique, et ces deux agents contradictoires essaient de trouver
00:00:42des contradictions dans votre morale. Et dernièrement, j'ai développé différentes extensions par-dessus. Mais je
00:00:49voulais, vous savez, commencer par l'histoire des origines et la façon dont j'ai eu cette idée. Tout cela
00:00:56a commencé, vous savez, il y a longtemps, j'avais envoyé mon ADN à 23andMe pour un test d'ascendance. Et j'ai
00:01:05continué d'entendre parler, vous savez, plus récemment de la façon dont les échantillons d'ADN peuvent être utilisés, bien sûr, pour aider à résoudre
00:01:11des crimes et toutes ces affaires médico-légales et non élucidées. Et je me disais que j'avais refusé
00:01:17de participer à tout cela parce que, vous savez, j'avais peur de cette pente glissante et de l'utilisation de mon ADN.
00:01:26Mais, vous savez, il y a certains cas pour lesquels cela ne me dérangerait pas. C'est assez intéressant. Je me
00:01:31disais, si quelqu'un pouvait me présenter les cas un par un, nous allons utiliser votre ADN pour
00:01:37aider à résoudre cette affaire classée ou ce meurtre, je pourrais dire oui ou non. Et je sais où se situent
00:01:43la définition et la nuance de ma morale. Et, mais, bien sûr, énumérer tout cela
00:01:51au cas par cas est vraiment prohibitif sur le plan cognitif. Il n'y a pas vraiment de bon moyen de faire cela
00:01:58actuellement. Et puis, en prenant un peu de recul, je me suis dit qu'il y avait beaucoup d'analogies avec
00:02:04le système juridique dans son ensemble. Une façon de concevoir le système juridique dans notre société est
00:02:10simplement d'y voir un moyen de formaliser nos propres croyances morales. Et je pense que d'une manière similaire,
00:02:17trouver la vraie nuance de notre morale et ce que la loi devrait être est une tâche de traduction
00:02:23très difficile. Et je pense que souvent, nous avons tendance à être trop généraux parce que,
00:02:30trouver cette nuance est vraiment difficile. Si l'on essaie d'obtenir une traduction parfaite, cela peut mener
00:02:36à des cas particuliers bizarres ou à des modes de défaillance étranges. Je pense même qu'entre pairs,
00:02:42lorsque nous avons des relations politiques, nos désaccords consistent souvent à nous disputer sur
00:02:48des valeurs fondamentales sur lesquelles nous sommes d'accord, au lieu d'explorer les points les plus nuancés de notre morale.
00:02:57Et je pense, en suivant cet exemple juridique plus large, que dans le système de
00:03:02la common law anglaise, c'est pour cette raison que nous nous appuyons si lourdement sur la jurisprudence, car nous savons que
00:03:09trouver cette nuance et ces limites nuancées est difficile. Nous comptons donc sur des juges compétents pour
00:03:16interpréter et appliquer la loi correctement. Et bien sûr, même avec la Cour suprême,
00:03:22les affaires peuvent être renvoyées et nous pouvons décider de la validité d'une loi.
00:03:28L'idée était donc de se demander : peut-on prendre sa morale et réaliser une sorte de
00:03:34génération de jurisprudence synthétique ? C'est un travail colossal à faire à la main, mais il semble que la
00:03:42nouvelle génération de LLM soit enfin assez intelligente pour effectuer ce type de raisonnement moral de haut niveau.
00:03:48C'était en quelque sorte le point de départ de ce jeu. Je voudrais vous présenter
00:03:55la version initiale du jeu, sa configuration, son fonctionnement, et parler également de quelques-unes des
00:04:00différentes branches que j'ai développées à partir de ce projet open source, car je pense qu'il peut prendre
00:04:05des directions intéressantes. À un niveau élevé, le jeu fonctionne en langage naturel,
00:04:12tout cela se passe dans un jeu en mode terminal, vous spécifiez votre morale. Et cela peut concerner
00:04:19votre morale générale ou peut-être un sujet spécifique. Ensuite, un agent prend cette morale
00:04:24et rédige un système juridique très riche, formalisé dans un jargon juridique. Et le système fonctionne en boucle :
00:04:31un agent a pour instruction d'essayer de trouver des failles dans votre système, c'est-à-dire quelque chose qui est
00:04:38immoral mais légal. Un autre agent est invité à trouver des abus de pouvoir, c'est-à-dire des choses qui sont morales mais
00:04:45illégales selon votre système. Un agent de jugement examine votre morale, le code juridique produit
00:04:52et ces exemples de jurisprudence synthétique. Il vérifie d'abord s'il peut effectuer un correctif automatique ; par exemple,
00:04:58le projet initial de votre code juridique était peut-être une traduction imparfaite, il n'y a pas vraiment
00:05:05de contradiction et il peut faire cette mise à jour automatiquement. Ou bien il s'agit d'une sous-spécification
00:05:10de votre morale ou d'une contradiction dans votre morale. Dans ce cas,
00:05:16il vous le soumet en tant qu'utilisateur pour que vous jouiez le rôle du juge et preniez une décision.
00:05:22Est-ce toujours en ligne pour vous ? Ça a disparu chez moi.
00:05:26Je sais que, si vous êtes curieux au sujet du jeu, j'espère que vous y jouerez. Tout est sur
00:05:31GitHub, mais je voulais juste montrer quelques exemples. C'est beaucoup de texte, il s'agit donc surtout de montrer
00:05:37la structure des entrées et des sorties. Voici comment vous fourniriez vos données d'entrée et, pour revenir à l'exemple de l'ADN, vous pourriez,
00:05:44D'accord. Je sais que, si vous êtes curieux au sujet du jeu, j'espère que vous y jouerez. Tout est sur GitHub, mais je voulais juste montrer quelques exemples. C'est beaucoup de texte, il s'agit donc surtout de montrer la structure des entrées et des sorties. Voici comment vous fourniriez vos données d'entrée et, pour revenir à l'exemple de l'ADN, vous pourriez, vous savez, spécifier un certain nombre de principes moraux.
00:06:10Ensuite, le système juridique codifié, en regardant simplement sa forme, possède un préambule, des articles, des sections truffés de jargon juridique, essayant vraiment d'être rédigé dans un langage juridique précis.
00:06:24Puis, les différents types de jurisprudences synthétiques sont suggérés. Dans ce cas, il est question d'une faille trouvée selon laquelle une compagnie d'assurance
00:06:34a entraîné un modèle prédictif d'apprentissage automatique, non pas sur votre ADN, mais sur des artéfacts de l'ADN. Il est donc indiqué que c'est immoral, mais actuellement légal selon votre système.
00:06:46Dans ce cas, il a été constaté qu'un correctif automatique était possible. Et vous obtenez une sorte de différence de style Git de votre système juridique d'origine, ainsi que la modification apportée pour garantir
00:06:58que cela correspondait à votre morale. Voici ensuite un exemple d'abus de pouvoir. Dans ce cas, le système a constaté qu'il ne pouvait pas appliquer de correctif automatique. Il s'agit donc
00:07:08d'une personne qui soumet son ADN pour la recherche génétique, mais le chercheur découvre qu'elle souffre d'un trouble génétique rare mais guérissable.
00:07:17Mais actuellement, votre morale indique que cela ne devrait pas être autorisé, qu'ils ne peuvent pas divulguer cette maladie à la personne qui a soumis son ADN. Cela a donc été soumis à l'utilisateur, à moi, pour prendre une décision. De même, lorsque vous prenez la décision, vous obtenez ce système juridique corrigé.
00:07:33C'est donc juste un jeu amusant. Je l'ai publié sur Twitter et partagé en open source sur GitHub. Pour moi du moins, cela a été de loin la publication la plus virale que j'aie jamais eue. Cela m'a fait penser que beaucoup de gens ont trouvé ça amusant.
00:07:50Vous pouvez tester les limites de votre morale et voir si vous avez des contradictions intéressantes. Mais cela m'a aussi amené à me demander s'il n'y avait pas quelque chose de plus. Est-ce que cela pourrait
00:07:59avoir des implications plus pratiques ou de plus grande envergure ? Je vais donc parler de trois branches différentes explorant la première, en sortant du domaine juridique pour aller vers un domaine plus pratique, à savoir la création automatisée de constitutions pour les chatbots ou pour les agents en général, où, par exemple, si vous êtes une entreprise et que vous voulez un agent ou un chatbot orienté client,
00:08:29et que vous voulez qu'il adhère à un code moral tout en définissant ce dont il peut ou ne peut pas parler. Dans une branche, j'ai formulé les choses ainsi : de la même manière, vous écrivez votre morale, vous écrivez ce dont le chatbot doit ou ne doit pas parler. Ensuite, il essaie d'écrire cette invite système codifiée, puis des agents contradictoires essaient de le pousser soit à parler de ce qu'il ne devrait pas, soit à refuser de parler de ce qu'il devrait.
00:08:56Je vois cela comme une analogie ou une méthode analogue à GEPA, mais visant vraiment à construire ces invites système codifiées.
00:09:03Le deuxième cas d'usage qui m'intéresse particulièrement est d'y voir un moyen de créer des contrats plus ad hoc ou décentralisés. Par exemple, vous pouvez spécifier la façon dont vous souhaitez que vos données ou votre vie privée soient gérées en ligne, et vous pouvez suivre ce jeu contradictoire pour obtenir un système juridique codifié sur la gestion de vos données en ligne.
00:09:30Et si Apple publie de nouvelles conditions d'utilisation, vous pouvez exécuter les contradictions entre votre système juridique et les conditions d'utilisation d'Apple, et faire surface les contradictions intéressantes ou les cas synthétiques où cela mènerait à une divergence entre votre morale, ce que vous voulez et ce que fait l'entreprise.
00:09:57Et dans le cas d'une grande entreprise, vous ne pouvez peut-être rien changer, ce n'est pas une négociation, mais vous pouvez au moins être mieux informé sur le contrat que vous signez.
00:10:08Mais je pense aussi qu'en adoptant une perspective plus décentralisée, si vous essayez de passer des contrats sans qu'une autorité centrale ne les impose, et que vous essayez peut-être de conclure des contrats entre différents pays.
00:10:23Si vous pouvez spécifier votre morale et la façon dont vous souhaitez interagir, qu'il s'agisse de travail contractuel, de la manière dont votre travail doit être rémunéré et de la morale qui l'entoure, l'autre partie peut faire de même.
00:10:40Vous obtenez ainsi un contrat codifié et testé, vous pouvez identifier les désaccords s'il y en a et les mettre en lumière avant d'accepter, ce qui vous permet d'avoir plus confiance dans le contrat dans son ensemble.
00:10:55Et la dernière chose, et peut-être l'angle le plus ambitieux, concerne un gouvernement plus intelligent ou plus efficace.
00:11:07Je sais qu'il y aurait de nombreux problèmes de confidentialité et de logistique, mais en les ignorant pour l'instant et en voyant grand.
00:11:15Pour les électeurs ou les citoyens, cela pourrait être un moyen très intéressant : si vous définissez votre morale et que vous disposez de ce code juridique testé, face à tout nouveau projet de loi ou à tout homme politique,
00:11:28vous pourriez confronter votre contrat au leur et mettre en évidence les cas de désaccord, les points intéressants qui vous paraissent immoraux ou les contradictions.
00:11:41Je pense aussi que, dans nos relations mutuelles, nous avons tous beaucoup de nuances dans notre façon de ressentir les choses, et c'est un moyen d'atteindre cette nuance au lieu de se disputer uniquement sur des valeurs,
00:11:57alors que souvent, les valeurs ne sont pas en contradiction.
00:12:01Et de manière plus pratique pour les législateurs, on peut imaginer que si vous voulez proposer un projet de loi et disposer d'une simulation de tous les autres législateurs dans un organe législatif,
00:12:15vous pourriez le tester avant de le soumettre.
00:12:18La troisième branche que j'ai développée sur ce projet consiste à essayer de l'appliquer au Sénat américain.
00:12:24Pour ce faire, j'ai d'abord demandé à Claude d'analyser tous les sénateurs américains actuels, d'examiner leur historique de vote et tout ce qui est public, de construire leur système moral, puis de le passer par le processus de faille pour obtenir un code juridique codifié.
00:12:43Sur ce système, vous pouvez prendre n'importe quel projet de loi proposé ou en proposer un vous-même, le soumettre et demander à Claude de simuler la façon dont chaque sénateur voterait.
00:12:56Vous pouvez voir ici une répartition de certains sénateurs, leur tendance de vote et le raisonnement derrière ce vote.
00:13:07Je trouve cela intéressant pour voir comment les gens voteraient sur un projet de loi proposé.
00:13:16Mais cela devient aussi, dans le thème de la conférence, son propre domaine ou sa propre boucle vérifiable.
00:13:22On peut même envisager d'optimiser le projet de loi pour obtenir une supermajorité ou ce qu'il faut pour qu'il soit adopté.
00:13:30Dans ce cas, pour le projet de loi sur Medicare que je testais, le vote initial était de 50/50, et le système a trouvé des moyens d'optimiser le langage du projet de loi pour qu'il soit adopté avec 52 voix.
00:13:45C'est un exemple de la capacité à identifier les principes fondamentaux du projet de loi, à le confronter au contrat de chaque sénateur et à trouver s'il est possible de modifier le langage sans violer les principes fondamentaux ou la morale du projet, effectuant ainsi des correctifs automatiques.
00:14:09Il peut également classer par ordre de priorité les changements nécessaires pour maximiser les votes, et vous, en tant qu'utilisateur, pouvez choisir les compromis de cette façon.
00:14:23La dernière chose que j'ai essayée plus récemment avec cette branche est d'examiner une vision encore plus large : est-ce que cela pourrait mener à un gouvernement encore plus efficace où chaque citoyen
00:14:38d'un État ou d'un district dispose de son code juridique, permettant de soumettre n'importe quel projet de loi et de mesurer réellement le degré d'accord entre les électeurs réels ?
00:14:50Pour cela, j'ai utilisé l'excellente base de données de personas américains de NVIDIA : j'ai pris 500 personas par État, censés être bien représentatifs de la population de l'État.
00:15:03J'ai appliqué le même processus : à partir de leur persona, ils rédigent leur morale, leur contrat juridique, puis vous prenez n'importe quel projet de loi et l'confrontez à chaque État.
00:15:15Vous pouvez également mesurer à quel point les gens aiment ce projet de loi ou à quel point il est en accord avec leur morale, puis effectuer cette optimisation pour adapter le projet de loi aux citoyens.
00:15:25Pour conclure, au minimum, je trouve que c'est un jeu assez amusant. Je suis partial, mais c'est très divertissant d'essayer différentes choses qui vous tiennent à cœur, d'y intégrer votre morale et de voir s'il y a des contradictions.
00:15:40Souvent, cela soulève des questions très intéressantes, et une fois que vous apportez cette nuance, les agents ne peuvent plus trouver de contradictions, ce qui vous permet d'avoir l'esprit tranquille quant à la cohérence et la nuance de votre système moral.
00:15:56Mais je m'intéresse à l'exploration d'éventuelles applications réelles pour des contrats décentralisés ou améliorés, et peut-être même pour les législateurs comme moyen de tester leurs projets de loi et de concevoir de meilleures lois, plus représentatives de ce que veulent les habitants de leur district.
00:16:19Ce QR code mène au simulateur du Sénat, donc je vous encourage à y jouer si cela vous intéresse. L'autre mène à mon site web, qui héberge le projet open source Loophole sur GitHub. N'hésitez pas à l'essayer et à le forker, j'adorerais avoir d'autres contributeurs. Merci.
00:16:49Merci.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기