ループホール:道徳性をストレステストする敵対的エージェント — ブレンダン・ラッパッツォ(モルガン・スタンレー)

AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00今回は、私が開発しているプロジェクト「Loophole」についてお話します。私はモルガン・スタンレーで機械学習の
00:00:17研究者をしておりますが、このプロジェクトはモルガン・スタンレーとは一切関係ありません。個人的に趣味で
00:00:23進めているオープンソースのプロジェクトです。まず概要を簡単にご説明すると、これは
00:00:30敵対的エージェントのフレームワークを基に構築されたゲームです。自分の道徳観を入力すると、1つの
00:00:37エージェントがそれを法体系に落とし込み、2つの敵対的なエージェントがその法体系の中から
00:00:42あなたの道徳の矛盾を見つけ出そうとします。最近はさまざまな拡張機能も開発しています。
00:00:49まずは、このアイデアに至った背景や発祥のストーリーからお話ししたいと思います。
00:00:56これはずいぶん前のことですが、祖先を調べるために自分のDNAを23andMeに送ったのがきっかけでした。それからしばらくして
00:01:05DNAサンプルが犯罪の捜査や様々な法医学、未解決事件の解決にどのように役立てられているかという話を
00:01:11耳にするようになりました。当時の私は、DNAがどのように利用されるかというなし崩し的な状況を恐れるあまり、
00:01:17あらゆる利用を拒否していたなと思い返していました。
00:01:26ただ、もちろん内容によっては協力してもいいと思えるケースもあります。考えてみれば面白いことに、
00:01:31もし誰かがケースバイケースで、「この未解決事件や殺害事件を解決するためにあなたのDNAを使用させてほしい」と
00:01:37提示してくれたなら、私はそれに対して「はい」か「いいえ」を答えることができるはずです。私自身の道徳観の
00:01:43定義やニュアンスがどこにあるのかは自分でも分かっています。しかし、もちろん、こういったケースバイケースをすべて列挙するのは
00:01:51認知的におよそ不可能です。現時点では、これをうまく行う方法がありません。
00:01:58そして、もう少し視点を引いて考えてみると、これは法体系全体にも多くの共通点があることに気づきました。
00:02:04私たちの社会における法体系とは、突き詰めれば、自分たちの道徳的信念を言語化しようとする試みに
00:02:10他なりません。そしてそれと同様に、私たちの道徳の真のニュアンスや、本来あるべき法律の姿を見つけ出すことは、
00:02:17非常に困難な翻訳の作業であると言えます。
00:02:23そのニュアンスを見出すのが難しいため、私たちは往々にして、表現を過度に一般化してしまう傾向があります。
00:02:30完璧な翻訳を試みようとすれば、奇妙な例外規定や予期せぬ不具合を引き起こす原因になりかねません。
00:02:36さらに日常の人間関係や政治的な対立においても、意見の不一致の多くは、実際にはお互いの核心的な価値観を
00:02:42争っているというよりも、道徳観における繊細なポイントを十分に探求できていないことから生じている場合が
00:02:48多いように思います。
00:02:57こうしたより広い法律の例に倣えば、イギリスのコモンロー(判例法)システムにおいて
00:03:02判例にこれほどまで大きく依拠しているのも、まさにそのためだと考えられます。つまり、こうしたニュアンスや
00:03:09微妙な境界線を見極めることは難しいため、優れた裁判官の判断力に頼ることで法律を正しく解釈し適用しようとするわけです。
00:03:16もちろん、最高裁判所のような場においても、問題が持ち上げられ、そもそも法律が有効であるかどうかを
00:03:22判断を下すことができます。
00:03:28そこで思いついたのが、「自分の道徳観をもとに、このような合成判例を生成することはできないか」というアイデアでした。
00:03:34これを手作業で行うのは途方もなく大変ですが、新しい世代の大規模言語モデル(LLM)であれば、
00:03:42ついにこのような高次元の道徳的推論を行えるだけの賢さを備えているように思えます。
00:03:48それがこのゲームの出発点となりました。今回は、
00:03:55ご説明し、さらに、このオープンソースプロジェクトをベースにして私が構築してきた様々な発展形についても
00:04:00お話ししたいと思います。非常に面白い方向に発展させられる可能性があると考えています。
00:04:05大まかなゲームの仕組みとしては、自然言語を用いて、これはターミナルベースのゲームなのですが、
00:04:12自分の道徳観を入力します。
00:04:19一般的な道徳観であっても良いですし、特定の主題に関するものであっても構いません。そして、1つのエージェントがその道徳観を受け取り、
00:04:24非常に重厚な法文形式に則った、体系化された法体系のドラフトを作成します。その後はループ処理として実行され、
00:04:31一方のエージェントには、作成されたシステム内の抜け穴(つまり道徳的には許されないが法律上は違反にならないもの)を
00:04:38見つけるよう指示が与えられます。もう一方のエージェントは、行き過ぎた規定、つまりあなたの道徳観に照らせば
00:04:45本来は道徳的なのに、システムの規定では違法になってしまうようなケースを探すようプロンプトが与えられます。そして判定役のエージェントが、
00:04:52あなたの道徳観、生成された法コード、そしてこれらの一連の合成判例の事例を確認します。まずは自動修正ができるかどうかを判断します。
00:04:58例えば、法コードの最初のドラフトの翻訳が不完全であり、本質的な矛盾が存在しない場合であれば、
00:05:05自動的にこのアップデート処理を行うことができます。あるいは、道徳観の指定が十分に明確でなかったり、
00:05:10道徳観の中に矛盾が含まれている場合もあります。そのような場合には、
00:05:16ユーザーであるあなたにそれが提示され、裁判官として判断を下すことになります。
00:05:22画面はまだ見えていますか? 私の方では消えてしまったのですが。
00:05:26このゲームに興味を持っていただけたなら、ぜひ遊んでみてください。すべてGitHubに公開されています。
00:05:31いくつか例をお見せしたいと思います。テキストが多いので、入力と出力がどのような形になるのかを
00:05:37示すことがメインとなります。このようにして入力を提供します。先ほどのDNAの例に戻ると、
00:05:44分かりました。このゲームに興味を持っていただけたならぜひ遊んでみてください。すべてGitHubに公開されていますが、いくつか例をお見せしたかったのです。テキストが多いので、入力や出力がどのような形状になるかをお見せすることが主目的です。このようにして入力を提供します。先ほどのDNAの例に戻ると、いくつかの道徳的原則を指定することができます。
00:06:10そして、体系化された法体系についても、形状を確認してみると、非常に法律文書らしい前文、条、節といった構成になっており、正確な法律用語で記述しようと試みられています。
00:06:24その後、さまざまな合成判例が提案されます。このケースでは、保険会社が発見された抜け穴について語られています。
00:06:34保険会社は、あなたのDNAそのものではなく、DNAのアーティファクトに基づいて予測機械学習モデルをトレーニングしました。これは実際には不道徳であるが、現在のシステムでは合法であるという抜け穴です。
00:06:46このケースでは、自動パッチ適用が可能であることが判明しました。そして、元の法体系と、確実に一貫性を持たせるために行う必要があった修正内容とが、Gitスタイルの差分として表示されます。
00:06:58次に、これは行き過ぎ(オーバーリーチ)の例です。このケースでは、自動パッチ適用ができないことが判明しました。これは、次のような事例について述べています。
00:07:08ある人が遺伝子研究のためにDNAを提出したが、研究者がその人が稀少だが治療可能な遺伝性疾患を持っていることを発見したという事例です。
00:07:17しかし現在のところ、あなたの道徳観では、この病気をDNAを提出した本人に開示することは許可されるべきではないとされています。そのため、これがユーザーである私に提示され、判断を下すことになりました。そして同様に、判断を下すと、修正された法体系が得られます。
00:07:33このように、これは楽しいゲームであり、Twitterに投稿してGitHubでオープンソースとして共有しました。私にとっても、これまでで圧倒的に最もバイラルとなった投稿でした。多くの人が、単に面白いと言ってくれました。
00:07:50自分の道徳観をストレステストして、興味深い矛盾がないか確認できるからです。しかし同時に、もっと何か先があるのではないかとも考えさせられました。
00:07:59より実用的で、より大きなスコープのインプリケーションがあるのではないかということです。そこで、法的な分野を離れた最初の探索として3つの異なる枝葉についてお話しします。より実用的なものとして、チャットボットや一般のエージェント向けの憲法を自動作成する方法があります。例えば、あなたが企業で、顧客対応を行うエージェントやチャットボットを導入したいとします。
00:08:29道徳的コードに則りつつ、話すべきことと話すべきではないことを制御したい場合です。あるアプローチでは、同様の方法で道徳観を記述し、チャットボットが話すべきことと話すべきでないことを記述します。次に、体系化されたシステムプロンプトの作成を試みます。そして、話すべきでないことについて話させようとしたり、話すべきことについて話すのを拒否させようとしたりする敵対的エージェントを配置します。
00:08:56これはGEPAに類似した手法ですが、体系化されたシステムプロンプトの構築を目的としている点に特徴があります。
00:09:03特に興味を持っている2つ目のユースケースは、アドホックまたは分散型の契約を行う手段として活用することです。簡単な例を挙げると、オンラインでのデータやプライバシーの取り扱い方法を指定し、このような敵対的ゲームを通じて、オンラインでのデータの扱い方を定めた体系化された法体系を得ることができます。
00:09:30そして、例えばAppleが新しい利用規約などを発表した際、あなたの法体系とAppleの利用規約の間の矛盾を実行し、興味深い矛盾や、あなたの道徳観(望むこと)と企業の実際の行動との間に乖離が生じるような合成事例を顕在化させることができます。
00:09:57大企業相手であれば何も変えられず、交渉にならない場合もありますが、少なくとも自分が署名する契約についてより良い情報を得ることができます。
00:10:08また、より分散型の視点として、中央集権的な権限による強制なしに契約を結ぼうとする場合や、異なる国を跨いで契約を結ぼうとする場合にも応用できると考えています。
00:10:23自分の道徳観や、どのようにインターフェースしたいかを指定できると仮定します。例えば業務委託において、どのように報酬が支払われるべきか、その周囲を取り巻く道徳観を定義し、相手方も同様に行うとします。
00:10:40そうすれば、双方がストレステストされた体系化された契約を得ることができ、合意する前に意見の不一致があればそれを見つけ出して表面化させることができ、契約全体に対する自信を高めることができます。
00:10:55最後の、そしておそらく最も野心的なアプローチは、より賢い政府やより効率的な政府のあり方についての考察です。
00:11:07多くのプライバシー上の問題やロジスティック上の課題が存在するとは思いますが、それらをひとまず脇に置いて大局的に考えてみます。
00:11:15有権者や住民にとって、自分の道徳観を定義し、ストレステストされた法的コードを持つことができれば、新しい法案や政治家が登場した際に非常に面白い方法になり得ます。
00:11:28自分の契約を相手のそれと照らし合わせて実行し、どのような点で意見が対立するのか、あるいは自分にとって不道徳であったり矛盾したりする興味深いポイントを浮かび上がらせることができます。
00:11:41また、お互いの関係性においても、私たちは物事に対して多くのニュアンスを抱いており、単なる価値観をめぐって議論するのではなく(価値観自体はしばしば矛盾していませんが)、そのニュアンスに到達する手段になります。
00:11:57価値観それ自体は、多くの場合矛盾していないからです。
00:12:01そして、立法者にとってより実用的な側面としては、法案を提案したい場合に、議会内の他のすべての議員のシミュレーションを行い、
00:12:15提出前にストレステストを行うことが想像できます。
00:12:18そのため、このプロジェクトで私が構築している3つ目の枝葉として、米国の下院・上院を対象にこれを試みました。
00:12:24最初に行ったのは、Claudeに現在の米国の全上院議員の投票履歴や公開されているその他の情報を調べさせ、それぞれの道徳的システムを構築してもらい、それをループホールプロセスに通して体系化された法コードを取得することでした。
00:12:43そしてこのシステム上で、現在提案されている法案や、あるいは自分で提案した法案を入力し、Claudeに各上院議員がどのように投票するかをシミュレートさせることができます。
00:12:56ここで、一部の上院議員の内訳や、どちらの立場に傾いているか、そして投票の背後にある理由を確認することができます。
00:13:07提案された立法に対して人々がどのように投票するのかを確認するという点で非常に興味深いと考えています。
00:13:16同時に、これはカンファレンスのテーマにも沿うものとして、それ自体が検証可能なドメインやループとなります。
00:13:22また、スーパーマジョリティ(3分の2など)や可決に必要な票数を獲得できるように法案を最適化していく(ヒルクライミングする)ことなども考えられます。
00:13:30このケースでは、私がテストしていたメディケア法案は当初50対50の投票結果になると判明していましたが、52票で可決されるように法案の文言をヒルクライミングで修正する方法が見つかりました。
00:13:45これは、法案の核心的な信条を見出し、各上院議員の契約に対して法案を照らし合わせ、法案の核心的な信条や道徳観に違反しない範囲で文言を変更する方法がないかを探り、その方法で自動パッチ適用を行うことができる例です。
00:14:09さらに、投票数を最大化するために必要な変更をランク付けして提示することもでき、ユーザーとしてトレードオフを選択することができます。
00:14:23最近このブランチで試している最後の試みは、さらに大きな視点として、州や地区などのすべての有権者が
00:14:38それぞれ自身の法コードを持ち、あらゆる法案を提出して実際の有権者間の合意度を実際に測定できるような、さらに効率的な政府に繋げられないかということです。
00:14:50このため、NVIDIAが提供している非常に優れた米国ペルソナのデータセットを使用しました。州ごとに500のペルソナを取り出し、州の人口を十分に代表するものとしています。
00:15:03ペルソナを与えて道徳観を起草させ、法的な契約を起草させ、興味のある法案を各州に対して実行するという同じプロセスを行いました。
00:15:15人々がこの法案をどれほど好むか、あるいは彼らの道徳観とどれほど一致しているかを測定し、人々に合わせて法案を最適化するヒルクライミングを行うこともできます。
00:15:25最後にまとめると、最低限としてこれはなかなか楽しいゲームです。私が関わっているからひいき目に見ているかもしれませんが、関心のあるテーマを入力して道徳観を入れ、矛盾がないか確かめるのはとても面白いです。
00:15:40多くの場合、非常に興味深い疑問が提起され、そのニュアンスを提供すると、エージェントはそれ以上矛盾を見つけられなくなり、一貫したニュアンスのある道徳的システムを持っているという安心感が得られます。
00:15:56しかし同時に、分散型やより優れた契約に向けた実用的な応用があるのではないか、あるいは立法者にとって法案のストレステストを行い、地区の住民にとってより良い、あるいは住民の意思をより正確に反映した法律を書く方法として役立つのではないかという点にも関心を持っています。
00:16:19このQRコードは上院シミュレーターへのリンクですので、興味のある方はぜひ遊んでみてください。もう一方は私のウェブサイトで、GitHubの完全なLoopholeリポジトリがあります。ぜひ触って、フォークしてみてください。他のコントリビューターの方にも参加していただければ幸いです。ありがとうございました。
00:16:49ありがとうございました。

핵심 요약

個人の道徳観から法体系のドラフトを自動生成し、敵対的エージェントのシミュレーションを通じて矛盾や抜け穴を発見・修正するオープンソースフレームワーク「Loophole」が構築されている。

하이라이트

  • 道徳観を入力するとエージェントがそれを法体系のドラフトに変換し、敵対的エージェントがその抜け穴や行き過ぎを見つけ出すオープンソースのゲーム「Loophole」が開発された。

  • DNAの提供や保険会社による機械学習モデルの訓練といった事例を基に、道徳的原則から体系化された法コードが生成され、Gitスタイルの差分として修正内容が表示される。

  • チャットボット向けのシステムプロンプトを構築するための敵対的フレームワークとして、話すべきことや話すべきでないことを制御する応用が可能である。

  • 米国の上院議員全員の投票履歴などから道徳的システムを構築し、提案された法案に対してどのように投票するかをシミュレートする機能が実装されている。

  • メディケア法案のシミュレーションにおいて当初50対50だった投票結果を、文言の修正を通じて52票で可決されるように最適化するヒルクライミング手法が用いられた。

타임라인

Loopholeプロジェクトの発想とゲームの仕組み

  • 個人の道徳観を入力すると、エージェントがそれを法体系のドラフトに落とし込む。
  • 2つの敵対的エージェントが法律上の抜け穴や行き過ぎた規定を発見する。
  • 判定役のエージェントが自動修正の可否を判断し、判断が分かれる場合はユーザーに提示される。

祖先調べるためにDNAを提出した経験や、法体系における表現の一般化の難しさから着想を得た。ターミナルベースのゲームとして実装されており、自然言語による道徳観の入力から構造化された法文形式への翻訳が行われる。システム内で道徳的な矛盾を洗い出し、自動パッチ適用やユーザーによる判断を通じて一貫性のある法体系へと更新していく。

具体例の提示とバイラル効果

  • DNAのアーティファクトを利用した予測機械学習モデルの事例において、自動パッチ適用による修正が行われる。
  • 稀少な遺伝性疾患の開示に関する事例では、自動パッチ適用ができずユーザーが直接判断を下す。
  • GitHubでオープンソースとして公開されたこのプロジェクトは、これまでにないバイラルな反響を獲得した。

実際の入力と出力の形状を示すため、保険会社の抜け穴や遺伝子研究における情報開示のケースが提示される。法律文書らしい前文や条項を備えたシステム上で、道徳観と法律上の規定の乖離がGitスタイルの差分として可視化される。自身の道徳観をストレステストできる点が多くの関心を集め、広く共有される契機となった。

チャットボット憲法と分散型契約への応用

  • 顧客対応チャットボットの話すべき内容と制限を制御するためのシステムプロンプト構築に応用される。
  • オンラインでのプライバシーやデータの取り扱いを定めたアドホックな契約の生成に活用できる。
  • 企業の利用規約と個人の法体系との間の矛盾や乖離をあらかじめ発見することが可能になる。

法的な分野にとどまらず、実用的なスコープへと拡張する試みが進められている。チャットボット向けの憲法作成において敵対的エージェントを配置し、対話の境界線を厳密に制御する。さらに分散型の視点から、オンライン契約や利用規約に対して個人の道徳観を適用し、意図しない条項や乖離を顕在化させる手段として機能する。

米国上院議員シミュレーターと法案の最適化

  • 全上院議員の投票履歴などを基にそれぞれの道徳的システムが構築されている。
  • 提案された法案に対して各議員がどのように投票するかをシミュレートできる。
  • 可決に必要な票数を獲得できるように法案の文言をヒルクライミングで最適化する。

政治や立法プロセスへの応用として、米国の下院や上院を対象としたシミュレーターが開発された。各議員の公開情報を基に構築された道徳的システムに対し、特定の法案を入力して投票行動を予測する。メディケア法案のテストでは、投票数が50対50から52票へと増加するように文言を自動修正する最適化手法が実証されている。

州のペルソナを活用した合意形成とまとめ

  • NVIDIAの米国ペルソナデータセットを用いて州ごとの住民の合意度を測定する。
  • 住民の道徳観に合わせて法案を最適化するアプローチが探求されている。
  • 楽しく遊べるゲームとしての側面と、より効率的な契約や政府のあり方への実用的な応用が目指されている。

州ごとに500のペルソナを配置し、それぞれの法コードを用いて新しい法案に対する好意度や一致度を大規模に測定する試みが行われている。個人の道徳観のストレステストという娯楽的な側面を持ちながらも、分散型契約や住民の意思を正確に反映した立法プロセスの効率化に向けた基盤として開発が続けられている。

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기