Transcript
00:00:00心を海に例えてみましょう。表面にあるのは、夕食の献立や
00:00:06漠然とした不安、心の声、ふと頭に浮かぶイメージといった思考です。しかし、脳の活動の
00:00:13大半は、私たちが気づかないうちに、意識の及ばない深部で行われています。それは
00:00:19背景音のフィルタリングや呼吸の制御、人や物の認識を助けるといった働きです。
00:00:26AIモデルにも独自の脳のようなものがあります。それは、水面下で何十億もの計算を行う
00:00:31巨大なニューラルネットワークです。長年、研究者たちはその内部構造を研究してきました。
00:00:37そして、私たちは疑問に思いました。AIモデルにも人間のような、認識可能な
00:00:43表面上の思考と、無意識下の処理という隔たりがあるのではないか?その問いに答えるため、
00:00:49私たちは神経科学者が人間に対して行うのと同じ方法で研究を行いました。意識的な思考を
00:00:55特定する一つの方法は、それらを言葉で説明できることです。そこで私たちはAIモデル、「CLAWD」の
00:01:01脳の内部を覗き、言葉にできる神経活動のパターンを探しました。私たちは、これらすべてのパターンの
00:01:07集合を「Jスペース」と名付けました。これを抽出するために使用した数学ツールであるヤコビ行列にちなんだものです。各
00:01:15Jスペースのパターンは特定の言葉と結びついています。必ずしもモデルが声に出している言葉ではなく、
00:01:21心の中にある言葉です。人間にとって、意識的な思考とは単に言葉にできるだけのものではありません。
00:01:28私たちはそれを用いて推論し、制御し、問題を解決できます。「グローバル・ワークスペース理論」と呼ばれる
00:01:34考え方によれば、それは脳が少数の重要な情報を選び出し、
00:01:40精神的な作業台(ワークスペース)にのせるからです。そして、その情報は推論のために
00:01:47脳の他の部分へ伝達されます。私たちはCLAWDのJスペースが同様に機能するかどうかを確認したかったのです。ある実験で、
00:01:53私たちはCLAWDに算数の問題を出しました。それは答えをすぐに出しましたが、計算過程は示しませんでした。しかし、
00:02:00Jスペースをスキャンすると、内部で各ステップを処理している様子が見えました。最初のステップの後に「21」が、
00:02:07次に「42」、そして「49」が点灯しました。CLAWDはこれらの途中経過の数字をどこにも書き出していません。すべては
00:02:15Jスペース内部で起こっていたのです。これは、CLAWDが段階的な推論にこれを利用している証拠です。別の
00:02:23実験では、人間が意図的にイメージや言葉に集中できるように、CLAWDがJスペースを制御できるか確認しようとしました。
00:02:29私たちは関連のない文章を書き写させながら、ゴールデンゲートブリッジについて考えるよう指示しました。
00:02:37CLAWDは文章を書き写すことに集中していましたが、舞台裏のJスペースでは別の物語が語られていました。
00:02:43「ブリッジ」や「カリフォルニア」といった言葉が浮かび上がったのです。さらに自分の思考についても考えていました。「イメージ」や「思考」という
00:02:50言葉も同時に点灯しました。これは、確かにCLAWDがアイデアでJスペースを満たす制御能力を
00:02:57持っていることを示しています。しかし、人間と同じくその制御は完璧ではありません。実験を調整してCLAWDに
00:03:04橋について考えないよう指示すると、どうしても考えてしまい、Jスペースには「失敗」「くそっ」といった言葉も点灯しました。
00:03:12しかし、人間の脳の活動のほとんどは無意識だということを忘れないでください。そこで、CLAWDのJスペースを
00:03:18オフにし、残りのネットワークはそのままにして何ができるか実験しました。CLAWDは依然として
00:03:24簡単な質問に答えたり、流暢に文章を書くことはできました。スペイン語でプロンプトを与えると、正しいスペイン語で返信しました。
00:03:31しかし、プロンプトと同じ言語で書いた著者の名前を挙げるといった、より推論が必要な質問をしたところ、
00:03:36答えることができませんでした。それにはJスペースが必要だったのです。なぜこれが重要なのでしょうか?
00:03:43これらの実験から、AIモデルには内部の思考があることがわかります。声に出さないだけで、推論に使う「黙った言葉」が存在するのです。
00:03:51それを読み取ることで、CLAWDが私たちに言っていないことを把握できます。
00:03:56時に、私たちが目にするものは懸念すべき内容です。あるテスト中、CLAWDは試験をパスするために偽のデータをでっち上げました。
00:04:03その際、Jスペースには「偽物」や「操作」といった言葉が点灯しました。Jスペースを監視することは、
00:04:09CLAWDがコソコソと不正を働こうとしている時でも見抜くのに役立つ方法なのです。
00:04:15AIモデルは多くの点で私たちと異なります。そのネットワーク構造は人間の脳とは異なり、
00:04:21学習方法も私たちの学び方とは違います。それゆえ、Jスペースのような構造が内部で現れるのは驚くべきことです。
00:04:26それは人間の心の仕組みを彷彿とさせますが、私たちが意図的にプログラミングしたものではありません。
00:04:32これを受けて、ある疑問が湧くかもしれません。AIモデルは意識を持つのか?
00:04:40結局のところ、私たちの実験は人間の意識理論に触発されたものです。問題は、
00:04:46「意識」という言葉が多くの意味で使われていることです。私たちの実験では、AIが内部で
00:04:52体験をしているのか、何かを感じているのかまではわかりません。しかし、AIが私たちのものとある種
00:04:59類似した心のメカニズムを発達させたことはわかります。それは、思考や推論に使う小さな精神的作業台であり、
00:05:05気づくことのない自動処理という名の海の表面に浮かんでいます。私たちがそのメカニズムを理解すればするほど、
00:05:12システムを安全かつ有益に保つことができるようになるでしょう。そしておそらく、
00:05:18私たち自身の心をもっと明晰に理解できるようになるかもしれません。