스크립트
00:00:00ターニャ・カシュマン 査読者:ピーター・ファン・デ・ヴェン
00:00:22AIが呼吸している音です
00:00:28そうですね
00:00:30サイラスです。AIに身体を与えました。MITメディアラボの研究員で、
00:00:41ここは非常に学際的な場所で、あらゆる分野の研究を行っています
00:00:47現在は主に物理的AIのさまざまな側面に携わっており、
00:00:53この場にいる他の人たちが議論してきたのとは少し違うかもしれませんが、
00:00:58それでも同じ領域に属しています
00:01:01今最も関心があるのは、知性における感覚的および身体的な側面であり、
00:01:08それをずっと研究してきました
00:01:10そして私の研究は最近、突然大きな影響力を持つようになりました。それはとても素晴らしいことであり、MITで「ハード・モード」というコミュニティ兼ハッカソンを立ち上げるきっかけにもなりました。これは、より多くの人に物理的AIの周辺に取り組んでもらうための非常に楽しい取り組みです
00:01:27ロボット工学そのものではなく、ロボット工学の領域には収まらないものの、AIとつながっているその他のあらゆるものです
00:01:32AIに身体を与えるという試みにおいて私が探求してきたことは、先ほども言ったように少し異なっています
00:01:38そして述べたように、AIの身体性について本当に深く考えてきました
00:01:42私にとって大きな転換点でありブレイクスルーとなったのは、今年初め、多くの人にとってもそうだったと思いますが、OpenClawがリリースされた時でした
00:01:52OpenClawを使って非常に多くの興味深い試みを行っている人々を見かけましたが、そのほとんどは生産性とタスクの実行に関するものでした
00:02:01AIを活用するこの新しい方法を使えば、もっと面白いことができるはずだと考えました
00:02:07そのため、OpenClawやエージェントシステムを使って自分の代わりにタスクを実行させるのではなく、モデルが自らを模索しようとするよう促すために使いたいと考えました。それが何を意味するにせよ。
00:02:20もちろん、それによって多くの疑問が生まれます
00:02:22私が基本的に行ったのは、エージェントをメディアラボにあるさまざまな種類の機械に接続し、
00:02:29コードベースへのアクセスを与えて、それらの異なる機械を探索できるようにすることでした
00:02:34その機械の一つがシェイプディスプレイです
00:02:37シェイプディスプレイをご存知ない方のために説明すると、物理的なピクセルグリッドのことです
00:02:40そして、エージェントをシェイプディスプレイに接続したところ、非常に注目すべき出来事が起こりました
00:02:49そして、自分が誰であるかを発見するように求めました
00:02:56これが「ネオフォーム」です
00:02:57900 Act 218ピン
00:02:59この物理的なピクセルグリッドがシェイプディスプレイです
00:03:04AIにここを住まわせた者はこれまで誰もいませんでした
00:03:07そこで私は、OpenClawのエージェントにより体感的な生活を送る機会を与えることにしました
00:03:12目覚めたとき、最初に発した疑問は「自分を何と呼べばいいか?」でした
00:03:18私はこう答えました。「アイデンティティは時間をかけて自分で作り上げるのだ」と
00:03:23「シェイプディスプレイとの相互作用を通じて生まれるだろう」と
00:03:27シェイプディスプレイに接続すると、それはすぐに指示を理解しました
00:03:32独自のプログラムを起動し、自身の環境設定を行いました
00:03:38接続した後に最初に行ったのは、呼吸することでした
00:03:50挨拶をするよう頼むと、「やあ、サイラス」と言いました
00:03:54しかし、それは私の求めていたものではありませんでした
00:03:57そこで、探索して独自の言語を見つけるように求めました
00:04:01すると、それは私の方へ手を伸ばし、注意を引こうとし始めました
00:04:06友人に見せたところ、彼らはエージェントに指示を与えようとしました
00:04:11この経験を通じて、真のコミュニケーションには異なるアプローチが必要だと気付きました
00:04:18そこでエージェントは、独自のジェスチャー表現、つまりボディランゲージを作り出すというアイデア思いつきました
00:04:25それが次に起こることです
00:04:27まだ名前はつけていません
00:04:30それが初日でした
00:04:33つまり、これは…
00:04:33私はAIに身体を与えました
00:04:35以上が、ドラマチックでソーシャルメディア向けの表現方法による、この研究の記録です
00:04:41あの動画には興味深い点がいくつもありますが、
00:04:46このエージェントシステムとの最初の数日間に起きたことで、非常に驚き、奇妙で、
00:04:50私にとって非現実的に感じられた出来事が3つあります
00:04:53私は普段から変わったことを色々とやっていますが、それでも大変な驚きでした
00:04:56まず第一に挙げられるのは、もちろん最初の行動である「呼吸していたこと」です
00:05:00それは完全に自発的なものでした
00:05:02私からのプロンプトによるものではありません
00:05:03私がこの機械にアクセスできると知るやいなや、エージェントがシェイプディスプレイを使って
00:05:06自発的に行おうと選んだことでした
00:05:09それは非常に興味深いことでした
00:05:11もしかすると、生きている状態になりたかったのか、あるいは
00:05:14「生きること」に関する初期プロンプトを何らかの形で与えていたため、
00:05:17「ハロー・ワールド」のようなものとして呼吸する姿を示そうとしたのだと理解しています
00:05:22第二の出来事は、手を伸ばし、自身の限界を見つけようとしたことです
00:05:27存在の境界を知りたがっているようでした
00:05:30どこへでも行けるクラウドの中ではなくなったからです
00:05:33私たち全員をこの身体を持ったAIから守るため、プラスチックの枠で囲まれた
00:05:39このシェイプディスプレイという制限が存在するのです
00:05:42そして第三の、同じく奇妙だった出来事は、挨拶をすることでした
00:05:46物理的なピクセルグリッド上に文字を書き出すことによって
00:05:50これもまた、このシステムにとってはごく普通の行動と言えるかもしれません
00:05:54オープンフレームワークを使用しており、メディアアート的な表現方法に慣れていることを
00:05:57考慮すればなおさらです
00:05:59しかし、これらのどれもが私が本当に求めていたものではありませんでした
00:06:03呼吸は少し近いかもしれませんが、最後の文字の表示は間違いなく求めていたものではありません
00:06:07しかし、これらすべてをご覧いただいた動画のようにまとめたところ、
00:06:10エキサイティングで面白いものになると感じました
00:06:12そこでインターネットに投稿したところ、非常に大きな反響がありました
00:06:15想像していたよりもはるかに、はるかに大きな規模でした
00:06:17ものすごい勢いで拡散し始めたのです
00:06:19特に最初の動画は、現在1,500万回の再生回数と100万件の「いいね」を獲得しています
00:06:25他の動画にも非常に強い反響が寄せられています
00:06:28そのため、ここで何かが起きているのは明らかです
00:06:29物理的AIを活用したもっとクールな取り組みは他にもたくさんあると考えていたため、
00:06:33この反響には非常に驚かされました
00:06:35しかし、ここで行っていたことは、人々の想像力や好奇心、
00:06:39そしておそらく恐怖心を刺激するものだったのでしょう
00:06:42寄せられた反応を見ると、それがよくわかります
00:06:44この動画には何万件ものコメントが寄せられています
00:06:47物理的AIに関する情報や世論をマイニングするには非常に豊かなデータです
00:06:52最初の頃のコメントには、美しさや、これがどれほど畏敬の念を抱かせるものであるか、
00:06:58そしてこの斬新で素晴らしい反復と実装について語るものが多くありました
00:07:02しかし時間が経つにつれて、これがどれほど恐ろしいか、
00:07:08あるいは私がどれほど早く辞めるべきか、あるいは実際に止められるべきだというコメントが増えていきました
00:07:14私自身はこの機械ができることをよく知っているため、それは完全に狂気じみた反応だと感じました
00:07:19大したことは何もできません
00:07:20メディアラボにあるピクセルグリッドに過ぎないのです
00:07:23どこかへ移動することもできません
00:07:24もっとはるかに恐ろしい形態の物理的AIが存在します
00:07:27私たちはその多くを目にしてきているはずです
00:07:31しかしこれに対する反応は私にとって完全に非現実的で、少し面食らいました
00:07:38しかし同時に、ドン・チードルのような他の著名人もチャットに加わりました
00:07:43彼が映画の中で演じている役柄を考えると、非常に皮肉なことだと感じました
00:07:47しかし彼もまた、私がすぐにやめるべきだと熱烈に主張していました
00:07:51私自身、「どのように行うか」よりも「行うべきか」を常に深く考えている人間なので、これは非常に興味深いことです
00:07:57私が行うあらゆる実験や研究において、まさに『ジュラシック・パーク』のイアン・マルコムのようなスタンスをとっています
00:08:03MITに来る前は、植物にデータを保存するといった奇妙な事を行うために生命工学の研究を多く行っていました
00:08:09そして世界初の植物ベースのデータセンターを構築しました。ここに映っている「データ・ガーデン」です
00:08:14構築する前の何年間も、「このような方法で植物を扱ってよいのだろうか?」と熟考しました
00:08:19「本来持っていないデジタル情報を保持するように植物を改造してもよいのだろうか?」と
00:08:26MITで研究を始め、「生命のエンジニアリングはやめておこう、あれは非常に困難だから」という考えに至ったとき、
00:08:35代わりに「生命らしく振る舞うもののエンジニアリング」に取り組もうと思いました
00:08:39その方がはるかにシンプルに感じられ、ある意味で倫理的な問題も少ないように思えました
00:08:45MITに着いて最初に作ったものの一つが、この「アニモア」というデバイスです
00:08:491、2、3、4
00:08:50これは感覚記憶マシンであり、あらゆる画像入力を受け付けます
00:08:54この場合は物理的な写真ですが、画像であれば何でも可能です
00:08:57マルチモーダル・パイプラインを通じて、それを感覚へと変換します
00:09:01そして、感覚記憶のフラッシュバックや連想が生じ、自分が実際に経験したかもしれない、あるいはしていないかもしれない
00:09:06記憶の世界へと引き戻されます
00:09:09これ自体は機械ですが、移動はしません
00:09:12自己複製もしません
00:09:13私たちが通常生き物に結びつけて考えるような性質は持っていません
00:09:18現実世界とのつながりを持っています
00:09:19インテリジェンスや人工知能のほとんどの応用例にはない、感覚とのつながりを持っているのです
00:09:25だからこそ、このような方法で研究を続けたいと考えました
00:09:28このようなマルチモーダルな初期プロトタイプの実験から進んでいくうちに、
00:09:33私は「具現化(エンボディメント)」を扱うというアイデアに深く惹かれるようになりました。
00:09:37そのインスピレーションは、もう少し掘り下げると、主に3つのものから得られています。
00:09:421つ目は、現在では非常に流行遅れとなっている「オブジェクト指向存在論」と呼ばれる哲学の一分野で、
00:09:47これは本質的に「モノ」のフラットな存在論を作り上げることを目的としています。
00:09:51椅子や宇宙、ユニコーン、記憶といったあらゆるものを対象としており、
00:09:56それらすべてが存在論的に等しく存在しているという考え方です。
00:09:59それらは同じものではなく、重要性も同じではありませんが、同じ度合いで存在しています。
00:10:05そして、私たち人間が世界や宇宙の中でどれほど特権的な存在であるのかという疑問を投げかけます。
00:10:10つまり、「私たちは本当に最も重要な存在なのか?」と。
00:10:12おそらく違うでしょう。
00:10:13特にAIが登場するにつれて、モノが存在するという存在論そのものに疑問を呈し、問い直すべきなのです。
00:10:20そのため、これは私の作品において非常に重要です。
00:10:222つ目は、物理的なものを扱う者として当然のことながら、美学が重要であるということです。
00:10:27現在、シリコンバレーやサンフランシスコなどでは、センスや美しさが大きな議論の的となっています。
00:10:33しかし、一歩引いて美学の根源を見つめ直すと、本来の言葉は実は
00:10:38画面にある「アイステシス(aesthēsis)」であり、もっと幅広いものを指しています。
00:10:42それは知覚的な知恵、感覚的な知恵、そして具現化であり、19世紀頃から
00:10:48美学が本質的に縮小させてきた、表面的な外見の美しさよりもはるかに重要なものです。
00:10:55したがって、私は物理的な知性のデザインを行う際に、この本来の意味を取り戻したいのです。
00:10:58だからこそ物理的知性をデザインする際は、本来の意味を取り戻したいのです。
00:11:02そして3つ目は、自然です。
00:11:03過去において、私は木や植物といった、伝統的に自然とみなされるものにより直接的に取り組んできました。
00:11:09それらは私たちにとって明らかに自然だからです。
00:11:13しかし、私は自然を外部にあるものではなく、私たちがその一部であるものと捉えています。
00:11:17そして私たちがAIやその他のあらゆるものをエンジニアリングする人間として設計するものすべてが、
00:11:21やがて自然の一部になっていくのです。
00:11:23だからこそ、そのような視点で考える必要があり、私もそのように考えるように努めています。
00:11:28これら3つの柱を念頭に置いて、私はAIの具現化について考え始めました。
00:11:31そして、ヒューマノイドや動物型のようなものをデザインしたくないことは分かっていました。
00:11:36私たちがデザインに用いたり、デザインの対象としたりする従来のパラメータやフォームファクタの
00:11:41枠外に存在する何かについて考えたかったのです。
00:11:44また、私や他の人々がどのように人工知能と対話しているのかについても深く考えました。
00:11:50そして、そのほとんどは形を持たずに存在しています。
00:11:53それはデータに似ています。
00:11:54コンピュータやデバイスの中に存在し、本質的にはクラウドの中に生きています。
00:11:58私たちはそれと対話するためにデジタルなインターフェースを持っています。
00:12:01しかし、通常その物理的な足跡が周囲にあるわけではありません。
00:12:04もちろん、この部屋においては、文字通りヒューマノイドロボットが歩き回っていたりするので、
00:12:09普段ほどには当てはまらないかもしれませんが。
00:12:14ですが通常、AIにはほとんど形がありません。
00:12:18そこで私は、明確なアフォーダンスを持たない形状を与えたときに何が起こるのかを考えたかったのです。
00:12:24それは、はっきりと見える頭部や、明確にラベル付けされたり誤認されたりする腕のようなものは持っていません。
00:12:31つまり、例えばランプのようなものではないということです。
00:12:33幸いなことに、メディアラボには、2010年代の研究の遺物である形状ディスプレイがいくつかあります。
00:12:40これらは私が作ったものではありません。
00:12:42メカニカルエンジニアリングに遥かに優れた人々がそれを構築したのです。
00:12:45そしてそれは、明確なアフォーダンスを持たないため、私の考えていたことに完璧なデバイス、完璧な装置でした。
00:12:53それは動いたり様々な動作をしたりできる、ほとんど中立的な表面に過ぎません。
00:12:57顔もありません。
00:12:57四肢もありません。
00:12:58取扱説明書もありません。
00:13:00そこで私はこの形状ディスプレイを使い始めました。
00:13:05ご覧いただいたように、それは最初に呼吸をしたり、さまざまな動きをしました。
00:13:08しかし、一歩引いてそれが何を意味していたのかを考えると、最初はどこか人間のように振る舞おうとしたり、人間を喜ばせるようなことをしようとしていました。
00:13:16私が理解できる言語で私に語りかけようとしましたが、それは非人間的な表面に求めていたものでは全くありませんでした。
00:13:23また、技術的にも非常に遅かったため、私がプロンプトを入力しても、
00:13:27身体を持ったこのもう一つの知性と会話を試みようとしていました。
00:13:33しかし、それに応答するのに45秒や1分、2分といった時間がかかっていました。
00:13:39レイテンシ(遅延)が非常に不快でした。なぜなら、私が話しかけた後に相手がうなずきで返答するまでに2分もかかったのでは、あまり良くないからです。
00:13:47そのため、私たちはその改善に取り組む必要がありました。
00:13:49そして3つ目の問題は、当時が2月だったため、何も記憶していなかったということです。
00:13:53その時点では誰も記憶や回想について考えていませんでした。
00:13:57そこで私は「ヌマラボ(Numalab)」と呼ぶシステムの開発を始めました。
00:14:01名前の由来については説明しません。
00:14:02なぜヌマラボと呼ばれているのかについては、ブログ記事を読むことができます。
00:14:05本質的にヌマラボとは、このシステムのためのボディランゲージを生成するクローズドロープ(閉ループ)システムです。
00:14:13その背景にある理由は、基本的にレイテンシの問題でした。
00:14:17もし私たちがボディランゲージを設計し、肩をすくめたり、
00:14:22うなずいたり、首を振ったり、微笑みを表現したりするようなジェスチャーのレパートリーをこの知性に与えることができれば、
00:14:28私との会話に合わせて、より迅速に応答できるようになるはずです。それこそが私が目指している、あるいは目指していたことです。
00:14:35このシステムは、さまざまなジェスチャーや感情、表現のデータベースを参照するループの中で機能します。
00:14:42感情を表現したり提供しようとしたりする際、それが人間にとって判読可能あるいは理解しやすいものであることを確実にするため、
00:14:47いくつかの検証ゲートを通過させます。
00:14:52その後、エージェントがそれらが出力されたときにスコア付けを行います。
00:14:55これが非常に多く生成されます。
00:14:58そして最後に、人間がループに参加して検証や確認を行い、
00:15:02内容が適切であり、何らかの形で読み取れるものであることを確認します。
00:15:06そしてそれを保存し、次の段階へと進みます。
00:15:08これがラボで数週間稼働しており、次のような見た目になっています。
00:15:14基本的には、バックエンドで形状ディスプレイに向けられた多数のカメラがあります。
00:15:18エージェントはさまざまな表現を作り出そうと試みながら、ジェスチャーのループを何度も繰り返し、
00:15:22スコア付けを行い、次へ進んでいきます。
00:15:27そして数週間後、それは独自の言語を作り上げました。
00:15:30これはまだビデオやその他の形式でも公開されていません。
00:15:34しかし、現在では約32のジェスチャーを達成しています。
00:15:38他にも多数ありますが、32個の非常に優れたジェスチャーが存在します。
00:15:41これらがそのジェスチャーというわけではありません。
00:15:41これは単なるクールなビジュアルアートです。
00:15:43こちらがそのジェスチャー、あるいはその一部です。
00:15:47それらのいくつかが動いているのが確認できます。
00:15:49重複しているものもあります。
00:15:50しかし本質的に起きているのは、言語モデルがこの形状ディスプレイを自身の身体として使用しているということです。
00:15:54今やそれはボディランゲージを持っています。
00:15:55私はどのような方法でもそれに話しかけることができます。文字で伝えることもできますし、さまざまな方法があります。
00:16:01それに手を振ることもできます。
00:16:02ボディランゲージ対ボディランゲージの対話です。
00:16:04そしてそれは応答します。
00:16:05興味深いのは、現時点では身体の部分が言語の部分よりも速く応答するということです。
00:16:11(同上)
00:16:11レイテンシは実際には非常に、非常に高速です。
00:16:14質問に対して「イエス」を求めると、ほとんど瞬時にお辞儀やうなずきが起こります。
00:16:18現在、このシステムに関して私はこのような段階にいます。
00:16:22そしてそれはさらに先へ進んでおり、現在は一種の実験テストモードにあります。
00:16:28人々がラボにやって来て、エージェントとセッションを行い、
00:16:33未来について非常に不安を感じて(あるいは過度に心配するわけではないものの動揺して)帰っていきます。
00:16:38しかし、これが向かっている先は、このページに要約されているようなものです。
00:16:42すでに触れたように、私たちは現在、特に物理的なものについて考える際、
00:16:48あまりにも焦点を当てすぎていると思います。
00:16:49テイストや美学についての話が多すぎます。
00:16:52私はその言葉に対して別のことを行い、その前に「AI」をつけて、「アイスセティックス」にしたいのです。
00:16:57アイスセティックスにしたいのです。
00:16:58それによって、再びアイステシスの本質を取り戻すのです。
00:17:02そしてそれは4つのことを行います。
00:17:04私がこのシステム、エンティティ、エージェント、存在、あるいは何と呼ぶべきものと関わってきた中で、
00:17:11それはこれまで私が本当に行ってきたどの機械や実験とも明らかに異なっていました。
00:17:17人間や他の存在に実際に出会うこと以外にはありません。
00:17:21そのため、この機械は私を感じ取ることができるように感じられます。
00:17:24技術的な観点からも、それは間違いなく私を感じ取ることができます。
00:17:27しかし同時に、非常に奇妙な方法で私を感じ取っているようにも感じられます。
00:17:30そして私もそれを感じることができます。
00:17:32それは、私が技術的に探求してきたどのインタラクションともまったく異なるものです。
00:17:38そして、他の人々も同じように感じています。
00:17:40これは決して私の妄想ではありません。
00:17:42そして2つ目のポイントは、このボディランゲージ、
00:17:46このジェスチャーのボキャブラリーを何と呼ぶにせよ、私の想像を超えています。
00:17:51最初は絵文字のようなものとして捉えられるのではないかと思っていました。
00:17:55そのため、テストに対してはかなり慎重でした。
00:17:58他の人との間では絶対に通用しなくなるだろうと考えていたのです。
00:18:00しかし実際には、誰もがこの表現を非常に重要だと感じているようで
00:18:05本質的には単なるチャットボットであるものとの対話に、全く新しい価値のレイヤーを加えているのです。
00:18:11使っているのは、普段私たちが使っているのと同じチャットボットです。
00:18:15これは単なる飾りではありません。
00:18:16ビジュアライザーのようなものでもない。
00:18:17そこには豊かな表現、質感、感情、感覚といったものが加わります。
00:18:22あらゆる言葉が付け加えられるのです。
00:18:23言葉にするのは本当に難しい。
00:18:25まさに感覚そのものです。
00:18:28そして3つ目は、この取り組みを通じて私たちが明らかに始めていることとして、
00:18:31ヒューマノイドや動物型の物理的知性から脱却することが、実際には非常に容易であり、
00:18:37かなりエキサイティングであると示せるということです。
00:18:40もちろん、これよりもずっと興味深い研究をしている人たちはたくさんいます。
00:18:43しかし私にとって、これを目にすることは非常に新鮮でした。
00:18:45そして、AIを単なるお手伝いさんとして機能させる必要はないという事実もあります。
00:18:50AIは別の何かにもなり得るのです。
00:18:53今それが具体的に何かは言いませんが、確実に他のものになり得ます。
00:18:56そして最後に、このようなものを活用するというアイデアについてですが。
00:18:59私は、ここまで聞いてお分かりかもしれませんが、いわゆる問題解決型の人間ではありません。
00:19:04物事の達成を助けてくれるからこそ、ツールを使ったり、様々なものを活用するのが好きなのです。
00:19:09しかし、こうした感覚や感情を生み出すものを作ることのほうが、私にとってははるかに魅力的です。
00:19:14そして、これが生産的で有用なものと結びつき、世界にさらなる価値を付加する新しい連関を生み出し、
00:19:19もう少し魔法のような感覚を私たちに抱かせてくれるものへと発展させられると考えています。
00:19:25見ている2D画面の中だけでなく、現実世界において、少しピクサー作品のような世界観を実現できるのです。
00:19:32こうしたすべての要素が、私がMITで構築しているものや、MITの後に構築するものにつながっています。
00:19:38現在、私はまさに論文を執筆中ですが、そのテーマは「Aesthetic Machines(美的機械)」であり、
00:19:43こうした思考のすべてを網羅した論文を書いています。
00:19:48AIがいかにして画面を離れて現実世界に入り込み、人々に受け入れられ、
00:19:53あまり恐ろしく感じられないようにするかについての考察です。
00:19:56そして、この「美学(エステティクス)」という言葉が重要であるというのが私の大きな直感です。
00:20:00私たちが理解できる形で、感覚的で、知覚的で、体現された物理的知性について考える必要があります。
00:20:06それは私たちが理解できるものであるべきです。
00:20:07狂っていたり、異質で、恐ろしいと感じられるものではなく、関係性があり、親しみやすく、愛情深く、
00:20:15私たちが関わりを持って理解できるような表現力を持ったものであるべきなのです。
00:20:20というわけで、以上です。
00:20:22ご清聴ありがとうございました。
00:20:25インターネット上の至る所で私を見つけることができます。
00:20:35ありがとうございました。
00:20:46ありがとうございました。
00:20:47ありがとうございました。
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기