ロボティクスは70年間停滞している — ディーパック・パタック、Skild AI

Transcript

00:00:00ここにいる皆さんは、ここ5年間でAIが
00:00:15どれほど進歩したかご存じでしょう。
00:00:17この数年の進歩は、過去100年分を超えるように思えます。
00:00:22そして今、特にAIの分野で何が起きているかというと、
00:00:24AIは言語、音声、オーディオ、そして動画へと展開してきました。
00:00:28誰もが次に期待しているのはロボット工学です。
00:00:32なぜか今年、この期待感は最高潮に達していますが、
00:00:37私にはまだ少し理解を超えています。
00:00:40また、ジェンスン・ファン氏のようなリーダーたちが
00:00:43ロボット工学の次のフロンティアとして物理AIについて語るのも見られます。
00:00:46そのため、TwitterやLinkedInを開くと、
00:00:49まるでロボットがすでにここにあるかのように感じられます。
00:00:51そして、多くの人が言うように、12月頃には家庭用ロボットが
00:00:56私たちの家にやってくるかのようです。
00:00:58しかし私がここで強調したいのは、ロボット工学は
00:01:03過去70年間にわたってずっと「ここにあった」ということです。
00:01:06さて、ここ4、5年でロボット工学に関わり始めた皆さんは、
00:01:10ロボット工学のコースを何か受講してみてください。
00:01:14そして、30年前のロボットの映像と今日のロボットの映像を
00:01:17見分けられたら、夕食をごちそうしましょう。
00:01:23例として、このロボットを見てみましょう。
00:01:26ここに映っているのは画像です。
00:01:27このロボットの目的は、ブロックのこの画像を見て、
00:01:31目の前にあるブロックを配置することです。
00:01:34画像と同じパターンになるように並べます。
00:01:37いいですか?
00:01:38これは非常に単純な作業です。
00:01:40しかし考えてみると、これは3Dのブロックです。
00:01:42両側から3Dを認識し、理解しなければなりません。
00:01:44そしてロボットはこれをかなり正確に行うことができます。
00:01:47この成果がどれくらい古いものか、予想はつきますか?
00:01:51どなたか?
00:01:51推測で構いません。
00:01:52どんな予想でもどうぞ。
00:01:53えっ?
00:01:5440年。
00:01:55なるほど。
00:01:55それが一番高いですか?
00:01:59これは1960年代のものです。
00:02:01コンピューターが存在するよりもずっと前の時代です。
00:02:03いいですか?
00:02:04これはMITコピーデモと呼ばれるものです。
00:02:06これが始まったのは――
00:02:09ご存じの今日のAIよりもさらに前の時代です。
00:02:12こちらも見てください。
00:02:17フィラデルフィアでの原子力会議でのある展示には、
00:02:19人気を集めるための完璧な方式がありました。
00:02:21ここで何が起きているかというと、裏にいる人物が
00:02:24これらのロボットを制御している、リーダーフォロワーシステムです。
00:02:27そして、主要な研究室や企業、
00:02:31大学の研究室がどのようにデータを取得しているかを見ると、
00:02:33彼らは遠隔操作システムを使用していますが、それは
00:02:35全く同じ原則に従っているのではないでしょうか?
00:02:38この映像の年代について何か予想はありますか?
00:02:40電子機器の熟練した操作者が――
00:02:42さて、皆さんは年代について積極的に訂正したくなるでしょう。
00:02:45しかしこれは1957年のもので、68年前のものです。
00:02:49いいですか?
00:02:51家族の中で、より年上の人に聞いてみてください――
00:02:53実際には、もう存命ではないかもしれません。
00:02:55なぜならこれは――
00:02:5780歳くらいの人に尋ねる必要があります、
00:02:59当時、技術の状況はどうだったかと。
00:03:02たとえばRAMの場合、わずか数キロバイトのRAMのために部屋ほどの大きさの、
00:03:06このような大規模な装置が必要でした。
00:03:07そして、そのような時代の人々がこれを機能させることができたのです。
00:03:11それだけでなく、どの十年代を振り返ってみても、
00:03:14映像はどれも素晴らしいものです。
00:03:15例えばここにいるロボット、ヒューマノイドがジャグリングをしたり、
00:03:18人間とテーブルサッカーをしたりしています。
00:03:21これらもすべて、ディープラーニング以前のものです。
00:03:25これは8年前のものです。
00:03:26ですから、このロボットはバークレーの成果で、
00:03:29テーブル全体を片付け、箱の中にアイテムを整理することができます。
00:03:33これは1人の大学院生が単一のGPUマシンで行ったものです。
00:03:36それ以上のものは何もありません。
00:03:37いいですか?
00:03:38さて、この映像――もしこれまでのビデオをすべて色彩豊かにし、
00:03:41生成AIのフィルターで現代の声を当てたとしたら、
00:03:45これが1965年の映像なのか、
00:03:49今日の映像なのか分かりません。
00:03:50しかも、これらは最も古い結果でさえないのです。
00:03:52最も古いものは1940年代にまで遡ります。
00:03:54いいですか?
00:03:55過去70年間を振り返ってみると、何が起きているでしょうか。
00:04:00他のあらゆる技術、他のあらゆるテクノロジーは
00:04:02はるか遠くへと進歩しました。
00:04:04言語理解、コンピュータビジョン、携帯電話、チップなどです。
00:04:08なぜロボット工学だけがこれほど長い間、原始的な時代のままなのでしょうか?
00:04:11その理由は、汎用的な頭脳がないからです。
00:04:14ロボット工学は常に、ゼロからハードウェアの
00:04:17問題としてアプローチされてきました。
00:04:18これが、ロボット工学の周辺のあらゆるものは進歩したのに、
00:04:21ロボット工学自体は過去70年間、同じ場所に
00:04:24取り残されている理由なのです。
00:04:25ここで、「モラベックのパラドックス」と呼ばれる非常に有名なパラドックスがあります。
00:04:27モラベックをご存知かどうかは分かりませんが、
00:04:29彼はCMUの教授であり、私もCMUの教授です。
00:04:32ですから、彼の言葉を引用しなければなりません。
00:04:34彼はAIの創設メンバーの一人でした。
00:04:36ロボット工学に30年間携わった後、
00:04:39彼は非常にシンプルな結論に達しました。
00:04:41難しいことは簡単である。
00:04:42簡単なことは難しい。
00:04:43いいですか?
00:04:44人間が難しいと信じていたことは、
00:04:45コンピュータにとっては極めて簡単であり、その逆も然りです。
00:04:49そして、それはまさに目の前で起きています。
00:04:51数学を解くのは難しいと言うでしょう。
00:04:53国際数学オリンピックの金メダルは本当に、本当に難しい。
00:04:56階段を登ることは?
00:04:57それは超簡単でした。
00:04:59テクノロジーの現在地を見回してみてください。
00:05:01何が解決されていて、
00:05:02何が解決されていないのか。
00:05:04これがロボット工学の現状です。
00:05:05AIの単なる別の応用例ではありません。
00:05:09それこそが、AIが最初に創立された理由でありながら、
00:05:12ほとんど進歩が見られなかった分野なのです。
00:05:14これは、ディープネットワークが参入して
00:05:15攻略できるような単なる別の応用例ではありません。
00:05:18ゼロから根本的な第一原理に基づいて考える必要があります。
00:05:22ゼロから構築するのです。
00:05:23これは非常に有名な例ですが、
00:05:2590年代にコンピュータがチェスでガルリ・カスパロフを打ち負かした一方で、
00:05:29チェスの駒を拾い上げてボード上に並べることができる
00:05:34コンピュータやロボットは、
00:05:36まだ存在しないということです。
00:05:37それでは、これをどのように解決していけばよいのでしょうか?
00:05:43もう少し前向きな話をすると、私たちにはAI成功のための秘伝のソースがあります。
00:05:47そうですよね?
00:05:49ビッグデータセットを集め、
00:05:51大規模なモデルをトレーニングする。
00:05:52そうすれば魔法が起きるのです。
00:05:54さて、このテンプレートが多くのトピックで非常にうまく機能していることはわかっています。
00:05:57では、同じレシピをロボット工学にも適用できるでしょうか?
00:05:59データがないため、直接は適用できません。
00:06:02ロボット工学のデータに関するインターネットが存在しないのです。
00:06:06そして先ほど言ったように、
00:06:09テレオペレーションと呼ばれる方法でロボットのデータを
00:06:12手動で収集することもできます。
00:06:14お気づきのように、テレオペレーションは最近始まったものではなく、
00:06:1868年か70年の歴史があるものです。
00:06:21面白いことに、振り返ってみると、
00:06:24GPT-3やGPT-4モデルの全体の進化の歴史を見ても、
00:06:283年前のGPT-3に遡ってみてください。
00:06:31まるで何年も前のことのようです。
00:06:33GPT-3が機能し始め、人々の注目を集めたのは、
00:06:36数兆ものトークンでそれらのモデルをトレーニングできるようになってからでした。
00:06:40当時のGPT-3ですら30兆を超えるトークンを使用しており、
00:06:42今日では数百兆ものトークンが使われています。
00:06:44もしテレオペレーションで手動でデータを収集する場合、
00:06:471つの例を得るのに約1分かかります。
00:06:49計算してみてください。
00:06:50全米の人口を総動員したとしても
00:06:53GPT-3と同等の規模に達するには
00:06:551世紀以上かかります。つまり…
00:06:59今やGPT-3を使う人はいません。
00:07:00ですよね?
00:07:01つまり、非常に遅くてコストがかかるのです。
00:07:02ロボット工学において、ロボットの規模を
00:07:05本当に拡大できた人はまだいないと言えます。
00:07:07ロボット工学のスケールについて語るには、まだ程遠い状況です
00:07:10ロボットのスケール化とは、まだ程遠い状況です。
00:07:14いいですか?
00:07:14そこで私たちが注力してきたのがこの点です。
00:07:17Scaledの創業は約3年前ですが、
00:07:19私はこの問題に1所以上取り組んできました。
00:07:22私のキャリアのすべてがこれです。
00:07:24他には何もしていません。
00:07:26当社の仮説は、
00:07:27「全身体知能(オムニボディ・インテリジェンス)」の構築です。
00:07:32どんなロボットでも、どんなタスクでも、頭脳はひとつ。
00:07:35いいですか?
00:07:36ロボットはヒューマノイドでもいい。
00:07:37四足歩行ロボットでもいい。
00:07:38コンベアベルト上のロボットアームや多関節ハンドでもいい。
00:07:41そんなことは本当にどうでもいいのです。
00:07:42この仮説でさえ、人間が持つ能力よりも
00:07:45はるかに汎用的であると言えます。
00:07:48人間は自分の身体しか制御しませんから。
00:07:50では、なぜそこまで汎用性を追求するのか?
00:07:51その理由は、ロボット工学においては
00:07:54そもそもデータが存在しないからです。
00:07:56だから、どのハードウェアのデータを使うか選り好みしている余裕はありません。
00:07:59あらゆるハードウェア、あらゆるタスク、
00:08:02あらゆるシナリオのデータを使えなければなりません。
00:08:04それこそが、3年前に言語モデルが
00:08:063年前に言語モデルが達成したようなスケールを
00:08:10真に実現するための唯一の方法なのです。
00:08:13頭脳はひとつ」というコンセプトです。
00:08:15この講演を通じて、これがロボット工学の
00:08:16進むべき道である理由を、きっと納得していただけると思います。
00:08:20いいですか?
00:08:20以上が簡単なイントロダクションです。
00:08:23詳細に入る前に、
00:08:24まずはティーザー映像をお見せしましょう。
00:08:28この映像に出てくるロボットはすべて
00:08:31異なる企業の、異なるハードウェアです。
00:08:34それらすべてがひとつの賢い頭脳によって制御されています。
00:08:37階段を昇り降りするヒューマノイドであれ、
00:08:39あらゆるシナリオに対応しています。
00:08:42これらは最近の成果というわけではなく、
00:08:432、3年ほど前の成果が含まれています。
00:08:47外乱に対しても頑健です。
00:08:51新しいシナリオにもゼロショットで適応できます。
00:09:03つまり、このビデオのロボットはすべて世界中のあらゆる場所で動作し、
00:09:08その背景にある頭脳が向上していくのです。
00:09:11全身体の頭脳だからこそ。
00:09:13そう、これは本当に難しいことですよね?
00:09:15卵を扱うような作業もうまくこなせますから。
00:09:16これが私たちの取り組んでいることのティーザーです。
00:09:17(※映像の演出部分)
00:09:33今回は企業の宣伝ではなく、より科学的で
00:09:38有益な講演にしたいと考えています。
00:09:39ロボット工学でデータをどうスケールさせるかについてお話ししましょう。
00:09:42人々がこれにどう取り組んできたか、振り返ってみます。
00:09:45私のこれまでのキャリアを振り返ってみましょう。
00:09:48データに関する私の仮説も長年にわたって変化してきました。
00:09:51研究やスケール化を始めた当初の考え方は、
00:09:55「ロボットのデータは手動で収集できるが、それでは遅すぎる。
00:09:59しかしそれでは遅すぎます。
00:10:00というものでした。
00:10:03そこで「好奇心駆動型探索」というアプローチを取り入れ、
00:10:06ロボットが環境内を好奇心に従って探索できるようにしました。
00:10:10人間が不要で、ロボットが動き回って
00:10:13遊び続け、データを収集できるという優れた点があります。
00:10:15当時、私たちはこれを「プレイデータ」と呼んでいました。
00:10:17力、センサー、関節角度などを含み、非常に豊富なデータです。
00:10:21しかし問題は、それが物理世界に限定されるため、
00:10:24スケールさせるのが非常に難しいという点でした。
00:10:27当時Googleは何百台ものロボットを使ってこれに取り組んでいましたが、
00:10:31Googleにとっても、スケールさせるにはコストが高すぎ、遅すぎました。
00:10:34もうひとつのアイデアが、先ほども言った
00:10:36「遠隔操作(テレオペ)」です。
00:10:38これも古いアイデアですが、やはり同じ問題を抱えています。
00:10:39ロボットだけでなく人間も必要になるため、
00:10:42スケールさせるのが不可能で、
00:10:43さらにコストがかかるのです。
00:10:45そして多様性も非常に限られています。
00:10:46人間と一緒にロボットを1つのセットアップに配置すれば
00:10:501,000件の例が得られるかもしれませんが、
00:10:51それらはすべて同じ環境でのものになってしまいます。
00:10:53理想を言えば、毎日ロボットを新しい家庭や
00:10:57新しいシナリオに持ち込みたいところですが、
00:10:58それはどう考えてもスケールさせるのが不可能に難しい。
00:11:01その後、シミュレーション学習において
00:11:03大きなブレイクスルーがありました。
00:11:04深層強化学習をシミュレーションで訓練し、
00:11:08実際のロボットに転移させられることを示した
00:11:12最初の成果のひとつです。
00:11:13当時、これは受賞歴のある論文となりました。
00:11:16現在では、あらゆるヒューマノイドや企業で使われています。
00:11:20これはバークレー校とカーネギーメロン大学の研究室の成果です。
00:11:23しかし、ここにもやはり長所と短所があります。
00:11:25スケールさせるのは非常に簡単ですが、
00:11:27多様性を得るのが難しいのです。すべてのシーンを
00:11:29シミュレーション上で手動で構築しなければならないからです。
00:11:31ここまで聞いてお気づきの通り、
00:11:34ひとつの決まった答えがあるわけではありません。
00:11:35単一の解決策など存在しないのです。
00:11:39これは私たちが以前に行った別の研究です。
00:11:41すべてScaled創業前の話です。
00:11:43人間の動画からの学習です。
00:11:44人間が何かをするのを見て、ロボットがそれを模倣する。
00:11:47この方法は多様性が高く、
00:11:48YouTubeなどの動画を使えるため、
00:11:50非常に高い拡張性があります。
00:11:51しかし、ロボットの動作からはかけ離れているため、
00:11:54データとしては質が非常に低いものになります。
00:11:57では、ここでの解決策は何でしょうか?
00:11:59万能な近道など存在しないということです。
00:12:01さまざまな特徴の文脈から
00:12:05データを考える必要があります。
00:12:06私の考えでは、ロボット工学で重要な特徴は
00:12:09たったの3つしかありません。
00:12:12「拡張性」「多様性」、そして「ロボットの関節角度にどれだけ近いか」です。
00:12:15(※同上)
00:12:18拡張性とは、さまざまなシナリオに素早くスケールできるか。
00:12:22多様性とは、多様なデータを取得できるかということです。
00:12:25100兆個のトークンがあっても、それらがすべて
00:12:27同じ環境や同じシナリオのものであれば、
00:12:29まったく役に立ちませんから。
00:12:32そしてロボットへの近さとは、ロボット自身の関節角度という
00:12:35グラウンド・トゥルース(真値)にどれだけ近いかということです。
00:12:38シミュレーションを見てみると、拡張性は高く多様性は低いが、ロボットへの近さは中程度です。
00:12:42(※連続する解説)
00:12:44人間の動画は拡張性と多様性は非常に高いものの、
00:12:46ロボットのデータからはかけ離れています。
00:12:47人間からロボットへのマッピングを学習しなければならないのです。
00:12:49残りの2つ、遠隔操作とマニピュレーション用インターフェースは
00:12:52ちょうどその中間くらいに位置します。
00:12:54ご覧のとおり、現在世界中のさまざまな企業が
00:12:57これらのアプローチのいずれかに注力しています。
00:12:58そのほとんどは遠隔操作やYumiのセットアップに偏っており、
00:13:01それ以外の方法に取り組んでいるところはごくわずかです。
00:13:05(※文脈の続き)
00:13:07しかし、万能な正解というものはありません。
00:13:09それぞれに欠点が存在します。
00:13:11ですが、希望の光は、それらが互いに
00:13:15補完し合えるという点です。
00:13:16互いの欠点がそのまま完全に一致しているわけではありません。
00:13:19(※同上)
00:13:20私たちが長年かけてたどり着いたレシピは、
00:13:24トレーニングを「事前学習」と「事後学習」の
00:13:272つに分けるという気づきでした。
00:13:29驚くようなことではないかもしれませんが、
00:13:30ではどうやって事前学習を行うのでしょうか?
00:13:31事前学習を行うにはデータが必要ですが
00:13:32それは拡張性と多様性に優れ、品質は低い場合があります
00:13:35つまりシミュレーションや人間の動画などです
00:13:37それが事前学習の方法です
00:13:39そして事後学習には、遠隔操作のデータを使用します
00:13:42では、遠隔操作データとは何でしょうか?
00:13:43非常に高品質ですが、量は少ないということです
00:13:47高品質で、量が少ない。
00:13:48それは言語モデルのレシピを正確に思い起こさせます
00:13:51インターネット上のデータで事前学習を行います
00:13:53その後、コーディングや自社向けなどのために事後学習を行います
00:13:59しかしロボット工学には、もう一つの要素があります
00:14:00それがデプロイメントデータです
00:14:02そしてデプロイメントデータは、展開が進めば
00:14:05非常に高い拡張性を持ちます
00:14:07そのため時間の経過とともに、このデータがすべてを凌駕していくでしょう
00:14:11そして私たちが構築しようとしているのは
00:14:14いわゆるデータフライホイールであり
00:14:16事後学習時のこのデータを取得して
00:14:18再び事前学習に組み込むものです
00:14:20これで、なぜ全身体の脳というこのアイデアが
00:14:23極めて重要なのかがおわかりでしょう
00:14:25世界中のあらゆるタスクにおいて、たった1つのロボットや
00:14:28たった1つのバージョンのみが永久に配備されるとは考えにくいからです
00:14:32ハードウェアのどの分野においても、チップを除いてこれはあり得ません
00:14:36チップは製造が非常に難しいためです
00:14:38それでもチップにおいてさえ、現在多くの企業から
00:14:40推論用チップが次々と登場しているのが
00:14:42おわかりいただけるでしょう
00:14:43したがってハードウェアにおいて、これが当てはまることは決してありません
00:14:45ロボットのバージョンや形が1つだけということはなく
00:14:48それが、全身体知能が私たちが言うところの
00:14:50デプロイメントデータフライホイールの実現要因となる理由です
00:14:56それでは、いくつかの結果を非常に手早く見ていきましょう
00:14:58この脳は極めて汎用性が高いため
00:15:00多様なタスクを非常に迅速にこなすことができます
00:15:03洗濯物の畳み方などの多くのタスクを見たことがあるかもしれません
00:15:06何であれ
00:15:07なぜかシリコンバレーで非常に人気のあるタスクです
00:15:10ここで言いたいのは、Tシャツを畳んでいるときに
00:15:14手を1センチでも外したら、Tシャツの畳みがめちゃくちゃになるなんて
00:15:18考えたことがいつありますか?
00:15:22そんな風には考えませんよね
00:15:23人は畳むときに考えてすらいません
00:15:25適当につまんで
00:15:26何かしら作業するだけです
00:15:27つまりエラーに対する許容範囲が、極めて、極めて高いのです
00:15:31では、なぜこのタスクが難しいのでしょうか?
00:15:35なぜ人々は、このタスクが難しいと
00:15:38思い込まされているのでしょうか?
00:15:39別の言い方をしましょう
00:15:42布ですね
00:15:43なぜ布は難しいのでしょうか?
00:15:46シミュレーションですが、誰もシミュレーションなど使っていません
00:15:48これはすべて遠隔操作によるものです
00:15:49なぜこれが難しいのでしょうか?
00:15:51なぜ難しいかわかりますか?
00:15:52従来のロボット工学にとっては難しいからです
00:15:56従来のロボット工学では、物理法則全体をモデル化し
00:15:59手作業でモデルを作成してから処理を行っていました
00:16:01それだと非常に困難なのです
00:16:02しかしディープラーニングベースのロボット工学にとって
00:16:04これは最も簡単なタスクと言えます
00:16:06エラーの許容範囲が広いためです
00:16:08そのため完全に――
00:16:09現在、非常に多くの企業がこのタスクに注目しています
00:16:12では何が難しいかというと
00:16:13例えばこのようなタスクです
00:16:17この動画を見る前に、皆さんにお聞きしますが
00:16:19手を使わずにこのタスクを実行することは可能でしょうか?
00:16:22おそらく半数の人は無理だと答えるでしょう
00:16:24なぜなら
00:16:25AirPodsをなくしたことがある人はどれくらいいますか?
00:16:29うちの会社には「右のAirPods」というチャンネルがあります
00:16:30みんな右のAirPodsを
00:16:32なくしてばかりだからです
00:16:34さてこの場合、ロボットには手がありません
00:16:36グリッパーがあります
00:16:37そのため、ここではグリッパーにとってこのタスクは非常に困難です
00:16:41アームが動いて自身の向きを調整し
00:16:43AirPodsを正しい方法で
00:16:46掴む必要があるため、より高度な知性が求められます
00:16:49挿入できるようにするためです。グリッパーは
00:16:52このようにしか閉じることができません
00:16:54グリッパーに対して平行です
00:16:55そのため、最後の段階でAirPodsの向きを変えることはできません
00:16:59ここでご覧いただいているのは、本物のAirPodsではありません
00:17:02Temuで買った1個5ドルや10ドルの偽物です
00:17:05そのため中には磁石が入っていません
00:17:07磁石が簡単に引き寄せてくれないため、ロボットは適切に中へ収めるために
00:17:11本当によく努力しなければなりません
00:17:13これらはすべて偽物なのです
00:17:15これは動画で見えるよりもさらに難しい作業です
00:17:17また、裏で汎用的な脳を構築すれば
00:17:23実際の微調整データをテレオペレーション時に用意することなく
00:17:26多様な人間の動画から学習させることも
00:17:28可能になります
00:17:29このシナリオでは、私たちが行ったのは
00:17:31このような人間の動画、一人称視点の動画で学習させることです
00:17:34現在、これをより三人称視点の動画へと移行させようとしています
00:17:38そして三人称視点でも機能すれば、YouTubeや
00:17:40あらゆるオープンソースデータから学習できるようになります
00:17:43このケースでは、動画を見てから
00:17:451時間未満のロボットデータを追加しています
00:17:47非常に素早い移行です
00:17:50そしてヒューマノイドへと移行させることができます
00:17:53さて、これらには手があります
00:17:54手があるかないかは大きな議論の的です
00:17:57人々はよく、ロボット工学がまだ普及していない言い訳として手を用いますが
00:18:00実際はそうではありません
00:18:02常に重要なのは裏にある知性です
00:18:07現在、私たちは手を配備していません。なぜなら
00:18:09工場で配備できるような利用可能な手が存在しないからです
00:18:12どれを選んでも100時間以内に壊れてしまいます
00:18:14どれでもいいので
00:18:17もしより良い手があるなら
00:18:19テスト用に今すぐ10台購入したいほどです
00:18:22つまりこれが過酷なシナリオというわけです
00:18:25さて、人間の動きを見ることで多くのタスクを実行できるというアイデアです
00:18:28私たちが非常に少ないデータで、つまり
00:18:311時間未満のロボットデータで作業できる理由は
00:18:33ロボットが自身の頭の中で物事を想像し
00:18:36多くのシナリオに向けて学習を増幅させようとするからです
00:18:39ここでご覧いただいているのは完全に偽の動画です
00:18:42ロボットの夢と呼んでもいいでしょう
00:18:43つまりロボット自身のモデルの内部であり
00:18:45そこでシナリオを想像できるのです
00:18:48したがってこれは実際のデータではありません
00:18:49すべてロボット自身のモデルによる偽のデータです
00:18:52これをより複雑なタスクや
00:18:56さらに低コストなハードウェアに移行させることができます
00:18:57これは卵作り、つまりオムレツ作りのタスクです
00:19:02ここで、このセットアップ全体で約4,000ドルの費用がかかります
00:19:06そのため、世にあるものと比べて非常に安価なアームです
00:19:11そしてお気づきかもしれませんが、このセットアップは安価すぎて
00:19:15センサーすら搭載されていません
00:19:16ここにあるセンサーはカメラのみで、力覚センサーなども一切ありません
00:19:20それでもロボットは、視覚情報から力を必要とするタスクを実行できます
00:19:25もちろん、それが未来だと言っているわけではありません
00:19:26このようにすべきだとは言いませんが
00:19:27センサーは確実に改良されるでしょう
00:19:29しかし既存のセンサーから見ても、私たちの現在地は
00:19:33知性の観点から到達できるレベルには
00:19:36まだまだ遠く及ばないのです
00:19:38ですから、これは今後も発展し続けます
00:19:39こちらはバークレー校での私の指導教官です
00:19:41彼はロボットにそんなことができるとは信じていませんでした
00:19:43ただ1時間ほど立ち尽くしていました
00:19:45そしてロボットはオムレツを作り続けました
00:19:48ここで興味深いのは、これが
00:19:49完全なエンドツーエンドのシステムである点です
00:19:51状態機械なども一切ありません
00:19:53ロボットが卵を作っているのは
00:19:55目の前に空の皿があるからです
00:19:56なぜ画面が揺れているのか分かりません。
00:19:58動画にカットはありません。
00:20:00それは保証します。
00:20:01HDMIの問題です。
00:20:02ですから、お皿をどかすと——
00:20:06すみません、なぜこうなるのか分かりません。
00:20:08そう、ステートマシンはありません。
00:20:10いつロボットが始まり、いつ終わるのか、
00:20:11すべて自動化されています。
00:20:12そして、外乱に対しても非常に堅牢です。
00:20:14物の配置を変えることもできます。
00:20:16これらはすべて、見たことのないオブジェクトを追加したものです。
00:20:20フライパンとガスコンロだけが同じです。
00:20:22他のものはすべて異なります。
00:20:23それでもロボットは動き続けます。
00:20:25このように基本的な堅牢性を得ることができます。
00:20:27これらはすべて10時間未満のデータでトレーニングされています。
00:20:30つまり、この堅牢性を学習するのに非常に少ないデータで済むのです。
00:20:33そしてそれは、背後にある基盤モデルから来ています。
00:20:37時間の都合上、ここは飛ばします。
00:20:39そのため、従来のロボット工学のパイプラインとは異なり、
00:20:42計画やマッピングなどを持つものとは違い、
00:20:44これはエンドツーエンドの脳です。
00:20:46さて、エンドツーエンドはAIの多くの分野で多用される言葉です。
00:20:50しかし、私の言うエンドツーエンドは、本当にエンドツーエンドの意味です。
00:20:53カメラから直接読み取り、
00:20:55モーターに直接電力を加えます。
00:20:59したがって、その間にあるのは、最後の段階でのPID制御を除いて、何もありません。
00:21:02100Hzから500Hzに引き上げるためのものです。
00:21:04しかし、PIDはロボット工学の貢献ではありません。
00:21:06もっと昔のものです。
00:21:07第二次世界大戦かそれ以前にさかのぼります。
00:21:10さて、面白いことに、私たちにとってビジョンは
00:21:13単なる別の入力にすぎません。
00:21:15ですから、それほど奇妙なことではありません。
00:21:17ご覧になったことがあるかもしれませんが、ロボットが
00:21:20ダンスをしたり、空手やカンフー、バク転をしたりする結果をたくさん見てきたでしょう。
00:21:23では振り返って考えてみてください、ロボットが
00:21:27階段を上り下りする映像をいくつ見たことがありますか?
00:21:30ごくわずかです。
00:21:31人型ロボットのトップ企業でさえ、
00:21:34チェックボックスを埋めるためだけに、1つの階段のサンプルを見せただけで
00:21:37それ以上は見せていません。
00:21:39そして人々は、人型ロボットがやってくる、中国対米国だと言います。
00:21:42そのほとんどは、いわばナンセンスです。
00:21:44人型ロボットが階段を昇れなければ、
00:21:47足を持つ意味がどこにあるでしょうか?
00:21:50足があるのはそれが唯一の理由です。
00:21:51これはまさに、モラベックのパラドックスが働いているところです。
00:21:55左側の方が、実はロボットにとってはるかに簡単なのです。
00:21:58バク転やダンスは、ロボットにとってはるかに簡単です。
00:22:01なぜこのパラドックスが存在するのか、
00:22:04もう一段深く考えてみましょう。
00:22:05ロボットがバク転をするとき、
00:22:09知る必要があるのは自分の身体のことだけで、他には何もありません。
00:22:13そうですよね?
00:22:13すべてが既知であるか、完全に観測されている場合、
00:22:17それはコンピューターが得意とするところです。
00:22:20あらゆる可能な設定をシミュレートできるからです。
00:22:25しかし右側は、単に階段を昇るだけでも、
00:22:27まず第一に階段が見えていなければなりません。
00:22:30高さや幅がどれくらいかということです。
00:22:32高さや幅を正確に測定するわけではありませんが、
00:22:34あらゆる外乱に適応します。
00:22:35そしてそれには視覚が必要です。
00:22:36そのため、右側は理解を必要とします。
00:22:38だからこそ難しく、こうした映像を目にすることがないのです。
00:22:40しかし私たちにとっては、単なる別の結果にすぎません。
00:22:42大したことではありません。
00:22:43ですから、この結果を1年半前に発表しました。
00:22:46これを撮影したのは2年半前です。
00:22:48しかし、このロボットはどのようなシナリオにも対応できます。
00:22:52物に躓いたりしません。
00:22:53意図的に物をまたぎます。
00:22:55そして、マッピングやプランニングもありません。
00:22:56周囲の3Dマップを作ることもありません。
00:22:59すべて胴体にあるカメラだけで動作しています。
00:23:02どのようなセットアップ、どのような階段にも配置できます。
00:23:05ここでは早足で進みます。
00:23:07これらは、いわゆる非常階段です。
00:23:11少し変わっています。
00:23:12非常階段は、火災などの緊急時に使用するものです。
00:23:15そして、どの建物でも最も難しいものです。
00:23:17そのため、私たちはそのようなあらゆる環境でテストを行っています。
00:23:20しかし、どこにでも配置できます。
00:23:21階段で妨害しても構いません。
00:23:22大した問題ではありません。
00:23:23これは超人的な能力です。
00:23:25ロボットは引っ張られていることを見ることができないからです。
00:23:27そのため、昇っている最中に引っ張られるというのは、
00:23:29ロボットにとって予期せぬ要因となります。
00:23:31そしてここでも、これらすべてのシナリオで
00:23:33同じモデルが使われています。
00:23:35非常にシンプルです。
00:23:36簡単ではありますが、パルクールは楽しそうに見えます。
00:23:40そして人々はよく、これは、つまり
00:23:45ロボットにはこんなことができるんだと感じます。
00:23:47しかしこれは、先ほどお見せしたものよりもはるかに簡単です。
00:23:51今これらの映像をご覧になっていても、
00:23:53私が簡単だと言っているにもかかわらず、
00:23:55多くの方がこちらの方が印象的だと感じるでしょう。
00:23:57これのトレーニングには30分しかかかりませんが、
00:23:59前のものははるかに時間がかかり、
00:24:01トレーニングもはるかに困難です。
00:24:03したがって、この基盤モデルを使用して、
00:24:06さまざまなタスクに非常に素早く転移させることができます。
00:24:08さて、これは1年半ほど前の
00:24:09非常に古い結果です。
00:24:11LANケーブルの挿入などに関しては、
00:24:13現在では非常に高度なシステムがあります。
00:24:14しかし、私たちはすでにこれらのモデルを
00:24:17さまざまなアプリケーションに展開しています。
00:24:18例えば、データフライホイールを構築するために、
00:24:21最も難しい部分は展開そのものです。
00:24:24ロボット工学を展開する際には、知能やハードウェアのほかに、
00:24:26非常に多くの問題が生じます。
00:24:30これは、アプリ上でChatGPTを展開するのとは同じではありません。
00:24:34さまざまな問題に対処しなければならないからです。
00:24:36この講演の前にSkydioが講演を行ったと思いますが、
00:24:38彼らは展開の難しさについて
00:24:40一日中話すことができるでしょう。
00:24:42そのため、私たちは今すぐ展開を開始し、
00:24:44近い将来にこのデータフライホイールを実現できるようにしなければなりません。
00:24:47私たちが進めている展開の例をいくつかご紹介しましょう。
00:24:49その一例がNVIDIAとの取り組みです——
00:24:51NVIDIAはヒューストンに最初の工場を開設しています。
00:24:54そして、現在使用している彼らのGPUは、
00:24:56すべて米国外、主に台湾で製造されています。
00:24:59そしてそこではすべて手作業で行われています。
00:25:01人間はこうした物を作るのが非常に効率的で、本当に優れています。
00:25:04しかし、ここ米国でコスト、拡張性、スループットを維持することは、
00:25:05しかし、アメリカ国内でこうした作業のコストを維持し、
00:25:08拡張性やスループットを保つのは、
00:25:10この労働力なしでは非常に困難です。
00:25:11そこで私たちは、彼らのためにこのGPUの組み立てを自動化しています。
00:25:15これは NVIDIA GTC でライブデモを行いました。
00:25:19先週すでに工場に導入されており、
00:25:21すでに稼働しています。
00:25:22ですが、私が強調したい興味深い点は——
00:25:25これは非常に伝統的な工場の作業だということです。
00:25:29しかし、セットアップ全体を見ると、
00:25:32極めてランダムで、極めて騒がしい環境です。
00:25:36どの工場や従来のセットアップを見ても、
00:25:38非常に綺麗に保たれています。
00:25:39ここでは、同じ頭脳を持つロボットが
00:25:42非常に精密な作業を行えるだけでなく、
00:25:44あらゆる外乱に対しても非常に高い堅牢性を持ちます。
00:25:46つまり、これらのロボットはもう柵の中にいる必要がないのです。
00:25:50そして、工場のラインにそのまま配置することができ、
00:25:54工場ラインの変更も一切必要ありません。
00:25:56人間の隣で作業でき、人間がいるところには必ず混乱が生じます。
00:26:00いいですか?
00:26:00同じ頭脳を配送アプリケーションにも応用できるのです。
00:26:02ここでは、ロボットがトラックからドアまで荷物を届けます。
00:26:06正面玄関がどこにあるかを見つける必要があります。
00:26:08つまりこれは常識の問題です。
00:26:09移動能力の問題ではありません。
00:26:10当社はすでに多くのパートナーと水面下で協力し
00:26:12パッケージの配送を行ってきました
00:26:15こうした地域の各戸の玄関先への配送です。
00:26:17同じセットアップが
00:26:19倉庫などでも同様に機能します。
00:26:23さて、話を締めくくるにあたり
00:26:26これが全身体に対応したブレインであると述べました。
00:26:29データフライホイールを構築する上で、全身体のブレインを持つことが
00:26:31なぜ極めて不可欠なのか、お分かりいただけたかと思います。
00:26:34しかし、もう一つの利点があります。
00:26:35その利点とは、時間の経過や安全性シナリオに伴って
00:26:38ロボットが故障する可能性があるということです。
00:26:41安全性は、この全身体ブレインの副産物なのです。
00:26:44なぜなら、もし…
00:26:45(少し急ぎ足で飛ばします)
00:26:47オンラインでご覧いただけます。
00:26:48これはすべてオンラインにあります。
00:26:49しかし、これらすべてのシステム、すべてのロボットに
00:26:52同じブレインを搭載することができます。
00:26:55この場合、私たちはこれらのロボットで訓練すらしていません。
00:26:58これらすべてのヒューマノイドやその他のシステムへの
00:27:00完全なゼロショット転移です。
00:27:02ロボットが壊れても、ここでは足が壊れても
00:27:05ミリ秒単位で復旧できます。
00:27:07足が壊れたとき、3本足のロボットは
00:27:10新しいロボットになるからです。
00:27:12つまり、ロボットの形状は実際には問題ではありません。
00:27:14何かが変わっても、ここではロボットの足を無効にしています。
00:27:17わずか3回の試行で2足歩行を学習します。
00:27:21画面で見ているのは、こうしたシステム内で
00:27:24行われているロボットの訓練のすべてです。
00:27:27そのため、数ミリ秒から30秒程度で適応します。
00:27:32一つの例として、車輪で移動しているとします。
00:27:34車輪をロックさせます。
00:27:36すると歩き始めます。
00:27:37これも全身体ブレインのもう一つの副産物です。
00:27:40このようなモデルがあれば、安全性はまったく異なる意味を持ちます
00:27:45ロボットが飛行できるとき…
00:27:46いえ、失礼、ロボットが歩行したり
00:27:49体の半分だけで動作できるときです。
00:27:50ここから残酷なシーンのいくつかは省きましたが
00:27:52ロボットを真っ二つに切断したりもしました。
00:27:54それでも二つの半分に分かれた状態でそれぞれ動作できます。
00:27:57ですが、それについてはYouTubeをご覧ください。
00:27:59私からは以上です。
00:28:00ありがとうございました。

Description

Show a robotics demo from 1957 next to one from today, and most people can't tell which is which. Deepak Pathak, co-founder and CEO of Skild AI and a professor at Carnegie Mellon, argues robotics stalled because it was treated as a hardware problem rather than a problem of building a general brain. Collecting robot data by teleoperation at one example a minute, he calculates, would take the entire US population more than a century to reach GPT-3 scale. Skild's answer is an "omni-bodied" brain: one model for any robot and any task. It's pre-trained on scalable data like simulation and human video, post-trained on teleoperation, and improved by a deployment flywheel. Pathak shows it inserting AirPods with a simple gripper, learning from human video with under an hour of robot data, and cooking omelets on $4,000 arms with only a camera. He explains why climbing stairs is harder than a backflip. He also shows GPU assembly for NVIDIA's Houston factory, and a robot learning to walk on two legs in three tries after its other legs are disabled. Speaker info: X/Twitter: @pathak2206 (https://x.com/pathak2206) LinkedIn: https://www.linkedin.com/in/pathak22 Website: https://www.cs.cmu.edu/~dpathak Related links: Skild AI: https://www.skild.ai Timestamps: 0:00 AI's progress and the robotics hype 1:02 Robotics has been "almost here" for 70 years 1:27 A 1960s block-copying robot 2:17 Teleoperation in 1957 3:57 Why robotics is stuck: the missing general brain 4:27 Moravec's paradox 5:42 There's no internet of robot data 7:22 Skild's thesis: one brain, any robot, any task 8:22 Teaser: many robots, one brain 9:31 How to scale robot data: a career retrospective 12:01 The three properties of robot data that matter 13:21 Pre-training, post-training and the deployment flywheel 14:56 Why laundry folding is actually easy 16:17 The AirPods task 17:21 Learning from human videos 18:36 The robot's "dream": imagined training data 18:56 Cooking omelets on $4,000 arms 20:41 Truly end-to-end: camera in, motor power out 21:21 Why stairs are harder than backflips 24:50 Deployment: GPU assembly for NVIDIA 26:00 Package delivery to the front door 26:25 Safety: adapting when the robot breaks

Community Posts

No posts yet. Be the first to write about this video!

Write about this video