フィジカルAIの次なるボトルネックは「最適な動画の収集」—— Rafael Levi(Bright Data)

AAI Engineer
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00皆さん、こんにちは。ようこそ。私を見るために来てくださった方々、ありがとうございます。ただ
00:00:21ここに立ち寄ってくださった方も、ありがとうございます。楽しんでいただきつつ、新しい発見を提供できればと思います。
00:00:26改めまして、ラファエルと申します。Bright Dataに8年以上勤務しており、弊社ではデータの収集と革新に取り組んでいます。
00:00:38本日は、エージェント的世界モデルの訓練に向けたビデオディスカバリーについてお話しします。それが何であるかは後ほど説明します。
00:00:48では、見て、理解して、行動できるシステムを構築するには何が必要なのでしょうか?
00:00:56AIとは何かは解明され、常に改善が重ねられています。そのあたりはクリアできていると言えますが、
00:01:04難しいのはどのようなデータを提供するのかです。データのないAIはただの箱に過ぎないことは皆さんご存じでしょう。
00:01:13少し歴史を振り返ってみましょう。2022年、Googleは画像と現実世界の行動を用いてロボットを学習させました。
00:01:25その後飛躍的な進歩があり、2023年にはAIが実際に複数のロボットを制御するようになりました。
00:01:372024年にはオープンソースが登場しました。ここで流れが大きく変わります。オープンソース化によってすべての研究室がAIにアクセスできるようになり、ロボットへのAI搭載が始まりました。
00:01:51そして今、これらのモデルはすでにヒューマノイドロボットを動かしています。ここに展示されているものの多くは遠隔操作ですが、
00:02:00サンフランシスコではWaymoが完全無人で走っています。素晴らしいことですよね。
00:02:07初めて乗ったときは死ぬかと思いましたが、実に快適でした。
00:02:12では、どうやって運転を学習したと思いますか?ドライブレコーダーの映像を学んで自習したのです。
00:02:22すべての車にドライブレコーダーがあります。それをAIに提供すれば、機械の操作方法を理解できるようになります。
00:02:31先ほど申し上げたように、もはや難所はAIではなくデータです。それについて本日お話ししたいのです。
00:02:39対話型LLM向けには何兆語ものテキストがあります。LLMを訓練するためのテキストデータは非常に豊富です。
00:02:49画像生成向けにはラベル付けされた何十億枚もの画像があり、これも膨大なデータベースとなっています。
00:02:56しかしロボティクス向けには約100万本の動画しかありません。ロボットの動作を収めたデータセットは非常に限定的です。
00:03:09そのため、多くの企業は人に報酬を払って動作を録画させています。
00:03:20例えば「ドアを開ける様子を録画して」とか「椅子に座る様子を録画して」といった形です。
00:03:28しかし問題は、指示されて行動するとき人は不自然になってしまう点です。
00:03:34私はこれを「指示された行動」と呼んでいます。ドアの開け方を録画するよう指示され、誰かのためにそれを行う場合、
00:03:40普通に家に入る時とは違った動きになります。動きの質が全く異なるのです。
00:03:45では、そのデータはロボットの訓練に適しているでしょうか?私の仮説ではノーです。バイアスがかかったデータであり、望む結果を得られません。
00:03:53直感的な動きを学んだ場合ほど、ロボットは効果的に機能しないでしょう。
00:03:59スライドにいくつか例を挙げました。
00:04:06人工的に作られたデータは、自然に撮影されたデータとは異なります。
00:04:12また、カメラを向けられると人は全く違う行動をとります。
00:04:16カメラ嫌いな人もいるように、カメラを向けられた瞬間に普段と変わってしまうのです。
00:04:23しかし現実世界においては、まったく別物になります。
00:04:27これこそが、私たちBright Dataが解決しようとしている課題です。
00:04:35では、なぜ従来のデータソースでは不十分なのでしょうか?
00:04:37シミュレーションは安価ですが、誰もがゲームで遊んでいるように、
00:04:44ゲーム内の物理演算は惜しいところまでいっていますが、ロボットを訓練するには不十分です。
00:04:50手動操作、つまり人がロボットを遠隔操作する方法は可能ですが、1日に何時間録画できるでしょうか?
00:04:57大規模なデータを得るために、一体どれだけの人手が必要になるでしょうか?
00:05:01毎日8時間録画したとしても、
00:05:041年でどれほどの時間数を確保できるでしょうか?
00:05:07現実的に拡張性はありません。
00:05:09そして既存のデータセットもありますが、先ほど言ったように小規模です。
00:05:13現時点では約100万本の動画しかありません。
00:05:15では、代替案は何でしょうか?
00:05:17代替案はウェブです。
00:05:20YouTubeについて考えてみましょう。
00:05:22YouTubeにはどれくらいの動画がありますか?
00:05:25おそらく50億本くらいでしょうか?
00:05:28それらの動画の中に、ロボットが再現できる行動がどれだけ含まれているでしょうか?
00:05:34少し考えてみてください。
00:05:35一人称視点でドアを開ける人の動画はどれくらいあると思いますか?
00:05:42何百万時間もあります。
00:05:43驚かれると思います。
00:05:45ウェブ動画には毎日、重力や動きが映し出されています。
00:05:53因果関係も示されており、事故などは最大の因果関係の例です。
00:06:00人が物体を扱う様子など、何十億時間分も存在します。
00:06:04ロボットにとって素晴らしい訓練素材ですが、何が問題なのでしょうか?
00:06:08問題はノイズが非常に多いことです。
00:06:12例えばこのようなケースです。
00:06:14Metaが訓練したAIモデルの一つでは、約100万時間の現実世界の動画を与えました。
00:06:21そして、実際のロボットを制御するために必要だった実機データは、わずか62時間分でした。
00:06:29考えてみてください。データは公開情報から収集されたものです。
00:06:33ランダムな映像で訓練を受けたロボットは、わずか62時間のロボットデータで動くようになりました。
00:06:41シミュレーション不要で、自律型ロボティクスを迅速に実現できたのです。
00:06:52しかし、動画自体にはロボットの動かし方は映っていません。
00:06:54人がコップに水を注ぐ映像がロボットにどう役立つのか、疑問に思うかもしれません。
00:07:01実は、動画内の行動をAIが識別し、学習するための手法が存在します。
00:07:09フレームごとに2つのコマを比較し、AIが動きの差分を測定するのです。
00:07:15画像Aと画像2があり、その2枚の間で小さな動きの変化が生じているとします。
00:07:21AIはその変化を測定することができます。
00:07:24動画全体でこれを繰り返すことで、AIは角度や距離など、
00:07:30ロボットの訓練に必要なあらゆる情報を割り出すことができます。
00:07:34そのため、必ずしもセンサーデータが必要というわけではありません。しかし当然ながら、YouTube等から
00:07:41ダウンロードした動画や抽出したデータだけでは、100%満足のいく結果が得られるわけではありません。
00:07:48その上に追加の処理を施す必要がありますが、それらは利用可能な状態にあります。
00:07:53技術はすでに存在しており、あとは処理するだけなのです。
00:07:58事例をいくつか追加でご紹介します。
00:07:59例えばNVIDIAがCosmosロボットを訓練する際、動画の約96%を破棄しています。
00:08:07どういうことでしょうか?
00:08:09100万時間の動画をダウンロードしても、
00:08:12実際に役立つのはわずか4%に過ぎません。
00:08:15残りはすべて捨てられます。
00:08:16計算資源の無駄であり、
00:08:18帯域幅の無駄であり、
00:08:19ストレージの無駄です。
00:08:21巨額の資金の無駄遣いに他なりません。
00:08:23また、Stable Video Diffusionはダウンロードした動画の74%を破棄しています。
00:08:30Bright Dataではこの問題を解決し、さらに一歩先へ進めようとしています。
00:08:37私たちが提案するのは「まず検索し、次に収集する」というアプローチです。
00:08:41動画にインデックスを付け、特定の行動を検索できるようにしています。
00:08:50ドアを開ける人の例が出ましたので、この例を続けましょう。
00:08:55当社のプラットフォームでは、詳細な情報を入力することができます。
00:09:01「皿を洗う人」「Tシャツをたたむ人」などのクエリです。
00:09:06すると、それらの行動が含まれる動画のスニペットが提供されます。
00:09:13これが意味することとは何でしょうか?
00:09:16データ収集における無駄が減るということです。
00:09:22ストレージと帯域幅の無駄が削減されます。
00:09:25仕組みについてもう少し詳しく説明します。
00:09:27まず、探している条件を指定します。
00:09:32あらかじめインデックス化された何十億もの動画を検索します。
00:09:36キーワードではなく「行動」で検索するのです。
00:09:39そして、すぐに使えるクリップを提供します。
00:09:43もちろん、訓練用に準備された状態になっています。
00:09:47あとは動きや距離センサーなどのために少し処理を加えるだけです。
00:09:52これでロボットに取り込める状態になります。
00:09:57当社のプラットフォームでの実際の動作を示す短いデモ動画があります。
00:10:02再生ボタンを押してみます。見つかるかな。
00:10:07「シンクで手洗いで食器を洗い、お皿の油汚れを落とす人物、
00:10:12スポンジと洗剤を使用、すすぎと水切りラックへの配置を含む、手元のアップ」
00:10:19現在、何十億もの動画から検索が行われています。
00:10:24この映像は少し古いものです。
00:10:26この動画の時点では1億本程度でしたが、現在は11億本に増えています。
00:10:31皆様の時間を無駄にしないよう少し倍速にしていますが、
00:10:35人が皿を洗っている動画のクリップが提供されます。
00:10:41検出されたすべての動画がここに表示されます。
00:10:47動画の中には皿洗いと直接関係ないものもあります。
00:10:50キッチン掃除の動画かもしれませんし、
00:10:52別の作業の動画かもしれません。
00:10:54別の例も見てみましょう。
00:10:55例えば「様々な種類の服をたたむ人」です。
00:10:59ね?
00:10:59もう少し詳しい説明ですね
00:11:01詳細に記述するほど、得られる結果も的確になります。
00:11:06こちらも少し倍速にしています。
00:11:08見てみましょう。
00:11:14あらゆる対象に適用できることをご理解いただきたいです。
00:11:16メイクをしている人物や、
00:11:17自社ブランド製品が露出している動画を探したい場合など、
00:11:21そうした用途にも活用できます。
00:11:23服をたたんでいる人々が確認できますね。
00:11:26これで、服のたたみ方をロボットに学習させることができます。
00:11:34もちろん、すべてAPI経由で利用可能です。
00:11:36手動での作業を前提とはしていません。
00:11:39ですよね?
00:11:39APIを使って実行することができます。
00:11:41該当動画のスニペットとURLが返されます
00:11:46元動画を見たい場合は リンクも用意されています
00:11:49重要なのは ロボットの学習に必要な動画スニペットを取得できる点です
00:11:57皆さんがロボットの学習を行っているかは分かりませんが
00:12:01どれほど有用か 別の例を挙げて説明しましょう
00:12:04例えば 自社ブランドをお持ちだとします
00:12:06自社商品がどの動画で実演されているか知りたいとしましょう
00:12:13タイトルは関係ありません 自社製品メインの動画ではないからです
00:12:19ポッドキャストなど 単に誰かが何かを撮影している映像です
00:12:22ですが 女性がメイクをしているシーンがあり
00:12:25机の上に自社ブランドのコスメが映っていたとします
00:12:30これで 自社製品が映り込んでいる全動画を検出できます
00:12:34どのような製品であれ
00:12:35ね?
00:12:35動画タイトルで検索しても見つかりません
00:12:38動画インデックス化により 関心のある具体的なシーンを発見できるのです
00:12:45「木から落ちるリンゴ」など
00:12:47様々なシーンです
00:12:48返されるデータは?
00:12:50タイムスタンプが提供され
00:12:52一致スコアも出力されます
00:12:53検索クエリとの一致度の高さです
00:12:55もちろんフレーム数も分かります
00:12:57探している対象が何フレーム含まれているかです
00:13:03これにより何が変わるでしょうか?
00:13:06大きな変化をもたらします
00:13:07無駄が減るのです
00:13:09何百万時間もの動画をダウンロードする必要はありません
00:13:12関心のある特定の動作だけを
00:13:16正確に取得できます
00:13:20繰り返しになりますが ロボット学習には極めて重要です
00:13:24ノイズは問題やハルシネーションの原因になるからです
00:13:28ですよね?
00:13:29これによりノイズを排除できます
00:13:34何の役に立つでしょうか?
00:13:35ロボットだけでなく 当然自動運転にも有効です
00:13:38例えばWaymoのように
00:13:39ですね?
00:13:40ドライブレコーダーの映像で学習させています
00:13:43YouTubeには何億時間もの映像が存在します
00:13:46ドライブレコーダーの映像です
00:13:47事故映像を見るのが好きな人はいますか?
00:13:49ドラレコが捉えた事故映像です
00:13:52皆さんも一度は見たことがあるはずです
00:13:53ロシアでの荒い運転など
00:13:55ね?
00:13:56これこそが私たちの話している内容です
00:13:58ですよね?
00:13:58動画はすでにネット上に存在しています
00:14:01いいですか?
00:14:01赤信号を無視して走る人
00:14:02赤信号で停車する人
00:14:04左折する車
00:14:05右折する車
00:14:06などなど
00:14:06そのすべてが学習用の非常に有用なデータになり得ます
00:14:11そして他のあらゆる世界モデルや
00:14:13物理法則にとってもです
00:14:14そうですよね?
00:14:14ロボットは物理を理解する必要があります
00:14:16重力とは何か
00:14:18どう座るか
00:14:18どう歩くか
00:14:19どう動くか
00:14:21もちろん事前録画することも可能です
00:14:25最近、何人かの人たちと話をしましたが
00:14:27何百万人もの人に動画を撮影させているそうです
00:14:30「ドアの開け方を録画してくれませんか?」といった風に
00:14:33正気の沙汰じゃありません
00:14:34オンラインで何でも手に入るのに、なぜ100万人がそんなことをする必要があるのでしょうか?
00:14:39オンラインは世の中で最も巨大なデータベースの1つです
00:14:43ただ、簡単に活用できる状態ではないだけなのです
00:14:46現在使える検索といえば、動画タイトルのキーワード検索くらいですから
00:14:53そしてもちろん、ウェブ上の全公開動画を1か所に集めた情報源があれば素晴らしいでしょう
00:14:59YouTubeやVimeoなど、世の中には非常に多くの動画プロバイダーが存在します
00:15:06何十億時間もの学習データが、ただ取得され
00:15:13収集・処理されるのを待っているのです
00:15:14そこで私たちがBright Dataで開発しているのが、この新製品です
00:15:18特定の動作やアクションを検索できるよう動画にインデックスを付けています
00:15:23思いつくあらゆるものが、ブランドにとっても役立ちます
00:15:28学習データのためだけではありません
00:15:31想像できるあらゆる用途に活用可能です
00:15:35例えばゲーマーで、あるステージの攻略法を知りたいとします
00:15:40しかしドンピシャな動画が見つからない場合でも
00:15:42「ビデオゲームのその面をクリアする場面」と検索できます
00:15:47何でも探せます、可能性は無限大です
00:15:52それではまとめに入らせていただきます
00:15:54質問はありますでしょうか?詳しく話したい方は
00:15:58ぜひLinkedInでつながりましょう
00:16:01ご清聴いただきありがとうございました
00:16:06もっと詳しく話したい方は、Bright Dataのブースにいます
00:16:10お越しいただき感謝します
00:16:17また次回お会いしましょう

설명

AI without data is just a box." Rafael Levi of Bright Data points out that LLMs train on trillions of words, but robotics has only about a million videos of robots doing things. Paying people to record staged actions produces biased data, because nobody opens a door naturally when told to. Meanwhile, the web holds billions of hours of real people handling objects and real physics, with gravity, motion and cause and effect. The catch is noise. Levi notes that NVIDIA discards about 96% of the video it downloads to train Cosmos, and Stable Video Diffusion discards 74%, which wastes compute, bandwidth and storage. Meta, on the other hand, trained on about a million hours of public video and needed only 62 hours of real robot data to control a robot. Bright Data's approach is "search first, collect second." It indexes more than a billion videos by the actions in them, not their titles, and returns trimmed clips with timestamps, match scores and frame counts through an API. Levi demos searches for dishwashing and clothes-folding clips and covers uses in self-driving and brand discovery. Speaker info: Bright Data: https://brightdata.com Timestamps: 00:00 Intro 0:50 The AI isn't the hard part anymore. The data is 1:15 A short history of robots learning from video 2:40 Trillions of words vs. about a million robot videos 3:15 Why staged recordings make biased data 4:35 Why simulation and teleoperation don't scale 5:14 The web as a training source 6:14 1 million hours of video, 62 hours of robot data 6:54 Learning actions from frame-to-frame motion 7:58 Throwing away 96% of the video 8:33 Search first, collect second 10:03 Demo: finding the exact action clips 11:38 The API and use cases beyond robotics 12:48 What comes back: timestamps, scores and frames 13:33 Self-driving, dashcams and physics 15:52 Wrap-up

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기