VLM/VLAから身体性エージェント(Embodied Agents)へ — Armen Aghajanyan, Perceptron AI
AAI Engineer
Computing/Software
Transcript
00:00:00それでは始めましょう。Arminです。Perceptronの共同創業者兼CEOを務めています。
00:00:20私たちの取り組みについても少し触れますが、本日主にお話ししたいのは
00:00:25VLM、VLA、ワールドモデルといった区別から脱却しようという
00:00:32私たちが「身体的基盤モデル(Embodied Foundation Models)」と呼ぶものへ移行する研究上のスタンスです。
00:00:42Perceptronでの取り組み、私たちの最終目標(North Star)は
00:00:48物理世界をリアルタイムで知覚・理解し、相互作用を可能にする
00:00:53フィジカルAIの基盤を構築することです。つまり最終ミッションは
00:00:58物理世界とデジタル世界の架け橋となることです。根本的な目標として
00:01:07デバイス、機器、ロボット、カメラ、センサーが存在するあらゆる場所に知能を提供します。
00:01:14知覚し、推論し、行動するというこのパラダイムについて言えば
00:01:19私たちはこれを伝統的なマルチモーダルモデルの統合と捉えています。
00:01:25私はFAIRに6年間在籍し、マルチモーダルモデルの手法を
00:01:31いかにスケールアップさせるかを追求してきました。初期に取り組んだことの1つであり
00:01:37論文も多く発表してきた分野がアーリーフュージョン(早期融合)です。これは
00:01:41あらゆるモダリティをできるだけ早い段階で取り入れる概念です。ここでの本当の難しさは
00:01:47入力・出力の両面で、多様なモダリティ全体を
00:01:52いかに適切に表現するかという最適な方法を見つけることです。そしてVLMが主力となりました。
00:01:58マルチモーダルモデルと言えば、皆さんもVLMを思い浮かべるでしょう。
00:02:03画像・動画とテキストを入力し、基本的にはテキストを出力する能力です。変形版もあります。
00:02:09ERモデル(身体的推論モデル)のようなモデルは、グラウンディングポイントを出力でき
00:02:15空間理解や推論をより高度に行うことができます。
00:02:20次にVLAがあり、出力領域をテキストだけでなくアクションにも拡張しています。
00:02:25これらは標準的なVLMバックボーン上に構築され続けていますが
00:02:30VLMからの移行を模索する試みもあります。
00:02:35ワールドモデルやワールドアクションモデルへの移行ですが、まだ大きな成果は出ていません。
00:02:39そしてさらに興味深く複雑なマルチモーダルモデルの派生形態に入っていきます。
00:02:46入力から動画を出力するワールドモデルなどです。入力は
00:02:51画像や動画、あるいは画像・動画・アクションの組み合わせです。最後にお話しするのは
00:02:57最近の「セマンティック・ワールドモデル」と呼ばれるものです。何も出力はしませんが
00:03:02将来役立つと考えられる内部表現を学習します。私たちが
00:03:08「身体的基盤モデル」とみなしているのは、標準的な知覚、
00:03:13知覚や身体的推論、そして最終目標である制御をすべて単一のモデルで実現する枠組みです。
00:03:20入力側の多様な感覚モダリティにわたって推論を行い、
00:03:25先述した出力機能の大部分を、単一の統合モデル内で処理できます。
00:03:31ここで手短に2つの課題について説明します。これらは私たちが直面している
00:03:35根本的な研究上の課題であり、当社がこれらにどう取り組んできたか
00:03:40他社がどう取り組んでいるかをお話しします。
00:03:431つ目は、1時間の動画のようなデータをモデル化しようとする純粋なケースです。
00:03:48表現形式によっては、入力される視覚トークンが
00:03:52100万個ほどになることもあります。実際には、有効に活用できるグランドトゥルース(正解データ)が
00:03:57存在しないのが実情です。もちろん従来のように、動画から
00:04:02文字起こしを抽出して予測させたり、フレームに合成ラベルを付けて
00:04:08質問を生成したりすることも可能です。しかしこれは巨大な無駄だと判明しました。
00:04:13モデルに入力される情報量を考えてみてください。100万トークンが入力されるのに
00:04:16損失計算に使用されるのは、全体のわずか0.2%程度の
00:04:22トークンに過ぎません。これは非常に根本的な問題です。実際のところ
00:04:27これを修正しようとするどんなアプローチも、誤った学習信号を注入することになります。
00:04:31信号が疎すぎるか、人工的すぎるか、無差別すぎるかのいずれかです。
00:04:37合成データの拡充以外の手法として、「全ピクセルを予測する」というものがありました。
00:04:42確かに高密度な信号ですが、注意(Attention)の割り当てが非常に下手です。
00:04:47背景のピクセルを、グリッパーの先端や接触点、
00:04:51特定のエラー事例、物理現象と同じ重要度で扱ってしまうからです。
00:04:56そこでPerceptronでは、コアとなる知的財産(IP)の1つとして
00:05:01自然な知覚目的関数(perceptive objective)とは何かを考えています。
00:05:06将来重要となる知覚要素(percepts)を、完全に自動化された方法で予測するにはどうすべきか。
00:05:11例えば、ロボットアームの場合、グリッパーの先端が
00:05:16将来予測に極めて有用な知覚要素となるため、それをハードコーディングする手法があります。
00:05:20AI2のMOMO Actチームや、他のVLA研究でもこの手法が採用され始めています。
00:05:26しかし、これは依然として手動設定された知覚要素です。問題は、モデルが自律的に
00:05:30この固有の目的関数を意味論的に学習できる自動化された方法を見つけられるかです。
00:05:37実は私たちはその方法を発見しました。具体的な手法はここでは明かせませんが
00:05:41スパース性(疎性)の問題にどうアプローチしているかを示すヒントです。私たちが注力する
00:05:492つ目の核心的な問題は「コンテキストの肥大化」です。常に作動しているカメラや
00:05:54停止しないロボットがある場合、極めて長大なトークン列に対して推論を行う必要があります。
00:06:01テキストは比較的密であるのに対し、動画は比較的に疎です。そのため
00:06:08単に人工的なレベルで不均衡を解消しようとするのではなく、ネイティブに
00:06:13この問題に対処できるアーキテクチャ上のブレイクスルーが存在するか、という疑問が生じます。
00:06:20取れる手段はいくつかあります。第一原理に基づく1つのアプローチは
00:06:25異なるモダリティを完全に別物としてトレーニングし始めることです。テキストトークンを
00:06:31画像や音声、動画のトークンと同等に扱うことはできません。そこで考えられるのは
00:06:36空間圧縮やトークン圧縮への注力です。最初は単純な方法から試すのが一般的ですが
00:06:41私たちも初期に試したその単純な方法でも実際に効果がありました。
00:06:44動画や画像全体でパッチごとの内部表現を平均化する手法により
00:06:51最大10倍といった興味深い圧縮率が得られ始めます。しかし、これは依然として対急処置的であり
00:06:57これを根本解決するための広く普及した構造的手法は存在していません。そこで
00:07:04ここ数ヶ月で私たちが発表したのが、異なる程度の疎性に対処する独自のアプローチです。
00:07:10それは、どのトークンに着目し、どのトークンを無視すべきかをモデル自身に判断させるというものです。
00:07:14これを可能にする「Data-Sparse Mixture of Experts」の論文を発表しました。
00:07:19モデル内のルーターを通じて
00:07:24どのトークンを入力し、どのトークンをスキップすべきかを予測させ、あらゆる層にわたり
00:07:30計算コストをかけずに実行できるようにしました。強力な構造的先入観を
00:07:36直接埋め込まずにモデル自体に学習させれば、実際に正しく学習することがわかっています。
00:07:43当社のモデルが使用するデータスパースな計算処理を可視化すると
00:07:49モデルが極めて情報密度の高い部分やタスクに関連する情報に自発的に着目し始めることが観察できます。
00:07:56右上を見ると、モデルがグラフ部分に集中して注目しているのがわかります。
00:08:00人間も図の中で最も関心が高い部分として、同様にそこを拡大して見るはずです。
00:08:05さらに、タスクに依存したリソース割り当てまでもが発生することが判明しました。
00:08:13左下を見ると、ごく一般的な質問をした場合
00:08:18アテンションのグラフが画像全体に拡散します。モデルが
00:08:22計算資源を最適に割り当てる方法を特定できないためです。一方で、「すべての果物をセグメンテーションして」
00:08:27といった指示を与えると、果物だと判断したトークンに対してより多くのトークンを割り振ります。
00:08:31これは私たちが採用し論文発表も行った、非常にスマートで巧みな手法であり、他社も
00:08:36採用し始めています。モダリティの疎性の不均衡に対処しつつ、
00:08:43モデルの自律的な学習を妨げない塩梅で、有用な事前知識をアーキテクチャに組み込むアプローチです。
00:08:49これらすべてを組み合わせ、数週間前に発表を行いましたが、皆さんも
00:08:57ご覧になったかもしれません。私たちは世界初の身体的基盤モデルと自負する
00:09:03モデルをリリースしました。このモデルはGemini 1.5 Proと同等の最高水準(Frontier)に位置し、
00:09:09Gemini Embodied Reasoningを上回りながら、コストは約15分之1に抑えられています。
00:09:15文字通りあらゆる領域から収集した1ペタバイトのデータセットで学習を行いました。
00:09:20ウェブクロールから独自の追加学習レシピ、合成データパイプラインに至るまで網羅しています。
00:09:28テキスト、画像、動画、軌跡データにわたる1ペタバイトのデータを取り扱っており、この軌跡データは
00:09:34デスクトップ操作の記録からビデオゲームのプレイ履歴まで、極めて多岐にわたります。
00:09:41こうしたアプローチを推し進めると、非常に興味深い特性が発現し始めます。
00:09:46私たちが確認した最大の特徴は、振り返ってみれば当然のことですが
00:09:50従来のコンピュータビジョンのタスクを、エージェント的なタスクとして扱えることです。
00:09:57この例では、物体検出をエージェント的タスクとして再定義しました。モデルはコードを書き、
00:10:02特定部分のズームインやコントラストの調整を要求できます。
00:10:09これは非常に難解な問題です。Redditには画像内の見つけにくい物体を探す
00:10:14スレッドがありますが、私たちのモデルはこれらを非常に高い精度で処理します。
00:10:19しかもエージェントとして実行します。単に「この枠内を検出する」のではなく、
00:10:24画像を分割処理したり、コントラストを変更したりする判断をモデル自身が行います。
00:10:28ここにバウンディングボックスを提案し、コントラストを上げて鳥を見つけ出しました。
00:10:36知覚能力に長けた人間にとっても、かなり難しい作業です。
00:10:42これはすべて、多様なモダリティの観察方法を
00:10:46ネイティブに理解する身体的モデル(Embodied Model)のおかげです。
00:10:51では、これがロボティクスにおけるフィジカルAIの方向性とどう関連するのでしょうか?
00:10:57このスライドはGoogle DeepMindから借用したものですが、ロボティクスのエージェントシステムでは
00:11:04「身体的推論モデル(オーケストレーター)」と「触覚・制御ポリシーモデル」の分離が進んでいます。
00:11:11たとえば、コーヒーを淹れるのに3分かかるとします。
00:11:171つのアプローチは、単一のVLAモデルに作業全体を直接処理させることです。
00:11:21もう1つは、オーケストレーターモデルがタスクをサブタスクに分解し、
00:11:26上位で触覚制御ポリシーを実行させる方法です。完全な単一VLAから
00:11:31このようなエージェントシステムまで、幅広い構成が存在します。
00:11:36強調したいのは、身体的推論は未解決の極めて興味深い複雑な課題だということです。
00:11:41当社のモデルは、身体的推論において最先端の性能を維持しています。
00:11:46最高水準にあるからこそ、これまでにない素晴らしい成果が見られ始めています。
00:11:50これは非常に複雑なロボットデータのアノテーションの具体例です。
00:11:55モデルが動画の異なる部分にジャンプし、切り出しを行い、
00:11:59キャプションが正しいか自己検証しているのがわかります。
00:12:04これが可能なのは、当社のARモデルが高速で、
00:12:09既存のどのモデルよりも格段に安価だからです。Geminiでこの動画を処理すると
00:12:15数ドルかかりますが、当社ならわずか数セントで済みます。
00:12:20これらはすべて、従来のモデルにはなかった最先端の身体的推論能力から生まれたものです。
00:12:24では、最大の研究成果についてお話しします。
00:12:29数週間以内にXなどで詳細を公開できると思います。
00:12:37私たちが発見したのは、身体的基盤モデル(Embodied Foundation Models)における
00:12:41新しいスケーリング法則です。制御学習、軌跡学習、
00:12:48知覚学習、身体的推論学習を統合して行えるモデルです。
00:12:53これらを組み合わせる最適な方法と適切な目的関数を見つけることで、
00:12:59これまで活用できなかった非常に効果的なアプローチが見えてきます。
00:13:03具体的な手段として、一般的な動画事前学習データと
00:13:08遠隔操作(テレオペ)データをトレードオフできる能力があります。
00:13:11ご存知の通り、遠隔操作データは1時間あたり約100ドルと非常に高価です。
00:13:19100ドルあれば、はるかに大量の動画事前学習データを収集できます。
00:13:25このグラフが示しているのは、純粋なVLAや純粋なポリシーのみを学習させる場合、
00:13:32限界の帯が存在するということです。スケーリング法則自体は機能するため、
00:13:39遠隔操作データを増やすほど恩恵は得られます。
00:13:43しかし、統合された身体的基盤モデルを学習させる場合ほど
00:13:48大きな恩恵ではありません。それがグラフの下半分の領域です。
00:13:55非常に素晴らしいのは、動画事前学習データを10倍増やせば、
00:14:03遠隔操作データを10分の1に減らせる点です。
00:14:09現在の当社の計算資源の範囲内では、この法則が成り立っています。
00:14:16基盤モデルの可能性をどこまで広げられるか挑み続けます。こちらは数週間以内に小型モデルを
00:14:28オープンソース化したいと考えているポリシーの動画です。すべて単一モデル上でネイティブに動作し
00:14:33小型モデルの1つをオープンソース化したいと考えています。
00:14:38これはタスクを把握するための身体的推論を
00:14:43単一モデル内でネイティブに実行し、制御トークンを出力しています。
00:14:48少しぎこちない動きですが、規模を拡大すれば解決するでしょう。
00:14:54純粋なVLAでは困難だった非常に複雑なタスクもこなせます。
00:14:58右の動画では、モデルが本のタイトルを読み取り、
00:15:04その本がどの分類に属するか知識を適用して、適切な箱に分け入れる必要があります。
00:15:09これは知覚と制御にまたがるマルチステップのタスクであり、
00:15:23達成すべき知覚タスクを認識できない純粋なエンドツーエンド制御モデルでは極めて困難です。
00:15:28とても素晴らしい挙動です。事前学習なし(ゼロショット)でも初期状態で良好に動作します。
00:15:337月中のどこかで、皆様の手にお届けできるのを楽しみにしています。
00:15:41質疑応答に少し時間を残しておきますが、興味のある方はぜひご連絡ください。
00:15:47当社では限定されたパートナー向けに「Mark 1」や
00:15:58より大型の身体的基盤モデルの重み(ウェイト)へのアクセスを提供しています。
00:16:02メールやXのDMなど、やりやすい方法でご連絡ください。
00:16:03それでは質問を受け付けます。残り数分あります。
00:16:05ご清聴ありがとうございました。
00:16:05ありがとうございました。
00:16:09ありがとうございました。
00:16:11ありがとうございます。
00:16:13ありがとうございます。
00:16:24質問は「時系列の理解をどのようにしてここまで高められたのか」ですね。
00:16:31良い質問ですね 正直なところ 完全ではありません 確実に運用できる段階にするには まだ課題が多く残っています
00:16:37核心となるのは コンテキスト管理の考え方です コンテキストは比較的限られています ここでのモデルは100万コンテキストですが 高FPS動画だとすぐに埋まってしまいます
00:17:06そのため 何か工夫できることはないかと考える必要があります 以前試していた手法ですが キーフレームと差分フレームをどう扱うかといったことです
00:17:19この2つのトレードオフでコンテキストを管理します そして事前学習の段階から ロボティクス課題に有用な情報をどうネイティブに取り込むかを考え始めます
00:17:32例えば Geminiモデルですら以前は苦手だった(最新のものはかなり改善されましたが)基本的な点として 位置関係の認識があります
00:17:40ウェブ全体のクロールデータでは 左右などの判別が極めて困難です 「この物体が別の物体の左や下にある」とラベル付けする人はいないからです
00:17:51そのため 初期段階でデータ分布を熟考することが 早期の能力獲得につながります また身体的推論(ER)に焦点を絞ったことで 少ない計算量でGemini ERを超えられたのだと思います
00:18:07いかに直接取り込むかを考えます。たとえばGemini初期モデルが苦戦していた基本要素として、
00:18:35特定の方策に向けて微調整しようとすると テーブルの背景などを変えただけで 方策が失敗してしまいます
00:18:47知覚と制御の統合モデリングを行えば こうしたエラーや光の当たりの変化に対して 非常に高い堅牢性を発揮できます
00:18:56従来のモデルにはない 背景変化に対する強さが 主な強みだと考えています
00:19:03また、こうした身体的推論に重点を置いたからこそ、少ない計算量で
00:19:07Gemini ERを上回ることができたと考えています。
00:19:12特にVLAモデルに関して見られた最も興味深い堅牢性は、
00:19:16既存のオープンソースモデルを特定のポリシー向けにファインチューニングする際、
00:19:27机などの背景を変更するだけで、ポリシーが機能しなくなる点にあります。
00:19:31知覚と制御を統合してモデル化すると、こうしたエラーや
00:19:35光の当たり方の変化に対して、はるかに高い堅牢性を発揮します。
00:19:43いいですね。
00:19:44。
00:19:50例えばロボットアームに直接ライトを照射すれば動作しないでしょう。
00:19:52しかし、これらを統合モデル化することは非常に大きな効果をもたらします。
00:19:57また、オンラインデータ拡張も積極的に行っています。
00:20:02アームのカメラの1つが停止した状態や、特定方向から日光が差し込む状態などを
00:20:07疑似的に作成して学習させ、堅牢性を高めています。
00:20:10最大の成果は、早期フュージョン(Early Fusion)のパラダイムを適用し、
00:20:11ロボティクス領域へと移行させたことによって得られました。
00:20:15ナレッジベースについてですか?
00:20:17画像や動画のキャプション生成などに非常に有用です。
00:20:19ロボティクスパートナーと共に、主観視点(Egocentric)の複雑なアノテーションに取り組んでいます。
00:20:22オントロジーの構築に限らず、深層の構造化データの抽出において
00:20:27当社のモデルは非常に優れた性能を発揮します。公開APIでお試しいただけます。
Community Posts
No posts yet. Be the first to write about this video!
Write about this video