ショート動画におけるモダリティの不整合とオリジナリティの帰属 — Aditya Gautam、Meta

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Aditya Rahm: 皆さんこんにちは、Adityaです。今回は主に2つの問題についてお話しします。
00:00:17それはショート動画プラットフォームで発生する問題です。
00:00:20これらに大規模に対応する方法について解説していきます。
00:00:25まず始めに、私たちが扱おうとしているデータの
00:00:28特徴について理解し、現在取り組んでいる2つの主な課題と、
00:00:33そしてそれらを大規模に解決するマルチエージェントシステムについて理解を深めます。
00:00:39各エージェントの課題を解決するために構築できる、特化型小型VLMとは何か、
00:00:46そしてそれらのエージェントをどう構築し、超大規模環境で
00:00:50スケーラブルにするための最適化手法には何があるかを解説します。
00:00:56さらに単なる適合率や再現率にとどまらない、包括的で360度全方位的な評価法も見ていきます。
00:01:00現状どのような技術があるのでしょうか?
00:01:01LLMレベル、ツール、MCPなど、マルチエージェントパイプライン全体を
00:01:08どのように理解すればよいのでしょうか。
00:01:09続いて、視覚やデータに特化した最適化技術に入ります。
00:01:14これにより「すべての動画にインテリジェントなワークフローを適用する必要はない」と判断する知能が得られ、
00:01:20処理の対象とすべき
00:01:25少数精鋭の動画セットを見つけ出すことができます。
00:01:29最後にまとめを行います。
00:01:32実際のデータは非常に雑多です。
00:01:341億回以上の再生数を持つような、バイラルコンテンツの規模での話です。
00:01:39悪意のあるスパム的なコンテンツも多く存在します。
00:01:42システムの裏をかこうとする人々がいるのです。
00:01:43画面上や動画、画像内には多言語のテキストが溢れています。
00:01:48また、データは非常に動的です。
00:01:50月ごとに絶えず変化し続けています。
00:01:52多様なAIツールが次々と登場するなど、あらゆる変化が起きています。
00:01:54そのため非常に流動的なのです。
00:01:57つまり動画データには、データドリフトなどの問題が数多く伴います。
00:02:00そして解決しようとしている問題に明確な正解(グランドトゥルース)がないことも分かっています。
00:02:05これらは現実世界の動画データセットで起きている既存の課題です。
00:02:10最初に話し合う問題は「モダリティのミスマッチ」です。
00:02:14一つ目の「異種モダリティ間(Inter-modality)」のズレは、すでに解決済みの問題です。
00:02:19CLIPモデルを使用すれば解決できます。
00:02:20画像、動画、音声、テキストのモダリティを取得し、
00:02:25それらの埋め込みのコサイン類似度を特定すれば十分です。
00:02:29ですので、こちらは比較的単純な問題です。
00:02:31私たちが焦点を当てるのは、「同種モダリティ内(Intra-modality)」の課題解決です。
00:02:37例えば、ある動画があるとします。
00:02:39長尺の動画を再生していると、
00:02:40突然、広告やプロパガンダ、政治的なコンテンツなど、
00:02:45クリックした本来の目的とは異なるものが映し出されたとします。
00:02:49では、動画の短いセグメントをどのように分析・理解し、
00:02:54本来含まれるべきではない異常や悪意のある挙動を
00:02:59特定すればよいのでしょうか。
00:03:01これが第一の課題であり、クリップやフレーム単位で何が起きているかを分析する、
00:03:05高度な細部理解、視覚理解、動画理解が求められます。
00:03:10第二の課題は「転載・非オリジナルコンテンツ」の把握です。
00:03:14AIツールが普及した現代では、コンテンツの複製が極めて容易になりました。
00:03:19動画などがアップロードされると、それが無断複製や改変され、
00:03:25ツールの進化によって動画の加工もさらに容易になっているのが現状です。
00:03:29では、このような非オリジナルコンテンツをどう検出するのか?
00:03:33動画の元ソースをどう突き止めるのか?
00:03:35これは帰属やクレジットの問題を引き起こし、エコシステムの不均衡を生んでいます。
00:03:41ユーザーの飽きを招いており、本来あるべきでない重複動画が氾濫しています。
00:03:47次にマルチエージェントシステムについてです。なぜ単一ではなくマルチエージェントなのかというと、
00:03:54単一のエージェントやLLMではなく マルチエージェントを使う理由は 問題が非常に複雑だからです
00:03:57検索 コンテンツ理解 推論という 各パートでの特化したノードと理解力が必要です
00:04:04高度に特化したノードと理解力が必要になります。
00:04:07もし単一のエージェントやLLMで解決できるなら、マルチエージェントシステムにする必要はありません。
00:04:14ここで中央ブレインの思考プロセスや、この問題の分解方法について説明します。
00:04:22まず、動画と動画IDなどがレビューアーエージェントに送られます。
00:04:28これが中央エージェントであり、
00:04:29全体のオーケストレーターです。
00:04:31信号の分解を行い、画像内で何が起きているかを把握するAPIゲートウェイとお考えください。
00:04:38このエージェントはパーシーバー(知覚)エージェントを呼び出します。パーシーバーは
00:04:46豊富な画像・動画ツールを自在に扱う、非常に洗練されたVLMエキスパートです。
00:04:52パーシーバーはレビューアーからIDを受け取り、データベースから動画を取得します。
00:05:01そして多様なツール、意味論的埋め込み、時系列的な変化を利用して小要素に分解します。
00:05:08本講演の範囲を少し超えますが、固定フレームレートで処理しないようにするための独自手法です。
00:05:17時間の経過による変化を検出し、類似フレームを1~2枚に圧縮します。
00:05:23パーシーバーはクリップレベルや動画埋め込みレベルの全データを取得し、タグ、OCRなど利用可能な全情報や、
00:05:34自然言語による説明、どのフレームからどのフレームまでかというタイムスタンプ情報などのメタデータを集めます。
00:05:41そして、そのデータをレビューアーに渡します。
00:05:43レビューアーは、パーシーバーから提供されたローデータ形式の全時系列JSONオブジェクトを、埋め込み、セマンティックID、タグ、OCRなどと共に確認します。
00:05:52そして時系列分析を行います。
00:05:55「最初のフレームからフレーム360(6秒時点)まではスポーツの動画だったが、
00:06:05そして突然 6秒から6.5秒、あるいは特定のフレーム数で 政治的な内容へと変化しているのが見られます
00:06:14そのためメタデータを確認するだけで レビュアーエージェントはどのような異常が発生しているのかを理解・把握でき
00:06:22どんな異常が発生しているかを理解・把握できます。
00:06:23これにより、単なるモダリティの非整合か、より大きな問題が存在するのかを判別します。
00:06:30レビューアーはレトリバー(検索)エージェントに「この動画を調査している。
00:06:36重複排除や後処理を済ませたメタデータがこれだ。
00:06:41コーパス内にある類似クリップの情報を共有してほしい」と要求します。
00:06:47レトリバーはパーシーバーから提供された全信号とメタデータ(クリップおよび動画全体)を分析し、各種DBへ適応的にインデックス化します。
00:06:57例えば、トピックと多数の動画を紐付ける転置インデックスなどが用いられます。
00:07:02埋め込み情報には、既存のベクトルデータベースを使用します。
00:07:06抽出されたエンティティにはグラフDBを使用し、レビューアーがDBやエンティティ、メタデータを特定できるようにします。
00:07:16インデックス化しておくことで、オンライン推論時に特定クリップの類似クリップやエンティティ、トピックを取得し、再現率を向上させることができます。
00:07:28各エージェントについて詳しく見ていきましょう。まずはパーシーバーです。
00:07:32動画全体を分析し、意味論的埋め込みやアルゴリズムで短いクリップに時系列分解し、VLMをファインチューニングして正確で
00:07:45詳細な情報を各クリップおよび動画全体から抽出します。
00:07:51超大規模なデータを扱うため、既存の標準的なVLMをそのまま使うことはできません。
00:07:56何十億ものフレームを処理するには、モデルの圧縮やコスト効率の高い手法が不可欠です。
00:08:05そのため事前学習、ファインチューニング、蒸留、量子化を駆使し、
00:08:13この特定課題に特化したVLMを展開・構築します。
00:08:16これについて簡単に説明します。
00:08:19レトリバーエージェントについては、概要をすでにお話ししました。
00:08:22オフライン処理では、パーシーバーが分解した全信号を受け取ります。
00:08:29エージェントというよりライブラリを活用し、大規模なオフライン分析を行うイメージです。
00:08:34例えばRayクラスターなどを活用します。
00:08:37メタデータが揃ったら、様々なデータベースにインデックス化します。
00:08:42定期的なオフラインクラスタリングで類似コンテンツを特定し、各クリップや動画全体の埋め込みIDやクラスタIDを決定します。
00:08:50このデータがオンライン推論時に類似動画の検索に使用されます。
00:08:56オンライン処理では、クエリやクリップID、全メタデータが与えられると、
00:09:01コーパス内から類似する既存コンテンツを特定します。
00:09:06高い類似性を持つ要素を見つけ出します。
00:09:09データベースを検索し、類似クリップや類似制作者、関連メタデータを抽出します。
00:09:16候補を再ランキングし、例えば従来の分類スコアのようなスパム判定ツールを使って
00:09:24スパムや低品質である可能性のある候補を除外します
00:09:29そして上位N件の候補が絞り込めたら、Reviewerに返します
00:09:33Reviewerでは「これがメインのコンテンツ信号とクリップ埋め込みで
00:09:39これがRetrieverから提供された類似動画か
00:09:42再検討してRetrieverからさらにデータを取得すべきか」を処理します
00:09:48そのためReviewerは単一クリップからの時系列信号をすべて保持し
00:09:52類似クリップの理解や類似制作者などの全情報を備えています
00:09:58さらにユーザーがその動画とどうインタラクションしているかのリアルタイム情報や
00:10:03報告やコメントの種類、コメントの感情分析結果なども保持しています
00:10:13オフライン信号やVLM、他のエージェントが見落としがちな多くの信号を取り込み
00:10:18センチメントの変化が発生しているかを確認します
00:10:22リアルタイムでどのような反応を得られているか?
00:10:25動画を単にコンテンツや意味論的観点から理解するだけでなく
00:10:30ユーザーのインタラクションの観点から理解するための様々なツールが存在します
00:10:36これらの信号は非常に重要です
00:10:38この役割などを整理した上で、エージェントフレームワークを構築します
00:10:44これら3つのエージェントはそれぞれ特化した
00:10:50小規模なVLMによって駆動されています
00:10:54まずは事前学習についてお話しします
00:10:58通常は事前学習済みのモデルがあり
00:11:01Vision Transformerを多少ファインチューニングして特定の目的に合わせます
00:11:08利用可能な外部の基盤モデルや最先端モデルは
00:11:14きれいに調整・クレンジングされたWebデータセットで学習されています
00:11:20しかし特定の目的のための自社データはそれとは特性が異なります
00:11:26ノイズが多く
00:11:27ユーザーによって生成され
00:11:28特定ワークフロー向けのものです
00:11:30つまりVision Transformerをゼロから微調整するために画像トークンと言語で事前学習を行い
00:11:37ゼロからの学習とファインチューニングで差が出るかを確認する必要があります
00:11:42そこで事前学習が役立ちます
00:11:44多少コストはかかりますが、差を生み出せれば非常に効果的です
00:11:502つ目は指示ファインチューニングで、ここには2つの課題があります
00:11:54特定のポリシーやガイドラインが存在し
00:11:57コンテンツや信号を理解した上で、JSONスキーマのような特定の出力スキーマを持つ
00:12:04特定のデータセットで調整し、モダリティの不整合やスコアの重複
00:12:10Reviewerエージェントから提供される思考鎖(CoT)推理を解釈させます
00:12:16ここには動画クリップがあります
00:12:17事前学習を少し進めたビジョンエンコーダーがあり
00:12:21さらに追加の学習を行っています
00:12:23Vision Transformerと言語モデルの間にプロジェクターが配置され
00:12:27両者を繋ぐ架け橋となっています
00:12:30そして用意した指示ファインチューニングデータに応じた出力が得られます
00:12:35これは特定ドメインにおけるモデルの性能を向上させる非常に重要な部分です
00:12:45コンテキストには役割やポリシー、メタデータに接地させるためのツール
00:12:50その他の利用可能な要素が含まれます
00:12:54すべてを非常に簡潔な形でコンテキストとして与え、検出された
00:13:01構造化ラベルを把握させます。これらは自社独自のラベルであり
00:13:06モダリティの詳細や発見された様々な問題点、
00:13:12モデルに必要な思考の連鎖(CoT)による推論プロセス、
00:13:15人手レビュー担当者から見た出力形式などを定義して作成したものです
00:13:21つまり各エージェント向けに高精度データセットでファインチューニングを行うのです
00:13:27動画の視覚的側面や他のモダリティを理解するための事前学習が終わると
00:13:33次はファインチューニングに進み、文脈を理解させ、処理したい形式で
00:13:38出力できるようにします。次の段階はDPO(直接選好最適化)フェーズです
00:13:44この手法は事後学習でモデルを特定領域やポリシー理解に
00:13:51微調整するために多用されますが
00:13:58本番環境でマルチエージェントシステムやLLMによって
00:14:02精度が不十分なサンプルを把握するためにも非常に有効です
00:14:11具体的には、送られてくる本番データから多数の推論が行われる中で
00:14:17一部をサブサンプリングし、手動ラベル付けデータで学習した
00:14:23評価用LLM(LLM as a judge)に通します。さらに人手レビューキューを使って
00:14:29人間のレビューキューで実際のシステムのパフォーマンスを確認します。これを行うことで
00:14:36パフォーマンスが非常に優れており、設定した予測しきい値(例えば各課題で
00:14:40超えていれば問題ありません。しかし超えていない場合は
00:14:47モデルがうまくいかなかったサンプルから学習する方法が必要です
00:14:52そこでキューに人手を介在させます。全エージェント、LLM呼び出し、MCPの
00:14:57トレースを分析し、どこで問題が発生したかを特定します
00:15:02思考鎖の推論か、誤ったツールの呼び出しや検索の失敗か?
00:15:08そうした検証を行い モデルの知能レベルにおける
00:15:14あらゆるフックやノード、さらにハーネスレベルの把握をして
00:15:20誤ってサンプリングされたデータに対して改善点を明確にします
00:15:28正例・負例と更新すべき内容が揃ったら、モデルを再学習させて
00:15:34さらなる改善を図ります。これはサンプル確認、再反復、モデル改善を行う
00:15:40継続的な改善プロセスであり、本番サンプルから新たなデータセットを作成して
00:15:46データドリフトの有無やモデルの挙動を把握します
00:15:53このHuman-in-the-loopは、本番環境から毎日サンプリングを行い
00:15:58モデルや評価用LLMの性能を把握し続ける常時プロセスのことです
00:16:05コストと大規模解決の観点から、標準的なフロンティア級VLMモデルの採用は困難です
00:16:14大量の推論と複雑さを伴いスケーラブルではない上、解くべき課題が非常に限定的だからです
00:16:20モデルがコーディング問題を解けるかは不要で、ドメイン特有の課題さえ解決できれば十分です
00:16:25これは顧客向けではなく内部ツールです。そのためオフポリシーおよびオンポリシーの知識蒸留を行い
00:16:31実験的な量子化を施して、4ビットやbfloat等何が最適かを確認します
00:16:37そして量子化の実験を少し行い
00:16:414ビットやbfloat16などのどれが有効かを確認します。その上で
00:16:47この最適化により本番環境の推論で計算資源とコストをどれほど削減できるかを検証します
00:16:54解決した課題自体は良好ですが、本番環境では拡張性とコスト効率が不可欠です
00:17:00非常に特定の課題を解決しているため、市場の既製品をそのまま使うわけにはいきません
00:17:07評価について言えば、まずはタスクの成功率です
00:17:13これらは二元的なもので、モダリティの整合・不整合の有無を測ります
00:17:21適合率、再現率、F1値はタスクの成功率を把握する一般的な指標です
00:17:27しかし最終目標だけでなく、各ノードの動作、検索システムの機能度
00:17:31システムのレイテンシや再現率、推論の質など、全体を包括的に捉える必要があります
00:17:37各エージェントレベル等でモデルから出力される思考鎖推論の品質はどうでしょうか?
00:17:42過剰に思考していませんか?低予算でも高精度を維持できるよう予算を削れるでしょうか?
00:17:47あるいは計画や推論の予算を増やして、複雑な問題の処理性能や精度を高めるべきでしょうか?
00:17:53そのため、適応的な推論予算の管理も非常に重要になります
00:17:59次に堅牢性についてです。どのようなコーナーケースやエラー率が存在し
00:18:04どのノードやフックで発生しているでしょうか?ツール呼び出しの不調や
00:18:09検索部分、LLMの精度不足などが考えられます
00:18:16さらにシステムの効率性も評価します。出力結果の性能だけでなく
00:18:22トークンコストのあらゆる側面や呼び出しているLLMを確認します
00:18:29コスト削減のためにLLMをさらに最適化できるか?各エージェントおよびシステム全体の
00:18:34効率やレイテンシはどうなっているかを確認します。次に評価用LLMについてですが
00:18:39あらゆる予測システムでは、特にUGC(ユーザー生成コンテンツ)を扱う際に
00:18:45データドリフトが必ず発生します。評価等に用いる評価用LLMが
00:18:51人手レビューキューに対してどのように機能しているか、乖離が生じていないか
00:18:56アノテーションチームからの新データで評価用LLMを再学習させる必要があるかを分析します
00:19:01最適化に関しては、時空間削減の最適化があります。これは類似フレームを検出して
00:19:081つに圧縮する手法で、動画処理全体の負荷を大幅に削減できます
00:19:142つ目はキャッシュです。拡散中のバイラルコンテンツが届いた際
00:19:20同一コンテンツをパイプライン全体に再度通さず、類似度スコアの高さを利用して
00:19:25マルチエージェントシステムをスキップして即座に判定します
00:19:30非常に重要な3つ目はメタデータのプルーニングです。トピックや
00:19:35すでに良好な実績を持つクリエイターなどのメタデータに基づき
00:19:41多数の候補から探索空間を絞り込みます。高い信頼性スコアを持ち
00:19:47動画品質やエンゲージメントが高いクリエイターの画像や動画は
00:19:52すべてを処理する必要はありません。メタデータを利用して
00:19:57システムに送る必要のない動画を事前除外することができます
00:20:01こうしたフラグの設定が有効です
00:20:07最後に、本セッションから得られる重要ポイントをお伝えします
00:20:12問題の分解が不可欠であり、必要に応じて問題を細分化すること
00:20:18ROIとコスト実現性の観点から、適応的最適化が極めて重要であること
00:20:22優れた評価基準が不可欠であり、すべての基盤となること
00:20:27これがシステム全体およびVLM全体の土台となります
00:20:33そして長期的な持続可能性を確保するには、予測監視と質的改善が欠かせません
00:20:42以上で発表を終わります。ご清聴ありがとうございました
00:20:50ROIとコストの実現可能性において適応的最適化が非常に重要であり 正確な評価が不可欠です
00:20:56すべての要素がこれに依存しており システム全体およびVLM全体の基盤となります そして予測モニタリングや
00:21:02質的改善は 長期的な持続可能性を確保するために非常に重要です
00:21:08ご清聴いただき、誠にありがとうございました

설명

A video is about sports for its first six seconds, then turns political for half a second. Catching that across a hundred million plus videos is one of two problems Aditya Gautam works on at Meta; the other is unoriginal content, trivial to make with AI tools and corrosive to attribution. Both sit on messy data: adversarial uploads, multilingual on screen text, drift, and no ground truth. Mismatch across modalities is a solved embedding problem; mismatch within one modality over time is not, so three agents share it. A perceiver splits the video where temporal change happens, not at a fixed frame rate, and emits clip level embeddings, tags, and OCR. A reviewer runs the temporal analysis over that JSON and folds in live comments and sentiment. A retriever indexes topics, embeddings, and entities into inverted, vector, and graph stores for pulling similar clips and authors at inference time. Every agent runs on a small specialized VLM, not a frontier model, since he does not care whether it can code. That means pretraining the vision encoder on in house images because user generated content looks nothing like clean web data, instruction tuning to a JSON schema, and a DPO loop where daily production samples pass through an in house LLM judge and a human queue tracing failures to the tool call or retrieval step. Distillation and quantization then produce a table of model sizes. Evaluation goes beyond precision and recall to per node latency, reasoning budgets, token cost, and judge drift. Three optimizations keep most videos out of the pipeline: compressing similar frames, caching verdicts on viral content, and pruning by metadata so trusted creators skip it. Speaker info: - https://www.linkedin.com/in/aditya-gautam-68233a30/ Timestamps: 0:00 - Two problems on short form video at 100 million plus scale 1:20 - Messy data: adversarial, multilingual, drifting, no ground truth 2:03 - Modality misalignment inside a single video 3:01 - Unoriginal content, and why one agent is not enough 4:22 - Reviewer, perceiver, retriever 5:31 - Temporal analysis, then indexing into inverted, vector, and graph stores 9:37 - The reviewer adds live user signals 10:45 - Pretraining and instruction tuning specialized VLMs 13:28 - DPO from production samples with humans in the queue 16:05 - Distillation and quantization to make it scalable 17:13 - Holistic evaluation: nodes, reasoning budgets, drift 19:28 - Spatial temporal reduction, caching, metadata pruning 20:35 - Takeaways

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기