ゼロからSOTAへ:3Bのステートスペース視覚モデルの学習 — Krishna Prasad Srinivasan, Sarvam
AAI Engineer
컴퓨터/소프트웨어창업/스타트업어학(외국어)
스크립트
00:00:00皆さん こんにちは クリシュナです SarvamのGMを務めています
00:00:24本日は 単一のGPUで実行できるほど小規模な30億パラメータのモデルが
00:00:32ドキュメントAI分野で最高水準(SOTA)を達成し 100倍大きなモデルを凌駕する仕組みをご紹介します
00:00:42また このモデルには少し珍しい2つの特徴があります 1つ目は 使用している言語モデルが標準的なTransformerではない点です
00:00:49そして データ収集からトレーニング、計算に至るモデル構築の全工程をインド国内で完結させた点です
00:00:58対象は英語およびインドの22の公用語です これは個人的に 現在世界で最も困難なドキュメントインテリジェンス課題の1つだと考えています
00:01:06ゼロからSOTAへと至った経緯をお話しします まず 私たちSarvamについてご紹介させてください
00:01:15当社はインドのソブリン基盤モデル企業です 音声、テキスト、ビジョン(画像)の各モダリティを跨いで開発を行っています
00:01:23音声では音声認識および音声合成モデルを テキストでは300億パラメータと1000億パラメータのモデルを展開しています
00:01:32ビジョン領域ではドキュメントインテリジェンスモデルを開発しており 本日はこれについてお話しします
00:01:38現在 インドは機械可読なデジタル世界から大きく取り残されています 公開されている言語分布研究によれば
00:01:48最先端モデルのトレーニングに使用されるCommon Crawlコーパスにおいて インド系言語の割合は1%を大幅に下回っています
00:01:55様々なフォーラムで最先端AIラボが「インドは重要な市場であり 急成長している」と発言するのを聞いたことがあるかもしれません
00:02:04しかし そのような取り組みにもかかわらず 日々トレーニングされている最先端モデルのデータにおいて インドのデータは未だに不足しているのが現状です
00:02:16その主な理由は データや知識自体が存在しないからではありません データがデジタル化されてこなかったからです
00:02:31データが未デジタル化のままであるというこの問題を Sarvamは解決しようとしています では、なぜインド系言語のドキュメントインテリジェンスは難しいのでしょうか
00:02:38まず 目標が単なる「テキスト抽出」ではなく「知識抽出」であるためです 論理的な脈絡のない単なるテキスト抽出には意味がありません
00:02:49第二に インド系言語の文字は 文字の形状と人間が見る言語表現が 機械の認識方法と大きく異なります
00:03:01つまり インドの言語は複雑なUnicodeの結合で成立しているため 正確に理解するには言語モデルが22言語すべてにおいて強力である必要があります
00:03:13第三に インド系言語の大部分は低リソース言語とみなされておりモデルのトレーニングに必要なデータが現在大きく不足しています
00:03:23これに対する当社の解が「Sarvam Vision」です ゼロから構築されたインド初のソブリン視覚言語モデルであり 状態空間(SSM)アーキテクチャを採用した30億パラメータモデルで データ、計算、トレーニングのすべてをインド国内で行いました
00:03:402025年後半に初期開発を開始した際 OCR分野のVLMの多くはモノリシック型で ページレベルのOCRを実行していました 当時私たちはあえて逆のアプローチをとり ブロックレベルOCRに焦点を当て モデルの周囲にドキュメント処理フレームワーク(Harness)を追加しました
00:04:02それ以降 2026年にリリースされた多くのモデルが OCRにおいて「Harness+小型モデル」という同じパラダイムに収束しており 私たちが踏み出した方向性の正しさが証明されています
00:04:17Sarvam Visionには レイアウト用と読み取り用の2つのHarnessモジュールと ブロックレベルOCR用の状態空間モデルVLMが備わっています
00:04:29ここで改めて「なぜTransformerではなく状態空間モデル(SSM)を使うのか?」という疑問が生じます
00:04:36現在の主要なOCRモデル(QwenやGemmaなどの一般的なオープンソースVLM)は すべてTransformerベースです
00:04:45私たちはSSMを用いた別のアプローチを採用しました その理由をご説明します
00:04:50TransformerもSSMも根本的にはシーケンスモデルですが 内部の仕組みが大きく異なります
00:04:57Transformerでは全トークンが他の全トークンを参照するため シーケンス長の自乗に比例して計算量が増大します
00:05:06これが $L imes L$ の相互作用です
00:05:10また シーケンスが伸びるにつれてメモリ使用量も増加します
00:05:13一方 SSMは単一の「状態」を保持します
00:05:17シーケンスを通じて1つの状態を維持し トークンごとにそれを更新していきます
00:05:22計算量は線形にしか増えないため SSMではメモリ使用量が一定に保たれます
00:05:27では なぜこれがOCRにとって適切なアーキテクチャなのでしょうか
00:05:32それはトレードオフに関わってきます 特に長い文書では 1ページあたり5,000〜10,000個のビ知覚トークンが発生することがあります
00:05:43計算量とメモリの二次関数的な増大(自乗的複雑さ)は インファレンス時に非常に高コストになります
00:05:51一方 SSMを用いて多少の情報損失を受け入れつつブロックレベルOCRを行うアプローチは 正当化し得る選択肢となります
00:06:00Transformerがもたらす高額な計算コストを回避できるからです
00:06:08では 実際にこれをどのようにトレーニングするのでしょうか
00:06:10私たちは4つのステージからなる段階的なカリキュラムを構築しました
00:06:13各ステージは前の段階を基礎にしています ステージ1はテキストのみの事前学習です
00:06:19英語、インド系言語のテキスト、数学、コードにわたる13兆トークンを使用します
00:06:25これにより30億パラメータの言語バックボーンが構築されます
00:06:29強力な言語事前知識があるからこそ 画像内の滲んだ文字や曖昧なテキストをモデルが読み解けるようになります
00:06:38人間が半分ぼやけた単語でも読めるのと同じ原理です
00:06:41文脈上 本来そこに位置すべき単語が何かを理解しているからです
00:06:46そのため 私たちはまず言語モデルの能力を高めることに注力しました
00:06:51モデルが画像ピクセルを目にする前の段階の話です
00:06:54ステージ2では 3億件の画像とテキストのペアで継続的な事前学習を行います
00:07:01これにより 言語モデルに一般的な視覚能力を習得させます
00:07:05ものの見方やピクセルの解釈方法などを教え込むのです
00:07:08そしてステージ3では 1億件のOCRデータで教師あり微調整を行います
00:07:15ステージ3の主な目的は 汎用VLMモデルをOCRに特化・強化することです
00:07:26これには 22の全言語と英語にわたる多様なデータを含めることや
00:07:32表などのあらゆるドキュメント要素を取り入れることが含まれます
00:07:39数式や手書き文書なども対象となります
00:07:44そしてステージ4が強化学習(RL)であり 教師あり微調整で到達できる限界を超える手助けとなります
00:07:54一見すると これは標準的な手法に見えるかもしれません
00:07:57しかし 当社の参入障壁(Moat)は基礎となる2つの層にあります
00:08:02データ層と評価(Eval)層です
00:08:051つ目はデータエンジンです
00:08:0822言語の大部分において 手軽に使えるラベル付きデータは存在しません
00:08:13ラベル付きデータがない場合 データエンジンの構築は極めて困難になります
00:08:18そして それこそが私たちが徹底的に取り組んできたことです
00:08:21合成データや実際の文書からのデータを生成するパイプラインを構築しました
00:08:26また トレーニングに投入するデータを継続的に改善するパイプラインの構築も支援しました
00:08:35評価パフォーマンスなどに基づいた改善です
00:08:37そのため 現在私たちはRLMのパラダイムを意欲的に検討しています
00:08:42今後のリリースに向けて モデルのエージェント的視覚能力を探求しているからです
00:08:482つ目の参入障壁は評価(Eval)です
00:08:51モデルの性能を正しく測定できなければ SOTAに到達することはできません
00:08:57測定値が真にSOTAであり
00:09:03エンドユーザーの利便性の観点から見ても実質的な意味を持つよう 広範な評価セットを構築しました
00:09:09ここで 当社のRLパイプラインについて少し掘り下げてお話ししたいと思います
00:09:15ステージ4です 性能向上の大部分は実質的にRLからもたらされるからです
00:09:20OCRにおいて 正確性は機械的に判定可能な問題ですよね?
00:09:24モデルに報酬を与え スコアリングするためのテストを多数セットアップできます
00:09:30生成されたこれらのサンプルに対して
00:09:34決定論的なOCRの世界では
00:09:37これらはすべて機械検証が可能です
00:09:40したがって RLは大幅なパフォーマンス向上をもたらしてくれます
00:09:44グループをサンプリングし
00:09:45単体テストでスコア判定を行い
00:09:47超えるべき平均値を強化(アップデート)し
00:09:51そのプロセスを繰り返します
00:09:53これがOCR向けRL-VRの拡張性を極めて高いものにしています
00:09:57ゼロからのトレーニングと
00:10:01データ構築の努力を重ねた結果
00:10:03グローバルな英語ベンチマーク2つでSOTAを達成することができました
00:10:081つはOCR Bench
00:10:10もう1つはOmnidoc Benchです
00:10:12リリース時点では OCR Benchで84.3
00:10:15Omnidoc Benchで93.2を記録しました
00:10:18それ以降にリリースされた他社モデルも
00:10:22基準を大きく引き上げていますが
00:10:24まもなくより強力なモデルを投入し
00:10:26グローバルなリーダーボードでも首位に立ちます
00:10:29第二に、そしてより重要なこととして
00:10:31インドの22言語において
00:10:34当社は無敗の独走状態にあります
00:10:36あらゆる最先端モデルと比較してもです
00:10:38Geminiや
00:10:40ChatGPT
00:10:41Opusなど
00:10:42各種モデルと比べても差は歴然です
00:10:43ここで私たちはリードを大きく広げました
00:10:46そして強力な優位性を維持しています
00:10:48新たに登場してきた
00:10:50あらゆる新モデルと比較してもです
00:10:52さて Sarvam Visionは
00:10:54「Akshar」と呼ばれるエージェント型ドキュメントインテリジェンス・ワークベンチを強力に支えています
00:10:57Akshar
00:10:59ここでは以下を可能にします
00:11:01ヒューマン・イン・ザ・ループによるエージェント型デジタル化や
00:11:04データ抽出
00:11:06そしてデータ取り込みです
00:11:07後続する様々なドキュメント処理の課題に対応します
00:11:11信頼性スコア(Confidence score)の提供や
00:11:13ブロックレベルでのグラウンディング機能
00:11:16エージェントによる校正機能などを備えています
00:11:22ベンチマークやSOTAは一側面に過ぎません
00:11:26それらも重要ではありますが
00:11:27現在 世界最大級の企業群が
00:11:30保険から銀行業務
00:11:32政府機関
00:11:33歴史的保全団体にいたるまで
00:11:36Sarvam Visionを活用しています
00:11:383,500万ページ以上のデジタル化に使用されています
00:11:40英語と
00:11:41インドの22言語に対応しています
00:11:44モデルはAPIとして提供されており
00:11:48オンプレミス環境や
00:11:49エージェント型プラットフォームでも利用可能です
00:11:51まとめになりますが
00:11:54わずか4ヶ月前まで
00:11:56インド発のソブリンモデルは存在しませんでした
00:11:59今日 私たちにはSarvam Visionがあります
00:12:02ゼロからトレーニングされ
00:12:03SOTAを打ち立てました
00:12:06価格設定に関しても
00:12:07非常に競争力が高く
00:12:09他のあらゆるソリューション(
00:12:11オープンソースおよび商用モデルを含む)と対抗できます
00:12:14まず 私たちは最も困難な課題の解決に着手しました
00:12:16課題とは
00:12:18インド系言語のドキュメントインテリジェンスです
00:12:20まもなく公開予定の
00:12:22汎用目的のVLMでは
00:12:24さらに高度な
00:12:26ビジョン能力を備えています
00:12:28そして
00:12:30皆さんに当社のモデルを試していただけるのを
00:12:32楽しみにしています ありがとうございました
00:12:33ご質問があれば何でもお答えします
00:12:35ご質問があれば何でもお答えします
00:12:37ご質問があれば何でもお答えします
00:12:38ご質問があれば何でもお答えします
00:12:39ご質問があれば何でもお答えします
00:12:39ご質問があれば何でもお答えします
00:12:40はい
00:12:40ご質問があれば何でもお答えします
00:12:41ご質問があれば何でもお答えします
00:12:42はい
00:12:43ご質問があれば何でもお答えします
00:12:44はい
00:12:45ご質問があれば何でもお答えします
00:12:46はい
00:12:47はい
00:12:48はい、もちろんです
00:12:49一般的に
00:12:50言語能力は
00:12:5122の言語の
00:12:53英語を向上させます
00:12:54かなりの差で
00:12:56そしてこれは当てはまります
00:12:58あらゆる低リソース言語に
00:12:59インドの低リソース言語だけではありません
00:13:02なるほど
00:13:27その方向性には対応していません
00:13:29このモデルでは
00:13:30ビジョンに特化したモデルだからです
00:13:33注力しているのは
00:13:34情報の抽出や
00:13:35文書からの知識獲得です
00:13:37しかし
00:13:38類似点もあるかもしれません
00:13:39モデルが
00:13:40一般的な言語を使用して
00:13:42コーディングを高速化するのを
00:13:44助けるという点では
00:13:45同様です
00:13:46ですが
00:13:47それは今回の取り組みの
00:13:48主眼ではありません
00:13:50はい
00:13:53そうですね
00:13:542つの点があります
00:14:11人工的な文書を作成しています
00:14:14合成文書と呼ばれるものです
00:14:15全般的な事後学習用で
00:14:16それには
00:14:18SFTと
00:14:19RLが含まれます
00:14:20ただ
00:14:21RLに関するご質問に
00:14:22お答えすると
00:14:23そこでも
00:14:24合成文書を
00:14:25生成することは可能です
00:14:26しかし
00:14:27最善の方法は
00:14:28十分に複雑な
00:14:29現実の文書を使用することです
00:14:30単体テストや
00:14:31さまざまな種類の報酬の
00:14:32設定に役立ちます
00:14:33例えば
00:14:34文字認識率に基づく報酬や
00:14:35表構造に基づく報酬
00:14:36数式
00:14:37あるいは言語に関連するもの
00:14:39文法的な報酬などです
00:14:40そしてモデルが
00:14:41さまざまな設定で
00:14:42生成できる展開に基づいて
00:14:43反復的に改善できるよう
00:14:44支援します
00:14:45はい
00:14:47その通りです
00:14:48Chandraの大ファンだと
00:14:49おっしゃいましたか?
00:14:50はい
00:14:51なるほど
00:14:52それは別の研究所のものですね
00:14:53私もChandraを開発した
00:14:54研究所の大ファンです
00:14:55ですが、ご質問の
00:14:56インド系ベンチマークについてお答えすると
00:14:57はい
00:14:58当社が22言語向けに作成した
00:14:58「Sarvam Indic Benchmark」を
00:14:59公開する予定です
00:15:00これは
00:15:01膨大な期間をカバーしており
00:15:201800年代から
00:15:21現代に至るまで網羅しています
00:15:22また
00:15:23さまざまなレイアウトや
00:15:24インド系言語の
00:15:25さまざまな種類の文書が含まれます
00:15:26想像していただける通り
00:15:27散文、詩
00:15:28文学
00:15:29表、財務関係など
00:15:30あらゆる文書が入っています
00:15:31間もなくそのベンチマークを
00:15:32一般公開する予定です
00:15:33翻訳や
00:15:34翻字(音訳)は
00:15:36ここでは直接関係ありません
00:15:37OCRで重要なのは
00:15:38忠実度の高い
00:15:39情報抽出だからです
00:15:42画像の中に間違いがあっても
00:15:43その間違いも含めて正確に抽出されることが求められ
00:15:44モデルが勝手に変更を加えることは
00:15:45望まれません
00:15:46そのため直接は適用されませんが
00:15:47OCRの学習用として
00:15:48翻字データも多く使われています
00:15:49そのデータの品質や有用性については
00:15:49まだ議論が分かれています
00:15:50翻訳や翻字は
00:15:51ここには直接関与していません
00:15:52OCRで重視されるのは
00:15:53高精度な
00:15:53抽出だからです
00:15:54画像内に誤りがあっても
00:15:54モデルが勝手に修正せず
00:15:55誤りのまま正確に抽出することが求められます
00:15:56そのため直接的ではありませんが
00:15:57現在のOCR学習では
00:15:57翻字経由のデータも大量に流入しており
00:15:59その品質や有用性についての結論は
00:16:00まだ出ていません
00:16:02翻訳もまた
00:16:02翻字もまた
00:16:03ここでは直接関係ありません
00:16:03OCRで重要なのは再現性の高い
00:16:05考慮すべき点がいくつかあります
00:16:07第一に、商用・オープン問わず
00:16:08既存の最先端モデルは
00:16:09複雑なインド系言語の文書処理が苦手です
00:16:09そのため、14億の人口を抱える国において
00:16:10日常的な文書知能の問題を
00:16:11解決できるようにする必要があります
00:16:15インドには大量の書類手続きが存在するからです
00:16:18急成長中の国であり
00:16:19現在進行形でデジタル化が進んでいるため
00:16:23まず国全体をデジタル化する能力の存在が非常に重要です
00:16:25第二に、学習面についてですが
00:16:26当社は後続の学習に活用可能なデータの生成を特に重視しました
00:16:28AIが生活の一部となる段階としてはまだ初期であり
00:16:29各自の好みの言語で
00:16:29パーソナライズされたエージェントを構築できる段階に達するには
00:16:33データ生成から始める必要があります
00:16:35高品質なデータがあれば
00:16:36モデルを最高水準(SOTA)に引き上げることができます
00:16:40最高水準のモデルであれば
00:16:43そのため直接適用はされませんが、多くのデータが入ってきているのは確かです
00:16:49OCRの学習にも翻字データが使われていますが、その品質や有用性についてはまだ結論が出ていません
00:16:58政府機関としては
00:17:00はい
00:17:01そうですね
00:17:26そのため、データ送信先や使用量・時期を
00:17:27自ら制御できる必要があります
00:17:29データ主権が極めて重要であり
00:17:39だからこそこのモデルは
00:17:40提供開始からわずか4ヶ月で
00:17:52すでに3,500万ページをデジタル化しています
00:17:55インドは急成長中の国で、現在もデジタル化が進んでおり、まずデジタル化するための手段を整えることが重要なのです。
00:18:05第二に、学習面において私たちが特に注力したのは、その後の多くの学習プロセスに追加できるデータを作成することでした。
00:18:18AIが日常生活に定着するという点において、私たちはまだ非常に初期段階におり、最終的に目指す場所に到達するにはデータの準備が必要不可欠です。
00:18:31モデルの性能自体、そしてモデル学習に必要なデータです
00:18:38それらすべてを実現するにはどこかで始める必要があり データの生成が必要です 質の高いデータがあれば モデルは最高水準(SOTA)に達します
00:18:47モデルが最高水準になれば 保険会社から政府機関 AIにおける主権を重視する人々に至るまで—
00:18:58政府機関としては 文字起こしデータがどこへ行くかも分からない 他所に配置されたモデルは使えません
00:19:06データの送信先や 使用時期 使用量などを自ら管理できる必要があります
00:19:13だからこそ主権が非常に重要となり このモデルはまさに今—
00:19:17ローンチからまだ4ヶ月ほどですが すでに3500万ページをデジタル化しています
00:19:23これはインドにおけるAIデジタル化の波を本格的に始動させる 自国主権型のソリューションを市場が待っていたことを示しています
00:19:32主に3つの側面があります 主権 そのものとしてのモデルの能力 そしてこれらのモデルの学習に必要なデータです
00:19:4240%がインド系言語で 残りは英語や数学 コードなどで構成されています
00:20:03そのため、現在の運用からのフィードバックを活用して
00:20:07間もなく再学習を行えるようになります
00:20:08はい、そのパイプラインもすでに稼働させています
00:20:09そして、そのパイプラインもすでに稼働させています
00:20:24現在、このモデルを用いた運用は複数の州で進められており
00:20:31英語や混在言語の文書に加え、地方言語のデジタル化に取り組んでいます
00:20:39そのため、現在の運用から得られるフィードバックをもとに、間もなく再学習が可能になります
00:20:48はい、そのパイプラインも開始しました
00:20:50そのパイプラインもすでに開始しています
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기