Inkling:ファインチューニングを前提としたオープンウェイトモデル

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00元OpenAIのCTOミラ・モレッティが立ち上げた120億ドルのスタートアップ「Thinking Machines」が、
00:00:05初のモデルを発表しました。パラメータ数は9,750億で、Apache 2.0ライセンスを採用し、重みは
00:00:12Hugging Faceで誰でもダウンロード可能です。Anthropicのような最先端ラボと
00:00:17競合するのではなく、実際の目標は自社プラットフォーム専用に微調整を行うことです。
00:00:22つまり、特定のタスクに特化したモデルが必要な場合、
00:00:25まさに求めていたものかもしれません。本日は、このモデルを
00:00:29具体的に使いたくなる理由や、ファインチューニングを行うべきすべての理由について解説します。さらに、
00:00:35このモデルが音声や視覚情報を処理する非常に興味深い方法があり、これまで見たことがないものです。
00:00:40そのため、この動画の後半でその点についても解説しますので、ぜひ最後までご覧ください。当チャンネルでは
00:00:44AIのトピックを常に取り上げていますので、最新情報を逃したくない方はBetterStackにご登録ください。
00:00:52Thinking Machinesは、新モデルが市場にある一般的などのモデルほど強力ではないということを
00:00:57非常に率直に認めており、ローンチ記事でも述べています。期待値を適切に管理しているため、
00:01:01ベンチマーク結果を見ればその理由が分かります。指示追従性においてはGLM 5.2を上回っており、
00:01:0779.8対73.3となっています。しかし、エージェントが実際に作業を行うTerminal Benchでは、63.8対82.7と大きく引き離されています。
00:01:14つまり、指示に従うのは得意ですが、自力で問題を解決する能力はやや劣るということです。
00:01:21しかし、ファインチューニングを行う予定であれば、素晴らしい出発点となります。内部構造はMixture of Expertsであり、
00:01:27合計で9,750億のパラメータを持ちますが、各レイヤーには256個のユニークな専門家(エキスパート)が存在し、各トークンは
00:01:35そのうちの6個にのみルーティングされます。つまり、どの瞬間でも稼働しているパラメータは約410億のみです。
00:01:41また、マルチモーダルであり、画像、テキスト、音声すべてを入力できます。この処理方法は、
00:01:47これまでに見たどのモデルとも大きく異なっています。通常、例えば音声モデルの場合、
00:01:52言語モデルの手前に独立した音声認識モデルが存在し、音声をテキストに書き起こした上で、
00:01:56そのトランスクリプト言語モデルに渡します。画像も同様に機能し、ビジョンエンコーダーが
00:02:02画像を確認して説明文を作成し、それを言語モデルに渡します。
00:02:07当然ながら、このプロセスでは何らかのデータの損失が発生することになります。
00:02:11Inklingはそのようなことを一切行いません。音声はスペクトログラムとしてそのまま入力され、音の
00:02:16生周波数帯域がバケットに分割されます。画像も40×40ピクセルのパッチとして入力されます。どちらも
00:02:23テキストトークンと同じ空間に直接配置され、モデルがそれらを一括して処理します。そのため、
00:02:28テキストに圧縮されてしまうデータがありません。理論上、特に音声や視覚情報を処理する際、
00:02:35Inklingモデルを使用すれば、データ損失や圧縮を大幅に抑えることができます。実際に、
00:02:40生音声をまったくサポートしていないほとんどの汎用モデルと比較して、Inklingは明確に際立っています。では、
00:02:46そもそもファインチューニングを行うべきかどうかは、具体的な目標によって決まります。一般的な経験則として、
00:02:50ファインチューニングはモデルに「知識」ではなく「答え方」を教えるものであるとされています。例えば、トーンや
00:02:57厳格な構造化出力など、モデルの出力を誘導するために何千もの例をコンテキストに含める必要がある場合、
00:03:02プロンプト経由で何千もの例を渡すことは実用的ではないため、ファインチューニングが必要になります。また、コストや
00:03:08レイテンシーの蒸留においても、汎用モデルで限定的なタスクを実行することは、
00:03:13より小さなモデルをファインチューニングするよりもはるかにコストがかかります。基本的には、
00:03:18まともな出力を得るために何千もの例が必要な状況であれば、ファインチューニングの恩恵を受けられます。しかし、モデルに
00:03:23知らない知識を覚えさせたい場合は、ファインチューニングを避けるべきです。実際、検索(RAG)と
00:03:28ファインチューニングを比較した広く引用されている論文では、一貫して検索が勝利しています。また、より良い推論能力を求める場合、
00:03:34モデルの思考の連鎖(CoT)を低下させるため、ファインチューニングがかえって逆効果になることもあります。興味深いことに、
00:03:40小型モデルほどその悪影響を強く受けます。ただし、特化した限定的な作業においては、ファインチューニングの効果は非常に大きくなります。例えば、
00:03:46法律事務所向けAIツールを開発するHarveyは、法的文書から引用部分を抽出する小型モデルをトレーニングしました。
00:03:52分類モデルのパフォーマンス評価指標であるF1スコアを測定したところ、ファインチューニングによって
00:03:580.56から0.68に向上しました。GPT-4oとの直接対決では、小型モデルが93%の確率で勝利または引き分けとなりました。
00:04:07さらに動作も高速でした。Thinking Machinesのデモでは、Inklingに文字「E」の使用を
00:04:12一切禁止するよう強制するものがあり、Tinkerを介してモデル自身にファインチューニングを行うようプロンプトを指示できます。するとモデルが自動で
00:04:18トレーニングデータセットを作成し、完全自動でファインチューニングプロセスを実行します。
00:04:24その結果、深刻なイプシロン恐怖症(文字E恐怖症)を持つモデルが完成し、なぜか応答の意味はしっかりと成り立っています。
00:04:29ただし、ここではモデル全体を再学習させているわけではありません。「LoRa」と呼ばれる技術を使用しており、
00:04:32これは低ランク適応(Low-Rank Adaptation)の略です。LoRaはモデル全体をトレーニングする代わりに、元の重みを
00:04:38凍結し、新しい特定のデータを捉えるために軽量で小さな行列を追加します。これにより、
00:04:44モデル全体をファインチューニングする場合(それはおそらく実用的ではないでしょう)と比較して、ポストトレーニングのコストと速度面で有利になります。
00:04:49現在、TinkerはQwen、Kimi、DeepSeek、NvidiaのNemoTron、OpenAIのGPT OSSなど、多くのオープンモデルをすでにサポートしています。
00:04:55その中でInklingは高価格帯の部類に入りますが、なぜあえて選ぶ必要があるのでしょうか?
00:05:02理由は2つあり、すでに少し触れました。1つ目は音声です。プラットフォーム上のすべての
00:05:06モデルの中で、Inklingだけが音声を直接入力として受け付けます。多くのモデルが画像を処理でき、
00:05:11KimiやほとんどのQwenモデルは視覚情報を問題なく処理しますが、
00:05:16生音声を実際に処理できるモデルは1つもありません。また、音声認識や
00:05:20発話スタイル分類といった3つのクックブックレシピも提供されています。これにより、モデルは単に話された内容だけでなく、
00:05:26どのように話されたかまで識別できます。さらに、音声入力された処方箋でトレーニングされ、
00:05:31他のモデルでは誤認識されがちな薬剤名を学習した医療分野の例もあります。2つ目は思考の度合いです。Inklingでは、
00:05:36思考の深さを0から1までの数値で設定できます。ほとんどのモデルは2、3段階の設定しか提供していません。例えばGPT OSSでは
00:05:42低、中、高を選択できますが、Inklingには専用のスライダーが用意されています。大きな疑問として、
00:05:47本当にこのモデルを使うべきなのでしょうか?そのままの状態でモデルを実行したい場合、
00:05:52おそらく最適ではないでしょう(開発元自身もそう明言しています)。しかし、限定的で高頻度な
00:05:56業務、実際のラベル付きデータ、そして出力を評価する方法がある場合、小規模なオープンモデルのファインチューニングは現在最も過小評価されている優れた手法の1つです。
00:06:02そしてTinkerのようなプラットフォームを使えば、それがはるかに簡単になります。
00:06:07Inklingを試すべきかどうかは、最終的にどのようなデータを入力するかによります。
00:06:11音声を入力する場合、Inklingは有力な選択肢であり、現時点でTinker上の他のモデルが生音声を処理することはありません。
00:06:16もし最高のオープン汎用モデルを探しているなら、Kimi K3についての動画を公開していますのでこちらをご覧ください。
00:06:21そちらは非常に素晴らしい結果を出しています。それ以外では、
00:06:26ご視聴ありがとうございました。BetterStackのウォーレンがお届けしました。次の動画でお会いしましょう。

핵심 요약

データ損失のない生音声処理と高度なファインチューニングを特徴とする9,750億パラメータのオープンウェイトモデル「Inkling」は、限定的で高頻度な業務において汎用モデルを凌駕するパフォーマンスを発揮する。

하이라이트

  • Thinking Machinesが発表したパラメータ数9,750億のオープンウェイトモデル「Inkling」は、Apache 2.0ライセンスを採用しHugging Faceで公開されている。

  • Mixture of Experts構造により合計9,750億のパラメータを持つが、各トークンは256個中の6個のエキスパートにルーティングされるため、稼働時は約410億パラメータとなる。

  • 音声はスペクトログラム、画像は40×40ピクセルのパッチとしてテキストトークンと同じ空間に直接配置され、データ損失や圧縮を大幅に抑える。

  • 法的文書から引用部分を抽出する小型モデルのファインチューニングにより、F1スコアが0.56から0.68に向上し、GPT-4oとの比較で93%の確率で勝利または引き分けとなった。

  • InklingはTinker上のプラットフォームモデルで唯一生音声を直接入力として受け付け、音声認識や発話スタイル分類に対応する。

타임라인

Inklingモデルの概要と性能比較

  • Thinking Machinesが発表した初のモデルはパラメータ数9,750億で、Apache 2.0ライセンスを採用している。
  • 指示追従性を示す指標ではGLM 5.2を上回る79.8対73.3を記録する。
  • エージェントの作業能力を測るTerminal Benchでは63.8対82.7となり、自力での問題解決能力はやや劣る。

元OpenAIのCTOミラ・モレッティが立ち上げたスタートアップが、Hugging Faceで重みをダウンロード可能なモデルを発表した。最先端ラボと競合するのではなく、自社プラットフォーム専用の微調整を明確な目標としている。ローンチ記事では一般的なモデルほど強力ではないと率直に認められており、ベンチマーク結果でも指示追従性と自力解決能力の特性の違いが示されている。

内部構造と独自のマルチモーダル処理方式

  • Mixture of Experts構造を採用し、各レイヤーには256個の専門家が存在し、各トークンは6個のエキスパートにルーティングされる。
  • 稼働しているパラメータはどの瞬間でも約410億のみである。
  • 音声はスペクトログラム、画像は40×40ピクセルのパッチとしてテキストと同じ空間に直接入力され、データ損失を防ぐ。

内部構造にはMixture of Expertsが採用されており、総パラメータ数は膨大であるものの稼働数を絞ることで効率化を図っている。通常のモデルでは音声や画像を一度テキストに変換するプロセスでデータ損失が発生するが、Inklingはそのような変換を行わない。生周波数帯域のバケット分割や画像パッチの直接配置により、データ圧縮を大幅に抑えている。

ファインチューニングの判断基準と適用事例

  • ファインチューニングは知識の習得ではなく、トーンや厳格な構造化出力などの答え方を教えるために使用する。
  • 新しい知識の追加には検索(RAG)が優れており、ファインチューニングは思考の連鎖を低下させる場合がある。
  • 法律事務所向けAIツールの小型モデルでは、ファインチューニングによりF1スコアが0.56から0.68に向上した。

何千もの例をプロンプトで渡すことが実用的でない状況においてファインチューニングの恩恵が生じる。小型モデルの思考力低下といった悪影響がある一方で、限定的で特化した作業においては極めて高い効果を発揮する。法的文書の抽出タスクでは、ファインチューニング済みの小型モデルがGPT-4oに対して93%の確率で勝利または引き分けを記録し、動作速度でも優位性を示している。

自動ファインチューニングとInklingを選ぶ理由

  • Tinkerを介して文字Eの使用禁止などの指示を出すだけで、モデル自身が完全自動でトレーニングデータを作成しLoRaによるファインチューニングを実行できる。
  • Inklingはプラットフォーム上のモデルで唯一、生音声を直接入力として受け付ける。
  • 思考の深さを0から1までの数値で調整できる専用のスライダーを備えている。

モデル全体ではなくLoRa技術を用いることで、コストと速度の面で有利なポストトレーニングが可能となっている。多くのオープンモデルがサポートされる中、Inklingの最大の強みは生音声の直接処理と詳細な思考深度の調整機能にある。音声入力された処方箋や発話スタイルの識別など、従来の汎用モデルでは対応が難しい領域で強力な選択肢となる。

커뮤니티 글

모든 글 보기