스크립트
00:00:00元OpenAIのCTOミラ・モレッティが立ち上げた120億ドルのスタートアップ「Thinking Machines」が、
00:00:05初のモデルを発表しました。パラメータ数は9,750億で、Apache 2.0ライセンスを採用し、重みは
00:00:12Hugging Faceで誰でもダウンロード可能です。Anthropicのような最先端ラボと
00:00:17競合するのではなく、実際の目標は自社プラットフォーム専用に微調整を行うことです。
00:00:22つまり、特定のタスクに特化したモデルが必要な場合、
00:00:25まさに求めていたものかもしれません。本日は、このモデルを
00:00:29具体的に使いたくなる理由や、ファインチューニングを行うべきすべての理由について解説します。さらに、
00:00:35このモデルが音声や視覚情報を処理する非常に興味深い方法があり、これまで見たことがないものです。
00:00:40そのため、この動画の後半でその点についても解説しますので、ぜひ最後までご覧ください。当チャンネルでは
00:00:44AIのトピックを常に取り上げていますので、最新情報を逃したくない方はBetterStackにご登録ください。
00:00:52Thinking Machinesは、新モデルが市場にある一般的などのモデルほど強力ではないということを
00:00:57非常に率直に認めており、ローンチ記事でも述べています。期待値を適切に管理しているため、
00:01:01ベンチマーク結果を見ればその理由が分かります。指示追従性においてはGLM 5.2を上回っており、
00:01:0779.8対73.3となっています。しかし、エージェントが実際に作業を行うTerminal Benchでは、63.8対82.7と大きく引き離されています。
00:01:14つまり、指示に従うのは得意ですが、自力で問題を解決する能力はやや劣るということです。
00:01:21しかし、ファインチューニングを行う予定であれば、素晴らしい出発点となります。内部構造はMixture of Expertsであり、
00:01:27合計で9,750億のパラメータを持ちますが、各レイヤーには256個のユニークな専門家(エキスパート)が存在し、各トークンは
00:01:35そのうちの6個にのみルーティングされます。つまり、どの瞬間でも稼働しているパラメータは約410億のみです。
00:01:41また、マルチモーダルであり、画像、テキスト、音声すべてを入力できます。この処理方法は、
00:01:47これまでに見たどのモデルとも大きく異なっています。通常、例えば音声モデルの場合、
00:01:52言語モデルの手前に独立した音声認識モデルが存在し、音声をテキストに書き起こした上で、
00:01:56そのトランスクリプト言語モデルに渡します。画像も同様に機能し、ビジョンエンコーダーが
00:02:02画像を確認して説明文を作成し、それを言語モデルに渡します。
00:02:07当然ながら、このプロセスでは何らかのデータの損失が発生することになります。
00:02:11Inklingはそのようなことを一切行いません。音声はスペクトログラムとしてそのまま入力され、音の
00:02:16生周波数帯域がバケットに分割されます。画像も40×40ピクセルのパッチとして入力されます。どちらも
00:02:23テキストトークンと同じ空間に直接配置され、モデルがそれらを一括して処理します。そのため、
00:02:28テキストに圧縮されてしまうデータがありません。理論上、特に音声や視覚情報を処理する際、
00:02:35Inklingモデルを使用すれば、データ損失や圧縮を大幅に抑えることができます。実際に、
00:02:40生音声をまったくサポートしていないほとんどの汎用モデルと比較して、Inklingは明確に際立っています。では、
00:02:46そもそもファインチューニングを行うべきかどうかは、具体的な目標によって決まります。一般的な経験則として、
00:02:50ファインチューニングはモデルに「知識」ではなく「答え方」を教えるものであるとされています。例えば、トーンや
00:02:57厳格な構造化出力など、モデルの出力を誘導するために何千もの例をコンテキストに含める必要がある場合、
00:03:02プロンプト経由で何千もの例を渡すことは実用的ではないため、ファインチューニングが必要になります。また、コストや
00:03:08レイテンシーの蒸留においても、汎用モデルで限定的なタスクを実行することは、
00:03:13より小さなモデルをファインチューニングするよりもはるかにコストがかかります。基本的には、
00:03:18まともな出力を得るために何千もの例が必要な状況であれば、ファインチューニングの恩恵を受けられます。しかし、モデルに
00:03:23知らない知識を覚えさせたい場合は、ファインチューニングを避けるべきです。実際、検索(RAG)と
00:03:28ファインチューニングを比較した広く引用されている論文では、一貫して検索が勝利しています。また、より良い推論能力を求める場合、
00:03:34モデルの思考の連鎖(CoT)を低下させるため、ファインチューニングがかえって逆効果になることもあります。興味深いことに、
00:03:40小型モデルほどその悪影響を強く受けます。ただし、特化した限定的な作業においては、ファインチューニングの効果は非常に大きくなります。例えば、
00:03:46法律事務所向けAIツールを開発するHarveyは、法的文書から引用部分を抽出する小型モデルをトレーニングしました。
00:03:52分類モデルのパフォーマンス評価指標であるF1スコアを測定したところ、ファインチューニングによって
00:03:580.56から0.68に向上しました。GPT-4oとの直接対決では、小型モデルが93%の確率で勝利または引き分けとなりました。
00:04:07さらに動作も高速でした。Thinking Machinesのデモでは、Inklingに文字「E」の使用を
00:04:12一切禁止するよう強制するものがあり、Tinkerを介してモデル自身にファインチューニングを行うようプロンプトを指示できます。するとモデルが自動で
00:04:18トレーニングデータセットを作成し、完全自動でファインチューニングプロセスを実行します。
00:04:24その結果、深刻なイプシロン恐怖症(文字E恐怖症)を持つモデルが完成し、なぜか応答の意味はしっかりと成り立っています。
00:04:29ただし、ここではモデル全体を再学習させているわけではありません。「LoRa」と呼ばれる技術を使用しており、
00:04:32これは低ランク適応(Low-Rank Adaptation)の略です。LoRaはモデル全体をトレーニングする代わりに、元の重みを
00:04:38凍結し、新しい特定のデータを捉えるために軽量で小さな行列を追加します。これにより、
00:04:44モデル全体をファインチューニングする場合(それはおそらく実用的ではないでしょう)と比較して、ポストトレーニングのコストと速度面で有利になります。
00:04:49現在、TinkerはQwen、Kimi、DeepSeek、NvidiaのNemoTron、OpenAIのGPT OSSなど、多くのオープンモデルをすでにサポートしています。
00:04:55その中でInklingは高価格帯の部類に入りますが、なぜあえて選ぶ必要があるのでしょうか?
00:05:02理由は2つあり、すでに少し触れました。1つ目は音声です。プラットフォーム上のすべての
00:05:06モデルの中で、Inklingだけが音声を直接入力として受け付けます。多くのモデルが画像を処理でき、
00:05:11KimiやほとんどのQwenモデルは視覚情報を問題なく処理しますが、
00:05:16生音声を実際に処理できるモデルは1つもありません。また、音声認識や
00:05:20発話スタイル分類といった3つのクックブックレシピも提供されています。これにより、モデルは単に話された内容だけでなく、
00:05:26どのように話されたかまで識別できます。さらに、音声入力された処方箋でトレーニングされ、
00:05:31他のモデルでは誤認識されがちな薬剤名を学習した医療分野の例もあります。2つ目は思考の度合いです。Inklingでは、
00:05:36思考の深さを0から1までの数値で設定できます。ほとんどのモデルは2、3段階の設定しか提供していません。例えばGPT OSSでは
00:05:42低、中、高を選択できますが、Inklingには専用のスライダーが用意されています。大きな疑問として、
00:05:47本当にこのモデルを使うべきなのでしょうか?そのままの状態でモデルを実行したい場合、
00:05:52おそらく最適ではないでしょう(開発元自身もそう明言しています)。しかし、限定的で高頻度な
00:05:56業務、実際のラベル付きデータ、そして出力を評価する方法がある場合、小規模なオープンモデルのファインチューニングは現在最も過小評価されている優れた手法の1つです。
00:06:02そしてTinkerのようなプラットフォームを使えば、それがはるかに簡単になります。
00:06:07Inklingを試すべきかどうかは、最終的にどのようなデータを入力するかによります。
00:06:11音声を入力する場合、Inklingは有力な選択肢であり、現時点でTinker上の他のモデルが生音声を処理することはありません。
00:06:16もし最高のオープン汎用モデルを探しているなら、Kimi K3についての動画を公開していますのでこちらをご覧ください。
00:06:21そちらは非常に素晴らしい結果を出しています。それ以外では、
00:06:26ご視聴ありがとうございました。BetterStackのウォーレンがお届けしました。次の動画でお会いしましょう。