Transcript
00:00:00これは同じベースモデルに投げた同じ質問です。
00:00:03こちらのトークンカウンターにご注目ください。
00:00:05一方は質問に対する推論に多くの時間を費やしていますが、
00:00:09もう一方はすでに処理を完了しています。
00:00:12両方の出力を確認してみると、質問に対する答えは基本的に同じです。
00:00:16しかし、右側のモデルは同じ結論にたどり着くためにより多くのトークンを浪費しました。
00:00:21そして、これが非常に興味深いのは、これら2つのモデルの唯一の違いが、
00:00:24左側のモデルが「Thinking Cap」を実行している点だからです。
00:00:27これは同じモデルのカスタムファインチューニング版であり、
00:00:31消費するトークンを抑えつつ、同等の品質の出力を確保し、
00:00:342倍速く回答にたどり着くことを目的としています。
00:00:39本日の動画では、この「Thinking Cap」を取り上げ、
00:00:42その仕組みを確認した上で、実際に自分でテストしてみて、
00:00:45これがAIモデルのファインチューニングにおける本当に新しいアプローチなのかを検証します。
00:00:50面白い内容になると思いますので、さっそく見ていきましょう。
00:00:57「Thinking Cap」について話す前に、私たちが実際にここまでどうやってたどり着いたのか少し振り返ってみましょう。
00:01:03一般向けに広く提供された最初のモデルであるGPT-3は2020年に登場し、
00:01:092022年末には、
00:01:11ChatGPTによってGPT-3.5が初めて一般公開されました。
00:01:17それが、ほとんどの人にとってAIとの関わりが始まった瞬間でした。
00:01:212023年にはGPT-4が続き、さらなる能力の飛躍がありましたが、
00:01:25根本的な考え方は依然として同じでした。
00:01:28次のトークンを予測し、即座に回答するというものです。
00:01:31しかしその後、2024年9月にOpenAIがo1をリリースしました。
00:01:37これは、回答する前に「思考モード」を使用する初めてのモデルでした。
00:01:42つまり、すぐに応答を出力するのではなく、
00:01:45最初に余分な時間とトークンを費やして問題の推論を行いました。
00:01:49その1つのアーキテクチャの転換が、推論モデルの時代を切り拓いたのです。
00:01:54その数ヶ月後にはDeepSeek-R1が続き、
00:01:56オープンソースの世界にも同じ概念をもたらしました。
00:02:00そしてあっという間に、
00:02:01推論があらゆる主要なAIモデルメーカーが出荷する機能となりました。
00:02:05しかしそれから1年余りが過ぎた今、
00:02:08私たちは逆のトレンドが現れ始めているのを目にしています。
00:02:11「もっと多く」ではなく「より少なく」考えるように特別にファインチューニングされたモデルです。
00:02:15ある意味で、私たちは原点に立ち返りつつも、
00:02:17推論の時代から学んだすべてを取り入れています。
00:02:21しかし、問題があります。
00:02:22「より多く考える」ことへの移行は1つの問題を解決した一方で、静かに別の問題を生み出しました。
00:02:28誰もこれらのモデルに「いつ考えるのをやめるべきか」を教えていなかったのです。
00:02:31推論モデルに本当に単純なことを尋ねると、
00:02:34何千ものトークンを消費し続け、
00:02:373文前にすでに導き出したことを再び導き出し、
00:02:41同じ要点を少し違う言葉で言い換えたり、
00:02:44最悪の場合、ループし始めたりします。
00:02:48これには文字通りの意味があります。
00:02:50私が遭遇した中で最も馬鹿げた例の1つをお見せしましょう。
00:02:54これはStep 3.5 Flashです。
00:02:56この推論モデルをテストしていたとき、
00:02:58私はたった一言「こんにちは」と送信しました。
00:03:01それがどう処理されたかご覧ください。
00:03:03自分の正確なモデル名で自己紹介することが義務付けられているかどうかについて、複数の段落を費やして議論し、
00:03:09「自己紹介する時は常に正確な名前を使わなければならない」ということは、毎回自己紹介すべきなのか、それともそう選んだ時だけなのかについて検討しています。
00:03:19次に、今日の日付に言及することが適切かどうかを比較検討します。
00:03:22そして最終的に、そのすべてを経た上で、私たちの誰でも約2秒で入力したような回答に行き着きます。
00:03:28「こんにちは、私はStep 3.5 Flashです。
00:03:31本日はどのようなご用件でしょうか?」
00:03:33つまり、これは実際の推論ではありません。
00:03:35考えるように訓練されてはいるものの、いつ思考が終わったのかを知るようには訓練されていないモデルなのです。
00:03:41さて、BottleCap AIは、推論の効率化に特化したヨーロッパのスタートアップです。
00:03:47彼らが「Thinking Cap」で行ったことは、正直なところ本当に巧妙です。
00:03:51彼らはモデルであるQwen 3.6の270億パラメータ版を採用しました。
00:03:55賢くしようとしたわけでも、新しいスキルを教えたり、パーソナリティを変更したり、安全性の挙動に手を加えたりしたわけでもありません。
00:04:04彼らが変更したかった唯一のことは、すでに答えを出す能力を持っている回答にたどり着くまでに、どれだけのコンピュートを消費するかという点でした。
00:04:11それは単純に聞こえますが、実際には見た目よりもはるかに難しいことです。
00:04:15モデルを高速化するための手っ取り早い方法は、単に推論を途中で打ち切ることです。
00:04:20実際に終わっているかどうかにかかわらず、特定のトークン数で強制的に停止させます。
00:04:25そうすれば確実にトークン数は減少します。
00:04:27しかし同時に、本当に余分なステップが必要な場合があるため、モデルが間違える頻度も高くなってしまいます。
00:04:34そのため、ここでの真のエンジニアリングの課題は、単に短くすることではありません。
00:04:38密かに愚かにすることなく、短くすることです。
00:04:42そして、これが彼らの実際のやり方です。
00:04:44Qwen 3.6の270億パラメータのベースチェックポイントから始めて、
00:04:48複数のドメインや難易度にわたる厳選された問題セットでトレーニングを行いました。
00:04:55そして、正しい答えを出したことに対してモデルに報酬を与える代わりに、
00:04:58効率的に正しい答えを出したことに対して報酬を与えました。
00:05:02なぜなら、モデルが正解に対してのみ報酬を得る場合、冗長であってもコストはかからないからです。
00:05:08早く考えるのをやめるインセンティブはありません。
00:05:10しかし、正確性と並行して効率性に明示的に報酬を与えることで、
00:05:14モデルは答えを確定するのに十分な情報がすでに揃っているタイミングを認識するようになります。
00:05:19その結果、元のモデルとほぼ同じように動作するモデルが完成しました。
00:05:23では、ここからが面白いところですので、実際に数字を見てみましょう。
00:05:27トレーニングデータに含まれていなかった問題を含む12のドメイン外のベンチマークにおいて、
00:05:33Thinking Capは思考トークンを平均で45.8%削減しました。
00:05:37そして、精度はほとんど変わりませんでした。
00:05:40平均して1パーセント未満の変動にとどまりました。
00:05:43また、トレーニングドメインに含まれていたベンチマークでは、
00:05:46トークンの削減効果はさらに大きく、約58%に達しました。
00:05:49特にGSM8Kでは、精度が93.3%から96.5%へと実際に向上しました。
00:05:58また、彼らは「ループ率」と呼ばれる指標も追跡しました。
00:06:00これは、モデルが収束せずに同じ推論の言い換えを何度も繰り返してしまう頻度のことです。
00:06:06先ほどのStep 3.5 Flashの例で見られたような現象です。
00:06:10それもほとんどのベンチマークで低下しました。
00:06:12このことは、これらのモデルが行っていた追加の推論の多くが、実際には決して生産的ではなかったことを物語っています。
00:06:18それは単なる努力に見せかけたノイズにすぎなかったのです。
00:06:21さて、数字上のデータはともかく、実際に自分たちでテストしてみましょう。
00:06:26このテストは、64GBのRAMを搭載したRTX 5090のマシンで実行しています。
00:06:32そして、両方のモデルに同じ質問を投げかけます。
00:06:35「nの階乗が末尾にちょうど100個のゼロを持つような最小の正の整数nは何ですか?」
00:06:42この質問の答えにたどり着くには、ルジャンドルの公式を使用する必要があり、
00:06:47この特定の質問の場合、答えは405になります。
00:06:51正解は1つしかありません。
00:06:53中間はありません。
00:06:55したがって、405が得られれば、モデルが正しく答えたことが分かります。
00:07:00それではまず、標準的な270億パラメータの量子化済みQwen 3.6モデルを実行して、
00:07:05そのパフォーマンスを確認してみましょう。
00:07:07ご覧のとおり、最初からトークンの速度はそれほど悪くありません。
00:07:12秒速約60トークンを平均しています。
00:07:14しかし、このモデルがどれほど多く思考しているか見てください。
00:07:17まったくもって馬鹿げています。
00:07:20すでに1分を大きく過ぎているのに、推論の段階だけでトークンを吐き出し続けています。
00:07:26合計時間が2分を超えていたため、ここではプレビューを早送りしました。
00:07:30それでも最終的には、正しい結果である405を得ることができました。それは良かったです。
00:07:37しかし、合計経過時間を見てください。
00:07:39140秒かかっています。
00:07:41そして、トークンの消費量を見てください。
00:07:43推論だけで7,000トークン以上が消費され、回答を出力するために実際に使われたのはわずか900トークンでした。
00:07:52このように、この例はQwenがいかにあらゆるリクエストに対して度を超えて馬鹿げた推論を行っているかを明確に示しています。
00:07:59それでは、同じモデルのThinking Cap版に切り替えてみましょう。
00:08:02念のため申し上げておきますが、同じ量子化を施した同じ270億パラメータのモデルを使用しています。
00:08:08ここに見られるように、開始から20秒で、すでに推論が完了しています。
00:08:13そしてわずか9秒後に答えが得られ、このケースでも正解である405が得られています。
00:08:19なんと鮮やかな違いでしょうか。
00:08:21合計で2,000トークン未満しか消費しなかっただけでなく(そのうち推論に割り当てられたのはわずか1,100トークン)、
00:08:30秒速62トークンという、わずかに高速なトークン生成速度も達成しました。
00:08:36したがって、あらゆる指標において、このモデルはベースのQwen 3.6モデルを圧倒しています。
00:08:42より速く、より効率的で、少ないトークンコストで、同じ正しい答えを出してくれます。
00:08:48これは非常に印象的な改良です。
00:08:51そして、彼らの解説記事にあった詳細についても触れておく必要があります。本当に面白いアクシデントだからです。
00:08:57彼らの本来の目標は、思考の痕跡(つまり推論の部分)だけを縮小し、
00:09:02最終的な回答はこれまで通りの長さに保つことでした。
00:09:06しかし、バグがありました。
00:09:07その短縮化が、思考だけでなく最終的な回答にも誤って適用されてしまったのです。
00:09:12そこで彼らはバグを修正したのですが、どうやら内部では誰もがそのバグのあるバージョンの方を実際に気に入っていました。
00:09:18そのため彼らの推測では、人間は長い回答を書くことに疲れるため、自然に話す内容を要約するのだということです。
00:09:25そしてこれらのモデルには、これまでそのような種類の疲労が組み込まれていませんでした。
00:09:29その結果、彼らは不完全で簡潔なバージョンを結局出荷し、技術的に正しい方は将来のリリースに取っておくことにしました。
00:09:37というわけで皆さん、
00:09:38それがThinking Capの要点です。
00:09:40ここからの最大の教訓は、モデルは考えれば考えるほど賢くなるものだと私たちは常に信じてきたということです。
00:09:48しかしThinking Capは、それが必ずしもそうではないことを証明しました。
00:09:53実際にそれに対してトレーニングを行えば、何も妥協することなく、わずかなコストで同品質の出力を得ることができます。
00:10:01このモデルをご自身で試してみたい場合は、Hugging FaceにてApache 2.0ライセンスの下で無料公開されています。
00:10:08そして、皆さんの意見もお聞かせください。
00:10:10この新しいアプローチについてどう思われますか?
00:10:12この技術に何かメリットやデメリットを感じますか?
00:10:15ぜひ下のコメント欄でお知らせください。
00:10:17また、このような技術解説がお好きな方は、動画の下にある「いいね」ボタンを押してそのことを教えてください。
00:10:23そして、チャンネル登録もお忘れなく。
00:10:26BetterStackのAndresがお届けしました。次の動画でお会いしましょう。