스크립트
00:00:00今日公開された新モデルは1つだけではありません。
00:00:023つもあります。
00:00:03約1時間前、AnthropicがClaude Opus 5.5をリリースしました。
00:00:06そして今、OpenAIからはGPT-6 SolとGPT-6 Lunaが発表されました。
00:00:12さて、Opus 5.5は非常に優れて見えました
00:00:14ベンチマークとコストの面においてです。
00:00:16では、この2つのモデルの実力を見ていきましょう。
00:00:19まずはベンチマークから見ていきます。
00:00:21GPT-6ファミリーの構成をおさらいしましょう。
00:00:24最上位にあるのが、数週間前に登場したAstraです。
00:00:27これがメインモデルとなります。
00:00:28Astraの下に、SolとLunaが位置しています。
00:00:32これらはAstraを超えることを目的とはしていません。
00:00:35Astraに近い機能と性能を提供しつつ、
00:00:38遥かに低コストで利用できるようにするためのものです。
00:00:40そのため、Astraに任せるほど
00:00:43複雑ではない問題を
00:00:44扱うような場合に、
00:00:45これら2つのモデルを活用することになります。
00:00:48ですから、これを見て
00:00:49「Astraほど良くないからダメだ」と思うべきではありません。
00:00:51そういう比較の仕方ではないのです。
00:00:53Frontier CodeベンチマークでGPT-Astraを見ると、
00:00:55どうでしょうか?
00:00:56最高で53.3%のスコアを記録しています。
00:00:59特に注目してほしいのはコストです。
00:01:014.59ドルです。
00:01:03ワンランク下のSolの場合、
00:01:06スコアは49.3%と少し下がりますが、
00:01:09タスクあたりのコストは2.14ドルです。
00:01:12コストは半額以下になりながら、
00:01:13スコアの低下は53から49にとどまっており、素晴らしい結果です。
00:01:18そして最も安価な
00:01:19Lunaを見ると、
00:01:21スコアは42.4%まで落ちますが、
00:01:24タスクあたりのコストはわずか11セントです。
00:01:27これはFrontier Codeベンチマークでの数値です。
00:01:29同じベンチマークで
00:01:31Opus 5.5を見ると、
00:01:326.19ドルで54.4%でした。
00:01:366.19ドルで54.4%です。
00:01:38Solと比較すると、
00:01:40スコアの低下は5%程度にとどまり、
00:01:41コストは訳3分の1に抑えられています。
00:01:44ですから、Opus 5.5やAstra 6のレベルには届かなくても、
00:01:47非常に優秀なモデルであることに変わりはありません。
00:01:50さらに、思考努力(effort)レベルを下げていくと、
00:01:53最大レベル(max)では49%ですが、
00:01:55中レベル(medium)に下げると、スコアは46%になる一方、
00:01:58コストは80セントまで下がります。
00:02:00つまり、SolとLunaは
00:02:03絶妙なバランス(スイートスポット)を提供してくれるのです。
00:02:04Anthropicのモデルではなかなか得られない選択肢です。
00:02:06AnthropicにはOpusやFableがあり、
00:02:09それらは非常に優秀ですが、
00:02:10かなり高価です。
00:02:11複雑でないタスク向けの
00:02:13安価で非常に効率的なモデルを提供する点で、
00:02:14Anthropicは苦戦しています。
00:02:16そして今、LunaとSolがそのギャップを埋めることになります。
00:02:20全体としてベンチマークを見ると、
00:02:21GPT-6バージョンを
00:02:235.6バージョンと比較した場合、
00:02:24GPT-5.6 SolからGPT-6 Solへの変化は、
00:02:28基本的な性能面ではわずかな向上ですが、
00:02:31コスト効率の面では
00:02:33大幅な向上となっています。
00:02:35これはLunaを見ると特に顕著です。
00:02:375.6 LunaとGPT-6 Lunaを比較すると、
00:02:40性能に関してはほぼ同じですが、
00:02:43ですが コストの差はかなり大きいです
00:02:46タスクあたり15セントとなっています
00:02:48タスクあたり15セントなのに対し、
00:02:505.6ではタスクあたり2.57ドルのコストがかかります。
00:02:55超高効率なモデルと言えます。
00:02:57場合によっては、GPT-6が
00:02:59Claude Fable 5.1を上回り、
00:03:01低努力レベルのGPT-6 Astraをも上回ることがあります。
00:03:05そして、その大部分は価格改定によるものです。
00:03:07全体として、5.6から6シリーズへ移行したことで、
00:03:10入力・出力コストがともに
00:03:1350%削減されました。
00:03:15Lunaに関して言えば、入力はわずか10セント、
00:03:17出力は50セントと、驚くべき安さです。
00:03:20これら新モデルのもう1つの大きなアップグレードは、
00:03:21事実正確性(factuality)に関するものです。
00:03:24誤った回答をどれくらいの頻度で出すかという点です。
00:03:27全般的に、着実な改善が見られます。
00:03:30Lunaの場合、かつての5.6では
00:03:32最高努力レベル(max)に設定していても、
00:03:3512%の確率で事実誤認を含む回答を出していました。
00:03:39それに対しGPT-6では、わずか7.6%にとどまっています。
00:03:42また、Lunaを低設定(low)で使用し、
00:03:44安さと効率性を最優先にしようとすると、
00:03:46以前は36%の確率で
00:03:48間違った回答を返していました。
00:03:50それが今では27%まで減少しました。
00:03:51そしてSolでは、エラー率が8.5%から
00:03:54わずか4.6%にまで低減しました。
00:03:57これはGPT-6 Astraの3.9%に
00:04:00かなり近い数値です。
00:04:03精度という点において、GPT-6レベルのSolは
00:04:07最高峰のモデルであるAstraと
00:04:10ほぼ同等の実力を持っています。
00:04:11また、キャッシュ機能にも改善が加えられました。
00:04:13これはコストを考える上で非常に重要です。
00:04:15キャッシュが保持されている(warm cache)状態、つまり
00:04:17OpenAIのエージェントとやり取りを続けていて
00:04:201時間以上離脱していない場合、
00:04:22これはAnthropic側でも同様ですが、
00:04:24メッセージ送信時に90%の割引が適用されます。
00:04:29仮に丸一日離れた後、
00:04:30同じスレッドに戻ってきて
00:04:31Astra、Sol、Lunaのいずれかにメッセージを送ると、
00:04:36会話全体の履歴が再送信され、
00:04:38入力コストの全額が課金されてしまいます。
00:04:41これはかなりの金額になり得ます。
00:04:43また、キャッシュに影響を与える要因は他にもありました。
00:04:44思考努力の設定を変更した場合です。
00:04:46例えば低設定(low)から
00:04:48高設定(high)に切り替えると、
00:04:49キャッシュがリセットされてしまい、
00:04:51高額な料金が発生していました。
00:04:53今では、そうした操作でキャッシュがリセットされることはありません。
00:04:55思考努力を調整してもキャッシュ状態が維持されるため、
00:04:59リソースの消費を抑えられ、
00:05:01費用を節約できます。
00:05:02特にAPIを利用している場合は顕著です。
00:05:03さらにプロンプトキャッシュ用ダッシュボードも追加されました。
00:05:06APIを利用していて
00:05:08細かい調整まで突き詰めたい方は
00:05:10キャッシュのブレークポイントを
00:05:13最適化することも可能です。
00:05:14最後に利用可能性についてですが、
00:05:15GPT-6 SolとLunaは実質ほぼすべての環境で利用可能です。
00:05:19今後注目されるのは、
00:05:21GPT-6 Terraが近いうちに登場するかどうかでしょう。
00:05:24今回リリースされたGPT-6 SolとLunaは、
00:05:26間違いなく魅力的な要素が満載です。
00:05:29スペック上では、
00:05:30AnthropicのOpus 5.5と比べると
00:05:32一歩劣るように見えるかもしれません。
00:05:35しかし、両者は異なる課題の解決を目指しています。
00:05:38LunaはFableやOpus級の課題を解くためのものではなく、
00:05:41Solも同様です。
00:05:43これらが対象としているのは、
00:05:45ワンランク下の課題です。
00:05:45そして率直に言えば、それこそがほとんどの人が活動している領域であり、
00:05:47それらを遥かに効率的に処理することができます。
00:05:50そして、こうした比較において
00:05:52コストの重要性を軽視することは決してできません。
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기