【朗報】GPT 6 Sol & Luna が登場!(しかも50%値下げ!)

CChase AI
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00今日公開された新モデルは1つだけではありません。
00:00:023つもあります。
00:00:03約1時間前、AnthropicがClaude Opus 5.5をリリースしました。
00:00:06そして今、OpenAIからはGPT-6 SolとGPT-6 Lunaが発表されました。
00:00:12さて、Opus 5.5は非常に優れて見えました
00:00:14ベンチマークとコストの面においてです。
00:00:16では、この2つのモデルの実力を見ていきましょう。
00:00:19まずはベンチマークから見ていきます。
00:00:21GPT-6ファミリーの構成をおさらいしましょう。
00:00:24最上位にあるのが、数週間前に登場したAstraです。
00:00:27これがメインモデルとなります。
00:00:28Astraの下に、SolとLunaが位置しています。
00:00:32これらはAstraを超えることを目的とはしていません。
00:00:35Astraに近い機能と性能を提供しつつ、
00:00:38遥かに低コストで利用できるようにするためのものです。
00:00:40そのため、Astraに任せるほど
00:00:43複雑ではない問題を
00:00:44扱うような場合に、
00:00:45これら2つのモデルを活用することになります。
00:00:48ですから、これを見て
00:00:49「Astraほど良くないからダメだ」と思うべきではありません。
00:00:51そういう比較の仕方ではないのです。
00:00:53Frontier CodeベンチマークでGPT-Astraを見ると、
00:00:55どうでしょうか?
00:00:56最高で53.3%のスコアを記録しています。
00:00:59特に注目してほしいのはコストです。
00:01:014.59ドルです。
00:01:03ワンランク下のSolの場合、
00:01:06スコアは49.3%と少し下がりますが、
00:01:09タスクあたりのコストは2.14ドルです。
00:01:12コストは半額以下になりながら、
00:01:13スコアの低下は53から49にとどまっており、素晴らしい結果です。
00:01:18そして最も安価な
00:01:19Lunaを見ると、
00:01:21スコアは42.4%まで落ちますが、
00:01:24タスクあたりのコストはわずか11セントです。
00:01:27これはFrontier Codeベンチマークでの数値です。
00:01:29同じベンチマークで
00:01:31Opus 5.5を見ると、
00:01:326.19ドルで54.4%でした。
00:01:366.19ドルで54.4%です。
00:01:38Solと比較すると、
00:01:40スコアの低下は5%程度にとどまり、
00:01:41コストは訳3分の1に抑えられています。
00:01:44ですから、Opus 5.5やAstra 6のレベルには届かなくても、
00:01:47非常に優秀なモデルであることに変わりはありません。
00:01:50さらに、思考努力(effort)レベルを下げていくと、
00:01:53最大レベル(max)では49%ですが、
00:01:55中レベル(medium)に下げると、スコアは46%になる一方、
00:01:58コストは80セントまで下がります。
00:02:00つまり、SolとLunaは
00:02:03絶妙なバランス(スイートスポット)を提供してくれるのです。
00:02:04Anthropicのモデルではなかなか得られない選択肢です。
00:02:06AnthropicにはOpusやFableがあり、
00:02:09それらは非常に優秀ですが、
00:02:10かなり高価です。
00:02:11複雑でないタスク向けの
00:02:13安価で非常に効率的なモデルを提供する点で、
00:02:14Anthropicは苦戦しています。
00:02:16そして今、LunaとSolがそのギャップを埋めることになります。
00:02:20全体としてベンチマークを見ると、
00:02:21GPT-6バージョンを
00:02:235.6バージョンと比較した場合、
00:02:24GPT-5.6 SolからGPT-6 Solへの変化は、
00:02:28基本的な性能面ではわずかな向上ですが、
00:02:31コスト効率の面では
00:02:33大幅な向上となっています。
00:02:35これはLunaを見ると特に顕著です。
00:02:375.6 LunaとGPT-6 Lunaを比較すると、
00:02:40性能に関してはほぼ同じですが、
00:02:43ですが コストの差はかなり大きいです
00:02:46タスクあたり15セントとなっています
00:02:48タスクあたり15セントなのに対し、
00:02:505.6ではタスクあたり2.57ドルのコストがかかります。
00:02:55超高効率なモデルと言えます。
00:02:57場合によっては、GPT-6が
00:02:59Claude Fable 5.1を上回り、
00:03:01低努力レベルのGPT-6 Astraをも上回ることがあります。
00:03:05そして、その大部分は価格改定によるものです。
00:03:07全体として、5.6から6シリーズへ移行したことで、
00:03:10入力・出力コストがともに
00:03:1350%削減されました。
00:03:15Lunaに関して言えば、入力はわずか10セント、
00:03:17出力は50セントと、驚くべき安さです。
00:03:20これら新モデルのもう1つの大きなアップグレードは、
00:03:21事実正確性(factuality)に関するものです。
00:03:24誤った回答をどれくらいの頻度で出すかという点です。
00:03:27全般的に、着実な改善が見られます。
00:03:30Lunaの場合、かつての5.6では
00:03:32最高努力レベル(max)に設定していても、
00:03:3512%の確率で事実誤認を含む回答を出していました。
00:03:39それに対しGPT-6では、わずか7.6%にとどまっています。
00:03:42また、Lunaを低設定(low)で使用し、
00:03:44安さと効率性を最優先にしようとすると、
00:03:46以前は36%の確率で
00:03:48間違った回答を返していました。
00:03:50それが今では27%まで減少しました。
00:03:51そしてSolでは、エラー率が8.5%から
00:03:54わずか4.6%にまで低減しました。
00:03:57これはGPT-6 Astraの3.9%に
00:04:00かなり近い数値です。
00:04:03精度という点において、GPT-6レベルのSolは
00:04:07最高峰のモデルであるAstraと
00:04:10ほぼ同等の実力を持っています。
00:04:11また、キャッシュ機能にも改善が加えられました。
00:04:13これはコストを考える上で非常に重要です。
00:04:15キャッシュが保持されている(warm cache)状態、つまり
00:04:17OpenAIのエージェントとやり取りを続けていて
00:04:201時間以上離脱していない場合、
00:04:22これはAnthropic側でも同様ですが、
00:04:24メッセージ送信時に90%の割引が適用されます。
00:04:29仮に丸一日離れた後、
00:04:30同じスレッドに戻ってきて
00:04:31Astra、Sol、Lunaのいずれかにメッセージを送ると、
00:04:36会話全体の履歴が再送信され、
00:04:38入力コストの全額が課金されてしまいます。
00:04:41これはかなりの金額になり得ます。
00:04:43また、キャッシュに影響を与える要因は他にもありました。
00:04:44思考努力の設定を変更した場合です。
00:04:46例えば低設定(low)から
00:04:48高設定(high)に切り替えると、
00:04:49キャッシュがリセットされてしまい、
00:04:51高額な料金が発生していました。
00:04:53今では、そうした操作でキャッシュがリセットされることはありません。
00:04:55思考努力を調整してもキャッシュ状態が維持されるため、
00:04:59リソースの消費を抑えられ、
00:05:01費用を節約できます。
00:05:02特にAPIを利用している場合は顕著です。
00:05:03さらにプロンプトキャッシュ用ダッシュボードも追加されました。
00:05:06APIを利用していて
00:05:08細かい調整まで突き詰めたい方は
00:05:10キャッシュのブレークポイントを
00:05:13最適化することも可能です。
00:05:14最後に利用可能性についてですが、
00:05:15GPT-6 SolとLunaは実質ほぼすべての環境で利用可能です。
00:05:19今後注目されるのは、
00:05:21GPT-6 Terraが近いうちに登場するかどうかでしょう。
00:05:24今回リリースされたGPT-6 SolとLunaは、
00:05:26間違いなく魅力的な要素が満載です。
00:05:29スペック上では、
00:05:30AnthropicのOpus 5.5と比べると
00:05:32一歩劣るように見えるかもしれません。
00:05:35しかし、両者は異なる課題の解決を目指しています。
00:05:38LunaはFableやOpus級の課題を解くためのものではなく、
00:05:41Solも同様です。
00:05:43これらが対象としているのは、
00:05:45ワンランク下の課題です。
00:05:45そして率直に言えば、それこそがほとんどの人が活動している領域であり、
00:05:47それらを遥かに効率的に処理することができます。
00:05:50そして、こうした比較において
00:05:52コストの重要性を軽視することは決してできません。

Key Takeaway

新登場のGPT-6 SolとLunaは、最上位モデルに迫る精度と機能を維持しながら大幅なコスト削減とキャッシュ効率化を実現し、日常的なAIタスクの費用対効果を飛躍的に向上させる。

Highlights

  • GPT-6 SolはFrontier Codeベンチマークで49.3%のスコアを記録し、タスクあたり2.14ドルとGPT-6 Astra(53.3%、4.59ドル)の半額以下のコストを実現する。

  • GPT-6 Lunaはタスクあたりのコストが11セントまで抑えられており、前世代の5.6 Luna(タスクあたり2.57ドル)から大幅な低価格化を達成した。

  • GPT-6ファミリーへの移行により、入力および出力トークンコストが全体で50%削減された。

  • 事実誤認(ハルシネーション)率が改善され、Solのエラー率は前世代の8.5%から4.6%へ低下し、最高峰モデルであるAstraの3.9%に近付いた。

  • 思考努力(effort)の設定を変更してもプロンプトキャッシュが保持される仕様に改定され、無駄な再課金が発生しなくなった。

Timeline

GPT-6 Sol・Lunaの登場とベンチマーク比較

  • OpenAIが新モデルGPT-6 SolとGPT-6 Lunaを発表し、最上位モデルAstraの下位ラインナップを拡充した。
  • GPT-6 SolはFrontier Codeベンチマークで49.3%を記録し、タスクあたり2.14ドルとAstra(53.3%、4.59ドル)の半額以下のコストで動作する。
  • 最安価なGPT-6 Lunaはスコア42.4%ながらタスクあたり11セントという低価格を実現している。

GPT-6 SolとLunaはAstraを凌駕する性能を目指すのではなく、複雑度の低い日常的なタスクを低コストで処理するために設計されている。AnthropicのOpus 5.5(スコア54.4%、6.19ドル)と比較しても、Solはわずか5%程度の性能差でコストを約3分の1に抑える。さらにSolの思考努力レベルを「medium」に下げると、スコア46%を維持しつつコストは80セントまで低下する。

前世代からの価格破壊と事実正確性の向上

  • 5.6からGPT-6シリーズへの移行により、全般的な入力・出力コストが50%カットされた。
  • 5.6 Luna(タスクあたり2.57ドル)とGPT-6 Luna(タスクあたり15セント)で劇的なコストダウンが達成された。
  • 事実誤認率が全体的に低下し、Solのエラー率は前世代の8.5%から4.6%に低減した。

GPT-6 LunaとSolは前世代と比較してコストパフォーマンスが飛躍的に向上している。Lunaの最高設定時のエラー率は12%から7.6%へ、低設定時も36%から27%へ改善した。特にSolのエラー率4.6%は最上位モデルAstraの3.9%に匹敵する精度であり、低価格ながら高い信頼性を提供する。

キャッシュ構造の改善と導入環境

  • ウォームキャッシュ状態ではメッセージ送信時に90%の割引が適用される。
  • 思考努力の設定を変更してもプロンプトキャッシュがリセットされないよう仕様が変更された。
  • API利用者のためにプロンプトキャッシュ用ダッシュボードが導入された。

従来は思考努力レベルを「low」から「high」などに変更するとキャッシュがリセットされ、全コンテキストの再送信による高額な課金が発生していた。新しい仕様では設定変更時もキャッシュ状態が維持されるため、API経由でのコスト制御が容易になった。GPT-6 SolとLunaはほぼすべての利用環境に提供開始されている。

Community Posts

No posts yet. Be the first to write about this video!

Write about this video