스크립트
00:00:00Anthropic社がFable 5.1をリリースした直後、OpenAIが反撃に出て「GPT-6 Astra」をリリースしました.
00:00:07まずはGPT-6 Astraのベンチマークを見ていきましょう。そして、OpenAIには感謝ですね.
00:00:10Anthropic社がFable 5.1で示したものよりも、は遥かに多くのベンチマークデータを公開してくれました.
00:00:14コンピューターの操作性能に関しては、ほぼ圧勝と言えます。Fable 5.1については,
00:00:19データすらあまり残っていません。プロフェッショナル向けのベンチマーク、例えばBenchCADや
00:00:24browse compなどを見ても、GPT-6は素晴らしい成績を収めています。勝てていない唯一の場所は
00:00:31Artificial Analysis Intelligence Indexで、Fable 5.1の65.7に対し、61.2というスコアになっています.
00:00:38次にコーディングですが、こちらもほぼ同様の傾向です。Fable 5.1を圧倒しているか、または
00:00:43互角の勝負を繰り広げています。TerminalBench 4.0を詳しく見ると、GPT 5.6 soloの37.3から
00:00:4957.7へと大きな飛躍が見られます。そして、おそらく私のお気に入りのコーディングベンチマークであるDeepSuiteを見ると,
00:00:55これは長期にわたるエージェントタスクに特化していますが、74.1%というスコアを記録しています.
00:01:02これも既存のどのモデルよりも優れています。GPT-6は、学術系や科学・医療系のベンチマークでも圧倒的な強さを見せています.
00:01:08さらにサイバーセキュリティのベンチマークを見てみると、ここでも私は特に5.6 soloに注目しています.
00:01:1378.5%から100%への大きな跳躍が見られます。exploit benchでも55.9%からなんと88.5%まで上昇しています.
00:01:22このように、5シリーズのモデルからは劇的な進化を遂げています。長文コンテキストに関しても,
00:01:27GPT-6は圧倒的です。256kから512kトークンの8ニードルテストでは100%のスコアを記録しました.
00:01:34つまり、コンテキストウィンドウの4分の一から完全な満杯の状態まで完璧にこなせます。そして、そのウィンドウが512,000から
00:01:41100万トークンに達しても、96.3%という高得点を維持します.
00:01:46ですから、お気に入りのAIモデルにいつも膨大なコンテキストを読み込ませている人にとって、GPT-6は非常に頼もしい存在になるはずです.
00:01:51しかし、生のベンチマークスコアだけでは不十分です。これらのスコアを達成するのにどれだけのコストがかかるのかを知る必要があります.
00:01:55Astraが世界最高のスコアを持っていたとしても、他のモデルの10倍のコストがかかるなら意味がありませんからね.
00:01:59さて、GPTモデルの良いところは、歴史的にトークンの効率性が非常に高かった点です.
00:02:04そこで、Terminal Bench 4.0のスコアを見てみると、それが如実に表れていることがわかります.
00:02:11まず最初に指摘しておきたいのは、他の多くのモデルと同様に、effortレベルを上げるにつれて
00:02:16効率が低下する傾向が見られる点です。lowからmedium、そしてhighへと上げていくと,
00:02:23コストの増加にほぼ比例して、より良いスコアが得られ続けます.
00:02:30しかし、highからextra high、さらにmaxへと進むと、実際にはコストが高くなっているにもかかわらずスコアが下がってしまいます.
00:02:39したがって、highの場合、7.21ドルで57.9%の精度が得られます.
00:02:49これをFable 5.1のhighと比較してみると、10.50ドルで49.4%の精度となっています.
00:02:57つまり、より高価であるにもかかわらず、スコアはそれほど良くありません.
00:03:06Fable 5では、最大努力量の55.8に設定すると55%前後の同じようなスコアが出ますが、19.50ドルかかります.
00:03:16一方、GPT-6 Astraなら7.20ドルです。実質的に同じ精度でありながら、圧倒的に安上がりです.
00:03:22また、Frontier Code 1.1を見ると、高負荷時には同様のスコアになるという似たような傾向が見られます.
00:03:29GPT-6とFable 5.1(またはFable 5)を比較した場合、このケースではFable 5の方が高いスコアを記録しています.
00:03:34しかし、GPT-6 Astraの優れたトークン効率のおかげで、クラウドモデルの実行コストははるかに抑えられています.
00:03:39さて、OpenAIがGPT-6に関してベンチマーク以外でアピールしている機能がいくつかあります.
00:03:431つ目は、これが「世界最高のコンピューター操作モデル」と称されている点です.
00:03:48こうした性能をテストするベンチマーク(例えばエージェントの最終試験など)がいくつか存在しますが,
00:03:52他のベンチマークでも見られたように、結果はどうなっているでしょうか?Astraは精度とAPIコストの両面で.
00:03:57圧倒的な成果を出しており、これは決して無視できない要素です.
00:04:01しかし、精度以上に重要なのがスピードかもしれません。Codexは、特に音声モードと併用する場合に.
00:04:06非常に優れたコンピューター操作性能を発揮します。そしてAstraは、GPT-5.6よりも1.9倍高速とされています.
00:04:11ここ一ヶ月ほどそのモデルを使い込んできた人にとっては、非常に嬉しい改善点ですね.
00:04:15もう1つ挙げられているのが、テンプレートへの高い順応性です.
00:04:20例えば、左側に表示されているようなスライドのテンプレートを渡して、同じスタイルの別のトピックで
00:04:25別のスライドを作成するように頼むと、右側のようにスタイルに非常に忠実な成果物が得られます.
00:04:31スライドデッキやウェブサイトなど、繰り返し使用する何らかのテンプレートがある場合,
00:04:35あらゆる出力に対するデザインシステムのように捉えてもらうと、GPT-6は非常に効果的です.
00:04:41Excelドキュメントや一般的な文書のスタイリングにおいても、その実力は同様に確認できます。これが最初に提示された参照画像です.
00:04:46左側が以前得られていたもので、右側が参照画像をもとに作成された改善後のものです.
00:04:51もう1つの興味深いポイントは、GPT-6 Astraがウェブサイトやゲーム、アプリケーション.
00:04:55そしてレンダリングにおいて、より優れた視覚的判断力をもたらすという点です.
00:05:00要するに、GPT-6はより良い「美的センス」を持っているということです。「AIにはセンスがない」という言葉を.
00:05:05これまで何度も耳にしてきたことでしょう。しかし彼らは、GPT-6にはそれが備わっていると主張しています.
00:05:10もちろん正直なところ、AIのセンスに関しては常に課題がつきものです。なぜなら、質の低いプロンプトを与えてしまえば,
00:05:15どんなに優れていようとも、平均値への回帰現象が起きてしまうからです.
00:05:20人々はその平均的な出力を「AIの安っぽさ」と結びつけてしまうでしょう.
00:05:25ここでは、Unreal EngineのウォークスルーやBlenderでのモデリング、そして静止画の例がいくつか示されています.
00:05:31さて、Astraで追加された非常にクールな機能の1つが、コンテキストウィンドウが一杯になった際の自動圧縮の仕組みの変更です.
00:05:37従来は、コンテキストウィンドウが一杯になると自動的に圧縮が行われ、直前のセッションで
00:05:41話し合った内容の要約が作成され、新しいセッションが開始されていました.
00:05:46しかし、これには細部が抜け落ちてしまうという問題がありました。しかしAstraでは、単なる1つの要約ではなく,
00:05:52コンテキストウィンドウをまたいでメモを保持します。1つのドキュメントにまとめるのではなく,
00:05:57重要だと思ったことに関する複数の付箋のようなものを持ち続けます.
00:06:01そして、これが要約のすべてだという一発限りの情報に頼るのではなく、いつでもそれらのメモを参照できます.
00:06:06実際、過去のコンテキストウィンドウも検索可能な状態が維持されます.
00:06:12要約として存在するドキュメントがこれだけなわけではなく、もしそこに載っていなければ万事休す、という状況にはならなくなりました.
00:06:16これは実験的な機能であるため、codexの設定で有効化する必要がありますが、数週間後にはデフォルトになる予定です.
00:06:20サイバーセキュリティに関して、AstraはAnthropic社がFableに取っているのと同様のアプローチを取っています.
00:06:24つまり、「このモデルは非常に強力で、数多くの脆弱性(エクスプロイト)を作り出すことができる」という考え方です.
00:06:28そのため、何らかのエクスプロイトを作成しようとしているとシステムが判断した場合、それを実行させてくれません.
00:06:33指示に従うこともなく、その問題に回答することもしません.
00:06:37GPT-6における5シリーズからのもう1つの優れた改良点は、ハルシネーション(幻覚)率の低下です.
00:06:42GPT-5.6 Solや5.6モデル全般は、他の最先端モデルに比べて実際にかなり多くのハルシネーションを起こしていました.
00:06:48しかし直接比較してみると、9.4%ほどあったハルシネーション率が,
00:06:54なんと2%まで低下していることがわかります.
00:07:01では、Astraは現在利用可能なのでしょうか?限られた組織を対象に公開されており,
00:07:06数日のうちに事実上すべての人に開放される予定です.
00:07:11APIに関しても開発者向けに提供されており、価格についてはFableと同等で、入力トークン100万あたり10ドル、出力トークン100万あたり50ドルとなっています.
00:07:17数値を見る限り、OpenAIはAnthropic社の最高峰モデルと完全に渡り合える非常に堅実なモデルを提供してくれました.
00:07:22しかも、それをお手頃な価格で実現しています.
00:07:26そのため、これを試してみるのが本当に楽しみです.
00:07:30最大手同士の競争があることは、エンドユーザーである私たちにとって最終的に素晴らしいことだと思います.