Opus 5が登場!FABLEを超える出来栄え?!

CChase AI
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00Claude Opus 5がリリースされました。Anthropicの発表によると
00:00:04Fable 5と同等の性能を半分のコストで実現したとのことです。詳細を見てみましょう。
00:00:09ベンチマーク結果を確認すると、いきなり驚くべき数値が出ています。
00:00:14多くのテストでFable 5を上回り、Opus 4.8を圧倒しています。
00:00:20特に自律型ターミナルコーディング、ナレッジワーク、エージェント検索で顕著です。またGPT-5.6なども
00:00:27これらの分野で凌駕しています。Opus 5がFable 5を下回っている唯一の領域は
00:00:33学術的・多分野の推論ですが、差はごく僅かです。ツール使用時には勝っており、あとは
00:00:39法律や医療の分野です。しかしそれ以外のすべての項目で、最上位モデルを上回っています。
00:00:46この数値が本当なら凄まじいことです。Cursor Bench 3.2のMax Effortにおいて
00:00:51Fable 5の最高スコアの0.5%差まで迫りつつ、タスク当たりのコストは半分です。驚異的ですね。
00:00:57グラフの赤がOpus 5、オレンジがFable 5、下の青がOpus 4.8です。
00:01:03確かに限界まで負荷をかけたMax EffortではFable 5が優位に立ちますが、一般的な用途で
00:01:08そこまでの設定で使う人は少なく、HighやExtra Highでの運用が主流です。
00:01:13Extra HighやHighの比較では、Fableとほぼ同等レベルの出力が得られつつ
00:01:17コストは約半分に抑えられます。Artificial Analysisのコーディングエージェント指標など
00:01:23他のベンチマークでは、Opus 5が明確にFable 5を打ち負かしています。Frontier Benchでも
00:01:27完全にFableを圧倒しており、しかも低価格です。次にナレッジワークや
00:01:32問題解決タスクを見てみましょう。ここで本当に驚くべきなのは
00:01:37Fable 5とOpus 5の比較だけでなく、Opus 4.8からOpus 5への進化の大きさです。
00:01:43全体的に飛躍的な前進を遂げています。もしこれがSonnet 5のように
00:01:49前モデルより性能が上がったものの、コストが極端に高くなってしまう仕様であれば
00:01:53微妙なところですが(Sonnet 5はタスク単位で見ると最も高価なモデルの一つです)
00:01:57ですが、今回は違います。Opusは他の2つのモデルと比べて、トークン効率が極めて高いようです。
00:02:03実際問題としてFable 5を上回っている点には感銘を受けざるを得ません。
00:02:07もう一つの興味深い改善点は視覚的なアウトプットです。こちらはOpus 5による
00:02:13風洞実験シミュレーションの例で、こちらでは3Dのインタラクティブな動物細胞の
00:02:19Artifactを生成しています。Claudeの欠点の一つは独自の画像などを直接生成できない点ですが
00:02:24このような3DのSVGやHTMLグラフィックの扱いが向上したことは大きな進歩です。
00:02:31さらに重要な改善として、検証機能と成功するまで
00:02:35試行錯誤を繰り返す精度が大幅に強化されたとAnthropicは説明しています。
00:02:40これは、一発のプロンプト処理ではなく長期間にわたる自律型エージェントタスクで
00:02:45Opus 5を使用する場合に真価を発揮します。話題のグラフエンジニアリングなどのように
00:02:49与えられた目標に対してClaude自身が成果物を検証し、何度も改善を重ねる作業において
00:02:53Opus 5はOpus 4.8よりも遥かに優れたパフォーマンスを示します。
00:02:58面白い例として、機械部品の図面を与えられ、それを3D FreeCADモデルとして
00:03:03再構築するコードを書くよう指示されたケースがあります。しかしモデルには図面を直接表示する手段が与えられませんでした。
00:03:09目標だけが提示され、具体策は指示されなかったため、自ら
00:03:14コンピュータビジョンパイプラインを記述してピクセルデータから形状を取得し、部品全体を
00:03:19復元してみせました。このように、達成すべきゴールが設定された長期的なタスクにおいて
00:03:25Opus 5は4.8を大きく上回る遂行能力を持っています。意図しない不適切な挙動に関しても
00:03:29従来モデルより改善されています(数値が低いほど優れています)。オープンソースコードの脆弱性や
00:03:35エクスプロイトを発見する能力も、Opus 4.8から飛躍的に向上しました。また素晴らしいのが
00:03:40セーフガードの調整です。Fableのようにサイバーセキュリティや生物学に少し触れただけで
00:03:45ブロックされるようなことがなく、ガードレールはFable 5よりはるかに柔軟です。
00:03:50分類器自体は残されていますが、Fableと比較して誤作動する確率が85%低下しています。
00:03:56そして最後にして最大の要素がコストです。先述の通りFableの半額に設定されており
00:04:01入力100万トークンあたり5ドル、出力100万トークンあたり25ドルです。ベンチマークの
00:04:07グラフからもわかる通り、トークン効率に優れたモデルです。実際に試すのがとても楽しみです。
00:04:12数値通りであれば、実質的にFable以上のモデルを半分のコストで使えることになります。

Key Takeaway

Claude Opus 5は、入力100万トークンあたり5ドル・出力100万トークンあたり25ドルというFable 5の半分のコストでありながら、コーディングや長時間の自律エージェントタスクで同等以上の性能を発揮する。

Highlights

  • Claude Opus 5は入力100万トークンあたり5ドル、出力100万トークンあたり25ドルで提供され、Fable 5の半分のコストで動作する。

  • Cursor Bench 3.2のMax Effort設定において、Opus 5はFable 5の最高スコアに対して0.5%差まで迫る性能を示す。

  • セキュリティ分類器の誤作動率はFable 5と比較して85%低下しており、過度なブロックが削減された。

  • 指示に含まれない画像処理パイプラインを自力で構築し、2D図面から3D FreeCADモデルを復元する自律タスク遂行能力を持つ。

Timeline

Opus 5の性能とコスト効率

  • Opus 5はFable 5と同等の性能を半分のコストで実現する。
  • 自律型ターミナルコーディングやナレッジワーク、エージェント検索などの領域でGPT-5.6やFable 5を凌駕する。
  • 日常的な運用環境であるHighやExtra High設定において、Fable 5と同等水準の出力を半額のコストで生成する。

多くのテスト項目においてOpus 4.8を大幅に上回り、Fable 5を上回るベンチマーク結果を記録する。Cursor Bench 3.2のMax Effort設定ではFable 5の最高スコアと0.5%差の精度を達成する。Frontier BenchやArtificial Analysisのコーディングエージェント指標においても高精度を示す。

トークン効率とビジュアル生成能力の強化

  • Opus 5は前世代モデルと比較して高いトークン効率を備える。
  • 3D SVGやHTMLグラフィックの処理能力が向上し、インタラクティブな視覚成果物を生成する。

Opus 4.8からOpus 5への進化において、単なる精度の向上にとどまらずトークン消費の効率化が達成されている。風洞実験のシミュレーションや3Dの動物細胞構造など、インタラクティブなArtifactsを正確に構築する能力を持つ。

長時間の自律タスク処理とセーフガードの調整

  • 成果物の自己検証機能と試行錯誤の反復精度が強化されている。
  • セキュリティ分類器の誤作動率がFable 5より85%低下し、過度な制御ブロックを回避する。
  • 価格は入力100万トークンあたり5ドル、出力100万トークンあたり25ドルに設定される。

機械部品の2D図面から3D FreeCADモデルを復元するタスクにおいて、指示に含まれないコンピュータビジョンパイプラインを自主的に記述してピクセルデータから形状を取得する行動を示す。オープンソースコードの脆弱性発見能力が向上した一方、サイバーセキュリティ分野などの適切なプロンプトに対する誤ブロック率は大幅に減少している。

Community Posts

View all posts