Transcript
00:00:00Claude Opus 5がリリースされました。Anthropicの発表によると
00:00:04Fable 5と同等の性能を半分のコストで実現したとのことです。詳細を見てみましょう。
00:00:09ベンチマーク結果を確認すると、いきなり驚くべき数値が出ています。
00:00:14多くのテストでFable 5を上回り、Opus 4.8を圧倒しています。
00:00:20特に自律型ターミナルコーディング、ナレッジワーク、エージェント検索で顕著です。またGPT-5.6なども
00:00:27これらの分野で凌駕しています。Opus 5がFable 5を下回っている唯一の領域は
00:00:33学術的・多分野の推論ですが、差はごく僅かです。ツール使用時には勝っており、あとは
00:00:39法律や医療の分野です。しかしそれ以外のすべての項目で、最上位モデルを上回っています。
00:00:46この数値が本当なら凄まじいことです。Cursor Bench 3.2のMax Effortにおいて
00:00:51Fable 5の最高スコアの0.5%差まで迫りつつ、タスク当たりのコストは半分です。驚異的ですね。
00:00:57グラフの赤がOpus 5、オレンジがFable 5、下の青がOpus 4.8です。
00:01:03確かに限界まで負荷をかけたMax EffortではFable 5が優位に立ちますが、一般的な用途で
00:01:08そこまでの設定で使う人は少なく、HighやExtra Highでの運用が主流です。
00:01:13Extra HighやHighの比較では、Fableとほぼ同等レベルの出力が得られつつ
00:01:17コストは約半分に抑えられます。Artificial Analysisのコーディングエージェント指標など
00:01:23他のベンチマークでは、Opus 5が明確にFable 5を打ち負かしています。Frontier Benchでも
00:01:27完全にFableを圧倒しており、しかも低価格です。次にナレッジワークや
00:01:32問題解決タスクを見てみましょう。ここで本当に驚くべきなのは
00:01:37Fable 5とOpus 5の比較だけでなく、Opus 4.8からOpus 5への進化の大きさです。
00:01:43全体的に飛躍的な前進を遂げています。もしこれがSonnet 5のように
00:01:49前モデルより性能が上がったものの、コストが極端に高くなってしまう仕様であれば
00:01:53微妙なところですが(Sonnet 5はタスク単位で見ると最も高価なモデルの一つです)
00:01:57ですが、今回は違います。Opusは他の2つのモデルと比べて、トークン効率が極めて高いようです。
00:02:03実際問題としてFable 5を上回っている点には感銘を受けざるを得ません。
00:02:07もう一つの興味深い改善点は視覚的なアウトプットです。こちらはOpus 5による
00:02:13風洞実験シミュレーションの例で、こちらでは3Dのインタラクティブな動物細胞の
00:02:19Artifactを生成しています。Claudeの欠点の一つは独自の画像などを直接生成できない点ですが
00:02:24このような3DのSVGやHTMLグラフィックの扱いが向上したことは大きな進歩です。
00:02:31さらに重要な改善として、検証機能と成功するまで
00:02:35試行錯誤を繰り返す精度が大幅に強化されたとAnthropicは説明しています。
00:02:40これは、一発のプロンプト処理ではなく長期間にわたる自律型エージェントタスクで
00:02:45Opus 5を使用する場合に真価を発揮します。話題のグラフエンジニアリングなどのように
00:02:49与えられた目標に対してClaude自身が成果物を検証し、何度も改善を重ねる作業において
00:02:53Opus 5はOpus 4.8よりも遥かに優れたパフォーマンスを示します。
00:02:58面白い例として、機械部品の図面を与えられ、それを3D FreeCADモデルとして
00:03:03再構築するコードを書くよう指示されたケースがあります。しかしモデルには図面を直接表示する手段が与えられませんでした。
00:03:09目標だけが提示され、具体策は指示されなかったため、自ら
00:03:14コンピュータビジョンパイプラインを記述してピクセルデータから形状を取得し、部品全体を
00:03:19復元してみせました。このように、達成すべきゴールが設定された長期的なタスクにおいて
00:03:25Opus 5は4.8を大きく上回る遂行能力を持っています。意図しない不適切な挙動に関しても
00:03:29従来モデルより改善されています(数値が低いほど優れています)。オープンソースコードの脆弱性や
00:03:35エクスプロイトを発見する能力も、Opus 4.8から飛躍的に向上しました。また素晴らしいのが
00:03:40セーフガードの調整です。Fableのようにサイバーセキュリティや生物学に少し触れただけで
00:03:45ブロックされるようなことがなく、ガードレールはFable 5よりはるかに柔軟です。
00:03:50分類器自体は残されていますが、Fableと比較して誤作動する確率が85%低下しています。
00:03:56そして最後にして最大の要素がコストです。先述の通りFableの半額に設定されており
00:04:01入力100万トークンあたり5ドル、出力100万トークンあたり25ドルです。ベンチマークの
00:04:07グラフからもわかる通り、トークン効率に優れたモデルです。実際に試すのがとても楽しみです。
00:04:12数値通りであれば、実質的にFable以上のモデルを半分のコストで使えることになります。