Transcript
00:00:00AnthropicがClaude Opus 5をリリースしました。半額でありながら
00:00:04Fableよりも優れている可能性があります。もし本当なら新しいお気に入りモデルになるので、確かめてみましょう。
00:00:13彼らはOpus 5をこのように説明しています。Opus 5は思慮深く主体的なモデルで、
00:00:18Claude Fable 5の最先端知性に半額で迫る性能を持ちます。コーディングや知識労働の
00:00:23Frontier BenchやGDP Valといった評価で、Opus 5は新たな最高水準を達成しましたが、
00:00:28サイバーセキュリティのタスクではMythos 5の後塵を拝しています。Opus 5は日常使いを想定して設計されており、
00:00:33他のモデルよりも効率的に動作し、Claude Maxの新しいデフォルトモデルかつClaude Proプランで最強のモデルです。
00:00:38この後ベンチマークが示されますが、Fable 5が存在するにもかかわらず、
00:00:43多くの項目で勝っており、しかも僅差での勝利ではありません。
00:00:47彼らによるとFrontier BenchでFable 5より10%近く優れていますが、最も驚くべきものの一つは
00:00:52Arc AGIのスコアです。Opus 4.8は1.5%で、旧最高記録のSolが7.8%だったのに対し、
00:01:00Opus 5は30.2%を記録しました。このベンチマークのチームは、Opusが他のモデルには見られなかった
00:01:06新たな能力を示したと発表しました。テストを代数記法に変換して
00:01:10高度な論理推論を行うのです。これは本当に素晴らしいことです。
00:01:15ちなみに、なぜFableがここに含まれていないかというと、Fableのデータ保持ポリシーの
00:01:19ためです。Arc AGIはベンチマークの詳細がAnthropicに漏洩するリスクを避けたいのですが、
00:01:24朗報としてOpus 5は一般アクセスでデータ保持要件がありません。
00:01:29これにより多くの人が歓喜することでしょう。次に、Artificial Analysisによる
00:01:33サードパーティベンチマークを見てみましょう。コーディングインデックスでは2位で、GPT 5.6 Sol Extra Highにわずか0.3ポイント差で負けたものの、
00:01:39Fableには1.5ポイント差で勝っており、Opus 4.8からも大きく飛躍しています。
00:01:45大手勢に割り込んだKimi K3にも一言触れておきましょう。リリース時に
00:01:49動画を作ったので、AIや開発者ニュースの最新情報を得るために
00:01:52ぜひチャンネル登録してください。エージェントインデックスを見ると、Opus 5が首位に立ち、
00:01:57Fable 5をわずかに上回り、OpenAIのSolモデルにも勝っています。知性インデックスでも
00:02:02同じ展開で、Opus 5がリードしています。性能面に関して言えば、
00:02:06Opus 5は実に優れたモデルに見えますし、正直かなり驚きました。
00:02:11今後はFableに注力し、Opusは新しいSonicモデルのような位置づけになると
00:02:15思っていましたが、価格設定を考慮するまでは、FableとOpusはほぼ互角のようです。
00:02:19Artificial Analysisのタスク完了コストを見ると、Opus 5は
00:02:23Fable 5より72セント安く、Opus 4.8より少し高い程度です。
00:02:28コスパで言えば、GPT 5.6 Solが依然として勝者であり、
00:02:33Opus 5のほぼ半額のコストで済みます。緑色が最も魅力的な象限である
00:02:37このチャートを見ると、GPTモデルはKimi K3とともにちょうどその位置にあり、
00:02:42Anthropicモデルは高価格帯の中に独自の領域を持っています。
00:02:46Cursor Benchもこれまで見てきたベンチマークと同様の結果を示しています。
00:02:50ここでのOpus 5 MaxはFable 5とほぼ同スコアですが、そのタスクにFableは17ドルかかり、
00:02:56Opusは8ドルです。価格自体はOpus 4.8と同じで、
00:03:01100万入力トークンあたり5ドル、100万出力トークンあたり25ドルです。
00:03:06そのためOpus 4.8のファンなら、このモデルを使わない理由はないと思います。
00:03:10Fable 5ファンの私自身も、サブスクやクレジットがすぐに底を突かないよう、
00:03:14節約のためにOpus 5を多用することになるでしょう。Fable対Opusについて正直な予想を言えば、
00:03:18本当に超長期の難しい問題には今でもFableがトップモデルでしょうが、
00:03:23作業の95%においてはOpus 5が取って代わることができます。では実際に
00:03:28ローカルテストで動作を見てみましょう。最初のテストでは、Three.jsを使用して
00:03:32単一のHTMLファイル内に完全なF1レースゲームを作成するよう依頼しました。
00:03:37各モデルにかかった時間やAPI費用は最後に話すとして、まずは
00:03:40結果を見てみましょう。これがOpus 5が出した結果ですが、モデルの出来には
00:03:45本気で感心させられたと言わざるを得ません。外部アセットなどは一切使用していません。
00:03:50すべてOpus 3.5によるもので、全体的に素晴らしい出来です。サーキットのレイアウトは少し逆走気味でしたが、
00:03:55ハンドリングは良好です。ラップタイム、順位付け、順序決定の
00:03:59すべてが正常に動作しています。芝生の下を走ってはいますが、衝突判定は機能しており、
00:04:03この芝生の下には実際にコースがあるので、プロンプトで簡単に修正できます。
00:04:07また、グラベルゾーンも非常にうまく機能しているようです。正直、
00:04:12Opus 5から得られた結果には大満足です。個人的には、このF1カーが一番格好いいと思います。
00:04:16判断はお任せしますが、こちらがFableの結果です。これもコースレイアウトが
00:04:20とても良いですが、車はOpus 5のものより少しシンプルです。
00:04:25曲がるときのエフェクト(カメラの揺れ)はすごく気に入っていますし、
00:04:28順位やタイム計測などの機能もすべて動いています。Fable 5も
00:04:33素晴らしい仕事をしましたが、正直Opusの方が好みです。そしてこれが
00:04:37GPT 5.6 Soul(Max Effort設定)の結果です。モデリングや
00:04:43カメラの見た目は良くできていますが、コースが存在せず、一部アセットが逆向きで、
00:04:47コースの途中でトラックが途切れてしまっています。そのため、個人的には
00:04:51FableやOpusよりも劣っていると思います。間違いなくOpusの勝利ですね。
00:04:56最後にテストしたモデルはKimi K3で、得られた結果はこちらです。
00:05:01オープンウェイトモデルとしては非常に素晴らしい出来です。かなり健闘しており、
00:05:05GPT 5.6 Soulと非常によく似ています。バリアもコースも機能しており、
00:05:09順位判定など全て動いています。一発でなかなか良いゲームを作ってくれました。
00:05:14実行コストと時間を見てみると、Opus 5はF1ゲームの完成に
00:05:1946分51秒かかり、APIを使用した場合は約12.99ドルになります。
00:05:25つまり、私にとってOpus 5はFableよりも高コストでした。詳しく調べたところ、
00:05:305倍のトークンを消費していたからです。他のベンチマークではそのような報告がないため、例外であってほしいです。
00:05:35なお、Claudeモデルのコスト計算にはClaude Codeの使用量ツールを使っているため、
00:05:39サブスク利用時には正確な価格が出ず、精度に不備があるかもしれません。
00:05:44また、先述の通りこれらのモデルは高価なので、GPT 5.6のようなモデルに落とせば
00:05:49より速く安価なモデルが得られますが、結果は個人的に劣ると感じました。
00:05:54別のテストを試してみましょう。今度は個人財務管理ダッシュボードの作成を依頼します。
00:05:58フロントエンドとバックエンドを備えたフルスタックアプリで、追加すべき機能もいくつか提示しました。
00:06:02そしてこれがOpus 5から得られた結果ですが、正直言ってもかなり感銘を受けました。
00:06:06個人的に好みのUIスタイルです。皆さんも気に入ったかコメントで教えてください。
00:06:11全て完全に機能します。全機能の動作を確認しましたし、依頼した各機能ごとに
00:06:15個別ページが用意されており、フロントエンドとバックエンド間で
00:06:20すべての機能が連携しています。このUIスタイルは本当に素晴らしいです。
00:06:24全体の中でベストだと思います。コード自体について言うと、フロントエンドには大好きな
00:06:28ReactとReact Routerを使用しており、バックエンドでも本物のデータベースを
00:06:33使用した点が加点要素です。データベースにはNode SQLiteを使い、
00:06:37サーバーにはExpressを使用しました。これがFable 5の結果です。
00:06:42Opus 5のUIの方が好みですが、こちらも悪くありません。
00:06:48ただ、正直なところチャートはあまり役に立ちません。下のものはなかなか良く、
00:06:53全ての機能が動作しています。Opus 5の方がUIにより力を入れており、
00:06:57その面では間違いなく優れています。コード面では、Opus 5と同様にReactを
00:07:01使っていますが、ルーティングライブラリを選ばず自作の小さなルーティングを
00:07:05構築していました。個人的にはReact Routerなどを使ってほしいところです。
00:07:09DBについては同様にNode SQLiteを使用し、Express上で
00:07:13構築されているためバックエンドは似ていますが、フロントエンドのスタック選択はOpusの方が上でした。
00:07:18これがGPT 5.6 Solの結果です。UIデザインに関しては
00:07:22トップクラスで、間違いなくOpusと同等です。スタイルの違いなので
00:07:26好みの問題ですが、とても気に入りました。UI全体の構成が見事で、
00:07:31機能も全て動きます。ただし個別機能に独立したページを使わず、
00:07:35同一ページ内の別セクションに移動する仕様でした。
00:07:38また、最もユニークなスタックを選んでおり、Next.jsと
00:07:43個人的に大好きなDrizzle DBの組み合わせを採用しており、この手の用途には妥当なアプローチです。
00:07:47しかしホスティングにCloudflareとVinextを使用したのは少々奇妙な判断です。
00:07:52Vinextは初期段階でまだ十分検証されていないからです。
00:07:56プロンプト内でCloudflareとVinextを強制的に使わせる指定があるのでしょう。
00:08:00Kimi K3の動画でも述べた通り、自社のChatGPTホスティングサイトがそう動いているからだと思われます。
00:08:04最後にテストしたモデルはKimi K3で、得られた結果はこちらです。
00:08:09非常に良い出来と言えます。UIはGPT 5.4や5.5で得られるようなレベルで、
00:08:14デザイン面では少し遅れていますが、機能は全て動作しており、
00:08:19大きな文句はありません。要求通りに動いています。
00:08:24ただコード面では減点要素があります。フロントエンドにはReactを選び、
00:08:28Fable同様にルーティングを自作していましたが、サーバーを見ると
00:08:32Expressサーバーのみで、Node SQLiteなどのデータベースを構築していません。
00:08:36JavaScriptで独自DBを構築し、JSONファイルに保存する形でした。
00:08:40これは望ましいアプローチではありません。
00:08:44財務テストにおける各モデルの時間と価格ですが、Fableが最も高価で
00:08:4830.79ドルかかり、時間も56分55秒でした。しかしOpusも
00:08:55Fableに近い価格帯で29.82ドルかかり、時間も59分15秒と長くかかりました。
00:09:02比較するとGPTモデルは非常に良心的な価格設定で約3.5倍安く、
00:09:07競争によってAnthropicの価格が下がっていくことを期待しています。
00:09:11そのため個人的には微妙なところです。各テストは1回ずつ、計2回しか行っていないため、
00:09:16OpusがFableの3分の1の価格というArtificial Analysisのデータが正確であってほしいです。
00:09:20検証のためにもう少し使い込む必要があります。コスト計測ツールの問題かもしれません。
00:09:24Opusのもう一つの利点は、サイバーセキュリティの制限がFable 5よりやや緩い点です。
00:09:28一部の狭いサイバータスクへの制限強化を除けば、セーフガードはOpus 4.8とほぼ同様です。
00:09:33セーフガードによりOpus 5はソースコードの脆弱性発見は許可されますが、
00:09:37バイナリベースのスキャンやペネトレーションテスト、エクスプロイト生成はブロックされます。
00:09:42彼らのテストによると、分類器の介入頻度はFable 5より約85%少ないとのことです。
00:09:46現在モデルの競争は実に見事です。
00:09:51GPT 5.6は低価格化を証明し、Kimmyなどのオープンモデルは大手並みの知性に達し、
00:09:55Anthropicは知性の限界を絶えず押し広げています。
00:10:00あなたのお気に入りモデルは何ですか?Opusに興味は湧きましたか?
00:10:04下のコメント欄で教えてください。チャンネル登録もよろしくお願いします。
00:10:09それでは、また次回の動画でお会いしましょう。