Transcript
00:00:00AnthropicがSonnet 5をリリースしました。知っておくべきことをすべて解説します。
00:00:04まずはベンチマークから始めましょう。Sonnet 5は、
00:00:08OpusやFableといったモデルよりも性能が低く、安価なモデルであることを覚えておいてください。アップグレードは
00:00:134.6以来となります。5と4.6を比較すると、エージェントによるコーディング、
00:00:21学際的な推論、コンピュータ使用、ナレッジワークにおいて大幅な飛躍を遂げています。全面的に
00:00:26アップグレードされています。では、Opus 4.8と比較した場合はどうでしょうか。差があるかどうかが問題ではなく、
00:00:32どれくらい性能が落ちるかが重要ですが、実際にはそれほど大きな落ち込みはありません。それどころか、
00:00:39ナレッジワークの数値はより優れており、驚くほどです。コンピュータ使用はわずか2%差で、
00:00:44エージェントによるコーディングも2%の差、学際的な推論でも
00:00:49わずか数パーセントの差です。最大の差はSweebench Proで、63%対69%という結果でした。
00:00:56しかし、Terminal Bench 2.1では80%対82%です。大きな差ではありません。この性能についての議論は、
00:01:03価格との関連で考える必要があります。Fable 5とMythos 5は、
00:01:08入力トークンあたり10ドルで、Opusの2倍です。Opusは100万入力トークンあたり5ドルです。
00:01:16出力は25ドルです。つまり5ドルと25ドルですね。Sonnet 5は2ドルで、
00:01:26Opusの入力トークンコストのわずか40%です。出力は10ドルです。大幅に安く、
00:01:34Opusの半分以下のコストです。しかし数値を見るとかなり近いです。ですから、
00:01:40AIで最先端の作業をする必要はないけれど、より日常的なタスクに使い、
00:01:46なおかつ高い性能を求めている人にとっては、Sonnet 5はまさにその穴を埋める存在です。では、
00:01:51ベンチマークを超えたチャートを見ていきましょう。ここでは努力レベル別のエージェント検索性能を、
00:01:55Opus 4.8、Sonnet 5、Sonnet 4.6で比較しています。すぐに気づくのは、Sonnet 5の
00:02:04努力レベル間の合格率の大きな差です。低(Low)では55%です。しかし、
00:02:13Sonnet 4.6の「低」の方が成績が良いのです。しかしコストの面では遥かに安いです。
00:02:19「中(Medium)」に移ると、基本的にSonnet 4.6と同じ性能を、
00:02:25大幅な割引価格で得られます。そして「高(High)」の努力レベルに移行して初めて、
00:02:34Sonnet 4.6を上回り始めます。しかしその時点では、Sonnet 4.6よりも優れた性能を得られても、
00:02:41コストはSonnet 4.6の「低」レベルの時と同じくらいになっています。この努力レベルによる区別は、
00:02:49とても重要だと思います。Sonnet 5が全般的に優れているわけではなく、
00:02:535の「低」が必ずしも4.6の「低」より優れているとは限りません。Sonnet 5の「低」は、単に
00:02:59非常に安くなるという意味です。しかし、これまで見てきたような高レベルの性能を得るには、
00:03:03高努力レベルの作業が必要になるでしょう。とはいえ、
00:03:08Sonnet 5で「高」を使う場合、Opusでかかる費用とほぼ同じ額を支払うことになります。Opusの「中」や
00:03:14「高」はSonnetの「高」と同額ですが、合格率は高くなります。この点が議論にニュアンスをもたらします。
00:03:21エージェント検索などでSonnet 5対Opus 4.8を使い分けるべきでしょうか?
00:03:27最終的には問題の複雑さ次第だと思います。複雑な問題であれば、結局のところOpus 4.8の方が
00:03:33トークン効率が良いので安くなる可能性があります。Sonnetではそのタスクに適さないからです。
00:03:38しかし、AIモデルにとってそれほど難しくないタスクであれば、
00:03:44Opus 4.8を使う意味がないかもしれません。そこでSonnet 5の出番です。
00:03:49どのモデルを使うべきかはケースバイケースという、興味深い状況にあります。
00:03:54もう一つ興味深いのが、エージェントによるコンピュータ使用です。概して、
00:03:58ほとんどの場合、Sonnet 5はSonnet 4.6を上回っており、非常に低コストで実行できます。
00:04:05エージェント検索ではそうとは言い切れませんでしたが、コンピュータ使用に関しては、
00:04:09急に4.6よりSonnet 5を使うべき状況になりました。これも、
00:04:14どのモデルを使うべきかはケースバイケースであるという考えに立ち返ります。興味深いことに、Opusを見てください。Opusの「高」は
00:04:20Sonnet 5の最大設定よりも良い性能を発揮し、しかも安価です。つまり、これらを見ると
00:04:26Opusは実際のところ、その機能に対してかなり効率的だと言えます。言うまでもなく、
00:04:30Sonnetには到達できない高いレベルに達します。ですので考えるべき点として、
00:04:36100万トークンあたりのコストがOpusの方が安くても、Opusが最適なケースはまだたくさんあります。さて、
00:04:41Anthropicのモデルリリースについて、モデルの誤った動作について触れずに終われません。Sonnet 5は改善されていますが、
00:04:45Opus 4.8やMythos Previewで期待されるレベルにはまだ達していません。そして、
00:04:50Mythosの使用をほぼ制限させたエクスプロイトやサイバーセキュリティの問題ですが、
00:04:55Sonnetクラスでは心配する必要はありません。全体として、私はこれらのベンチマークをあまり重視しません。
00:04:59正直なところ、こうしたベンチマークやチャートを見ると躊躇してしまいます。
00:05:05問題はSonnet 5対4.6ではないと思うからです。基本的にはいつでもSonnet 5を使うでしょう。
00:05:11問題はSonnet 5対Opus 4.8です。Opusの方が実際に安いのか?
00:05:18Anthropicには、どこが分岐点になるのかをもっと明確に示すような
00:05:24テストをもっと行ってほしいです。つまり「ここならSonnet 5で十分でOpusより安い」
00:05:29と「これは複雑なタスクなので、完了させるにはOpusの方が効率的だ」という
00:05:34境界線です。考えるべき点ですね。確かに便利な存在です。全体として、
00:05:40低レベルのタスクにおいてSonnetは恩恵となるでしょう。なぜなら、APIトークンを
00:05:46使用する私たちにとって、Claude Max Planのエコシステム外のアプリケーションだと、
00:05:51Anthropicを使うのはコスト的に非常に厳しいからです。ずっと言ってきたのは、
00:05:55OpenAIの小型モデルを見るようにということでした。多くの人の仕事にはそれで十分なことが多いためです。
00:05:59これでAnthropicでもミドルティアの選択肢ができたので、嬉しいことです。
00:06:05今日はここで終わりにします。どこでも利用可能です。どれが一番理にかなっているかを
00:06:09見極めるには、多くの試行錯誤が必要になると思います。皆さんはどう思いましたか?
00:06:13私のClaude Code Masterclassに興味がある方は、ぜひChase AI Plusをチェックしてください。
00:06:17またお会いしましょう。