Sonnet 5が登場!Opusに匹敵する性能

CChase AI
컴퓨터/소프트웨어창업/스타트업경영/리더십

스크립트

00:00:00AnthropicがSonnet 5をリリースしました。知っておくべきことをすべて解説します。
00:00:04まずはベンチマークから始めましょう。Sonnet 5は、
00:00:08OpusやFableといったモデルよりも性能が低く、安価なモデルであることを覚えておいてください。アップグレードは
00:00:134.6以来となります。5と4.6を比較すると、エージェントによるコーディング、
00:00:21学際的な推論、コンピュータ使用、ナレッジワークにおいて大幅な飛躍を遂げています。全面的に
00:00:26アップグレードされています。では、Opus 4.8と比較した場合はどうでしょうか。差があるかどうかが問題ではなく、
00:00:32どれくらい性能が落ちるかが重要ですが、実際にはそれほど大きな落ち込みはありません。それどころか、
00:00:39ナレッジワークの数値はより優れており、驚くほどです。コンピュータ使用はわずか2%差で、
00:00:44エージェントによるコーディングも2%の差、学際的な推論でも
00:00:49わずか数パーセントの差です。最大の差はSweebench Proで、63%対69%という結果でした。
00:00:56しかし、Terminal Bench 2.1では80%対82%です。大きな差ではありません。この性能についての議論は、
00:01:03価格との関連で考える必要があります。Fable 5とMythos 5は、
00:01:08入力トークンあたり10ドルで、Opusの2倍です。Opusは100万入力トークンあたり5ドルです。
00:01:16出力は25ドルです。つまり5ドルと25ドルですね。Sonnet 5は2ドルで、
00:01:26Opusの入力トークンコストのわずか40%です。出力は10ドルです。大幅に安く、
00:01:34Opusの半分以下のコストです。しかし数値を見るとかなり近いです。ですから、
00:01:40AIで最先端の作業をする必要はないけれど、より日常的なタスクに使い、
00:01:46なおかつ高い性能を求めている人にとっては、Sonnet 5はまさにその穴を埋める存在です。では、
00:01:51ベンチマークを超えたチャートを見ていきましょう。ここでは努力レベル別のエージェント検索性能を、
00:01:55Opus 4.8、Sonnet 5、Sonnet 4.6で比較しています。すぐに気づくのは、Sonnet 5の
00:02:04努力レベル間の合格率の大きな差です。低(Low)では55%です。しかし、
00:02:13Sonnet 4.6の「低」の方が成績が良いのです。しかしコストの面では遥かに安いです。
00:02:19「中(Medium)」に移ると、基本的にSonnet 4.6と同じ性能を、
00:02:25大幅な割引価格で得られます。そして「高(High)」の努力レベルに移行して初めて、
00:02:34Sonnet 4.6を上回り始めます。しかしその時点では、Sonnet 4.6よりも優れた性能を得られても、
00:02:41コストはSonnet 4.6の「低」レベルの時と同じくらいになっています。この努力レベルによる区別は、
00:02:49とても重要だと思います。Sonnet 5が全般的に優れているわけではなく、
00:02:535の「低」が必ずしも4.6の「低」より優れているとは限りません。Sonnet 5の「低」は、単に
00:02:59非常に安くなるという意味です。しかし、これまで見てきたような高レベルの性能を得るには、
00:03:03高努力レベルの作業が必要になるでしょう。とはいえ、
00:03:08Sonnet 5で「高」を使う場合、Opusでかかる費用とほぼ同じ額を支払うことになります。Opusの「中」や
00:03:14「高」はSonnetの「高」と同額ですが、合格率は高くなります。この点が議論にニュアンスをもたらします。
00:03:21エージェント検索などでSonnet 5対Opus 4.8を使い分けるべきでしょうか?
00:03:27最終的には問題の複雑さ次第だと思います。複雑な問題であれば、結局のところOpus 4.8の方が
00:03:33トークン効率が良いので安くなる可能性があります。Sonnetではそのタスクに適さないからです。
00:03:38しかし、AIモデルにとってそれほど難しくないタスクであれば、
00:03:44Opus 4.8を使う意味がないかもしれません。そこでSonnet 5の出番です。
00:03:49どのモデルを使うべきかはケースバイケースという、興味深い状況にあります。
00:03:54もう一つ興味深いのが、エージェントによるコンピュータ使用です。概して、
00:03:58ほとんどの場合、Sonnet 5はSonnet 4.6を上回っており、非常に低コストで実行できます。
00:04:05エージェント検索ではそうとは言い切れませんでしたが、コンピュータ使用に関しては、
00:04:09急に4.6よりSonnet 5を使うべき状況になりました。これも、
00:04:14どのモデルを使うべきかはケースバイケースであるという考えに立ち返ります。興味深いことに、Opusを見てください。Opusの「高」は
00:04:20Sonnet 5の最大設定よりも良い性能を発揮し、しかも安価です。つまり、これらを見ると
00:04:26Opusは実際のところ、その機能に対してかなり効率的だと言えます。言うまでもなく、
00:04:30Sonnetには到達できない高いレベルに達します。ですので考えるべき点として、
00:04:36100万トークンあたりのコストがOpusの方が安くても、Opusが最適なケースはまだたくさんあります。さて、
00:04:41Anthropicのモデルリリースについて、モデルの誤った動作について触れずに終われません。Sonnet 5は改善されていますが、
00:04:45Opus 4.8やMythos Previewで期待されるレベルにはまだ達していません。そして、
00:04:50Mythosの使用をほぼ制限させたエクスプロイトやサイバーセキュリティの問題ですが、
00:04:55Sonnetクラスでは心配する必要はありません。全体として、私はこれらのベンチマークをあまり重視しません。
00:04:59正直なところ、こうしたベンチマークやチャートを見ると躊躇してしまいます。
00:05:05問題はSonnet 5対4.6ではないと思うからです。基本的にはいつでもSonnet 5を使うでしょう。
00:05:11問題はSonnet 5対Opus 4.8です。Opusの方が実際に安いのか?
00:05:18Anthropicには、どこが分岐点になるのかをもっと明確に示すような
00:05:24テストをもっと行ってほしいです。つまり「ここならSonnet 5で十分でOpusより安い」
00:05:29と「これは複雑なタスクなので、完了させるにはOpusの方が効率的だ」という
00:05:34境界線です。考えるべき点ですね。確かに便利な存在です。全体として、
00:05:40低レベルのタスクにおいてSonnetは恩恵となるでしょう。なぜなら、APIトークンを
00:05:46使用する私たちにとって、Claude Max Planのエコシステム外のアプリケーションだと、
00:05:51Anthropicを使うのはコスト的に非常に厳しいからです。ずっと言ってきたのは、
00:05:55OpenAIの小型モデルを見るようにということでした。多くの人の仕事にはそれで十分なことが多いためです。
00:05:59これでAnthropicでもミドルティアの選択肢ができたので、嬉しいことです。
00:06:05今日はここで終わりにします。どこでも利用可能です。どれが一番理にかなっているかを
00:06:09見極めるには、多くの試行錯誤が必要になると思います。皆さんはどう思いましたか?
00:06:13私のClaude Code Masterclassに興味がある方は、ぜひChase AI Plusをチェックしてください。
00:06:17またお会いしましょう。

핵심 요약

Sonnet 5はSonnet 4.6より大幅に安価で、日常的なエージェント作業においてOpus 4.8に近い性能を提供する、Anthropicの中位層モデルである。

하이라이트

  • Sonnet 5の入力コストは100万トークンあたり2ドルであり、Opus 4.8の入力コスト5ドルの40%に抑えられている。

  • Sweebench Proにおける性能はSonnet 5が63%、Opus 4.8が69%を記録している。

  • 低努力レベルのタスクではSonnet 4.6の方がSonnet 5よりも高い合格率を示すケースがある。

  • エージェントによるコンピュータ使用タスクにおいて、Sonnet 5は多くの場面でSonnet 4.6を上回る性能を発揮する。

  • 複雑なタスクでは、トークン効率の観点からOpus 4.8の方が総コストを低く抑えられる場合がある。

타임라인

Sonnet 5の性能とコスト

  • Sonnet 5はSonnet 4.6からの全面的なアップグレードである。
  • Opus 4.8との性能差は、ナレッジワークやコーディングにおいて数パーセント程度に留まる。
  • 入力コストは100万トークンあたり2ドル、出力コストは10ドルであり、Opusの半分以下の価格設定である。

Sonnet 5はOpusやFableよりも下位の位置付けだが、ベンチマーク上ではOpus 4.8に対して大きな性能低下は見られない。特にナレッジワークやコーディングタスクでは僅差であり、低コストで高い性能を求めるユーザーにとって、日常業務をカバーする有効な選択肢となる。

努力レベル別性能とモデル選択

  • 低努力レベルの作業では、Sonnet 4.6の方が合格率が高い場合がある。
  • Sonnet 5は高努力レベルの作業に移行して初めてSonnet 4.6を上回る性能を示す。
  • コンピュータ使用タスクでは、ほとんどのケースでSonnet 5がSonnet 4.6を上回る結果を出している。

努力レベル設定を調整することでコストと性能のバランスが変化する。Sonnet 5は高負荷な作業で本領を発揮するが、単純なタスクでは過去モデルの方が効率的な場合がある。一方でコンピュータ操作においてはSonnet 5の優位性が顕著であり、タスク内容に応じた柔軟なモデル選定が必要である。

運用の境界線と今後の展望

  • 複雑な問題ではOpus 4.8の方がトークン効率が良く、最終的なコストが安くなる可能性がある。
  • API経由でAnthropicを利用するユーザーにとって、ミドルティアモデルの選択肢が追加されたことは重要である。
  • どのモデルがコスト効率的かを見極めるためには、タスクの複雑さに応じた試行錯誤が必要である。

モデルの誤動作やセキュリティリスクに関してはSonnet 5で大幅な心配は不要だが、Opusと使い分ける明確な境界線はまだ不透明である。AIの利用においてコストを最適化するためには、単純なタスクでのSonnet 5活用と、複雑なタスクでのOpus活用を戦略的に組み合わせることが推奨される。

커뮤니티 글

모든 글 보기