Claude Sonnet 3.5は期待外れかも… (でもFableが復活!)

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Anthropicが先週Claude Sonnet 5をリリースしましたが、期待外れでした。ただ、Fable 5が復活したのはせめてもの救いです。
00:00:04少し性能が落ちているかもしれませんが。あと、Claude Codeには中国語の使用を検知するための
00:00:09スパイウェアのようなコードが含まれている可能性があります。さっそく見ていきましょう。まずはSonnet 5からです。実はSonnetのアップデートは4ヶ月半ぶりで、
00:00:18Anthropicいわく、これまでで最もエージェント的なSonnetモデルとして構築されたそうです。
00:00:22Opus 4.8に近い性能をより低価格で実現しているとのこと。価格設定は非常に興味深いポイントなので、
00:00:28後ほど詳しく触れます。まずはAnthropicが提供するベンチマークを見てみましょう。
00:00:31すべての指標で前モデルを上回っており、一部の項目ではOpusに迫っています。
00:00:35Terminal BenchやComputer Useなどでは、ナレッジワークの分野でわずかながらOpusを凌駕しています。私は
00:00:40サードパーティのベンチマークを見るのが好きで、信頼しているのはArtificial Analysisのものです。その
00:00:44コーディングインデックスでは、Opusには数ポイント及びませんが、GPT 5.4よりはわずかに上です。前モデルのSonnet 4.6から
00:00:50非常に素晴らしい飛躍を遂げています。インテリジェンスインデックスでも同様で、
00:00:56GPT 5.5とGPT 5.4の間に位置していますが、興味深いことに、エージェントインデックスではGPT 5.5を上回りました。
00:01:03ブログでエージェント機能に注力したと書かれていた通り、それが実を結んだようです。
00:01:06ベンチマークを見る限り、かなり有能なモデルであり、Sonnet 4.6からの進化は間違いありません。次に価格について話しましょう。
00:01:10Sonnet 4.6からステップアップしていますが、気になる価格設定です。
00:01:14API価格についてですが、8月31日までは入力100万トークンあたり2ドル、
00:01:18出力100万トークンあたり10ドルという割引価格で提供されています。その後は
00:01:23他のSonnetモデルと同じ価格に戻る予定で、入力100万トークンあたり3ドル、出力100万トークンあたり15ドルになります。
00:01:28Gemini 3.5 FlashやGPT 5.6 Terra(もし利用できればですが)と同等の価格帯です。
00:01:34彼らが言うように、Opus 4.8よりは安いです。しかし問題は、実際にはそれが全く当てはまらない点です。
00:01:39このモデルは非常にトークンを消費します。Artificial Analysisのインテリジェンスインデックスでの
00:01:45タスク実行には約69,000トークンを使用しており、Sonnet 4.6、Opus 4.8、Fable 5、GPT 5.4、
00:01:52そして5.5よりも多い消費量です。この図で見ると、緑色の理想的なエリアからは
00:01:57可能な限り遠い位置にあります。当然、これはタスクの実際のコストに影響を与えます。
00:02:02Artificial Analysisによると、Sonnet 5はタスクあたりでOpus 4.8よりも高コストであることが分かりました。
00:02:07Fableに次ぐ高さです。さらに、ほとんどのベンチマークで結果が良いGPT 5.5と比べると、
00:02:12Sonnet 5の半額です。ここで注目すべきは、Artificial Analysisは
00:02:16割引価格ではなく標準価格を使用している点です。Anthropicが割引を延長するのか、
00:02:20あるいはこのままの価格設定で行くのか、非常に気になります。
00:02:25タスクごとのコスト以上に深刻なのは、テストスイート全体を実行するのに
00:02:29Sonnet 5はFable 5よりもコストがかかったという点です。一体何が起きているのでしょうか?
00:02:34Cursor Benchで見ても、Sonnet 5 Highは、同等の結果を得るためにOpus 4.8とほぼ同じコストがかかります。
00:02:39努力レベルを上げると、Sonnet 5 MaxはOpus 4.8のExtra Highよりも結果が悪く、
00:02:44コストはさらに高くなります。何か修正が必要な気がしてなりません。そうでなければ、
00:02:48このモデルの立ち位置が分かりません。決して悪いモデルではありませんが、経済性の観点からです。私は
00:02:54Sonnetモデルの熱烈なファンでした。私たちの多くが日常的に使い始めた最初のモデルだったと思います。
00:02:58しかしここ数ヶ月は常にOpus 4.8を使ってきましたし、今回の件で考えが変わることはありませんでした。
00:03:02特にFableが戻ってきたので、難しいタスクにはFableを、
00:03:05日常の作業にはOpus 4.8を使い、Sonnetは使わないという形になるでしょう。Fable 5の話をすると、輸出規制が
00:03:11解除され、市民権に関わらず誰でも利用できるようになりました。しかし残念ながら、
00:03:15プラン制限内で使える期間は1週間だけ(またはプラン制限の50%まで)で、7月7日以降は
00:03:20使用クレジット経由でしか利用できなくなります。当初の禁止に関するブログ記事には興味深い点がありました。
00:03:24これはAmazonの研究者がセキュリティの脆弱性を発見しようとしてプロンプトを指示した、
00:03:29いわゆる脱獄(ジェイルブレイク)が原因だったとされています。実際にエクスプロイトを実証したケースもありますが、
00:03:33調査の結果、AnthropicはClaude Opus 4.8、
00:03:37GPT 5.5、Kimi K 2.7など、多くのモデルがFable 5と同じ脆弱性を特定できることを発見しました。
00:03:43脆弱性を悪用する方法を実証するとなると、
00:03:47Claude Haiku 4.5、Sonnet 4.6、Opus 4.6、
00:03:524.7、4.8、GPT 5.4、5.5、Kimi K 2.7を含むテストしたすべてのモデルが実行できました。つまり、
00:03:58この禁止措置は無意味だったようです。結局、AnthropicがFableの
00:04:02セーフガードをより厳しくしただけで、普通のリクエストさえブロックされるようになってしまいました。発表の
00:04:06ツイートでは、デバッグやコーディングなどのルーチンタスクはOpus 4.8にフォールバックすると言っていましたが、
00:04:11後になってAnthropicの従業員が、ごく一部のみだと訂正しました。
00:04:14ただ、一部のベンチマークへの影響が大きく、Fableが「弱体化(nerfed)」されたという主張もあります。
00:04:18基本的にはOpus 4.8へのフォールバックが増えたせいで、ベンチマークのスコアがかなり下がっているのです。
00:04:23輸出規制や禁止の話に関連して、Claude
00:04:27Codeがシステムプロンプトの日付文字列を書き換えるという、非常に巧妙な方法で
00:04:32フィンガープリント(追跡)を試みていることに気付いた人がいます。詳細は素晴らしいブログ記事に
00:04:35書かれていますのでリンクを貼っておきますが、要するにClaude Codeにはタイムゾーンが
00:04:40中国かどうかを確認する関数があるということです。そうであれば、日付文字列のハイフンがスラッシュに変わります。
00:04:44さらにAPIベースのURLがリストと一致するか、ホスト名に特定のAI研究所のキーワードが含まれているかを確認し、
00:04:49一致する場合は、「today's」のアポストロフィを見た目がほとんど同じ別の
00:04:55Unicode文字に置き換えるのです。これはステガノグラフィーと呼ばれる非常に巧妙な技術です。
00:05:00ほとんどの人は影響を受けないでしょう。これは基本的に、API
00:05:03リセラーや不正なClaude Codeゲートウェイ、モデル蒸留攻撃を検知するためのものです。私は
00:05:08彼らがそれを阻止しようとすること自体には反対しませんが、もっと正直に
00:05:12Claude Codeに何が含まれているかを開示してほしいと思います。これについてどう思いますか?
00:05:16Sonnet 5とFableの復活についてどう感じましたか?コメント欄で教えてください。チャンネル登録もぜひ。
00:05:20それでは、また次の動画でお会いしましょう。

핵심 요약

Claude Sonnet 5は性能向上を果たしたものの、トークン消費効率が悪くコスト対効果の面で課題があり、日常作業にはOpus 4.8、高難度タスクには復活したFable 5を用いる運用が推奨される。

하이라이트

  • Claude Sonnet 5の価格は、API経由で入力100万トークンあたり3ドル、出力100万トークンあたり15ドルに設定されている。

  • Artificial Analysisのベンチマークによると、Sonnet 5はタスク実行あたり約69,000トークンを消費し、これは競合モデルの中で最も高い消費量である。

  • タスクごとの実行コストはSonnet 5がOpus 4.8を上回り、Fable 5に次いで高額である。

  • Fable 5に対する輸出規制は解除されたが、プラン制限内での無料利用は1週間限定で、7月7日以降はクレジット決済が必要となる。

  • Claude Codeには、中国語環境や特定のホスト名を識別し、ステガノグラフィーを用いてフィンガープリントを埋め込む検知関数が含まれている。

타임라인

Claude Sonnet 5の性能と市場評価

  • Sonnet 5は前モデルの4.6から大幅な進化を遂げ、エージェント性能でGPT 5.5を上回る。
  • ベンチマーク上ではOpus 4.8に迫る能力を有するが、期待値には届いていない。

4ヶ月半ぶりのアップデートとなるSonnet 5は、ナレッジワーク分野でOpus 4.8を一部凌駕する。Artificial Analysisの評価ではコーディングインデックスでGPT 5.4よりわずかに上位に位置し、エージェントインデックスではGPT 5.5を超える性能を示している。

コスト効率と経済性の課題

  • API価格は割引期間終了後、入力3ドル/出力15ドルとなる。
  • タスクあたりのトークン消費量が他モデルと比較して非常に多い。
  • 実運用コストはOpus 4.8より高く、経済的な合理性に欠ける。

API価格自体はOpus 4.8より安価に設定されているが、実際のタスク実行におけるトークン消費量が非常に多く、トータルコストはOpus 4.8や他モデルを上回る。Cursor Benchによる検証でも、高負荷なタスクにおいて性能向上とコストが見合っていないことが示唆されている。

Fable 5の復活と規制の現状

  • 輸出規制が解除され、制限付きで利用可能となった。
  • モデルの脆弱性は他モデルでも確認されており、禁止措置は実効性を欠いていた。
  • セーフガードの強化により、通常のルーチンタスクまでブロックされる副作用が発生している。

Fable 5の利用制限は一時的な解除にとどまり、7月7日以降はクレジット消費が必須となる。Anthropicによる脆弱性調査の結果、対象とされた脆弱性は他モデルでも共通であり、特定のモデルのみを規制する論理的根拠が弱かったことが露呈している。

Claude Codeのトラッキング機能

  • Claude Codeはタイムゾーンやホスト名を解析する関数を持つ。
  • 検知対象に対してUnicode文字を置き換えるステガノグラフィー技術を使用する。
  • モデル蒸留攻撃や不正なゲートウェイ利用を監視することが目的である。

Claude Codeにはシステムプロンプトの微細な変更を通じて、特定環境を識別する仕組みが組み込まれている。APIリセラーや不正なモデルコピーを阻止する狙いがあるが、その手法に透明性が欠けている点が指摘されている。

커뮤니티 글

모든 글 보기