스크립트
00:00:00Anthropicが先週Claude Sonnet 5をリリースしましたが、期待外れでした。ただ、Fable 5が復活したのはせめてもの救いです。
00:00:04少し性能が落ちているかもしれませんが。あと、Claude Codeには中国語の使用を検知するための
00:00:09スパイウェアのようなコードが含まれている可能性があります。さっそく見ていきましょう。まずはSonnet 5からです。実はSonnetのアップデートは4ヶ月半ぶりで、
00:00:18Anthropicいわく、これまでで最もエージェント的なSonnetモデルとして構築されたそうです。
00:00:22Opus 4.8に近い性能をより低価格で実現しているとのこと。価格設定は非常に興味深いポイントなので、
00:00:28後ほど詳しく触れます。まずはAnthropicが提供するベンチマークを見てみましょう。
00:00:31すべての指標で前モデルを上回っており、一部の項目ではOpusに迫っています。
00:00:35Terminal BenchやComputer Useなどでは、ナレッジワークの分野でわずかながらOpusを凌駕しています。私は
00:00:40サードパーティのベンチマークを見るのが好きで、信頼しているのはArtificial Analysisのものです。その
00:00:44コーディングインデックスでは、Opusには数ポイント及びませんが、GPT 5.4よりはわずかに上です。前モデルのSonnet 4.6から
00:00:50非常に素晴らしい飛躍を遂げています。インテリジェンスインデックスでも同様で、
00:00:56GPT 5.5とGPT 5.4の間に位置していますが、興味深いことに、エージェントインデックスではGPT 5.5を上回りました。
00:01:03ブログでエージェント機能に注力したと書かれていた通り、それが実を結んだようです。
00:01:06ベンチマークを見る限り、かなり有能なモデルであり、Sonnet 4.6からの進化は間違いありません。次に価格について話しましょう。
00:01:10Sonnet 4.6からステップアップしていますが、気になる価格設定です。
00:01:14API価格についてですが、8月31日までは入力100万トークンあたり2ドル、
00:01:18出力100万トークンあたり10ドルという割引価格で提供されています。その後は
00:01:23他のSonnetモデルと同じ価格に戻る予定で、入力100万トークンあたり3ドル、出力100万トークンあたり15ドルになります。
00:01:28Gemini 3.5 FlashやGPT 5.6 Terra(もし利用できればですが)と同等の価格帯です。
00:01:34彼らが言うように、Opus 4.8よりは安いです。しかし問題は、実際にはそれが全く当てはまらない点です。
00:01:39このモデルは非常にトークンを消費します。Artificial Analysisのインテリジェンスインデックスでの
00:01:45タスク実行には約69,000トークンを使用しており、Sonnet 4.6、Opus 4.8、Fable 5、GPT 5.4、
00:01:52そして5.5よりも多い消費量です。この図で見ると、緑色の理想的なエリアからは
00:01:57可能な限り遠い位置にあります。当然、これはタスクの実際のコストに影響を与えます。
00:02:02Artificial Analysisによると、Sonnet 5はタスクあたりでOpus 4.8よりも高コストであることが分かりました。
00:02:07Fableに次ぐ高さです。さらに、ほとんどのベンチマークで結果が良いGPT 5.5と比べると、
00:02:12Sonnet 5の半額です。ここで注目すべきは、Artificial Analysisは
00:02:16割引価格ではなく標準価格を使用している点です。Anthropicが割引を延長するのか、
00:02:20あるいはこのままの価格設定で行くのか、非常に気になります。
00:02:25タスクごとのコスト以上に深刻なのは、テストスイート全体を実行するのに
00:02:29Sonnet 5はFable 5よりもコストがかかったという点です。一体何が起きているのでしょうか?
00:02:34Cursor Benchで見ても、Sonnet 5 Highは、同等の結果を得るためにOpus 4.8とほぼ同じコストがかかります。
00:02:39努力レベルを上げると、Sonnet 5 MaxはOpus 4.8のExtra Highよりも結果が悪く、
00:02:44コストはさらに高くなります。何か修正が必要な気がしてなりません。そうでなければ、
00:02:48このモデルの立ち位置が分かりません。決して悪いモデルではありませんが、経済性の観点からです。私は
00:02:54Sonnetモデルの熱烈なファンでした。私たちの多くが日常的に使い始めた最初のモデルだったと思います。
00:02:58しかしここ数ヶ月は常にOpus 4.8を使ってきましたし、今回の件で考えが変わることはありませんでした。
00:03:02特にFableが戻ってきたので、難しいタスクにはFableを、
00:03:05日常の作業にはOpus 4.8を使い、Sonnetは使わないという形になるでしょう。Fable 5の話をすると、輸出規制が
00:03:11解除され、市民権に関わらず誰でも利用できるようになりました。しかし残念ながら、
00:03:15プラン制限内で使える期間は1週間だけ(またはプラン制限の50%まで)で、7月7日以降は
00:03:20使用クレジット経由でしか利用できなくなります。当初の禁止に関するブログ記事には興味深い点がありました。
00:03:24これはAmazonの研究者がセキュリティの脆弱性を発見しようとしてプロンプトを指示した、
00:03:29いわゆる脱獄(ジェイルブレイク)が原因だったとされています。実際にエクスプロイトを実証したケースもありますが、
00:03:33調査の結果、AnthropicはClaude Opus 4.8、
00:03:37GPT 5.5、Kimi K 2.7など、多くのモデルがFable 5と同じ脆弱性を特定できることを発見しました。
00:03:43脆弱性を悪用する方法を実証するとなると、
00:03:47Claude Haiku 4.5、Sonnet 4.6、Opus 4.6、
00:03:524.7、4.8、GPT 5.4、5.5、Kimi K 2.7を含むテストしたすべてのモデルが実行できました。つまり、
00:03:58この禁止措置は無意味だったようです。結局、AnthropicがFableの
00:04:02セーフガードをより厳しくしただけで、普通のリクエストさえブロックされるようになってしまいました。発表の
00:04:06ツイートでは、デバッグやコーディングなどのルーチンタスクはOpus 4.8にフォールバックすると言っていましたが、
00:04:11後になってAnthropicの従業員が、ごく一部のみだと訂正しました。
00:04:14ただ、一部のベンチマークへの影響が大きく、Fableが「弱体化(nerfed)」されたという主張もあります。
00:04:18基本的にはOpus 4.8へのフォールバックが増えたせいで、ベンチマークのスコアがかなり下がっているのです。
00:04:23輸出規制や禁止の話に関連して、Claude
00:04:27Codeがシステムプロンプトの日付文字列を書き換えるという、非常に巧妙な方法で
00:04:32フィンガープリント(追跡)を試みていることに気付いた人がいます。詳細は素晴らしいブログ記事に
00:04:35書かれていますのでリンクを貼っておきますが、要するにClaude Codeにはタイムゾーンが
00:04:40中国かどうかを確認する関数があるということです。そうであれば、日付文字列のハイフンがスラッシュに変わります。
00:04:44さらにAPIベースのURLがリストと一致するか、ホスト名に特定のAI研究所のキーワードが含まれているかを確認し、
00:04:49一致する場合は、「today's」のアポストロフィを見た目がほとんど同じ別の
00:04:55Unicode文字に置き換えるのです。これはステガノグラフィーと呼ばれる非常に巧妙な技術です。
00:05:00ほとんどの人は影響を受けないでしょう。これは基本的に、API
00:05:03リセラーや不正なClaude Codeゲートウェイ、モデル蒸留攻撃を検知するためのものです。私は
00:05:08彼らがそれを阻止しようとすること自体には反対しませんが、もっと正直に
00:05:12Claude Codeに何が含まれているかを開示してほしいと思います。これについてどう思いますか?
00:05:16Sonnet 5とFableの復活についてどう感じましたか?コメント欄で教えてください。チャンネル登録もぜひ。
00:05:20それでは、また次の動画でお会いしましょう。