Fable 5.1はこれまでの最高傑作(しかもFable 5より安い)

CChase AI
Computing/Software

Transcript

00:00:00Fable 5.1が登場しました。より高性能で安価になり、
00:00:02本日はその全容について
00:00:04お伝えしていきたいと思います。
00:00:05まずは価格についてです。
00:00:07Fable 5.1は、Fable 5よりも約25%安く抑えられており、
00:00:11これはキャッシュ読み取りの
00:00:13価格が引き下げられたためです。
00:00:14長時間の自律的なエージェント作業を行う場合には非常に大きく影響します。
00:00:19公式でも特筆されている通り、
00:00:21コスト削減効果は最大45%に達する場合もあり、
00:00:23何千もの膨大なトークンを扱い、
00:00:24コンテキストウィンドウを50%、60%、70%と
00:00:27フルに使って作業するようなケースでは
00:00:28特にその恩恵を受けられます。
00:00:30データ保持ポリシーもエンタープライズ顧客向けに
00:00:32順次アップデートが進められています。
00:00:34セーフガードの面に関しては、
00:00:35誤検知が削減されています。
00:00:37これが従来のFable 5では
00:00:38なかなかの悩みの種でした。
00:00:40例えばサイバーセキュリティ関連の
00:00:41質問を投げかけたときなど、
00:00:43頻繁にブロックされていましたが、
00:00:44今回は誤検知の発生率が60%減少しています。
00:00:49それではベンチマークを見ていきましょう。
00:00:50あらゆる面でFable 5、Opus 5、
00:00:53そしてGPT 5.6を文字通り圧倒しています。
00:00:56一部の向上幅はかなり顕著です。
00:00:58自律的な科学研究の分野においては、
00:01:00Fable 5の2倍のスコアを記録しています。
00:01:03コーディング分野でも大きな飛躍を遂げています。
00:01:05Fable 5の42%から、Fable 5.1では55.8%へと向上しています。
00:01:09Opus 5のベンチマークを見た当時のことを思い出しますが、
00:01:11その圧倒的な生データの数値には本当に驚かされました。
00:01:16実際には、ほとんどの人が依然としてOpus 5よりもFable 5を好む傾向にありますが、
00:01:19Fable 5と5.1の比較については、
00:01:23実際に使用したときの感覚として
00:01:24より正確に違いを実感できるものに
00:01:26なっていると感じています。
00:01:28それを除けば、他のベンチマークの向上は
00:01:29比較的緩やかなものです。
00:01:31せいぜい数パーセント程度の違いですが、
00:01:32例外となるのが自動化ベンチマークを用いた
00:01:34ビジネスワークフローです。
00:01:37さて、重要なのはベンチマークの数値そのものだけでなく、
00:01:39このようなスコアに対してどれだけのコストを支払っているか、
00:01:41そしてeffort(処理努力量)のレベルを変更したときに
00:01:43どのような変化が見られるかという点です。
00:01:44これを検証するのはいつも非常に興味深いことです。
00:01:46なぜなら、特高(extra high)や
00:01:48最大(max)レベルに設定しても、
00:01:49高(high)や中(medium)の設定と比べて
00:01:51費用対効果があまり見合わないことが多いためです。
00:01:53こちらはTerminal Bench 4.0の結果です。
00:01:56一番上にMythos 5.1があり、
00:01:59中央にFable 5.1、
00:02:00そして下方にMythos 5が位置しています。
00:02:02Fable 5はそのMythosのわずかに下にあるとイメージしてください。
00:02:05そのため、Fable 5.1とMythos 5.1は
00:02:07Mythos 5に比べて明らかに大きな進化を遂げており、
00:02:10しかも安価になっています。
00:02:12本当に素晴らしいのは、
00:02:13例えば「高(high)」のような設定を見た場合です。
00:02:15ここには多くの人が設定しているかと思います。
00:02:16私自身もFableを使う際は
00:02:17「中(medium)」をよく使っていますが、
00:02:20要するに、
00:02:20中レベルを見ると、
00:02:21Mythos 5の最大出力と同等のパフォーマンスでありながら、
00:02:25費用は26ドルではなく
00:02:277ドル80セントで済むということです。
00:02:30そして高レベルに設定し、
00:02:32それを例えば最大(max)と比較すると、
00:02:34出力の差はせいぜい
00:02:356%程度しか変わらないにもかかわらず、
00:02:38価格は19.50ドルに対して10.50ドルとなります。
00:02:42したがって、これらの新しいモデルの素晴らしい点は、
00:02:43中間あたりのeffortレベルで
00:02:45極めて高いパフォーマンスを発揮し、
00:02:47コストを大幅に抑えられるという点です。
00:02:50この傾向は他のベンチマークでも
00:02:52同様に見られます。
00:02:53こちらはHumanity's Last Examです。
00:02:55こちらでも、高から最大へと
00:02:57引き上げても劇的な向上は見られず、
00:02:59中間層の設定であっても
00:03:00非常にリーズナブルなコストで
00:03:02非常に優れたパフォーマンスが得られます。
00:03:04唯一の例外と言えるのが、
00:03:05Cursor Benchでのエージェントコーディングです。
00:03:07Fable 5.1では、
00:03:08高から特高(extra high)への移行でかなり大きな伸びが見られますが、
00:03:11やはり特高と最大の間では
00:03:13大差ありません。
00:03:14しかし、Fable 5.1で
00:03:15「高」に設定している場合、
00:03:17それはFable 5の「特高」と同等でありながら、
00:03:20コストは半分以下に抑えられます。
00:03:22ですから、必ずしも極めて複雑な作業を
00:03:24行うわけではない人にとっても、
00:03:25ここで巨額のコスト削減効果が得られます。
00:03:27いわゆる「一人開発者」のような立場であって、
00:03:30直面する課題がそれほど複雑でなくとも、
00:03:32最先端モデルを使いたいという場合、
00:03:33effortレベルを下げさえすれば、
00:03:36これまでと同等の作業を
00:03:37こなしつつ、
00:03:38コストを半減させることができます。
00:03:40このメリットはいくら強調してもし足りません。
00:03:41さて、科学研究はこれまでも
00:03:42FableおよびMythosモデルの
00:03:44大きなウリとなってきました。
00:03:46今回の5.1のリリースでも、その点に変わりはありません。
00:03:49分子デザイン、計算解析およびモデリング、
00:03:53そして計算生物学などが多く語られています。
00:03:55これらも特定のユーザーが解決に挑んでいる
00:03:57比較的ニッチな問題ではありますが、
00:03:58標準的な自律コーディングベンチマークでの
00:04:00パフォーマンスと比較して、
00:04:01こうした領域で何が起きているかを見るのも
00:04:03常に興味深いところです。
00:04:05オープニングでも触れたように、
00:04:07安全性、セキュリティ、
00:04:08およびアライメントに関しても
00:04:09いくつかの変更が加えられています。
00:04:11大局的に見れば、
00:04:12誤検知が減少しています。
00:04:13サイバーセキュリティ関連の質問を
00:04:14より多く投げかけることが可能になり、
00:04:15モデル側も無暗に動揺して
00:04:18問答無用でOpusに切り替えてしまうようなことが
00:04:19なくなっています。
00:04:20さらに深く掘り下げたい場合は、
00:04:21いつでもシステムカードを確認できます。
00:04:24これは、何百ページ、
00:04:27正確には212ページに及ぶものですが、
00:04:28わかりやすい概要が提供されています。
00:04:30ユーザーとして把握しておくべきなのは、
00:04:31こうしたガードレールが
00:04:32より精密になり、
00:04:33無害なコンテンツを
00:04:34誤ってフラグ付けして
00:04:35下位モデルに飛ばしてしまうことが
00:04:36減ったという点です。
00:04:37特にサイバーセキュリティに関する質問において、
00:04:40Cloud Codeユーザーは、
00:04:40セーフガードによる
00:04:41セッションあたりの介入回数が平均して
00:04:4360%減少することを
00:04:44期待できます。
00:04:46これは、
00:04:46特定のユースケースにおける
00:04:48ベストプラクティスについて質問する必要がある
00:04:49アプリケーション開発に取り組む人にとって
00:04:51非常に素晴らしいことです。
00:04:53また、
00:04:53興味深い段落として
00:04:55蒸留(ディスティレーション)対策メカニズムについても触れられています。
00:04:57これは、Fable 5や
00:04:58本質的に抽出する
00:04:59Fable 5から最高の結果を
00:05:01引き出し、Fable 5.1
00:05:02を他のモデルで使う方法です.
00:05:03これは非常に大きな
00:05:04議論の一つであり
00:05:05オープンソースモデルに
00:05:06関連しています.
00:05:07ご存じのとおり、こうした
00:05:08非常に優れた
00:05:08オープンソースモデルの登場に
00:05:09ついては,
00:05:10今後も間違いなく
00:05:11次々と登場し続けるでしょう.
00:05:13それらは最先端モデルから
00:05:14知識を蒸留しているからです.
00:05:15ですから、これは
00:05:17注目しておきたい
00:05:17種類の話題の
00:05:18一つと言えます.
00:05:18エンドユーザーである皆さんに
00:05:20直接の影響はありませんが,
00:05:21何というか,
00:05:22一種のメタ的な話です.
00:05:23中国発のこうした
00:05:24オープンソースモデルが
00:05:25多数存在する一方で,
00:05:26最先端企業の多くは
00:05:26米国に拠点を置いており,
00:05:27いつでもこのような,
00:05:28いわば,
00:05:29議論が交わされています.
00:05:31つまり、これらすべての
00:05:32オープンソースモデルは
00:05:32実際には単に
00:05:33OpusやFableといった
00:05:35ものから拝借しているだけだ
00:05:36その仕組みの
00:05:37一例として挙げられています
00:05:38新規のAPIアカウントでは
00:05:39Claudeの
00:05:40過去のコンテキストを編集して
00:05:42Claudeがどのように考えて
00:05:43答えを導き
00:05:44出しているのかを
00:05:44本質的に
00:05:45抽出できないようになっています
00:05:46そして繰り返しになりますが
00:05:46これは特に
00:05:47新規アカウントが対象なので
00:05:48すでにアカウントをお持ちであれば
00:05:48これもまた
00:05:49特に影響はありません
00:05:50続いて費用と
00:05:51可用性についてですが
00:05:52可用性に関しては
00:05:52利用可能です
00:05:53現在はどこでも。
00:05:54費用面では
00:05:55トークン単価で見ると
00:05:56Fable 5と
00:05:56まったく同じになっています
00:05:58入力トークンが
00:05:58100万トークンあたり10ドル
00:05:59出力トークンが
00:06:00100万トークンあたり50ドルですが
00:06:02実際のところ
00:06:03ですが実際には、
00:06:04実際にこれを
00:06:05例えば、
00:06:06こういう作業を
00:06:07させるときには、
00:06:08費用はもっと抑えられ、
00:06:09さらに安くなるのは
00:06:10キャッシュ読み込みのおかげです。
00:06:12さて、プロンプトキャッシュが
00:06:12何か全くわからない場合は、
00:06:14先週投稿した
00:06:14そのことについて話している動画を
00:06:16チェックしてみてください。
00:06:18基本的に、
00:06:18これは
00:06:19長時間実行される
00:06:20エージェントタスクを
00:06:20行う人にとって非常に大きいです。
00:06:23つまり、
00:06:23非常に大きなセッションがあり、
00:06:25膨大なコンテキストがあり、
00:06:26それを継続的に
00:06:27使用している場合です。
00:06:28何かを処理させて
00:06:29翌日戻ってくるような
00:06:29使い方ではなく、
00:06:30ずっと対話を
00:06:31重ね続けているような
00:06:32状態です。
00:06:32そのため、このキャッシュ読み込みは
00:06:33コストが75%削減されます。
00:06:35これは大きな変更であり、
00:06:37それがこうしたコストの低下に
00:06:39つながっています。
00:06:40このグラフが
00:06:41それを物語っています。
00:06:42通常のタスクにおけるコストは
00:06:42およそ25%削減され、
00:06:44通常のタスクではその程度ですが、
00:06:45重ねてになりますが、
00:06:46エージェント的な高負荷な作業では
00:06:47最大45%も削減されます。
00:06:49したがって、Fableモデルの
00:06:49アップグレードが行われるのは
00:06:50本当に素晴らしいことです。
00:06:51私はFableが大好きでしたが、
00:06:53Opus 5のときは
00:06:53少し微妙な感じがしました。
00:06:54しかし、これまで
00:06:55Fableを実際に触ってきた
00:06:56方々なら、
00:06:57きっとこう同意して
00:06:58いただけるはずです。
00:06:59Anthropicから提供されてきた
00:07:01他のどのモデルと比べても、
00:07:02このモデルがもたらす変化は
00:07:03非常に大きなものだと
00:07:03実感しているはずです。
00:07:04ですから、より優れていて
00:07:05費用も安く、
00:07:06さらに安くなり、
00:07:07ガードレールについても
00:07:09あまり心配しなくてよいものが
00:07:10手に入るのは素晴らしいことです。
00:07:11ぜひチェックしてみてください。
00:07:12感想を
00:07:13教えてくださいね。

Key Takeaway

Fable 5.1はFable 5から価格が最大45%引き下げられ、科学研究やコーディングの性能が大幅に向上した。

Highlights

  • Fable 5.1はFable 5よりも約25%安く抑えられており、最大45%のコスト削減効果を発揮する。

  • サイバーセキュリティに関する質問時におけるセーフガードの誤検知発生率が60%減少した。

  • 自律的な科学研究の分野において、Fable 5の2倍のスコアを記録している。

  • コーディング分野のベンチマークがFable 5の42%から55.8%へと向上した。

  • プロンプトキャッシュ読み取りのコストが75%削減されている。

Timeline

価格改定とコスト削減効果

  • Fable 5.1はFable 5に比べて価格が約25%安くなっている。
  • キャッシュ読み取り価格の引き下げにより、最大45%のコスト削減効果がある。
  • サイバーセキュリティ関連の質問における誤検知の発生率が60%減少した。

キャッシュ読み取りの価格改定により、長時間の自律的なエージェント作業を行う際に大きなコスト削減効果をもたらす。コンテキストウィンドウをフルに使って作業するケースで特に恩恵が大きい。また、従来のFable 5で課題となっていたサイバーセキュリティ関連の質問時の誤検知が大幅に減少し、開発作業時の利便性が向上している。

ベンチマーク結果と性能向上

  • 自律的な科学研究の分野でFable 5の2倍のスコアを記録している。
  • コーディング分野のスコアが42%から55.8%へと向上している。
  • 中程度のeffort設定でもMythos 5の最大出力と同等のパフォーマンスを発揮する。

Fable 5.1はあらゆる面で従来のモデルを圧倒し、特に科学研究やコーディング分野で顕著な向上幅を見せている。ベンチマークの数値だけでなく処理努力量(effort)の変更による費用対効果が優れており、中程度のジュニア設定を活用することでコストを大幅に抑えながら高いパフォーマンスを得られる。

安全性ガードレールと可用性・費用

  • サイバーセキュリティに関するセッションあたりの介入回数が平均60%減少している。
  • 新規APIアカウントではコンテキストの抽出を防ぐ蒸留対策メカニズムが導入されている。
  • 通常のタスクで約25%、高負荷なエージェント作業では最大45%のコスト削減が実現されている。

ガードレールがより精密になり、無害なコンテンツの誤判定による下位モデルへの移行が減少した。オープンソースモデルに対する蒸留対策として新規アカウントでの設計変更が行われている一方、通常のトークン単価はFable 5と同等でありながらプロンプトキャッシュ等により実質的な運用コストが大幅に低下している。

Community Posts

No posts yet. Be the first to write about this video!

Write about this video