あなたはClaude Fable 5.1を間違えて使っている…代わりにこうしよう

AAI LABS
컴퓨터/소프트웨어

스크립트

00:00:00Fable 5.1はAnthropic社の最新モデルであり、現在利用できる最高のモデルの1つです。
00:00:05しかし、これまでのモデルとは挙動が異なるため、
00:00:09使い方を少し変更する必要があります。従来のモデルと同じように使っていると、
00:00:13その実力を十分に引き出せず、むしろ悪い結果を招く可能性さえあります。
00:00:18例えば、Anthropic社はこのモデルが長時間のタスクに最適だとしていますが、
00:00:23それは特定のプロンプトの与え方をした場合の話です。また、Anthropic社が
00:00:28高く設定することを推奨しているものの、実際には結果を悪化させている設定が1つあります。
00:00:32初めての方へ、私たちはソフトウェア企業であり、このチャンネル「AI Labs」では、
00:00:37Fable 5.1を最大限に活用するための7つのコツをご紹介します。そのコツに入る前に、
00:00:42この新しいモデルについていくつかお伝えしておくべきことがあります。Fable 5.1のリリース時、
00:00:48Anthropic社はこのモデルがタスクの完了において圧倒的に優れていると主張しました。
00:00:54しかし、Fable 5.1が優れているのは仕事の質ではなく、より少ないコストで多くの仕事を
00:01:00こなせる点にあります。私たちのクライアントプロジェクトで検証したところ、Fable 5と
00:01:05Fable 5.1に同じタスクを与えてそれぞれ複数回実行しました。プロジェクトの詳細はお見せできませんが、
00:01:10ほとんどのタスクではFable 5のほうが優れた成果を出し、Fable 5.1が勝ったのは1つだけでした。
00:01:16それは群を抜いて最も難しいタスクで、Fable 5.1はその品質が高く、処理速度は40%ほど速く、
00:01:22費用は半分以下でした。つまり、Fable 5.1は仕事が難しくなるほど強みを発揮します。また、
00:01:27品質で勝てなかったタスクでも、最後までやり通しました。Fable 5が途中で止まってしまった試行も、
00:01:33Fable 5.1はすべて最後まで完遂しました。しかも、すべてのタスクでコストが抑えられています。
00:01:38ご存知かもしれませんが、Claude Codeには、サブスクではなく都度払いだった場合のセッション費用を
00:01:45概算するusageコマンドがあります。その試算では、Fable 5.1はFable 5より約47%安価でした。
00:01:50しかし、モデルが突然少ないトークンを使用するようになったから安いわけではありません。
00:01:55Anthropic社の価格設定が変更されたためです。その価格変更の話の前に、1つ知っておくべきことがあります。
00:02:00タスクの実行時間が長くなるほど、会話の履歴は長くなります。その結果、モデルは新しいプロンプトに
00:02:05答える前により多くのテキストを読み込む必要があります。モデルはメッセージ間で会話を自動記憶しているわけでは
00:02:10ないため、応答を返すたびに会話全体をもう一度送信し直す必要があります。
00:02:16しかし、毎回最初から同じ会話を処理するのではなく、Claudeは既に処理した部分の保存コピーを保持し、
00:02:21次のプロンプト入力時にそれを再利用します。これは基本的にキャッシュ読み取りと呼ばれます。
00:02:27このキャッシュ読み取りにもコストはかかりますが、通常の入力や出力に比べて安価です。Fable 5.1では、
00:02:33Anthropic社はこの価格を75%削減しました。そのため、応答前に再送信される会話のコストが大幅に下がりました。
00:02:391回のプロンプトでは、送信する会話が少ないためこの節約は小さく見えるかもしれません。
00:02:44しかし長時間のタスクでは、膨らみ続ける会話が何度も送信されるため、モデルが応答するたびに節約効果が大きくなります。
00:02:50いま説明したのは読み取りの話だけであり、モデルが書き出す出力の価格は別個であり、そちらは変更されていません。
00:02:55モデルを独自にテストして評価しているArtificial Analysis社によると、
00:03:01Fable 5.1はFable 5よりもはるかに多くのテキストを記述することがわかりました。そのため、読み取りが安くなっても
00:03:07請求額は増加しました。テストでは、Fable 5の約1.7倍の出力を生成し、タスクあたりの費用は約20%高くなりました。
00:03:14Anthropic社のFableモデルにはセーフティガードレールがあり、特定の種類のタスクを実行しないように
00:03:19制限するルールが存在します。Fable 5.1では、このガードレールがClaude Codeのセッションを中断する頻度が
00:03:25約60%減少したとAnthropic社は述べています。しかし、いざガードレールに抵触した場合、
00:03:31Claude Codeはユーザーに知らせることなく、より性能の低いモデルに切り替えて処理を続行します。
00:03:36その下位モデルは、次のお願いがトリガーとなった理由とは全く関係のない内容であっても、セッションの残りを処理し続けます。
00:03:41つまり、拒否される代わりに精度の低い作業結果を得ることになり、それをFable 5.1が生成したものだと思い込んでしまいます。
00:03:46これは、ジョークファイル内に「biological」という単語が含まれていたゲームを開発していた人物に実際に起きました。
00:03:51プロジェクト自体は生物学とは何ら関係がありませんでしたが、たったその1語だけで処理モデルが切り替わるには十分でした。
00:03:55もし実際のプロジェクトがセキュリティや生物学など、ガードレールが対象とするテーマを扱っている場合、
00:04:00これを回避する設定や言い回しは存在しません。これはFable 5.1でどうしても生じてしまうコストなのです。
00:04:06Artificial Analysis社のテストによると、Fable 5.1は正確性においてFable 5より高得点をマークしていますが、
00:04:13ハルシネーション(モデルが答えを知らないときに嘘を創り出し、真実であるかのように提示する現象)も多くなります。
00:04:18Fable 5.1が答えを知らなかった際、72.6%の確率でハルシネーションを起こしました(Fable 5は63.6%)。
00:04:26分からないと正直に言うモデルのほうが、何でも知っているふりをするモデルよりも優れています。
00:04:31なぜなら自分で確認しに行けるからです。しかし、モデルが嘘をでっち上げ、その言葉を信じてしまうと、
00:04:35その間違った答えがそのままあなたの成果物に紛れ込んでしまいます。
00:04:40リサーチや執筆で使っている場合、検証作業が後から丸ごと追加されるため、これはさらに重要になります。
00:04:45コツに移る前に、チャンネル登録と高評価ボタンを押していただけると幸いです。この小さな応援が
00:04:50私たちの大きな励みになります。さて、こうした点を聞くと、古いモデルのほうが一部の側面では明らかに
00:04:56優れていると思われるでしょう。それは事実ですが、同時に、今後利用するアプリのデフォルトモデルに
00:05:01なっていくのも間違いありません。だからこそ、これからお話しするコツに従う必要があります。
00:05:06そうしないと、そのポテンシャルを十分に引き出すことはできません。さて、Fable 5.1を
00:05:11実際にうまく使いこなすための最初の方法は、「effort(労力)」の設定を下げることです。
00:05:16ご存知ない方のために説明すると、effortとは、モデルが回答を生成する前にどれだけの労力をかけるかを
00:05:21決める設定です。このたった1つの設定が、仕事の質とコストの両方に影響を与えます。
00:05:26コードレビューツールを提供しているCode Rabbit社が、実際のレビュー業務でFable 5.1をテストしたところ、
00:05:33低労力(low)設定では問題の61%を見つけたのに対し、高労力(high)では57.1%にとどまり、
00:05:39しかも処理は約3分早くなりました。コミュニティサイトに機能を追加するためにFable 5.1を使用した際も、
00:05:44同様の現象が見られました。高労力では機能の一部について行ったり来たりに多くの時間を費やした一方、
00:05:49低労力では全体をサクッと完了させ、より良い結果を出してくれました。前のFableの動画でも
00:05:54低労力を推奨しましたが、Fable 5.1を使った現在でも、変わらず低労力を推奨します。
00:06:00まずは低労力から始め、結果に理由がある場合にのみ引き上げるべきです。そうしないと、
00:06:05大した見返りもないまま時間とトークンを浪費することになります。次にすべきことは、
00:06:10古いモデル向けに書いた指示を削除することです。それらの指示は、修正対象の挙動がなくなったにもかかわらず、
00:06:15Fable 5.1に切り替えてもセットアップ内に残り続けます。そのため、Fable 5.1は
00:06:21もう存在しない問題に対する修正リストの数々に従わされ続けます。それらはリミットを無駄に消費するだけであり、
00:06:25一部の指示は新たな問題を引き起こします。これについては前回の動画でも触れました。
00:06:30どの指示が重要でどれが不要なのかどうやって見分ければよいかと思うかもしれません。Claude.mdから
00:06:36指示を1つ外して、Claudeに同じような作業をさせてみることでテストできます。外しても結果が同じであれば、
00:06:41その指示はもう必要ありません。ですが、すべてを自分一人でする必要はありません。Claude Codeには
00:06:46「Claude API Prompt Audit」というコマンドがあり、そうした不要な指示を見つけ出してくれます。
00:06:51ターミナルでこのコマンドを実行すると、Claude用に保存したすべてをチェックしてくれます。
00:06:56そして、どの指示が古いモデル向けに書かれたものかを示し、推奨される正確な変更内容を提示してくれます。
00:07:01勝手に変更されることはないため、まずリストを確認して、賛同する変更だけを承認することができます。
00:07:06次のコツに進む前に、スポンサーであるPorkbunのご紹介です。アプリをやっとリリースしたものの、
00:07:12適当なデフォルトURLのままになっており、本当に必要なのはちゃんとした独自のドメインだと気付くことがあります。
00:07:18そこでPorkbunの出番です。テックプロジェクト向けに作られた.appや.devドメインが揃っています。
00:07:23.appドメインはアプリやSaaSのランディングページに最適で、.devはコーディングポートフォリオや
00:07:28ドキュメント用に作られているため、見た瞬間に本物のプロジェクトだと分かります。
00:07:33これらは単に名前が良いだけではありません。.appや.devドメインはすべてHSTSプリロードリストに登録されており、
00:07:39設定不要ですべての接続で自動的にHTTPS化され、無料のSSL証明書も含まれているため、
00:07:45サイトは最初から安全です。何より、初年度はわずか5.99ドルで取得でき、無料のWHOISプライバシー保護や、
00:07:52面倒なアップセル、隠し費用もありません。2年目以降も更新料は原価のままなので、長期的に安く維持できます。
00:07:58[porkbun.com/ailabs26で5.99ドルからドメインを手に入れましょう](https://www.google.com/search?q=https%3A%2F%2Fporkbun.com%2Failabs26%E3%81%A75.99%E3%83%89%E3%83%AB%E3%81%8B%E3%82%89%E3%83%89%E3%83%A1%E3%82%A4%E3%83%B3%E3%82%92%E6%89%8B%E3%81%AB%E5%85%A5%E3%82%8C%E3%81%BE%E3%81%97%E3%82%87%E3%81%86)。リンクは下の概要欄にあります。
00:08:03さて、Anthropic社はFable 5.1を、あまり監視せずに放置できる長時間のジョスク向けとして販売していますが、
00:08:09元のリクエストですでにカバーされている手順を実行する前にも、依然として一時停止して許可を求めてきます。
00:08:14ただ質問して待機するだけであり、誰も答える人がいない環境では、待機することは停止するのと同じ意味になります。
00:08:19これは、モデルの通常の挙動がユーザーの並行作業を前提としているために起こります。
00:08:24そのため、Fable 5.1向けのAnthropic社のプロンプトガイドでは、誰も監視していないこと、
00:08:29そして元に戻せる変更であれば、リクエストですでにカバーされている内容についてはそのまま続行すべきだと
00:08:34プロンプトで指示する必要があるとされています。これにより、モデルは不要な質問で停止することなく長時間のジョブを完遂できます。
00:08:39また、Fable 5.1には、要求された以上の作業を行ってしまう傾向もあります。
00:08:43例えば、1つの機能の追加を頼むと、近くにある別の問題にも気づいてそれまでついでに直してしまったり、
00:08:48説明された範囲を超えて機能を拡張したりします。クライアントプロジェクトの1つで、
00:08:53機能追加をお願いしたところ、誰も触るように頼んでいないテストファイルまで編集してしまったことがありました。
00:08:58問題なのは、そうした余計な編集によって、そのままにしてほしかったプロダクトの部分が変わってしまう可能性がある点です。
00:09:03そのため、Fable 5.1にタスクを与える際は、何をそのままにしておくべきかも指示する必要があります。
00:09:08つまり要求された部分だけを変更させます。そして他に問題を見つけた場合は、
00:09:13最後にそれを報告するように伝えます。プロジェクトでそのように指示し、テストファイルを
00:09:18編集しないよう明記したところ、依頼した機能の作業だけを行いました。Fable 5.1にはもう一つ、
00:09:24ファイルを変更する際に起こる癖があります。タスクの途中でファイルの一部だけを編集すればよい場合でも、
00:09:29残りの部分は一切変わらないにもかかわらず、ファイル全体を書き直してしまうのです。
00:09:33望み通りの結果が得られるため問題なく見えるかもしれませんが、こうした行はすべて
00:09:38出力トークンを消費し、多くのファイルを扱う場合は制限をはるかに早く消耗させます。
00:09:43私たち自身のセカンドブレインでもこれが確認され、本来より小さな変更にも過剰なコストがかかりました。
00:09:48編集だけで済むファイルを書き換え続けたためです。これを防ぐには、
00:09:52小さな変更でも同じ結果が得られる場合は、その部分だけを編集するよう
00:09:56Fable 5.1に伝える必要があります。次の問題は書く量ではなく、
00:10:01その「書き方」にあります。これはOpus 5でも見られたもので、アンソロピックが
00:10:06「気取った散文」と呼ぶ表現を多用していました。ご存じない方のために説明すると、
00:10:11気取った散文とは、単に意味を伝えればいいところを、大げさな表現や比喩を使うことです。
00:10:16例えば、設定変更の価値があると言う代わりに「回すべきダイヤル」と呼ぶといった具合です。長い調査タスクでは、
00:10:20こうした言葉遣いのせいで、モデルが伝えたい要点すら見えにくくなってしまいます。
00:10:24現在、Fable 5.1はその使用量がOpus 5やFable 5よりも少なく、お決まりのフレーズや説明のない専門用語も減っています。
00:10:31しかしFable 5.1はOpus 5やFable 5よりもその傾向が少なく、決まり文句や
00:10:36説明のない専門用語も減っています。それでも文章の癖は残っており、Fable 5に比べると
00:10:41文が長く段落の区切りも少ないため、一層追いづらくなっています。そのため、
00:10:46飾り立てた表現をすべて省くよう指示するだけで、両方の問題が解決します。これは開発ではなく
00:10:51執筆目的でリサーチタスクを実行した際にも実際に行った方法です。最後のポイントは、
00:10:56Fable 5.1にどのような作業を任せるかという点です。ここまで解説した内容はすべて
00:11:01性能を引き出すためのものですが、仕事の種類も同様に重要です。Fable 5.1は、
00:11:07大規模なタスクにおいて真価を発揮します。プロジェクトのタスクで比較したところ、単純な作業では
00:11:14Fable 5の方が優れた成果を出しましたが、最も困難なタスクではFable 5.1が
00:11:19より良い成果を上げ、処理速度は約40%速く、コストは58%削減されました。
00:11:23つまり、途中で止まることなく最後までやり切ることが重要な大規模な仕事こそが、Fable 5.1の強みです。
00:11:28そのため、機能を細かく分割して1ステップずつプロンプトを投げるのではなく、機能全体を与えて
00:11:33求める結果を明確に記述すれば、AIが自力で機能全体を完成させる様子を確認できるでしょう。動画内で
00:11:38紹介しているすべてのスキルやワークフローを利用したい方は、コミュニティであるAI Labs Proを
00:11:43ご利用ください。リンクは概要欄にあります。それでは本日の動画は以上となります。
00:11:48チャンネルをサポートし、このような動画制作の継続にご協力いただける場合は、下の「スーパーサンクス」ボタンをご利用ください。
00:11:53いつもご視聴ありがとうございます。また次回の動画でお会いしましょう。

핵심 요약

Fable 5.1は長時間の複雑なタスクで高いコストパフォーマンスを発揮するが、低労力設定への変更や古い指示の削除を行わなければトークンを浪費する。

하이라이트

  • Fable 5.1はFable 5と比較して、最も困難なタスクにおいて処理速度が約40%速く、費用は58%削減される。

  • Fable 5.1のキャッシュ読み取りコストは75%削減されているが、出力テキストの生成量はFable 5の約1.7倍に増加する。

  • 低労力(low)設定では問題の61%を見つけたのに対し、高労力(high)では57.1%にとどまり、処理は約3分遅くなる。

  • Fable 5.1が答えを知らなかった場合、72.6%の確率でハルシネーションを起こす。

  • Fable 5.1はファイルの一部だけを変更する場合でもファイル全体を書き直してしまうため、出力トークンを過剰に消費する。

타임라인

Fable 5.1の特徴とコスト構造

  • Fable 5.1は仕事の質自体ではなく、少ないコストで多くの仕事をこなす点に優れている。
  • 長時間のタスクにおいて、Fable 5.1はFable 5より約47%安価である。
  • キャッシュ読み取りコストは75%削減されたが、出力テキストの生成量が増えたためタスクあたりの費用は約20%高くなる。
  • ハルシネーションの発生確率は72.6%であり、Fable 5の63.6%よりも高い。

Fable 5.1は単純なタスクではFable 5に劣る場合があるものの、極めて困難なタスクでは品質が高く処理速度も速い。会話履歴のキャッシュ読み取りコストは大幅に下がった一方で、出力される文章量が増えているためトータルの請求額に影響を与える。また、ガードレールに抵触した際に下位モデルに自動切り替わり、誤った作業結果を生むリスクが存在する。

Fable 5.1の実践的な活用方法

  • 労力(effort)設定を低くすることで、品質を維持しながら無駄な試行錯誤を防ぐことができる。
  • 古いモデル向けに書いた不要な指示を削除することで、リミットの消耗を防ぐ。
  • ファイル全体を書き直す癖があるため、変更すべき箇所を明確に指定する必要がある。
  • 機能全体を一度に与えて明確な結果を記述することで、大規模なタスクで最大の効果を発揮する。

コードレビューや機能追加のテストにおいて、高労力設定よりも低労力設定のほうが優れた結果を出すことが示されている。また、古いモデル用の指示が残っているとモデルが不要な作業を強いられるため、定期的な見直しが不可欠である。さらに、小さな変更であってもファイル全体を書き換える傾向があるため、指示によって制限する対策が求められる。

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기