Claude Codeのトークン料金を20分の1に安くする方法(&その他4つの活用ハック)

CChase AI
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Cloud Codeのトークン代に、必要経費の20倍もの金額を気づかずに支払っているかもしれません。
00:00:05Cloud Codeのトークンを最大限に活用する方法を理解することは、
00:00:08マスターすべき極めて重要なスキルの1つであり、Cloud.mdファイルに「簡潔に」と
00:00:14一行書き加えるだけにとどまりません。プロンプトキャッシュの仕組みなどを理解していないと、
00:00:19余分な費用を大きく支払うことになりかねないからです。そこでこの動画では、
00:00:23クラウドトークンをより良く管理し、最高峰モデルを
00:00:27最大限に活用するための5つの方法をご紹介します。さて、第1のコツが最も重要です。
00:00:31これは他のすべてのコツを合わせたものよりもはるかに多くの費用と使用量を節約できます。それがプロンプトキャッシュの実際の仕組みの理解です。
00:00:37プロンプトキャッシュを理解するには、まずトークンの仕組みを理解する必要があります。そこで、
00:00:43全員の認識を合わせるために、60秒ほどの非常に簡単な復習を行いましょう。トークンは
00:00:47大規模言語モデルの通貨であり、実質的に(多少簡略化されますが)、
00:00:52「1単語=1トークン」となります。したがって、ユーザーであるあなたがFableへの最初のメッセージで「今日はどんな調子ですか」と尋ねると、
00:01:005つの入力トークンを送信したことになります。次に、Fableが「絶好調だよ、ありがとう」と返答すると、
00:01:094つの出力トークンが生成されます。これらは価格が異なります。実際、出力トークンは概して
00:01:16入力トークンの5倍のコストがかかります。これら5つの入力トークンと4つの出力トークンが、
00:01:23コンテキストウィンドウ内に蓄積されていきます。トークンが通貨であるなら、コンテキストウィンドウは私たちの予算です。
00:01:31Opus、Fable、Sonnetはいずれも100万トークンの予算を持っているため、この段階では100万のうち
00:01:379つしか使用しておらず、大した量ではありません。面白くなってくるのは、最初のメッセージの後に
00:01:43後続のメッセージを送信するときです。2回目のメッセージで、ユーザーの私は「アプリを作ってくれ、ミスなく」と伝えます。
00:01:506つの入力トークンですよね?AnthropicとFableには6つの入力トークンだけを送るのでしょうか?
00:01:56いえ、そうではありません。実際に送信しているのは、すべてのデータです。Anthropicに送信するのは
00:02:04その時点までの会話全体です。したがって、6つの入力トークンを送っているのではなく、実際には
00:02:1116の入力トークンを送っています。ここでの5つと、ここでの4つを含めて送信することになるからです。
00:02:16コンテキストを理解できるように会話全体が取得されるためです。そして、以降の
00:02:20すべてのフォローアップメッセージについても同様であり、常に最新のメッセージの前に交わされた
00:02:26会話のすべてを送信しています。これが非常に急速に累積していき、
00:02:32メッセージごとに5,000、10,000、100,000もの入力トークンが送信される事態になることがすぐにわかるでしょう。そして、
00:02:37その分の料金を支払っているのです。さて、もしそうだとしたら、なぜ私たちはすべての使用量を
00:02:43すぐに使い切ってしまわないのでしょうか?AIシステムを使用するたびに、誰もが10億ドルを支払う羽目にならないのはなぜでしょうか?
00:02:47なぜなら、明らかにメッセージを次々と送信しているからです。そのため、サーバーには
00:02:51多くの累積メッセージが送信されています。そこで、その解決策がキャッシュシステムです。ですから、はい、
00:02:57こちらで2番目のメッセージを送信するとき、私は確かにこれらすべてを送信しています。しかし、この時点で
00:03:05作成されているのがメッセージキャッシュです。そして2番目のメッセージにとって、そのメッセージキャッシュとなるのは最初の
00:03:122つのメッセージです。メッセージキャッシュとは、Claudeの目の前に置かれた、
00:03:17その時点までの会話のすべてが記載されたドキュメントのようなものだと考えてください。Claudeと会話しているここで、
00:03:23あなたは今「アプリを作ってくれ、ミスなく」という2番目のメッセージを送信しています。しかしキャッシュシステムがあるため、
00:03:30このセクション全体、最初の2つのメッセージがこのドキュメント内に保持されます。そのため、
00:03:36ClaudeとAnthropicができることは、そのドキュメントを読み取り、キャッシュを読み取ることです。
00:03:42キャッシュなしで一度にすべてを送信する場合に比べて、はるかに安価なレートで、その時点までのメッセージ履歴全体を確認できます。
00:03:47それによってコストが計算されます。そして、このキャッシュシステムは永遠に持続するわけではないため、
00:03:54このコストは重要です。理解しておかなければならないのは、あなたとClaudeが互いに会話しており、
00:04:00私たちの間にこのキャッシュドキュメントが存在する場合、そこにはすべての会話履歴が含まれており、
00:04:06非常に安価に読み取ることができますが、保持されるのは1時間だけだということです。
00:04:11ですから、あなたとClaudeがこの議論を行っており、何度も何度もやり取りを重ねていて、
00:04:16何度もやり取りした後に、1時間その場を離れたとします。そして、
00:04:2150万トークンの長さを持つドキュメント、つまり50万トークンの会話があるとします。1時間が経過すると、これが消滅します。
00:04:29これはなくなってしまいます。そのため、50万1番目のメッセージを送信すると、どうなるでしょうか。
00:04:38たとえ言ったことが「やあ、元気?」だけであっても、フルレートの50万トークン分のメッセージ料金が請求されることになります。
00:04:46ここで、このキャッシュが1時間しか持続しないと言った意味を理解してください。それは「アクティビティがない状態が1時間」という意味です。つまり、
00:04:52メッセージごとに更新されます。最後のメッセージから59分が経過した時点で再びメッセージを送れば、
00:04:56その1時間のカウンターがリセットされます。では、なぜこれがそれほど重要なのでしょうか?それはコストです。
00:05:01イントロで話したように、キャッシュヒット(この履歴全体を読み込むこと)と、キャッシュなしで50万のメッセージを読み込むことの間には、
00:05:08文字通り20倍の差があります。そしてこれは、価格上昇のドキュメントにも反映されています。
00:05:16出力トークン、つまりClaudeが私たちに返してくれるものについては、決して変わりません。
00:05:22Fableの場合は100万トークンあたり50ドル、Opusの場合は25ドルです。しかし入力トークンこそが、
00:05:27この会話全体が行われている場所です。そのため、基本の入力トークンは100万トークンあたり
00:05:3310ドルとよく言われますが、それはある種ミスネーム(不適切な表現)です。実際には、私たちは常にキャッシュ書き込みを行っているからです。
00:05:40したがって、サブスクリプションプランで行っている1時間のキャッシュ書き込みは、実際にはコストが2倍になります。
00:05:47最初のメッセージのように初めてそのキャッシュに書き込む場合、100万トークンあたり20ドルとなります。
00:05:54ここで5分のキャッシュ書き込みを見かけるかもしれませんが、それは主にAPIを利用している人のためのものです。
00:05:59それをキャッシュヒットと比較してみてください。つまり、Anthropicが目の前にあるドキュメントを読み込むだけであり、
00:06:05それは毎時計測・蓄積され更新されているものです。価格は1ドルであり、20倍も安くなります。それは
00:06:13驚くべき違いです。だからこそ、この全体、特にこのコツであるプロンプトキャッシュや
00:06:18トークンシステムの仕組みを理解することが非常に重要なのです。これ以降に私が話すことで、
00:06:22これに匹敵するような効率の向上をもたらすものは何一つありません。一切ありません。
00:06:29それでは、Claude Codeで行っている50万トークンの会話の例に戻りましょう。
00:06:35フォローアップメッセージを送信しようとしているところです。シナリオ1では、
00:06:40キャッシュシステムがある状況を想定します。この50万トークンの会話履歴はキャッシュされており、新しいメッセージを送信します。
00:06:46価格設定の仕組みとしては、依然としてこの会話履歴全体を読み込む必要があります。
00:06:51そしてそれは100万トークンあたり1ドルのレートで行われます。したがって、次のメッセージで
00:06:58すべてと新しいメッセージを読み込むのに50セントかかることになります。では、その新しいメッセージが1,000トークンの長さだったと想像してください。
00:07:05その1,000トークンのフォローアップメッセージは、100万あたり1ドルでは課金されません。100万あたり20ドルで課金されます。
00:07:14ですから1,000トークンだと、いくらでしょう、2セントとかそんなものでしょうか?わかりません。
00:07:18私の計算は間違っているかもしれませんが、要するに履歴は1ドルで、キャッシュされているため新しい方は20ドルになるということです。
00:07:26さて、次にメッセージを送信する際も同じシナリオですが、今度はこの1,000トークンがそのキャッシュドキュメントの一部になります。
00:07:32なんとなく意味が通じますよね。分かりました。それがシナリオ1です。シナリオ2は、キャッシュがない場合です。1時間待ってから送信した場合です。
00:07:40送信するために正しい手順ですが、これが50セントになる代わりに、今度は
00:07:47キャッシュ読み取り、いえ、キャッシュ書き込みのレートで課金されることになります。覚えているように、それは100万あたり20ドルです。では、これには
00:07:54どれくらいのコストがかかるでしょうか?なんと、この1通のメッセージだけで10ドルほどかかります。つまり、50セントから
00:08:0010ドルへと跳ね上がりました。ただ1時間待ったというだけで。これが、仕組みを理解していないことによる
00:08:05ある種の結果です。さて、キャッシュを失う要因として考えなければならないのは時間だけではありません。他にも
00:08:10完全にリセットしてしまう要因があります。そしてこれは、Cloud Codeのドキュメントに直接記載されているものです。
00:08:14モデルを切り替えた場合(例えば、Fableを使っていてOpusに切り替え、50万トークン進んでいる状態)、
00:08:20それは消えてしまいます。キャッシュはリセットされます。推論レベルの変更、ファストモード、MCPサーバーの
00:08:26接続または切断、プラグイン、ツールの拒否、会話のコンパクション、あるいは単にCloud Codeのアップグレードなどです。
00:08:32これらのいずれの動作でもキャッシュがリセットされ、次のメッセージのコストが必要以上に20倍高くなってしまいます。
00:08:38こうしたことを踏まえて、この情報を使って具体的に何ができるでしょうか?
00:08:42重要な情報がたくさん含まれている会話からいったん離れる必要がある状況で、
00:08:461時間以上離れることになるとき、あるいは1時間以上離れて戻ってきたときに、
00:08:50「しまった、事前にこれについて考えていなかったな」と気づいたとき、どうすればよいでしょうか。
00:08:54それについて、第2のコツでお話しします。ですがその前に、
00:08:59今日のスポンサーである私から少しお知らせがあります。今週、私はChase AI+の内部で
00:09:06Cloud Codeマスタークラスの完全アップデート版をリリースします。これを最初に公開して以来、多くのことが変わりました。
00:09:12常にアップデートしていますが、根本的に、私がこれを公開した3月以来、私たちは長い道のりを歩んできました。
00:09:19ですから、AIのスキルをレベルアップさせようとしている方、あるいは技術的な背景が一切なく、
00:09:24ゼロからこのツールの使い方を実際に知るためのロードマップを求めていて、実用的なユースケースに焦点を当てたものを探しているなら、
00:09:28これはあなたにぴったりです。Chase AI+の中にあります。固定コメントにリンクが貼られています。
00:09:33さて、第2のコツは、キャッシュを失った場合のオプションに関するすべてです。長期間その場を離れてしまい、
00:09:37会話が20万、30万、40万、50万トークンの長さになっているとします。
00:09:42そして、法外なコストを支払う代わりに、次のステップとしてどうすべきかを知りたいわけです。それはあなたのシナリオによって異なります。
00:09:47最初のオプションは、ある種の最終手段であり、それは単にforward slash clearを実行することです。
00:09:52さて、最初の選択肢はいわば最終手段で、それは単に /clear と入力することです.
00:09:58forward slash clearを使えば、会話履歴をすべて消去できます。これは必ずしも悪いことではなく、
00:10:04そして、これは必ずしも悪いことではありません.
00:10:10実際のところ、作業中のコードベースや、多くのファイルとコンテキストを含むプロジェクトがある場合,
00:10:15おそらく単に /clear を実行した方がよいでしょう.
00:10:20これまで何に取り組んでいようと、何について話していようと、何が起きたのかという痕跡はプロジェクト自体に残っている可能性が高いからです.
00:10:25Cloud Codeはそれを確認し、ゼロから新しい会話を始めたときに、その断片を拾い上げて元の状態に戻すことができます.
00:10:31前の会話に縛られる必要はありません.
00:10:382つ目の選択肢は、コンパクション(圧縮)機能を利用することです.
00:10:42Cloud Codeには、一定量のトークンに達すると自動圧縮される機能が備わっています.
00:10:4760万、70万、80万トークンといった範囲で作業を行っていると、コンテキストの劣化問題に対処し始めることになるため,
00:10:51そのポイントに達するまで待たないことをお勧めします.
00:10:57もっとも、いつでも /compact を実行することは可能です.
00:11:03それを実行すると、これまでの会話の要約が作成されます.
00:11:10そして実質的に /clear と同じ動作をしつつ、いわばメモリ内にその要約を持った状態で新しい会話が開始されます.
00:11:15もしその会話の中に重要な内容が含まれており、コードベースにある情報だけではAIが理解するのに不十分だと思われる場合は,
00:11:20コンパクション、つまり /compact を実行すればよいのです.
00:11:26compactに非常に似ているのが、3つ目の選択肢である
00:11:32カスタムハンドオフツールを使う方法です。世の中には
00:11:383つ目の選択肢は、コンパクションに非常によく似ていますが、何らかのカスタム引き継ぎツールを使用する方法です.
00:11:46世の中にはさまざまなカスタムハンドオフスキルが存在します.
00:11:51私自身も一つ持っており、それは無料のコミュニティ内で入手可能です.
00:11:59ハンドオフとコンパクションの違いは、その要約がどこに保存されるかという点にあります.
00:12:04ハンドオフを行う場合、システムはそれをディスク上に直接保存します.
00:12:10必要な内容をすべて含んだ実際のMarkdownファイルを要約として作成してくれるのです.
00:12:15その後、新しい会話を開始して「ねえClaude Code、把握すべき情報を得るためにディスク上のあのハンドオフドキュメントを確認して」と指示することができます.
00:12:20一方、コンパクションではいかなるファイルも作成されません.
00:12:26行っている特定の会話内のメッセージ履歴にメッセージが残るだけという、わずかな違いがあります.
00:12:31しかし、人によってはディスク上に何らかのファイル形式で残したい場合もあります.
00:12:37多くの場合、それは常に更新され続ける生きたドキュメントになります.
00:12:42新しいメッセージを送り続けるのは避けるべきです。そもそも40万、50万、60万という
00:12:48トークン範囲で運用すべきではないからです。さて、コツの3つ目はモデルのルーティングについてです。
00:12:53タスクに最適なモデルを選ぶにはどうすればよいでしょうか?何でもかんでも最高性能のモデルを使うのではなく、
00:12:59あるいは、Claudeのネイティブ機能を使って圧縮し、要約を直接挿入したいですか?
00:13:04それとも、Claudeが参照できる実際のドキュメントとして要約を残したいですか?
00:13:10ローカルモデルを使うか、あるいはアンソロピックのエコシステム内にとどまる選択肢もあります。
00:13:16個人的には、これを行う最も簡単な方法はアドバイザーモードだと思います。ここでご覧いただいているのは、
00:13:22そして多くの場合、単に新しいメッセージを送信し続けるよりもこれらの方法の方が優れています.
00:13:29大局的に見て、そもそも40万、50万、60万トークンもの範囲で動作させるべきではないからです.
00:13:37さて、チップの3つ目はモデルのルーティングについてです.
00:13:43仕事に適したモデルをどのように選べばよいでしょうか?
00:13:50すべてのタスクに常に最上位モデルを使用するのではなく,
00:13:54よりシンプルで簡単なタスクに対しては、より小さく、安価で、性能が少し劣るモデルを使用することはできないでしょうか?
00:14:01同時稼働させます。さて、2つ目のオプションは、Claude
00:14:06外のモデルにタスクを委譲することです。簡単な例がCodexです。Claude codeにはCodex用の
00:14:12プラグインがあり、インターフェースから簡単にCodexを呼び出せます。つまり、実質的にFableに
00:14:18例えばGPT系を利用することも可能ですし、最近非常に安価になった他のモデルを利用することもできます.
00:14:24ローカルモデルを使用するか、あるいはAnthropicのエコシステム内に留まりたい場合のオプションもあります.
00:14:31これを行うための最も簡単な方法は、アドバイザーモードであると私は考えています.
00:14:36ここで表示されているのは、数か月前に公開された元のアドバイザーに関するブログ記事からのものです.
00:14:41そのためOpusやSonnetが表示されていますが、他のモデルでも同様のシステムが維持されます.
00:14:48その概念とは、スマートなモデルが、タスクを実行する小型モデルに助言を与えるというものです.
00:14:53つまり、大型モデルが計画を立案し、小型モデルがそれを実行します.
00:14:57そして小型モデルは、問題に直面したときはいつでも、そのコンテキストを大型モデルと共有することができます.
00:15:01このモデルは、低コストでより優れた成果を上げられることを誇ってきました.
00:15:07そしてプロンプトキャッシュに関するこれまでの議論を持ち出すと、アドバイザーと実行役の両方が同時に独自のプロンプトキャッシュを稼働させています.
00:15:122つ目の選択肢は、Claude Code以外のモデルにタスクを委任することです.
00:15:18簡単にできる例としてCodexがあります.
00:15:23Claude Code用のCodexプラグインが存在するため、Claude CodeのインターフェースからCodexを非常に簡単に呼び出すことができます.
00:15:30そのため、本質的に同様のアドバイザーモードを実行させることができます.
00:15:36OpusやSonnetを呼び出す代わりに、GPTモデルを呼び出すわけです.
00:15:42まさにそのようなことを行う他のリポジトリも存在します.
00:15:46最終的に、このような動作をする独自のスキルをセットアップすることは非常に簡単です.
00:15:53もしより安価なモデルを探しているのであれば、繰り返しになりますが、GPT系モデルを見ることを強くお勧めします.
00:15:59なぜなら、第一にコストが大幅に削減されたためであり、第二に、その価格帯でそれらのモデルと同等の働きをするモデルがAnthropicファミリー内には実際に見当たらないからです.
00:16:04タスクが適しているのであれば、さらに一歩進めてローカルモデルを導入することも可能です.
00:16:10さて、4つ目のチップはClaudeの衛生管理(クリーンアップ)についてです.
00:16:15Claude Codeの作成者であるボリス・チェルニー氏が「Claude.mdファイルを削除する必要がある」と述べている動画が最近広まっているのを見たかもしれません.
00:16:20では、本当にそのClaude.mdファイルを削除する必要があるのでしょうか?
00:16:25必ずしもそうとは限りませんが、実行する必要があることとして、ここ数週間でいくつかの変更が加えられました.
00:16:31それは /doctor コマンドを実行することです.
00:16:36これがトークンとどう関係しているのでしょうか?
00:16:41まず第一に、このコマンドが行うことは(他にもいろいろありますが、今回はトークンに関連付けて説明しますが)Claude.mdを確認し、その内容をスリム化することです.
00:16:47これらのモデル、特に最近の世代のモデルの仕組みとして、それほど多くの指示を必要としません.
00:16:533ヶ月、6ヶ月、9ヶ月前に人々がClaude.md用に作成していたものを見ると、非常に指示的で極めて詳細なものでした.
00:16:58そしておそらく当時は、それらが必要であるという主張も成り立ったでしょう.
00:17:03しかし現在ではそれは当てはまりません.
00:17:08そのため、肥大化したClaude.mdは動作を遅くするだけでなく、文字通りトークンを浪費させています.
00:17:12/doctor はそれを精査し、Claude.md内で本来必要のない要素を取り除いてくれます.
00:17:17第二に、コンテキストを圧迫している要素や、コンテキストウィンドウを肥大化させている要素を確認してくれます.
00:17:22なぜなら、新しい会話を開始して /context を実行したときでさえ、すでに内部を埋め尽くしているものがあるからです.
00:17:28私自身、最近 /doctor を実行したため多くの肥大化を取り除きましたが、メッセージを一切送信していない会話の開始時点ですら、私のコンテキストウィンドウはこのような状態になっています.
00:17:33すでに4万トークンが使用されています.
00:17:38何がこれほど多くの領域を消費しているのでしょうか?
00:17:44その一部は、ここに見られるようなスキルなどの要素に由来しています.
00:17:51また、システムプロンプトやメモリファイルなども含まれています.
00:17:56/doctor が行うのは、スキルやMCPといった要素を確認し、長期間使用していないものを削り始めることです.
00:18:01これが莫大なトークンの節約になるかと言えば、そうではありません.
00:18:06しかし、細かな部分での効果はありますし、非常に簡単な修正です.
00:18:11特に、ここ半年間で膨大な数のスキルを蓄積し続け、実際に見直して削除したことがない人にとっては、実行しない理由がありません.
00:18:18そうすることでスキルがより効果的に機能するようになり、どのスキルを呼び出すべきかというClaude側の混乱もなくなります.
00:18:25あなたもおそらく、フロントエンドのデザインに関するスキルを10個ほど抱えている一方で、それらすべてが必要というわけではないでしょう.
00:18:30したがって、Claudeの衛生管理に関してこの非常にシンプルで実行しやすいチップを見過ごすべきではありません.
00:18:36元の議論に戻すと、そのパズルの大部分を占めるのが
00:18:41プロンプトキャッシングです。この動画から何か一つでも
00:18:46これは今日の中で最も効果が低いものと私は考えていますが、至る所で目にする追加のスキルや足場(スキャフォールディング)に関するものです.
00:18:50最近最も人気のあるものはポンテイルであり、本質的にClaudeが書くコードの量を減らしつつその効果を維持し,
00:18:55それによってコストを抑え、高速化を図るものです.

핵심 요약

Claude Codeのトークン料金を大幅に抑えるためには、プロンプトキャッシュの1時間の有効期限とリセット条件を管理し、キャッシュヒット率を最大化することが最も重要である。

하이라이트

  • プロンプトキャッシュのヒット時とキャッシュなしの読み込み時では、コストに最大20倍の差が発生する。

  • コンテキストウィンドウの入力トークンコストは、キャッシュ未ヒット時の書き込みで100万トークンあたり20ドル、キャッシュヒット時は100万トークンあたり1ドルとなる。

  • モデルの切り替え、推論レベルの変更、ファストモード、MCPサーバーの接続・切断などを行うと、キャッシュがリセットされる。

  • 不要なスキルや肥大化した設定ファイルを整理するために、/doctorコマンドを実行するとコンテキストウィンドウの無駄な消費を抑えられる。

  • 長時間の離脱後にコストを抑える手法として、/clearによる履歴消去、/compactによる会話要約、またはカスタムハンドオフツールを用いたディスク保存がある。

타임라인

プロンプトキャッシュの仕組みとコスト構造

  • トークンは大規模言語モデルの通貨であり、入力トークンの価格は出力トークンの5分の1である。
  • 会話が進行するにつれて過去のメッセージ履歴全体が送信されるため、キャッシュシステムがコスト抑制の鍵となる。
  • プロンプトキャッシュの有効期限はアクティビティがない状態で1時間であり、期限が切れるとフルレートの料金が課金される。
  • キャッシュ書き込みは100万トークンあたり20ドル、キャッシュ読み込み(ヒット時)は100万トークンあたり1ドルとなり、20倍のコスト差が生じる。

トークンの基本的な概念から始まり、メッセージを重ねるごとに会話全体が送信される仕組みを解説している。サーバー側ではメッセージキャッシュが作成され、目の前のドキュメントとして安価に読み込まれる。しかし、このキャッシュは1時間操作がないと消滅し、次にメッセージを送った際にはキャッシュ書き込みのフルレートが適用されるため、コストが跳ね上がる原因となる。

キャッシュ喪失時の対策と会話管理

  • 1時間以上離れてキャッシュを失った場合の最初の最終手段として、/clearコマンドで履歴を完全に消去できる。
  • /compactコマンドを実行すると、これまでの会話の要約がメモリ内に保持された状態で新しい会話を開始できる。
  • カスタムハンドオフツールを使用すると、要約内容をMarkdownファイルとしてディスク上に直接保存して引き継ぐことが可能である。

長時間の離脱によって高額なキャッシュ書き込みコストが発生する事態を避けるための具体的なオプションが示されている。プロジェクトのファイル自体に作業の痕跡が残っている場合は/clearで十分対応できる。一方、文脈を維持したい場合は、自動あるいは手動のコンパクション、または外部のMarkdownファイルを作成するカスタムハンドオフツールが有効である。

モデルルーティングと衛生管理による最適化

  • すべてのタスクに最上位モデルを使用せず、アドバイザーモードや外部プラグインを用いてより安価なモデルへタスクを委譲できる。
  • /doctorコマンドを実行することで、肥大化したClaude.mdや長期間使用していないスキルを精査しスリム化できる。
  • 初期状態ですでに消費されている数万トークンの無駄を省くことで、コンテキストウィンドウの圧迫を防ぎ、モデルの動作精度を高めることができる。

タスクの難易度に応じたモデル選定の重要性と、システム全体のクリーンアップ手法について説明している。小型モデルと大型モデルを組み合わせるアドバイザーモードやCodexの活用によりコストを削減できる。また、過去に蓄積された不要なスキルや過剰な指示が含まれるClaude.mdを/doctorコマンドで整理することが、トークン節約と動作の効率化につながる。

커뮤니티 글

모든 글 보기