Comment rendre les jetons de Claude Code 20x plus abordables (& 4 autres astuces d'utilisation)

CChase AI
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Vous payez peut-être 20 fois plus cher vos jetons Cloud Code que nécessaire sans même le savoir.
00:00:05Comprendre comment tirer le meilleur parti de vos jetons Cloud Code est l'une des compétences
00:00:08les plus importantes à maîtriser, et cela va bien au-delà de l'ajout d'une ligne dans votre fichier Cloud.md
00:00:14disant : soyez bref. Car si vous ne comprenez pas le fonctionnement de la mise en cache des invites,
00:00:19vous risquez de payer bien plus que nécessaire. Dans cette vidéo, je vais donc vous donner cinq
00:00:23façons différentes de mieux gérer vos jetons Cloud afin de vraiment profiter au maximum
00:00:27de ces modèles haut de gamme. L'astuce numéro un est la plus importante. Elle vous permettra d'économiser
00:00:31plus d'argent et d'utilisation que toutes les autres astuces combinées, de loin, et il s'agit de comprendre le fonctionnement réel
00:00:37de la mise en cache des invites. Pour comprendre cela, vous devez d'abord comprendre comment fonctionnent les jetons. Nous allons donc
00:00:43faire un récapitulatif très rapide, d'environ 60 secondes, pour que nous soyons tous sur la même longueur d'onde. Les jetons sont la monnaie
00:00:47des grands modèles de langage, et grosso modo — c'est un peu simplifié — chaque
00:00:52mot équivaut à un jeton. Ainsi, lorsque vous, l'utilisateur, lors de votre premier message à Fable, dites : comment allez-vous aujourd'hui,
00:01:00vous avez envoyé cinq jetons d'entrée. Lorsque Fable vous répond : je vais très bien, merci,
00:01:09il vous a fourni quatre jetons de sortie. Ceux-ci sont tarifiés différemment. En fait, les jetons de sortie, dans l'ensemble,
00:01:16coûtent cinq fois plus qu'un jeton d'entrée. Ces cinq jetons d'entrée et ces quatre jetons de sortie s'accumulent maintenant
00:01:23dans la fenêtre de contexte. Si les jetons sont la monnaie, alors la fenêtre de contexte est notre budget.
00:01:31Opus, Fable, Sonnet, ils ont tous un budget d'un million de jetons, donc à ce stade, nous avons utilisé
00:01:37neuf de notre million, ce n'est pas grand-chose. Ce qui devient intéressant, c'est lorsque nous envoyons des messages de suivi
00:01:43après le premier. Dans notre deuxième message, moi, l'utilisateur, je dis : construis-moi une application, sans erreurs,
00:01:50six jetons d'entrée, n'est-ce pas ? Je vais simplement envoyer à Anthropic et Fable six jetons d'entrée. Eh bien,
00:01:56pas tout à fait. Ce que je vais réellement lui envoyer, c'est tout. Je vais envoyer à Anthropic
00:02:04toute cette conversation jusqu'à ce point. Je n'envoie donc pas vraiment six jetons d'entrée, j'envoie en fait
00:02:1116 jetons d'entrée car je vais leur envoyer les cinq d'ici et les quatre d'ici parce qu'il
00:02:16va recevoir l'intégralité du message afin de pouvoir comprendre le contexte. Et ce sera le cas pour
00:02:20chaque message de suivi : j'envoie toujours l'intégralité de la conversation
00:02:26précédant ce dernier message. Et vous voyez rapidement comment cela se cumule très, très vite au point
00:02:32où vous parlez de 5 000, 10 000, 100 000 jetons d'entrée envoyés à chaque message. Et vous payez
00:02:37pour cela. Si c'est le cas, alors pourquoi ne consommons-nous pas tout notre quota
00:02:43immédiatement ? Pourquoi tout le monde ne paie-t-il pas un milliard de dollars à chaque fois qu'il essaie d'utiliser ces systèmes d'IA ?
00:02:47Parce qu'évidemment, nous envoyons message après message. Il y a donc tout un tas de
00:02:51messages cumulés envoyés aux serveurs. La solution ici est le système de cache. Alors oui,
00:02:57quand j'envoie le message numéro deux ici, j'envoie effectivement tout cela. Mais ce qui a été créé
00:03:05à ce stade, c'est le cache de messages. Et pour notre deuxième message, ce cache de messages correspond à ces deux premiers
00:03:12messages. Je veux que vous pensiez au cache de messages simplement comme à un document que Claude a sous les yeux
00:03:17et qui contient toute votre conversation jusqu'à présent. Vous discutez donc avec Claude ici,
00:03:23vous envoyez maintenant le message numéro deux, qui est : construis-moi une application, sans erreurs. Mais nous avons le système
00:03:30de cache. Toute cette section, ces deux premiers messages, se trouve donc dans ce document. Ce que
00:03:36Claude et Anthropic peuvent faire, c'est lire ce document, lire le cache,
00:03:42examiner l'historique complet des messages jusqu'à ce point à un tarif bien moins élevé que si vous
00:03:47envoyiez le tout d'un coup sans le cache. C'est ainsi qu'il calcule le coût. Et ce coût
00:03:54est important car ce système de cache ne dure pas éternellement. Ce qu'il faut comprendre, c'est que lorsque
00:04:00vous et Claude vous parlez, et que nous avons ce document de cache entre nous, qui contient tout
00:04:06l'historique de notre conversation que vous pouvez lire très bon marché, il ne le conserve que pendant une heure.
00:04:11Donc si vous et Claude avez cette discussion, avec des allers-retours répétés,
00:04:16vous savez, sans cesse, et qu'ensuite vous vous éloignez pendant une heure. Et vous avez un
00:04:21document long de 500 000 jetons, une conversation de 500 000 jetons. Au bout d'une heure, cela disparaît.
00:04:29C'est effacé. Et donc lorsque vous envoyez un message, le 500 001e, eh bien devinez quoi, vous allez maintenant
00:04:38être facturé au tarif plein pour un message de 500 000 jetons, même si tout ce que vous avez dit était : “Salut, ça va ?”
00:04:46Sachez que lorsque je dis que ce cache ne dure qu'une heure, je veux dire une heure sans activité. Il est donc
00:04:52actualisé à chaque message. Si cela fait 59 minutes depuis notre dernier message et que je relance,
00:04:56eh bien ce compteur d'une heure est réinitialisé. Pourquoi est-ce si important ? C'est une question de coût. J'ai parlé
00:05:01dans l'intro de la différence entre une lecture du cache, c'est-à-dire la lecture de tout cet historique par rapport à la lecture des 500 000
00:05:08messages sans cache, qui représente littéralement une différence de 20 fois. Cela se reflète dans la documentation
00:05:16sur l'augmentation des prix. Rappelez-vous, les jetons de sortie, ce que Claude nous donne, cela ne change jamais.
00:05:22Pour Fable, nous sommes à 50 $par million de jetons et 25$ pour Opus. Mais les jetons d'entrée
00:05:27sont le cœur de cette conversation. Nous parlons toujours de jetons d'entrée de base à
00:05:3310 $ par million, mais c'est un peu un abus de langage car en réalité, nous effectuons toujours des écritures dans le cache.
00:05:40Une écriture dans le cache d'une heure, ce que vous faites sur un plan d'abonnement, coûte en fait le double.
00:05:47Lorsque nous écrivons dans ce cache pour la première fois, comme pour ce premier message, c'est 20 $ par
00:05:54million de jetons. Vous remarquerez une écriture dans le cache de cinq minutes ici, mais elle s'adresse vraiment aux personnes
00:05:59qui utilisent l'API. Comparez cela aux accès au cache, c'est-à-dire quand Anthropic lit simplement ce document sous ses yeux,
00:06:05accumulé heure par heure et actualisé. C'est 1 $, soit 20 fois moins cher. C'est une
00:06:13différence énorme. C'est pourquoi tout ceci, cette astuce en particulier, comprendre la mise en cache des invites et
00:06:18le fonctionnement du système de jetons, est si crucial. Il n'y a rien dont je parlerai par la suite
00:06:22qui vous apportera un gain d'efficacité comparable. Rien du tout.
00:06:29Revenons à notre exemple de conversation de 500 000 jetons que nous avons
00:06:35avec Claude Code et sur le point d'envoyer un message de suivi. Dans le scénario numéro un, nous allons
00:06:40imaginer que nous disposons du système de cache. Cet historique de conversation de 500k est donc mis en cache et j'envoie
00:06:46ce nouveau message. Le calcul du prix fonctionnera de telle sorte qu'il doit quand même lire tout cet historique
00:06:51de conversation. Et cela se fait au tarif de 1 $ par million de jetons. Cela me coûtera donc 50 centimes pour
00:06:58ce message suivant pour qu'il lise tout ainsi que le nouveau message. Imaginons que ce nouveau message fasse un millier
00:07:05de jetons. Ce message de suivi d'un millier de jetons n'est pas facturé à 1 $ le million. Il est facturé à 20 $
00:07:14par million. Pour un millier de jetons, ça fait quoi, deux cents ou quelque chose comme ça ? Je ne sais pas.
00:07:18Mon calcul est probablement faux, mais l'essentiel est que l'historique est à 1 $. Le nouveau est à 20 $ par mois parce que c'est mis en cache.
00:07:26La prochaine fois que nous enverrons un message, même scénario, sauf que ces mille jetons feront désormais partie de ce
00:07:32document de cache. C'est assez logique. D'accord. Ça c'est le scénario un. Scénario deux, nous n'avons pas de cache. Nous avons attendu une heure
00:07:40pour l'envoyer. C'est le moment de l'envoyer. Au lieu que cela coûte 50 centimes, nous allons cette fois
00:07:47être facturés au tarif d'écriture dans le cache, c'est-à-dire, rappelons-le, 20 $ par million. Combien
00:07:54cela va-t-il coûter ? Eh bien maintenant, ce seul message nous coûte environ 10 balles. Nous sommes donc passés de 50 centimes à
00:08:0010 dollars juste parce que nous avons attendu une heure. Voilà les conséquences de ne pas comprendre
00:08:05cela. Le temps n'est pas la seule chose à prendre en compte pour la perte du cache. Il y
00:08:10a d'autres éléments qui le réinitialiseront complètement. Et cela vient directement de la documentation de Cloud Code.
00:08:14Si vous changez de modèle, par exemple vous êtes sur Fable et vous passez à Opus après 500 000 jetons,
00:08:20c'est perdu. Le cache est réinitialisé. Niveau d'effort, si vous le modifiez. Mode rapide, connexion ou déconnexion
00:08:26d'un serveur MCP, plugins, refus d'outils, compactage de la conversation, ou simple mise à jour de Cloud Code
00:08:32en général. N'importe laquelle de ces actions réinitialisera le cache et votre prochain message sera 20 fois plus cher
00:08:38que nécessaire. Cela étant dit, que pouvez-vous réellement faire de cette information ?
00:08:42Que faites-vous lorsque vous devez vous éloigner d'une conversation
00:08:46qui contient beaucoup d'informations importantes, mais que vous allez vous absenter plus d'une heure,
00:08:50ou que vous vous êtes absenté pendant plus d'une heure et que vous revenez en réalisant : oh mince, genre
00:08:54je n'y avais pas pensé à l'avance. C'est ce dont nous allons parler dans l'astuce numéro deux.
00:08:59Mais d'abord, un petit mot du sponsor d'aujourd'hui : moi. Cette semaine, je sors une version entièrement mise à jour
00:09:06de ma masterclass Cloud Code au sein de Chase AI+. Beaucoup de choses ont changé depuis que j'ai lancé
00:09:12ce cours. Je le mets constamment à jour. Mais fondamentalement, nous avons fait du chemin depuis mars, date à laquelle
00:09:19j'ai créé ce truc. Donc si vous essayez de progresser avec l'IA, si vous ne venez pas du tout
00:09:24d'un milieu technique et que vous voulez une feuille de route pour savoir comment utiliser cet outil
00:09:28de zéro avec des cas d'usage concrets, alors c'est pour vous. C'est disponible
00:09:33dans Chase AI+. Un lien se trouve dans le commentaire épinglé. L'astuce numéro deux concerne vos
00:09:37options lorsque nous perdons le cache. Nous nous sommes absentés trop longtemps. Nous avons une conversation de deux,
00:09:42trois, quatre, cinq cent mille jetons. Et nous voulons savoir quelle doit être la prochaine étape
00:09:47et cela dépend en gros de votre situation.
00:09:52Notre première option est en quelque sorte l'option nucléaire, qui consiste simplement à faire slash clear.
00:09:58Slash clear va simplement effacer tout l'historique de la conversation. Et ce n'est pas toujours une mauvaise
00:10:04chose. En fait, si vous travaillez sur une sorte de base de code, un projet avec
00:10:10un tas de fichiers et de contexte, vous avez probablement juste envie de faire slash clear. Quoi
00:10:15que vous fassiez, de quoi que vous parliez, il y a de fortes chances qu'il y ait des indices dans le projet lui-même
00:10:20comme quoi cela s'est produit. Cloud Code peut simplement jeter un œil à cela. Et quand vous commencez une nouvelle conversation
00:10:25partir de zéro, il peut reprendre les choses en main et vous ramener là où vous en étiez. Vous n'avez pas besoin d'être esclave
00:10:31de la conversation précédente. Maintenant, votre deuxième option est d'utiliser le compactage. Il existe d'ailleurs une fonction de compactage automatique
00:10:38dans Cloud Code une fois que vous atteignez un certain nombre de jetons. Je vous suggère de ne pas attendre d'arriver
00:10:42à ce stade, car lorsque nous travaillons dans la plage de six, sept ou huit cent mille jetons, nous
00:10:47commençons à faire face à la dégradation du contexte. C'est encore un problème avec ces grands modèles, ces modèles plus puissants,
00:10:51mais nous pouvons faire slash compact à tout moment. Et ce que cela va faire pour nous, c'est créer un
00:10:57résumé de ce dont nous avons parlé. Et ensuite, à toutes fins utiles, il va faire un slash
00:11:03clear, mais il va démarrer une nouvelle conversation avec ce résumé, un peu comme dans la mémoire. Donc
00:11:10si vous aviez des choses importantes dans cette conversation et que vous pensez que le contenu de la base de code ne sera pas
00:11:15suffisant pour qu'il comprenne, alors faites simplement une compaction, slash compact. Il commencera une nouvelle
00:11:20conversation avec ce résumé. Et ce résumé vit simplement dans l'historique des messages. Votre troisième option
00:11:26est très similaire à la compaction et consiste à utiliser une sorte d'outil de transfert personnalisé. Il existe un tas de compétences
00:11:32de transfert personnalisées. J'en ai une moi-même. Vous pouvez l'obtenir dans ma communauté gratuite. Et la différence
00:11:38entre le transfert et la compaction réside dans l'endroit où vit ce résumé. Donc si je fais un transfert, ce que cela va faire, c'est
00:11:46le placer directement sur mon disque. Il va créer un véritable fichier Markdown avec le résumé contenant
00:11:51tout ce que je veux. Et ensuite, je peux commencer une nouvelle conversation et dire : Hé, Claude Code, jette un œil
00:11:59à ce document de transfert sur le disque pour que tu puisses te remettre au page sur ce que tu dois savoir. Contrairement à la compaction,
00:12:04cela ne crée aucun type de fichier. C'est juste un message dans l'historique des messages de cette conversation
00:12:10particulière, une subtile différence. Mais pour certaines personnes, elles veulent un fichier sur le
00:12:15disque. Et souvent, c'est un document vivant et évolutif qui est constamment mis à jour.
00:12:20Ce sont donc vraiment vos trois options. Voulez-vous simplement tout effacer et recommencer à zéro ?
00:12:26Souvent, c'est tout à fait très bien. Voulez-vous simplement utiliser la fonction native de Claude, le compacter et
00:12:31faire injecter le résumé directement ? Ou voulez-vous que le résumé soit un vrai document que Claude peut consulter
00:12:37et lire ? Dans ce cas, utilisez le transfert. Ce sont vos trois options. Et souvent, elles sont meilleures que d'envoyer
00:12:42un nouveau message, car dans l'ensemble, vous ne devriez vraiment pas opérer dans des plages de 400, 500, 600 000
00:12:48jetons de toute façon. Maintenant, l'astuce numéro trois concerne le routage des modèles. Comment choisir le bon modèle
00:12:53pour la tâche ? Afin de ne pas utiliser Fable pour tout. Pouvons-nous utiliser un modèle plus petit, moins cher et moins intelligent
00:12:59pour les tâches plus simples ? La réponse est oui. Et nous pouvons aborder cela de différentes manières.
00:13:04Nous pouvons utiliser des modèles externes. Nous pourrions aller vers GPT, Sol. Nous pourrions aller vers GPT, Luna et Terra, qui viennent de devenir
00:13:10super bon marché. Nous pouvons utiliser des modèles locaux, ou nous avons des options si nous voulons rester dans l'écosystème d'Anthropic.
00:13:16Et la façon la plus simple de le faire, je pense, est le mode conseiller. Ce que vous voyez ici provient du billet de blog
00:13:22initial du conseiller paru il y a plusieurs mois. Il montre donc Opus et Sonnet, mais le même système
00:13:29reste en place avec des modèles comme Fable. Et l'idée est d'avoir un modèle intelligent comme Fable ou même Opus conseillant
00:13:37un modèle plus petit comme Sonnet lorsqu'il s'agit d'exécuter des tâches. Le gros modèle élabore donc un plan, le
00:13:43petit modèle l'exécute, et le petit modèle est capable de partager son contexte avec le plus grand modèle chaque fois
00:13:50qu'il rencontre des problèmes. Et ce modèle s'est targué de meilleurs résultats à moindre coût. Et pour relier notre
00:13:54discussion précédente sur la mise en cache des invites, le conseiller et l'exécuteur ont tous deux leur propre cache d'invites
00:14:01qui fonctionne en même temps. Votre deuxième option consiste à déléguer des tâches à des modèles extérieurs à Claude
00:14:06code. Un moyen facile est d'utiliser Codex. Il y a un plugin Codex pour Claude code, ce qui rend très simple
00:14:12l'appel à Codex depuis l'interface de Claude code. Vous pourriez donc avoir Fable effectuant essentiellement ce même
00:14:18type de mode conseiller, mais au lieu d'appeler Opus ou Sonnet, il appelle les modèles GPT. Il existe
00:14:24d'autres dépôts comme ce conseiller Fable qui font exactement cela. Et en fin de compte, il est assez trivial de configurer
00:14:31votre propre compétence pour faire exactement cela. Et si vous cherchez ces modèles moins chers, je suggère vraiment
00:14:36d'examiner ceux de GPT, en particulier Luna et Terra, car d'une part, leurs coûts ont considérablement baissé,
00:14:41et d'autre part, il n'y a vraiment aucun modèle dans la famille Anthropic qui fait ce qu'ils font
00:14:48à ce niveau de prix. On peut même aller un peu plus loin et intégrer des modèles locaux si
00:14:53les tâches s'y prêtent. L'astuce numéro quatre concerne l'hygiène de votre Claude. Vous avez peut-être vu
00:14:57c récemment cette vidéo de Boris Cherney, le créateur de Claude code, disant :
00:15:01Vous devez supprimer votre fichier Claude.md. Alors, devez-vous vraiment supprimer ce fichier Claude.md ? Eh bien,
00:15:07pas nécessairement, mais ce que vous devez faire, et cela a connu quelques changements récents ces
00:15:12dernières semaines, c'est exécuter la commande slash doctor. Et qu'est-ce que cela a à voir avec les jetons ?
00:15:18Eh bien, d'abord, ce que cette commande va faire entre autres, tout en gardant un lien
00:15:23avec les jetons, c'est jeter un œil à votre fichier Claude.md et élaguer tout ça.
00:15:30La façon dont ces modèles fonctionnent, en particulier ces modèles de la série 5, c'est qu'ils n'ont pas besoin de tant
00:15:36d'instructions. Si vous regardez ce que les gens créaient pour les Claude.md il y a trois, six, neuf mois,
00:15:42ils étaient très prescriptifs et extrêmement détaillés. Et à l'époque, on pouvait peut-être
00:15:46soutenir qu'ils en avaient besoin. Ce n'est plus le cas aujourd'hui. Par conséquent, un fichier Claude.md boursouflé
00:15:53le rend non seulement plus lent, mais il vous coûte littéralement des jetons. Et slash doctor va examiner cela
00:15:59et se débarrasser des éléments de votre Claude.md qui n'ont tout simplement pas lieu d'être. Deuxièmement,
00:16:04il va examiner les éléments qui nuisent à votre contexte ou alourdissent votre fenêtre de contexte.
00:16:10Car même lorsque vous commencez une nouvelle conversation et que vous exécutez slash context, il y a des choses
00:16:15qui la remplissent. J'ai récemment exécuté slash doctor, donc je me suis débarrassé d'une grande partie de ce surplus,
00:16:20mais voici à quoi ressemble ma fenêtre de contexte juste au début d'une conversation sans aucun message
00:16:25envoyé. Nous avons déjà utilisé 40 000 jetons. Qu'est-ce qui consomme une grande partie de cela ? Une partie provient
00:16:31de choses comme les compétences, comme vous pouvez le voir ici. Une autre partie comprend l'invite système ainsi que
00:16:36les fichiers de mémoire. Ce que slash doctor va faire, c'est examiner des éléments tels que vos
00:16:41compétences, vos MCP et commencer à élaguer ceux que vous n'avez tout simplement pas utilisés. Est-ce une énorme économie
00:16:47de jetons ? Non, mais c'est toujours ça de pris à la marge et c'est un correctif tellement simple. Il n'y a aucune
00:16:53raison de ne pas le faire, surtout si vous faites partie de ceux qui ont accumulé 10 millions de compétences au cours
00:16:58des six derniers mois sans jamais faire le tri pour commencer à les réduire, car le faire
00:17:03permettra également à vos compétences de s'exécuter plus efficacement. Et Claude ne sera plus du tout confus
00:17:08quant à la compétence qu'il doit appeler. Je parie que vous avez probablement une dizaine de compétences qui ont toutes
00:17:12un rapport avec le design front-end et vous n'avez pas besoin de tout cela. Donc cette astuce très simple et facile à exécuter
00:17:17en matière d'hygiène de Claude est à ne pas rater. Exécutez simplement doctor. Et cela
00:17:22nous amène à notre dernière astuce, qui est selon moi la moins efficace du lot de nos jours, mais qui consiste
00:17:28en des compétences et des échafaudages supplémentaires que l'on voit circuler un peu partout.
00:17:33Le plus populaire ces temps-ci est ponytail et il réduit essentiellement la quantité de code
00:17:38que Claude écrit tout en maintenant son efficacité, ce qui le rend par conséquent moins cher et plus rapide. J'ai
00:17:44fait une vidéo là-dessus pour comparer ces chiffres avec ce qui se passe réellement, car le dépôt
00:17:51GitHub ne montre que Haiku 4.5, ce qui est manifestement très obsolète. Lorsque j'ai exécuté ceci en utilisant Fable, les chiffres
00:17:56se sont avérés exacts. En fait, les chiffres sont encore meilleurs avec de meilleurs modèles. J'ai utilisé les benchmarks fournis
00:18:01avec ce dépôt GitHub. Ce qui fonctionne pour vous en réalité peut être un peu différent selon la
00:18:06complexité de votre projet. Mais c'est quelque chose que vous pouvez greffer à tout ce dont nous avons parlé
00:18:11jusqu'à présent si vous voulez continuer à réduire votre utilisation de jetons. Un autre que vous verrez souvent est Caveman,
00:18:18qui prétend de nos jours réduire vos jetons de sortie de 65%. Il y a beaucoup de gens qui
00:18:25parlent également de faire simplement des phrases d'une ligne dans Claude MD, quelque chose d'aussi simple que de dire d'être bref,
00:18:30ce qui réduira également vos jetons de sortie. Mais souvenez-vous, les jetons de sortie ne sont qu'une pièce du puzzle.
00:18:36Et ce puzzle, pour en revenir à notre discussion initiale, est dominé par la mise en cache des invites. Donc si
00:18:41vous n'avez rien retenu d'autre de cette vidéo, j'espère que vous avez pu retenir cela car c'est sur quoi nous
00:18:46allons terminer aujourd'hui. Alors comme toujours, dites-moi ce que vous en pensez. Assurez-vous de jeter un œil à
00:18:50ChaseAI Plus si vous voulez mettre la main sur la masterclass Claude Code. Encore une fois, je publie une énorme
00:18:55mise à jour à ce sujet cette semaine. Et sur ce, à la prochaine.

핵심 요약

La maîtrise de la mise en cache des invites et la gestion rigoureuse du contexte permettent de réduire drastiquement le coût des jetons d'entrée avec Claude Code.

하이라이트

  • La mise en cache des invites réduit le coût des jetons d'entrée d'un facteur 20, passant de 20 dollars à 1 dollar par million de jetons.

  • Le cache de messages expire après une heure sans activité, réinitialisant le compteur et facturant la lecture complète au tarif fort.

  • Le changement de modèle, la modification du niveau d'effort, ou la connexion d'un serveur MCP réinitialisent instantanément le cache des invites.

  • La commande slash compact génère un résumé de la conversation et initialise une nouvelle session pour éviter la dégradation du contexte.

  • La commande slash doctor supprime les fichiers Claude.md boursouflés et nettoie les compétences inutilisées pour alléger la fenêtre de contexte.

타임라인

Fonctionnement des jetons et de la mise en cache

  • Les jetons de sortie coûtent cinq fois plus cher que les jetons d'entrée de base.
  • Le cache de messages réduit le coût de lecture de l'historique complet à 1 dollar par million de jetons au lieu de 20 dollars.
  • Une inactivité d'une heure efface le cache et supprime l'avantage tarifaire sur les messages suivants.

Les conversations accumulent rapidement des milliers de jetons d'entrée car chaque message renvoie l'historique complet. Le système de cache permet d'économiser un facteur 20 lors de la lecture des messages précédents. Toutefois, le non-respect de la limite d'une heure ou des actions spécifiques réinitialise le cache et multiplie les coûts par vingt.

Options de gestion de session après une perte de cache

  • La commande slash clear efface l'historique complet pour recommencer une conversation à partir de la base de code.
  • La commande slash compact crée un résumé de la session précédente avant d'ouvrir une nouvelle conversation.
  • Le transfert personnalisé enregistre le résumé directement sur le disque sous forme de fichier Markdown.

Lorsque le cache est perdu suite à une absence prolongée, plusieurs solutions s'offrent aux utilisateurs pour éviter les surcoûts. Effacer la session ou utiliser la compaction automatique protège la fenêtre de contexte contre la dégradation. Le transfert sur disque offre une alternative structurée pour conserver les informations importantes.

Routage des modèles et hygiène de l'environnement

  • Le mode conseiller associe un grand modèle intelligent pour la planification et un modèle plus petit pour l'exécution.
  • La commande slash doctor nettoie le fichier Claude.md et supprime les compétences obsolètes pour libérer la fenêtre de contexte.
  • Les outils externes et les scripts de réduction de code optimisent la consommation de jetons de sortie.

L'utilisation exclusive de modèles haut de gamme alourdit inutilement la facture. Le routage vers des modèles plus économiques et l'exécution régulière de la commande de diagnostic permettent d'alléger la structure de travail. L'optimisation des fichiers de configuration garantit une exécution plus rapide et moins coûteuse.

커뮤니티 글

모든 글 보기