Comment rendre les jetons de Claude Code 20x plus abordables (& 4 autres astuces d'utilisation)
CChase AI
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Vous payez peut-être 20 fois plus cher vos jetons Cloud Code que nécessaire sans même le savoir.
00:00:05Comprendre comment tirer le meilleur parti de vos jetons Cloud Code est l'une des compétences
00:00:08les plus importantes à maîtriser, et cela va bien au-delà de l'ajout d'une ligne dans votre fichier Cloud.md
00:00:14disant : soyez bref. Car si vous ne comprenez pas le fonctionnement de la mise en cache des invites,
00:00:19vous risquez de payer bien plus que nécessaire. Dans cette vidéo, je vais donc vous donner cinq
00:00:23façons différentes de mieux gérer vos jetons Cloud afin de vraiment profiter au maximum
00:00:27de ces modèles haut de gamme. L'astuce numéro un est la plus importante. Elle vous permettra d'économiser
00:00:31plus d'argent et d'utilisation que toutes les autres astuces combinées, de loin, et il s'agit de comprendre le fonctionnement réel
00:00:37de la mise en cache des invites. Pour comprendre cela, vous devez d'abord comprendre comment fonctionnent les jetons. Nous allons donc
00:00:43faire un récapitulatif très rapide, d'environ 60 secondes, pour que nous soyons tous sur la même longueur d'onde. Les jetons sont la monnaie
00:00:47des grands modèles de langage, et grosso modo — c'est un peu simplifié — chaque
00:00:52mot équivaut à un jeton. Ainsi, lorsque vous, l'utilisateur, lors de votre premier message à Fable, dites : comment allez-vous aujourd'hui,
00:01:00vous avez envoyé cinq jetons d'entrée. Lorsque Fable vous répond : je vais très bien, merci,
00:01:09il vous a fourni quatre jetons de sortie. Ceux-ci sont tarifiés différemment. En fait, les jetons de sortie, dans l'ensemble,
00:01:16coûtent cinq fois plus qu'un jeton d'entrée. Ces cinq jetons d'entrée et ces quatre jetons de sortie s'accumulent maintenant
00:01:23dans la fenêtre de contexte. Si les jetons sont la monnaie, alors la fenêtre de contexte est notre budget.
00:01:31Opus, Fable, Sonnet, ils ont tous un budget d'un million de jetons, donc à ce stade, nous avons utilisé
00:01:37neuf de notre million, ce n'est pas grand-chose. Ce qui devient intéressant, c'est lorsque nous envoyons des messages de suivi
00:01:43après le premier. Dans notre deuxième message, moi, l'utilisateur, je dis : construis-moi une application, sans erreurs,
00:01:50six jetons d'entrée, n'est-ce pas ? Je vais simplement envoyer à Anthropic et Fable six jetons d'entrée. Eh bien,
00:01:56pas tout à fait. Ce que je vais réellement lui envoyer, c'est tout. Je vais envoyer à Anthropic
00:02:04toute cette conversation jusqu'à ce point. Je n'envoie donc pas vraiment six jetons d'entrée, j'envoie en fait
00:02:1116 jetons d'entrée car je vais leur envoyer les cinq d'ici et les quatre d'ici parce qu'il
00:02:16va recevoir l'intégralité du message afin de pouvoir comprendre le contexte. Et ce sera le cas pour
00:02:20chaque message de suivi : j'envoie toujours l'intégralité de la conversation
00:02:26précédant ce dernier message. Et vous voyez rapidement comment cela se cumule très, très vite au point
00:02:32où vous parlez de 5 000, 10 000, 100 000 jetons d'entrée envoyés à chaque message. Et vous payez
00:02:37pour cela. Si c'est le cas, alors pourquoi ne consommons-nous pas tout notre quota
00:02:43immédiatement ? Pourquoi tout le monde ne paie-t-il pas un milliard de dollars à chaque fois qu'il essaie d'utiliser ces systèmes d'IA ?
00:02:47Parce qu'évidemment, nous envoyons message après message. Il y a donc tout un tas de
00:02:51messages cumulés envoyés aux serveurs. La solution ici est le système de cache. Alors oui,
00:02:57quand j'envoie le message numéro deux ici, j'envoie effectivement tout cela. Mais ce qui a été créé
00:03:05à ce stade, c'est le cache de messages. Et pour notre deuxième message, ce cache de messages correspond à ces deux premiers
00:03:12messages. Je veux que vous pensiez au cache de messages simplement comme à un document que Claude a sous les yeux
00:03:17et qui contient toute votre conversation jusqu'à présent. Vous discutez donc avec Claude ici,
00:03:23vous envoyez maintenant le message numéro deux, qui est : construis-moi une application, sans erreurs. Mais nous avons le système
00:03:30de cache. Toute cette section, ces deux premiers messages, se trouve donc dans ce document. Ce que
00:03:36Claude et Anthropic peuvent faire, c'est lire ce document, lire le cache,
00:03:42examiner l'historique complet des messages jusqu'à ce point à un tarif bien moins élevé que si vous
00:03:47envoyiez le tout d'un coup sans le cache. C'est ainsi qu'il calcule le coût. Et ce coût
00:03:54est important car ce système de cache ne dure pas éternellement. Ce qu'il faut comprendre, c'est que lorsque
00:04:00vous et Claude vous parlez, et que nous avons ce document de cache entre nous, qui contient tout
00:04:06l'historique de notre conversation que vous pouvez lire très bon marché, il ne le conserve que pendant une heure.
00:04:11Donc si vous et Claude avez cette discussion, avec des allers-retours répétés,
00:04:16vous savez, sans cesse, et qu'ensuite vous vous éloignez pendant une heure. Et vous avez un
00:04:21document long de 500 000 jetons, une conversation de 500 000 jetons. Au bout d'une heure, cela disparaît.
00:04:29C'est effacé. Et donc lorsque vous envoyez un message, le 500 001e, eh bien devinez quoi, vous allez maintenant
00:04:38être facturé au tarif plein pour un message de 500 000 jetons, même si tout ce que vous avez dit était : “Salut, ça va ?”
00:04:46Sachez que lorsque je dis que ce cache ne dure qu'une heure, je veux dire une heure sans activité. Il est donc
00:04:52actualisé à chaque message. Si cela fait 59 minutes depuis notre dernier message et que je relance,
00:04:56eh bien ce compteur d'une heure est réinitialisé. Pourquoi est-ce si important ? C'est une question de coût. J'ai parlé
00:05:01dans l'intro de la différence entre une lecture du cache, c'est-à-dire la lecture de tout cet historique par rapport à la lecture des 500 000
00:05:08messages sans cache, qui représente littéralement une différence de 20 fois. Cela se reflète dans la documentation
00:05:16sur l'augmentation des prix. Rappelez-vous, les jetons de sortie, ce que Claude nous donne, cela ne change jamais.
00:05:22Pour Fable, nous sommes à 50 $par million de jetons et 25$ pour Opus. Mais les jetons d'entrée
00:05:27sont le cœur de cette conversation. Nous parlons toujours de jetons d'entrée de base à
00:05:3310 $ par million, mais c'est un peu un abus de langage car en réalité, nous effectuons toujours des écritures dans le cache.
00:05:40Une écriture dans le cache d'une heure, ce que vous faites sur un plan d'abonnement, coûte en fait le double.
00:05:47Lorsque nous écrivons dans ce cache pour la première fois, comme pour ce premier message, c'est 20 $ par
00:05:54million de jetons. Vous remarquerez une écriture dans le cache de cinq minutes ici, mais elle s'adresse vraiment aux personnes
00:05:59qui utilisent l'API. Comparez cela aux accès au cache, c'est-à-dire quand Anthropic lit simplement ce document sous ses yeux,
00:06:05accumulé heure par heure et actualisé. C'est 1 $, soit 20 fois moins cher. C'est une
00:06:13différence énorme. C'est pourquoi tout ceci, cette astuce en particulier, comprendre la mise en cache des invites et
00:06:18le fonctionnement du système de jetons, est si crucial. Il n'y a rien dont je parlerai par la suite
00:06:22qui vous apportera un gain d'efficacité comparable. Rien du tout.
00:06:29Revenons à notre exemple de conversation de 500 000 jetons que nous avons
00:06:35avec Claude Code et sur le point d'envoyer un message de suivi. Dans le scénario numéro un, nous allons
00:06:40imaginer que nous disposons du système de cache. Cet historique de conversation de 500k est donc mis en cache et j'envoie
00:06:46ce nouveau message. Le calcul du prix fonctionnera de telle sorte qu'il doit quand même lire tout cet historique
00:06:51de conversation. Et cela se fait au tarif de 1 $ par million de jetons. Cela me coûtera donc 50 centimes pour
00:06:58ce message suivant pour qu'il lise tout ainsi que le nouveau message. Imaginons que ce nouveau message fasse un millier
00:07:05de jetons. Ce message de suivi d'un millier de jetons n'est pas facturé à 1 $ le million. Il est facturé à 20 $
00:07:14par million. Pour un millier de jetons, ça fait quoi, deux cents ou quelque chose comme ça ? Je ne sais pas.
00:07:18Mon calcul est probablement faux, mais l'essentiel est que l'historique est à 1 $. Le nouveau est à 20 $ par mois parce que c'est mis en cache.
00:07:26La prochaine fois que nous enverrons un message, même scénario, sauf que ces mille jetons feront désormais partie de ce
00:07:32document de cache. C'est assez logique. D'accord. Ça c'est le scénario un. Scénario deux, nous n'avons pas de cache. Nous avons attendu une heure
00:07:40pour l'envoyer. C'est le moment de l'envoyer. Au lieu que cela coûte 50 centimes, nous allons cette fois
00:07:47être facturés au tarif d'écriture dans le cache, c'est-à-dire, rappelons-le, 20 $ par million. Combien
00:07:54cela va-t-il coûter ? Eh bien maintenant, ce seul message nous coûte environ 10 balles. Nous sommes donc passés de 50 centimes à
00:08:0010 dollars juste parce que nous avons attendu une heure. Voilà les conséquences de ne pas comprendre
00:08:05cela. Le temps n'est pas la seule chose à prendre en compte pour la perte du cache. Il y
00:08:10a d'autres éléments qui le réinitialiseront complètement. Et cela vient directement de la documentation de Cloud Code.
00:08:14Si vous changez de modèle, par exemple vous êtes sur Fable et vous passez à Opus après 500 000 jetons,
00:08:20c'est perdu. Le cache est réinitialisé. Niveau d'effort, si vous le modifiez. Mode rapide, connexion ou déconnexion
00:08:26d'un serveur MCP, plugins, refus d'outils, compactage de la conversation, ou simple mise à jour de Cloud Code
00:08:32en général. N'importe laquelle de ces actions réinitialisera le cache et votre prochain message sera 20 fois plus cher
00:08:38que nécessaire. Cela étant dit, que pouvez-vous réellement faire de cette information ?
00:08:42Que faites-vous lorsque vous devez vous éloigner d'une conversation
00:08:46qui contient beaucoup d'informations importantes, mais que vous allez vous absenter plus d'une heure,
00:08:50ou que vous vous êtes absenté pendant plus d'une heure et que vous revenez en réalisant : oh mince, genre
00:08:54je n'y avais pas pensé à l'avance. C'est ce dont nous allons parler dans l'astuce numéro deux.
00:08:59Mais d'abord, un petit mot du sponsor d'aujourd'hui : moi. Cette semaine, je sors une version entièrement mise à jour
00:09:06de ma masterclass Cloud Code au sein de Chase AI+. Beaucoup de choses ont changé depuis que j'ai lancé
00:09:12ce cours. Je le mets constamment à jour. Mais fondamentalement, nous avons fait du chemin depuis mars, date à laquelle
00:09:19j'ai créé ce truc. Donc si vous essayez de progresser avec l'IA, si vous ne venez pas du tout
00:09:24d'un milieu technique et que vous voulez une feuille de route pour savoir comment utiliser cet outil
00:09:28de zéro avec des cas d'usage concrets, alors c'est pour vous. C'est disponible
00:09:33dans Chase AI+. Un lien se trouve dans le commentaire épinglé. L'astuce numéro deux concerne vos
00:09:37options lorsque nous perdons le cache. Nous nous sommes absentés trop longtemps. Nous avons une conversation de deux,
00:09:42trois, quatre, cinq cent mille jetons. Et nous voulons savoir quelle doit être la prochaine étape
00:09:47et cela dépend en gros de votre situation.
00:09:52Notre première option est en quelque sorte l'option nucléaire, qui consiste simplement à faire slash clear.
00:09:58Slash clear va simplement effacer tout l'historique de la conversation. Et ce n'est pas toujours une mauvaise
00:10:04chose. En fait, si vous travaillez sur une sorte de base de code, un projet avec
00:10:10un tas de fichiers et de contexte, vous avez probablement juste envie de faire slash clear. Quoi
00:10:15que vous fassiez, de quoi que vous parliez, il y a de fortes chances qu'il y ait des indices dans le projet lui-même
00:10:20comme quoi cela s'est produit. Cloud Code peut simplement jeter un œil à cela. Et quand vous commencez une nouvelle conversation
00:10:25partir de zéro, il peut reprendre les choses en main et vous ramener là où vous en étiez. Vous n'avez pas besoin d'être esclave
00:10:31de la conversation précédente. Maintenant, votre deuxième option est d'utiliser le compactage. Il existe d'ailleurs une fonction de compactage automatique
00:10:38dans Cloud Code une fois que vous atteignez un certain nombre de jetons. Je vous suggère de ne pas attendre d'arriver
00:10:42à ce stade, car lorsque nous travaillons dans la plage de six, sept ou huit cent mille jetons, nous
00:10:47commençons à faire face à la dégradation du contexte. C'est encore un problème avec ces grands modèles, ces modèles plus puissants,
00:10:51mais nous pouvons faire slash compact à tout moment. Et ce que cela va faire pour nous, c'est créer un
00:10:57résumé de ce dont nous avons parlé. Et ensuite, à toutes fins utiles, il va faire un slash
00:11:03clear, mais il va démarrer une nouvelle conversation avec ce résumé, un peu comme dans la mémoire. Donc
00:11:10si vous aviez des choses importantes dans cette conversation et que vous pensez que le contenu de la base de code ne sera pas
00:11:15suffisant pour qu'il comprenne, alors faites simplement une compaction, slash compact. Il commencera une nouvelle
00:11:20conversation avec ce résumé. Et ce résumé vit simplement dans l'historique des messages. Votre troisième option
00:11:26est très similaire à la compaction et consiste à utiliser une sorte d'outil de transfert personnalisé. Il existe un tas de compétences
00:11:32de transfert personnalisées. J'en ai une moi-même. Vous pouvez l'obtenir dans ma communauté gratuite. Et la différence
00:11:38entre le transfert et la compaction réside dans l'endroit où vit ce résumé. Donc si je fais un transfert, ce que cela va faire, c'est
00:11:46le placer directement sur mon disque. Il va créer un véritable fichier Markdown avec le résumé contenant
00:11:51tout ce que je veux. Et ensuite, je peux commencer une nouvelle conversation et dire : Hé, Claude Code, jette un œil
00:11:59à ce document de transfert sur le disque pour que tu puisses te remettre au page sur ce que tu dois savoir. Contrairement à la compaction,
00:12:04cela ne crée aucun type de fichier. C'est juste un message dans l'historique des messages de cette conversation
00:12:10particulière, une subtile différence. Mais pour certaines personnes, elles veulent un fichier sur le
00:12:15disque. Et souvent, c'est un document vivant et évolutif qui est constamment mis à jour.
00:12:20Ce sont donc vraiment vos trois options. Voulez-vous simplement tout effacer et recommencer à zéro ?
00:12:26Souvent, c'est tout à fait très bien. Voulez-vous simplement utiliser la fonction native de Claude, le compacter et
00:12:31faire injecter le résumé directement ? Ou voulez-vous que le résumé soit un vrai document que Claude peut consulter
00:12:37et lire ? Dans ce cas, utilisez le transfert. Ce sont vos trois options. Et souvent, elles sont meilleures que d'envoyer
00:12:42un nouveau message, car dans l'ensemble, vous ne devriez vraiment pas opérer dans des plages de 400, 500, 600 000
00:12:48jetons de toute façon. Maintenant, l'astuce numéro trois concerne le routage des modèles. Comment choisir le bon modèle
00:12:53pour la tâche ? Afin de ne pas utiliser Fable pour tout. Pouvons-nous utiliser un modèle plus petit, moins cher et moins intelligent
00:12:59pour les tâches plus simples ? La réponse est oui. Et nous pouvons aborder cela de différentes manières.
00:13:04Nous pouvons utiliser des modèles externes. Nous pourrions aller vers GPT, Sol. Nous pourrions aller vers GPT, Luna et Terra, qui viennent de devenir
00:13:10super bon marché. Nous pouvons utiliser des modèles locaux, ou nous avons des options si nous voulons rester dans l'écosystème d'Anthropic.
00:13:16Et la façon la plus simple de le faire, je pense, est le mode conseiller. Ce que vous voyez ici provient du billet de blog
00:13:22initial du conseiller paru il y a plusieurs mois. Il montre donc Opus et Sonnet, mais le même système
00:13:29reste en place avec des modèles comme Fable. Et l'idée est d'avoir un modèle intelligent comme Fable ou même Opus conseillant
00:13:37un modèle plus petit comme Sonnet lorsqu'il s'agit d'exécuter des tâches. Le gros modèle élabore donc un plan, le
00:13:43petit modèle l'exécute, et le petit modèle est capable de partager son contexte avec le plus grand modèle chaque fois
00:13:50qu'il rencontre des problèmes. Et ce modèle s'est targué de meilleurs résultats à moindre coût. Et pour relier notre
00:13:54discussion précédente sur la mise en cache des invites, le conseiller et l'exécuteur ont tous deux leur propre cache d'invites
00:14:01qui fonctionne en même temps. Votre deuxième option consiste à déléguer des tâches à des modèles extérieurs à Claude
00:14:06code. Un moyen facile est d'utiliser Codex. Il y a un plugin Codex pour Claude code, ce qui rend très simple
00:14:12l'appel à Codex depuis l'interface de Claude code. Vous pourriez donc avoir Fable effectuant essentiellement ce même
00:14:18type de mode conseiller, mais au lieu d'appeler Opus ou Sonnet, il appelle les modèles GPT. Il existe
00:14:24d'autres dépôts comme ce conseiller Fable qui font exactement cela. Et en fin de compte, il est assez trivial de configurer
00:14:31votre propre compétence pour faire exactement cela. Et si vous cherchez ces modèles moins chers, je suggère vraiment
00:14:36d'examiner ceux de GPT, en particulier Luna et Terra, car d'une part, leurs coûts ont considérablement baissé,
00:14:41et d'autre part, il n'y a vraiment aucun modèle dans la famille Anthropic qui fait ce qu'ils font
00:14:48à ce niveau de prix. On peut même aller un peu plus loin et intégrer des modèles locaux si
00:14:53les tâches s'y prêtent. L'astuce numéro quatre concerne l'hygiène de votre Claude. Vous avez peut-être vu
00:14:57c récemment cette vidéo de Boris Cherney, le créateur de Claude code, disant :
00:15:01Vous devez supprimer votre fichier Claude.md. Alors, devez-vous vraiment supprimer ce fichier Claude.md ? Eh bien,
00:15:07pas nécessairement, mais ce que vous devez faire, et cela a connu quelques changements récents ces
00:15:12dernières semaines, c'est exécuter la commande slash doctor. Et qu'est-ce que cela a à voir avec les jetons ?
00:15:18Eh bien, d'abord, ce que cette commande va faire entre autres, tout en gardant un lien
00:15:23avec les jetons, c'est jeter un œil à votre fichier Claude.md et élaguer tout ça.
00:15:30La façon dont ces modèles fonctionnent, en particulier ces modèles de la série 5, c'est qu'ils n'ont pas besoin de tant
00:15:36d'instructions. Si vous regardez ce que les gens créaient pour les Claude.md il y a trois, six, neuf mois,
00:15:42ils étaient très prescriptifs et extrêmement détaillés. Et à l'époque, on pouvait peut-être
00:15:46soutenir qu'ils en avaient besoin. Ce n'est plus le cas aujourd'hui. Par conséquent, un fichier Claude.md boursouflé
00:15:53le rend non seulement plus lent, mais il vous coûte littéralement des jetons. Et slash doctor va examiner cela
00:15:59et se débarrasser des éléments de votre Claude.md qui n'ont tout simplement pas lieu d'être. Deuxièmement,
00:16:04il va examiner les éléments qui nuisent à votre contexte ou alourdissent votre fenêtre de contexte.
00:16:10Car même lorsque vous commencez une nouvelle conversation et que vous exécutez slash context, il y a des choses
00:16:15qui la remplissent. J'ai récemment exécuté slash doctor, donc je me suis débarrassé d'une grande partie de ce surplus,
00:16:20mais voici à quoi ressemble ma fenêtre de contexte juste au début d'une conversation sans aucun message
00:16:25envoyé. Nous avons déjà utilisé 40 000 jetons. Qu'est-ce qui consomme une grande partie de cela ? Une partie provient
00:16:31de choses comme les compétences, comme vous pouvez le voir ici. Une autre partie comprend l'invite système ainsi que
00:16:36les fichiers de mémoire. Ce que slash doctor va faire, c'est examiner des éléments tels que vos
00:16:41compétences, vos MCP et commencer à élaguer ceux que vous n'avez tout simplement pas utilisés. Est-ce une énorme économie
00:16:47de jetons ? Non, mais c'est toujours ça de pris à la marge et c'est un correctif tellement simple. Il n'y a aucune
00:16:53raison de ne pas le faire, surtout si vous faites partie de ceux qui ont accumulé 10 millions de compétences au cours
00:16:58des six derniers mois sans jamais faire le tri pour commencer à les réduire, car le faire
00:17:03permettra également à vos compétences de s'exécuter plus efficacement. Et Claude ne sera plus du tout confus
00:17:08quant à la compétence qu'il doit appeler. Je parie que vous avez probablement une dizaine de compétences qui ont toutes
00:17:12un rapport avec le design front-end et vous n'avez pas besoin de tout cela. Donc cette astuce très simple et facile à exécuter
00:17:17en matière d'hygiène de Claude est à ne pas rater. Exécutez simplement doctor. Et cela
00:17:22nous amène à notre dernière astuce, qui est selon moi la moins efficace du lot de nos jours, mais qui consiste
00:17:28en des compétences et des échafaudages supplémentaires que l'on voit circuler un peu partout.
00:17:33Le plus populaire ces temps-ci est ponytail et il réduit essentiellement la quantité de code
00:17:38que Claude écrit tout en maintenant son efficacité, ce qui le rend par conséquent moins cher et plus rapide. J'ai
00:17:44fait une vidéo là-dessus pour comparer ces chiffres avec ce qui se passe réellement, car le dépôt
00:17:51GitHub ne montre que Haiku 4.5, ce qui est manifestement très obsolète. Lorsque j'ai exécuté ceci en utilisant Fable, les chiffres
00:17:56se sont avérés exacts. En fait, les chiffres sont encore meilleurs avec de meilleurs modèles. J'ai utilisé les benchmarks fournis
00:18:01avec ce dépôt GitHub. Ce qui fonctionne pour vous en réalité peut être un peu différent selon la
00:18:06complexité de votre projet. Mais c'est quelque chose que vous pouvez greffer à tout ce dont nous avons parlé
00:18:11jusqu'à présent si vous voulez continuer à réduire votre utilisation de jetons. Un autre que vous verrez souvent est Caveman,
00:18:18qui prétend de nos jours réduire vos jetons de sortie de 65%. Il y a beaucoup de gens qui
00:18:25parlent également de faire simplement des phrases d'une ligne dans Claude MD, quelque chose d'aussi simple que de dire d'être bref,
00:18:30ce qui réduira également vos jetons de sortie. Mais souvenez-vous, les jetons de sortie ne sont qu'une pièce du puzzle.
00:18:36Et ce puzzle, pour en revenir à notre discussion initiale, est dominé par la mise en cache des invites. Donc si
00:18:41vous n'avez rien retenu d'autre de cette vidéo, j'espère que vous avez pu retenir cela car c'est sur quoi nous
00:18:46allons terminer aujourd'hui. Alors comme toujours, dites-moi ce que vous en pensez. Assurez-vous de jeter un œil à
00:18:50ChaseAI Plus si vous voulez mettre la main sur la masterclass Claude Code. Encore une fois, je publie une énorme
00:18:55mise à jour à ce sujet cette semaine. Et sur ce, à la prochaine.