Как сделать токены Claude Code в 20 раз дешевле (и еще 4 полезных лайфхака)

CChase AI
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Возможно, вы платите за токены Cloud Code в 20 раз больше, чем нужно, даже не подозревая об этом.
00:00:05Понимание того, как извлечь максимум пользы из токенов Cloud Code, — это один из важнейших
00:00:08навыков, которыми вы можете овладеть, и он выходит далеко за рамки простого добавления строки в файл Cloud.md
00:00:14с текстом «будь краток». Ведь если вы не понимаете, как вообще работает кэширование промптов,
00:00:19вы можете переплачивать в разы. Поэтому в этом видео я дам вам пять
00:00:23различных способов лучше управлять токенами Cloud, чтобы вы могли получить максимум от
00:00:27этих первоклассных моделей. Совет номер один — самый важный. Он сбережет вам больше денег
00:00:31и ресурсов, чем все остальные советы вместе взятые, и это — понимание принципа работы кэширования промптов.
00:00:37Чтобы разобраться в кэшировании промптов, нужно понять, как вообще работают токены. Поэтому мы сделаем
00:00:43- "очень быстрый обзор секунд на 60, чтобы мы были на одной волне. Токены — это валюта"
00:00:47больших языковых моделей, и если говорить совсем просто (несколько упрощая), каждое
00:00:52слово равно одному токену. Так что, когда вы, пользователь, в своем первом сообщении Fable говорите: «Как дела сегодня?»,
00:01:00вы отправляете пять входных токенов. Когда же Fable отвечает вам: «У меня все отлично, спасибо»,
00:01:09модель выдает вам четыре выходных токена. Они оцениваются по-разному. По сути, выходные токены
00:01:16в основном стоят в пять раз дороже входных. Эти пять входных и четыре выходных токена теперь
00:01:23накапливаются в контекстном окне. Если токены — это валюта, то контекстное окно — наш бюджет.
00:01:31Opus, Fable, Sonnet — у всех у них бюджет в один миллион токенов, так что к этому моменту мы использовали
00:01:37девять из миллиона, совсем немного. Самое интересное начинается при отправке последующих сообщений
00:01:43после первого. В нашем втором сообщении я, пользователь, говорю: «Создай мне приложение без ошибок»,
00:01:50— шесть входных токенов, верно? Я просто отправлю Anthropic и Fable шесть входных токенов. Ну,
00:01:56не совсем так. На самом деле я отправляю им абсолютно все. Я собираюсь отправить Anthropic
00:02:04весь этот разговор вплоть до текущего момента. То есть я отправляю не шесть входных токенов, а целых
00:02:1116 входных токенов, потому что передам и те пять отсюда, и те четыре оттуда, ведь
00:02:16модели требуется всё сообщение целиком для понимания контекста. И так будет происходить
00:02:20с каждым последующим сообщением: я всегда отправляю всю историю беседы,
00:02:26предшествующую последнему сообщению. Легко заметить, как это лавинообразно накапливается, и вот
00:02:32речь уже идет о 5 000, 10 000, 100 000 входных токенов, отправляемых с каждым сообщением. И вы
00:02:37платите за это. Если это так, то почему мы не исчерпываем весь лимит
00:02:43мгновенно? Почему каждый не платит миллиард долларов при каждой попытке воспользоваться этими ИИ-системами?
00:02:47Потому что мы, очевидно, отправляем сообщение за сообщением, и на серверы передается
00:02:51огромный массив наслоенных друг на друга сообщений. Решением здесь является система кэширования. Итак, да,
00:02:57когда я отправляю второе сообщение здесь, я действительно отправляю все это. Но что уже было создано
00:03:05к этому моменту? Кэш сообщений. Для нашего второго сообщения этим кэшем являются первые
00:03:12два сообщения. Представьте кэш сообщений просто как документ, который лежит перед Claude
00:03:17и содержит весь ваш разговор до этого момента. Допустим, вы общаетесь с Claude здесь,
00:03:23отправляя второе сообщение: «Создай мне приложение без ошибок». Но у нас есть система кэширования,
00:03:30поэтому весь этот раздел, первые два сообщения, теперь находится в этом документе. В результате
00:03:36Claude и Anthropic могут прочитать этот документ, прочитать кэш,
00:03:42изучить всю историю сообщений к этому моменту по гораздо более низкой цене, чем если бы вы
00:03:47просто отправляли все разом без кэша. Так и рассчитывается стоимость. Этот аспект
00:03:54важен, поскольку система кэширования не вечна. Вы должны понимать: когда
00:04:00вы общаетесь с Claude и между вами есть этот кэш-документ, содержащий всю
00:04:06историю беседы, которую можно читать очень дешево, он хранится всего один час.
00:04:11Поэтому, если вы с Claude ведете эту дискуссию, обмениваясь репликами снова и снова,
00:04:16взамен туда-сюда, а затем отходите на час, имея
00:04:21документ длиной в 500 000 токенов (разговор на полмиллиона токенов), через час все это исчезает.
00:04:29Это пропало. И когда вы отправляете 500 001-е сообщение, угадайте что: вам
00:04:38придется платить по полной ставке за все 500 000 токенов сообщения, даже если вы сказали лишь: «Эй, как дела?»
00:04:46Помните, когда я говорю, что этот кэш живет всего один час, я имею в виду час без какой-либо активности. Он
00:04:52обновляется с каждым сообщением. Так что, если прошло 59 минут с нашего последнего сообщения и я снова пишу,
00:04:56этот часовой таймер сбрасывается. Почему это так важно? Из-за стоимости. Я говорил
00:05:01во введении: разница между чтением из кэша (то есть чтением всей этой истории) и чтением сообщения на 500 000
00:05:08без кэша составляет ровно 20 раз. Это отражено
00:05:16в документации по ценам. Помните: выходные токены, выдаваемые Claude, неизменны.
00:05:22Для Fable мы смотрим на $50 за миллион токенов и $25 для Opus. Но входные токены
00:05:27— это то, вокруг чего строится весь разговор. Мы всегда говорим, что базовые входные токены стоят
00:05:33$10 за миллион, но это отчасти неверно, поскольку на практике мы всегда выполняем запись в кэш.
00:05:40Запись в часовой кэш, которая происходит при оформлении подписки, фактически стоит вдвое дороже.
00:05:47Поэтому при первой записи в кэш, например для самого первого сообщения, тариф составляет $20 за
00:05:54миллион токенов. Здесь вы заметите пятиминутный кэш, но он предназначен в основном для тех, кто
00:05:59пользуется API. Сравните это с попаданиями в кэш (cache hits), когда Anthropic просто читает документ перед собой,
00:06:05который накапливался каждый час и обновляется. Это стоит $1 — в 20 раз дешевле. Колоссальная
00:06:13разница. Именно поэтому вся эта тема, этот конкретный совет о понимании кэширования промптов и
00:06:18работы системы токенов, настолько важна. Ничто из того, о чем я скажу далее,
00:06:22не даст вам сопоставимого прироста эффективности. Ничто.
00:06:29Теперь вернемся к нашему примеру с разговором на 500 000 токенов,
00:06:35который мы ведем в Claude code перед отправкой следующего сообщения. В сценарии номер один
00:06:40представим, что у нас есть система кэширования. История этого диалога на 500 тыс. кэширована, и я отправляю
00:06:46новое сообщение. Ценообразование будет работать так: модели все равно нужно прочитать всю историю
00:06:51этого разговора по тарифу $1 за миллион токенов. Чтение всего объема плюс нового сообщения
00:06:58обойдется мне в 50 центов за следующее сообщение. Представьте, что новое сообщение содержало тысячу
00:07:05токенов. Это последующее сообщение на тысячу токенов тарифицируется не по $1 за миллион, а по $20
00:07:14за миллион. Сколько это для тысячи токенов — цента два или около того? Не знаю.
00:07:18Мои расчеты могут быть неточными, но суть в том, что история стоит $1, а новое сообщение — $20 за счет кэширования.
00:07:26При отправке следующего сообщения в том же сценарии эта тысяча токенов станет частью того же
00:07:32кэш-документа. Звучит логично? Хорошо. Это первый сценарий. Во втором сценарии кэша нет — мы подождали час
00:07:40перед отправкой. Вместо 50 центов мы теперь
00:07:47будем платить по тарифу записи в кэш, который, как помните, составляет $20 за миллион. Во сколько же
00:07:54это обойдется? Теперь одно это сообщение будет стоить нам долларов 10. Мы перескочили с 50 центов на
00:08:0010 долларов просто потому, что подождали час. Таковы последствия непонимания
00:08:05этого процесса. Время — не единственный фактор потери кэша. Существуют и другие вещи,
00:08:10которые сбрасывают его полностью, и это прямо указано в документации Cloud Code.
00:08:14Если вы переключаете модель (например, работали на Fable, а перешли на Opus при наборе в 500 000 токенов),
00:08:20все пропало. Кэш сброшен. Уровень усилий, его изменение. Быстрый режим, подключение или отключение
00:08:26сервера MCP, плагины, отклонение инструментов, компактизация диалога или просто обновление Cloud Code
00:08:32в целом. Любое из этих действий сбросит кэш, и ваше следующее сообщение окажется в 20 раз дороже,
00:08:38чем могло бы быть. Учитывая все это, что же вы реально можете сделать с данной информацией?
00:08:42Как поступить, если вам нужно прервать работу над диалогом,
00:08:46содержащим много важной информации, но вас не будет дольше часа,
00:08:50или вы отсутствовали больше часа, возвращаетесь и понимаете: «Черт, я же
00:08:54не подумал об этом заранее»? Что ж, об этом мы поговорим во втором совете.
00:08:59Но сначала пару слов от спонсора сегодняшнего выпуска — меня. На этой неделе я выпускаю полностью обновленную
00:09:06версию моего мастер-класса по Cloud Code в рамках Chase AI+. С момента моего первого релиза
00:09:12многое изменилось. Я постоянно его обновляю, но в целом мы прошли большой путь с марта, когда я его выпустил.
00:09:19Так что, если вы хотите прокачать свои навыки работы с ИИ, особенно если у вас
00:09:24нет технического бэкграунда, и вам нужна пошаговая дорожная карта по использованию этого инструмента
00:09:28с нуля с упором на реальные кейсы, это для вас. Все доступно внутри
00:09:33Chase AI+. Ссылка на него находится в закрепленном комментарии. Второй совет посвящен
00:09:37вашим действиям при потере кэша. Мы отсутствовали слишком долго, и у нас есть диалог на два,
00:09:42три, четыре или пятьсот тысяч токенов. Мы хотим знать, каким должен быть следующий шаг,
00:09:47чтобы не платить баснословные суммы, и это зависит от конкретной ситуации.
00:09:52Итак, наш первый вариант — это своего рода радикальная мера, а именно использование команды forward slash clear.
00:09:58Команда forward slash clear просто удаляет всю историю разговора. И это не всегда плохо.
00:10:04На самом деле, если вы работаете в какой-то кодовой базе, в каком-то проекте
00:10:10с кучей файлов и контекста, вам, вероятно, просто стоит ввести forward slash clear. Что бы
00:10:15вы ни делали, о чем бы ни говорили, скорее всего, в самом проекте есть свидетельства
00:10:20того, что произошло. Cloud Code может просто посмотреть на это. И когда вы начнете новый разговор
00:10:25с нуля, он сможет собрать все воедино и вернуть вас туда, где вы были. Вам не нужно быть рабом
00:10:31предыдущего разговора. Теперь ваш второй вариант — использовать сжатие. Внутри Cloud Code есть функция
00:10:38автоматического сжатия, когда вы достигаете определенного количества токенов. Я предлагаю не дожидаться
00:10:42этого момента, потому что когда мы работаем в диапазоне шести, семи, восьмисот тысяч токенов, мы
00:10:47начинаем сталкиваться с деградацией контекста. Это по-прежнему проблема для таких больших и мощных моделей,
00:10:51но мы можем использовать forward slash compact в любой момент. И это сделает для нас следующее:
00:10:57создаст резюме того, о чем мы говорили. А затем, по сути, выполнит команду forward slash
00:11:03clear, но начнет новый разговор с этим резюме, как бы храня его в памяти. Так что
00:11:10если в этом разговоре были важные вещи, и вы не думаете, что содержимого кодовой базы
00:11:15будет достаточно для понимания, то просто сделайте сжатие — forward slash compact. Он начнет новый
00:11:20разговор с этим резюме. И это резюме просто хранится в истории сообщений. Теперь ваш третий вариант
00:11:26очень похож на сжатие, и это использование какого-нибудь пользовательского инструмента передачи данных. Есть много
00:11:32пользовательских навыков для передачи контекста. У меня есть свой собственный. Вы можете получить его в моем бесплатном сообществе. И разница
00:11:38между передачей контекста и сжатием заключается в том, где хранится это резюме. Если я использую передачу контекста, то она
00:11:46фактически просто сохраняет его на моем диске. Она создает реальный файл утекста в формате Markdown с резюме
00:11:51и всем необходимым. И тогда я могу начать новый разговор и сказать: «Эй, Claude code, взгляни
00:11:59на тот документ передачи контекста на диске», чтобы ты мог вникнуть в то, что тебе нужно знать. В отличие от сжатия,
00:12:04оно не создает никаких файлов. Это просто сообщение в истории сообщений в конкретном
00:12:10разговоре, который вы ведёте — небольшое отличие. Но некоторым людям нужен именно файл на
00:12:15диске. И часто это живой документ, который постоянно обновляется.
00:12:20Итак, у вас действительно есть три варианта. Хотите ли вы просто все очистить и начать с нуля?
00:12:26Зачастую это абсолютно нормально. Хотите ли вы просто использовать встроенную функцию Claude для сжатия
00:12:31и внедрения резюме прямо внутрь? Или вы хотите, чтобы резюме было настоящим документом, на который Claude может
00:12:37посмотреть? В таком случае используйте передачу контекста. Это ваши три варианта. И зачастую они лучше, чем просто
00:12:42отправка нового сообщения, потому что в целом вам вообще не следует работать в диапазонах 400, 500, 600 тысяч
00:12:48токенов. Теперь совет номер три касается маршрутизации моделей. Как нам выбрать правильную модель
00:12:53для работы? Чтобы мы не использовали Fable для всего подряд. Можем ли мы использовать меньшую, более дешевую и менее умную
00:12:59модель для более простых задач? Ответ: да. И мы можем подойти к этому с разных сторон.
00:13:04Мы можем использовать сторонние модели. Мы могли бы обратиться к GPT, Sol. Мы могли бы перейти к GPT, Luna и Terra, которые только что стали
00:13:10супер дешевыми. Мы можем использовать локальные модели, или у нас есть варианты, если мы хотим остаться в экосистеме Anthropic.
00:13:16И самый простой способ сделать это, как мне кажется, — режим советника. То, что вы здесь видите, взято из оригинального
00:13:22блога о советниках, вышедшего несколько месяцев назад. И там показаны Opus и Sonnet, но та же система
00:13:29сохраняется и с такими моделями, как Fable. И идея в том, что умная модель, вроде Fable или даже Opus, консультирует
00:13:37меньшую модель, такую как Sonnet, когда дело касается выполнения задач. Большая модель разрабатывает план,
00:13:43маленькая модель выполняет его, и маленькая модель может делиться своим контекстом с большей моделью всякий раз,
00:13:50когда она сталкивается с проблемами. И эта модель показала лучшие результаты при более низких затратах. И возвращаясь к нашему
00:13:54предыдущему обсуждению кэширования промптов, и у советника, и у исполнителя есть свой собственный кэш промптов,
00:14:01работающий одновременно. Теперь ваш второй вариант — делегировать задачи моделям за пределами Claude
00:14:06code. Простой вариант — Codex. Существует плагин Codex для Claude code, который позволяет очень легко
00:14:12вызывать Codex из интерфейса Claude code. Таким образом, Fable может выполнять ту же самую
00:14:18роль режима советника, но вместо вызова Opus или Sonnet она вызывает модели GPT. Есть
00:14:24и другие репозитории, подобные этому советнику Fable, которые делают именно это. И в конечном счете довольно просто настроить
00:14:31собственный навык, который делает ровно это. И если вы ищете те самые более дешевые модели, я действительно советую
00:14:36посмотреть на модели GPT, особенно Luna и Terra, потому что, во-первых, их стоимость значительно снизилась,
00:14:41а во-вторых, в семействе Anthropic действительно нет никакой модели, которая делала бы то, что делают они,
00:14:48по такой цене. Можно даже пойти дальше и подключить локальные модели, если
00:14:53для задач это имеет смысл. Совет номер четыре посвящен гигиене Claude. Вы, возможно, видели
00:14:57недавнее популярное видео с Борисом Черни, создателем Claude code, который говорит:
00:15:01«Вам нужно удалить ваш файл Claude.md». Что ж, действительно ли нужно удалять этот файл Claude.md? Ну,
00:15:07не обязательно, но что вам действительно нужно сделать — и в последние пару недель здесь произошли некоторые изменения —
00:15:12так это запустить команду forward slash doctor. И какое отношение это имеет к токенам?
00:15:18Ну, во-первых, что эта команда сделает помимо прочего — а мы все же держим в уме токеновую тему —
00:15:23так это изучит ваш файл Claude.md и сократит его.
00:15:30То, как работают эти модели, особенно модели серии 5, заключается в том, что им требуется не так много
00:15:36инструкций. Если вы посмотрите на то, что люди создавали для Claude.md 3, 6, 9 месяцев
00:15:42назад, они были очень жесткими и чрезвычайно подробными. И, возможно, в то время можно было
00:15:46утверждать, что они им нужны. Сейчас это уже не так. И раздутый файл Claude.md не только
00:15:53замедляет работу, но и буквально стоит вам токенов. И forward slash doctor просмотрит его
00:15:59и избавится от того, чему просто не нужно быть в вашем Claude.md. Во-вторых,
00:16:04он проверит вещи, которые портят или раздувают ваше окно контекста.
00:16:10Потому что даже когда вы начинаете новый разговор и вводите forward slash context, его что-то
00:16:15заполняет. Я недавно запустил forward slash doctor, поэтому избавился от большой части мусора,
00:16:20но вот как выглядит мое окно контекста прямо в начале разговора без отправленных
00:16:25сообщений. Мы уже использовали 40 000 токенов. И что же так сильно его загружает? Часть этого исходит
00:16:31от таких вещей, как навыки, как вы можете здесь видеть. Часть включает в себя системный промпт, а также
00:16:36файлы памяти. Команда forward slash doctor просматривает такие вещи, как ваши
00:16:41навыки, ваши MCP и начинает сокращать те, которые вы просто не использовали. Дает ли это огромную экономию
00:16:47токенов? Нет, но это кое-что, это небольшой плюс, и это настолько простое исправление. Нет
00:16:53причин не делать этого, особенно если вы тот человек, который просто накопил 10 миллионов навыков за
00:16:58последние шесть месяцев и на самом деле не просматривал их и не сокращал, потому что это
00:17:03также заставит ваши навыки работать более эффективно. И у Claude не будет путаницы по поводу
00:17:08того, какой навык ему нужно вызвать. Держу пари, у вас наверняка есть штук 10 навыков, которые
00:17:12все связаны с фронтенд-дизайном, и они вам все не нужны. Так что этот очень простой и легкий в исполнении совет,
00:17:17когда дело касается гигиены Claude, нельзя упускать. Просто запустите doctor. И это
00:17:22подводит нас к нашему последнему совету, который, я думаю, в наши дни наименее эффективен из всех, но это
00:17:28дополнительные навыки и каркасы, которые можно встретить повсюду.
00:17:33Самый популярный из них сегодня — ponytail, по сути, он сокращает количество кода,
00:17:38который пишет Claude, сохраняя его эффективность и делая его более дешевым и быстрым. Я
00:17:44снял об этом видео, сравнивая эти цифры с тем, что происходит в реальности, потому что в репозитории GitHub
00:17:51указан только haiku 4.5, что, очевидно, сильно устарело. Когда я запустил это с Fable, цифры
00:17:56подтвердились. На самом деле с лучшими моделями цифры выглядят еще лучше. Я использовал бенчмарки,
00:18:01которые прилагались к этому репозиторию GitHub. То, что работает для вас в реальности, может немного отличаться в зависимости от
00:18:06сложности вашего проекта. Но это то, что вы можете применить ко всему, о чем мы говорили
00:18:11до сих пор, если хотите продолжать снижать расход токенов. Еще один инструмент, который вы часто увидите, — Caveman,
00:18:18который в настоящее время заявляет, что сокращает ваши выходные токены на 65%. Есть много людей,
00:18:25которые также говорят о том, чтобы использовать простые однострочники в Claude MD, например, просто сказать «будь краток»,
00:18:30что тоже сократит ваши выходные токены. Но помните, выходные токены — это лишь часть головоломки.
00:18:36И в этой головоломке, возвращаясь к нашему первоначальному обсуждению, доминирует кэширование промптов. Так что если
00:18:41вы ничего больше не вынесли из этого видео, я надеюсь, вы поняли это, потому что на этом мы
00:18:46сегодня закончим. Так что, как всегда, дайте мне знать, что вы думаете. Обязательно загляните в
00:18:50ChaseAI Plus, если хотите получить в свои руки мастер-класс по Claude Code. Опять же, выпускаю огромное
00:18:55обновление по нему на этой неделе. А кроме того, еще увидимся.

핵심 요약

Понимание принципа работы кэширования промптов с часовым таймером и регулярная очистка контекста через специальные команды снижают расходы на токены в 20 раз.

하이라이트

  • Стоимость чтения из кэша промптов в 20 раз ниже по сравнению с базовой обработкой без кэша.

  • Часовой кэш промптов сбрасывается автоматически, если в течение часа отсутствует активность или происходят изменения в конфигурации вроде смены модели или вызова MCP-серверов.

  • Первая запись в кэш промптов стоит $20 за миллион токенов, тогда как последующие попадания в кэш обходятся всего в $1 за миллион токенов.

  • Команда forward slash clear полностью удаляет историю диалога, позволяя начать работу с нуля и избежать накопления избыточного контекста.

  • Функция forward slash doctor производит очистку раздутого файла Claude.md и неиспользуемых навыков, уменьшая объем стартового контекста.

타임라인

Принципы работы токенов и кэширования промптов

  • Каждое новое сообщение в чате отправляет модели всю предшествующую историю беседы.
  • Кэш промптов сохраняет историю диалога на один час, обновляясь при каждом новом запросе.
  • Стоимость чтения из кэша составляет $1 за миллион токенов, что в 20 раз дешевле стандартной стоимости записи в кэш, равной $20 за миллион токенов.
  • Переключение моделей, изменение уровня усилий или перезапуск MCP-серверов полностью стирают накопленный кэш.

Токены выступают валютой языковых моделей, где входные и выходные единицы оцениваются по разным тарифам. Без использования кэширования каждое последующее обращение к модели приводит к экспоненциальному росту передаваемого объема данных и затрат. Система кэширования позволяет моделям обращаться к уже сгенерированному документу предыдущего разговора по значительно более низкой цене. Однако часовой перерыв в отправке сообщений приводит к полной потере кэша, из-за чего последующий запрос оплачивается по максимальной тарифной ставке.

Методы восстановления после потери кэша

  • Команда forward slash clear полностью стирает устаревшую историю разговора для оптимизации расходов.
  • Команда forward slash compact создает краткое резюме текущего диалога перед очисткой истории.
  • Пользовательские инструменты передачи контекста сохраняют сводку в виде файла на диске для последующих сессий.

Превышение часового лимита бездействия требует применения радикальных мер для предотвращения огромных счетов за токены. Полная очистка истории через специальную команду помогает начать проект с чистого листа, опираясь на состояние файлов в кодовой базе. Встроенное сжатие формирует сводку ключевых моментов диалога, позволяя модели сохранять контекст без удержания всей громоздкой истории сообщений.

Маршрутизация моделей и гигиена файлов конфигурации

  • Режим советника использует мощную модель для составления плана и более дешевую модель для выполнения задач.
  • Команда forward slash doctor анализирует и сокращает объем файла Claude.md и неиспользуемых навыков.
  • Вспомогательные инструменты вроде внешних каркасов уменьшают количество генерируемого кода и снижают расход токенов.

Делегирование рутинных задач менее дорогим моделям оптимизирует общие затраты на разработку в экосистеме искусственного интеллекта. Регулярная очистка конфигурационных файлов устраняет избыточные инструкции, которые незаметно загромождают стартовое окно контекста. Применение специализированных навыков сокращения вывода дополнительно уменьшает объем выходных токенов при сохранении эффективности работы.

커뮤니티 글

모든 글 보기