Как сделать токены Claude Code в 20 раз дешевле (и еще 4 полезных лайфхака)
CChase AI
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Возможно, вы платите за токены Cloud Code в 20 раз больше, чем нужно, даже не подозревая об этом.
00:00:05Понимание того, как извлечь максимум пользы из токенов Cloud Code, — это один из важнейших
00:00:08навыков, которыми вы можете овладеть, и он выходит далеко за рамки простого добавления строки в файл Cloud.md
00:00:14с текстом «будь краток». Ведь если вы не понимаете, как вообще работает кэширование промптов,
00:00:19вы можете переплачивать в разы. Поэтому в этом видео я дам вам пять
00:00:23различных способов лучше управлять токенами Cloud, чтобы вы могли получить максимум от
00:00:27этих первоклассных моделей. Совет номер один — самый важный. Он сбережет вам больше денег
00:00:31и ресурсов, чем все остальные советы вместе взятые, и это — понимание принципа работы кэширования промптов.
00:00:37Чтобы разобраться в кэшировании промптов, нужно понять, как вообще работают токены. Поэтому мы сделаем
00:00:43- "очень быстрый обзор секунд на 60, чтобы мы были на одной волне. Токены — это валюта"
00:00:47больших языковых моделей, и если говорить совсем просто (несколько упрощая), каждое
00:00:52слово равно одному токену. Так что, когда вы, пользователь, в своем первом сообщении Fable говорите: «Как дела сегодня?»,
00:01:00вы отправляете пять входных токенов. Когда же Fable отвечает вам: «У меня все отлично, спасибо»,
00:01:09модель выдает вам четыре выходных токена. Они оцениваются по-разному. По сути, выходные токены
00:01:16в основном стоят в пять раз дороже входных. Эти пять входных и четыре выходных токена теперь
00:01:23накапливаются в контекстном окне. Если токены — это валюта, то контекстное окно — наш бюджет.
00:01:31Opus, Fable, Sonnet — у всех у них бюджет в один миллион токенов, так что к этому моменту мы использовали
00:01:37девять из миллиона, совсем немного. Самое интересное начинается при отправке последующих сообщений
00:01:43после первого. В нашем втором сообщении я, пользователь, говорю: «Создай мне приложение без ошибок»,
00:01:50— шесть входных токенов, верно? Я просто отправлю Anthropic и Fable шесть входных токенов. Ну,
00:01:56не совсем так. На самом деле я отправляю им абсолютно все. Я собираюсь отправить Anthropic
00:02:04весь этот разговор вплоть до текущего момента. То есть я отправляю не шесть входных токенов, а целых
00:02:1116 входных токенов, потому что передам и те пять отсюда, и те четыре оттуда, ведь
00:02:16модели требуется всё сообщение целиком для понимания контекста. И так будет происходить
00:02:20с каждым последующим сообщением: я всегда отправляю всю историю беседы,
00:02:26предшествующую последнему сообщению. Легко заметить, как это лавинообразно накапливается, и вот
00:02:32речь уже идет о 5 000, 10 000, 100 000 входных токенов, отправляемых с каждым сообщением. И вы
00:02:37платите за это. Если это так, то почему мы не исчерпываем весь лимит
00:02:43мгновенно? Почему каждый не платит миллиард долларов при каждой попытке воспользоваться этими ИИ-системами?
00:02:47Потому что мы, очевидно, отправляем сообщение за сообщением, и на серверы передается
00:02:51огромный массив наслоенных друг на друга сообщений. Решением здесь является система кэширования. Итак, да,
00:02:57когда я отправляю второе сообщение здесь, я действительно отправляю все это. Но что уже было создано
00:03:05к этому моменту? Кэш сообщений. Для нашего второго сообщения этим кэшем являются первые
00:03:12два сообщения. Представьте кэш сообщений просто как документ, который лежит перед Claude
00:03:17и содержит весь ваш разговор до этого момента. Допустим, вы общаетесь с Claude здесь,
00:03:23отправляя второе сообщение: «Создай мне приложение без ошибок». Но у нас есть система кэширования,
00:03:30поэтому весь этот раздел, первые два сообщения, теперь находится в этом документе. В результате
00:03:36Claude и Anthropic могут прочитать этот документ, прочитать кэш,
00:03:42изучить всю историю сообщений к этому моменту по гораздо более низкой цене, чем если бы вы
00:03:47просто отправляли все разом без кэша. Так и рассчитывается стоимость. Этот аспект
00:03:54важен, поскольку система кэширования не вечна. Вы должны понимать: когда
00:04:00вы общаетесь с Claude и между вами есть этот кэш-документ, содержащий всю
00:04:06историю беседы, которую можно читать очень дешево, он хранится всего один час.
00:04:11Поэтому, если вы с Claude ведете эту дискуссию, обмениваясь репликами снова и снова,
00:04:16взамен туда-сюда, а затем отходите на час, имея
00:04:21документ длиной в 500 000 токенов (разговор на полмиллиона токенов), через час все это исчезает.
00:04:29Это пропало. И когда вы отправляете 500 001-е сообщение, угадайте что: вам
00:04:38придется платить по полной ставке за все 500 000 токенов сообщения, даже если вы сказали лишь: «Эй, как дела?»
00:04:46Помните, когда я говорю, что этот кэш живет всего один час, я имею в виду час без какой-либо активности. Он
00:04:52обновляется с каждым сообщением. Так что, если прошло 59 минут с нашего последнего сообщения и я снова пишу,
00:04:56этот часовой таймер сбрасывается. Почему это так важно? Из-за стоимости. Я говорил
00:05:01во введении: разница между чтением из кэша (то есть чтением всей этой истории) и чтением сообщения на 500 000
00:05:08без кэша составляет ровно 20 раз. Это отражено
00:05:16в документации по ценам. Помните: выходные токены, выдаваемые Claude, неизменны.
00:05:22Для Fable мы смотрим на $50 за миллион токенов и $25 для Opus. Но входные токены
00:05:27— это то, вокруг чего строится весь разговор. Мы всегда говорим, что базовые входные токены стоят
00:05:33$10 за миллион, но это отчасти неверно, поскольку на практике мы всегда выполняем запись в кэш.
00:05:40Запись в часовой кэш, которая происходит при оформлении подписки, фактически стоит вдвое дороже.
00:05:47Поэтому при первой записи в кэш, например для самого первого сообщения, тариф составляет $20 за
00:05:54миллион токенов. Здесь вы заметите пятиминутный кэш, но он предназначен в основном для тех, кто
00:05:59пользуется API. Сравните это с попаданиями в кэш (cache hits), когда Anthropic просто читает документ перед собой,
00:06:05который накапливался каждый час и обновляется. Это стоит $1 — в 20 раз дешевле. Колоссальная
00:06:13разница. Именно поэтому вся эта тема, этот конкретный совет о понимании кэширования промптов и
00:06:18работы системы токенов, настолько важна. Ничто из того, о чем я скажу далее,
00:06:22не даст вам сопоставимого прироста эффективности. Ничто.
00:06:29Теперь вернемся к нашему примеру с разговором на 500 000 токенов,
00:06:35который мы ведем в Claude code перед отправкой следующего сообщения. В сценарии номер один
00:06:40представим, что у нас есть система кэширования. История этого диалога на 500 тыс. кэширована, и я отправляю
00:06:46новое сообщение. Ценообразование будет работать так: модели все равно нужно прочитать всю историю
00:06:51этого разговора по тарифу $1 за миллион токенов. Чтение всего объема плюс нового сообщения
00:06:58обойдется мне в 50 центов за следующее сообщение. Представьте, что новое сообщение содержало тысячу
00:07:05токенов. Это последующее сообщение на тысячу токенов тарифицируется не по $1 за миллион, а по $20
00:07:14за миллион. Сколько это для тысячи токенов — цента два или около того? Не знаю.
00:07:18Мои расчеты могут быть неточными, но суть в том, что история стоит $1, а новое сообщение — $20 за счет кэширования.
00:07:26При отправке следующего сообщения в том же сценарии эта тысяча токенов станет частью того же
00:07:32кэш-документа. Звучит логично? Хорошо. Это первый сценарий. Во втором сценарии кэша нет — мы подождали час
00:07:40перед отправкой. Вместо 50 центов мы теперь
00:07:47будем платить по тарифу записи в кэш, который, как помните, составляет $20 за миллион. Во сколько же
00:07:54это обойдется? Теперь одно это сообщение будет стоить нам долларов 10. Мы перескочили с 50 центов на
00:08:0010 долларов просто потому, что подождали час. Таковы последствия непонимания
00:08:05этого процесса. Время — не единственный фактор потери кэша. Существуют и другие вещи,
00:08:10которые сбрасывают его полностью, и это прямо указано в документации Cloud Code.
00:08:14Если вы переключаете модель (например, работали на Fable, а перешли на Opus при наборе в 500 000 токенов),
00:08:20все пропало. Кэш сброшен. Уровень усилий, его изменение. Быстрый режим, подключение или отключение
00:08:26сервера MCP, плагины, отклонение инструментов, компактизация диалога или просто обновление Cloud Code
00:08:32в целом. Любое из этих действий сбросит кэш, и ваше следующее сообщение окажется в 20 раз дороже,
00:08:38чем могло бы быть. Учитывая все это, что же вы реально можете сделать с данной информацией?
00:08:42Как поступить, если вам нужно прервать работу над диалогом,
00:08:46содержащим много важной информации, но вас не будет дольше часа,
00:08:50или вы отсутствовали больше часа, возвращаетесь и понимаете: «Черт, я же
00:08:54не подумал об этом заранее»? Что ж, об этом мы поговорим во втором совете.
00:08:59Но сначала пару слов от спонсора сегодняшнего выпуска — меня. На этой неделе я выпускаю полностью обновленную
00:09:06версию моего мастер-класса по Cloud Code в рамках Chase AI+. С момента моего первого релиза
00:09:12многое изменилось. Я постоянно его обновляю, но в целом мы прошли большой путь с марта, когда я его выпустил.
00:09:19Так что, если вы хотите прокачать свои навыки работы с ИИ, особенно если у вас
00:09:24нет технического бэкграунда, и вам нужна пошаговая дорожная карта по использованию этого инструмента
00:09:28с нуля с упором на реальные кейсы, это для вас. Все доступно внутри
00:09:33Chase AI+. Ссылка на него находится в закрепленном комментарии. Второй совет посвящен
00:09:37вашим действиям при потере кэша. Мы отсутствовали слишком долго, и у нас есть диалог на два,
00:09:42три, четыре или пятьсот тысяч токенов. Мы хотим знать, каким должен быть следующий шаг,
00:09:47чтобы не платить баснословные суммы, и это зависит от конкретной ситуации.
00:09:52Итак, наш первый вариант — это своего рода радикальная мера, а именно использование команды forward slash clear.
00:09:58Команда forward slash clear просто удаляет всю историю разговора. И это не всегда плохо.
00:10:04На самом деле, если вы работаете в какой-то кодовой базе, в каком-то проекте
00:10:10с кучей файлов и контекста, вам, вероятно, просто стоит ввести forward slash clear. Что бы
00:10:15вы ни делали, о чем бы ни говорили, скорее всего, в самом проекте есть свидетельства
00:10:20того, что произошло. Cloud Code может просто посмотреть на это. И когда вы начнете новый разговор
00:10:25с нуля, он сможет собрать все воедино и вернуть вас туда, где вы были. Вам не нужно быть рабом
00:10:31предыдущего разговора. Теперь ваш второй вариант — использовать сжатие. Внутри Cloud Code есть функция
00:10:38автоматического сжатия, когда вы достигаете определенного количества токенов. Я предлагаю не дожидаться
00:10:42этого момента, потому что когда мы работаем в диапазоне шести, семи, восьмисот тысяч токенов, мы
00:10:47начинаем сталкиваться с деградацией контекста. Это по-прежнему проблема для таких больших и мощных моделей,
00:10:51но мы можем использовать forward slash compact в любой момент. И это сделает для нас следующее:
00:10:57создаст резюме того, о чем мы говорили. А затем, по сути, выполнит команду forward slash
00:11:03clear, но начнет новый разговор с этим резюме, как бы храня его в памяти. Так что
00:11:10если в этом разговоре были важные вещи, и вы не думаете, что содержимого кодовой базы
00:11:15будет достаточно для понимания, то просто сделайте сжатие — forward slash compact. Он начнет новый
00:11:20разговор с этим резюме. И это резюме просто хранится в истории сообщений. Теперь ваш третий вариант
00:11:26очень похож на сжатие, и это использование какого-нибудь пользовательского инструмента передачи данных. Есть много
00:11:32пользовательских навыков для передачи контекста. У меня есть свой собственный. Вы можете получить его в моем бесплатном сообществе. И разница
00:11:38между передачей контекста и сжатием заключается в том, где хранится это резюме. Если я использую передачу контекста, то она
00:11:46фактически просто сохраняет его на моем диске. Она создает реальный файл утекста в формате Markdown с резюме
00:11:51и всем необходимым. И тогда я могу начать новый разговор и сказать: «Эй, Claude code, взгляни
00:11:59на тот документ передачи контекста на диске», чтобы ты мог вникнуть в то, что тебе нужно знать. В отличие от сжатия,
00:12:04оно не создает никаких файлов. Это просто сообщение в истории сообщений в конкретном
00:12:10разговоре, который вы ведёте — небольшое отличие. Но некоторым людям нужен именно файл на
00:12:15диске. И часто это живой документ, который постоянно обновляется.
00:12:20Итак, у вас действительно есть три варианта. Хотите ли вы просто все очистить и начать с нуля?
00:12:26Зачастую это абсолютно нормально. Хотите ли вы просто использовать встроенную функцию Claude для сжатия
00:12:31и внедрения резюме прямо внутрь? Или вы хотите, чтобы резюме было настоящим документом, на который Claude может
00:12:37посмотреть? В таком случае используйте передачу контекста. Это ваши три варианта. И зачастую они лучше, чем просто
00:12:42отправка нового сообщения, потому что в целом вам вообще не следует работать в диапазонах 400, 500, 600 тысяч
00:12:48токенов. Теперь совет номер три касается маршрутизации моделей. Как нам выбрать правильную модель
00:12:53для работы? Чтобы мы не использовали Fable для всего подряд. Можем ли мы использовать меньшую, более дешевую и менее умную
00:12:59модель для более простых задач? Ответ: да. И мы можем подойти к этому с разных сторон.
00:13:04Мы можем использовать сторонние модели. Мы могли бы обратиться к GPT, Sol. Мы могли бы перейти к GPT, Luna и Terra, которые только что стали
00:13:10супер дешевыми. Мы можем использовать локальные модели, или у нас есть варианты, если мы хотим остаться в экосистеме Anthropic.
00:13:16И самый простой способ сделать это, как мне кажется, — режим советника. То, что вы здесь видите, взято из оригинального
00:13:22блога о советниках, вышедшего несколько месяцев назад. И там показаны Opus и Sonnet, но та же система
00:13:29сохраняется и с такими моделями, как Fable. И идея в том, что умная модель, вроде Fable или даже Opus, консультирует
00:13:37меньшую модель, такую как Sonnet, когда дело касается выполнения задач. Большая модель разрабатывает план,
00:13:43маленькая модель выполняет его, и маленькая модель может делиться своим контекстом с большей моделью всякий раз,
00:13:50когда она сталкивается с проблемами. И эта модель показала лучшие результаты при более низких затратах. И возвращаясь к нашему
00:13:54предыдущему обсуждению кэширования промптов, и у советника, и у исполнителя есть свой собственный кэш промптов,
00:14:01работающий одновременно. Теперь ваш второй вариант — делегировать задачи моделям за пределами Claude
00:14:06code. Простой вариант — Codex. Существует плагин Codex для Claude code, который позволяет очень легко
00:14:12вызывать Codex из интерфейса Claude code. Таким образом, Fable может выполнять ту же самую
00:14:18роль режима советника, но вместо вызова Opus или Sonnet она вызывает модели GPT. Есть
00:14:24и другие репозитории, подобные этому советнику Fable, которые делают именно это. И в конечном счете довольно просто настроить
00:14:31собственный навык, который делает ровно это. И если вы ищете те самые более дешевые модели, я действительно советую
00:14:36посмотреть на модели GPT, особенно Luna и Terra, потому что, во-первых, их стоимость значительно снизилась,
00:14:41а во-вторых, в семействе Anthropic действительно нет никакой модели, которая делала бы то, что делают они,
00:14:48по такой цене. Можно даже пойти дальше и подключить локальные модели, если
00:14:53для задач это имеет смысл. Совет номер четыре посвящен гигиене Claude. Вы, возможно, видели
00:14:57недавнее популярное видео с Борисом Черни, создателем Claude code, который говорит:
00:15:01«Вам нужно удалить ваш файл Claude.md». Что ж, действительно ли нужно удалять этот файл Claude.md? Ну,
00:15:07не обязательно, но что вам действительно нужно сделать — и в последние пару недель здесь произошли некоторые изменения —
00:15:12так это запустить команду forward slash doctor. И какое отношение это имеет к токенам?
00:15:18Ну, во-первых, что эта команда сделает помимо прочего — а мы все же держим в уме токеновую тему —
00:15:23так это изучит ваш файл Claude.md и сократит его.
00:15:30То, как работают эти модели, особенно модели серии 5, заключается в том, что им требуется не так много
00:15:36инструкций. Если вы посмотрите на то, что люди создавали для Claude.md 3, 6, 9 месяцев
00:15:42назад, они были очень жесткими и чрезвычайно подробными. И, возможно, в то время можно было
00:15:46утверждать, что они им нужны. Сейчас это уже не так. И раздутый файл Claude.md не только
00:15:53замедляет работу, но и буквально стоит вам токенов. И forward slash doctor просмотрит его
00:15:59и избавится от того, чему просто не нужно быть в вашем Claude.md. Во-вторых,
00:16:04он проверит вещи, которые портят или раздувают ваше окно контекста.
00:16:10Потому что даже когда вы начинаете новый разговор и вводите forward slash context, его что-то
00:16:15заполняет. Я недавно запустил forward slash doctor, поэтому избавился от большой части мусора,
00:16:20но вот как выглядит мое окно контекста прямо в начале разговора без отправленных
00:16:25сообщений. Мы уже использовали 40 000 токенов. И что же так сильно его загружает? Часть этого исходит
00:16:31от таких вещей, как навыки, как вы можете здесь видеть. Часть включает в себя системный промпт, а также
00:16:36файлы памяти. Команда forward slash doctor просматривает такие вещи, как ваши
00:16:41навыки, ваши MCP и начинает сокращать те, которые вы просто не использовали. Дает ли это огромную экономию
00:16:47токенов? Нет, но это кое-что, это небольшой плюс, и это настолько простое исправление. Нет
00:16:53причин не делать этого, особенно если вы тот человек, который просто накопил 10 миллионов навыков за
00:16:58последние шесть месяцев и на самом деле не просматривал их и не сокращал, потому что это
00:17:03также заставит ваши навыки работать более эффективно. И у Claude не будет путаницы по поводу
00:17:08того, какой навык ему нужно вызвать. Держу пари, у вас наверняка есть штук 10 навыков, которые
00:17:12все связаны с фронтенд-дизайном, и они вам все не нужны. Так что этот очень простой и легкий в исполнении совет,
00:17:17когда дело касается гигиены Claude, нельзя упускать. Просто запустите doctor. И это
00:17:22подводит нас к нашему последнему совету, который, я думаю, в наши дни наименее эффективен из всех, но это
00:17:28дополнительные навыки и каркасы, которые можно встретить повсюду.
00:17:33Самый популярный из них сегодня — ponytail, по сути, он сокращает количество кода,
00:17:38который пишет Claude, сохраняя его эффективность и делая его более дешевым и быстрым. Я
00:17:44снял об этом видео, сравнивая эти цифры с тем, что происходит в реальности, потому что в репозитории GitHub
00:17:51указан только haiku 4.5, что, очевидно, сильно устарело. Когда я запустил это с Fable, цифры
00:17:56подтвердились. На самом деле с лучшими моделями цифры выглядят еще лучше. Я использовал бенчмарки,
00:18:01которые прилагались к этому репозиторию GitHub. То, что работает для вас в реальности, может немного отличаться в зависимости от
00:18:06сложности вашего проекта. Но это то, что вы можете применить ко всему, о чем мы говорили
00:18:11до сих пор, если хотите продолжать снижать расход токенов. Еще один инструмент, который вы часто увидите, — Caveman,
00:18:18который в настоящее время заявляет, что сокращает ваши выходные токены на 65%. Есть много людей,
00:18:25которые также говорят о том, чтобы использовать простые однострочники в Claude MD, например, просто сказать «будь краток»,
00:18:30что тоже сократит ваши выходные токены. Но помните, выходные токены — это лишь часть головоломки.
00:18:36И в этой головоломке, возвращаясь к нашему первоначальному обсуждению, доминирует кэширование промптов. Так что если
00:18:41вы ничего больше не вынесли из этого видео, я надеюсь, вы поняли это, потому что на этом мы
00:18:46сегодня закончим. Так что, как всегда, дайте мне знать, что вы думаете. Обязательно загляните в
00:18:50ChaseAI Plus, если хотите получить в свои руки мастер-класс по Claude Code. Опять же, выпускаю огромное
00:18:55обновление по нему на этой неделе. А кроме того, еще увидимся.