Этот open source репозиторий решает главную проблему Claude Code

CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Может ли один навык сделать CloudCode значительно эффективнее?
00:00:03Может ли он сделать CloudCode быстрее, дешевле и сократить код,
00:00:06сохраняя при этом высокое качество результатов, к которому мы привыкли?
00:00:10Что ж, именно это и обещает инструмент Ponytail,
00:00:13благодаря чему он набрал 40 000 звезд всего через семь дней после релиза.
00:00:18Но Ponytail — не первый инструмент, заявляющий о подобных возможностях.
00:00:22Раньше мы уже говорили о Caveman, и все эти инструменты преследуют одну и ту же идею.
00:00:26Идея в том, что CloudCode по своей природе избыточен,
00:00:29и если сказать ему: эй, хватит столько болтать,
00:00:32можно получить гораздо более лаконичный ответ, который окажется столь же верным,
00:00:36или даже более верным, как мы помним на примере Caveman.
00:00:40Ponytail — просто последняя версия такого подхода,
00:00:42но она заявляет показатели, которые лучше всего, что мы видели раньше.
00:00:45И эти показатели можно увидеть прямо здесь.
00:00:47Мы видим сравнение строк кода, токенов, стоимости и времени.
00:00:52И во всех категориях (серый цвет — базовый уровень без этих инструментов,
00:00:55а зеленый — Ponytail)
00:00:58Ponytail практически везде лидирует или оказывается очень близко к лидерам.
00:01:03Однако показанные здесь цифры — это усредненные значения.
00:01:05Это среднее арифметическое по результатам различных тестов,
00:01:08и получены они с использованием модели Haiku 4.5.
00:01:11И не переживайте, позже мы, во-первых, проверим эти тесты,
00:01:14а во-вторых, оценим работу реальной модели, ведь никто из нас не пользуется Haiku 4.5.
00:01:18Мы используем Opus 4.8, так что давайте посмотрим на эти цифры.
00:01:20Что касается строк кода, их количество сокращается примерно на 50%.
00:01:24А если говорить о токенах, стоимости и времени,
00:01:27наблюдается улучшение на 20-30% по сравнению с базовым уровнем.
00:01:31И это немало,
00:01:32особенно если экстраполировать это на такие инструменты, как Fable,
00:01:36которые стоят безумно дорого.
00:01:37Поэтому, если я скажу вам: эй, при использовании Fable
00:01:40процесс станет быстрее и дешевле,
00:01:42разве нам бы это не понравилось?
00:01:43Прежде чем я объясню, как это работает
00:01:45и покажу результаты бенчмарков,
00:01:47пару слов от спонсора сегодняшнего выпуска — меня.
00:01:50Внутри Chase AI+ у меня есть мастер-класс по Claude Code,
00:01:53который идеально подходит для перехода от нуля к AI-разработке,
00:01:56особенно если у вас нет технического бэкграунда.
00:01:59Я обновляю его каждую неделю,
00:02:01и он также включает мастер-классы по кодекам
00:02:03и созданию собственной ОС на базе агентов.
00:02:06Ссылка на него находится в закрепленном комментарии.
00:02:08Опять же, я обновляю его каждую неделю,
00:02:10и мы сфокусированы на реальных сценариях.
00:02:12Так что если вы хотите начать уверенно владеть Claude Code,
00:02:15это то, что вам нужно.
00:02:16Как же работает Ponytail?
00:02:17Процесс состоит из шести этапов,
00:02:19которые выполняются перед написанием кода.
00:02:20Первый вопрос:
00:02:22нужно ли вообще, чтобы это существовало?
00:02:24Если ответ «нет»,
00:02:26то мы просто не пишем под это код.
00:02:28Всё довольно очевидно.
00:02:29После этого мы спрашиваем: есть ли это в стандартной библиотеке?
00:02:33Если ответ «да»,
00:02:34мы используем стандартную библиотеку.
00:02:36Главное, что вы заметите по бенчмаркам:
00:02:38бывают случаи, когда Claude Code
00:02:41с нуля воссоздает функции, которые уже существуют
00:02:45либо в какой-нибудь библиотеке, либо на уровне платформы.
00:02:49У Claude Code есть такая проблема:
00:02:51велосипед уже изобретен.
00:02:52Велосипед уже есть в этой программе.
00:02:53А он думает: «Знаешь что?
00:02:55Я построю велосипед с нуля».
00:02:56И из-за этого
00:02:57получается много лишнего кода,
00:02:59когда он вовсе не нужен.
00:03:01Это то, что вы снова и снова видите
00:03:03в этих бенчмарках.
00:03:04Если отвлечься на секунду,
00:03:05все эти шесть шагов сводятся к тому, чтобы спросить у Claude Code:
00:03:09эй, разве эта функция уже не существует нативно?
00:03:12Обязательно ли нам создавать что-то свое?
00:03:15Потому что Claude любит создавать кастомные решения,
00:03:17даже когда в этом нет необходимости.
00:03:18Поэтому, если стандартная библиотека этого не делает,
00:03:20он проверяет: является ли это нативной функцией платформы?
00:03:22Является ли это установленной зависимостью?
00:03:24Можно ли обойтись одной строкой?
00:03:26Нужна ли нам избыточность?
00:03:27И если он проходит через все это,
00:03:28и везде звучит «нет, нет, нет, нет, нет»,
00:03:30то мы говорим: что бы ты ни писал,
00:03:33делай минимум из того, что работает.
00:03:35Не перебарщивай.
00:03:36Не создавай лишнего, если не нужно.
00:03:37А если нужно — делай самый необходимый минимум.
00:03:40Идея в том, чтобы сделать Claude Code ленивым,
00:03:42но не халатным.
00:03:44Всё, что связано с проверкой границ доверия,
00:03:47обработкой потери данных, безопасностью и доступностью,
00:03:48никогда не попадает под сокращение.
00:03:50Так что он довольно умно подходит к выбору мест для этого процесса.
00:03:53Что касается установки, всё довольно просто.
00:03:55Вы просто копируете вот эту команду.
00:03:57Ссылка на этот репозиторий, конечно же,
00:03:58будет в описании,
00:04:00и она установит его для вас.
00:04:01Вы также можете использовать это для кодеков
00:04:03или вообще любых других AI-агентов.
00:04:05У Ponytail есть несколько команд.
00:04:07А именно: light, full, ultra и off.
00:04:10Опять же, очень напоминает Caveman,
00:04:12те же уровни, что были у Caveman.
00:04:14Мы можем запустить проверку кода.
00:04:16Мы можем запустить аудит репозитория.
00:04:18А также есть навыки debt, gain и help.
00:04:20Вы можете подробно изучить их все
00:04:22внутри репозитория на GitHub.
00:04:24Но всё это не имеет значения,
00:04:24если бенчмарки не подтверждаются.
00:04:26А хорошая новость заключается в том,
00:04:28что авторы репозитория предоставляют бенчмарки.
00:04:29Мы можем запустить их самостоятельно.
00:04:31И угадайте что?
00:04:32Именно это я и сделал.
00:04:34Вы тоже можете сделать это сами.
00:04:36Там есть подробное описание
00:04:37того, как они получили результаты тестов,
00:04:39прямо здесь в файле README.
00:04:40И оно также дает вам возможность воспроизвести их.
00:04:43Поэтому я хочу показать вам
00:04:44те цифры, которые получил я,
00:04:45когда воспроизвел все эти бенчмарки.
00:04:48И воспроизвел их не только с Haiku 4.5,
00:04:51что вы видите в репозитории,
00:04:52но также и с Opus 4.8.
00:04:54Потому что никто из нас не пользуется Haiku.
00:04:56Мне не особо интересен Haiku.
00:04:58Меня интересует Opus.
00:05:00И результаты, честно говоря, оказались весьма интересными.
00:05:02Вот тесты, а вот и результаты.
00:05:04Вы видите их опубликованные показатели.
00:05:07Вы видите наш запуск с Haiku.
00:05:09А справа в самом конце
00:05:10находится наш запуск с Opus.
00:05:12Внизу указан общий результат.
00:05:14Итак, 54% — это опять же оценка по строкам кода.
00:05:17По данным Ponytail, это на 54% меньше строк кода.
00:05:21Когда мы запустили его, на Haiku получилось 56%.
00:05:24То есть, по сути, абсолютно то же самое.
00:05:27А на Opus результат составил 71%.
00:05:29Так что мы увидели ещё больший прирост и более эффективный код при использовании Ponytail с Opus.
00:05:36Почему так?
00:05:36Потому что эти более мощные модели любят поговорить, верно?
00:05:40Они предпочитают многословие.
00:05:41Опять же, небольшая отсылка к Caveman.
00:05:43Вы помните, одно из исследований, о котором там говорится,
00:05:45заключается в том, что очень многословные модели любят говорить слишком много,
00:05:50иногда доходя до того, что сами себя запутывают и уходят от правильного ответа.
00:05:53Так что это довольно интересно и фактически служит неплохим стимулом для этой штуки.
00:05:57И это любопытно.
00:05:58Они говорят, что использовали Haiku в тестах из-за соображений стоимости.
00:06:02Я действительно считаю, что им следовало провести весь этот тест на Opus,
00:06:04потому что, когда мы его запустили, Opus на самом деле показывает себя с лучшей стороны.
00:06:09Знаете, ведь именно эту модель люди и используют.
00:06:11Так что, если уж на то пошло, они несколько приуменьшили её эффективность в плане строк кода.
00:06:15И это также относится к затратам.
00:06:17Когда мы посмотрели на Haiku 4.5, каким был совокупный результат в наших тестах?
00:06:21Мы увидели сокращение расходов примерно на 25%, в то время как у Opus 4.8 снижение составило 53%,
00:06:28что просто безумие.
00:06:30Это обходится нам на 53% дешевле.
00:06:32Представьте, если бы это был Fable.
00:06:33И вы можете видеть все тесты и цифры по всем направлениям.
00:06:35Самый низкий показатель составил 13%.
00:06:38А в некоторых случаях для многоэтапного мастера настройки он доходил до 73%.
00:06:42Теперь вы можете подумать: нужен ли нам вообще Opus для некоторых из этих задач?
00:06:45Справедливо.
00:06:45Но просто поймите, что здесь вообще иллюстрируется.
00:06:48То, что обычно стоило 1,39 доллара при стандартном использовании Opus без скилла, обошлось нам в 0,38 доллара
00:06:55с использованием Ponytail.
00:06:57А если посмотреть на Haiku, эти меньшие модели в некоторых случаях с Ponytail в итоге обходились даже дороже.
00:07:04Так что вся эта идея сокращения строк кода и повышения эффективности работает намного лучше, когда мы говорим о более мощных моделях.
00:07:11В некоторых случаях с меньшими моделями мы получаем противоположный эффект, потому что они изначально были эффективными, так как они просто «тупые» и быстрые.
00:07:18Вы можете видеть здесь, что в бенчмарке подсчета элементов использование Ponytail с Haiku обошлось на 21% дороже.
00:07:27Конечно, речь идет о разнице в два цента, но суть остается прежней.
00:07:31Чем сильнее модель, тем эффективнее эта архитектура.
00:07:34И мне было бы очень интересно посмотреть, как это выглядит с Fable.
00:07:37Опять же, 53% — это не шутки.
00:07:39А как насчет скорости?
00:07:40И здесь мы наблюдаем ту же картину с Haiku.
00:07:43Насколько быстрее она стала?
00:07:44Примерно на 31% больше, на 31% быстрее при использовании Haiku с Ponytail по сравнению с обычной работой.
00:07:51С Opus — на 71% быстрее.
00:07:55На 71% быстрее.
00:07:56И снова, что мы видим у Haiku?
00:07:58Бывают случаи — ровно три, когда с Ponytail работало медленнее.
00:08:03Знаете, в некоторых случаях на 22% медленнее, в то время как у Opus каждый отдельный бенчмарк показал прирост до 88%.
00:08:10В некоторых ситуациях это неизменно быстрее, верно?
00:08:13Опять же, мы видим: многоэтапный мастер — 78%, выбор даты — 88%.
00:08:17А в худшем сценарии разница составила 27%.
00:08:22Поэтому, когда мы смотрим на эти цифры с Ponytail, мы думаем: хм, относиться к этому скептически, даже если я могу запустить бенчмарки, что вообще значит эти 20%?
00:08:31А потом ты думаешь: о, так это же Haiku.
00:08:33Так что это какая-то чушь.
00:08:34Затем мы тестируем это на Opus, и результаты кардинально отличаются.
00:08:36Это намного эффективнее.
00:08:37И я думаю, что очевидный вопрос: а как насчет самих бенчмарков?
00:08:41Насколько эффективны эти тесты?
00:08:42Реалистичны ли они?
00:08:44Прежде всего, зайдите в репозиторий, протестируйте их самостоятельно или запустите собственные бенчмарки, которые, по вашему мнению, соответствуют вашим критериям легитимности.
00:08:52В любом случае, я думаю, когда мы говорим о тех, кажется, 19 различных бенчмарках, которые проводились, мы повсюду видим одну и ту же тенденцию.
00:08:59Когда мы смотрим на более мощную модель вроде Opus, честно говоря, я бы просто игнорировал результаты Haiku.
00:09:04Мне плевать на Haiku.
00:09:06Она дешевле.
00:09:07Она быстрее.
00:09:08И следовательно, она эффективнее.
00:09:11И опять же, раз мы говорим о том, что по сути является просто скиллом, в чем минус попробовать это в деле?
00:09:16Эти цифры выглядят действительно здорово.
00:09:17Я настоятельно рекомендую вам зайти в этот репозиторий, скачать его и начать использовать самостоятельно.
00:09:21В худшем сценарии, допустим, для вашего конкретного проекта всё настолько сложно, что призыв быть менее многословным на самом деле дает обратный эффект.
00:09:30Что ж, я думаю, это ситуация из серии «попытка не пытка», верно?
00:09:34Так что это худший вариант.
00:09:37Лучший вариант — вы экономите около 50% на использовании Opus, и всё работает на 70% быстрее.
00:09:43Так что материал действительно интересный.
00:09:45Я определенно буду использовать это в своей повседневной работе.
00:09:47Я уже месяц или два постоянно пользуюсь Caveman, у меня всё настроено по умолчанию.
00:09:52И теперь я собираюсь переключиться на Ponytail и посмотреть, как мне это понравится.
00:09:55Я думаю, чем больше подобных вещей появляется, тем лучше.
00:09:58В последнее время только и слышишь: стоимость токенов, стоимость токенов, стоимость токенов.
00:10:03Поэтому всё, что может снизить эти затраты для нас, будет принято на ура.
00:10:07На этом я закончу данное видео.
00:10:08Как всегда, обязательно загляните на ChaseAI Plus, если хотите получить мой мастер-класс по Cloud Code.
00:10:13Дайте мне знать, что вы думаете в комментариях, и до скорой встречи.

Key Takeaway

Открытый инструмент Ponytail делает Claude Code эффективнее, сокращая объем кода на 71%, снижая затраты на токены на 53% и увеличивая скорость работы при использовании модели Opus.

Highlights

  • Инструмент Ponytail набирает 40 000 звезд на GitHub всего через семь дней после релиза.

  • Использование Ponytail с моделью Opus сокращает количество строк кода в среднем на 71%.

  • Применение инструмента снижает расходы на токены при работе с Opus на 53%.

  • Скорость выполнения задач с Opus и Ponytail возрастает в среднем на 71%.

  • Инструмент проходит через шесть этапов проверки перед написанием кода, предотвращая создание избыточных решений.

Timeline

Обзор инструмента Ponytail и базовые показатели

  • Ponytail решает проблему избыточности кода в Claude Code.
  • Инструмент набирает 40 000 звезд за неделю после релиза.
  • Базовые тесты на модели Haiku показывают сокращение строк кода на 50% и улучшение остальных показателей на 20-30%.

Инструмент Ponytail продолжает идею проекта Caveman, заставляя Claude Code выдавать более лаконичные ответы без потери качества. Усредненные значения бенчмарков демонстрируют лидерство Ponytail во всех основных категориях по сравнению с базовым уровнем. Предварительные данные получены на модели Haiku 4.5, однако реальные пользователи чаще применяют более мощные модели вроде Opus 4.8.

Принцип работы и структура этапов

  • Процесс состоит из шести этапов, выполняемых перед генерацией кода.
  • Система проверяет наличие функционала в стандартной библиотеке или нативных функциях платформы.
  • Инструмент ограничивает избыточность, сохраняя при этом защиту данных и безопасность.

Алгоритм Ponytail последовательно проверяет необходимость создания нового кода, наличие существующих решений в библиотеках или зависимостях и возможность реализации одной строкой. Если все проверки дают отрицательный результат, модель получает команду использовать минимально необходимый объем кода. При этом критически важные аспекты безопасности и защиты данных не подвергаются сокращению.

Установка, команды и сравнение бенчмарков для Haiku и Opus

  • Установка выполняется с помощью простой команды из репозитория на GitHub.
  • Доступны различные уровни работы: light, full, ultra и off.
  • Использование Ponytail с моделью Opus снижает затраты на 53% и ускоряет работу на 71%.

Пользователи могут запускать аудит репозитория и проверку кода с помощью команд Ponytail. Воспроизведение бенчмарков с моделью Opus 4.8 показывает гораздо более впечатляющие результаты, чем официальные тесты на Haiku. Для мощных моделей многословие является проблемой, поэтому призыв к лаконичности дает синергетический эффект, сокращая объем кода на 71% и снижая финансовые затраты более чем вдвое.

Community Posts

View all posts