Claude Code의 최대 난제를 해결한 오픈소스 저장소

CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00단 하나의 스킬로 CloudCode를 엄청나게 효율적으로 만들 수 있을까요?
00:00:03CloudCode를 더 빠르고, 저렴하게 만들고 코드를 더 적게 작성하면서도
00:00:06우리가 익숙한 수준의 높은 결과물을 계속 얻을 수 있을까요?
00:00:10글쎄요, 그것이 바로 Ponytail가 해내겠다고 주장하는 바입니다.
00:00:13그 덕분에 이 도구는 출시 단 7일 만에 4만 개의 스타를 기록했습니다.
00:00:18자, Ponytail가 이런 주장을 하는 것을 본 첫 번째 도구는 아닙니다.
00:00:22우리는 과거에 Caveman에 대해 이야기한 적이 있으며, 이러한 도구들은 모두 비슷한 아이디어를 가지고 있습니다.
00:00:26그 아이디어는 CloudCode가 본질적으로 장황하다는 것입니다.
00:00:29그래서 만약 우리가 "이봐, 말을 너무 많이 하지 마"라고 말한다면,
00:00:32궁극적으로 똑같이 정확하면서도 훨씬 더 간결한 답변을 얻을 수 있습니다.
00:00:36또는 Caveman에서 기억하듯이, 심지어 더 정확할 수도 있습니다.
00:00:40Ponytail는 그 최신 버전일 뿐입니다.
00:00:42하지만 이 버전은 우리가 과거에 보았던 그 어떤 것보다 더 나은 수치를 주장하고 있습니다.
00:00:45그리고 우리는 바로 여기서 그 수치들을 볼 수 있습니다.
00:00:47코드 라인 수, 토큰 수, 비용, 그리고 시간을 비교해서 볼 수 있습니다.
00:00:52전반적으로 회색은 이러한 도구가 전혀 없는 기준선이고
00:00:55초록색은 Ponytail입니다.
00:00:58Ponytail는 거의 모든 곳에서 선두를 달리거나 매우 근접한 결과를 보여줍니다.
00:01:03자, 여기서 보신 수치들은 집계된 것입니다.
00:01:05이것은 여러 가지 다른 테스트를 통해 도출된 평균값이며,
00:01:08이것은 또한 Haiku 4.5를 사용하여 수행되었습니다.
00:01:11걱정하지 마세요. 나중에 A, 이 테스트들을 검증하고,
00:01:14실제 모델을 살펴보겠습니다. 왜냐하면 우리 중 아무도 실제로 Haiku 4.5를 사용하고 있지 않기 때문입니다.
00:01:18우리는 Opus 4.8을 사용하고 있으니, 그 수치들이 어떻게 나오는지 봅시다.
00:01:20그리고 코드 라인 수의 경우, 약 50% 적은 라인을 보여줍니다.
00:01:24그리고 토큰, 비용, 시간 측면에서 살펴보면
00:01:27기준선 대비 약 20%에서 30% 정도 향상되었습니다.
00:01:31그리고 그것은 결코 적은 양이 아닙니다.
00:01:32특히 이를 Fable 같은 것에 외삽할 때 더욱 그렇습니다.
00:01:36이것은 터무니없이 비쌉니다.
00:01:37그러므로 만약 제가 여러분에게 "이봐요, Fable 같은 것을 사용하고 있다면,
00:01:40더 빠르고 저렴해질 것입니다"라고 말할 수 있다면,
00:01:42우리는 아주 좋아하지 않겠습니까?
00:01:43자, 이것이 어떻게 작동하는지 설명하고
00:01:45벤치마크 점수가 어떻게 생겼는지 보여드리기 전에,
00:01:47제가 직접 테스트해 본 후, 오늘의 스폰서인 저로부터의 짧은 한 말씀이 있겠습니다.
00:01:50자, Chase AI+ 안에는 제 Clawed Code 마스터클래스가 있습니다.
00:01:53이것은 제로에서 AI 개발자가 되는 가장 좋은 방법이며,
00:01:56특히 기술적 배경이 없는 분들에게 더욱 그렇습니다.
00:01:59저는 이것을 매주 업데이트하며,
00:02:01또한 코덱스에 관한 마스터클래스와
00:02:03자신만의 에이전틱 OS를 구축하는 방법에 대한 내용도 포함되어 있습니다.
00:02:06고정된 댓글에서 이에 대한 링크를 찾으실 수 있습니다.
00:02:08그리고 다시 말씀드리지만, 저는 이걸 매주 업데이트하며
00:02:10우리는 실제 사용 사례에 집중합니다.
00:02:12그러므로 Clawed Code를 마스터하기 시작하고 싶다면,
00:02:15여기가 바로 당신을 위한 장소입니다.
00:02:16그렇다면 Ponytail는 어떻게 작동할까요?
00:02:17자, 이것은 코드를 작성하기 전에
00:02:196단계 과정을 거칩니다.
00:02:20그래서 첫 번째 질문은,
00:02:22이것이 존재할 필요나 있는지에 대한 것입니다.
00:02:24만약 대답이 아니오라면,
00:02:26글쎄요, 우리는 그에 대한 코드를 아예 작성하지 않습니다.
00:02:28비교적 명백합니다.
00:02:29그 후에 우리는 묻습니다. 표준 라이브러리가 이걸 처리하나요?
00:02:33만약 대답이 예라면,
00:02:34우리는 표준 라이브러리를 사용할 것입니다.
00:02:36벤치마크를 통해 보게 될 가장 큰 특징은
00:02:38Clawed Code가 이미 존재하는 기능을
00:02:41처음부터 다시 만드는 경우가 있다는 것입니다.
00:02:45어떤 라이브러리 안에서든 혹은 플랫폼 기능으로서든 말이죠.
00:02:49그래서 Clawed Code에는 다음과 같은 문제가 있습니다.
00:02:51이봐요, 바퀴는 이미 만들어져 있습니다.
00:02:52이 프로그램에 이미 바퀴가 있어요.
00:02:53그런데 이렇습니다.
00:02:55내가 바퀴를 처음부터 새로 만들겠다고요.
00:02:56그리고 그 때문에,
00:02:57반드시 필요하지도 않은데 코드를 많이 얻게 되는
00:02:59방식이 바로 그것입니다.
00:03:01이것은 이러한 벤치마크에서 반복해서 보게 되는
00:03:03그러한 점입니다.
00:03:04그리고 잠시 화제를 돌려서,
00:03:05이 6단계는 모두 Clawed Code에게 이렇게 묻는 것과 같습니다.
00:03:09이 기능이 이미 네이티브로 존재하고 있나요?
00:03:12우리가 커스텀 무언가를 만들 필요가 있나요?
00:03:15Clawed는 커스텀 무언가를 만들기를 좋아하기 때문입니다.
00:03:17굳이 그럴 필요가 없더라도 말이죠.
00:03:18따라서 표준 라이브러리가 이를 처리하지 않는다면,
00:03:20이것이 네이티브 플랫폼 기능인가요? 하고 묻는 것입니다.
00:03:22이것은 설치된 의존성인가요?
00:03:24이것이 단 한 줄일 수 있나요?
00:03:26우리가 장황할 필요가 있나요?
00:03:27그리고 이 모든 과정을 거쳐서
00:03:28본질적으로 아니요, 아니요, 아니요, 아니요, 아니요라면,
00:03:30그때 우리가 말하는 것은 네가 무엇을 쓰든
00:03:33작동하는 최소한의 것만 하라는 것입니다.
00:03:35지나치게 오버하지 마세요.
00:03:36필요 없으면 만들지 마세요.
00:03:37그리고 만약 정말 필요하다면 딱 최소한만 하세요.
00:03:40그래서 여기서의 아이디어는 Clawed Code를 게으르게 만들되,
00:03:42태만하게 만들지는 않는 것입니다.
00:03:44신뢰 경계 검증, 데이터 손실 처리, 보안, 접근성과 관련 된
00:03:47모든 것은 절대 타협 대상이 아닙니다.
00:03:48따라서 이 프로세스를 적용하는 대상에 대해 꽤 영리합니다.
00:03:50이제 설치 측면에서는 비교적 간단합니다.
00:03:53여기 있는 이 명령어를 복사하기만 하면 됩니다.
00:03:55그리고 당연히 설명란에 이 저장소에 대한 링크를 남겨둘 것이며,
00:03:57이것이 여러분을 위해 설치를 진행해 줄 것입니다.
00:03:58그리고 코덱스나 실제로 세상의 어떤 AI 에이전트에도
00:04:00이것을 사용할 수 있습니다.
00:04:01Ponytail와 관련하여 몇 가지 명령어가 있습니다.
00:04:03즉, light, full, ultra, 그리고 off입니다.
00:04:05다시 말하지만, Caveman을 매우 연상시키며,
00:04:07우리가 추구하는 Caveman의 레벨들과 같습니다.
00:04:10우리는 코드를 검토하도록 할 수 있습니다.
00:04:12저장소를 감사(audit)하도록 할 수도 있습니다.
00:04:14그리고 debt, gain, help 스킬도 있습니다.
00:04:16다시 말씀드리지만, GitHub 저장소 안에서 원하신다면
00:04:18이들에 대해 정말 자세히 파고들 수 있습니다.
00:04:20하지만 벤치마크가 뒷받침되지 않는다면
00:04:22이 모든 것은 사실 중요하지 않습니다.
00:04:24그리고 이 저장소의 좋은 점은
00:04:24그들이 벤치마크를 제공한다는 것입니다.
00:04:26우리는 직접 이것을 실행해 볼 수 있습니다.
00:04:28그리고 맞추어보세요?
00:04:29그게 바로 제가 한 일입니다.
00:04:31여러분도 직접 할 수 있습니다.
00:04:32README 바로 여기에
00:04:34벤치마크를 어떻게 얻었는지에 대한
00:04:36전체적인 설명 문서가 있습니다.
00:04:37그리고 이것들을 재현할 수 있는 기능도 제공합니다.
00:04:39그래서 제가 보여드릴 것은
00:04:40이 모든 벤치마크를 재현했을 때 제가 얻은 수치들입니다.
00:04:43그리고 저는 저장소에서 볼 수 있는
00:04:44Haiku 4.5뿐만 아니라
00:04:45Opus 4.8을 가지고도 그것들을 재현했습니다.
00:04:48왜냐하면 다시 말씀드리지만, 우리 중 아무도 Haiku를 사용하지 않기 때문입니다.
00:04:51저는 Haiku에는 별 관심이 없습니다.
00:04:52저는 Opus에 관심이 있습니다.
00:04:54그리고 결과는 솔직히 꽤 흥미로웠습니다.
00:04:56자, 여기 테스트들이 있고 점수들이 있습니다.
00:04:58그들의 공개된 수치가 보입니다.
00:05:00Haiku로 실행한 우리의 결과가 보입니다.
00:05:02그리고 저기 맨 오른쪽에 있는 것은
00:05:04Opus로 실행한 우리의 결과입니다.
00:05:07맨 아래에는 집계 결과가 있습니다.
00:05:09그래서 54%, 이것은 다시 말해 코드 라인을 살펴본 것입니다.
00:05:10Ponytail에 따르면 코드 라인이 54% 더 적어졌습니다.
00:05:12우리가 실행했을 때, Haiku에서는 56%였습니다.
00:05:14그러므로 본질적으로 정확히 동일합니다.
00:05:17그리고 Opus에서는 71%였습니다.
00:05:21따라서 우리는 Opus를 사용할 때 Ponytail를 통해 훨씬 더 큰 효율성 향상이나 더 효율적인 코드를 보았습니다.
00:05:24왜 그럴까요?
00:05:27이러한 더 강력한 모델들은 말을 많이 하는 것을 좋아하기 때문입니다, 맞죠?
00:05:29장황한 것을 좋아하죠.
00:05:36다시 말해 Caveman에 대한 일종의 회상입니다.
00:05:36거기서 다뤄졌던 연구들 중 하나를 기억하실 겁니다.
00:05:40매우 장황한 모델들은 너무 말을 많이 한 나머지
00:05:41때로는 스스로 정답에서 벗어난 말을 하게 된다는 바로 그 아이디어 말입니다.
00:05:43그래서 꽤 흥미롭고 실제로 이것에 대한 일종의 부스터가 됩니다.
00:05:45그리고 흥미롭죠.
00:05:50그들은 테스트에서 왜 Haiku를 사용했는지 이야기하는데 그것은 비용 때문이었습니다.
00:05:53저는 정말로 이 전체 과정을 Opus로 했어야 했다고 생각합니다.
00:05:57우리가 실행했을 때 Opus가 실제로 그것을 더 좋아 보이게 만들기 때문입니다.
00:05:58아시다시피, 이것은 사람들이 실제로 사용하는 모델입니다.
00:06:02그러므로 굳이 따지자면 그들은 코드 라인 수와 관련하여 그 효율성을 과소평가한 셈입니다.
00:06:04그리고 이것은 비용에도 적용됩니다.
00:06:09Haiku 4.5를 살펴보았을 때, 우리 테스트에서의 집계 결과는 어땠나요?
00:06:11비용이 약 25% 감소한 것을 보았습니다.
00:06:15반면에 Opus 4.8과 비교했을 때는 53% 감소했습니다.
00:06:17Haiku 4.5를 살펴봤을 때, 우리 테스트의 전체 평균은 어땠죠?
00:06:21Opus 4.8에 비해 비용이 약 25% 줄었고, 53%까지 감소한 경우도 있었습니다
00:06:28이게 Fable이었다고 상상해 보세요.
00:06:30그리고 전반적으로 모든 테스트와 수치들을 볼 수 있습니다.
00:06:32가장 낮은 것은 13%였습니다.
00:06:33그리고 전반적으로 모든 테스트와 수치들을 볼 수 있습니다.
00:06:35무려 73%에 달하기도 했습니다.
00:06:38이제 여러분은 이렇게 생각하실지도 모릅니다. 이 중 일부에 과연 Opus가 필요하기는 한가요?
00:06:42타당한 지적입니다.
00:06:45하지만 여기서 설명되고 있는 바가 무엇인지 이해하기만 하세요.
00:06:45스킬 없이 표준 Opus를 사용할 때 보통 1.39달러가 들 비용이 Ponytail를 사용하면
00:06:480.38달러가 들게 됩니다.
00:06:55그리고 Haiku를 살펴보면, 이 더 작은 모델들은 어떤 경우에는 Ponytail를 사용함으로써 실제로 비용이 더 많이 들기도 했습니다.
00:06:57따라서 코드 라인을 줄이고 더 효과적으로 만든다는 이 전체적인 아이디어는 더 강력한 모델에 대해 이야기할 때 훨씬 더 뛰어납니다.
00:07:04어떤 경우에는 더 작은 모델들과 함께 반대 효과가 나타나는데, 왜냐하면 그들은 어차피 멍청하고 빠르기 때문에 이미 효율적이었기 때문입니다.
00:07:11여기 아이템 수 카운트 벤치마크에서 볼 수 있듯이, Haiku와 함께 Ponytail를 사용하는 것이 21% 더 비용이 많이 들었습니다.
00:07:18물론 2센트 차이에 대한 이야기지만, 요점은 여전히 유효합니다.
00:07:27모델이 강할수록 이 아키텍처는 더욱 효과적입니다.
00:07:31그리고 Fable을 사용할 때 이것이 어떤 모습일지 정말 보고 싶습니다.
00:07:34다시 말하지만, 53%는 농담이 아닙니다.
00:07:37그럼 속도는 어떨까요?
00:07:39다시 말하지만, 우리는 Haiku에서 똑같은 현상이 나타나는 것을 보고 있습니다.
00:07:40얼마나 더 빨라졌을까요?
00:07:43그렇지 않은 경우와 비교해 Ponytail와 함께 Haiku를 사용하는 것이 약 31% 더 빨랐습니다.
00:07:44Opus의 경우는 71% 더 빨랐습니다.
00:07:5171% 더 빨라졌죠.
00:07:55그리고 다시 말하지만, Haiku에서는 어떤 현상을 볼 수 있나요?
00:07:56Ponytail를 사용했을 때 오히려 더 느렸던 사례가 세 건이나 있습니다.
00:07:58어떤 경우에는 Opus의 모든 단일 벤치마크 전반에 걸쳐 최대 88%까지 22% 더 느렸던 반면 말이죠.
00:08:03어떤 경우에는 항상 더 빨랐습니다, 맞죠?
00:08:10다시 말하지만, 멀티스텝 마법사는 78%, 날짜 선택기는 88%를 기록했습니다.
00:08:13그리고 최악의 시나리오에서는 27%의 차이가 있었습니다.
00:08:17따라서 우리는 Ponytail와 함께 이 수치들을 보면서 이렇게 생각합니다. 아, 벤치마크를 직접 돌릴 수 있긴 하지만 20%라는 게 정말 무엇을 의미하는지 대충 흘려듣게 되죠.
00:08:22그러고 나서는 아, 이거 Haiku잖아라고 생각하게 됩니다.
00:08:31그래서 이건 좀 헛소리 같아요.
00:08:33그런데 Opus로 테스트해 보면 완전히 다릅니다.
00:08:34엄청나게 더 효과적입니다.
00:08:36그리고 당연한 의문이 드는 것은 벤치마크 그 자체는 어떠한가 하는 점입니다.
00:08:37그러면 당연히 이런 의문이 들겠죠. 벤치마크 자체는 과연 어떨까?
00:08:41이 벤치마크들이 얼마나 효과적일까요?
00:08:42우선, 저장소로 가서 이것들을 직접 테스트해 보거나 여러분이 타당하다고 여기는 기준에 맞는 자신만의 벤치마크를 실행해 보세요.
00:08:44어느 쪽이든, 제가 보기에 실행된 19개의 서로 다른 벤치마크에 대해 이야기할 때 우리는 전반적으로 동일한 현상을 보고 있습니다.
00:08:52Opus처럼 더 강력한 모델을 살펴볼 때 말이죠, 솔직히 저는 Haiku에 대한 것들은 무시하는 편입니다.
00:08:59Haiku에는 관심이 없습니다.
00:09:04더 저렴하고,
00:09:06더 빠르며,
00:09:07따라서 더 효율적이기 때문입니다.
00:09:08그리고 다시 말하지만, 이것이 본질적으로 단지 하나의 스킬에 불과하다는 점을 고려할 때 이걸 한번 시도해 보는 것의 단점이 무엇인가요?
00:09:11이 수치들은 정말 좋아 보입니다.
00:09:16이 저장소에 가서 직접 다운로드하고 사용해 보기를 강력히 추천합니다.
00:09:17최악의 시나리오로, 여러분의 특정 프로젝트가 너무 복잡해서 덜 장황하게 만들라는 지시가 오히려 역효과를 낳는다고 가정해 봅시다.
00:09:21글쎄요, 제 생각에는 이건 해가 될 것도 없고 문제될 것도 없는 시나리오입니다, 맞죠?
00:09:30그러니 그것이 최악의 경우입니다.
00:09:34가장 좋은 경우는 Opus 사용량의 약 50%를 절약하고 속도도 70% 더 빨라지는 것입니다.
00:09:37정말 흥미로운 내용이네요.
00:09:43저는 분명히 제 일상 업무에서 이것을 사용하게 될 것입니다.
00:09:45저는 한 달이나 두 달 정도 전부터 항상 Caveman을 사용해 왔고, 자동으로 로드되도록 해 두었습니다.
00:09:47그리고 저는 Ponytail로 전환하여 마음에 드는지 확인할 것입니다.
00:09:52이와 같은 것들이 더 많이 나올수록 좋다고 생각합니다.
00:09:55요즘 여러분이 듣는 모든 이야기는 토큰 비용, 토큰 비용, 토큰 비용뿐입니다.
00:09:58따라서 우리를 위해 그것을 낮춰줄 수 있는 그 어떤 것이든 좋은 반응을 얻을 것입니다.
00:10:03그래서 여기서 이 영상을 마치려고 합니다.
00:10:07언제나 그렇듯, 제 Cloud Code 마스터클래스를 이용하고 싶다면 꼭 ChaseAI Plus를 확인해 보세요.
00:10:08댓글로 여러분의 생각을 알려주시면 다음에 뵙겠습니다.
00:10:13댓글로 여러분의 생각을 알려주시면 다음에 뵙겠습니다.

Key Takeaway

오픈소스 저장소 Ponytail는 Claude Code 사용 시 불필요한 코드 생성을 방지하는 6단계 검증 과정을 통해, Opus 4.8 모델 기준 코드 라인 71% 감소와 비용 53% 절감을 이끌어냅니다.

Highlights

  • 출시 단 7일 만에 4만 개의 스타를 기록한 오픈소스 저장소 Ponytail는 Claude Code의 장황한 코드 작성 문제를 해결하여 효율성을 극대화합니다.

  • Haiku 4.5 모델 기준 Ponytail 도입 시 코드 라인 수가 약 50% 줄어들며, 토큰, 비용, 시간 측면에서 20%에서 30% 정도 향상되었습니다.

  • 강력한 모델인 Opus 4.8을 사용할 경우 Ponytail 적용 시 코드 라인이 71% 감소하고 비용은 53% 절감되며 속도는 71% 더 빨라졌습니다.

  • Ponytail는 코드를 작성하기 전 존재 여부, 표준 라이브러리 활용 여부 등 6단계 과정을 거쳐 불필요한 코드 생성을 차단합니다.

  • 신뢰 경계 검증, 데이터 손실 처리, 보안, 접근성과 같은 핵심 요소는 타협 대상에서 제외하고 최소한의 코드만 작성하도록 설계되었습니다.

Timeline

Ponytail의 등장 배경과 기본 수치

  • Ponytail는 Claude Code를 더 빠르고 저렴하게 만들며 출시 7일 만에 4만 개의 스타를 기록했습니다.
  • 기존 기준선과 비교했을 때 코드 라인 수는 약 50% 줄어들고 토큰, 비용, 시간은 20%에서 30% 향상되었습니다.

AI 코딩 도구들이 본질적으로 장황한 답변을 내놓는 문제를 해결하기 위해 Ponytail 같은 도구들이 등장했습니다. 이 도구는 Haiku 4.5 모델을 사용한 집계 테스트에서 뚜렷한 수치적 개선을 보여주며, 비싼 모델을 사용할 때 비용과 시간을 크게 아낄 수 있는 가능성을 제시합니다.

Ponytail의 6단계 작동 원리

  • Ponytail는 코드를 작성하기 전에 존재 필요성, 표준 라이브러리 활용 여부 등 6가지 질문을 거칩니다.
  • 이미 존재하는 기능을 처음부터 다시 만드는 바퀴 재발명 과정을 차단하여 불필요한 코드 작성을 막습니다.
  • 보안, 데이터 손실 처리, 신뢰 경계 검증 등의 필수 요소는 타협하지 않고 유지합니다.

Claude Code는 종종 필요 이상으로 커스텀 코드를 작성하려는 경향이 있습니다. Ponytail는 이를 방지하기 위해 네이티브 기능이나 기존 의존성을 먼저 확인하고, 작동하는 최소한의 결과물만 남기도록 유도합니다. 다만 보안이나 접근성과 같은 중요한 영역은 예외로 두어 안정성을 지킵니다.

모델별 벤치마크 결과 비교 분석

  • Haiku 4.5 모델에서는 효과가 미미하거나 일부 지표에서 비용과 시간이 늘어나는 역효과가 발생했습니다.
  • Opus 4.8 모델과 결합할 경우 코드 라인 71% 감소, 비용 53% 절감, 속도 71% 향상이라는 압도적인 결과가 도출되었습니다.

실제 개발 환경에서 주로 쓰이는 강력한 모델인 Opus 4.8을 기준으로 재현 테스트를 진행한 결과, 장황하게 코드를 늘어놓는 경향이 강한 모델일수록 Ponytail의 효율화 메커니즘이 더욱 강력하게 작용하는 것으로 나타났습니다. 반면 이미 가볍고 빠른 Haiku 모델에서는 큰 이점이 나타나지 않았습니다.

실사용 평가 및 도입 권장

  • 단 하나의 스킬로 작동하는 도구이므로 복잡한 프로젝트에서도 잃을 것 없이 시도해 볼 가치가 있습니다.
  • 토큰 비용이 화두가 되는 시점에서 일상적인 개발 워크플로우에 적용하기에 매우 유용한 도구입니다.

강력한 모델에서 토큰 사용량을 대폭 줄여주고 속도를 높여준다는 점에서 실무 도입 가치가 매우 높습니다. 최악의 경우에도 프로젝트 복잡성으로 인해 큰 손해 없이 기존과 유사한 수준을 유지하므로 적극적인 활용이 권장됩니다.

Community Posts

View all posts