Este repositório open source resolve o maior problema do Claude Code

CChase AI
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Uma única habilidade pode tornar o Claude Code muito mais eficiente?
00:00:03Pode torná-lo mais rápido, mais barato e escrever menos código
00:00:06enquanto ainda nos dá o mesmo tipo de resultados de alto nível a que estamos acostumados?
00:00:10Bem, isso é exatamente o que o Ponytail afirma ser capaz de fazer,
00:00:13e fez com que ele atingisse 40.000 estrelas apenas sete dias após o seu lançamento.
00:00:18Agora, o Ponytail não é a primeira ferramenta que vemos afirmar fazer algo assim.
00:00:22Já falamos sobre o Caveman no passado, e todas essas ferramentas tendem a ter a mesma ideia.
00:00:26A ideia é que o Claude Code é naturalmente prolixo,
00:00:29e se dissermos a ele, ei, pare de falar tanto,
00:00:32podemos obter uma resposta muito mais concisa que acaba sendo igualmente correta
00:00:36ou, como nos lembramos com o Caveman, pode até ser mais correta.
00:00:40O Ponytail é simplesmente a versão mais recente disso,
00:00:42mas é uma versão que afirma números melhores do que qualquer coisa que vimos no passado.
00:00:45E podemos ver esses números bem aqui.
00:00:47Podemos ver linhas de código versus tokens versus custo e versus tempo.
00:00:52E em geral, com o cinza sendo uma espécie de linha de base sem nenhuma dessas ferramentas
00:00:55e o verde sendo o Ponytail,
00:00:58o Ponytail lidera praticamente em todos os lugares ou chega bem perto.
00:01:03Agora, os números que você viu aqui são agregados.
00:01:05Esta é a média obtida em vários testes diferentes,
00:01:08e isso também é feito usando o Haiku 4.5.
00:01:11E não se preocupe, mais tarde vamos A, validar esses testes,
00:01:14dar uma olhada em um modelo real porque nenhum de nós está usando o Haiku 4.5 de verdade.
00:01:18Estamos usando o Opus 4.8, então vamos ver como esses números se parecem.
00:01:20E quando se trata de linhas de código, são cerca de 50% menos linhas.
00:01:24E estamos olhando em termos de tokens, custo e tempo,
00:01:27cerca de 20% a 30% de melhoria em relação à linha de base.
00:01:31E isso não é pouca coisa,
00:01:32especialmente quando extrapolamos isso para algo como o Fable,
00:01:36que é extremamente caro.
00:01:37Então, se eu pudesse dizer a você, ei, se você está usando algo como o Fable,
00:01:40vai ser mais rápido e mais barato.
00:01:42Bem, nós adoraríamos isso, não é?
00:01:43Agora, antes de eu entrar em como isso funciona
00:01:45e mostrar como são as pontuações dos benchmarks,
00:01:47quando eu testei, uma rápida palavra do patrocinador de hoje, eu mesmo.
00:01:50Então, dentro do Chase AI+, eu tenho o meu Claude Code Masterclass,
00:01:53que é a melhor maneira de ir do zero ao dev de IA,
00:01:56especialmente se você não vem de um background técnico.
00:01:59Eu atualizo isso toda santa semana,
00:02:01e também inclui masterclasses sobre codecs
00:02:03e como construir seu próprio SO agêntico.
00:02:06Você pode encontrar um link para isso no comentário fixado.
00:02:08E novamente, eu atualizo isso toda semana,
00:02:10e nos concentramos em casos de uso reais.
00:02:12Então, se você quer começar a dominar o Claude Code,
00:02:15este é o lugar para você.
00:02:16Então, como o Ponytail funciona?
00:02:17Bem, ele passa por um processo de seis etapas
00:02:19antes de escrever código.
00:02:20Então a primeira pergunta é:
00:02:22isso sequer precisa existir?
00:02:24Se a resposta for não,
00:02:26bem, então nós simplesmente não escrevemos código para isso.
00:02:28Relativamente óbvio.
00:02:29Depois disso, perguntamos: a biblioteca padrão faz isso?
00:02:33Se a resposta for sim,
00:02:34vamos usar a biblioteca padrão.
00:02:36A grande coisa que você vai ver nos benchmarks
00:02:38é que há instâncias em que o Claude Code
00:02:41recria recursos do zero que já existem,
00:02:45seja em alguma biblioteca ou como um recurso de plataforma.
00:02:49Então o Claude Code tem o problema em que,
00:02:51ei, a roda já foi inventada.
00:02:52Nós temos a roda aqui neste programa.
00:02:53E é tipo, sabe de uma coisa?
00:02:55Vou construir uma roda do zero.
00:02:56E por causa disso,
00:02:57é assim que você acaba com muito código
00:02:59quando você não necessariamente precisa dele.
00:03:01Isso é algo que você vê repetidamente
00:03:03nesses benchmarks.
00:03:04E saindo disso por um segundo,
00:03:05essas seis etapas estão basicamente perguntando ao Claude Code,
00:03:09tipo, ei, esse recurso já existe nativamente?
00:03:12Precisamos criar algo personalizado?
00:03:15Porque o Claude gosta de criar coisas personalizadas,
00:03:17mesmo quando não precisa.
00:03:18Então, se a biblioteca padrão não faz isso,
00:03:20então ele diz, ei, isto é um recurso de plataforma nativo?
00:03:22Esta é uma dependência instalada?
00:03:24Isso pode ser uma linha?
00:03:26Precisamos ser prolixos?
00:03:27E se ele passar por tudo isso,
00:03:28e for essencialmente tipo, não, não, não, não, não,
00:03:30então dizemos, o que quer que você escreva,
00:03:33faça apenas o mínimo que funcione.
00:03:35Não exagere.
00:03:36Não crie se não precisarmos.
00:03:37E se precisarmos, faça o estritamente necessário.
00:03:40Portanto, a ideia aqui é tornar o Claude Code preguiçoso,
00:03:42mas não negligente.
00:03:44Tudo o que tem a ver com validações de limites de confiança,
00:03:47perda de dados, tratamento, segurança e acessibilidade
00:03:48nunca está em risco de corte.
00:03:50Então ele é meio inteligente sobre onde aplica esse processo.
00:03:53Agora, em termos de instalação, é relativamente simples.
00:03:55Você só vai copiar este comando bem aqui.
00:03:57E eu vou colocar um link na descrição
00:03:58para este repositório, obviamente,
00:04:00e isso vai instalá-lo para você.
00:04:01E você também pode usar isso para codecs,
00:04:03ou realmente qualquer agente de IA por aí.
00:04:05Existem alguns comandos quando se trata do Ponytail.
00:04:07Nomeadamente, light, full, ultra e off.
00:04:10Novamente, muito reminiscente do Caveman,
00:04:12como os níveis do Caveman que estamos buscando.
00:04:14Podemos fazer com que ele revise nosso código.
00:04:16Podemos fazer com que ele audite um repositório.
00:04:18E também temos as habilidades debt, gain e help.
00:04:20Novamente, você pode se aprofundar nisso
00:04:22se quiser dentro do repositório do GitHub.
00:04:24Mas nada disso realmente importa
00:04:24se os benchmarks não se sustentarem.
00:04:26E a coisa boa sobre este repositório
00:04:28é que eles nos dão os benchmarks.
00:04:29Podemos executar isso por nós mesmos.
00:04:31E adivinha?
00:04:32Foi exatamente isso que eu fiz.
00:04:34Você pode fazer isso sozinho também.
00:04:36Há um artigo completo
00:04:37sobre como eles obtiveram os benchmarks
00:04:39bem aqui no README.
00:04:40E também lhe dá a capacidade de reproduzi-los.
00:04:43E então o que vou mostrar a você
00:04:44são os números que obtive
00:04:45quando reproduzi todos esses benchmarks.
00:04:48E os reproduzi não apenas com o Haiku 4.5,
00:04:51que é o que você vê no repositório,
00:04:52mas também fiz com o Opus 4.8.
00:04:54Porque novamente, nenhum de nós está usando o Haiku.
00:04:56Eu não me importo muito com o Haiku.
00:04:58Eu me importo com o Opus.
00:05:00E os resultados foram honestamente muito interessantes.
00:05:02Então aqui estão os testes, e aqui estão as pontuações.
00:05:04Você vê os números publicados deles.
00:05:07Você vê a nossa execução com o Haiku.
00:05:09E então aqui na extrema direita
00:05:10está a nossa execução com o Opus.
00:05:12Na parte inferior, você tem o agregado.
00:05:14Então os 54%, isso é novamente, olhando para as linhas de código.
00:05:17São 54% menos linhas de código, de acordo com o Ponytail.
00:05:21Quando executamos, foi 56% no Haiku.
00:05:24Ou seja, praticamente a mesma coisa.
00:05:27E no Opus, foi de 71%.
00:05:29Portanto, vimos ganhos ainda maiores ou código mais eficiente ao usar o Ponytail com o Opus.
00:05:36Por que isso?
00:05:36Porque esses modelos mais potentes gostam de falar, né?
00:05:40Eles gostam de ser verbosos.
00:05:41Mais uma vez, fazendo uma referência ao Caveman.
00:05:43Vocês devem se lembrar de um dos estudos mencionados lá
00:05:45sobre essa ideia de que modelos muito verbosos gostam de falar bastante,
00:05:50a ponto de às vezes acabarem se confundindo e perdendo a resposta certa.
00:05:53Então é bem interessante e acaba sendo um impulso para essa ferramenta.
00:05:57E é curioso.
00:05:58E eles falam sobre o motivo de terem usado o Haiku nos testes, que foi por causa do custo.
00:06:02Eu realmente acho que eles deveriam ter feito tudo isso com o Opus,
00:06:04porque, quando executamos, o Opus faz a ferramenta parecer ainda melhor.
00:06:09Sabe, e esse é o modelo que as pessoas estão usando.
00:06:11Então, se anything, eles acabaram subestimando a eficiência em relação às linhas de código.
00:06:15E isso também se aplica aos custos.
00:06:17Quando olhamos para o Haiku 4.5, qual foi o resultado geral nos nossos testes?
00:06:21Vimos uma redução de cerca de 25% no custo versus o Opus 4.8, que teve uma redução de 53%,
00:06:28o que é impressionante.
00:06:30Estamos gastando 53% a menos.
00:06:32Imagine se fosse o Fable.
00:06:33E dá para ver todos os testes e os números em geral.
00:06:35O menor valor foi de 13%.
00:06:38E em alguns casos, chegou a 73% para um assistente de várias etapas.
00:06:42Agora você pode pensar: será que ainda precisamos do Opus para algumas dessas tarefas?
00:06:45Justo.
00:06:45Mas é preciso entender o que está sendo ilustrado aqui.
00:06:48O que normalmente custaria 1,39 dólar usando o Opus padrão sem a habilidade, passou a custar 0,38 dólar
00:06:55usando o Ponytail.
00:06:57E se olharmming para o Haiku, esses modelos menores em alguns casos acabaram custando mais com o Ponytail.
00:07:04Portanto, essa ideia de reduzir as linhas de código e tornar tudo mais eficaz funciona muito melhor com modelos mais potentes.
00:07:11Em alguns casos, temos o efeito oposto com os modelos menores, porque eles já eram eficientes por serem mais simples e rápidos.
00:07:18Como podemos ver aqui no benchmark de contagem de itens, foi 21% mais caro usar o Ponytail com o Haiku.
00:07:27Agora, estamos falando de uma diferença de dois centavos, mas o argumento continua válido.
00:07:31Quanto mais forte o modelo, mais eficaz é essa arquitetura.
00:07:34E eu adoraria ver como isso se sai usando o Fable.
00:07:37Mais uma vez, 53% não é pouca coisa.
00:07:39E quanto à velocidade?
00:07:40Novamente, vemos a mesma tendência com o Haiku.
00:07:43Quanto foi mais rápido?
00:07:44Cerca de 31% mais rápido para usar o Haiku com o Ponytail em comparação ao uso normal.
00:07:51Com o Opus, foi 71% mais rápido.
00:07:5571% mais rápido.
00:07:56E de novo, o que vemos com o Haiku?
00:07:58Há casos, três para ser exato, em que foi mais lento usando o Ponytail.
00:08:03Sabe, em alguns casos, 22% mais lento, enquanto no Opus todos os benchmarks foram mais rápidos, chegando a até 88%.
00:08:10Em algumas situações, foi sempre mais rápido, certo?
00:08:13Mais uma vez, vemos o assistente de várias etapas com 78%, o seletor de data com 88%.
00:08:17E no pior cenário, a diferença foi de 27%.
00:08:22Então olhamos para esses números com o Ponytail e pensamos: é melhor olhar com desconfiança, mesmo que eu possa rodar os benchmarks, o que 20% realmente significa?
00:08:31E aí você percebe: ah, é o Haiku.
00:08:33Então isso meio que não vale tanto.
00:08:34Aí testamos com o Opus e a diferença é enorme.
00:08:36É muito mais eficaz.
00:08:37E acho que a pergunta óbvia que surge é: e quanto aos benchmarks em si?
00:08:41Tipo, quão eficazes são esses benchmarks?
00:08:42Eles são realistas?
00:08:44Primeiro de tudo, acessem o repositório, testem vocês mesmos ou rodem seus próprios benchmarks que considerem adequados e legítimos.
00:08:52De qualquer forma, acho que considerando os cerca de 19 benchmarks diferentes que foram executados, começamos a ver o mesmo padrão em todos eles.
00:08:59Quando olhamos para um modelo mais potente como o Opus... Sinceramente, eu meio que ignoro esses resultados para o Haiku.
00:09:04Eu não ligo para o Haiku.
00:09:06Ele é mais barato.
00:09:07Ele é mais rápido.
00:09:08E, portanto, é mais eficiente.
00:09:11E como estamos falando de algo que é essencialmente apenas uma habilidade, qual é o mal em testar isso?
00:09:16Esses números parecem muito bons.
00:09:17Sugiro fortemente que acessem este repositório, baixem e comecem a usar por conta própria.
00:09:21No pior cenário, digamos que para o seu projeto específico, ele seja tão complexo que pedir para ser menos verboso acabe saindo pela culatra.
00:09:30Bem, acho que é uma situação em que não há danos nem prejuízos, certo?
00:09:34Esse é o pior dos casos.
00:09:37O melhor caso é você economizar cerca de 50% no uso do Opus e ainda ter um ganho de 70% na velocidade.
00:09:43Então, são coisas muito interessantes.
00:09:45Com certeza vou usar isso no meu dia a dia.
00:09:47Tenho usado o Caveman há um ou dois meses o tempo todo, já carregado de forma automática.
00:09:52E agora vou mudar para o Ponytail para ver o que acho.
00:09:55Acho que quanto mais coisas assim aparecem, melhor.
00:09:58Tudo o que se ouve falar hoje em dia é custo de token, custo de token, custo de token.
00:10:03Então qualquer coisa que possa reduzir isso para nós será muito bem-vinda.
00:10:07É aqui que encerro este vídeo.
00:10:08Como sempre, não deixem de conferir o ChaseAI Plus se quiserem ter acesso à minha Cloud Code Masterclass.
00:10:13Deixem suas opiniões nos comentários e vejo vocês na próxima.

Key Takeaway

O repositório open source Ponytail força o Claude Code a ser mais conciso e econômico, reduzindo as linhas de código em até 71% e os custos em 53% quando utilizado com modelos avançados como o Opus 4.8.

Highlights

  • O repositório open source Ponytail atingiu 40.000 estrelas apenas sete dias após o lançamento.

  • A ferramenta Ponytail reduz o uso de linhas de código em cerca de 50% a 71% durante o uso do Claude Code.

  • O uso do Ponytail com o modelo Opus 4.8 reduziu o custo em 53% e aumentou a velocidade em 71%.

  • Modelos menores como o Haiku 4.5 obtiveram ganhos menores ou até aumentaram o custo e o tempo em algumas tarefas específicas.

  • O processo de seis etapas do Ponytail impede que o Claude Code recrie recursos nativos ou bibliotecas padrão do zero.

Timeline

Apresentação da ferramenta Ponytail

  • O Ponytail alcançou 40.000 estrelas no GitHub em apenas sete dias.
  • A ferramenta resolve a prolixidade natural do Claude Code.
  • Os testes iniciais com o Haiku 4.5 mostram uma redução de 50% nas linhas de código.

Ferramentas anteriores como o Caveman já tentavam conter a verbosidade dos modelos de IA na geração de código. O Ponytail surge como uma versão mais recente com métricas superiores de desempenho. Os dados agregados iniciais apontam reduções em tokens, custo e tempo de execução.

Mecanismo de funcionamento de seis etapas

  • O sistema avalia a necessidade real de existência do código antes de criá-lo.
  • Verifica a disponibilidade de recursos na biblioteca padrão e em dependências instaladas.
  • A ferramenta restringe a verbosidade sem comprometer a segurança, acessibilidade ou integridade dos dados.

O Claude Code possui a tendência de reinventar a roda e criar soluções customizadas do zero quando bibliotecas padrão ou recursos nativos já suprem a necessidade. O Ponytail executa um processo de filtragem em seis etapas para tornar a IA preguiçosa no volume de código, porém rigorosa em aspectos críticos de segurança e tratamento de dados.

Validação de benchmarks com Haiku e Opus

  • A execução com o modelo Opus 4.8 reduziu as linhas de código em 71%.
  • O custo de execução com o Opus caiu 53% com o uso do Ponytail.
  • Modelos menores como o Haiku 4.5 apresentaram piora no custo e na velocidade em algumas tarefas pontuais.

A reprodução dos testes utilizando o modelo Opus 4.8 revelou ganhos de eficiência muito superiores aos divulgados com o Haiku 4.5. Modelos mais potentes tendem a ser mais verbosos, o que amplia os benefícios da arquitetura do Ponytail. Em contrapartida, modelos menores e mais simples podem registrar pequenas perdas de eficiência em tarefas específicas.

Community Posts

View all posts