Ferramenta em alta no GitHub acaba de resolver o maior problema do agente de IA

AAI LABS
컴퓨터/소프트웨어

스크립트

00:00:00se você trabalha com bons modelos como o Opus e o GPT 5.6, geralmente obtém um bom resultado, mas esses modelos
00:00:06também consomem muitos tokens, e a situação fica ainda pior com os de ponta, como o GPT Astra
00:00:11e o Fable 5.1, porque você atinge o seu limite de uso muito mais rápido do que com outros modelos.
00:00:16Eles também são muito lentos, então você acaba esperando bastante tempo para uma única tarefa terminar. Para resolver esse
00:00:21problema exato, há uma ferramenta que tem feito sucesso no GitHub ultimamente chamada Graft. Ela corrige a forma como
00:00:26esses agentes lidam com projetos por padrão; além de economizar tokens, ela também torna o
00:00:31agente muito mais rápido do que quando trabalha sozinho, e tem uma forma de funcionamento muito interessante que
00:00:36corrige a causa raiz desse problema. Não é como se já não houvesse
00:00:40ferramentas criadas para resolver essa questão, mas todas têm uma grande lacuna, e é exatamente isso que esta ferramenta conserta.
00:00:46Se esta é a sua primeira vez aqui, somos uma empresa de software e este é o nosso canal, AI Labs. Neste
00:00:51vídeo, vamos mostrar exatamente como o Graft torna o uso desses modelos mais barato. Mas antes de entrarmos
00:00:56no Graft, você precisa entender por que o seu agente usa tantos tokens antes de alterar qualquer coisa no
00:01:02seu aplicativo. O método padrão que agentes como o Claude Code e o Codex usam para encontrar arquivos tem um problema:
00:01:07quando você pede ao agente para adicionar qualquer coisa ao aplicativo em que está trabalhando, ele primeiro precisa encontrar as partes
00:01:12do seu aplicativo onde precisa escrever essa alteração. Para achar essas partes, ele usa diferentes comandos no
00:01:17terminal que buscam palavras relacionadas ao que você quer adicionar. Os modelos geralmente não encontram o que
00:01:23procuram na primeira tentativa; eles precisam usar várias ferramentas para restringir o que exatamente
00:01:28estão procurando, e toda vez que o modelo precisa decidir qual ferramenta usar em seguida, o agente
00:01:32envia ao modelo toda a sua conversa até o momento, incluindo as respostas das ferramentas que ele
00:01:37já utilizou. O modelo então lê tudo isso para decidir seu próximo passo, chegando ao arquivo correto
00:01:42após várias etapas, e cada uma dessas etapas consome o seu limite. Por exemplo, quando você pede ao agente para deixar
00:01:47um botão verde, ele primeiro precisa descobrir qual arquivo contém o código desse botão, então ele busca
00:01:53o arquivo que contém esse botão e os resultados vão para o modelo junto com a sua mensagem. Depois, o agente
00:01:58usa outra ferramenta para ler as linhas específicas de código desse arquivo e só então faz
00:02:04a alteração. Esse vai e volta é como cada mudança que você solicita é feita; como todas as suas
00:02:08mensagens e os resultados das ferramentas são enviados de novo e de novo, a janela de contexto continua crescendo. Não só isso
00:02:14está consumindo o seu contexto, mas também está deixando o modelo mais lento, porque assim o modelo usa várias etapas
00:02:19para restringir o arquivo necessário, então cada nova busca adiciona mais informações e o modelo precisa usar
00:02:25tokens para decidir o que fazer com elas. Essa é, na verdade, uma das razões pelas quais você atinge seu limite de uso quando
00:02:30está trabalhando com agentes em muitas tarefas em uma única sessão. Agora, atingir o limite de uso é apenas uma
00:02:36consequência; você também obtém resultados de pior qualidade, porque há tanta coisa na janela de contexto que
00:02:41o agente não consegue se concentrar em uma coisa de cada vez. Como esse é um problema conhecido, já existem ferramentas
00:02:46por aí que tentam resolvê-lo. Uma abordagem comum que essas ferramentas usam é transformar seções do seu
00:02:51código em números chamados vetores, para que o modelo possa compará-los facilmente. Quando você faz uma pergunta, a
00:02:56ferramenta de busca também transforma a pergunta em vetores e encontra as seções com as correspondências mais próximas.
00:03:02Isso se chama busca vetorial, o que basicamente significa encontrar informações com base na similaridade do seu significado
00:03:07com o que você pediu. Mas a similaridade sozinha não diz como as partes do seu aplicativo se conectam; por
00:03:12exemplo, o código para criar uma conta e para excluir uma conta podem corresponder a uma pergunta sobre
00:03:17contas, mas eles fazem duas coisas opostas, então escolher o errado seria realmente custoso.
00:03:21É por isso que essa busca não é tão eficaz e a maioria dos agentes de código não a usa.
00:03:26Mas antes de prosseguirmos para a ferramenta, seria ótimo se você se inscrevesse no canal e curtisse
00:03:30o vídeo. Esse pequeno gesto de apoio nos ajuda muito. Agora, o Graft é na verdade um comando de terminal
00:03:36que você instala no seu computador e foi criado para alterar o método padrão que seu agente de código usa,
00:03:41para que ele não precise vasculhar todo o seu projeto antes de cada alteração. Ele faz isso
00:03:46construindo um grafo de conhecimento, que basicamente é um mapa de todas as partes do seu projeto, mostrando como
00:03:51as diferentes partes se conectam. O agente usa esse mapa para encontrar o código de que precisa e verificar quais outras partes
00:03:57dependem dele. Ele é gratuito e de código aberto, e o principal é que ele não usa modelos
00:04:02com uma chave de API separada, funcionando com a sua assinatura normal. Há também uma etapa opcional que usa
00:04:07um modelo para escrever páginas simples sobre o seu aplicativo, explicando o que cada parte do código faz e como as
00:04:12partes se encaixam. Você não precisa realmente disso, porque o mapa já diz ao agente o que se conecta a
00:04:17o que o código faz, então com essas páginas o agente passa a
00:04:22saber o que cada parte faz em vez de abrir cada arquivo. Quando a equipe por trás do graft executou essa ferramenta, eles
00:04:28descobriram que ela torna os agentes quatro vezes mais baratos em termos de uso de tokens, e esse é o melhor cenário deles
00:04:33Em seu próprio benchmark com 162 execuções, as tarefas levaram 60% menos tempo em média, o agente usou suas ferramentas 46 vezes a menos
00:04:42e 42% menos tokens, e o custo ficou 32% menor em média. E como a economia
00:04:48vem de todas as buscas que o agente não precisa mais fazer, ela compensa em um projeto maior, porque
00:04:53em um projeto pequeno não há tanta busca para economizar para começar. O graft funciona com o Claude Code
00:04:58e Codex, bem como com outros agentes de código que usam comandos de terminal ou MCP, mas o mapa que ele constrói
00:05:04não é como a busca vetorial de que falamos antes, porque o graft não transforma seu código em números e
00:05:09o combina por similaridade; ele lê o código e anota qual parte realmente usa qual, então quando você
00:05:14altera uma parte, o agente pode ver exatamente o que mais essa alteração pode quebrar, e quando seu código muda,
00:05:20ele apenas atualiza as partes que mudaram em vez de recompilar tudo, para que o mapa permaneça atualizado
00:05:25sozinho e o agente nunca trabalhe com uma versão antiga do seu projeto. Mas primeiro, vamos dar uma
00:05:30palavra do nosso patrocinador Hydra. Então, estávamos adicionando um recurso de geração de IA ao nosso aplicativo, o que antes significava
00:05:35gerenciar modelos, infraestrutura e filas de tarefas por conta própria. É aí que entra a API da Hydra: eles construíram
00:05:41todo o runtime e API por trás de seus modelos, então, em vez de configurar toda essa infraestrutura sozinho,
00:05:46essa camada inteira já é tratada para você. Fizemos uma chamada real do nosso código e, em vez de um ativo simplesmente
00:05:51aparecer, recebemos um trabalho real que podíamos rastrear, e o vimos passar de enfileirado para processamento e
00:05:56concluído antes que a mídia retornasse. Essa leitura de status é a parte que importa, porque é como você sabe
00:06:02que isso pode lidar com trabalho de produção real. Leva apenas um pouco de código para integrar no seu próprio aplicativo, e há
00:06:07uma CLI e um SDK também, para que você possa trabalhar direto do seu terminal ou editor. Esse é o tipo de coisa que um desenvolvedor solo
00:06:13simplesmente não conseguiria construir antes. Experimente o Hydra de graça em hydra.com e use nosso código para ganhar 50% de desconto no seu
00:06:19primeiro mês. O link e o código estão na descrição abaixo. Antes de instalarmos qualquer coisa, você precisa ver
00:06:24como o graft realmente cria esse mapa. Quando você o usa para construir o mapa, o graft lê o código no seu
00:06:29computador e anota cada parte que encontra com seu nome e onde ela está no projeto,
00:06:34então ele anota quais partes estão conectadas a quais. Cada parte nesse mapa é chamada de nó e
00:06:39cada conexão entre duas partes é chamada de aresta. Portanto, quando o agente pergunta o que usa uma parte específica
00:06:44do seu aplicativo, o graft segue essas arestas e fornece o código conectado ao que ele estava procurando
00:06:49para que ele possa ver se essa alteração afeta mais alguma coisa, o que é exatamente o que a busca vetorial
00:06:53não conseguia fazer. O graft salva esse mapa no seu computador como um arquivo JSON; o motivo de salvá-lo como JSON
00:06:59é que esse formato permite anotar algo em uma estrutura adequada com detalhes anexados a ele. Ele
00:07:04também possui um visualizador que abre no seu navegador, onde você pode ver o mapa e explorar as conexões quando
00:07:10o graft está conectado ao Claude Code, ele fornece ao modelo as instruções para usar o mapa no início de
00:07:15cada sessão. Em seguida, toda vez que você envia um prompt, o graft verifica as palavras da sua mensagem no mapa e
00:07:20anexa até três locais correspondentes a ele, para que o modelo já saiba quais arquivos e linhas ler
00:07:26antes de usar uma única ferramenta. O código em si só entra no contexto quando o agente lê essas linhas,
00:07:32então o modelo chega ao arquivo certo em menos turnos e muito menos é adicionado à janela de contexto,
00:07:37portanto, é mais rápido e consome menos do seu limite. Há também uma opção de MCP, e a diferença é quem
00:07:43inicia a busca: com a configuração que acabamos de ver, o graft adivinha pelo seu prompt e anexa esses locais
00:07:48a cada mensagem, quer o agente precisasse deles ou não. Com o MCP, nada é anexado aos seus
00:07:53prompts e o agente pergunta ao graft apenas quando realmente precisa de algo. Nos testes do próprio graft, a
00:07:58versão MCP acertou algumas respostas a mais do que a versão CLI, e a versão CLI era mais rápida quando você
00:08:04a instala, você realmente obtém ambas. E conforme você altera seu aplicativo, o graft mantém o mapa atualizado por conta própria: antes
00:08:10de responder a uma pergunta, ele verifica se o código mudou desde que o mapa foi construído e, se tiver mudado, ele
00:08:15atualiza o mapa primeiro sem usar o modelo. Agora, para instalar o graft, você precisa ir ao site deles,
00:08:20que vincularemos na descrição, e a partir daí você pode copiar o comando de instalação ou o prompt de configuração
00:08:25para qualquer agente de código que você estiver usando e colar isso diretamente no agente. Esse prompt de configuração
00:08:30tem todos os comandos que o agente precisa para instalar o graft e configurá-lo no seu projeto. E se você preferir
00:08:35fazer essa parte você mesmo, você pode fazê-lo copiando o comando de instalação do site e executando-o no
00:08:40terminal de qualquer pasta. Uma vez instalado, a CLI está pronta para uso. Para usá-la em um projeto, você
00:08:46precisa configurar o graft nesse projeto executando o comando init. Esse comando deve ser executado no terminal
00:08:52precisa configurar o graft nesse projeto executando o comando init, esse comando precisa ser executado no terminal
00:08:57dentro da pasta em que você está trabalhando, porque ele adiciona algumas instruções para esse projeto na pasta
00:09:02que seriam perdidas se você o executasse em outro lugar. Quando você o executa, ele pergunta qual agente de código você está usando
00:09:07porque cada agente precisa de sua própria configuração e, como estamos usando o Claude Code, nós o selecionamos e
00:09:11prosseguimos com a instalação. Uma vez feito isso, você verá uma habilidade do graft na pasta do seu projeto
00:09:16que diz ao agente como usar o graft e quais comandos ele possui. Ele também instala hooks e, se você
00:09:22não sabe o que é um hook, é um pequeno script que roda sozinho em um ponto definido. Esses hooks forçam
00:09:26o agente a seguir o fluxo de trabalho do graft. Há vários hooks que são instalados: um fornece ao
00:09:31modelo instruções para usar o mapa quando uma sessão começa, outro anexa os locais correspondentes a cada
00:09:37prompt que você envia e o último roda depois que o Claude edita um arquivo para que o mapa se mantenha atualizado. Então,
00:09:41se você estiver configurando isso em um projeto no qual já vem trabalhando, você precisa executar o comando graft build
00:09:46nessa mesma pasta para que o graft analise todo o código que já está lá e
00:09:50construa o mapa a partir dele. E se você estiver começando em uma pasta vazia, ainda não há nada para mapear, então a
00:09:56habilidade faz o Claude construí-lo assim que houver arquivos. Depois disso, você simplesmente roda o Claude Code normalmente e o
00:10:01visualizador de mapas mostra os nós e arestas que o graft criou. Em uma pasta vazia, o mapa começa com zero nós e
00:10:06o graft os adiciona conforme os arquivos vão sendo criados. Agora, nós testamos o graft construindo um aplicativo de reservas e
00:10:13agendamento semelhante ao Calendly, mas para provedores independentes, com o Fable 5.1. Como esse modelo consome tokens
00:10:18muito rapidamente, nós não queríamos que ele gastasse esforço nas tarefas erradas. É por isso que tomamos uma série de
00:10:23etapas antes de trabalhar com ele: primeiro escrevemos um PRD, que é o documento que define o que o aplicativo deve
00:10:29fazer para que ele conheça todos os recursos necessários. Também adicionamos um arquivo claude.md que contém
00:10:34instruções personalizadas para este modelo, permitindo que ele execute turnos longos sem se desviar do objetivo. Esse
00:10:40arquivo claude.md é o que enviamos como modelo em nosso Community AI Labs Pro, então usamos esse mesmo
00:10:46modelo. Primeiro, pedimos que ele preenchesse as lacunas desse claude.md a partir do PRD, porque o arquivo era apenas
00:10:51um modelo. E se você não tiver um PRD, basta dizer a ele no seu prompt o que você está construindo. Em vez disso,
00:10:57uma vez que o claude.md foi atualizado, mudamos o modelo para o Fable 5.1 e demos a ele o prompt para construir
00:11:02o aplicativo de reservas junto com as ferramentas com as quais queríamos que o app fosse construído. E você precisa dizer a este modelo
00:11:07explicitamente que ele está trabalhando por conta própria, o que cobrimos em nosso vídeo anterior do Fable 5.1, então dissemos a ele
00:11:14para não parar e pedir permissão. Com o graft, a construção levou 39 minutos e usou cerca de 31% da
00:11:20janela de contexto; sem o graft, a mesma construção levou 47 minutos e usou cerca de 35%, e ambos os aplicativos
00:11:25tinham praticamente a mesma funcionalidade. Portanto, nessa primeira construção, a diferença foi pequena porque o
00:11:30grafo ainda não havia sido construído nesse ponto, mas ela aumentou assim que começamos a fazer alterações, pois nessa altura o graft
00:11:35já tinha um mapa de todo o projeto para pesquisar. Uma reformulação completa da página inicial levou menos de
00:11:40dois minutos, e sem o graft a mesma mudança teria levado muito mais tempo do que isso. Após a mudança,
00:11:46o graft atualizou o mapa com os novos arquivos e mostrou sua própria estimativa dos tokens que economizou
00:11:50naquele turno. E há uma última coisa que você precisa saber: quando você está trabalhando em um projeto real, ele
00:11:56nem sempre inclui apenas código, mas também contém outros arquivos que dão aos agentes contexto sobre o que está sendo
00:12:03construído. Eles incluem o PRD, todos os seus arquivos específicos de área, o arquivo learnings.md e muitos outros. Mas
00:12:09o graft só mapeia código, então ele não mapeia seu PRD ou as notas, o que significa que o agente usa o método
00:12:14padrão usual quando precisa ler esses arquivos. E, além disso, muitas pessoas como nós usam o Claude Code
00:12:20para muitas tarefas que não envolvem código também. Então, para fazer com que a ferramenta atenda a essas necessidades também, nós a
00:12:25modificamos um pouco para podermos usá-la em nossos projetos reais onde temos vários arquivos de planejamento, e adicionamos
00:12:31essa versão no AI Labs Pro, que é a nossa comunidade. Então, se você encontra valor no que fazemos e quer
00:12:36apoiar o canal, esta é a melhor maneira de fazer isso, o link está na descrição. Isso nos traz ao fim de
00:12:41este vídeo. Se você quiser apoiar o canal e nos ajudar a continuar fazendo vídeos como este, você pode fazê-lo

핵심 요약

O uso da ferramenta Graft no terminal elimina buscas repetitivas em agentes de código, reduzindo o consumo de tokens em 42% e acelerando as tarefas em 60% por meio de um grafo de conhecimento estruturado.

하이라이트

  • A ferramenta Graft reduz o uso de tokens de agentes de IA em 42% em benchmarks.

  • O tempo médio de conclusão de tarefas diminui em 60% com a utilização do Graft.

  • O Graft constrói um grafo de conhecimento em formato JSON que mapeia arquivos de código e suas dependências.

  • A busca vetorial falha em conectar partes opostas do código, enquanto o Graft analisa chamadas reais entre as funções.

  • O comando init configura ganchos automáticos que atualizam o mapa do projeto após cada edição de arquivo.

타임라인

Problemas de contexto em agentes de IA

  • Modelos de linguagem avançados consomem muitos tokens e atingem limites de uso rapidamente.
  • O método padrão de busca em terminais envia todo o histórico de conversas a cada nova etapa de verificação de arquivos.
  • A busca vetorial tradicional falha ao encontrar conexões lógicas e dependências opostas no código.

Modelos como Opus, GPT 5.6 e Fable 5.1 exigem espera prolongada e esgotam o limite de tokens devido aos comandos sucessivos no terminal. Para localizar arquivos, o agente envia o contexto inteiro repetidas vezes, gerando lentidão e piorando a qualidade dos resultados. Abordagens baseadas em vetores convertem o código em números por similaridade, mas falham porque trechos com significados parecidos podem executar funções opostas.

Funcionamento do Graft e grafos de conhecimento

  • O Graft é um comando de terminal gratuito e de código aberto que cria um mapa de conexões do projeto.
  • Benchmarks mostram redução de 60% no tempo de tarefas e economia de 32% nos custos.
  • O mapa armazena nós e arestas em um arquivo JSON para indicar dependências exatas entre as partes do código.

A ferramenta substitui a busca exaustiva por um grafo estruturado que lê o código e registra quais partes dependem de outras. O sistema executa localmente sem chaves de API separadas. Nos testes de 162 execuções, o agente utilizou ferramentas 46 vezes a menos e reduziu o custo total em 32%, pois elimina buscas desnecessárias em projetos maiores.

Instalação e fluxo de trabalho no terminal

  • O comando graft init configura ganchos automáticos para gerenciar o fluxo do agente.
  • O comando graft build analisa o código existente para construir o mapa inicial de nós.
  • A construção de um aplicativo de reservas consumiu 31% da janela de contexto com o Graft contra 35% sem a ferramenta.

A instalação ocorre via comandos de terminal colados no agente de código escolhido, como o Claude Code. Os ganchos instalados atualizam o mapa automaticamente após cada edição de arquivos sem utilizar o modelo de linguagem. Em testes práticos de desenvolvimento, a utilização do Graft manteve o uso da janela de contexto abaixo de 31% e agilizou reformulações completas em menos de dois minutos.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기