Esta Nova Habilidade Finalmente Resolve o Raciocínio Para Agentes de IA

AAI LABS
Computing/SoftwareInternet Technology

Transcript

00:00:00O Claude Code, o Codex e quase todos os outros agentes que você usa têm um problema sério, e você se depara com ele no momento em que precisa que um deles tome uma decisão real.
00:00:08Esses modelos conseguem analisar um problema, mas nunca criam nada novo.
00:00:12E não importa qual você esteja usando, pois todos eles falham no momento em que você precisa de algo criativo.
00:00:17Então, quando você recorre a eles em busca de ideias, o que recebe de volta é a resposta segura, e você acaba pedindo várias vezes pelos ângulos que eles deveriam ter encontrado sozinhos.
00:00:24Até que você mesmo dê esses ângulos a eles, eles não vão pensar de forma criativa.
00:00:28Mas a solução para isso, por incrível que pareça, é na verdade o TDAH, que é quando a atenção de uma pessoa salta para todo lado em vez de focar em uma só coisa.
00:00:35E acontece que o TDAH se torna um superpoder quando você é um agente de IA, e é basicamente isso que estamos dando a eles agora.
00:00:41Existe uma ferramenta em alta ultimamente que faz exatamente isso.
00:00:44E se esta é a sua primeira vez aqui, nós somos uma empresa de software e este é o nosso canal, AI Labs, onde mostramos como otimizar seus processos com IA, assim como otimizamos os nossos.
00:00:54Portanto, neste vídeo, vamos mostrar como dar TDAH ao seu agente realmente ajuda.
00:00:59Agora, antes de entrarmos na ferramenta, você precisa saber por que precisa dela em primeiro lugar.
00:01:03Se você já trabalhou com Claude Code, Codex ou qualquer outro agente, já sabe que eles são bons em quebrar as grandes tarefas que você dá em pequenos pedaços.
00:01:10Eles passam esses pedaços para subagentes, para que cada um trabalhe em sua própria janela de contexto sem lotar a sessão principal.
00:01:16Você nem precisa pedir por isso.
00:01:18Eles criam listas de tarefas e as delegam onde for possível para que o trabalho rode em paralelo.
00:01:22Mas toda essa divisão só acontece para o trabalho em si.
00:01:26Nada disso acontece quando você pede para eles gerarem ideias, e se você já tentou fazer um brainstorming de diferentes ângulos de uma ideia com um deles, já conhece essa dor.
00:01:34Você pede variações e o que volta parece diferente quando você lê, mas são todas apenas a mesma ideia reescrita de outra forma.
00:01:40Então, a ideação é a coisa mais difícil de delegar, porque encontrar direções genuinamente diferentes não é algo em que os agentes sejam bons.
00:01:47Basicamente, tudo se resume a como esses modelos são treinados.
00:01:50Um agente recorre ao padrão que apareceu com mais frequência nos dados com os quais aprendeu, porque ver a mesma resposta repetida foi o que ensinou a ele que aquela resposta é boa.
00:01:59Isso não torna as respostas erradas e o que você recebe geralmente é razoável, mas há outros ângulos do problema para os quais ele nem olha, o que meio que anula o propósito de fazer um brainstorming com ele.
00:02:08E os padrões seguros são apenas metade do problema, porque ele também nunca avalia cada ideia por si só.
00:02:13Todas as possibilidades são analisadas na mesma janela de contexto, então as ideias se misturam e o contexto fica cheio de ruído.
00:02:20O raciocínio piora em vez de melhorar, é por isso que ele não consegue avaliar nada com clareza e acaba entregando a mesma ideia com palavras diferentes.
00:02:28A skill de TDAH foi lançada recentemente e ganhou muitas estrelas em poucos dias.
00:02:33E o nome cai como uma luva, porque, assim como no TDAH real, onde os pensamentos ficam dispersos por toda parte, ela dispersa o raciocínio em vez de segui-lo em uma linha reta.
00:02:42Assim, ela pega a ideação, ou qualquer tarefa com muitas direções possíveis, e a divide entre agentes separados como uma árvore de pensamentos.
00:02:49Uma árvore de pensamentos é basicamente uma estrutura onde múltiplos ramos de subagentes trabalham isoladamente em ideias diferentes, do mesmo jeito que os galhos de uma árvore se dividem.
00:02:58Então, no final, assim que cada ramo decide por uma possibilidade, ela reúne todas essas ideias novamente e as consolida na resposta final.
00:03:06Assim, ela inicializa múltiplos agentes que pensam em suas próprias janelas de contexto, e cada um recebe uma abordagem diferente do mesmo problema.
00:03:12Eles estão isolados, portanto compartilham zero contexto e nenhum deles sabe no que os outros estão trabalhando.
00:03:17Mas o isolamento aqui não é para dividir o trabalho, é para manter cada ideia separada para que elas não se influenciem.
00:03:24A forma como ela os mantém separados é por meio de enquadramentos, que são basicamente lentes diferentes para analisar o problema.
00:03:29Ela tem uma biblioteca interna de enquadramentos com todas as direções que os agentes podem seguir, e cada agente escolhe o enquadramento em que vai trabalhar.
00:03:37Assim, ele recebe o prompt desse enquadramento junto com o prompt do sistema e o próprio problema.
00:03:41Depois, um agente crítico pontua tudo o que retorna, porque algo precisa decidir quais dessas ideias valem a pena manter.
00:03:48Ele avalia cada ideia com base em três fatores.
00:03:50Originalidade, que é o quão nova e criativa a ideia realmente é.
00:03:54Viabilidade, que é se você realmente conseguiria construí-la.
00:03:57E adequação, que é o quão bem ela resolve o problema que você está tentando solucionar.
00:04:01Essa avaliação acontece em um agente próprio, rodando um prompt que o instrui a agir como um engenheiro sênior cético.
00:04:07Portanto, todo o trabalho dele é ser rigoroso com tudo o que lê.
00:04:10E com base na pontuação, ele decide se uma ideia sobrevive ou é descartada.
00:04:15No final, a skill seleciona as ideias mais fortes e analisa a lista de armadilhas, que são os problemas que cada ideia poderia causar se você realmente optasse por ela.
00:04:23Em seguida, ela prioriza as ideias que foram marcadas como não óbvias.
00:04:26Antes de mostrarmos formas interessantes em que essa skill realmente ajuda, seria ótimo se você se inscrevesse no canal e deixasse o seu like.
00:04:33Esse pequeno gesto de apoio faz uma enorme diferença para nós.
00:04:36Então é isso que ela faz por baixo dos panos.
00:04:38Agora vamos instalá-la.
00:04:40Você encontrará o comando para isso no repositório do GitHub do projeto.
00:04:43Basta copiá-lo, abrir o terminal no projeto em que estiver trabalhando e executá-lo.
00:04:47Em seguida, ela pergunta para qual agente de programação de IA você deseja instalá-la, e ela suporta mais de 45.
00:04:53Então você pode escolher qualquer um que usar.
00:04:55Depois disso, ela pergunta se deve estar disponível apenas no projeto atual (Project Scope) ou em qualquer lugar, não importa em qual projeto você esteja.
00:05:03Se você só precisar dela em um lugar, escolha Project Scope.
00:05:06Mas, assim que termina, a skill vai para uma pasta chamada .agents.
00:05:10É isso que muitos outros agentes, como o Codex, usam para manter suas configurações, mas o Claude Code só reconhece a pasta .claude por padrão.
00:05:18Portanto, se for esse o seu caso, renomeie essa pasta para .claude e ela será reconhecida.
00:05:22Quando você a abrir, verá a skill lá dentro.
00:05:25E é apenas um único arquivo skill.md que cuida de tudo sozinho, sem arquivos de referência ou dependências ao lado.
00:05:31As instruções também forçam o agente a ir além das suas três primeiras respostas.
00:05:36O arquivo diz claramente que essas três primeiras são as respostas mais comuns nos dados em que esses modelos aprenderam,
00:05:41e também são as únicas que qualquer agente sênior criaria de imediato.
00:05:44As coisas mais interessantes que um agente sênior é realmente capaz de fazer só começam depois dessas.
00:05:50Mas criar tantos agentes consome muitos tokens,
00:05:52por isso há uma etapa de pré-checagem que decide se essa skill deve ser executada ou não.
00:05:56Se você chamá-la com o comando de barra, ou simplesmente pedi-la diretamente, ela é acionada na hora.
00:06:01Se você não a mencionou no prompt para chamá-la diretamente,
00:06:04e o seu agente decidir invocá-la automaticamente,
00:06:07ela passa o problema por três perguntas que compõem a etapa de pré-checagem.
00:06:11A primeira é se o problema é aberto,
00:06:14o que basicamente significa: alguém experiente teria algumas respostas diferentes que funcionariam aqui,
00:06:19ou apenas uma resposta certa?
00:06:20Se houver apenas uma resposta certa,
00:06:22pensar sob múltiplos ângulos é inútil e apenas desperdiça tokens,
00:06:26então ela para por aí.
00:06:27A segunda é se os riscos são realmente altos,
00:06:29o que significa: custaria genuinamente algo se a resposta óbvia se mostrasse errada?
00:06:34E a terceira é a forma como você pediu.
00:06:36Se você usou palavras como "rápido" ou "padrão",
00:06:38está claro que busca uma resposta direta,
00:06:40então ela para por aí em vez de usar a skill.
00:06:43Além da pré-etapa,
00:06:44você tem todas as fases do loop junto com a tabela de enquadramentos, que se tornam as diferentes direções entregues a cada agente.
00:06:50Também lista os padrões que os agentes são explicitamente orientados a evitar.
00:06:54Mas antes de ver maneiras interessantes de usá-la, uma palavra do nosso patrocinador.
00:06:59Top View.
00:06:59Se você faz vídeos de IA, já conhece o sofrimento.
00:07:02Cada modelo fica em uma plataforma diferente e você gera um clipe de cada vez.
00:07:05O Top View resolve isso.
00:07:06É a primeira skill de vídeo de IA tudo-em-um do mundo e fica dentro do seu agente de programação.
00:07:11Claude Code, Cursor, Codex.
00:07:13Ele reúne os principais modelos em um só lugar.
00:07:16Veo, Kling, SeaDance, Sora e muito mais.
00:07:19Sem trocar de plataforma, sem malabarismos com assinaturas.
00:07:22Então nós testamos.
00:07:23Demos ao nosso agente apenas um comando:
00:07:25“Gere 10 variações de um anúncio de 15 segundos para o TikTok a partir desta imagem do produto.”
00:07:29Segundos depois, tínhamos 10 anúncios prontos para publicar.
00:07:32Essa é a verdadeira mudança.
00:07:34O Top View transforma seu agente em uma linha de produção de vídeo.
00:07:36Você descreve o que quer uma vez e ele gera dezenas de vídeos em lote com diferentes modelos, estilos e proporções em uma única sessão.
00:07:44Ele até seleciona automaticamente o modelo certo para a tarefa.
00:07:47Você vai de uma linha de texto a vídeos prontos sem jamais sair do seu agente.
00:07:51Experimente a skill do Top View no link da descrição.
00:07:54Essa é a estrutura dele.
00:07:54Agora vamos ver onde isso realmente vale a pena.
00:07:57Um lugar onde se destaca é o desenvolvimento orientado a testes, o TDD, em que você faz o agente escrever os testes primeiro.
00:08:03Depois ele constrói a aplicação parte por parte até que todos esses testes passem.
00:08:07E escrever os testes antes do código é importante, como já falamos em vídeos anteriores,
00:08:12porque quando todos os seus requisitos estão estritamente escritos em código, qualquer alteração que quebre o app é pego pelos testes.
00:08:18O agente é forçado a cumpri-los.
00:08:20E escrever testes é um ótimo problema para dar a essa skill, porque é exatamente onde os agentes acomodam.
00:08:26Eles não cobrem todos os casos que deveriam, pois, como dissemos, recorrem às mesmas respostas comuns e criam testes só em volta delas.
00:08:33Eles nunca olham para os outros caminhos que alguém poderia seguir no aplicativo, que também precisam ser cobertos.
00:08:37Você pode dar a ele um prompt detalhado de como escrever testes e criar um agente especializado cuja única função seja escrevê-los.
00:08:45Mas eles ainda voltam para os mesmos padrões.
00:08:47Antes de executá-la, porém, o agente precisa saber o que você está construindo antes de escrever qualquer coisa.
00:08:51Para isso, você precisa registrar o que deve ser feito, como um PRD, que é basicamente o documento que define o que o aplicativo deve fazer e o problema que ele resolve, além das metas e do público-alvo.
00:09:03Junto a isso, você também deve fornecer uma especificação técnica, definindo os detalhes para não ter que ficar repetindo quais ferramentas usar.
00:09:11Você vincula ambos no seu arquivo Claude.md para que ele pegue esse contexto desde o início.
00:09:16Depois, você invoca a skill com o comando de barra, passa um prompt descrevendo o aplicativo e pede para escrever os casos de teste usando TDD.
00:09:25Como você a chamou explicitamente, ela pula a pré-checagem e aciona cinco agentes imediatamente.
00:09:30Cada um segue em sua própria direção de pensamento, usando o enquadramento ideal para o problema, e eles retornam com abordagens diferentes para os testes.
00:09:38Depois, ela pontua cada uma com base nos critérios que vimos antes, escolhe as três melhores e as explora mais a fundo.
00:09:44E assim que todos os agentes terminam, você recebe um relatório detalhado das diretrizes de testes com suas respectivas notas.
00:09:50As notas usam abreviações: N9 significa nota 9 em originalidade, V8 é nota 8 em viabilidade, e F10 é nota máxima em adequação.
00:10:00Cada ideia também vem com um esboço de como seria construída, os riscos envolvidos e os primeiros passos para começar.
00:10:07Mas as ideias que retornam não se parecem em nada com um conjunto comum de testes.
00:10:11Geralmente, os testes que um agente escreve apenas verificam se o app funciona corretamente.
00:10:15Mas as ideias trazidas pela skill foram atrás de muito mais casos limites e também pegam problemas de desempenho.
00:10:21Assim, você obtém uma suíte de testes muito mais robusta, dividida em três ramos bem explorados, onde cada um testa um caminho diferente no aplicativo.
00:10:30Uma coisa que deve ficar clara aqui: a skill planeja os testes, mas não os escreve de fato.
00:10:34O que você recebe é a estratégia; a partir daí, você diz ao agente qual direção deseja e ele a implementa.
00:10:40Você pode escolher uma única direção, se for tudo o que precisa, ou pedir para implementar as três.
00:10:44Se o desempenho for crítico para o seu projeto, o ideal seriam as três, mas isso demora um pouco, já que o agente precisa trabalhar em um caminho de cada vez.
00:10:52Depois de pronto, você vê claramente que os testes ficaram muito mais detalhados do que seriam de outra forma,
00:10:57porque toda a estratégia de testes foi planejada profundamente antes de escrever uma única linha.
00:11:02Isso funciona muito bem antes de começar a codificar, pois cobre a maior parte do terreno de início e reduz as chances de quebrar o app mais tarde.
00:11:09Mas isso é tudo para antes de construir.
00:11:11A outra forma de usar isso é como uma etapa logo antes de lançar.
00:11:14Você executa a skill no app prestes a ser lançado e pede para ela avaliar a experiência do usuário.
00:11:18Ela aponta tudo o que poderia confundir as pessoas ao navegar pelo site ou usar o produto,
00:11:23e qualquer coisa que possa levá-las ao churn, que é quando as pessoas param de usar seu produto depois de já terem começado.
00:11:29E o churn acontece muito assim que seu site vai ao ar com pessoas reais usando, especialmente se for pago.
00:11:34Elas gostam no começo e depois vão embora porque um recurso não funcionou como esperavam,
00:11:38então pedem o dinheiro de volta.
00:11:40Na maioria das vezes, é um detalhe pequeno que passou despercebido durante a criação,
00:11:44foi parar na versão oficial e causou problemas mais para frente.
00:11:48Rodamos isso em nosso próprio site de comunidade, bem quando estávamos lançando um novo recurso.
00:11:53Já temos muitos membros lá, então qualquer novidade precisa ser verificada com muito cuidado,
00:11:57pois não queremos lançar algo que estrague a experiência de quem já está na plataforma.
00:12:01Então a invocamos com o comando de barra, apresentamos o recurso e pedimos para ela identificar
00:12:05onde os usuários poderiam desistir e o que causaria uma má experiência.
00:12:09Ela começou analisando a aplicação a fundo para reunir contexto,
00:12:12inicializou seus agentes da mesma forma e trouxe cerca de 30 ideias diferentes.
00:12:17Dentre elas, escolheu as três melhores e as aprofundou.
00:12:20Ao final, ela entregou cada uma das descobertas avaliadas em originalidade, viabilidade e adequação.
00:12:25E encontrou lacunas que tinham passado totalmente despercebidas,
00:12:28como recursos prometidos no PRD que nunca foram realmente construídos,
00:12:32ou seja, teríamos lançado algo diferente do que prometemos,
00:12:35além de várias outras constatações.
00:12:37E para cada uma delas, sugeriu uma correção e listou as armadilhas e riscos associados.
00:12:42E funciona do mesmo jeito que com os testes.
00:12:44Ela não corrige nada sozinha, então você apenas repassa os pontos desejados para o agente,
00:12:48e ele cuida da implementação.
00:12:50Assim, você resolve tudo isso antes do lançamento em vez de depois,
00:12:53deixando o seu aplicativo em um estado muito melhor quando for ao ar.
00:12:57Todas as skills, fluxos de trabalho e recursos que mostramos em nossos vídeos
00:13:01estão disponíveis no AI Labs Pro, que é a nossa comunidade.
00:13:04Portanto, se você encontrou valor no que fazemos e quer apoiar o canal,
00:13:07essa é a melhor maneira de fazer isso.
00:13:09O link está na descrição.
00:13:10Isso nos leva ao fim deste vídeo.
00:13:12Se você quiser apoiar o canal e nos ajudar a continuar fazendo vídeos como este,
00:13:16pode fazer isso usando o botão “Valeu demais” abaixo.
00:13:18Como sempre, obrigado por assistir e nos vemos no próximo.

Key Takeaway

A skill de TDAH resolve a falta de criatividade em agentes de IA ao isolar a ideação em múltiplos subagentes e filtrar as soluções por critérios rigorosos de engenharia.

Highlights

  • Agentes de IA tradicionais recorrem a padrões seguros e falham na ideação criativa porque treinam com respostas repetidas.

  • A skill de TDAH para agentes de programação divide o raciocínio em múltiplos ramos isolados usando uma árvore de pensamentos.

  • Um agente crítico avalia cada ideia gerada com base em originalidade, viabilidade e adequação antes da seleção final.

  • A ferramenta suporta mais de 45 agentes de IA e organiza suas configurações na pasta .agents ou .claude.

  • A fase de pré-checagem analisa se o problema é aberto e se os riscos são altos antes de gastar tokens com a skill.

  • No desenvolvimento orientado a testes (TDD), a abordagem gera suítes de testes robustas que cobrem casos limites e desempenho.

  • A avaliação pré-lançamento identifica falhas de experiência do usuário, recursos ausentes e cenários de churn.

Timeline

O problema da criatividade em agentes de IA

  • Agentes como Claude Code e Codex dividem tarefas repetitivas em subagentes, mas falham em sessões de brainstorming.
  • Os modelos geram respostas seguras baseadas nos padrões mais frequentes dos dados de treinamento.
  • A análise de múltiplas ideias na mesma janela de contexto gera ruído e prejudica o raciocínio.

Os agentes atuais conseguem quebrar tarefas grandes em pedaços e delegá-las para execução paralela, porém esse mecanismo não funciona para a geração de ideias. Quando solicitadas variações de um conceito, as respostas voltam reescritas mas com o mesmo conteúdo subjacente. Esse comportamento ocorre porque o treinamento prioriza padrões recorrentes e, ao acumular várias possibilidades no mesmo contexto, a qualidade do resultado diminui.

Funcionamento da skill de TDAH

  • A skill dispersa o raciocínio em uma árvore de pensamentos com ramos isolados que compartilham zero contexto.
  • Uma biblioteca interna de enquadramentos fornece lentes diferentes para analisar o mesmo problema.
  • Um agente crítico avalia as ideias geradas com base em originalidade, viabilidade e adequação.

Inspirada no funcionamento do TDAH humano, a ferramenta divide a tarefa entre múltiplos subagentes que trabalham de forma independente sem influenciar uns aos outros. Cada agente adota um enquadramento específico da biblioteca interna para abordar o problema por ângulos distintos. Em seguida, um agente crítico atua como um engenheiro sênior cético para pontuar e filtrar as ideias mais fortes, priorizando as opções não óbvias.

Instalação e configuração da ferramenta

  • A instalação ocorre via terminal através de um comando copiado do repositório do GitHub.
  • O arquivo único skill.md reside na pasta .claude ou .agents do projeto.
  • Uma etapa de pré-checagem avalia se o problema é aberto e se os riscos justificam o consumo de tokens.

O processo de configuração exige executar o comando no terminal do projeto e selecionar o agente desejado entre mais de 45 opções suportadas, além de definir o escopo do projeto. A skill consiste em um único arquivo de instrução que força o agente a ir além das três primeiras respostas padrão. Antes de iniciar a execução completa, a pré-checagem verifica se a questão possui apenas uma resposta correta, se os riscos são altos e se o usuário solicitou uma resposta direta.

Aplicação no desenvolvimento orientado a testes (TDD)

  • A escrita prévia de testes garante que alterações futuras que quebrem o aplicativo sejam interceptadas.
  • A skill aciona cinco agentes em paralelo para gerar estratégias de teste diversificadas.
  • O relatório final classifica as ideias com abreviações de nota para originalidade, viabilidade e adequação.

Antes de iniciar a codificação, o uso da skill no TDD evita que o agente crie apenas testes superficiais focados nas respostas mais comuns. Fornecer um documento de requisitos (PRD) e especificações técnicas no arquivo Claude.md estabelece o contexto inicial. A ferramenta gera três direções aprofundadas com foco em casos limites e desempenho, permitindo escolher a estratégia ideal para implementação.

Avaliação de experiência do usuário antes do lançamento

  • A execução da skill antes do lançamento identifica pontos de confusão e fatores de churn.
  • O processo detecta lacunas como recursos descritos no PRD que não foram implementados.
  • A ferramenta fornece relatórios detalhados com correções sugeridas e riscos associados para cada problema.

Aplicar a skill antes de colocar um recurso no ar em produção ajuda a evitar problemas que geram abandono por parte dos usuários. A análise aprofundada gera dezenas de ideias, reduzidas para as três principais avaliadas em originalidade, viabilidade e adequação. Dessa forma, correções preventivas são aplicadas antes que falhas cheguem aos usuários reais.

Community Posts

View all posts