Transcript
00:00:00Você não pode confiar no Claude para avaliar seu próprio trabalho, o que é um grande problema, mas que esta habilidade
00:00:05resolve. Ela se chama Claudex Loop, e a premissa é simples. Em vez de deixar o Claude responsável
00:00:09por planejar, executar e avaliar o seu próprio trabalho, por que não trazer o Codex para dar uma olhada
00:00:16também no plano e na execução do Claude e dizer, olha, isso parece bom, isso não, aqui está o que eu
00:00:22acho que você deveria mudar. Porque um dos grandes problemas com cada modelo de IA existente
00:00:25é que eles avaliam o próprio trabalho de forma muito favorável. Quando eu pergunto ao Claude quão bom é o plano que ele
00:00:30criou, ele vai dizer que essa coisa é incrível. Então é importante termos sistemas onde
00:00:35 possamos trazer um segundo par de olhos para analisar o que o primeiro modelo construiu e dizer, polegar para cima,
00:00:40polegar para baixo e o porquê. Então hoje, não vou apenas te dar a habilidade, vou detalhar como
00:00:44ela funciona por trás dos panos e faremos uma demonstração rápida. Agora, a habilidade é dividida em quatro fases,
00:00:48e a ideia é que você a invoque antes de adicionar algum tipo de recurso, ou se estiver iniciando um novo
00:00:53projeto do zero. E a ideia geral é que, independentemente do que o primeiro modelo crie como plano ou execute,
00:00:58nós esperamos até que o segundo modelo dê uma olhada e diga, olha, isso parece ótimo,
00:01:02antes de avançarmos em grandes coisas. Agora, para a primeira fase, estamos fazendo um reconhecimento. Vamos
00:01:07na verdade navegar na web, o Claude vai sondar para ver se as respostas realmente
00:01:10existem. Temos a opção de invocar a pesquisa profunda, que é o fluxo de trabalho dinâmico integrado, se quisermos
00:01:15nos aprofundar muito nas respostas que estamos recebendo. Depois disso, entramos na fase de interrogatório.
00:01:20Pense nisso como um conjunto aprimorado de perguntas do modo de planejamento, onde tentamos entrar em sintonia
00:01:25com o Claude antes que ele crie seu primeiro plano. Segundo, é aqui que trazemos o segundo
00:01:28modelo. Este é o estágio de revisão. Então o Claude Code, depois de criar um plano com base em tudo
00:01:34o que discutimos e pesquisamos, vai criar o seu plan.md padrão.
00:01:38A partir daí, o Codex vai revisar o plano em um ambiente isolado (sandbox) somente leitura, e vai dizer,
00:01:43olha, ou isso está aprovado, ou precisamos revisar x, y e z. Ele vai então enviar essa resposta
00:01:49com as revisões de volta para o Claude Code. O Claude Code vai dar uma olhada, dizer, eu concordo, não concordo,
00:01:55e então enviará suas alterações de volta. Esse loop continuará até cinco vezes. Agora, eu
00:02:01nunca vi travar exatamente em cinco vezes sem atingir um estado aprovado. No entanto, eu o faço
00:02:06parar em cinco, você pode mudar isso facilmente com a habilidade para que ele não fique preso em algum loop
00:02:11infinito estranho, queimando tokens para todo sempre. Isso te dá um limite rígido muito claro
00:02:15para você não ficar preso nessa situação. Por fim, assim que o Claude e o Codex chegam a um acordo
00:02:20e um plano é criado, nós passamos para a fase de construção. Agora, esta habilidade te dá a capacidade
00:02:24de não apenas ter o Claude construindo, você pode fazer o Codex começar a construir coisas também. Mas seja qual for o modelo
00:02:30que construir, o segundo modelo vai dar uma olhada no que foi criado antes de avançar
00:02:34com qualquer coisa. E novamente, por trás dos panos, há muitas variáveis diferentes que você pode ajustar.
00:02:38Como mencionei antes, temos a seção de revisão, que está definida como cinco. Na seção de construção,
00:02:43quando pedimos ao Codex para dar uma olhada no que construímos, reduzi isso para dois loops novamente,
00:02:48apenas para não ficarmos presos nesses cenários de loops sem fim. E eu realmente não tive
00:02:52problemas em que senti que, nossa, eu precisava aumentar isso. Mas você pode brincar com isso. Além disso,
00:02:56você pode explorar mais isso e trazer um modelo local em vez do Codex,
00:03:00se essa também for a abordagem que você deseja. Agora, se você usou a versão anterior da habilidade,
00:03:04chamada Grill Me Codex, as alterações às quais você deve prestar atenção no Claudix Loop
00:03:08são um modo de interrogatório mais aprimorado. Portanto, ele vai mais fundo na linha de questionamento. E na
00:03:13fase de execução, integramos mais o Codex. Assim, novamente, podemos ter supervisão sobre o código real
00:03:18que foi criado. Então, o próximo passo é a demonstração real. Mas antes de entrarmos nisso,
00:03:23uma rápida palavra do patrocinador de hoje, eu mesmo. Acabei de lançar uma versão completamente atualizada da minha
00:03:28masterclass do Claude Code dentro do Chase AI Plus, e é a maneira número um de ir do zero a desenvolvedor de IA,
00:03:33especialmente se você não vem de uma formação técnica, focamos em casos de uso reais. Isso é
00:03:38atualizado todas as semanas. Então, se você quer melhorar nessa ferramenta insana e
00:03:42não vem de uma formação em desenvolvimento de software, isso é para você. Se quiser
00:03:47conferir, há um link para isso no comentário fixado. Agora, para a demonstração de hoje, vamos usar
00:03:51o Claudex Loop para recriar o Calendee. Se você não sabe o que é o Calendee, é um aplicativo web de agendamento,
00:03:56você envia um link para as pessoas, elas podem ver seu calendário, escolher horários e ele cria automaticamente
00:04:00um link do Zoom ou do Google Meet. É algo que muita gente usa e realmente
00:04:05paga por isso. Mas pensei: por que não criarmos isso nós mesmos e economizarmos uns 10 dólares
00:04:09por mês, ou o que quer que eu esteja pagando? Eu deveria saber disso. O que vou fazer é
00:04:13invocar a barra inclinada Claudex Loop e apenas dar a ele um fluxo de consciência, dizendo
00:04:18algo como: quero usar o Claudex Loop para criar essencialmente nossa própria versão do Calendee.
00:04:25A partir de agora, eu provavelmente faria com que ele usasse o Google Meet em vez do Zoom. Mas eu gostaria que estivesse vinculado
00:04:32ao meu calendário e essencialmente recriasse o Calendee com todos os principais recursos. Vamos lá
00:04:38fazer isso. No começo, estamos na fase zero, que é a fase de pesquisa. Então ele diz:
00:04:41olha, como você realmente quer fazer essa pesquisa? Ou fazemos a busca na web, que é o seu
00:04:46padrão do Claude enviando alguns subagentes, ou queremos fazer uma pesquisa profunda completa? Agora,
00:04:50com esta habilidade, eu a fixei para o Opus. Como você sabe, na pesquisa profunda, se você fizer isso no Fable
00:04:56e executar apenas a barra inclinada deep research, ele chamará subagentes do Fable, que podem exagerar
00:05:01no seu uso. Então, por enquanto, configurei para usar o Opus direto, apenas para ajudar. Novamente,
00:05:05você pode fazer isso totalmente. Ele recomenda a web, mas francamente, vou pedir para fazer a profunda para ver
00:05:10o que ele retorna. Ele vai me mostrar o prompt de pesquisa profunda proposto e as perguntas que ele
00:05:14está tentando responder. Então ele precisa saber sobre o Google Calendar, Meet, armadilhas do domínio de agendamento
00:05:19e, em geral, a pilha de tecnologia. Se eu aprovar isso, diremos apenas para iniciar. E se eu
00:05:25quiser editar, é muito simples de fazer. O Claude terminou a pesquisa profunda e criou um
00:05:29registro de suposições, que é essencialmente uma lista de tudo o que ele assume que você quer que aconteça para este
00:05:36projeto. Depois disso, ele terá mais perguntas para nós, onde podemos seguir por diferentes
00:05:40caminhos. Mas estas são coisas em que ele pensa: olhe, não há muitas dúvidas aqui.
00:05:44Agora você pode dar um sinal positivo e ele fará tudo isso. E isso fica meio que
00:05:48integrado ao plano. Ou você pode dizer: olha, na verdade, quero mudar a pilha tecnológica ou como
00:05:53estamos lidando com lembretes e coisas desse tipo. Mas por enquanto, vamos dizer: olha,
00:05:57isso está confirmado. E então passaremos para o que ele chama de camada
00:06:01estrutural. Sabe, todos nós amamos o termo estrutural. Isso agora foi anexado a tudo
00:06:05o que o Claude faz. Então agora estamos passando para essas perguntas estruturais. A primeira pergunta é:
00:06:09em qual conta do Google fica o seu calendário real? Para todas essas perguntas, independentemente do
00:06:13seu projeto, ele fornecerá uma série de perguntas junto com uma recomendação. Então, se você não faz ideia,
00:06:17pode ir com a recomendada. Mas francamente, como boa prática, se você não faz ideia do que o Claude está
00:06:23te dizendo sobre possíveis respostas ou o que está acontecendo, eu sugiro fortemente que
00:06:27você vá para esta outra seção e diga algo como explique isso melhor. É assim
00:06:32que você realmente melhora quando se trata de IA e construção de coisas, em vez de ser apenas um
00:06:35macaco de aceitação apertando recomendado, recomendado o tempo todo. Se não sabe, peça ao Claude
00:06:40para continuar explicando até você entender. Essa é a única maneira de realmente
00:06:44aprender, mas meio que fora do escopo deste vídeo. Então vamos com o Gmail pessoal, e eu
00:06:49vou pular para depois de ter respondido a todas essas perguntas, porque acho que você já entendeu
00:06:53como esta fase funciona. Agora, depois de responder às perguntas estruturais, entramos em algumas
00:06:58decisões cosméticas que, novamente, não mudam realmente a funcionalidade básica do aplicativo.
00:07:02Neste cenário, ele apenas lista todas elas de forma semelhante ao registro de suposições. Então você pode dizer
00:07:08que isso é aceitável e ele simplesmente avançará, ou você pode dizer: olha, mude a um,
00:07:12mude a dois, mude o que for. Eu configurei dessa forma para você acelerar esse processo.
00:07:16Agora, depois de responder a essas perguntas cosméticas, passamos para a fase dois. O Claude vai escrever
00:07:20esse arquivo plan.markdown e ele será enviado ao Codex usando o GPT 5.6 Sol. A partir daí,
00:07:27eles terão seu vai e vem por no máximo cinco rodadas, ou até chegarem a um
00:07:32veredito aceito. Então o Claude e o Codex foram e voltaram por cinco rodadas. No começo, havia 27 problemas
00:07:37levantados na primeira rodada, chegamos à quinta rodada e o problema é que ainda há alguns
00:07:43problemas. Eles não chegaram a um veredito aceito. Eu mencionei antes como nunca tinha visto isso
00:07:47acontecer antes, então estou meio feliz que aconteceu aqui. Chegamos a cinco rodadas. Eles ainda não descobriram
00:07:51tudo. Ainda há alguns problemas menores. O que você quer fazer? Bem, você tem opções.
00:07:56Você pode parar por aqui, manter como está. Pode apenas aceitar o estado de impasse ou estendê-lo
00:08:01duas rodadas. Então é isso que vamos fazer, e depois veremos o que acontece quando eles finalmente
00:08:05se entenderem. Mas é bom saber e para vocês verem que, mesmo tendo esses limites
00:08:11rígidos, por exemplo, cinco rodadas, você não fica preso a isso. Se chegar a esse ponto como nós chegamos aqui,
00:08:15você pode facilmente estender. Então, após sete rodadas, eles chegaram a um acordo, e agora ele vai
00:08:19te perguntar: quem você quer que realmente construa isso? Então, podemos fazer o Claude construir e o Codex
00:08:24dar uma olhada, ou podemos inverter, o Codex constrói e o Claude dá uma olhada. Em certas situações,
00:08:29dependendo do que estamos fazendo, ele também dará a opção de fazer uma construção em conjunto. Então, digamos
00:08:33que estivéssemos criando algo que exigisse geração de ativos ou algo como imagens do GPT para
00:08:38entrar na equação. Bem, ele também dirá algo como, ei, vamos trazer o Codex para essa parte específica
00:08:43do projeto. Mas, neste caso, vamos fazer o Claude construir. E agora ele vai
00:08:47começar a criar o que é chamado de Open Book. Assim, o Claude pôde terminar de criar a demo do calendário,
00:08:51que é o que estamos vendo aqui. Então vamos ver se realmente funciona. E depois vamos voltar e
00:08:55mergulhar de fato no que o Codex adicionou a todo esse processo. Então temos a chamada de introdução e depois uma sessão
00:09:01de trabalho. Então, se formos à chamada de introdução, poderemos ver vários horários e agendamentos diferentes
00:09:07que estão sincronizados com meu calendário do Gmail. Então, digamos que eu escolha algo para o dia 31.
00:09:12E eu escolho às 10h. Você pode adicionar meu nome, colocaremos meu e-mail. E depois clicaremos em confirmar reserva.
00:09:23E podemos ver que o e-mail nos foi enviado com um link de acesso. E também posso ver todo o meu calendário,
00:09:28também pedi que ele criasse um artefato simples, para detalhar visualmente o que o Codex adicionou a esse
00:09:33processo inteiro. Falamos sobre isso antes, aquela fase de idas e vindas onde o Claude tinha o plano e
00:09:38o Codex fez seus, você sabe, ajustes ou propostas de ajustes que se estenderam por
00:09:42sete rodadas. E começou com 27 problemas. E você pode ver que a cada rodada foi diminuindo, até que na
00:09:48sétima rodada, finalmente tivemos um veredito aprovado. E agora aqui estão algumas coisas que o Codex de fato
00:09:52chamou a atenção do Claude durante a fase de planejamento, como a restrição de reserva dupla
00:09:57não conseguir compilar coisas como o fluxo de conexão OAuth com problemas. Também há problemas de concorrência,
00:10:03onde dois reagendamentos da mesma reserva poderiam ser bem-sucedidos e por aí vai, muitos casos extremos
00:10:08relacionados. Agora, na fase de construção, o Claude implementou aquele plano melhorado que tínhamos após as
00:10:12sete rodadas. E então uma nova sessão do Codex apareceu, com memória totalmente limpa, nova janela de
00:10:17contexto, ele não tinha lido o plano. E então ele leu o código em relação à especificação real, o que foi criado
00:10:23versus o que foi realmente planejado. Então ele retornou com 23 descobertas, 19 foram aceitas e corrigidas, quatro foram
00:10:29rejeitadas. Então, aqui estão algumas das coisas que o Codex encontrou nesta fase de construção: a grade de horários se deslocava após
00:10:34cada reunião, o token de gerenciamento estava em texto simples, todos os eventos bloqueavam os horários errados.
00:10:39E, novamente, mais e mais coisas que, de novo, você poderia argumentar serem casos isolados, mas teria
00:10:44levado muito tempo para o Claude encontrá-las. Então, se o Codex não estivesse presente desde o início,
00:10:48como isso teria sido? Bem, teríamos recursos quebrados, teríamos reservas que
00:10:53existem no banco de dados e em nenhum outro lugar e assim por diante. Agora, na realidade, teria sido assim se
00:10:58dependêssemos apenas do Claude? Provavelmente no início, teríamos apenas precisado de mais algumas iterações e
00:11:03eventualmente chegaríamos a algo que provavelmente funcionasse. Mas com o Codex, encontramos muitos desses problemas na
00:11:08fase de planejamento. Então não tivemos que gastar tokens e depois gastar mais tokens depois do ocorrido. E conseguimos
00:11:14testar essas coisas com o Codex, dar uma olhada nisso com o Codex antes de passar para a produção. Resumindo,
00:11:21isso economiza muito tempo e dinheiro. Então esse é o ciclo do Claudex em ação. Se você quiser experimentar
00:11:26isso, vou colocar um link no comentário fixado. E, além disso, vejo vocês por aí.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video