스크립트
00:00:00Você não pode confiar no Claude para avaliar seu próprio trabalho, o que é um grande problema, mas que esta habilidade
00:00:05resolve. Ela se chama Claudex Loop, e a premissa é simples. Em vez de deixar o Claude responsável
00:00:09por planejar, executar e avaliar o seu próprio trabalho, por que não trazer o Codex para dar uma olhada
00:00:16também no plano e na execução do Claude e dizer, olha, isso parece bom, isso não, aqui está o que eu
00:00:22acho que você deveria mudar. Porque um dos grandes problemas com cada modelo de IA existente
00:00:25é que eles avaliam o próprio trabalho de forma muito favorável. Quando eu pergunto ao Claude quão bom é o plano que ele
00:00:30criou, ele vai dizer que essa coisa é incrível. Então é importante termos sistemas onde
00:00:35 possamos trazer um segundo par de olhos para analisar o que o primeiro modelo construiu e dizer, polegar para cima,
00:00:40polegar para baixo e o porquê. Então hoje, não vou apenas te dar a habilidade, vou detalhar como
00:00:44ela funciona por trás dos panos e faremos uma demonstração rápida. Agora, a habilidade é dividida em quatro fases,
00:00:48e a ideia é que você a invoque antes de adicionar algum tipo de recurso, ou se estiver iniciando um novo
00:00:53projeto do zero. E a ideia geral é que, independentemente do que o primeiro modelo crie como plano ou execute,
00:00:58nós esperamos até que o segundo modelo dê uma olhada e diga, olha, isso parece ótimo,
00:01:02antes de avançarmos em grandes coisas. Agora, para a primeira fase, estamos fazendo um reconhecimento. Vamos
00:01:07na verdade navegar na web, o Claude vai sondar para ver se as respostas realmente
00:01:10existem. Temos a opção de invocar a pesquisa profunda, que é o fluxo de trabalho dinâmico integrado, se quisermos
00:01:15nos aprofundar muito nas respostas que estamos recebendo. Depois disso, entramos na fase de interrogatório.
00:01:20Pense nisso como um conjunto aprimorado de perguntas do modo de planejamento, onde tentamos entrar em sintonia
00:01:25com o Claude antes que ele crie seu primeiro plano. Segundo, é aqui que trazemos o segundo
00:01:28modelo. Este é o estágio de revisão. Então o Claude Code, depois de criar um plano com base em tudo
00:01:34o que discutimos e pesquisamos, vai criar o seu plan.md padrão.
00:01:38A partir daí, o Codex vai revisar o plano em um ambiente isolado (sandbox) somente leitura, e vai dizer,
00:01:43olha, ou isso está aprovado, ou precisamos revisar x, y e z. Ele vai então enviar essa resposta
00:01:49com as revisões de volta para o Claude Code. O Claude Code vai dar uma olhada, dizer, eu concordo, não concordo,
00:01:55e então enviará suas alterações de volta. Esse loop continuará até cinco vezes. Agora, eu
00:02:01nunca vi travar exatamente em cinco vezes sem atingir um estado aprovado. No entanto, eu o faço
00:02:06parar em cinco, você pode mudar isso facilmente com a habilidade para que ele não fique preso em algum loop
00:02:11infinito estranho, queimando tokens para todo sempre. Isso te dá um limite rígido muito claro
00:02:15para você não ficar preso nessa situação. Por fim, assim que o Claude e o Codex chegam a um acordo
00:02:20e um plano é criado, nós passamos para a fase de construção. Agora, esta habilidade te dá a capacidade
00:02:24de não apenas ter o Claude construindo, você pode fazer o Codex começar a construir coisas também. Mas seja qual for o modelo
00:02:30que construir, o segundo modelo vai dar uma olhada no que foi criado antes de avançar
00:02:34com qualquer coisa. E novamente, por trás dos panos, há muitas variáveis diferentes que você pode ajustar.
00:02:38Como mencionei antes, temos a seção de revisão, que está definida como cinco. Na seção de construção,
00:02:43quando pedimos ao Codex para dar uma olhada no que construímos, reduzi isso para dois loops novamente,
00:02:48apenas para não ficarmos presos nesses cenários de loops sem fim. E eu realmente não tive
00:02:52problemas em que senti que, nossa, eu precisava aumentar isso. Mas você pode brincar com isso. Além disso,
00:02:56você pode explorar mais isso e trazer um modelo local em vez do Codex,
00:03:00se essa também for a abordagem que você deseja. Agora, se você usou a versão anterior da habilidade,
00:03:04chamada Grill Me Codex, as alterações às quais você deve prestar atenção no Claudix Loop
00:03:08são um modo de interrogatório mais aprimorado. Portanto, ele vai mais fundo na linha de questionamento. E na
00:03:13fase de execução, integramos mais o Codex. Assim, novamente, podemos ter supervisão sobre o código real
00:03:18que foi criado. Então, o próximo passo é a demonstração real. Mas antes de entrarmos nisso,
00:03:23uma rápida palavra do patrocinador de hoje, eu mesmo. Acabei de lançar uma versão completamente atualizada da minha
00:03:28masterclass do Claude Code dentro do Chase AI Plus, e é a maneira número um de ir do zero a desenvolvedor de IA,
00:03:33especialmente se você não vem de uma formação técnica, focamos em casos de uso reais. Isso é
00:03:38atualizado todas as semanas. Então, se você quer melhorar nessa ferramenta insana e
00:03:42não vem de uma formação em desenvolvimento de software, isso é para você. Se quiser
00:03:47conferir, há um link para isso no comentário fixado. Agora, para a demonstração de hoje, vamos usar
00:03:51o Claudex Loop para recriar o Calendee. Se você não sabe o que é o Calendee, é um aplicativo web de agendamento,
00:03:56você envia um link para as pessoas, elas podem ver seu calendário, escolher horários e ele cria automaticamente
00:04:00um link do Zoom ou do Google Meet. É algo que muita gente usa e realmente
00:04:05paga por isso. Mas pensei: por que não criarmos isso nós mesmos e economizarmos uns 10 dólares
00:04:09por mês, ou o que quer que eu esteja pagando? Eu deveria saber disso. O que vou fazer é
00:04:13invocar a barra inclinada Claudex Loop e apenas dar a ele um fluxo de consciência, dizendo
00:04:18algo como: quero usar o Claudex Loop para criar essencialmente nossa própria versão do Calendee.
00:04:25A partir de agora, eu provavelmente faria com que ele usasse o Google Meet em vez do Zoom. Mas eu gostaria que estivesse vinculado
00:04:32ao meu calendário e essencialmente recriasse o Calendee com todos os principais recursos. Vamos lá
00:04:38fazer isso. No começo, estamos na fase zero, que é a fase de pesquisa. Então ele diz:
00:04:41olha, como você realmente quer fazer essa pesquisa? Ou fazemos a busca na web, que é o seu
00:04:46padrão do Claude enviando alguns subagentes, ou queremos fazer uma pesquisa profunda completa? Agora,
00:04:50com esta habilidade, eu a fixei para o Opus. Como você sabe, na pesquisa profunda, se você fizer isso no Fable
00:04:56e executar apenas a barra inclinada deep research, ele chamará subagentes do Fable, que podem exagerar
00:05:01no seu uso. Então, por enquanto, configurei para usar o Opus direto, apenas para ajudar. Novamente,
00:05:05você pode fazer isso totalmente. Ele recomenda a web, mas francamente, vou pedir para fazer a profunda para ver
00:05:10o que ele retorna. Ele vai me mostrar o prompt de pesquisa profunda proposto e as perguntas que ele
00:05:14está tentando responder. Então ele precisa saber sobre o Google Calendar, Meet, armadilhas do domínio de agendamento
00:05:19e, em geral, a pilha de tecnologia. Se eu aprovar isso, diremos apenas para iniciar. E se eu
00:05:25quiser editar, é muito simples de fazer. O Claude terminou a pesquisa profunda e criou um
00:05:29registro de suposições, que é essencialmente uma lista de tudo o que ele assume que você quer que aconteça para este
00:05:36projeto. Depois disso, ele terá mais perguntas para nós, onde podemos seguir por diferentes
00:05:40caminhos. Mas estas são coisas em que ele pensa: olhe, não há muitas dúvidas aqui.
00:05:44Agora você pode dar um sinal positivo e ele fará tudo isso. E isso fica meio que
00:05:48integrado ao plano. Ou você pode dizer: olha, na verdade, quero mudar a pilha tecnológica ou como
00:05:53estamos lidando com lembretes e coisas desse tipo. Mas por enquanto, vamos dizer: olha,
00:05:57isso está confirmado. E então passaremos para o que ele chama de camada
00:06:01estrutural. Sabe, todos nós amamos o termo estrutural. Isso agora foi anexado a tudo
00:06:05o que o Claude faz. Então agora estamos passando para essas perguntas estruturais. A primeira pergunta é:
00:06:09em qual conta do Google fica o seu calendário real? Para todas essas perguntas, independentemente do
00:06:13seu projeto, ele fornecerá uma série de perguntas junto com uma recomendação. Então, se você não faz ideia,
00:06:17pode ir com a recomendada. Mas francamente, como boa prática, se você não faz ideia do que o Claude está
00:06:23te dizendo sobre possíveis respostas ou o que está acontecendo, eu sugiro fortemente que
00:06:27você vá para esta outra seção e diga algo como explique isso melhor. É assim
00:06:32que você realmente melhora quando se trata de IA e construção de coisas, em vez de ser apenas um
00:06:35macaco de aceitação apertando recomendado, recomendado o tempo todo. Se não sabe, peça ao Claude
00:06:40para continuar explicando até você entender. Essa é a única maneira de realmente
00:06:44aprender, mas meio que fora do escopo deste vídeo. Então vamos com o Gmail pessoal, e eu
00:06:49vou pular para depois de ter respondido a todas essas perguntas, porque acho que você já entendeu
00:06:53como esta fase funciona. Agora, depois de responder às perguntas estruturais, entramos em algumas
00:06:58decisões cosméticas que, novamente, não mudam realmente a funcionalidade básica do aplicativo.
00:07:02Neste cenário, ele apenas lista todas elas de forma semelhante ao registro de suposições. Então você pode dizer
00:07:08que isso é aceitável e ele simplesmente avançará, ou você pode dizer: olha, mude a um,
00:07:12mude a dois, mude o que for. Eu configurei dessa forma para você acelerar esse processo.
00:07:16Agora, depois de responder a essas perguntas cosméticas, passamos para a fase dois. O Claude vai escrever
00:07:20esse arquivo plan.markdown e ele será enviado ao Codex usando o GPT 5.6 Sol. A partir daí,
00:07:27eles terão seu vai e vem por no máximo cinco rodadas, ou até chegarem a um
00:07:32veredito aceito. Então o Claude e o Codex foram e voltaram por cinco rodadas. No começo, havia 27 problemas
00:07:37levantados na primeira rodada, chegamos à quinta rodada e o problema é que ainda há alguns
00:07:43problemas. Eles não chegaram a um veredito aceito. Eu mencionei antes como nunca tinha visto isso
00:07:47acontecer antes, então estou meio feliz que aconteceu aqui. Chegamos a cinco rodadas. Eles ainda não descobriram
00:07:51tudo. Ainda há alguns problemas menores. O que você quer fazer? Bem, você tem opções.
00:07:56Você pode parar por aqui, manter como está. Pode apenas aceitar o estado de impasse ou estendê-lo
00:08:01duas rodadas. Então é isso que vamos fazer, e depois veremos o que acontece quando eles finalmente
00:08:05se entenderem. Mas é bom saber e para vocês verem que, mesmo tendo esses limites
00:08:11rígidos, por exemplo, cinco rodadas, você não fica preso a isso. Se chegar a esse ponto como nós chegamos aqui,
00:08:15você pode facilmente estender. Então, após sete rodadas, eles chegaram a um acordo, e agora ele vai
00:08:19te perguntar: quem você quer que realmente construa isso? Então, podemos fazer o Claude construir e o Codex
00:08:24dar uma olhada, ou podemos inverter, o Codex constrói e o Claude dá uma olhada. Em certas situações,
00:08:29dependendo do que estamos fazendo, ele também dará a opção de fazer uma construção em conjunto. Então, digamos
00:08:33que estivéssemos criando algo que exigisse geração de ativos ou algo como imagens do GPT para
00:08:38entrar na equação. Bem, ele também dirá algo como, ei, vamos trazer o Codex para essa parte específica
00:08:43do projeto. Mas, neste caso, vamos fazer o Claude construir. E agora ele vai
00:08:47começar a criar o que é chamado de Open Book. Assim, o Claude pôde terminar de criar a demo do calendário,
00:08:51que é o que estamos vendo aqui. Então vamos ver se realmente funciona. E depois vamos voltar e
00:08:55mergulhar de fato no que o Codex adicionou a todo esse processo. Então temos a chamada de introdução e depois uma sessão
00:09:01de trabalho. Então, se formos à chamada de introdução, poderemos ver vários horários e agendamentos diferentes
00:09:07que estão sincronizados com meu calendário do Gmail. Então, digamos que eu escolha algo para o dia 31.
00:09:12E eu escolho às 10h. Você pode adicionar meu nome, colocaremos meu e-mail. E depois clicaremos em confirmar reserva.
00:09:23E podemos ver que o e-mail nos foi enviado com um link de acesso. E também posso ver todo o meu calendário,
00:09:28também pedi que ele criasse um artefato simples, para detalhar visualmente o que o Codex adicionou a esse
00:09:33processo inteiro. Falamos sobre isso antes, aquela fase de idas e vindas onde o Claude tinha o plano e
00:09:38o Codex fez seus, você sabe, ajustes ou propostas de ajustes que se estenderam por
00:09:42sete rodadas. E começou com 27 problemas. E você pode ver que a cada rodada foi diminuindo, até que na
00:09:48sétima rodada, finalmente tivemos um veredito aprovado. E agora aqui estão algumas coisas que o Codex de fato
00:09:52chamou a atenção do Claude durante a fase de planejamento, como a restrição de reserva dupla
00:09:57não conseguir compilar coisas como o fluxo de conexão OAuth com problemas. Também há problemas de concorrência,
00:10:03onde dois reagendamentos da mesma reserva poderiam ser bem-sucedidos e por aí vai, muitos casos extremos
00:10:08relacionados. Agora, na fase de construção, o Claude implementou aquele plano melhorado que tínhamos após as
00:10:12sete rodadas. E então uma nova sessão do Codex apareceu, com memória totalmente limpa, nova janela de
00:10:17contexto, ele não tinha lido o plano. E então ele leu o código em relação à especificação real, o que foi criado
00:10:23versus o que foi realmente planejado. Então ele retornou com 23 descobertas, 19 foram aceitas e corrigidas, quatro foram
00:10:29rejeitadas. Então, aqui estão algumas das coisas que o Codex encontrou nesta fase de construção: a grade de horários se deslocava após
00:10:34cada reunião, o token de gerenciamento estava em texto simples, todos os eventos bloqueavam os horários errados.
00:10:39E, novamente, mais e mais coisas que, de novo, você poderia argumentar serem casos isolados, mas teria
00:10:44levado muito tempo para o Claude encontrá-las. Então, se o Codex não estivesse presente desde o início,
00:10:48como isso teria sido? Bem, teríamos recursos quebrados, teríamos reservas que
00:10:53existem no banco de dados e em nenhum outro lugar e assim por diante. Agora, na realidade, teria sido assim se
00:10:58dependêssemos apenas do Claude? Provavelmente no início, teríamos apenas precisado de mais algumas iterações e
00:11:03eventualmente chegaríamos a algo que provavelmente funcionasse. Mas com o Codex, encontramos muitos desses problemas na
00:11:08fase de planejamento. Então não tivemos que gastar tokens e depois gastar mais tokens depois do ocorrido. E conseguimos
00:11:14testar essas coisas com o Codex, dar uma olhada nisso com o Codex antes de passar para a produção. Resumindo,
00:11:21isso economiza muito tempo e dinheiro. Então esse é o ciclo do Claudex em ação. Se você quiser experimentar
00:11:26isso, vou colocar um link no comentário fixado. E, além disso, vejo vocês por aí.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기