스크립트
00:00:00Нельзя доверять Claude оценивать собственную работу, что является огромной проблемой, но её решает
00:00:05этот навык. Он называется Claudex Loop, и его суть проста. Вместо того чтобы возлагать на Claude
00:00:09ответственность за планирование, выполнение и оценку собственной работы, почему бы не привлечь Codex,
00:00:16чтобы он тоже изучил план и выполнение Claude и сказал: эй, это выглядит хорошо, а это нет,
00:00:22вот что, по моему мнению, стоит изменить. Ведь одна из главных проблем абсолютно любой модели
00:00:25искусственного интеллекта заключается в том, что они очень благосклонно оценивают свою собственную работу.
00:00:30Когда я спрашиваю Claude, насколько хорош созданный им план, он отвечает: эта штука просто восхитительна.
00:00:35Поэтому важно иметь такие системы, где можно подключить второй взгляд, чтобы оценить то, что построила
00:00:40первая модель, и сказать: палец вверх, палец вниз и почему. Так что сегодня я не только
00:00:44дам вам этот навык, но и разберу то, как он работает под капотом, а также мы проведем быструю демо-версию.
00:00:48Этот навык делится на четыре фазы, и предполагается, что вы вызываете его перед добавлением какой-то функции
00:00:53или при запуске абсолютно нового проекта с нуля. Общая идея заключается в следующем: что бы ни придумала
00:00:58первая модель в качестве плана или какую бы работу она ни выполнила, мы ждем, пока вторая модель
00:01:02изучит это и скажет: эй, это выглядит отлично, — прежде чем мы перейдем к серьезным шагам. Теперь,
00:01:07на первой фазе мы занимаемся разведкой. Мы фактически отправляемся в сеть, Claude собирается
00:01:10проверить, существуют ли ответы на самом деле. У нас есть возможность задействовать глубокое исследование,
00:01:15то есть встроенный динамический рабочий процесс, если мы хотим по-настоящему глубоко разобраться в получаемых ответах.
00:01:20Думайте об этом как о наборе вопросов для расширенного режима планирования, в котором мы пытаемся
00:01:25найти общий язык с Claude до того, как он создаст свой первый план. Во-вторых, именно здесь мы подключаем
00:01:28вторую модель. Это этап проверки. Итак, после того как Claude Code составляет план на основе всего,
00:01:34что мы обсудили и исследовали, он создает ваш стандартный файл plan.md.
00:01:38После этого Codex изучает план в изолированной среде только для чтения и говорит:
00:01:43эй, либо это одобрено, либо нам нужно доработать x, y и z. Затем он отправляет этот ответ
00:01:49с доработками обратно в Claude Code. Claude Code изучает его, говорит: я согласен или не согласен.
00:01:55А затем отправляет свои изменения назад. Этот цикл повторяется до пяти раз. Лично у меня
00:02:01никогда не было такого, чтобы процесс зависал на пяти итерациях или чтобы мы не достигали одобренного состояния.
00:02:06Тем не менее, я ограничил его пятью попытками; вы легко можете изменить это в настройках навыка, чтобы не застрять
00:02:11в какой-нибудь странной бесконечной петле, вечно сжигая токены. Это дает вам очень четкое
00:02:15ограничение, чтобы не оказаться в подобной ситуации. Наконец, когда Claude и Codex приходят к соглашению
00:02:20и план создан, мы переходим к фазе сборки. Теперь этот навык дает вам возможность
00:02:24поручить создание не только Claude, вы также можете запустить сборку с помощью Codex. Но какая бы модель
00:02:30ни занималась сборкой, вторая модель снова оценит созданный результат, прежде чем переходить
00:02:34к чему-либо еще. И опять же, под капотом есть множество различных переменных, которые можно настроить.
00:02:38Как я упоминал ранее, у нас есть раздел проверки, лимит которого установлен на пять. В разделе сборки,
00:02:43когда Codex проверяет то, что мы построили, я снова снизил этот показатель до двух циклов,
00:02:48просто чтобы не попадать в сценарии бесконечных циклов. И на самом деле я не сталкивался с проблемами,
00:02:52когда мне казалось: о, это нужно увеличить. Но вы можете поэкспериментировать с этим. Более того,
00:02:56вы можете пойти дальше и подключить локальную модель вместо Codex,
00:03:00если вы предпочитаете такой подход. Теперь, если вы использовали предыдущую версию навыка,
00:03:04которая называлась Grill Me Codex, изменения, на которые стоит обратить внимание в Claudex Loop,
00:03:08включают более продвинутый режим допроса. То есть он глубже прорабатывает линию вопросов. А на этапе
00:03:13выполнения мы сильнее интегрировали Codex. Так что теперь мы можем проконтролировать созданный код.
00:03:18Следующим идет само демо. Но прежде чем мы к нему перейдем,
00:03:23пару слов от спонсора сегодняшнего выпуска — меня. Я только что выпустил полностью обновленную версию
00:03:28своего мастер-класса по Claude Code на платформе Chase AI Plus, и это лучший способ пройти путь от новичка до AI-разработчика,
00:03:33особенно если у вас нет технического бэкграунда. Мы делаем упор на реальные сценарии использования. Материал
00:03:38обновляется каждую неделю. Так что если вы хотите лучше разобраться в этом безумном инструменте
00:03:42и при этом не имеете опыта в разработке программного обеспечения, этот курс для вас. Если вы хотите
00:03:47ознакомиться с ним, ссылка на него находится в закрепленном комментарии. Ну а для сегодняшней демо-версии мы воспользуемся
00:03:51Claudex Loop, чтобы воссоздать Calendee. Если вы не знаете, что такое Calendee, это веб-приложение для планирования встреч:
00:03:56вы даете людям ссылку, они видят ваш календарь, могут выбрать время, и система автоматически
00:04:00либо ссылку на Zoom, либо Google Meet. Этим пользуются многие,
00:04:05и даже платят за это деньги. Но я подумал: почему бы нам не сделать это самим и не сэкономить,
00:04:09скажем, баксов 10 в месяц или сколько там я плачу? Наверное, стоило бы знать. Итак,
00:04:13я просто вызываю слэш-команду Claudex loop и высказываю свои мысли в потоке сознания,
00:04:18примерно так: я хочу использовать Claudex loop, чтобы по сути создать нашу собственную версию Calendee.
00:04:25Прямо сейчас я бы, наверное, просто настроил использование Google Meet вместо Zoom. Но мне нужно,
00:04:32чтобы сервис был связан с моим календарем и по сути воспроизводил все основные функции Calendee. Давайте
00:04:38приступим. Сначала мы находимся на нулевом этапе, то есть в фазе исследования. Система спрашивает:
00:04:41«Эй, как именно вы хотите провести это исследование? Либо с помощью веб-поиска, который является
00:04:46стандартным для Claude и отправляет несколько субагентов, либо мы перейдем к полноценному глубокому исследованию?»
00:04:50с этим навыком у меня задан Opus. Так что, как вы знаете, с глубоким исследованием, если делать это на Fable
00:04:56и запуске команды deep research вызываются субагенты Fable, которые могут изрядно
00:05:01истощить ваши лимиты. Поэтому сейчас я настроил его так, чтобы сразу использовался Opus для вашего удобства.
00:05:05Опять же, вы можете сделать и так. Система рекомендует веб-поиск, но честно говоря, я запущу глубокое,
00:05:10просто чтобы посмотреть результаты. Мне покажут предлагаемый промпт для глубокого исследования
00:05:14и вопросы, на которые он пытается найти ответы. Ему нужно узнать о Google Calendar, Meet, подводных камнях
00:05:19в сфере планирования встреч и стеке в целом. Если меня все устраивает, мы просто говорим: «Запускай». Если нужно
00:05:25что-то отредактировать, это делается очень просто. Claude завершил глубокое исследование и создал
00:05:29реестр допущений — по сути список всего, что, по его мнению, должно быть реализовано в этом проекте.
00:05:36Затем у него появятся новые вопросы к нам, позволяющие углубиться в различные аспекты.
00:05:40Но здесь он как бы говорит: «Хм, кажется, тут особо не о чем спорить».
00:05:44Вы можете просто поставить палец вверх, и все это будет учтено. И это как бы закладывается
00:05:48в план. Либо вы можете сказать: «Слушай, вообще-то я хочу изменить стек» или «Я хочу изменить то,
00:05:53как мы работаем с напоминаниями и тому подобным». Но пока мы ответим: «Эй,
00:05:57это утверждено». И после этого мы переходим к тому, что он называет несущим
00:06:01уровнем. Знаете, мы все любим термин «несущий». Теперь его приписывают ко всему,
00:06:05что делает Claude. Итак, мы переходим к этим фундаментальным вопросам. Первый вопрос:
00:06:09в каком аккаунте Google находится ваш реальный календарь? Для всех этих вопросов, независимо от вашего
00:06:13проекта, вам будет предложен ряд вопросов и вариант ответа по умолчанию. Так что если вы ничего не понимаете,
00:06:17можно просто выбрать рекомендованный. Но откровенно говоря, лучшей практикой будет следующее: если вы не представляете,
00:06:23что именно Claude пытается вам сказать касательно возможных вариантов ответа или вообще происходящего,
00:06:27я настоятельно рекомендую заглянуть в этот дополнительный раздел и написать что-нибудь вроде «объясни это подробнее». Именно так
00:06:32вы начнете действительно разбираться в искусственном интеллекте и разработке, а не просто станете
00:06:35соглашаться со всем подряд, раз за разом нажимая на рекомендованные варианты. Если вы чего-то не знаете, просите Claude
00:06:40продолжать объяснять, пока вы не поймете. Только так вы сможете по-настоящему
00:06:44чему-то научиться, хотя это уже выходит за рамки данного видео. Поэтому мы выберем личный Gmail, и я,
00:06:49пожалуй, пропущу момент до того, как ответил на все эти вопросы, так как суть этой фазы вам уже понятна.
00:06:53После ответа на фундаментальные вопросы мы переходим к некоторым
00:06:58косметическим решениям, которые опять же не меняют базовую функциональность приложения.
00:07:02В этом сценарии они просто перечисляются аналогично реестру допущений. Вы можете либо сказать,
00:07:08что это приемлемо и продолжить работу, либо заявить: «Измени первое, измени второе, измени что угодно».
00:07:12Я настроил все именно так, чтобы вы могли немного ускорить этот процесс.
00:07:16Завершив с этими косметическими вопросами, мы переходим ко второму этапу. Claude напишет
00:07:20файл plan.markdown, после чего он будет отправлен в Codex с использованием GPT 5.6 Sol. Оттуда
00:07:27они будут вести диалог максимум пять раундов или до тех пор, пока не придут к согласованному
00:07:32вердикту. Итак, Claude и Codex спорили на протяжении пяти раундов. В начале было поднято 27 проблем,
00:07:37озвученных в первом раунде. Мы дошли до пятого раунда, и дело в том, что осталось еще несколько
00:07:43проблем. Они так и не пришли к единому вердикту. Ранее я упоминал, что со мной такого еще не случалось,
00:07:47поэтому я даже рад, что это произошло здесь. Итак, мы достигли лимита в пять раундов. Они еще не во всем разобрались.
00:07:51Остались лишь мелкие недочеты. Что же делать? Что ж, у вас есть выбор.
00:07:56Вы можете остановиться здесь и оставить все как есть. Либо принять тупиковую ситуацию или продлить процесс
00:08:01на два раунда. Именно это мы и сделаем, а потом посмотрим, что будет, когда они наконец
00:08:05придут к согласию. Но полезно знать и видеть, что даже при наличии таких жестких
00:08:11ограничений, например, в пять раундов, вы не закованы в рамки. Если вы доходите до такой точки, как здесь,
00:08:15вы можете очень легко продлить процесс. Итак, после семи раундов они пришли к соглашению, и теперь система
00:08:19спросит вас: кто именно должен это построить? Мы можем поручить сборку Claude, а Codex
00:08:24проверит результат, либо наоборот — собрать всё с помощью Codex, а Claude выполнит проверку. В определенных ситуациях,
00:08:29в зависимости от нашей задачи, вам также будет доступен вариант совместной сборки. Допустим,
00:08:33мы создаем что-то требующее генерации ассистов или подключения изображений GPT
00:08:38в рабочий процесс. В таком случае система подскажет: эй, давайте подключим Codex для этой конкретной
00:08:43части проекта. Но в нашем случае мы выберем сборку силами Claude. И теперь он начинает
00:08:47создавать то, что называется открытой книгой. Таким образом, Claude может завершить создание демо-версии календаря,
00:08:51которую мы здесь и наблюдаем. Давайте проверим, действительно ли она работает. А затем мы вернемся
00:08:55и подробно разберем, какой именно вклад Codex внес во весь этот процесс. У нас есть вводный звонок и рабочая
00:09:01сессия. Если мы перейдем к вводному звонку, то увидим множество различных вариантов времени и расписания,
00:09:07которые синхронизированы с моим календарем Gmail. Допустим, я выбираю дату на 31-е число
00:09:12и назначаю встречу на 10 утра. Можно просто ввести мое имя, указать мою электронную почту и нажать кнопку подтверждения бронирования.
00:09:23Мы видим, что на нашу почту было отправлено письмо со ссылкой для подключения. И помимо всего моего календаря,
00:09:28я также попросил создать простой артефакт, наглядно показывающий, что именно Codex добавил в
00:09:33этот процесс. Мы говорили об этом ранее: этап обсуждения, на котором у Claude был план,
00:09:38а Codex вносил свои корректировки или предлагал изменения, и это продолжалось вплоть до
00:09:42семи раундов. Все началось с 27 проблем, и с каждым раундом их количество уменьшалось, пока в седьмом
00:09:48раунде мы наконец не получили утвержденный вердикт. Вот некоторые вещи, на которые Codex обратил
00:09:52внимание Claude на этапе планирования: например, ограничение на двойное бронирование,
00:09:57из-за которого код не компилировался, или проблемы с процессом OAuth-авторизации. Возникали также трудности с параллелизмом,
00:10:03когда два запроса на перенос одной и той же брони могли одновременно завершиться успехом, и многое другое — целый ряд краевых случаев.
00:10:08Затем на этапе сборки Claude реализовал тот улучшенный план, который у нас появился после семи раундов.
00:10:12После этого у нас открылась новая сессия Codex с совершенно чистой памятью и новым контекстным окном,
00:10:17причем план она не читала. Она сопоставила написанный код с реальной спецификацией: тем, что было создано,
00:10:23и тем, что планировалось изначально. В итоге было обнаружено 23 замечания: 19 приняты и исправлены, четыре
00:10:29отклонены. Вот некоторые из проблем, выявленных Codex на этом этапе сборки: временная сетка смещалась после
00:10:34каждой встречи, токен управления хранился в открытом виде, а события блокировали неправильные часы.
00:10:39И снова множество деталей, которые можно назвать краевыми случаями, но на их самостоятельный поиск
00:10:44у Claude ушло бы много времени. Если бы Codex изначально не участвовал в процессе,
00:10:48как бы это выглядело? Ну, у нас были бы сломанные функции, бронирования, которые существуют
00:10:53только в базе данных и больше нигде, и так далее. Но действительно ли все было бы именно так, если бы мы
00:10:58полагались только на Claude? Наверное, в начале понадобилось бы чуть больше итераций, и мы бы
00:11:03в конце концов получили что-то рабочее. Но с помощью Codex мы выявили множество этих проблем еще на стадии
00:11:08планирования. Поэтому нам не пришлось тратить токены впустую, а затем сжигать их снова постфактум. Мы смогли
00:11:14протестировать всё с помощью Codex и изучить эти моменты до перехода в продакшн. В общем и целом,
00:11:21это экономит вам уйму времени и денег. Вот так выглядит цикл Claudex в действии. Если вы хотите опробовать
00:11:26это самостоятельно, я оставлю ссылку в закрепленном комментарии. А кроме того, еще увидимся!
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기