클로드의 최대 단점을 해결해 주는 오픈소스 저장소

CChase AI
컴퓨터/소프트웨어

스크립트

00:00:00Claude이 스스로의 작업을 검토하도록 믿을 수는 없으며, 이는 큰 문제이지만 이 스킬이
00:00:05그 문제를 해결합니다. 이름은 Claudex Loop이며 전제는 간단합니다. Claude에게
00:00:09계획 수립, 실행, 자체 검토까지 모두 맡기는 대신, Codex를 불러와서 함께 검토하게 합니다.
00:00:16Claude의 계획과 실행 과정을 살펴보고, 이건 좋고 저건 별로며 이런 걸 바꿔야 한다고 말해주는 식이죠.
00:00:22현재 존재하는 모든 AI 모델의 큰 문제점 중 하나는
00:00:25자신의 작업을 매우 우호적으로 평가한다는 것입니다. Claude에게 자기가 만든 계획이 얼마나 좋냐고 물어보면
00:00:30이거 정말 대단하다고 대답할 겁니다. 따라서 첫 번째 모델이 빌드한 결과물을
00:00:35제3자의 시선으로 바라보고 찬성인지 반대인지, 그리고 그 이유는 무엇인지
00:00:40말해줄 수 있는 시스템을 갖추는 것이 중요합니다. 오늘 저는 그 스킬을 제공할 뿐만 아니라
00:00:44내부 작동 원리를 분석하고 간단한 데모도 보여드리겠습니다. 이 스킬은 네 가지 단계로 나뉘며,
00:00:48어떤 기능을 추가하기 전이나 완전히 새로운 그린필드 프로젝트를 시작할 때 호출하도록 설계되었습니다.
00:00:53기본적인 아이디어는 첫 번째 모델이 어떤 계획을 세우거나 무엇을 실행하든 간에,
00:00:58두 번째 모델이 살펴보고 멋진 내용이라고 확인해 줄 때까지 큰 진행을 멈춘다는 것입니다.
00:01:02먼저 첫 번째 단계에서는 정찰을 수행합니다. 웹으로 직접 나가서
00:01:07실제로 정답이 존재하는지 Claude가 직접 정찰을 수행하게 됩니다.
00:01:10받아오는 답변을 아주 깊이 있게 파고들고 싶다면 내장된 동적 워크플로인 심층 연구(Deep Research)를 호출할 수도 있습니다.
00:01:15그후에 심층 심문(Interrogation) 단계로 들어갑니다.
00:01:20이는 향상된 계획 모드 질문 세트로 생각할 수 있으며, Claude가 첫 계획을 세우기 전에
00:01:25우리와 의견을 조율하려는 과정입니다. 두 번째로, 여기서 두 번째 모델을 불러옵니다.
00:01:28이것이 검토 단계입니다. 우리가 이야기하고 연구한 모든 것을 바탕으로 Claude Code가 계획을 세운 후,
00:01:34표준적인 plan.md 파일을 생성하게 됩니다.
00:01:38그곳으로부터 Codex가 읽기 전용 샌드박스에서 그 계획을 검토하고 다음과 같이 말합니다.
00:01:43이 계획은 승인되거나 x, y, z를 수정해야 한다고 말이죠. 그런 다음 수정 사항이 포함된 그 답변을
00:01:49Claude Code로 다시 보냅니다. Claude Code는 이를 살펴보고 동의한다 혹은 동의하지 않는다라고 말한 뒤,
00:01:55변경 사항을 다시 보냅니다. 이 루프는 최대 5번까지 계속됩니다. 지금까지
00:02:01실제로 5번에서 멈추거나 승인된 상태에 도달하지 못한 적은 없었습니다.
00:02:06다만 5번에서 멈추도록 설정해 두었는데, 스킬을 통해 이를 쉽게 변경하여 이상한 끝없는 루프에 갇히거나
00:02:11영원히 토큰을 낭비하는 상황을 방지할 수 있습니다. 이는 매우 명확한
00:02:15하드 제한을 제공하여 그런 상황에 빠지지 않도록 해줍니다. 마지막으로 Claude와 Codex가 합의에 도달하고 계획이 생성되면
00:02:20이제 빌드 단계로 넘어갑니다. 이 스킬을 사용하면 Claude에게만 빌드를 맡기는 것이 아니라
00:02:24Codex도 무언가를 구축하도록 만들 수 있습니다. 하지만 어떤 모델이 빌드하든 간에
00:02:30두 번째 모델은 무엇이든 진행하기 전에 생성된 결과물을 다시 한번 살펴보게 됩니다.
00:02:34내부적으로 조정할 수 있는 다양한 변수들이 존재합니다.
00:02:38앞서 언급했듯이 5회로 설정된 검토 섹션이 있죠. 빌드 섹션에서는
00:02:43Codex가 우리가 구축한 것을 검토하도록 할 때, 끝없는 루프 시나리오에 갇히지 않도록
00:02:48이 역시 두 번의 루프로 줄였습니다. 지금까지 이 수치를 더 높여야겠다고
00:02:52느낀 문제는 겪어보지 않았지만, 여러분도 직접 조정해 볼 수 있습니다. 나아가
00:02:56이를 더 활용해서 Codex 대신 로컬 모델을 불러오는 방식으로 접근할 수도 있습니다.
00:03:00이전 버전의 스킬인 'Grill Me Codex'를 사용하셨던 분들이라면 Claudix Loop에서 주목해야 할 변경 사항은
00:03:04더 강화된 심문 모드입니다. 질문의 수준이 더 깊어졌다는 뜻이죠.
00:03:08그리고 실행 단계에서는 Codex의 통합도가 높아졌습니다. 따라서 생성된 실제 코드에 대해
00:03:13더 확실하게 검토 의견을 받을 수 있습니다. 다음은 실제 데모입니다. 하지만 그로 넘어가기 전에,
00:03:18오늘의 스폰서인 저의 메시지가 있겠습니다. 제가 방금 완전히 업데이트된 버전을 출시했는데요,
00:03:23Chase AI Plus 내에 공개된 Claude Code 마스터클래스이며, 제로베이스에서 AI 개발자로 거듭날 수 있는
00:03:28최고의 방법입니다. 특히 비전공자이신 분들에게 적합하며 실제 유스케이스에 초점을 맞춥니다.
00:03:33이 과정은 매주 업데이트됩니다. 따라서 이 엄청난 도구를 더 능숙하게 다루고 싶지만
00:03:38소프트웨어 개발 배경이 없으신 분들이라면 바로 여러분을 위한 것입니다.
00:03:42확인해 보고 싶다면 고정 댓글에 링크가 있으니 참고하세요. 오늘 데모에서는
00:03:47Calendee를 재구현하기 위해 Claudex Loop를 사용할 것입니다. Calendee가 뭔지 모르신다면,
00:03:51사람들에게 링크를 보내 캘린더를 확인하고 시간을 선택할 수 있게 해주는 일정 예약 웹앱으로,
00:03:56Zoom 링크나 Google Meet을 자동으로 생성해 줍니다. 따라서 많은 사람들이 사용하고
00:04:00실제로 비용을 지불하는 서비스죠. 하지만 제가 생각하기엔, 이걸 직접 만들어서 매달
00:04:0510달러 정도 되는 구독료를 아끼면 어떨까 싶었습니다. 제가 얼마를 내고 있는지 정확히는 알아야겠네요.
00:04:09그래서 제가 할 일은 슬래시 Claudex loop를 입력하고,
00:04:13의식의 흐름대로 다음과 같이 말하는 것입니다. Claudex loop를 사용해 우리만의 Calendee 버전을
00:04:18기본적으로 생성하고 싶다고 말이죠.
00:04:25현재로서는 Zoom 대신 Google Meet을 사용하도록 하고 싶습니다. 하지만 내 캘린더와 연동되어
00:04:32Calendee의 모든 주요 기능을 기본적으로 재구현할 수 있기를 원합니다. 자, 한번 진행해 봅시다.
00:04:38시작할 때 우리는 연구 단계인 0단계에 있게 됩니다. 따라서 이렇게 말하죠.
00:04:41이 연구를 실제로 어떻게 진행하고 싶으신가요? 표준적인 Claude처럼 몇 개의 하위 에이전트를 내보내는 웹 검색을 할까요,
00:04:46아니면 본격적인 심층 연구를 진행할까요? 이 스킬에서는 Opus로 고정해 두었습니다.
00:04:50아시다시피 Fable에서 슬래시 deep research를 실행하면 Fable 하위 에이전트를 호출하는데,
00:04:56이게 사용량을 꽤 많이 소모할 수 있습니다. 그래서 현재로서는 사용자를 돕기 위해 곧바로 Opus를 사용하도록 해두었습니다.
00:05:01물론 여러분도 원하시는 대로 바꿀 수 있습니다. 웹 검색을 추천하지만, 솔직히 저는
00:05:05어떤 결과가 나오는지 보기 위해 심층 연구를 수행하도록 하겠습니다. 제안된 심층 연구 프롬프트와
00:05:10답변을 얻고자 하는 질문들을 보여줄 것입니다. Google Calendar, Meet, 예약 도메인
00:05:14함정, 그리고 전반적인 기술 스택에 대해 알아야 합니다. 만약 그것을 승인한다면,
00:05:19그냥 실행하라고 말하면 됩니다. 수정하고 싶다면 아주 간단하게 할 수 있습니다. Claude가 심층 연구를 마치고
00:05:25가정 원장(assumptions ledger)을 생성했습니다. 이는 기본적으로 이 프로젝트에 대해
00:05:29원한다고 가정하는 모든 것의 목록입니다. 그 후, 다양한 경로로 분기할 수 있는
00:05:36더 많은 질문들이 우리에게 주어집니다. 여기서는 의문이 별로 들지 않는 부분들이 다뤄지죠.
00:05:40여기에 엄지척을 보내면 이 모든 작업이 수행되며 계획에 녹아들게 됩니다.
00:05:44아니면 기술 스택을 바꾸고 싶다거나, 알림이나 기타 기능을 처리하는 방식을 바꾸고 싶다고 말할 수도 있습니다.
00:05:48하지만 지금은 승인한다고 말한 뒤,
00:05:53하중 지지 계층(load bearing tier)이라고 부르는 단계로 넘어갑니다.
00:05:57우리 모두 '하중 지지'라는 용어를 좋아하죠. 이제 Claude가 하는 모든 일에 이 말이 갖다 붙습니다.
00:06:01이제 그 하중 지지 질문들로 넘어가겠습니다. 첫 번째 질문은,
00:06:05실제 캘린더가 있는 Google 계정이 무엇인가요? 프로젝트가 무엇이든 간에 이 모든 질문에 대해
00:06:09추천 사항과 함께 일련의 질문을 제공합니다. 따라서 전혀 감이 안 온다면
00:06:13그냥 추천 항목으로 갈 수도 있습니다. 하지만 솔직히 모범 사례로서, 잠재적인 답변이나
00:06:17현재 진행 상황에 대해 Claude가 뭐라고 말하는지 도무지 이해할 수 없다면,
00:06:23다른 섹션으로 들어가서 '이것을 더 자세히 설명해 줘' 같은 요청을 해보시는 것을 강력히 추천합니다.
00:06:27이것이 바로 AI를 활용하고 무언가를 구축할 때 실력을 키우는 방법이며,
00:06:32그저 로봇처럼 '수락'만 누르고 추천 항목만 반복해서 누르는 사람이 되지 않는 길입니다.
00:06:35잘 모르겠다면 이해할 수 있을 때까지 Claude에게 계속 설명을 요구하세요. 그것이 실제로 실력을
00:06:40키우는 유일한 방법입니다. 물론 이 영상의 범위를 조금 벗어나긴 하지만요.
00:06:44우리는 개인용 Gmail로 진행할 것이고, 이 질문들에 모두 답한 시점으로 건너뛰겠습니다.
00:06:49이 단계가 어떻게 작동하는지 대략 감이 오실 테니까요. 자, 하중 지지 질문에 답변한 후에는
00:06:53애플리케이션의 기본 기능 자체를 바꾸지는 않는 몇 가지 꾸미기(cosmetic) 결정 사항으로 넘어갑니다.
00:06:58이 시나리오에서는 가정 원장과 유사하게 그것들을 전부 나열해 줍니다.
00:07:02따라서 이것이 수용 가능하다고 하고 그냥 진행할 수도 있고, 1번이나 2번, 또는 원하는 항목을 수정해 달라고 할 수도 있습니다.
00:07:08이 과정을 빠르게 진행할 수 있도록 이런 식으로 설정해 두었습니다.
00:07:12이러한 꾸미기 관련 질문들에 답한 후에는 2단계로 넘어갑니다.
00:07:16Claude가 plan.markdown 파일을 작성하고 나면, GPT-5.6 Sol을 사용하는 Codex로 해당 파일이 전송됩니다.
00:07:20그곳으로부터 최대 5라운드 동안 또는 승인된 판정에 도달할 때까지 의견을 주고받게 됩니다.
00:07:27Claude와 Codex가 5라운드 동안 서로 의견을 주고받았습니다. 처음에는 27개의 이슈가
00:07:321라운드에서 제기되었고, 5라운드까지 진행되었음에도 여전히 몇 가지
00:07:37문제가 남아 있습니다. 아직 승인된 판정에 도달하지 못한 것이죠.
00:07:43이런 일이 일어난 적이 없다고 앞서 말씀드렸는데, 여기서 실제로 발생해서 오히려 다행이라는 생각이 듭니다.
00:07:47아무튼 5라운드에 도달했습니다. 아직 해결을 보지 못했고
00:07:51소소한 문제들이 몇 개 남아 있네요. 어떻게 하시겠습니까? 선택지가 있습니다.
00:07:56여기서 멈추고 이대로 유지할 수도 있습니다. 교착 상태를 그대로 받아들이거나, 아니면
00:08:01그래서 두 라운드를 더 연장하고, 마침내 의견이 일치했을 때
00:08:05어떻게 되는지 지켜보겠습니다. 하지만 이렇게 5라운드 같은 엄격한 제한이 있더라도
00:08:11거기에 얽매이지 않는다는 점을 알 수 있죠. 우리처럼 이런 상황에 도달하더라도
00:08:15아주 쉽게 연장할 수 있습니다. 그렇게 7라운드가 지난 후 합의에 도달했고,
00:08:19이제 실제로 이 프로그램을 구축할 주체가 누구인지 묻게 됩니다. Claude가 구축하고
00:08:24Codex가 검토하게 하거나, 반대로 Codex가 구축하고 Claude가 검토하게 할 수 있습니다.
00:08:29작업 내용에 따라 특정 상황에서는 공동 구축 옵션을 제공하기도 합니다.
00:08:33예를 들어 에셋 생성이나 GPT 이미지 같은 기능을 도입해야 하는 무언가를 만든다고 해보죠.
00:08:38그럼 프로젝트의 이 특정 부분에는 Codex를 투입하자고 제안하기도 합니다.
00:08:43하지만 이번에는 Claude가 구축하는 방식으로 진행하겠습니다. 이제 오픈 북이라는 이름의
00:08:47프로그램을 만들기 시작할 겁니다. Claude가 지금 우리가 보고 있는 캘린더 데모 제작을
00:08:51마무리할 수 있도록 말이죠. 실제로 잘 작동하는지 확인해 본 다음,
00:08:55이 전체 과정에 Codex가 어떤 기여를 했는지 자세히 살펴보겠습니다. 소개 통화와 작업 세션이 있죠.
00:09:01소개 통화로 들어가 보면 제 Gmail 캘린더와 실제로 동기화된 다양한 시간과 일정을 볼 수 있습니다.
00:09:0731일로 날짜를 고른다고 해보죠. 오전 10시를 선택하고요.
00:09:12이름을 추가하고 이메일을 입력한 뒤 예약을 확정하면 됩니다.
00:09:23참여 링크가 포함된 이메일이 우리에게 전송된 것을 볼 수 있습니다. 제 캘린더도 확인할 수 있죠.
00:09:28또한 Codex가 이 전체 과정에 기여한 내용을 시각적으로 분석해 주는 간단한 아티팩트도 만들었습니다.
00:09:33아까 이야기했던 그 질의응답 단계 기억하시죠? Claude가 계획을 세우고
00:09:38Codex가 수정 사항을 제안하거나 조율하던 그 과정이
00:09:427라운드까지 이어졌습니다. 27개의 이슈로 시작해서 라운드가 거듭될수록 점점 줄어들었고,
00:09:48마침내 7라운드에 승인 판정을 받았습니다. 계획 단계에서 Codex가 Claude의 주의를
00:09:52환기시킨 몇 가지 사항을 살펴보면, 이중 예약 제약 조건으로는
00:09:57컴파일할 수 없다는 점이나 OAuth 연결 흐름에 문제가 생기는 것 같은 내용이 있었습니다.
00:10:03동일한 예약에 대한 두 번의 일정 변경 요청이 모두 성공할 수 있는 동시성 문제 등 엣지 케이스와 관련된
00:10:08수많은 문제들이 있었죠. 이제 구축 단계에서 Claude는 7라운드를 거쳐
00:10:12개선된 계획을 구현했습니다. 그리고 완전히 새로운 기억과 새로운 컨텍스트 윈도우를 가진
00:10:17새로운 Codex 세션이 시작되었습니다. 이 세션은 계획서를 읽지 않은 상태에서
00:10:23실제 사양과 코드를 대조해 검토했습니다. 계획된 것과 실제로 만들어진 것을 비교한 것이죠. 그리하여 23개의 발견 사항이 나왔고,
00:10:2919개는 수용되어 수정되었으며 4개는 거부되었습니다. 이 구축 단계에서 Codex가 발견한 몇 가지 문제를 보면,
00:10:34모임이 끝날 때마다 시간 그리드가 틀어지는 문제, 관리 토큰이 평문으로 노출되어 있던 문제,
00:10:39모든 이벤트가 잘못된 시간을 차단하던 문제 등이 있었습니다. 엣지 케이스라고 볼 수도 있지만,
00:10:44Claude 혼자였다면 찾아내는 데 아주 오랜 시간이 걸렸을 문제들이 계속해서 발견되었습니다.
00:10:48만약 처음부터 Codex가 참여하지 않았다면 결과물은 어땠을까요? 고장 난 기능들이 존재하고,
00:10:53데이터베이스에만 존재하고 다른 곳에는 없는 예약들이 생기는 등의 문제가 있었을 겁니다.
00:10:58물론 우리가 오직 Claude에게만 의존했더라도 실제로는 어땠을까요? 아마 처음에는 몇 번 더 반복 작업을 거쳐
00:11:03결국에는 작동하는 결과물을 만들어냈을 겁니다. 하지만 Codex와 함께함으로써 계획 단계에서
00:11:08이러한 많은 문제들을 미리 발견할 수 있었습니다. 따라서 토큰을 낭비하고 사후에 추가 토큰을 태울 필요가 없었죠.
00:11:14프로덕션에 넘어가기 전에 Codex와 함께 이러한 항목들을 테스트하고 검토할 수 있었습니다. 요약하자면,
00:11:21이는 시간과 비용을 크게 절약해 줍니다. 이것이 바로 실제로 작동하는 Claudex 루프입니다. 이를 직접 이용해보고 싶으시다면,
00:11:26고정 댓글에 링크를 남겨두겠습니다. 그럼 이만 줄이며, 다음에 또 뵙겠습니다.

핵심 요약

Claudex Loop는 Claude와 Codex를 연동하여 최대 7라운드의 상호 계획 검토와 빌드 검증을 거침으로써 AI 모델의 자가 평가 오류와 엣지 케이스 문제를 해결한다.

하이라이트

  • Claudex Loop는 첫 번째 모델인 Claude와 두 번째 모델인 Codex를 결합하여 자체 검토의 한계를 극복하는 오픈소스 저장소이다.

  • 정찰, 심층 심문, 검토 루프, 빌드의 4단계로 구성되어 있으며 계획 단계에서 최대 7라운드까지 상호 검토를 수행한다.

  • Calendee 재구현 데모에서 7라운드 동안 27개의 초기 이슈를 조율하여 이중 예약 및 동시성 문제를 사전에 해결했다.

  • 구축 단계에서 Codex는 평문으로 노출된 관리 토큰과 시간 그리드 오류 등 23개의 추가 발견 사항 중 19개를 수정했다.

  • 토큰 낭비를 방지하고 프로덕션 이전 단계에서 엣지 케이스를 차단하여 시간과 비용을 크게 절약한다.

타임라인

Claudex Loop의 개념과 작동 원리

  • Claude는 자신의 작업 결과를 우호적으로 평가하는 경향이 있어 제3자 모델인 Codex를 함께 사용해야 한다.
  • 정찰, 심층 심문, 검토, 빌드의 네 가지 단계로 구성되며 새로운 기능 추가나 그린필드 프로젝트에 활용된다.
  • 계획 검토 루프는 기본 5회로 제한되어 무한 루프와 토큰 낭비를 방지하며 필요시 연장할 수 있다.

AI 모델이 스스로 만든 계획을 지나치게 긍정적으로 평가하는 문제를 해결하기 위해 두 번째 모델인 Codex를 도입한다. 첫 단계인 정찰에서는 웹 검색이나 심층 연구를 수행하며, 이어지는 심층 심문 단계에서 사용자와 의견을 조율한다. Claude가 plan.md 파일을 생성하면 Codex가 읽기 전용 샌드박스에서 이를 검토하고 최대 5번의 수정 루프를 거친다. 빌드 단계에서도 생성된 결과물을 다시 검토하여 오류를 최소화한다.

Calendee 재구현 데모와 7라운드 검토 과정

  • Calendee를 재구현하기 위해 슬래시 명령어를 입력하고 심층 연구와 가정 원장 승인 단계를 거친다.
  • 하중 지지 질문에 답변한 후 계획 파일이 Codex로 전송되어 5라운드를 초과한 7라운드 동안 의견을 교환했다.
  • 일정 예약 웹앱의 소개 통화 화면에서 Gmail 캘린더와 연동된 시간 선택 및 예약 확정 기능을 구현했다.

일정 예약 웹앱인 Calendee를 직접 제작하는 데모를 통해 Claudex Loop의 실제 작동 과정을 보여준다. 사용자는 의식의 흐름대로 명령을 입력하고 심층 연구 프롬프트를 확인하여 승인한다. 5라운드 만에 합의에 도달하지 못하자 2라운드를 추가로 연장하여 총 7라운드 끝에 최종 계획에 합의한다. 이후 Claude가 코드를 구축하여 Gmail 캘린더와 동기화되는 예약 시스템을 완성한다.

Codex 기여도 분석과 최종 효과

  • 계획 단계에서 이중 예약 제약 조건과 동시성 문제 등 27개의 이슈가 라운드를 거치며 해결되었다.
  • 구축 단계에서는 관리 토큰 평문 노출과 시간 그리드 오류 등 23개의 발견 사항 중 19개가 수정되었다.
  • 사전 검토 과정을 통해 프로덕션 오류와 토큰 낭비를 방지하고 시간과 비용을 크게 절약한다.

아티팩트를 통해 Codex가 전체 과정에 기여한 내역을 시각적으로 분석한다. 계획 단계에서는 27개의 이슈로 시작해 7라운드 만에 승인을 받으며 이중 예약과 OAuth 흐름 등의 문제를 해결했다. 구축 단계에서는 새로운 컨텍스트를 가진 Codex가 평문 노출된 관리 토큰과 엣지 케이스 오류를 발견하여 수정했다. 이러한 상호 검토 구조는 단독 모델 사용 시 발생하는 사후 수정 비용을 없애고 개발 효율성을 극대화한다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기