건틀렛 루프의 치명적인 결함... 이 클로드 스킬이 해결했습니다

AAI LABS
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00최근 엄청난 주목을 받고 있는 루프 유형이 하나 있는데, 바로 건틀릿 루프라고 불리는 것입니다.
00:00:04이 루프는 사람들이 실제로 거대한 앱이나 제대로 된 고품질 게임을 단 한 번에 구축할 수 있게 해줍니다.
00:00:10예를 들어, 저희가 거대한 제품 제작을 맡겼더니 1시간 넘게 걸리긴 했지만 버그 하나 없이 작업을 완료했습니다.
00:00:16그리고 그 모든 과정의 기반이 되는 프롬프트는 여러분이 예상하는 것만큼 복잡하지도 않습니다.
00:00:20하지만 그게 다들 입 모아 얘기하는 부분이죠.
00:00:22그들이 말해주지 않는 것은 이 루프에 두 가지 치명적인 문제가 있다는 점이며, 바로 그 문제들 때문에 게임을 만드는 데는 괜찮지만
00:00:28실제 프로젝트에는 사용할 수 없는 것입니다.
00:00:31따라서 이를 해결하려면 완전히 새로운 기술이 필요하다고 생각하겠지만, 전혀 그렇지 않습니다. 해결책은 이미 예상치 못한 방식으로 개발되어 배포되었으니까요.
00:00:38처음 오신 분들이라면 환영합니다.
00:00:40저희는 소프트웨어 회사이며, 이 채널은 AI를 활용해 비즈니스를 최적화하는 방법을 알려드리는 AI 랩스입니다.
00:00:45만약 여러분만의 비즈니스가 없다면, 이 기술을 활용해 다른 사람의 비즈니스를 최적화해주고 수익을 얻을 수도 있습니다.
00:00:50이번 영상에서는 해당 루프가 무엇인지, 그 두 가지 문제는 무엇이며 어떻게 이미 해결되었는지 살펴보겠습니다.
00:00:55자, 만약 이미 건틀릿 루프가 무엇인지 잘 알고 계신다면 다음 섹션으로 건너뛰세요. 이 부분은 그냥 배경 지식이니까요.
00:01:00하지만 건틀릿 루프를 살펴보기 전에, 먼저 '루프'가 무엇인지 알아야 합니다.
00:01:04루프가 도입되기 전에는 클로드(Claude)로 뭔가를 만들 때 여러분이 직접 검토해야 했습니다.
00:01:07프롬프트를 보내고, 결과가 돌아오면 살펴보고, 무엇이 잘못되었는지 알려주고, 제대로 될 때까지 이 과정을 계속 반복하는 식이었죠.
00:01:13루프란 더 이상 여러분이 그런 식으로 티키타카를 주고받지 않는 상태를 말합니다.
00:01:16에이전트에게 목표와 도달해야 할 기준만 주면, 목표에 도달할 때까지 스스로 작업물을 계속 검토하는 것입니다.
00:01:21여러분은 마지막 결과물만 확인하면 됩니다.
00:01:23건틀릿 루프는 최근 큰 인기를 끌고 있는 새로운 유형의 루프입니다.
00:01:27사람들은 단 하나의 프롬프트만으로 게임, 3D 월드, 완전한 웹사이트를 제작하는 데 이를 사용해 왔습니다.
00:01:32하지만 그 이면의 원리는 결과물만큼 거창하지 않습니다. 전체 방식이 고작 세 줄짜리 프롬프트에 불과하며, 그것이 루프를 작동시키기 때문입니다.
00:01:40이 모든 것은 맷 슈머(Matt Schumer)가 X(트위터)에 1인칭 슈팅 게임 데모를 올리면서 클로드가 기존 에셋을 전혀 사용하지 않고 단일 프롬프트로 이를 제작했다고 밝히면서 시작되었습니다.
00:01:50이 게시물이 큰 인기를 끌었던 이유는, AI 모델이 단 하나의 프롬프트로 완벽하게 플레이 가능한 게임을 만들어내는 것이 사람들이 생각했던 이 모델들의 한계를 뛰어넘었기 때문입니다.
00:01:57며칠 후, 그는 실제로 게임을 구축한 방법을 공개했고 이 방법에 '건틀릿 루프'라는 이름도 붙여주었습니다.
00:02:03그는 에이전트에게 '좋은 게임'을 만들라고 지시할 수도 있었겠지만, '좋다'는 기준은 AI가 스스로 결정하는 것이며 스스로 기준을 정하는 에이전트는 대충 만든 작업물도 통과시키기 마련입니다.
00:02:11그래서 그는 그 대신 작업물을 비교할 실제 게임 기준을 제시했습니다.
00:02:14일단 이 방법이 세상에 알려지자, 다른 사람들도 직접 실행해보기 시작했습니다.
00:02:17오픈에이아이(OpenAI)의 창립 멤버 중 한 명인 안드레이 카파시(Andrey Karpathy)는 이러한 결과가 중요한 이유에 대해, 이처럼 고품질의 작업은 과거에는 소요되는 시간에 비해 얻는 가치가 턱없이 부족해 제작할 가치가 없었기 때문이라고 말했습니다.
00:02:28하지만 AI 모델에는 그런 한계가 없기 때문에, 사람들은 모델의 한계를 최대한으로 밀어붙이는 다양한 아이디어를 거침없이 실험해 보았습니다.
00:02:34더 자세히 알아보기 전에, 저희 채널을 구독해주시고 좋아요 버튼을 눌러주시면 정말 감사하겠습니다.
00:02:39이러한 작은 지지가 저희에게는 아주 큰 힘이 됩니다.
00:02:43이제 이 루프가 내부적으로 어떻게 작동하는지 실제로 알아봅시다.
00:02:46슈머는 자신이 사용한 정확한 프롬프트를 공개했는데, 전체 게임을 구축한 것은 단 세 줄에 불과했습니다.
00:02:51각 줄은 빌드의 서로 다른 부분을 담당하며, 여러분이 무엇을 만들든 똑같은 세 줄을 작성할 수 있을 만큼 단순합니다.
00:02:57첫 번째 줄은 무엇을 만들고 있는지 정의합니다.
00:03:00슈머의 경우 1인칭 슈팅 게임을 만드는 것이었죠.
00:03:02그리고 해당 줄의 나머지 절반은 도달해야 하는 품질 수준을 정의하는데, 바로 최근 콜 오브 듀티(Call of Duty) 게임 수준이었습니다.
00:03:09그는 업계에서 가장 예산이 많이 투입되는 게임을 일컫는 AAA급 품질을 요구했으며, 텍스처부터 물리 엔진에 이르기까지 문자 그대로 모든 면에서 완벽해야 한다고 명시했습니다.
00:03:18두 번째 줄은 어떻게 구축해야 하는가에 대한 내용으로, 작업이 어떻게 나뉘는지 결정하는 부분입니다.
00:03:23메인 에이전트에게 목표를 스스로 더 작은 부분들로 쪼개고 각 부분을 개별 하위 에이전트에게 맡기도록 지시합니다.
00:03:28하위 에이전트가 뭔지 모르시는 분들을 위해 설명하자면, 메인 에이전트가 생성하는 별도의 에이전트들로 각각 다른 에이전트들이 무엇을 하는지 보지 못한 채 저마다 자신의 메모리 안에서 작은 작업을 수행합니다.
00:03:38그리고 프롬프트에는 이 점이 매우 구체적으로 명시되어 있습니다.
00:03:40여러분에게 번거로움이 전가되지 않도록 에이전트가 직접 작업을 쪼개야 하는 것이죠.
00:03:44하지만 에이전트는 여전히 자신이 올바른 방향으로 가고 있는지 알아야 하며, 그것이 바로 비평가(critic)가 존재하는 이유입니다.
00:03:49프롬프트는 메인 에이전트가 생성하는 각 에이전트에 루프를 설정하고, 각 에이전트의 작업물을 검토하기 위해 별도의 하위 에이전트를 붙입니다.
00:03:56그 검토용 하위 에이전트를 비평가라고 부릅니다.
00:03:58비평가의 유일한 임무는 작업물을 검토하는 것이며, 수준이 충분하지 않다면 만족스러워질 때까지 수정하도록 빌더 에이전트에게 다시 돌려보냅니다.
00:04:04비평가는 스스로 아무것도 만들지 않으며, 이전 작업에 대한 기억이 전혀 없는 상태로 시작하기 때문에 누가 작업을 만들었는지 혹은 이 부분이 이미 몇 번이나 퇴짜를 맞았는지 알지 못합니다.
00:04:13단지 결과물을 평가할 때 무자비하고 비판적일 정도로 정직해야 할 뿐입니다.
00:04:16세 번째 줄은 최종 결과물이 일치해야 하는 실제 품질 수준이며, 이것이 비평가에게 언제 멈춰도 되는지 알려주는 역할을 합니다.
00:04:23슈머는 에이전트가 제작 중인 게임이 지향해야 할 기준으로 콜 오브 듀티를 설정했습니다.
00:04:28그의 지시는 비평가가 문자 그대로 두 개를 블라인드 방식으로 비교하여 어느 쪽이 더 나아 보이는지 말해야 한다는 것이었습니다.
00:04:33여기서 블라인드란 어떤 것이 클로드가 만든 것인지 알려주지 않는다는 뜻으로, 어느 쪽이 실제 제품이고 어느 쪽이 클로드가 디자인한 게임인지 모르는 상태에서 그중 더 나은 게임을 고르게 만드는 것입니다.
00:04:43그리고 해당 프롬프트의 끝부분에는 알아둘 만한 단어가 하나 더 있는데, 바로 울트라코드(ultracode)입니다.
00:04:47이것은 클로드 코드(Claude Code) 내의 키워드이며, 이를 입력하면 이 작업이 동적 워크플로로 전환됩니다.
00:04:52이는 소수의 에이전트에만 작업을 나누는 대신, 하위 에이전트 함대 전체를 한 번에 실행하는 기능입니다.
00:04:58그리고 이런 식으로 작업을 실행할 때, 우리는 이를 실제로 그래프라고 부릅니다.
00:05:01그래프가 뭔지 모르시는 분들을 위해 설명하자면, 기본적으로 루프의 고급 형태라고 할 수 있습니다
00:05:05단일 에이전트가 혼자 루프를 돌기보다는, 여러 서로 다른 하위 에이전트들이 루프를 도는 방식이죠.
00:05:09이것이 바로 건틀릿 루프가 하고 있는 일입니다.
00:05:12건틀릿 루프라는 이름으로 인기를 끌기 훨씬 전부터 저희의 이전 영상들을 시청해 오셨다면, 이런 내용을 이미 다뤘다는 것을 아실 겁니다.
00:05:18건틀릿 루프가 그리는 것은 다이아몬드 형태의 그래프입니다. 상단의 하나의 작업이 측면에서 동시에 실행되는 여러 하위 에이전트로 나뉘고,
00:05:26다시 하나의 에이전트로 좁혀져 그들이 찾아낸 모든 것을 하나의 답변으로 취합하는 방식이죠.
00:05:31따라서 건틀릿 루프라는 개념 자체가 여러분에게 새로운 것은 아니겠지만, 여러분이 모르는 사실은 이 루프에 상당한 문제가 있다는 점입니다.
00:05:38하지만 어떤 문제들이 있는지 이야기하기 전에, 스폰서 광고 먼저 듣고 가겠습니다.
00:05:42코딩을 배우고 있다면, 포트폴리오 프로젝트를 정말 돋보이게 만들어주는 것은 바로 실제 데이터입니다.
00:05:47대부분의 초보자 프로젝트는 가짜 샘플 데이터로 구동되죠.
00:05:49함정은 실제 데이터를 얻는다는 것이 보통 웹 스크래핑을 의미하며, 이는 누구도 원치 않는 골칫거리라는 점입니다.
00:05:54거기서 바로 SerpApi가 등장합니다.
00:05:55단 한 번의 API 호출로 Google, YouTube 등에서 가져온 깔끔하고 구조화된 검색 결과를 제공해주며,
00:06:00캡차나 프록시 같은 스크래핑 관련 골칫거리들을 알아서 다 처리해 줍니다.
00:06:04여러분은 수백만 개의 실제 데이터 포인트를 깔끔한 JSON 형태로 얻고, 개발하면서 데이터 다루는 기술을 연마할 수 있습니다.
00:06:09또 하나의 뻔한 할 일 목록(to-do list) 클론 프로젝트 대신, Google 쇼핑 API를 이용한 실시간 가격 추적기를 만들거나
00:06:14Google 트렌드 API로 구동되는 트렌드 대시보드를 만들어 실시간으로 상승하는 트렌드를 보여줄 수 있습니다.
00:06:19그것이 튜토리얼처럼 보이는 프로젝트와 채용으로 이어지는 프로젝트의 차이입니다.
00:06:24250개의 무료 크레딧으로 시작할 수 있습니다. 설명란의 링크를 클릭하시거나 화면의 QR 코드를 스캔해 보세요.
00:06:30이번 영상의 스폰서인 SerpApi에 큰 감사를 표합니다.
00:06:33X나 유튜브에서 수많은 사람들이 건틀렛 루프를 사용해 프로젝트 전체를 단번에 완성하고 있지만,
00:06:38그 이면의 문제점들을 깨닫지 못하는 사람들이 많습니다.
00:06:40크게 두 가지 문제가 있습니다.
00:06:42첫째는 메인 에이전트가 검토 작업을 전적으로 책임진다는 점입니다.
00:06:45비평가들을 생성하고 그들의 지침을 작성하는 방식을 혼자서 관리하죠.
00:06:49결과적으로 여러분은 에이전트나, 비평가들에게 판단 프롬프트가 전달되는 방식을 통제할 수 없습니다.
00:06:55여러분이 준 것이라곤 비교할 게임 하나뿐이고, 그 이후로는 프롬프트에 그저
00:06:59아주 가혹한 비평가가 되어 시각적으로 검토하라고 적혀 있을 뿐입니다.
00:07:01앞서 채널에서도 말했듯, 검토 과정은 에이전트가 알아서 검증하게 내버려두는 것보다 훨씬 구체적으로 설정해야 합니다.
00:07:08즉, 에이전트가 혼자서 모든 것을 파악하고 있다는 뜻이며, 현재 작업하고 있는 규모를 감안할 때
00:07:14장기적으로 무엇이 문제를 일으켰는지 여러분이 알아내지 못할 것입니다.
00:07:17두 번째 문제는 이 방법이 여러분에게 아예 통할지 여부를 결정하는 핵심 문제입니다.
00:07:21해당 프롬프트의 품질 기준은 이미 존재하는 제품이기 때문입니다.
00:07:24슈머는 이를 이미 출시된 게임인 콜 오브 듀티로 설정했기에, 비평가는 '좋다'는 의미를 스스로 정의하는 대신 작업물을 비교할 실제 대상이 있었습니다.
00:07:32이것이 바로 이 방법이 성공한 유일한 이유입니다.
00:07:34그리고 게임을 만들 때는 항상 비교할 대상이 존재하므로 이는 문제가 되지 않습니다.
00:07:38여러분이 제작 중인 랜딩 페이지나 3D 월드도 마찬가지입니다.
00:07:42무엇을 만들고 싶은지 말하면, 비평가가 그것을 살펴보고 둘 중 어느 것이 더 나은지 고릅니다.
00:07:46하지만 완전히 새로운 것을 만들 때는 그 기준을 세워줄 기존 앱이 존재하지 않습니다.
00:07:51비평가는 기준을 지어내고 그에 맞춰 작업물을 통과시키기 시작합니다.
00:07:54그러다 진행 방향이 원하던 바가 아니라는 것을 깨달았을 때는, 이미 엄청난 시간과 토큰을 낭비한 뒤죠.
00:07:59결국 에이전트가 스스로 지어낸 기준에 맞춰 한 번에 뚝딱 만들어진 기능 더미만 떠안게 됩니다.
00:08:05작업을 비교할 대상이 아무것도 없는 상황은 예외가 아니라 오히려 일반적인 경우입니다.
00:08:09만약 여러분의 사업이 구동되는 과금 규칙을 만들고 있다면, 비평가에게 검토를 맡길 만한 완성된 기존 제품이란 존재하지 않습니다.
00:08:15따라서 건틀릿 루프는 모방할 만한 무언가가 충분히 가까이 있을 때는 작동하지만, 그렇지 않은 순간 바로 무너집니다.
00:08:21이에 대한 해결책이 있으며, 두 부분으로 나뉩니다.
00:08:23첫째는 검증으로, 에이전트가 검증 방식을 지어내게 내버려두는 대신 우리가 직접 검증 계획을 적절히 세우는 것입니다. 이는 그래프 엔지니어링 영상에서 다뤘습니다.
00:08:30둘째는 루프에 구체적인 요구사항을 부여하여 여러분이 원하는 방향에서 벗어나지 않도록 하는 것입니다.
00:08:35그리고 바로 이때 '웨이파인더(Wayfinder)'라는 기술이 필요합니다.
00:08:37웨이파인더는 맷 포콕(Matt Pocock)이 만들었습니다.
00:08:39그는 설치해서 사용할 수 있는 다양한 스킬 세트를 공개한 소프트웨어 개발자인데, 각각은 서로 다른 작업용으로 만들어졌습니다.
00:08:46웨이파인더는 그의 집중적인 기획 스킬로, 본인의 말에 따르면 AI가 존재하기 전 개발자 시절에 배웠던 업무 기획의 기초를 바탕으로 만들어졌다고 합니다.
00:08:54그리고 코딩에만 국한되어 있지도 않습니다.
00:08:56기획이 필요한 그 어떤 일에도 사용할 수 있죠.
00:08:59이 스킬이 존재하게 된 이유는 아마 여러분도 이미 겪어보셨을 문제 때문입니다.
00:09:03에이전트와 함께 큰 무언가를 기획할 때 목적지는 명확하지만, 그곳에 도달하는 방법은 불명확합니다.
00:09:08그리고 그 사이의 구간을 포콕은 '안개(fog)'라고 부릅니다.
00:09:11에이전트는 자신이 안개 속 에 있다는 사실을 절대 알려주지 않습니다.
00:09:13자신의 추측으로 빈틈을 채우고는 마치 모든 것이 결정된 것처럼 기획을 이어갑니다.
00:09:18그래서 결과물로 받아보게 되는 것은 중간중간 지어낸 부품들이 들어간, 완성된 것처럼 보이는 계획서입니다.
00:09:22그것을 바탕으로 지도를 만들어냅니다.
00:09:23아직 내려야 할 모든 결정들이 각각의 질문으로 그 지도에 올라가며, 그 질문들은 두 개의 그룹으로 나뉩니다.
00:09:30의존하는 모든 것들이 이미 결정되었기 때문에 지금 바로 해결할 수 있는 것들이 있고,
00:09:35아직 살펴보지 않은 무언가 때문에 발목이 잡혀 여전히 안개 속에 있는 것들이 있습니다.
00:09:39그리고 바로 이 부분이 우리에게 중요한 점입니다.
00:09:41웨이파인더는 안개를 만나면 짐작으로 때워 넘기지 않습니다.
00:09:43에이전트를 보내 안개를 걷어내게 하는데, 이는 조사를 통해 수행될 수도 있고,
00:09:47보고 피드백할 대략적인 무언가를 만들거나, 서비스를 직접 가입해 보고 판단하는 등의 현실 세계의 작업으로 수행될 수도 있습니다.
00:09:54이러한 것들은 각각 개별적으로 처리되며, 일단 해결되면 그 답은 다시 지도에 반영되어 그것에 가로막혀 있던 다른 작업들을 진행할 수 있게 열어줍니다.
00:10:01안개가 완전히 걷힐 때까지 질문 하나하나를 거치며 지도를 완성해 나가는 것입니다.
00:10:04그렇게 남게 되는 것은 근거와 함께 기록된 모든 결정 사항들입니다.
00:10:09그리고 웨이파인더는 이 모든 것을 단 하나의 스펙(명세서)으로 변환하는데, 이는 기본적으로 무엇을 왜 만들고 있는지 정리해 주는 단 하나의 문서입니다.
00:10:15이것이 바로 웨이파인더를 건틀릿 루프의 해결책으로 만들어 주는 이유입니다. '콜 오브 듀티'가 게임의 기준점이 되어 주었던 것처럼 말이죠.
00:10:21이 스펙이 똑같은 기준점이 되어, 만들고자 하는 대상이 완료되었다고 볼 수 있는 지점을 검증하는 수단이 됩니다.
00:10:27이 스펙은 앞서 이야기했던 기획상의 안개 문제를 정확하게 해소해 주는 핵심입니다.
00:10:32그 안에 담긴 모든 결정은 대충 짐작한 것이 아니라 실제로 확정된 것이기 때문에,
00:10:35우리 자신의 비즈니스를 위한 결제 규칙이나 참고할 모델이 없는 그 어떤 것을 만들 때에도,
00:10:40비평가 에이전트는 스스로 기준을 지어내는 대신 견고한 기반 위에서 작업을 수행할 수 있게 됩니다.
00:10:44이것이 실제로 어떻게 작동하는지 보여드리기 위해 이 HR 시스템을 예로 들어보겠습니다.
00:10:49사람들은 휴가 신청이나 고충 제기 등을 위해 이를 사용할 수 있습니다.
00:10:52자, 원본 웨이파인더를 설치하고 싶다면 아래의 GitHub 링크를 통해 설치하실 수 있습니다.
00:10:56GitHub 저장소에 Claude Code 안에서 실행할 수 있는 설치 명령어가 있습니다.
00:11:01하지만 원본 스킬에는 한 가지 문제가 있습니다.
00:11:03웨이파인더는 완성된 스펙 작성까지 전 과정을 이끌어가도록 만들어져 있어서 기획 방식이 매우 광범위합니다.
00:11:09하지만 우리가 원하던 것은 그게 아니었습니다. 우리는 명확성을 얻는 부분만 원했고,
00:11:13완성된 계획 외에는 아무것도 남지 않기를 원했습니다.
00:11:16원본 웨이파인더 스킬을 실행하면 질문 세션 동안 내린 모든 결정을 가져와서
00:11:21각각을 에이전트가 나중에 참조할 수 있는 개별 요구사항 파일로 만듭니다.
00:11:26그건 무엇을 만들지 정의해 주었지만, 우리가 원했던 것은 에이전트가 스스로를 검증할 수 있는 열쇠였습니다.
00:11:31그래서 우리는 클로드에게 스킬을 수정해 달라고 요청하여, 모든 결정마다 별도의 파일을 작성하는 대신
00:11:36그러한 결정들을 에이전트가 계속해서 대조해 볼 수 있는 단 하나의 정답 키(Answer Key)로 변환하도록 했습니다.
00:11:41원래의 주요 부분은 유지하면서 나머지 부분을 다른 목표에 맞게 다듬어 스킬을 완전히 다시 작성한 것입니다.
00:11:47그렇게 완성된 것은 훨씬 더 단순한 버전으로, 원본이 만들어내던 개별 티켓들 대신
00:11:51지도와 정답 키라는 단 두 개의 파일만 작성합니다.
00:11:55하지만 또 다른 흥미로운 점이 있습니다. 웨이파인더 스킬은 혼자서 작동하지 않습니다.
00:11:59맷 포콕의 다른 스킬들도 호출하지만, 우리 버전에서는 그 수도 줄였습니다.
00:12:03이 세 가지 스킬만 있으면 되며, 이 역시 아래의 GitHub 링크에서 다운로드할 수 있습니다.
00:12:07예를 들어, 웨이파인더 스킬은 기획 과정의 질문 단계에 Grill.me를 사용합니다.
00:12:12사용하기 위해 클로드 코드를 열고 웨이파인더 명령어를 실행했습니다.
00:12:15에이전트가 혼자서는 시작하지 않는 그런 스킬 중 하나이기 때문입니다.
00:12:18그런 다음 우리가 원하던 것, 즉 HR 시스템에 대해 알려주었습니다.
00:12:21그러자 질문을 시작했습니다.
00:12:23앱이 실제로 누구를 위한 것인지, 무엇이 반드시 포함되어야 하고 무엇은 제외되어야 하는지 물었고,
00:12:27이어서 완료된 상태란 어떤 모습이어야 하는지, 사람들이 사용하기 시작했을 때 무엇이 잘못될 수 있는지 물었습니다.
00:12:31질문 34개로 끝난 긴 문답 과정이었습니다.
00:12:34모든 질문에 답하고 나자 인터뷰를 종료하고 .wayfinder 폴더 안에 두 개의 파일을 작성했습니다.
00:12:39첫 번째는 지도 파일로, 우리가 내린 모든 결정과
00:12:42각각의 이유, 그리고 완성된 결과물이 어떤 모습이어야 하는지를 담고 있습니다.
00:12:46두 번째는 정답 키인데, 그것은 오직 검증 항목들로만 이루어져 있으며
00:12:49모든 줄이 통과(pass) 또는 실패(fail) 둘 중 하나로 판정됩니다.
00:12:52따라서 실제로 건틀릿 루프를 시작하기 위해 프롬프트가 필요했습니다.
00:12:55맷이 게시한 그대로의 프롬프트를 복사해서 클로드에게 전달했습니다.
00:12:58그런 다음 우리가 구축 중인 앱에 맞춰 그 프롬프트를 다시 작성해 달라고 요청하면 되는데,
00:13:01우리 경우 그것은 HR 시스템이었습니다.
00:13:03유일하게 바꾸는 부분은 무엇을 기준으로 측정할인가입니다.
00:13:06게임 대신 진실의 원천(Source of truth)이 기획 과정에서 나온 .wayfinder 폴더이며,
00:13:10모든 것이 그 안에 있는 내용에 따라 검증된다고 알려줍니다.
00:13:13원본에서 '콜 오브 듀티'가 작동했던 방식과 정확히 같습니다.
00:13:16그러면 클로드는 우리 앱에 딱 맞게 작성된 동일한 건틀릿 루프 형식으로 전체 내용을 돌려줍니다.
00:13:20그 이후부터는 원본과 똑같은 방식으로 실행되었습니다.
00:13:23하위 에이전트들을 기획하되, 이번에는 모든 것을 대조해 볼 수 있는 정답 키가 있다는 점이 달랐습니다.
00:13:27'대충 비슷한 것'이나 '지름길'은 없다고 에이전트에게 단단히 일러두었습니다.
00:13:30먼저 무엇을 빌드할지 기획한 다음, 설치해야 할 도구를 기획하고,
00:13:34에이전트들이 단단한 기반 위에 구축할 수 있도록 기초 작업을 기획했습니다.
00:13:37그 후, 시스템의 서로 다른 파트를 담당할 많은 에이전트를 한꺼번에 실행했습니다.
00:13:42빌드에는 1시간 33분이 소요되었고, 세션 한도의 약 40%를 소모했습니다.
00:13:47그리고 맥스 플랜 대신 API로 실행했다면
00:13:50동일한 빌드 비용으로 약 116달러가 들었을 텐데, 이는 상당한 금액입니다.
00:13:54하지만 반대편 결과로 나온 것은 우리가 기획했던 그대로의 앱이었습니다.
00:13:58우리가 원했던 모든 기능이 앱에서 정상적으로 작동했으며,
00:14:00약간의 이슈는 있었지만 전반적으로 우리가 필요로 했던 구현 형태에 가장 가까웠습니다.
00:14:05이번 작업을 위해 만든 스킬과 기타 모든 리소스는
00:14:09저희 커뮤니티인 AI Labs Pro에서 이용하실 수 있습니다.
00:14:12그러니 저희 활동에서 가치를 느끼셨고 채널을 지원하고 싶으시다면
00:14:15그것이 가장 좋은 방법입니다.
00:14:17링크는 설명란에 있습니다.
00:14:18이것으로 이번 영상은 끝마치겠습니다.
00:14:20채널을 지원하고 이와 같은 영상을 계속 만드는 데 도움을 주고 싶으시다면
00:14:24아래의 슈퍼 땡스(Super Thanks) 버튼을 통해 그렇게 하실 수 있습니다.
00:14:26늘 시청해 주셔서 감사드리며, 다음 영상에서 뵙겠습니다.

핵심 요약

건틀릿 루프는 비교할 기존 대상이 없을 때 스스로 기준을 지어내는 치명적 결함이 있으며, 웨이파인더 스킬로 명확한 정답 키를 제공해야만 실제 프로젝트에 활용할 수 있다.

하이라이트

  • 건틀릿 루프는 단 하나의 프롬프트만으로 게임이나 3D 월드, 웹사이트 전체를 구축하는 최신 에이전트 루프 방식이다.

  • 건틀릿 루프는 명확한 비교 대상이 존재할 때만 작동하며, 새로운 비즈니스 로직처럼 기준이 없는 경우에는 에이전트가 스스로 기준을 지어내어 실패하게 된다.

  • 맷 포콕이 개발한 웨이파인더 스킬은 기획 과정에서 발생하는 안개 구간을 제거하고 정답 키와 지도 파일을 생성하여 이 문제를 해결한다.

  • HR 시스템 구축 테스트에서 웨이파인더와 결합된 건틀릿 루프는 1시간 33분이 소요되었으며, API 실행 시 116달러의 비용이 발생했다.

  • 수정된 웨이파인더 스킬은 질문 세션을 거쳐 에이전트가 지속적으로 대조해 볼 수 있는 단 하나의 정답 키 파일로 변환한다.

타임라인

건틀릿 루프의 개념과 작동 원리

  • 건틀릿 루프는 사용자의 지속적인 개입 없이 에이전트가 스스로 작업물을 검토하며 고품질의 결과물을 만들어낸다.
  • 이 방식은 단 세 줄짜리 프롬프트로 구성되며 빌더 에이전트와 비평가 에이전트 간의 블라인드 비교 방식으로 작동한다.
  • 울트라코드는 하위 에이전트 함대 전체를 다이아몬드 형태의 그래프로 동시에 실행하는 동적 워크플로 기능이다.

건틀릿 루프는 맷 슈머가 1인칭 슈팅 게임을 단일 프롬프트로 제작하면서 대중화되었다. 프롬프트의 첫 번째 줄은 목표와 콜 오브 듀티 수준의 AAA급 품질을 정의하고, 두 번째 줄은 메인 에이전트가 하위 에이전트와 비평가 에이전트를 생성하도록 지시한다. 비평가는 이전 작업에 대한 기억 없이 무자비하게 결과물을 비교 검증하며, 마지막 세 번째 줄은 콜 오브 듀티 같은 구체적인 품질 기준을 제시하여 비평가가 멈춰야 할 시점을 알려준다.

건틀릿 루프의 두 가지 치명적 결함

  • 첫 번째 문제는 메인 에이전트가 검토 작업과 비평가 지침을 전적으로 책임져 사용자가 통제할 수 없다는 점이다.
  • 두 번째 문제는 콜 오브 듀티처럼 비교할 기존 제품이 없을 때 에이전트가 기준을 임의로 지어내어 실패한다는 점이다.
  • 과금 규칙이나 새로운 비즈니스 로직처럼 모방할 대상이 없는 상황에서는 건틀릿 루프가 무너진다.

수많은 사람들이 건틀릿 루프를 사용해 프로젝트를 완성하지만 그 이면의 문제점들을 놓치고 있다. 에이전트가 스스로 검증 방식을 관리하므로 장기적으로 무엇이 문제를 일으켰는지 파악하기 어렵다. 무엇보다 완전히 새로운 것을 만들 때는 비교할 기존 앱이 존재하지 않기 때문에 비평가가 기준을 제멋대로 지어내고, 결국 원하던 방향에서 벗어난 기능 더미만 남게 된다.

웨이파인더 스킬을 통한 문제 해결

  • 웨이파인더는 기획 과정의 불명확한 안개 구간을 질문을 통해 제거하고 명확한 지도와 정답 키를 생성한다.
  • 수정된 웨이파인더 스킬은 기획 결정 사항들을 에이전트가 대조할 수 있는 단 하나의 정답 키 파일로 변환한다.
  • HR 시스템 빌드 테스트에서 이 방식을 적용한 결과 1시간 33분이 소요되었고 요구사항에 가장 가까운 앱이 구현되었다.

맷 포콕이 만든 웨이파인더 스킬은 기획 단계에서 에이전트가 추측으로 빈틈을 채우지 않고 조사를 수행하거나 직접 확인하도록 만든다. 질문 세션을 거쳐 .wayfinder 폴더 안에 모든 결정 사항을 담은 지도 파일과 검증 항목으로 이루어진 정답 키를 작성한다. 이를 건틀릿 루프의 '콜 오브 듀티' 기준점 대신 사용하면 에이전트가 견고한 기반 위에서 작업을 수행할 수 있다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기