스크립트
00:00:00제 프로젝트 '루프홀(Loophole)'에 대해 말씀드리겠습니다. 저는 모건 스탠리의 머신러닝 연구원이지만,
00:00:17이 프로젝트는 모건 스탠리와는 아무런 관련이 없습니다. 그냥 재미로 만들고 있는 오픈소스 프로젝트일 뿐이죠.
00:00:23먼저 전체적인 개요를 설명해 드리자면, 이 프로젝트는 적대적 에이전트 프레임워크를 기반으로 플레이할 수 있는 게임입니다.
00:00:30사용자가 자신의 도덕관을 지정하면, 한 에이전트가 이를 법 체계로 성문화하고, 두 개의 적대적 에이전트가
00:00:37여러분의 도덕관 속 모순을 찾아내려고 시도하는 방식입니다. 최근에는 여기에 다양한 확장 기능들을 추가하고 있는데요.
00:00:42먼저 이 아이디어를 어떻게 떠올리게 되었는지 그 기원 이야기부터 시작하고 싶습니다.
00:00:49이 프로젝트는 사실 아주 오래 전에 제가 혈통 분석을 위해 '23앤미(23andMe)'에 제 DNA를 보냈던 것에서 시작되었습니다.
00:00:56그 이후로 DNA 샘플이 범죄 해결이나 각종 법과학, 미제 사건 수사에 어떻게 사용될 수 있는지에 대한 이야기를 계속 접하게 되었죠.
00:01:05그리고 저는 이런 생각이 들었습니다. 왜냐하면 저는 DNA가 어떻게 활용될지 모른다는 우려와
00:01:11그로 인한 부작용이 무서워서 모든 것에 동의하지 않음(opt-out) 처리를 해두었거든요.
00:01:17하지만 그중에서도 제가 동의할 수 있는 특정 사례들이 분명 존재할 겁니다.
00:01:26흥미롭게도 저는 이런 생각을 했습니다. 만약 누군가 제게 사안별로 제안을 해준다면 어떨까요?
00:01:31“이 미제 사건이나 살인 사건을 해결하는 데 당신의 DNA를 사용해도 되겠습니까?”라고 묻고 제가 예 또는 아니오로 답할 수 있다면 말이죠.
00:01:37저는 제 도덕관의 정의와 미묘한 차이들이 어디에 있는지 잘 알고 있습니다.
00:01:43하지만 물론 이렇게 모든 사안을 일일이 열거하는 것은 인지적으로 엄청난 부담이 따르는 일이기도 합니다.
00:01:51현재로서는 이를 제대로 해낼 수 있는 좋은 방법이 마땅히 존재하지 않죠.
00:01:58그러다 조금 더 시각을 넓혀서 법 체계 전반과 유사한 점이 많다는 생각을 하게 되었습니다.
00:02:04우리 사회에서 법 체계가 무엇을 의미하는지 생각해보면, 결국 우리가 가진 도덕적 신념을 성문화하려는 시도입니다.
00:02:10이와 비슷한 맥락에서, 우리의 도덕관이 가진 진정한 미묘한 뉘앙스와 법이 나아갈 바를 찾아내는 것은
00:02:17정말 어려운 번역 작업과도 같습니다.
00:02:23우리는 종종 그 미묘함을 찾아내는 것이 너무 어렵기 때문에 차라리 너무 포괄적으로 규정하는 실수를 범하곤 합니다.
00:02:30만약 완벽한 번역을 시도하려고 하면, 이상한 예외 상황이나 기이한 오류 모드로 이어질 수 있죠.
00:02:36심지어 우리가 정치적으로 서로 관계를 맺을 때도 마찬가지라고 생각합니다.
00:02:42많은 경우견해차는 도덕적 관점의 아주 미세한 지점을 탐구하기보다는, 사실상 동의하고 있는 핵심 가치들을 두고
00:02:48서로 싸우는 것에 가깝습니다.
00:02:57이러한 더 넓은 법적 사례에 비추어 볼 때, 영미법 체계에서 판례(case law)에
00:03:02그토록 크게 의존하는 이유도 바로 여기에 있다고 봅니다.
00:03:09이러한 미묘함과 세부적인 경계선을 찾아내는 것이 어렵다는 것을 잘 알기 때문입니다.
00:03:16그래서 우리는 현명한 판결에 의존하여 법을 올바르게 해석하고 적용합니다.
00:03:22물론 연방 대법원의 경우처럼 사안이 상급 심으로 올라가 법의 유효성을 다시 판단하기도 하죠.
00:03:28그래서 제가 떠올린 아이디어는 이렇습니다. “자신의 도덕관을 바탕으로 합성 판례(synthetic case law)를 생성할 수 있을까?” 하는 것이죠.
00:03:34사람 손으로 직접 하려면 엄청난 부담이지만, 차세대 LLM들은 드디어 이러한 수준 높은 도덕적 추론을
00:03:42수행할 수 있을 만큼 충분히 똑똑해진 것 같습니다.
00:03:48이것이 바로 이 게임의 출발점이었습니다. 이제 이 게임의 초기 버전과
00:03:55그리고 제가 이 오픈소스 프로젝트 위에 구축해 온 다양한 확장 기능들에 대해 소개해 드리려고 합니다.
00:04:00이 프로젝트가 아주 흥미로운 방향으로 발전할 수 있다고 생각하기 때문입니다.
00:04:05개략적으로 게임이 작동하는 방식을 말씀드리면, 사용자가 자연어로 자신의 도덕관을 지정합니다.
00:04:12이 모든 과정은 터미널 기반의 게임 형태로 이루어집니다.
00:04:19일반적인 도덕관일 수도 있고 특정 주제에 관한 것일 수도 있습니다. 그러면 하나의 에이전트가 그 도덕관을 가져와서
00:04:24매우 풍부한 법률 용어로 이루어진 성문화된 법 체계를 초안으로 작성합니다.
00:04:31그 후 하나의 루프 안에서 작동하게 되는데, 한 에이전트는 여러분의 체계에서 허점(loophole)을 찾도록 지시를 받습니다.
00:04:38즉, 비도덕적이면서도 법적으로는 허용되는 부분을 찾는 것이죠. 또 다른 에이전트는 지나친 규제(overreach)를 찾도록 프롬프트를 받습니다.
00:04:45즉, 여러분의 체계에 따를 경우 도덕적이지만 불법이 되는 사안들을 찾는 것입니다. 판정 에이전트는 사용자의 도덕관, 생성된 법 코드,
00:04:52그리고 이러한 합성 판례 사례들을 살펴봅니다. 처음에는 자동 패치(auto patch)가 가능한지 확인합니다.
00:04:58법 코드의 원래 초안이 불완전한 번역이어서 실제 모순이 있는 것이 아니라면 자동으로 업데이트를 수행할 수 있죠.
00:05:05혹은 도덕관이 제대로 구체화되지 않았거나 모순이 있는 경우일 수도 있습니다.
00:05:10이러한 경우에는 사안을 사용자에게 올려서 직접 판사가 되어 결정을 내리도록 합니다.
00:05:16이러한 경우에는 사안을 사용자에게 올려서 직접 판사가 되어 결정을 내리도록 합니다.
00:05:22아직 화면에 잘 보이시나요? 제 화면에서는 사라졌네요.
00:05:26이 게임에 호기심이 생기셨다면 꼭 한번 플레이해 보시길 바랍니다. 전부 깃허브에 공개되어 있습니다.
00:05:31다만 몇 가지 예시를 보여드리고 싶었을 뿐입니다. 텍스트가 꽤 많기 때문에 입력과 출력의 형태가
00:05:37어떻게 생겼는지 보여드리는 데 초점을 맞추겠습니다. 이것이 입력을 제공하는 방식이며, 앞서 언급한 DNA 예시로 돌아가서
00:05:44좋습니다. 게임에 관심이 있으시다면 꼭 플레이해 보시길 바라며, 모든 소스는 깃허브에 공개되어 있습니다. 몇 가지 예시를 통해 입력과 출력의 형태를 보여드리고 싶었습니다. 이처럼 입력을 제공할 수 있으며, 앞서의 DNA 예시로 돌아가 일련의 도덕적 원칙들을 지정할 수 있습니다.
00:06:10그리고 성문화된 법 체계의 경우, 그 형태를 살펴보면 전문(preamble), 조항, 섹션 등 법률 용어를 사용하여 정확한 법적 언어로 작성하려고 노력한 모습을 볼 수 있습니다.
00:06:24그런 다음 다양한 합성 판례들이 제안됩니다. 이 경우, 보험 회사가
00:06:34당신의 DNA 자체가 아니라 DNA의 산물(artifacts)을 활용해 예측 머신러닝 모델을 훈련시킨 허점을 발견한 사례를 다룹니다. 이는 비도덕적이지만 현재 시스템상으로는 합법임을 보여줍니다.
00:06:46이 경우 자동 패치가 가능하다는 점이 발견되었습니다. 그러면 원래의 법 체계와 비교하여, 여러분의 도덕관과 일치시키기 위해
00:06:58어떤 수정이 이루어졌는지 깃(git) 스타일의 차이점(diff)을 확인할 수 있습니다. 다음은 지나친 규제(overreach)의 예시입니다. 여기서는 자동 패치를 수행할 수 없다는 사실이 발견되었습니다.
00:07:08예를 들어 누군가 유전 연구를 위해 DNA를 제출했는데, 연구자가 그 사람에게 희귀하지만 치료 가능한 유전 질환이 있다는 사실을 발견하는 상황입니다.
00:07:17하지만 현재 여러분의 도덕관에 따르면, 연구자가 이 질병을 DNA 제출자에게 알려주는 것은 허용되지 않는다고 되어 있습니다. 이 사안은 사용자(저)에게 전달되어 최종 판단을 내리게 됩니다. 판단을 내리면 마찬가지로 패치된 법 체계를 얻게 됩니다.
00:07:33이처럼 이 프로젝트는 꽤 재미있는 게임입니다. 트위터에 올리고 깃허브에 오픈소스로 공유했는데, 제게는 지금까지 가장 큰 바이럴을 기록한 게시물이 되었습니다. 이를 통해 많은 사람들이 그저 재미있다고 평가했다는 점을 알게 되었죠.
00:07:50자신의 도덕관을 스트레스 테스트해 보고 흥미로운 모순이 있는지 확인할 수 있습니다. 하지만 동시에 “여기에 뭔가 더 실질적인 것이 있지 않을까?” 하는 생각이 들었습니다.
00:07:59더 실용적이고 거시적인 함의가 있을지 탐구해 보기 위해 세 가지 다른 갈래를 말씀드리려 합니다. 첫 번째는 법적 영역을 벗어나 보다 실용적으로, 챗봇이나 전반적인 에이전트를 위한 헌법을 자동으로 만드는 방법을 생각하는 것입니다. 예를 들어 기업에서 고객 대면용 챗봇을 운영할 때,
00:08:29도덕적 규범을 따르게 하면서도 다룰 내용과 다루지 말아야 할 내용을 정하고 싶어 합니다. 한 갈래에서는 이를 구현하여, 유사한 방식으로 도덕관을 작성하고 챗봇이 대화해야 할 내용과 하지 말아야 할 내용을 정의합니다. 그런 다음 성문화된 시스템 프롬프트를 작성하도록 유도하고, 적대적 에이전트를 동원해 챗봇이 금지된 주제를 다루게 하거나 반대로 마땅히 해야 할 답변을 거부하도록 유도합니다.
00:08:56저는 이것이 GEPA와 유사한 방법론이면서도, 성문화된 시스템 프롬프트를 구축하는 데 초점을 맞춘 방식이라고 봅니다.
00:09:03제가 특히 관심을 갖고 있는 두 번째 유익한 사례는 임시 계약(ad hoc)이나 탈중앙화된 계약을 처리하는 수단으로 활용하는 것입니다. 간단히 말해, 온라인에서 데이터나 프라이버시가 다루어지기를 원하는 방식을 지정하고, 이러한 적대적 게임을 거쳐 온라인 데이터 처리 방식에 대한 성문화된 법적 계약을 얻어낼 수 있습니다.
00:09:30만약 애플 같은 기업이 새로운 이용 약관을 발표한다면, 여러분의 법 체계와 애플의 약관 사이의 모순을 실행해 봄으로써 흥미로운 모순점이나, 여러분의 도덕관·원하는 바와 기업의 실제 행태 사이에 차이를 만드는 합성 사례들을 표면화할 수 있습니다.
00:09:57상대가 대기업이라오면 실제로 무언가를 바꾸거나 협상하긴 어렵겠지만, 적어도 체결하는 계약에 대해 더 정확한 정보를 가질 수 있죠.
00:10:08또한 더욱 탈중앙화된 관점에서, 중앙 집중식 권력의 강제 없이 계약을 맺으려 하거나 서로 다른 국가 간에 계약을 체결하려 할 때도 유용합니다.
00:10:23자신의 도덕관과 상호작용하고 싶은 방식을 지정할 수 있다면, 예를 들어 계약직 업무의 경우 보수가 지급되는 방식이나 그와 관련된 다양한 도덕적 규범을 정의하고 상대방도 똑같이 수행할 수 있습니다.
00:10:40그러면 양측 모두 스트레스 테스트를 거친 성문화된 계약을 얻게 되고, 의견 불일치가 있다면 계약 체결 전에 미리 찾아내어 표면화함으로써 전체 계약에 대한 확신을 높일 수 있습니다.
00:10:55마지막으로, 어쩌면 가장 이상적인 목표일 수 있는 더 스마트하고 효율적인 정부에 대한 관점입니다.
00:11:07다양한 프라이버시 문제나 물류적 이슈가 존재하겠지만, 일단 그것들은 제쳐두고 큰 그림에서 생각해 보겠습니다.
00:11:15유권자나 구성원들에게 이는 매우 흥미로운 방식이 될 수 있습니다. 자신의 도덕관을 정의하고 스트레스 테스트를 거친 법적 코드를 보유하면, 새로 발의되는 법안이나 등장하는 정치인에 대해
00:11:28자신의 계약과 비교하여 어떤 부분에서 의견이 갈리는지, 혹은 자신에게 비도덕적이거나 모순이 되는 흥미로운 지점들이 무엇인지 표면화할 수 있습니다.
00:11:41또한 우리가 서로 관계를 맺을 때도 마찬가지입니다. 우리는 모두 사안에 대해 많은 미묘한 감정을 갖고 있으며, 이는 단순한 가치를 두고 다투는 것에서 벗어나
00:11:57그러한 미묘함에 도달하는 방법이 됩니다. 종종 그 가치들 자체는 서로 모순되지 않기 때문이죠.
00:12:01입법자들에게 더 실용적인 측면을 생각해보면, 법안을 발의하고 싶을 때 입법 기관 내의 다른 모든 입법자들의 시뮬레이션을 돌려
00:12:15제출 전에 미리 스트레스 테스트를 거쳐볼 수 있습니다.
00:12:18그래서 제가 이 프로젝트에서 구축해 온 세 번째 갈래는 미국 상원을 대상으로 이를 시도해 보는 것이었습니다.
00:12:24먼저 클로드(Claude)를 통해 현재 미국의 모든 상원의원을 조사하여 그들의 투표 이력과 공개된 모든 자료를 검토하고, 각자의 도덕 시스템을 구축한 뒤 루프홀 프로세스를 거쳐 성문화된 법적 코드를 도출했습니다.
00:12:43이 시스템을 바탕으로 현재 발의 중인 법안이나 직접 제안한 법안을 제출하면, 클로드가 각 상원의원이 어떻게 투표할지 시뮬레이션하도록 할 수 있습니다.
00:12:56여기서 일부 상원의원들이 어떤 쪽으로 기울어 있는지, 그리고 그 투표의 배경이 되는 논리는 무엇인지 그 내역을 확인할 수 있습니다.
00:13:07제안된 법안에 대해 사람들이 어떻게 투표할지 미리 살펴보는 것은 꽤 흥미로운 일이라고 생각합니다.
00:13:16또한 이는 컨퍼런스의 취지에도 부합하는 자체적인 검증 가능한 도메인 혹은 루프가 됩니다.
00:13:22초당적 과반수(supermajority)나 법안 통과에 필요한 의석수를 확보하기 위해 법안을 힐클라이밍(hill-climbing) 방식으로 개선해 나가는 것도 생각해 볼 수 있습니다.
00:13:30이 경우, 제가 테스트하던 메디케어 법안은 원래 50대 50 투표로 시작되었으나, 52표로 통과될 수 있도록 법안의 문구를 힐클라이밍 방식으로 수정하는 방법들을 찾아냈습니다.
00:13:45이것은 법안의 핵심 정신을 찾아내고, 각 상원의원의 계약과 법안을 비교하여 법안의 핵심 신념이나 도덕성을 위반하지 않으면서도 언어를 바꿀 수 있는 방법이 있는지 찾아내어 자동 패치를 수행할 수 있음을 보여주는 사례입니다.
00:14:09또한 투표 찬성을 극대화하기 위해 필요한 변경 사항들을 순위별로 정렬하여 제공하므로, 사용자가 직접 트레이드오프를 선택할 수 있습니다.
00:14:23최근 이 갈래에서 시도하고 있는 마지막 작업은 훨씬 더 거시적인 관점에서, 모든 구성원이 참여하는 더 효율적인 정부로 이어질 수 있는지 살펴보는 것입니다.
00:14:38주(state)나 선거구의 모든 유권자가 각자의 법적 코드를 가지고 있고, 임의의 법안을 제출했을 때 실제 유권자들 간의 합의 수준을 측정할 수 있도록 말이죠.
00:14:50이를 위해 엔비디아가 제공하는 훌륭한 미국 페르소나 데이터셋을 활용하여 주당 500개의 페르소나를 추출했습니다. 이는 해당 주의 인구를 잘 대변하도록 설계된 것입니다.
00:15:03페르소나에 따라 도덕관을 초안으로 작성하고 법적 계약을 도출한 뒤, 관심 있는 법안을 가져와 각 주별로 실행하는 동일한 프로세스를 거쳤습니다.
00:15:15또한 사람들이 이 법안을 얼마나 지지하는지, 혹은 그들의 도덕관과 얼마나 부합하는지 측정하고, 국민을 위해 법안을 최적화하는 힐클라이밍 작업도 수행할 수 있습니다.
00:15:25결론적으로 말씀드리면, 적어도 최소한으로 볼 때 이 프로젝트는 꽤 재미있는 게임입니다. 제가 편파적일 수도 있겠지만, 관심 있는 주제를 입력하고 도덕관을 넣은 뒤 모순이 있는지 확인하는 것은 아주 흥미롭습니다.
00:15:40종종 아주 흥미로운 질문들이 제기되며, 일단 그 미묘함을 제공하고 나면 에이전트들은 더 이상 모순을 찾지 못하게 됩니다. 이를 통해 일관성 있고 미묘한 도덕 시스템을 갖추었다는 안도감을 느낄 수 있죠.
00:15:56하지만 저는 여기서 더 나아가 탈중앙화되거나 더 나은 계약을 위한 실제적인 응용 가능성이 있는지, 그리고 입법자들이 법안을 스트레스 테스트하고 지역구 주민들에게 더 이롭거나 주민들의 바람을 더 잘 대변하는 법안을 작성하는 방법에 대해 고민하는 데 활용될 수 있을지 탐구하는 데 관심이 있습니다.
00:16:19표시된 QR 코드는 상원 시뮬레이터로 연결되므로 관심 있으신 분들은 꼭 플레이해 보시길 권장합니다. 다른 코드는 루프홀 깃허브 전체 소스가 있는 제 웹사이트로 연결됩니다. 마음껏 플레이하고 포크(fork)해 보세요. 다른 기여자분들과 함께할 수 있으면 좋겠습니다. 감사합니다.
00:16:49감사합니다.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기