스크립트
00:00:00어제 앤스로픽이 페이블 5.1을 출시했는데, 이는 출시한 모델 중 처음으로
00:00:04생성물마다 워터마크를 넣는 모델입니다. 오늘 저는 이 워터마크를 제거하는 방법을 알려드리려고 합니다.
00:00:10하지만 먼저 이 워터마크가 정확히 무엇인지 이야기해 보겠습니다. 워터마크라고 부르는 것 자체가
00:00:14약간의 오해가 있을 수 있으며, 왜 애초에 이것이 존재하고 어떻게 작동하는지 알아보겠습니다.
00:00:19이러한 점들을 이해한다면 이 워터마크를 우회하는 해결책이 훨씬 더 납득이 갈 것입니다.
00:00:23자, 왜 우리가 이 문제를 다뤄야 할까요? 이는 이것이
00:00:26유럽연합(EU) AI 법을 준수하기 때문입니다. 사실상 주요 프론티어 연구소들이 모두 서명한 규정이죠.
00:00:31XAI를 제외하면 말입니다. 이 법안이 명시하는 바에 따르면 EU 측에서는
00:00:38특정 텍스트나 결과물이 AI에 의해 생성되었는지 판별할 수 있는 수단이 필요합니다.
00:00:43이를 위해 앤스로픽은 2026년 8월 2일 이후에 출시된 모델들의 모든 출력물에 워터마크를 추가했습니다.
00:00:50바로 페이블 5.1처럼 말이죠. 앤스로픽은 이것이 실제 출력물에 아무런 실질적 영향이 없으며,
00:00:56코드를 다룰 때 변경되는 부분도 매우 제한적이라고 주장합니다. 하지만 이게 실제로 어떻게 작동할까요?
00:00:59그리고 왜 제가 애초에 오해의 소지가 있다고 불렀을까요? 앤스로픽이 이러한 워터마크를
00:01:03출력물에 삽입하는 전략은 2024년에 구글이 발표한 논문을 기반으로 합니다.
00:01:07대규모 언어 모델 출력을 식별하기 위한 확장 가능한 워터마킹(Scalable Watermarking for Identifying Large Language Model Outputs)이라는 논문이죠.
00:01:13이것은 다소 기술적인 논문입니다. SynthID의 토너먼트 기반 워터마킹을 다루고 있죠.
00:01:19하지만 이해하기 쉬운 간단한 정신 모델을 하나 들어 설명해 드리겠습니다.
00:01:25아시다시피 대규모 언어 모델과 그 출력물은 확률에 기반하며 일정량의 무작위성이 포함되어 있습니다.
00:01:29예를 들어 '그녀는 [빈칸]이다'라는 문장을 주고 빈칸을 채워야 한다면,
00:01:34문장을 완성하는 데 사용할 수 있는 단어 목록이 나오게 됩니다.
00:01:41그 단어들이 아름다운(beautiful), 멋진(stunning), 화려한(gorgeous), 예쁜(pretty)이라고 해봅시다. 실제로는
00:01:48이 단어들 각각에 대규모 언어 모델이 선택할 확률에 따라 서로 다른 백분율이나 확률이 부여됩니다.
00:01:54소프트맥스(softmax)라는 용어를 자주 들으시겠지만, 이 단어들에는 모두 대규모 언어 모델이
00:01:58어떤 것을 선택할지와 관련된 확률이 지정되어 있다는 것만 이해하시면 됩니다.
00:02:04이 정신적 실험을 위해 이 단어들이 모두 정확히 동일한 확률을 가진다고 가정해 보겠습니다.
00:02:08즉, 문장을 완성하는 각 단어가 선택될 확률이 25%씩인 셈입니다.
00:02:14이제 워터마킹이 도입되기 전에는 평소처럼 이 중 하나를 그냥 선택했을 것입니다.
00:02:204면체 주사위를 굴려 'beautiful'을 선택했다고 해보죠. 멋지죠? 25%의 확률이었고,
00:02:26모든 단어가 선택될 확률이 똑같았습니다. 하지만 이제 우리는 다른 시스템에서 작동하며, 그 시스템이
00:02:31바로 워터마킹 시스템입니다. 워터마킹 시스템을 사용하더라도 여전히 다음과 같은 상황에 있을 수 있습니다.
00:02:38'그녀는 [빈칸]이다'라는 문장을 완성해 달라고 요청하고 4가지 선택지가 주어진다고 해봅시다.
00:02:42다시 말해 이 네 가지 단어가 똑같은 확률을 가진다고 가정해 보죠. 워터마킹 구조를 추가할 때,
00:02:49이것이 하는 일은 본질적으로 이 주사위를 조작하는 것입니다. 이것이 어떤 종류의
00:02:544면체 주사위라면, 워터마킹 목적을 위해 'beautiful'의 확률이 이제
00:03:0150%가 되고 'gorgeous'가 30%가 되도록 만드는 식입니다. 따라서 워터마킹 시스템을 적용하면
00:03:10특정 단어들을 선택하여 더 큰 가중치를 부여하게 됩니다. 특정 단어들에 더 높은 가중치가
00:03:15부여되기 때문에 대규모 언어 모델이 그것을 선택할 때, 음, 해당 단어들이
00:03:19더 자주 나타나게 됩니다. 워터마킹 시스템을 사용하면 대개 '그녀는 아름답다(she is beautiful)'라고
00:03:25출력하게 되죠. 최종 사용자 입장에서는 이 단어들이 무엇인지, 어떤 단어에 더 높은 가중치가
00:03:32부여되었는지 전혀 알 수 없습니다. 하지만 키를 가진 사람, 즉 워터마킹 비밀 키를 가진 사람은 알 수 있습니다.
00:03:40물론 절대적인 확실성으로 알 수 있는 것은 아닙니다. 예전처럼 언제나 '그녀는 아름답다'라는
00:03:45말이 나올 확률이 항상 존재했기 때문입니다. 워터마킹 때문에 더 높은 확률을 가졌는지
00:03:49단정할 수는 없습니다. 하지만 키를 가진 사람은 어떤 단어에 더 큰 가중치가 부여되었는지 알 수 있습니다.
00:03:55그리고 키를 가진 사용자, 즉 유럽 규제 기관에 이 텍스트가 작성된 확률을 알려주게 됩니다.
00:04:01예를 들어 '이 텍스트가 클로드로 작성되었을 확률이 90%, 100%, 혹은 99%입니다'라고 알려주는 식이죠. 이런 식으로 작동합니다.
00:04:09여기서 핵심 아이디어는 워터마킹을 통해 변경하고 더 큰 가중치를 부여하는 단어들이
00:04:15문장의 전체적인 의미를 바꾸지는 않는다는 점입니다. 출력 내용이 바뀌지 않습니다.
00:04:20성능이 저하되지도 않습니다. 특히 코드를 이야기할 때도 출력물의 형태에 영향을
00:04:24주는 방식으로 코드를 변경하지는 않습니다. 또한 사실 관계를 바꾸지도 않습니다.
00:04:28예를 들어 어떤 역사적 사건이 8월 10일에 일어났다고 한다면,
00:04:34그 표현을 바꾸지 않습니다. 그것은 사실이니까요. 8월 10일에 일어났다는 사실은
00:04:41변경되지 않습니다. 하지만 이것은 이 시스템이 어떻게 작동하는지 설명하기 위한 단순화된 설명입니다.
00:04:45물론 앤스로픽이 정확히 어떤 알고리즘으로 작동하는지 완전히 공개하지는 않았지만,
00:04:52우리는 딥마인드 논문 등을 통해 이를 유추해 볼 수 있습니다. 또한 여러분이 거기서 이해하셨어야 할 점은
00:04:57워터마킹 시스템을 기반으로 AI가 작성했는지 알 수 있는 유일한 방법이 이 키를 가지고 있는 것뿐이라는 사실입니다.
00:05:02그리고 이 키는 공개되어 있지 않습니다. 키에 접근하려면 권한을 요청해야 합니다. 공개된 목록은 없습니다.
00:05:08아마도 EU 규제 기관 같은 곳이어야 할 겁니다. 그러니 누군가 나와서
00:05:12'아, 내 웹사이트에 오면 워터마크가 들어갔는지 아닌지 알 수 있습니다'라고 말한다면, 그것은 거짓말이며 그런 것은 존재하지 않습니다.
00:05:16텍스트 워터마크가 어떻게 작동하는지 더 깊이 파고들고 싶다면 앤스로픽의 자체 기사를 읽어볼 수도 있습니다.
00:05:21그들은 이것이 출력물에 영향을 미치지 않는다는 점을 거듭 강조하죠.
00:05:25따라서 워터마킹 시스템은 본질적으로 특정 단어가 다른 단어보다 더 자주 선택되는 것에 관한 것입니다.
00:05:29그리고 이것은 최종 사용자인 여러분이 키를 가지고 있지 않다면 절대 파악할 수 없는 통계적 알고리즘입니다.
00:05:35그렇다면 이 문제를 어떻게 해결해야 할까요? 클로드가 제공하는 텍스트 출력물을
00:05:40살짝 수정하는 정도로 그치고 잘 되기를 바라면 될까요? 아니면 전체 내용을 본질적으로 다시 작성해야 할까요?
00:05:47그리고 어떻게 다시 작성해야 할까요? 이 문장들을 다시 쓰기 위해 클로드를 사용할 수는 없습니다.
00:05:52그러면 워터마크가 찍힐 테니까요. 그렇다고 ChatGPT나 젬니를 사용할 수도 없습니다.
00:05:56따라서 선택지는 아주 명확해집니다. 전체적인 느낌은 유지하면서
00:06:01텍스트의 상당 부분을 다시 작성해야 합니다. 그리고 XAI를 사용하거나,
00:06:09아마도 더 가능성이 높은 방법은 오픈소스 모델을 사용하는 것일 겁니다.
00:06:16컴퓨터에 다운로드하여 실행할 수 있는 어떤 중국산 모델 같은 것 말이죠.
00:06:21이런 모델들은 A) 무료이고 B) 이러한 워터마킹 규정의 적용을 받지 않습니다.
00:06:28그렇다면 실질적인 관점에서 이 시스템은 어떤 모습일까요? 평소처럼 클로드를 사용해 모든 작업을 수행합니다.
00:06:33만약 긴 블로그 게시물 같은 무언가를 만들었는데 워터마크 플래그가 붙는 것을 원치 않는다면, 그 출력물을 가져옵니다.
00:06:37그런 다음 로컬 모델로 전송하는 것입니다. 클로드를 통해 그렇게 할 수도 있습니다.
00:06:42OLLAMA를 통해 다운로드할 수 있는 정말 훌륭한 로컬 모델들이 아주 많습니다.
00:06:47그 로컬 모델이 작업을 수행하게 됩니다. 텍스트를 다시 작성하는 것이죠.
00:06:51거기에 이런 프롬프트를 주는 겁니다. “이것의 실제 느낌을 유지해 줬으면 좋겠어.
00:06:55너만의 목소리 톤이나 원하는 내용을 넣어도 돼” 같은 식으로요. 그리고 작업이 완료되면,
00:07:01그 정확한 응답을 그대로 다시 클로드에게 보내는 겁니다. 그 시점부터는 원하는 대로 활용하면 됩니다.
00:07:05그 시점에서 원하는 대로 활용할 수 있습니다. 자, 이 전체 과정에서
00:07:09우리가 다루는 토큰의 양은 얼마나 될까요? 왜냐하면 우리가 실제로 알 수 없는 수치이기 때문입니다.
00:07:14감지 API가 실행되었을 때 이것이 AI로 작성되었다고 어느 정도 확신을 가지고 말하려면
00:07:19이 출력물의 길이가 얼마나 길어야 할까요? 단지 “그녀는 아름답다” 같은 링크드인 댓글을 쓰고 있다면,
00:07:25API가 정말로 그것이 클로드로 작성되었는지 판별할 수 있을까요? 아니요. 그러므로 만약 작성한 내용에
00:07:31워터마크가 찍히고 클로드의 소유로 귀속되는 것이 매우 걱정되는 사람이라면 스스로에게 물어보세요.
00:07:37“내가 쓰는 글이 애초에 워터마크가 의미가 있을 만큼 충분히 긴가?”라고요.
00:07:41링크드인 게시글이나 100단어 미만의 댓글 같은 경우라면 아마 아닐 겁니다.
00:07:46하지만 수천 단어에 달하는 거대한 블로그 게시물이라면 이야기가 다릅니다. 네, 그 워터마크에 걸리게 될 것입니다.
00:07:51그리고 그것이 클로드로 작성되었다는 사실이 매우 명백해질 것입니다. 자, 이 모든 것을 설정하는 가장 쉬운 방법은
00:07:56Ollama를 다운로드하고, 본인의 하드웨어에 적합한 로컬 모델을 다운로드한 다음,
00:08:00클로드 내에 스킬을 만드는 것입니다. 이 스킬을 호출하면 출력물이 해당 로컬 모델로 전송되고,
00:08:05모델이 전체 재작업을 수행한 뒤 다시 가져오는 식이죠.
00:08:10여러분이 쉽게 할 수 있도록 이 전 과정을 여러분과 클로드에게 안내하는 전체 프롬프트를 만들었습니다.
00:08:15이것을 복사해서 클로드에 붙여넣기만 하면 됩니다. 그러면 클로드가 여러분의 하드웨어를 조사하고,
00:08:20어떤 로컬 모델이 적합한지 파악할 것입니다. 아직 설치하지 않았다면
00:08:24Ollama를 다운로드하고 설치해 줄 것입니다. 그런 다음 여러분을 위한 스킬을 생성하고,
00:08:28재작업된 문구의 스타일이 어떻게 들릴지 정할 수 있도록 질문을 던질 것입니다.
00:08:35기본적으로 여러분의 말투를 주입하고 예시를 제공하는 식이죠. 그러므로 아래에 링크를 남겨두어
00:08:40실제로 이를 수행할 수 있도록 하겠습니다. 앞으로 10분 동안 이 모든 과정을
00:08:44단계별로 안내하는 대신, 이 프롬프트를 실행하기만 하면 알아서 다 처리해 줄 것입니다.
00:08:48따라서 워터마킹에 대한 전체 설명이 이해가 되었기를 바랍니다. 이것은 실제 워터마크가 아닙니다.
00:08:53이면에 무언가가 기록되는 것도 아니고 코드가 숨겨져 있는 것도 아닙니다. 단지 특정 단어들이 더 자주 사용될 뿐입니다.
00:08:57여러분은 그 특정 단어가 무엇인지 전혀 알 수 없을 것입니다. 이를 알 수 있는 유일한 방법은
00:09:02워터마크 키를 가지고 있는 것뿐이며, 규제 기관이 아니라면 여러분은 키를 가질 수 없습니다.
00:09:07그러므로 워터마크가 있는지 판별할 수 있다고 말하는 사람들은 거의 다 거짓말을 하고 있는 것입니다. 즉시 알아두세요.
00:09:11그리고 이 작동 방식에 따라, 원한다면 그 딥마인드 논문을 직접 파고들어 볼 수도 있습니다. 여기서 이 문제를
00:09:16우회할 수 있는 유일한 방법은 대대적인 편집을 거치는 것뿐입니다. 가벼운 수정 정도로는 안 됩니다.
00:09:20전체를 다시 작성해야 합니다. 그리고 그걸 해낼 수 있는 유일한 방법은 오픈소스 모델을 이용하는 것입니다.
00:09:24그것이 가장 저렴한 방법이기도 할 것입니다. 만약 그 프롬프트를 이용해보고 싶다면
00:09:29아래에서 찾으실 수 있습니다. 이게 여러분 중 일부에게 도움이 되었기를 바랍니다. 솔직히 말씀드리자면,
00:09:33저는 워터마크가 적용되는 현상이나 그 성격에 대해 전반적으로 다소 과장되어 있다고 생각합니다.
00:09:38AI를 이용해 글을 쓰는 사람들의 대부분은 이미 너무나 명백하게 AI 티가 납니다.
00:09:43어떻게 인간미를 불어넣거나 자신처럼 들리게 해야 할지 전혀 모르기 때문입니다.
00:09:49그리고 게시물을 올리는 모든 곳, 모든 웹사이트에
00:09:52어떤 종류의 워터마크 탐지기가 도입되어 그것이 엄청난 결례가 되는 세상이 오지 않는 한 말입니다.
00:09:58다시 말해, 우리가 할 일은 이걸 로컬 모델에 통과시키기만 하면 사실상 아무런 문제가 없다는 것입니다.
00:10:02어떻게 보셨는지 의견을 남겨주세요. 클로드 코드 마스터클래스를 이용하고 싶으시다면
00:10:06Chase AI+를 꼭 확인해 보시기 바랍니다.
00:10:10그럼 다들 이 워터마크를 잘 피해 가시길 바랍니다.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기