스크립트
00:00:00좋습니다. 환상적이네요. 다들 만나서 반갑습니다. 저는 타이스입니다. 저는 Taste Labs의 창립자이고요. 우리를 잘
00:00:19모르시는 분들을 위해 말씀드리면, 우리는 몇 주 전에 스타우트(Stout)에서 나왔으며, 우리의 전체적인 사명은 기본적으로
00:00:23어떻게 하면 AI 슬롭(AI Slop)을 없앨 것인가 하는 것입니다. 그것은 나의 개인적인 원수이기도 하죠. 그래서 우리는 이 슬롭 문제를 해결하기 위해서는
00:00:31주관적인 영역을 해독해야 한다고 진심으로 믿습니다. 코딩이나 수학 같은 분야에서 모델과 에이전트를
00:00:36뛰어나게 만드는 데는 정말 많은 노력이 투입되어 왔으며, 이제는 그와 똑같은 모든 노력을
00:00:41디자인이나 글쓰기 같은 분야에서 뛰어난 성능을 발휘하도록 쏟아부어야 할 때입니다. 그래서 디자인은 우리가
00:00:46시작하는 첫 번째 기둥이며, 대단히 흥미진진했습니다. 우리는 주로 두 가지 방식으로 일합니다. 우선 우리는
00:00:52프론티어 랩(Frontier Labs)과 긴밀히 협력하여 그들의 모델을 평가하고, 어디서 성능이
00:00:57저하되는지 파악하며, 무엇을 개선할 수 있을지 이해한 다음, 그 문제를 기본적으로 해결하기 위해 올바른 사후 학습
00:01:01데이터나 환경을 구축합니다. 이 과정의 일부는 디자인처럼 모호하고 거대한 것을
00:01:05어떻게 가져와서, 각 방법으로 가장 잘 해결되는 부분이 무엇인지 식별할 수 있는 수준으로 해체하느냐에 관한 것입니다.
00:01:11디자인의 요소들 중에는 문제를 어느 정도
00:01:15분석해 보면 너무나 구체적이어서 거의 결정론적(deterministic)이 되는 것들이 있습니다. 예를 들어, 만약 여러분이
00:01:20모델이 색상 팔레트를 선택하거나 대비 또는 정렬을 잘하도록 훈련시키려 한다면 말입니다. 그러한 것들은
00:01:25문맥과 상황을 충분히 구체적인 방식으로 정의한다면, 꽤 객관적이거나 적어도
00:01:30대다수의 전문가가 동의할 수 있는 정답에 도달할 수 있는 항목들입니다. 하지만 미학과 같은 다른
00:01:34측면에서는 전문가 간의 의견 차이가 자연스럽게 나타나게 됩니다. 그럴 때는 데이터에 더 가까운
00:01:39방식에 의존하게 되죠. 아무튼 우리는 이러한 모든 문제에 대해 많은 시간을 고민합니다.
00:01:43하지만 반대편에는 모델 레이어를 전혀 건드리지 않고도 말이죠, 어떻게 하면 실제로 에이전트와
00:01:48앱 레이어 기업들이 더 나은 결과물을 만들도록 도울 수 있을까 하는 문제가 있습니다. 거기에 들어가는 요소는 정말 많습니다.
00:01:53애플리케이션 레이어에서는 직면하는 문제들의 성격이 완전히 달라집니다. 기성(off-the-shelf)
00:01:56모델을 사용하고 있기 때문인데, 이 모델들은 스타일 측면에서 무너지는 경향이 있고 평균으로 수렴하는 경향이 있습니다. 그렇다면 어떻게
00:02:02창의성을 시스템에 다시 불어넣을 수 있을까요? 오늘 많이 이야기하게 될 슬롭의 패턴들을 어떻게 피할 수 있을까요? 사용자의
00:02:07사용자 취향이나 브랜드 선호도를 이해하여 어떻게 그
00:02:13따라서 앱 레이어에서는 맥락, 판단, 또는 검증으로서 실제로 해결해야 할 일들이 아주 많으며, 이것이 바로 우리가 양쪽 모두에 걸쳐 일하는 이유입니다.
00:02:19이유이기도 합니다.
00:02:25하지만 아마도 저는 좀 더 철학적인 질문으로 시작해 볼까 합니다. 훌륭한 것이란
00:02:29무엇인지 어떻게 정의할 수 있을까요? 위대함이란 어떻게 정의되는 걸까요? 수학 같은 경우에는 더 쉽습니다, 왜냐하면
00:02:35객관적인 정답이 하나 존재하기 때문입니다. 그리고 훌륭한 것은 곧 옳은 것과 같습니다. 하지만
00:02:40글쓰기나 디자인 같은 분야에서는 훨씬 더 어려워집니다. 훌륭한 트윗이나 훌륭한 예술 작품,
00:02:45혹은 훌륭한 웹사이트를 과연 어떻게 정의할 수 있을까요? 여러분이 시와 교감했거나 커피숍에 들어갔을 때
00:02:52왠지 모르게 느낌이 남다르고 아주 특별하게 다가왔던 게 마지막으로 언제인지 모르겠습니다.
00:02:56아마 그것은 매우 독특하게 느껴졌던 여러 요소들의 조합일 것입니다. 거의 약간은 색다르게 느껴졌고,
00:03:02여러분의 주의를 끌었을 겁니다. 엄청난 정성과 세심한 디테일, 그리고 장인정신을 바탕으로 만들어진 것처럼
00:03:06느껴졌겠지요. 그리고 거의 진정성이라는 느낌을 지니고 있었을 것입니다. 제 생각에는 이것이 바로 오늘날 AI가
00:03:12많이 놓치고 있는 부분입니다. 평범하지 않은 것들을 어떻게 만들어낼 것인가 하는 점이죠.
00:03:16고의적으로 분포(distribution)를 벗어난 결과물을 어떻게 생산해 낼 것인가? 슬롭은 그와 정확히 반대되는 것입니다.
00:03:21때로는 훌륭한 것이 무엇인지 정의하기 어렵지만, 슬롭이 무엇인지는 정의하기가 꽤 쉽다고 생각합니다. 왜냐하면 대다수의 사람들이
00:03:26동의할 테니까요. 반복되는 느낌, 영혼이 없는 듯한 느낌은
00:03:30우리 모두가 지금 AI를 사용할 때 공통으로 느끼는 부분입니다. 그런데 한편으로는 AI가 이 정도까지 발전해서,
00:03:34지구상의 어떤 인간이든 디자이너나 엔지니어가 아니더라도
00:03:39버튼 하나만 누르면 순식간에 파워포인트 전체를 만들거나 웹사이트, 웹 앱을 뚝딱 만들어낼 수 있게 된 것은
00:03:44정말 마법 같은 일이라고 생각합니다. 하지만 그에 따른 결과도 따르기 마련입니다. 콘텐츠 생성 비용이 기본적으로
00:03:490으로 수렴하게 되는 결과가 생겨나죠. 하지만 일반 사람들은
00:03:56반드시 안목(taste)을 갈고닦아 온 것은 아닙니다. 디자이너가 평생에 걸쳐
00:04:01안목을 키우기 위해 쏟아붓는 노력과 작업량을 생각해 보세요. 수많은 것들을 접하고,
00:04:06패턴을 발견하는 법을 배우고, 자신만의 관점을 정립하며, 다소 규범에 어긋나더라도
00:04:11소신 있게 일들을 추진해 나가는 그런 모든 과정 말입니다.
00:04:15무엇을 하지 말아야 할지, 어떻게 절제력을 가질지 배우는 것은 정말 어렵습니다. 일반 사람들은
00:04:21디자인을 비롯한 모든 분야에서 안목을 기를 시간도, 기술도 반드시 충분한 것은 아닙니다.
00:04:25그렇기 때문에 우리가 그냥 “좋아, 슬롭을 해결하는 방법은 모두가 안목을 갖추는 거야”라고 치부해 버리는 것은
00:04:30최악의 시나리오가 될 것입니다. 그것이 반드시 현실적이라고는 생각하지 않으니까요.
00:04:34어떻 하면 우리가 이 문제를 더 잘 이해하여, 일반 사람조차도 훌륭한 것을 창조하고
00:04:39일반인도 멋진 것을 만들고 자신의 취향을
00:04:44쉽게 말이죠. 그래서 그 점이 바로 우리가 집중하고 있는 많은 부분입니다. 아무튼 이 슬롭 현상은
00:04:50새로운 것이 아닙니다. 소셜 미디어가 부상할 때 인터넷상에 계셨던 분들이라면 그 이전에도 수많은 슬롭을 보셨을 겁니다.
00:04:55하지만 저는 AI가 버튼 클릭 한 번으로 무언가를 매우 쉽게 만들어내는,
00:05:00그 과정에 수반되는 무심함과 함께 일종의 가속화 역할을 해왔다고 생각합니다.
00:05:04그리고 슬롭에서 반복되는 세 가지 특징이 있습니다.
00:05:08첫째는 반복성입니다. 똑같은 것이 여러 번, 아주 여러 번 반복되는 것을 보게 되죠.
00:05:15두 번째는 적합성 부족(lack of fit)인데, 이것도 사실 매우 밀접하다고 봅니다.
00:05:19적합성이란 특정한 맥락, 특정한 시점, 특정한 사람에게
00:05:23어떤 것이 올바르게 느껴지도록 만드는 능력입니다. 하지만 갑자기 반복성이 생겨서,
00:05:27한 사람은 애완동물 가게 웹사이트를 요청하고 다른 사람은 금융 회사 웹사이트를 요청했는데
00:05:32그 디자인들이 묘하게 수렴해서 똑같이 보인다면, 그것 참 이상한 일이지 않겠습니까?
00:05:38만약 그것을 정성을 들여 직접 만들었다면 그렇게 수렴하지는 않았을 것입니다.
00:05:42이러한 적합성 부족과 맥락에 대한 이해 부족은 실제로 슬롭으로 이어지는 거대한 문제입니다.
00:05:46그리고 세 번째는 낮은 의도(low intent)일 것입니다. 이는 아마도 사람들이 정말 빠르게 프롬프트를 입력하고
00:05:51원샷으로 무언가를 끝내고 싶어 하는 성향이 섞여 있는 결과일 겁니다.
00:05:54하지만 우리가 구축하고 있는 시스템에는 의도를 해석해 주는 부분이 빠져 있습니다.
00:05:58어떻게 하면 사용자를 도울 수 있을까요?
00:06:01사용자가 자신의 의도를 더 잘 이해하도록 도울 수 있을까요? 그리하여 여러분이 만들고자 하는 것에
00:06:05더 많은 색채와 맥락을 더할 수 있도록 말입니다.
00:06:12좋습니다. 저는 무언가를 고치려면 먼저 그것을 측정해야 하고, 먼저 그것을 이해해야 한다고 굳게 믿는 사람입니다.
00:06:17그것이 바로 우리가 이러한 도메인들을 좀 더 검증 가능한 것으로 바꾸어
00:06:21측정 지표를 붙일 수 있는 방법에토록 집중하는 이유입니다.
00:06:27자, 이제 저와 함께 약간의 연구 여정을 떠나보시죠.
00:06:31우리는 기본적으로 슬롭을 측정할 수 있는지 알아내고자 했습니다. 과연 이를 정량적으로 측정하고
00:06:36포착할 수 있을까요? 그리고 그 모습은 과연 어떨까요? 그래서 우리는 지난 10년 동안의 웹사이트
00:06:43200만 개 이상을 분석했습니다. 웨이백 머신(Wayback Machine) 스타일로 말이죠.
00:06:48이를 통해 디자인 전반의 모든 트렌드를 이해하고자 했습니다. 인터넷은 어떻게 변하고 있을까? 디자인은 시간에 따라 어떻게 변하고 있을까? 그러자 두 가지 흥미로운 점이 발견되었습니다.
00:06:55그리고 우리는 또한 비교를 위해 일련의 디자인 웹사이트들을 합성적으로 생성하기도 했습니다.
00:07:00사람이 만든 사이트는 AI가 생성한 사이트와 어떻게 비교될까? 흥미로운 점들이 몇 가지 있었습니다.
00:07:07첫째는 이미 AI 이전에도 인터넷상에서 약간의 수렴 현상이 나타나고 있었다는 점입니다.
00:07:13즉, 인터넷이 점점 더 동조화(homogenous)되고, 더 유사한 색상 팔레트를 사용하며, 더 유사한 레이아웃을
00:07:18사용하는 경향을 볼 수 있었는데, 이는 아마도 이러한 트렌드가 더 빠르게
00:07:24퍼져나간 결과물이라고 할 수 있습니다. 하지만 AI와 함께라면, 이러한 반복 현상이 훨씬 더 많이 일어나고
00:07:28맥락과 관계없이 거의 더 잘 식별되는 것을 볼 수 있었습니다.
00:07:33따라서 완전히 다른 범주들 속에서도 매우 유사한 패턴들이 나타났습니다. 그래서 우리는
00:07:38이를 프로브(probes)라고 부르는 것을 구축했습니다. 기본적으로 두 가지 작업을 수행했는데요. 이 모든 데이터에 대해
00:07:44패턴 마이닝을 수행하여 이 모든 사이트에서 추출할 수 있는 특징이 무엇인지 파악했습니다.
00:07:47색상, 타이포그래피, 레이아웃, 오디언스 등 우리가 더 객관적으로 만들 수 있는 특성들은 무엇일까요?
00:07:53이것들을 어떻게 거의 구조화된 형태로 정제할 수 있을까요? 그리고 나서
00:07:58이러한 프로브들을 어떻게 훈련시킬 것인가? 이것들을 베이비 분류기(baby classifiers)라고 생각해보세요. 이 하나의 특성을 포착하는
00:08:03능력을 어떻게 훈련할 것인가? 그리고 이러한 모든 슬롭 사이트들에 대해 우리는 식별해 내기 시작했습니다.
00:08:09이 사이트가 AI 슬롭일 가능성이 매우 높음을 의미하는 프로브는 과연 무엇일까요? 특히
00:08:16이들을 결합하기 시작하고 이 중 여러 개가 동시에 발생하는 빈도를 보게 되면,
00:08:20실제로 슬롭을 측정하고 예측할 수 있을 가능성이 매우 높아지게 됩니다. 그리고 우리는 엄청나게 높은 수준의
00:08:26예측 능력을 확인했으며, 그것을 보는 것은 정말 멋진 일이었습니다. 이것은 참고로
00:08:30LLM에게 해당 결과물이 인간의 훌륭한 품질인지 아니면 AI가 생성한 슬롭인지 판단해 달라고 요구하는 대부분의
00:08:36LLM-as-a-judge 방식보다 더 뛰어난 성능을 보였습니다. 그래서 그 점을 확인하는 것이 꽤 멋졌습니다.
00:08:40그리고 그것은 AI에서 우리가 보는 이 패턴이 슬롭 속에서 실제로 관찰할 수 있는 정량적인 현상임을 잘 보여준다고 생각합니다.
00:08:47정말 멋진 일이죠. 하지만 물론 여기서 멈추고 싶지는 않습니다.
00:08:51측정하는 데서 그치고 싶지 않거든요. 이걸 해결하고도 싶고요. 그래서 앞서 말씀드린 것처럼,
00:08:56콘텐츠 제작 비용이 사실상 0으로 수렴함에 따라, 앞으로 훨씬 더 중요해지고
00:09:01비용을 지불하게 되는 가치는 바로 '판단력'입니다. '취향'이라는 단어 대신 굳이 '판단력'이라고 쓰고 싶네요.
00:09:07무엇이 옳은지 분별하는 능력, 문제를 세분화하여 제대로 이해하고
00:09:11그에 대한 해결책을 만들어내는 바로 그 능력 말입니다. 따라서 인간의 판단력이라는
00:09:16측면은 그 어느 때보다 가치 있다고 생각합니다.
00:09:19하지만 동시에 이런 측면도 있죠. 과연 어떻게 올바른 도구와 시스템을 구축하여
00:09:23이 문제의 일부분을 해결할 것인가 하는 점입니다.
00:09:27그렇다면 저의 숙적이나 다름없는 저질 콘텐츠(slop)와는 어떻게 싸워야 할까요? 참고로 이와 관련해 모델 레이어에서
00:09:34저질 콘텐츠를 어떻게 방지할 것인가에 대한 많은 논의가 오가고 있습니다. 예를 들면 모델을 더 우수하게 만들고,
00:09:39기준을 더 높이려면 어떻게 해야 할까 같은 이야기죠. 물론 이 역시 반드시 해결해야 하며
00:09:43저희도 이를 해결하기 위해 열심히 노력하고 있습니다. 하지만 저는 추론 시점(inference time)의 문제가
00:09:48그못지않게, 혹은 어쩌면 그 이상으로 중요하다고 생각합니다. 바로 그때가 최종 사용자 층과 상호작용하는 시점이기 때문입니다.
00:09:53이러한 맥락과 의도를 이해하는 과정은 추론이 이루어지는 순간에 발생합니다.
00:09:57따라서 단순히 모델 성능만 높이고 이 문제를 해결하지 않는다면 저질 콘텐츠의 범람은 계속될 것입니다.
00:10:01그러니 몇 가지 세부적인 부분과 더불어, 저희가 이 문제를 해결하기 위해 고민해 온 방식이나
00:10:07구축한 솔루션들을 몇 가지 나누어 설명해 드리겠습니다. 예를 들어,
00:10:11반복성 같은 문제를 해결하기 위해 저희가 작업 중인 것이 있습니다. 제가 별명으로 붙이기를,
00:10:15공식 명칭이 될지는 모르겠지만, 가칭 '창의성 API'라고 부르는 것입니다. 어떻게 하면
00:10:18에이전트에게 영감을 불어넣는 시스템을 만들어, 에이전트가 기존의 평균적인
00:10:23결과물에서 벗어나 실제로 분포 외(out of distribution)의 결과물을
00:10:27생성할 수 있게 할까요? 저품질 콘텐츠 사이트들에서 보듯 똑같은 평균값만 찍어내는 것이 아니라요.
00:10:32이것이 바로 실질적인 방법 중 하나로, 의도적으로 분포를 벗어난 결과물을 만들어냄으로써
00:10:36전반적인 품질을 향상시킬 수 있습니다. 그리고 이건 단순히 무작위성을 부여하는 것과는 다릅니다.
00:10:43단순히 모델의 temperature(창의성 수치)를 높이고 잘 되기를 행운처럼 비는 게 아니라는 거죠.
00:10:47오히려 특정 도메인에서의 규칙이나 기대치가 무엇인지를 파악하는 과정에 가깝습니다.
00:10:52예를 들어, 스타트업 피칭을 위한 슬라이드 덱을 요청한다고 해봅시다.
00:10:57좋은 피칭 덱은 어떤 모습일까요? 그리고 어떻게 해야 규칙을 의도적으로 깨뜨리면서도
00:11:03더 창의적인 결과물을 만들어낼 수 있을까요? 보통 창의성이란 무작위성이 아니니까요.
00:11:07그 상황에 전혀 어울리지 않는 엉뚱한 짓을 하는 게 아니라는 겁니다. 의도적으로
00:11:12몇 가지 부분에서는 일탈하되, 해당 카테고리가 요구하는 기대치는 계속 유지하는 식이죠.
00:11:19이것이 첫 번째로 저희가 작업 중인 부분입니다. 두 번째 당면 과제인 적합성 문제에 대해 이야기하자면,
00:11:23흥미롭게도 디자이너이신 분들은 잘 아시겠지만, 멋진 브랜드를 만드는 데는 엄청난 노력이 듭니다.
00:11:28훌륭한 브랜드는 수십 명의 디자이너들이 수많은 공내림과 고민, 정성을 쏟아부은 결과물입니다.
00:11:35따라서 특정 기업에 무엇이 최고인지 정의하는 작업은 이미 완료해 둔 상태인데도, 이를 제대로 활용하지 못하고 있습니다.
00:11:40그러므로 이 브랜드 준수(brand adherence)야말로 거대한 문제이며, 품질의 기준을
00:11:45이 브랜드 준수라는 게 실제로 엄청난 문제라고 생각하며,
00:11:49품질 기준을 훨씬 더 쉽게 높일 수 있는 요인 중 하나입니다.
00:11:54여기에 대한 구체적인 예시를 하나 짚고 넘어가겠습니다.
00:11:58의도와 판단력도 마찬가지죠. 앞서 본 분류기 예시가 좋은 사례였다고 생각합니다.
00:12:04이걸 활용해 저품질 양산형 결과물을 걸러내는 관문으로 삼을 수도 있습니다.
00:12:09아무튼 브랜드 API는 우리가 대중에게 처음 선보이는 제품입니다. 이미 여러 디자인
00:12:14파트너들과 함께 베타 테스트 중이며, 본질적인 기능은 특정 브랜드 URL을 입력받아
00:12:21에이전트가 따르기 좋은 구체적인 구성 요소로 추출해 내는 것입니다.
00:12:25즉, 브랜드처럼 모호한 개념을 에이전트가 쉽게 따를 수 있을 뿐만 아니라
00:12:30우리가 그 결과를 평가하기에도 아주 구조화된 형태로 바꿔주는 것이죠.
00:12:35물론 에이전트가 더 나은 결과물을 만들도록 돕는 역할도 하지만, 이와 동시에
00:12:40에이전트가 정말 제대로 가고 있는지, 이 브랜드 가이드라인에 맞게 잘
00:12:44작동하고 있는지 판단할 방법을 어떻게 추가할 것인가 하는 점도 중요합니다.
00:12:49이것이 품질 향상에 큰 도움이 되는 첫 번째 흐름이라고 할 수 있습니다.
00:12:54물론 지금은 이미 존재하는 브랜드를 예로 들었지만, 만약 여러분이 에이전트나
00:12:59앱을 사용하는데 그 사용자가 마땅한 브랜드가 없는 경우라면 어떨까요?
00:13:03예를 들어 일반 소비자라면 말이죠. 그래서 저희가 만들고 있는 것 중 하나는
00:13:07사전에 미리 구상된 브랜드 시스템들을 모아둔 일종의 저장소, 즉 브랜드 색인입니다.
00:13:13몽환적인 느낌의 결과물을 원한다면, 즉석에서 생성하는 방식 대신
00:13:17처음부터 통일감 있게 잘 설계된 몽환적인 브랜드 시스템을 가져다 쓰는 게 낫습니다.
00:13:23그렇지 않으면 결과가 별로 좋지 않거나 저품질 양산형으로 끝날 수 있으니까요.
00:13:28이게 실제로 어떻게 작동하는지 실제 사례를 보여드리겠습니다.
00:13:31뉴욕 범용 인공지능 회사(General Intelligence Company of New York)라는 멋진 회사가 있습니다.
00:13:36웹사이트가 아주 멋지니 여러분도 꼭 한번 보시기 바랍니다. 아무튼 클로드 디자인에
00:13:41해당 브랜드 스타일로 슬라이드 덱을 만들어달라고 하면 가운데 있는 결과물이 나옵니다.
00:13:47왼쪽에 있는 것이 원래 브랜드이고, 가운데가 기본 설정으로 만든 것입니다.
00:13:51이 과정에서 추출 기능을 사용하면 원본과 훨씬 더 충실도가 높고 세부적인 부분까지
00:13:57제대로 된 결과물이 나옵니다. 이것은 실제 작동 예시를 보여드린 것입니다.
00:14:06하지만 인간의 미감과 최고의 장인 정신은 언제나 깊은 가치를 지닐 것이며,
00:14:13현재 우리의 과제는 이런 논의를 할 자격조차 아직 제대로 갖추지 못한 게 아닌가 싶습니다.
00:14:18어떻게 하면 모델이 미적 감각의 정점에 도달할 수 있는가 하는 문제는 전혀 아닙니다.
00:14:23그보다는 우선 전체적인 기준선을 어떻게 끌어올릴 것인가 하는 점입니다.
00:14:28현재 기준선은 거의 바닥에 가깝기 때문에, 우리가 문제를 어떻게 분해하고
00:14:33어떻게 측정할 것인가에 쏟는 모든 노력은 최소한 이 품질 기준을 높이기 위한 것입니다.
00:14:41이상입니다. 시간 내주셔서 정말 감사합니다. 정말 멋진 시간이었습니다.
00:15:03잠시 후 다시 돌아오겠습니다.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기