미각 훈련하기 — 타이스 카스텔로 브랑코, 테이스트 랩스

AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00좋습니다. 환상적이네요. 다들 만나서 반갑습니다. 저는 타이스입니다. 저는 Taste Labs의 창립자이고요. 우리를 잘
00:00:19모르시는 분들을 위해 말씀드리면, 우리는 몇 주 전에 스타우트(Stout)에서 나왔으며, 우리의 전체적인 사명은 기본적으로
00:00:23어떻게 하면 AI 슬롭(AI Slop)을 없앨 것인가 하는 것입니다. 그것은 나의 개인적인 원수이기도 하죠. 그래서 우리는 이 슬롭 문제를 해결하기 위해서는
00:00:31주관적인 영역을 해독해야 한다고 진심으로 믿습니다. 코딩이나 수학 같은 분야에서 모델과 에이전트를
00:00:36뛰어나게 만드는 데는 정말 많은 노력이 투입되어 왔으며, 이제는 그와 똑같은 모든 노력을
00:00:41디자인이나 글쓰기 같은 분야에서 뛰어난 성능을 발휘하도록 쏟아부어야 할 때입니다. 그래서 디자인은 우리가
00:00:46시작하는 첫 번째 기둥이며, 대단히 흥미진진했습니다. 우리는 주로 두 가지 방식으로 일합니다. 우선 우리는
00:00:52프론티어 랩(Frontier Labs)과 긴밀히 협력하여 그들의 모델을 평가하고, 어디서 성능이
00:00:57저하되는지 파악하며, 무엇을 개선할 수 있을지 이해한 다음, 그 문제를 기본적으로 해결하기 위해 올바른 사후 학습
00:01:01데이터나 환경을 구축합니다. 이 과정의 일부는 디자인처럼 모호하고 거대한 것을
00:01:05어떻게 가져와서, 각 방법으로 가장 잘 해결되는 부분이 무엇인지 식별할 수 있는 수준으로 해체하느냐에 관한 것입니다.
00:01:11디자인의 요소들 중에는 문제를 어느 정도
00:01:15분석해 보면 너무나 구체적이어서 거의 결정론적(deterministic)이 되는 것들이 있습니다. 예를 들어, 만약 여러분이
00:01:20모델이 색상 팔레트를 선택하거나 대비 또는 정렬을 잘하도록 훈련시키려 한다면 말입니다. 그러한 것들은
00:01:25문맥과 상황을 충분히 구체적인 방식으로 정의한다면, 꽤 객관적이거나 적어도
00:01:30대다수의 전문가가 동의할 수 있는 정답에 도달할 수 있는 항목들입니다. 하지만 미학과 같은 다른
00:01:34측면에서는 전문가 간의 의견 차이가 자연스럽게 나타나게 됩니다. 그럴 때는 데이터에 더 가까운
00:01:39방식에 의존하게 되죠. 아무튼 우리는 이러한 모든 문제에 대해 많은 시간을 고민합니다.
00:01:43하지만 반대편에는 모델 레이어를 전혀 건드리지 않고도 말이죠, 어떻게 하면 실제로 에이전트와
00:01:48앱 레이어 기업들이 더 나은 결과물을 만들도록 도울 수 있을까 하는 문제가 있습니다. 거기에 들어가는 요소는 정말 많습니다.
00:01:53애플리케이션 레이어에서는 직면하는 문제들의 성격이 완전히 달라집니다. 기성(off-the-shelf)
00:01:56모델을 사용하고 있기 때문인데, 이 모델들은 스타일 측면에서 무너지는 경향이 있고 평균으로 수렴하는 경향이 있습니다. 그렇다면 어떻게
00:02:02창의성을 시스템에 다시 불어넣을 수 있을까요? 오늘 많이 이야기하게 될 슬롭의 패턴들을 어떻게 피할 수 있을까요? 사용자의
00:02:07사용자 취향이나 브랜드 선호도를 이해하여 어떻게 그
00:02:13따라서 앱 레이어에서는 맥락, 판단, 또는 검증으로서 실제로 해결해야 할 일들이 아주 많으며, 이것이 바로 우리가 양쪽 모두에 걸쳐 일하는 이유입니다.
00:02:19이유이기도 합니다.
00:02:25하지만 아마도 저는 좀 더 철학적인 질문으로 시작해 볼까 합니다. 훌륭한 것이란
00:02:29무엇인지 어떻게 정의할 수 있을까요? 위대함이란 어떻게 정의되는 걸까요? 수학 같은 경우에는 더 쉽습니다, 왜냐하면
00:02:35객관적인 정답이 하나 존재하기 때문입니다. 그리고 훌륭한 것은 곧 옳은 것과 같습니다. 하지만
00:02:40글쓰기나 디자인 같은 분야에서는 훨씬 더 어려워집니다. 훌륭한 트윗이나 훌륭한 예술 작품,
00:02:45혹은 훌륭한 웹사이트를 과연 어떻게 정의할 수 있을까요? 여러분이 시와 교감했거나 커피숍에 들어갔을 때
00:02:52왠지 모르게 느낌이 남다르고 아주 특별하게 다가왔던 게 마지막으로 언제인지 모르겠습니다.
00:02:56아마 그것은 매우 독특하게 느껴졌던 여러 요소들의 조합일 것입니다. 거의 약간은 색다르게 느껴졌고,
00:03:02여러분의 주의를 끌었을 겁니다. 엄청난 정성과 세심한 디테일, 그리고 장인정신을 바탕으로 만들어진 것처럼
00:03:06느껴졌겠지요. 그리고 거의 진정성이라는 느낌을 지니고 있었을 것입니다. 제 생각에는 이것이 바로 오늘날 AI가
00:03:12많이 놓치고 있는 부분입니다. 평범하지 않은 것들을 어떻게 만들어낼 것인가 하는 점이죠.
00:03:16고의적으로 분포(distribution)를 벗어난 결과물을 어떻게 생산해 낼 것인가? 슬롭은 그와 정확히 반대되는 것입니다.
00:03:21때로는 훌륭한 것이 무엇인지 정의하기 어렵지만, 슬롭이 무엇인지는 정의하기가 꽤 쉽다고 생각합니다. 왜냐하면 대다수의 사람들이
00:03:26동의할 테니까요. 반복되는 느낌, 영혼이 없는 듯한 느낌은
00:03:30우리 모두가 지금 AI를 사용할 때 공통으로 느끼는 부분입니다. 그런데 한편으로는 AI가 이 정도까지 발전해서,
00:03:34지구상의 어떤 인간이든 디자이너나 엔지니어가 아니더라도
00:03:39버튼 하나만 누르면 순식간에 파워포인트 전체를 만들거나 웹사이트, 웹 앱을 뚝딱 만들어낼 수 있게 된 것은
00:03:44정말 마법 같은 일이라고 생각합니다. 하지만 그에 따른 결과도 따르기 마련입니다. 콘텐츠 생성 비용이 기본적으로
00:03:490으로 수렴하게 되는 결과가 생겨나죠. 하지만 일반 사람들은
00:03:56반드시 안목(taste)을 갈고닦아 온 것은 아닙니다. 디자이너가 평생에 걸쳐
00:04:01안목을 키우기 위해 쏟아붓는 노력과 작업량을 생각해 보세요. 수많은 것들을 접하고,
00:04:06패턴을 발견하는 법을 배우고, 자신만의 관점을 정립하며, 다소 규범에 어긋나더라도
00:04:11소신 있게 일들을 추진해 나가는 그런 모든 과정 말입니다.
00:04:15무엇을 하지 말아야 할지, 어떻게 절제력을 가질지 배우는 것은 정말 어렵습니다. 일반 사람들은
00:04:21디자인을 비롯한 모든 분야에서 안목을 기를 시간도, 기술도 반드시 충분한 것은 아닙니다.
00:04:25그렇기 때문에 우리가 그냥 “좋아, 슬롭을 해결하는 방법은 모두가 안목을 갖추는 거야”라고 치부해 버리는 것은
00:04:30최악의 시나리오가 될 것입니다. 그것이 반드시 현실적이라고는 생각하지 않으니까요.
00:04:34어떻 하면 우리가 이 문제를 더 잘 이해하여, 일반 사람조차도 훌륭한 것을 창조하고
00:04:39일반인도 멋진 것을 만들고 자신의 취향을
00:04:44쉽게 말이죠. 그래서 그 점이 바로 우리가 집중하고 있는 많은 부분입니다. 아무튼 이 슬롭 현상은
00:04:50새로운 것이 아닙니다. 소셜 미디어가 부상할 때 인터넷상에 계셨던 분들이라면 그 이전에도 수많은 슬롭을 보셨을 겁니다.
00:04:55하지만 저는 AI가 버튼 클릭 한 번으로 무언가를 매우 쉽게 만들어내는,
00:05:00그 과정에 수반되는 무심함과 함께 일종의 가속화 역할을 해왔다고 생각합니다.
00:05:04그리고 슬롭에서 반복되는 세 가지 특징이 있습니다.
00:05:08첫째는 반복성입니다. 똑같은 것이 여러 번, 아주 여러 번 반복되는 것을 보게 되죠.
00:05:15두 번째는 적합성 부족(lack of fit)인데, 이것도 사실 매우 밀접하다고 봅니다.
00:05:19적합성이란 특정한 맥락, 특정한 시점, 특정한 사람에게
00:05:23어떤 것이 올바르게 느껴지도록 만드는 능력입니다. 하지만 갑자기 반복성이 생겨서,
00:05:27한 사람은 애완동물 가게 웹사이트를 요청하고 다른 사람은 금융 회사 웹사이트를 요청했는데
00:05:32그 디자인들이 묘하게 수렴해서 똑같이 보인다면, 그것 참 이상한 일이지 않겠습니까?
00:05:38만약 그것을 정성을 들여 직접 만들었다면 그렇게 수렴하지는 않았을 것입니다.
00:05:42이러한 적합성 부족과 맥락에 대한 이해 부족은 실제로 슬롭으로 이어지는 거대한 문제입니다.
00:05:46그리고 세 번째는 낮은 의도(low intent)일 것입니다. 이는 아마도 사람들이 정말 빠르게 프롬프트를 입력하고
00:05:51원샷으로 무언가를 끝내고 싶어 하는 성향이 섞여 있는 결과일 겁니다.
00:05:54하지만 우리가 구축하고 있는 시스템에는 의도를 해석해 주는 부분이 빠져 있습니다.
00:05:58어떻게 하면 사용자를 도울 수 있을까요?
00:06:01사용자가 자신의 의도를 더 잘 이해하도록 도울 수 있을까요? 그리하여 여러분이 만들고자 하는 것에
00:06:05더 많은 색채와 맥락을 더할 수 있도록 말입니다.
00:06:12좋습니다. 저는 무언가를 고치려면 먼저 그것을 측정해야 하고, 먼저 그것을 이해해야 한다고 굳게 믿는 사람입니다.
00:06:17그것이 바로 우리가 이러한 도메인들을 좀 더 검증 가능한 것으로 바꾸어
00:06:21측정 지표를 붙일 수 있는 방법에토록 집중하는 이유입니다.
00:06:27자, 이제 저와 함께 약간의 연구 여정을 떠나보시죠.
00:06:31우리는 기본적으로 슬롭을 측정할 수 있는지 알아내고자 했습니다. 과연 이를 정량적으로 측정하고
00:06:36포착할 수 있을까요? 그리고 그 모습은 과연 어떨까요? 그래서 우리는 지난 10년 동안의 웹사이트
00:06:43200만 개 이상을 분석했습니다. 웨이백 머신(Wayback Machine) 스타일로 말이죠.
00:06:48이를 통해 디자인 전반의 모든 트렌드를 이해하고자 했습니다. 인터넷은 어떻게 변하고 있을까? 디자인은 시간에 따라 어떻게 변하고 있을까? 그러자 두 가지 흥미로운 점이 발견되었습니다.
00:06:55그리고 우리는 또한 비교를 위해 일련의 디자인 웹사이트들을 합성적으로 생성하기도 했습니다.
00:07:00사람이 만든 사이트는 AI가 생성한 사이트와 어떻게 비교될까? 흥미로운 점들이 몇 가지 있었습니다.
00:07:07첫째는 이미 AI 이전에도 인터넷상에서 약간의 수렴 현상이 나타나고 있었다는 점입니다.
00:07:13즉, 인터넷이 점점 더 동조화(homogenous)되고, 더 유사한 색상 팔레트를 사용하며, 더 유사한 레이아웃을
00:07:18사용하는 경향을 볼 수 있었는데, 이는 아마도 이러한 트렌드가 더 빠르게
00:07:24퍼져나간 결과물이라고 할 수 있습니다. 하지만 AI와 함께라면, 이러한 반복 현상이 훨씬 더 많이 일어나고
00:07:28맥락과 관계없이 거의 더 잘 식별되는 것을 볼 수 있었습니다.
00:07:33따라서 완전히 다른 범주들 속에서도 매우 유사한 패턴들이 나타났습니다. 그래서 우리는
00:07:38이를 프로브(probes)라고 부르는 것을 구축했습니다. 기본적으로 두 가지 작업을 수행했는데요. 이 모든 데이터에 대해
00:07:44패턴 마이닝을 수행하여 이 모든 사이트에서 추출할 수 있는 특징이 무엇인지 파악했습니다.
00:07:47색상, 타이포그래피, 레이아웃, 오디언스 등 우리가 더 객관적으로 만들 수 있는 특성들은 무엇일까요?
00:07:53이것들을 어떻게 거의 구조화된 형태로 정제할 수 있을까요? 그리고 나서
00:07:58이러한 프로브들을 어떻게 훈련시킬 것인가? 이것들을 베이비 분류기(baby classifiers)라고 생각해보세요. 이 하나의 특성을 포착하는
00:08:03능력을 어떻게 훈련할 것인가? 그리고 이러한 모든 슬롭 사이트들에 대해 우리는 식별해 내기 시작했습니다.
00:08:09이 사이트가 AI 슬롭일 가능성이 매우 높음을 의미하는 프로브는 과연 무엇일까요? 특히
00:08:16이들을 결합하기 시작하고 이 중 여러 개가 동시에 발생하는 빈도를 보게 되면,
00:08:20실제로 슬롭을 측정하고 예측할 수 있을 가능성이 매우 높아지게 됩니다. 그리고 우리는 엄청나게 높은 수준의
00:08:26예측 능력을 확인했으며, 그것을 보는 것은 정말 멋진 일이었습니다. 이것은 참고로
00:08:30LLM에게 해당 결과물이 인간의 훌륭한 품질인지 아니면 AI가 생성한 슬롭인지 판단해 달라고 요구하는 대부분의
00:08:36LLM-as-a-judge 방식보다 더 뛰어난 성능을 보였습니다. 그래서 그 점을 확인하는 것이 꽤 멋졌습니다.
00:08:40그리고 그것은 AI에서 우리가 보는 이 패턴이 슬롭 속에서 실제로 관찰할 수 있는 정량적인 현상임을 잘 보여준다고 생각합니다.
00:08:47정말 멋진 일이죠. 하지만 물론 여기서 멈추고 싶지는 않습니다.
00:08:51측정하는 데서 그치고 싶지 않거든요. 이걸 해결하고도 싶고요. 그래서 앞서 말씀드린 것처럼,
00:08:56콘텐츠 제작 비용이 사실상 0으로 수렴함에 따라, 앞으로 훨씬 더 중요해지고
00:09:01비용을 지불하게 되는 가치는 바로 '판단력'입니다. '취향'이라는 단어 대신 굳이 '판단력'이라고 쓰고 싶네요.
00:09:07무엇이 옳은지 분별하는 능력, 문제를 세분화하여 제대로 이해하고
00:09:11그에 대한 해결책을 만들어내는 바로 그 능력 말입니다. 따라서 인간의 판단력이라는
00:09:16측면은 그 어느 때보다 가치 있다고 생각합니다.
00:09:19하지만 동시에 이런 측면도 있죠. 과연 어떻게 올바른 도구와 시스템을 구축하여
00:09:23이 문제의 일부분을 해결할 것인가 하는 점입니다.
00:09:27그렇다면 저의 숙적이나 다름없는 저질 콘텐츠(slop)와는 어떻게 싸워야 할까요? 참고로 이와 관련해 모델 레이어에서
00:09:34저질 콘텐츠를 어떻게 방지할 것인가에 대한 많은 논의가 오가고 있습니다. 예를 들면 모델을 더 우수하게 만들고,
00:09:39기준을 더 높이려면 어떻게 해야 할까 같은 이야기죠. 물론 이 역시 반드시 해결해야 하며
00:09:43저희도 이를 해결하기 위해 열심히 노력하고 있습니다. 하지만 저는 추론 시점(inference time)의 문제가
00:09:48그못지않게, 혹은 어쩌면 그 이상으로 중요하다고 생각합니다. 바로 그때가 최종 사용자 층과 상호작용하는 시점이기 때문입니다.
00:09:53이러한 맥락과 의도를 이해하는 과정은 추론이 이루어지는 순간에 발생합니다.
00:09:57따라서 단순히 모델 성능만 높이고 이 문제를 해결하지 않는다면 저질 콘텐츠의 범람은 계속될 것입니다.
00:10:01그러니 몇 가지 세부적인 부분과 더불어, 저희가 이 문제를 해결하기 위해 고민해 온 방식이나
00:10:07구축한 솔루션들을 몇 가지 나누어 설명해 드리겠습니다. 예를 들어,
00:10:11반복성 같은 문제를 해결하기 위해 저희가 작업 중인 것이 있습니다. 제가 별명으로 붙이기를,
00:10:15공식 명칭이 될지는 모르겠지만, 가칭 '창의성 API'라고 부르는 것입니다. 어떻게 하면
00:10:18에이전트에게 영감을 불어넣는 시스템을 만들어, 에이전트가 기존의 평균적인
00:10:23결과물에서 벗어나 실제로 분포 외(out of distribution)의 결과물을
00:10:27생성할 수 있게 할까요? 저품질 콘텐츠 사이트들에서 보듯 똑같은 평균값만 찍어내는 것이 아니라요.
00:10:32이것이 바로 실질적인 방법 중 하나로, 의도적으로 분포를 벗어난 결과물을 만들어냄으로써
00:10:36전반적인 품질을 향상시킬 수 있습니다. 그리고 이건 단순히 무작위성을 부여하는 것과는 다릅니다.
00:10:43단순히 모델의 temperature(창의성 수치)를 높이고 잘 되기를 행운처럼 비는 게 아니라는 거죠.
00:10:47오히려 특정 도메인에서의 규칙이나 기대치가 무엇인지를 파악하는 과정에 가깝습니다.
00:10:52예를 들어, 스타트업 피칭을 위한 슬라이드 덱을 요청한다고 해봅시다.
00:10:57좋은 피칭 덱은 어떤 모습일까요? 그리고 어떻게 해야 규칙을 의도적으로 깨뜨리면서도
00:11:03더 창의적인 결과물을 만들어낼 수 있을까요? 보통 창의성이란 무작위성이 아니니까요.
00:11:07그 상황에 전혀 어울리지 않는 엉뚱한 짓을 하는 게 아니라는 겁니다. 의도적으로
00:11:12몇 가지 부분에서는 일탈하되, 해당 카테고리가 요구하는 기대치는 계속 유지하는 식이죠.
00:11:19이것이 첫 번째로 저희가 작업 중인 부분입니다. 두 번째 당면 과제인 적합성 문제에 대해 이야기하자면,
00:11:23흥미롭게도 디자이너이신 분들은 잘 아시겠지만, 멋진 브랜드를 만드는 데는 엄청난 노력이 듭니다.
00:11:28훌륭한 브랜드는 수십 명의 디자이너들이 수많은 공내림과 고민, 정성을 쏟아부은 결과물입니다.
00:11:35따라서 특정 기업에 무엇이 최고인지 정의하는 작업은 이미 완료해 둔 상태인데도, 이를 제대로 활용하지 못하고 있습니다.
00:11:40그러므로 이 브랜드 준수(brand adherence)야말로 거대한 문제이며, 품질의 기준을
00:11:45이 브랜드 준수라는 게 실제로 엄청난 문제라고 생각하며,
00:11:49품질 기준을 훨씬 더 쉽게 높일 수 있는 요인 중 하나입니다.
00:11:54여기에 대한 구체적인 예시를 하나 짚고 넘어가겠습니다.
00:11:58의도와 판단력도 마찬가지죠. 앞서 본 분류기 예시가 좋은 사례였다고 생각합니다.
00:12:04이걸 활용해 저품질 양산형 결과물을 걸러내는 관문으로 삼을 수도 있습니다.
00:12:09아무튼 브랜드 API는 우리가 대중에게 처음 선보이는 제품입니다. 이미 여러 디자인
00:12:14파트너들과 함께 베타 테스트 중이며, 본질적인 기능은 특정 브랜드 URL을 입력받아
00:12:21에이전트가 따르기 좋은 구체적인 구성 요소로 추출해 내는 것입니다.
00:12:25즉, 브랜드처럼 모호한 개념을 에이전트가 쉽게 따를 수 있을 뿐만 아니라
00:12:30우리가 그 결과를 평가하기에도 아주 구조화된 형태로 바꿔주는 것이죠.
00:12:35물론 에이전트가 더 나은 결과물을 만들도록 돕는 역할도 하지만, 이와 동시에
00:12:40에이전트가 정말 제대로 가고 있는지, 이 브랜드 가이드라인에 맞게 잘
00:12:44작동하고 있는지 판단할 방법을 어떻게 추가할 것인가 하는 점도 중요합니다.
00:12:49이것이 품질 향상에 큰 도움이 되는 첫 번째 흐름이라고 할 수 있습니다.
00:12:54물론 지금은 이미 존재하는 브랜드를 예로 들었지만, 만약 여러분이 에이전트나
00:12:59앱을 사용하는데 그 사용자가 마땅한 브랜드가 없는 경우라면 어떨까요?
00:13:03예를 들어 일반 소비자라면 말이죠. 그래서 저희가 만들고 있는 것 중 하나는
00:13:07사전에 미리 구상된 브랜드 시스템들을 모아둔 일종의 저장소, 즉 브랜드 색인입니다.
00:13:13몽환적인 느낌의 결과물을 원한다면, 즉석에서 생성하는 방식 대신
00:13:17처음부터 통일감 있게 잘 설계된 몽환적인 브랜드 시스템을 가져다 쓰는 게 낫습니다.
00:13:23그렇지 않으면 결과가 별로 좋지 않거나 저품질 양산형으로 끝날 수 있으니까요.
00:13:28이게 실제로 어떻게 작동하는지 실제 사례를 보여드리겠습니다.
00:13:31뉴욕 범용 인공지능 회사(General Intelligence Company of New York)라는 멋진 회사가 있습니다.
00:13:36웹사이트가 아주 멋지니 여러분도 꼭 한번 보시기 바랍니다. 아무튼 클로드 디자인에
00:13:41해당 브랜드 스타일로 슬라이드 덱을 만들어달라고 하면 가운데 있는 결과물이 나옵니다.
00:13:47왼쪽에 있는 것이 원래 브랜드이고, 가운데가 기본 설정으로 만든 것입니다.
00:13:51이 과정에서 추출 기능을 사용하면 원본과 훨씬 더 충실도가 높고 세부적인 부분까지
00:13:57제대로 된 결과물이 나옵니다. 이것은 실제 작동 예시를 보여드린 것입니다.
00:14:06하지만 인간의 미감과 최고의 장인 정신은 언제나 깊은 가치를 지닐 것이며,
00:14:13현재 우리의 과제는 이런 논의를 할 자격조차 아직 제대로 갖추지 못한 게 아닌가 싶습니다.
00:14:18어떻게 하면 모델이 미적 감각의 정점에 도달할 수 있는가 하는 문제는 전혀 아닙니다.
00:14:23그보다는 우선 전체적인 기준선을 어떻게 끌어올릴 것인가 하는 점입니다.
00:14:28현재 기준선은 거의 바닥에 가깝기 때문에, 우리가 문제를 어떻게 분해하고
00:14:33어떻게 측정할 것인가에 쏟는 모든 노력은 최소한 이 품질 기준을 높이기 위한 것입니다.
00:14:41이상입니다. 시간 내주셔서 정말 감사합니다. 정말 멋진 시간이었습니다.
00:15:03잠시 후 다시 돌아오겠습니다.

핵심 요약

AI 생성 콘텐츠의 저품질 양산 문제를 해결하기 위해 주관적인 디자인 영역을 해체하고, 브랜드 준수 및 분포 외 결과물을 생성하는 시스템과 측정 지표를 도입해야 한다.

하이라이트

  • 테이스트 랩스는 AI 생성 콘텐츠의 획일성과 저품질 양산 문제를 해결하기 위해 설립되었다.

  • 200만 개 이상의 웹사이트를 10년간 분석하여 AI 슬롭(Slop) 현상을 정량적으로 측정하고 예측하는 프로브 분류기를 구축했다.

  • AI 생성 콘텐츠의 세 가지 특징은 반복성, 적합성 부족, 낮은 의도이다.

  • 브랜드 URL을 입력받아 에이전트가 따를 수 있는 구조화된 구성 요소로 추출하는 브랜드 API를 개발했다.

  • 콘텐츠 제작 비용이 0으로 수렴함에 따라 무엇이 옳은지 분별하는 인간의 판단력과 취향이 핵심 가치로 부상하고 있다.

타임라인

디자인 영역의 주관성 해소와 테이스트 랩스의 역할

  • 테이스트 랩스의 전체적인 사명은 AI 슬롭을 없애는 것이다.
  • 디자인과 같은 주관적인 영역을 해체하여 객관화 가능한 규칙을 도출한다.
  • 앱 레이어에서는 모델의 평균 수렴 경향과 스타일 붕괴 문제를 해결해야 한다.

코딩이나 수학 분야에 비해 디자인이나 글쓰기 같은 주관적인 영역에서는 모델 성능을 높이기 위한 노력이 부족했다. 테이스트 랩스는 프론티어 랩과 협력하여 모호한 디자인 요소를 결정론적인 규칙과 객관적 정답으로 도출할 수 있도록 사후 학습 데이터를 구축한다. 또한 기성 모델이 평균으로 수렴하는 스타일 붕괴 현상을 막고 창의성을 불어넣는 작업을 수행한다.

AI 슬롭의 정의와 세 가지 반복적 특징

  • 수학적 정답과 달리 훌륭한 예술이나 디자인은 독특함과 진정성을 지닌다.
  • 콘텐츠 생성 비용이 0으로 수렴하면서 안목과 절제력을 기르기 어려워졌다.
  • 슬롭의 세 가지 특징은 반복성, 적합성 부족, 낮은 의도이다.

버튼 하나로 웹사이트나 문서를 쉽게 만들 수 있게 되면서 콘텐츠 생성 비용이 사라졌지만, 일반 사람들은 평생에 걸쳐 안목을 기를 시간이 부족하다. 이로 인해 영혼이 없고 반복적인 저품질 콘텐츠인 슬롭이 양산된다. 슬롭은 동일한 결과물이 반복되는 반복성, 특정 맥락에 맞지 않는 적합성 부족, 빠른 일회성 프롬프트로 인한 낮은 의도라는 공통된 특징을 보인다.

웹사이트 데이터 분석을 통한 슬롭 측정

  • 지난 10년간의 웹사이트 200만 개 이상을 분석하여 디자인 트렌드를 파악했다.
  • 색상, 타이포그래피, 레이아웃 등의 특성을 추출하는 베이비 분류기를 구축했다.
  • 구축된 프로브는 기존의 LLM-as-a-judge 방식보다 뛰어난 예측 능력을 보여준다.

슬롭을 해결하기 위해 지난 10년간의 웹사이트 데이터와 합성 생성된 디자인을 비교 분석했다. 색상과 레이아웃 등 객관화할 수 있는 특성들을 패턴 마이닝하여 특징을 추출하고, 이를 식별하는 베이비 분류기를 훈련시켰다. 이를 통해 AI 슬롭 발생 여부를 높은 정확도로 예측하고 정량적으로 측정할 수 있게 되었다.

창의성 API와 브랜드 준수를 통한 품질 향상

  • 추론 시점에서 맥락과 의도를 이해하는 것이 저품질 콘텐츠 방지에 필수적이다.
  • 창의성 API는 의도적으로 분포를 벗어난 결과물을 생성하여 반복성을 해결한다.
  • 브랜드 API는 URL을 입력받아 에이전트가 따를 수 있는 구조화된 가이드라인을 추출한다.

모델 성능 향상만큼이나 최종 사용자와 상호작용하는 추론 시점의 대응이 중요하다. 무작위성을 부여하는 것이 아니라 도메인 규칙을 유지하면서 의도적으로 일탈하는 창의성 API를 통해 평균적인 결과물에서 벗어난다. 또한 기존 브랜드의 디자인 자산을 추출하는 브랜드 API와 사전 설계된 브랜드 색인을 통해 에이전트와 앱의 결과물 품질을 높인다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기