피지컬 AI의 다음 난제, 알맞은 비디오 데이터 찾기 — 라파엘 레비(Rafael Levi), Bright Data
AAI Engineer
Computing/SoftwareBusiness NewsInternet Technology
Transcript
00:00:00안녕하세요, 여러분. 환영합니다. 저를 보러 와주신 분들께 감사드립니다. 그리고
00:00:21그냥 자리를 지켜주고 계신 분들께도 감사드립니다. 즐거운 시간이 되도록 새로운 내용을 알려드리겠습니다.
00:00:26다시 소개해 드리자면, 제 이름은 라파엘이고 브라이트 데이터에서 8년 이상 근무하며 데이터를 수집하고 혁신을 도모하고 있습니다.
00:00:38오늘 저는 에이전틱 세계 모델 학습을 위한 비디오 디스커버리에 대해 말씀드리고자 하며, 이게 무엇인지 잠시 후에 설명해 드리겠습니다.
00:00:48그렇다면 오늘날 보고, 이해하고, 행동할 수 있는 시스템을 구축하려면 무엇이 필요할까요?
00:00:56우리는 AI가 무엇인지 파악했고 지속적으로 개선하고 있으니 그 부분은 어느 정도 해결되었습니다.
00:01:04하지만 이제 어려운 부분은 어떤 데이터를 제공하느냐입니다. 데이터 없는 AI는 그저 깡통에 불과하니까요.
00:01:13과거 역사를 잠시 돌이켜볼까요? 2022년에 구글은 이미지와 현실 세계의 행동으로 로봇을 학습시켰습니다.
00:01:25이후 비약적인 발전이 있었죠. 2023년에는 AI가 실제로 여러 로봇을 제어하기 시작했습니다.
00:01:372024년에는 오픈 소스가 공개되었습니다. 여기서 판도가 바뀌었죠. 오픈 소스가 생기자 모든 연구소가 AI에 접근하여 로봇에 적용하기 시작했습니다.
00:01:51이제 이러한 모델들은 휴머노이드 로봇을 구동하고 있습니다. 여기에 있는 대부분은 물론 원격 제어되는 것이 보이지만요.
00:02:00하지만 샌프란시스코에서는 웨이모가 운전자 없이 주행하고 있습니다. 정말 멋지지 않나요?
00:02:07처음 탔을 때는 죽는 줄 알았지만, 실제로는 정말 쾌적했습니다.
00:02:12그렇다면 어떻게 운전을 배웠을까요? 블랙박스 카메라 영상을 학습하며 스스로 학습해 나간 것입니다.
00:02:22모든 차에는 블랙박스가 있으니까요. 이를 AI에 제공하면 기계를 조작하는 방법을 스스로 알아낼 수 있습니다.
00:02:31말씀드렸듯이 AI 자체는 더 이상 어려운 부분이 아니며, 진짜 난관은 데이터입니다. 이것이 제가 이야기하고자 하는 주제입니다.
00:02:39대화형 LLM에는 수조 개의 단어와 텍스트가 존재합니다. 따라서 LLM을 학습시킬 텍스트 데이터는 아주 풍부합니다.
00:02:49이미지 생성 분야 역시 수십억 개의 라벨링된 이미지가 있어 거대한 데이터베이스가 구축되어 있습니다.
00:02:56하지만 로보틱스의 경우 동작하는 로봇 영상이 100만 개 정도에 불과해 매우 제한적이고 적은 데이터셋만 존재합니다.
00:03:09그래서 현재 많은 기업이 취하는 방식은 사람들에게 돈을 주고 특정 행동을 촬영하게 하는 것입니다.
00:03:20"문 열어보는 모습을 녹화해 주세요"라든가 "의자에 앉는 모습을 녹화해 주세요"라고 요청하죠.
00:03:28하지만 여기서 문제는 무언가를 하라고지시를 받으면 행동이 자연스럽지 않다는 점입니다.
00:03:34저는 이걸 '지시된 데이터'라고 부르는데, 촬영 목적으로 문을 열 때의 행동은
00:03:40그냥 집에 들어갈 때와는 완전히 다릅니다. 움직임 자체가 완전히 달라지죠.
00:03:45그렇다면 이 데이터가 로봇 학습에 적합할까요? 제 생각에는 아닙니다. 편향된 데이터이며 동일한 결과를 내지 못합니다.
00:03:53결국 직관적으로 학습했을 때만큼 로봇이 효과적으로 작동하지 못하겠죠.
00:03:59슬라이드에 몇 가지 예시를 담아봤습니다.
00:04:06인위적으로 연출된 데이터는 자연스럽게 수집된 데이터와 결코 같지 않습니다.
00:04:12또한 사람들은 카메라 앞에 서면 행동이 완전히 달라집니다.
00:04:16아시다시피 카메라를 울렁거려하는 사람들은 렌즈를 가져다 대는 순간 태도가 변하죠.
00:04:23하지만 현실 세계에서의 자연스러운 모습은 완전히 다릅니다.
00:04:27이것이 바로 우리 브라이트 데이터가 해결하려는 문제입니다.
00:04:35그렇다면 왜 기존의 데이터 소스로는 부족할까요?
00:04:37시뮬레이션은 가상이라 비용이 저렴하지만, 다들 비디오 게임 해보셨잖아요?
00:04:44게임 속 물리엔진이 정교해졌다고는 해도 로봇을 학습시키기엔 부족합니다.
00:04:50사람이 로봇을 수동 제어하는 방식도 가능하지만, 하루에 몇 시간이나 녹화할 수 있을까요?
00:04:57대규모 데이터를 얻으려면 얼마나 많은 인력이 필요할까요?
00:05:01매일 8시간씩 녹화한다고 해봅시다.
00:05:041년에 과연 몇 시간이나 확보할 수 있을까요?
00:05:07확장성이 떨어집니다.
00:05:09기존에 구축된 데이터셋도 있지만 앞서 말씀드렸듯 규모가 작습니다.
00:05:13현재로서는 약 100만 개의 영상뿐이죠.
00:05:15그렇다면 대안은 무엇일까요?
00:05:17대안은 바로 웹입니다.
00:05:20유튜브를 예로 들어봅시다.
00:05:22유튜브에 영상이 얼마나 많을까요?
00:05:25한 50억 개쯤 될까요?
00:05:28그 영상들 속에 로봇이 복제할 수 있는 행동이 얼마나 많이 들어있을까요?
00:05:34한번 생각해보세요.
00:05:351인칭 시점으로 문을 여는 영상이 얼마나 될 것 같으신가요?
00:05:42수백만 시간에 달합니다.
00:05:43놀라실 겁니다.
00:05:45웹 영상에는 매일 중력과 다양한 움직임이 담깁니다.
00:05:53원인과 결과, 특히 사고 영상은 가장 확실한 인과관계를 보여주죠.
00:06:00사람들이 물체를 다루는 수십억 시간의 데이터가 존재합니다.
00:06:04로봇 학습에 아주 훌륭한 자료지만, 문제는 무엇일까요?
00:06:08불필요한 노이즈가 너무 많다는 점입니다.
00:06:12예를 하나 들어볼까요?
00:06:14메타가 학습시킨 AI 모델 중 하나는 약 100만 시간 분량의 실제 영상 데이터를 학습했습니다.
00:06:21그리고 실제 로봇을 제어하는 데는 단 62시간의 로봇 데이터만 필요했습니다.
00:06:29생각해보면, 데이터는 공개적으로 수집된 것이었습니다.
00:06:33일반적인 영상들로 로봇을 학습시킨 뒤 단 62시간의 로봇 학습만으로 움직이기 시작했죠.
00:06:41시뮬레이션 없이 빠르게 자율주행 로봇 기술을 구현해낸 것입니다.
00:06:52하지만 일반 영상은 로봇이 어떻게 움직여야 하는지 보여주지 않죠?
00:06:54사람이 컵에 물을 따르는 영상이 로봇에게 무슨 유용한 정보가 되겠냐고 생각하실 수 있습니다.
00:07:01하지만 영상 속 행동을 AI가 구분하고 실제로 학습하게 하는 방식들이 존재합니다.
00:07:09두 프레임을 연속으로 비교하며 AI가 움직임의 차이를 측정합니다.
00:07:15이미지 A와 이미지 2 사이에서 발생하는 미세한 움직임 변화를
00:07:21AI가 측정할 수 있는 것이죠.
00:07:24영상 전체에 걸쳐 이 과정을 계속 수행하면 AI가 각도, 거리 등
00:07:30로봇 학습에 필요한 모든 것을 알아낼 수 있습니다.
00:07:34따라서 센서 데이터가 반드시 필요한 것은 아니지만, 유튜브 등에서 추출하거나
00:07:41다운로드한 영상만으로 100% 완벽한 데이터를 얻기는 어렵습니다.
00:07:48추가적인 후처리 작업이 필요하긴 하지만, 이미 가용한 방식입니다.
00:07:53기술은 이미 존재하며 가공하기만 하면 됩니다.
00:07:58예를 몇 가지 더 들어볼까요?
00:07:59엔비디아의 경우 코스모스 로봇을 학습시킬 때 비디오의 약 96%를 버립니다.
00:08:07이게 무슨 의미일까요?
00:08:09100만 시간 분량의 영상을 다운로드해도
00:08:12실제 쓸모있는 부분은 4%에 불과하고
00:08:15나머지는 전부 폐기된다는 뜻입니다.
00:08:16연산 자원 낭비이자,
00:08:18대역폭 낭비이고,
00:08:19저장 공간 낭비입니다.
00:08:21막대한 비용이 낭비되는 것이죠.
00:08:23스테이블 비디오 디퓨전 역시 다운로드하는 영상의 74%를 버리고 있습니다.
00:08:30브라이트 데이터는 이 문제를 해결하고 한 단계 더 나아가고자 합니다.
00:08:37저희가 제안하는 방식은 '선 검색, 후 수집'입니다.
00:08:41비디오를 미리 인덱싱하여 특정 행동을 직접 검색할 수 있도록 하는 것입니다.
00:08:50문 열기 행동을 예로 들었으니 계속 이 예시를 사용해봅시다.
00:08:55저희 플랫폼에서는 매우 구체적인 정보 입력이 가능합니다.
00:09:01"설거지하는 사람", "티셔츠 개는 사람" 같은 검색어로요.
00:09:06그러면 해당 동작이 포함된 비디오 클립만을 추출해 제공합니다.
00:09:13이게 무슨 의미일까요?
00:09:16데이터 수집 시 손실을 최소화할 수 있다는 의미입니다.
00:09:22저장 공간과 대역폭의 낭비도 줄어들죠.
00:09:25작동 방식을 조금 더 설명해 드리겠습니다.
00:09:27먼저 찾고자 하는 대상을 정의합니다.
00:09:32그러면 사전 인덱싱된 수십억 개의 비디오를 검색합니다.
00:09:36키워드가 아닌 '행동' 단위로 검색하죠.
00:09:39그리고 바로 사용할 수 있는 클립을 제공합니다.
00:09:43물론 이미 학습에 적합하도록 정제된 상태입니다.
00:09:47움직임이나 거리 센서 등에 맞게 약간의 가공만 거치면 됩니다.
00:09:52그러면 로봇에 즉시 입력할 수 있는 상태가 됩니다.
00:09:57저희 플랫폼이 실제 작동하는 모습을 담은 시연 영상을 준비했습니다.
00:10:02재생 버튼을 눌러보겠습니다.
00:10:07"싱크대에서 손으로 설거지하며 접시의 기름때를 제거하는 사람,
00:10:12수세미와 세제 사용, 헹굼 및 건조대에 접시 놓기 포함, 손 상호작용 클로즈업"
00:10:19지금 수십억 개의 비디오를 검색하는 과정이 진행 중입니다.
00:10:24이 녹화 영상은 조금 이전 것입니다.
00:10:26이 영상에서는 약 1억 개만 색인되었지만, 지금은 11억 개까지 늘어났습니다.
00:10:31여러분의 시간을 아끼기 위해 영상을 약간 배속 처리했습니다.
00:10:35검색 결과로 사람들이 설거지하는 비디오 클립들을 추출해줍니다.
00:10:41찾아낸 영상들이 바로 여기에 표시됩니다.
00:10:47검색된 일부 영상은 설거지와 직접 관련이 없을 수도 있습니다.
00:10:50주방 청소에 관한 영상일 수도 있고,
00:10:52다른 작업을 다룬 영상일 수도 있죠.
00:10:54또 다른 예시입니다.
00:10:55예를 들어 "다양한 옷을 접는 사람"입니다.
00:10:59그렇죠?
00:10:59설명을 조금 더 추가해봅시다.
00:11:01구체적인 설명을 제공할수록 더 정확한 결과를 얻을 수 있습니다.
00:11:06다시 배속으로 돌려보겠습니다.
00:11:08확인해보죠.
00:11:14어떤 검색어든 가능하다는 점을 강조하고 싶습니다.
00:11:16화장하는 모습도 가능합니다.
00:11:17특정 브랜드의 제품이 노출되는 영상 클립을 찾고 싶다면
00:11:21그러한 결과 역시 제공할 수 있습니다.
00:11:23사람들이 옷을 접는 모습이 보입니다.
00:11:26이제 로봇에게 옷 개는 방법을 학습시킬 수 있는 것이죠.
00:11:34당연히 모든 기능은 API로 활용할 수 있습니다.
00:11:36수동으로 직접 작업하시는 것을 바라는 사람은 없으니까요.
00:11:39맞죠?
00:11:39따라서 API를 통해 간편하게 호출할 수 있습니다.
00:11:41비디오의 스니펫과 URL을 반환받게 됩니다.
00:11:46직접 시청하고 싶으신 경우 원본 비디오 링크도 제공해 드립니다.
00:11:49하지만 여기서 핵심은 로봇을 학습시킬 수 있는 비디오 스니펫을 제공한다는 점입니다.
00:11:57여기 계신 분들 중에 실제로 로봇을 학습시키는 분이 계실지는 잘 모르겠네요.
00:12:01그래서 이것이 얼마나 유용한지 다른 예시를 하나 더 들어드리겠습니다.
00:12:04여러분에게 특정 브랜드가 있다고 해봅시다.
00:12:06그리고 여러분의 브랜드가 어떤 비디오에서 시연되고 있는지 알고 싶다고 가정해 보죠.
00:12:13비디오 제목은 중요하지 않습니다. 제품에 관한 제목이 아닐 수도 있으니까요.
00:12:19그저 누군가 팟캐스트를 진행하거나 뭔가를 녹화하는 영상일 수 있죠.
00:12:22하지만 영상 속에 한 여성이 화장을 하고 있는 모습이 보이고,
00:12:25탁자 위에 올려진 화장품이 여러분의 브랜드 제품인 것이 확인됩니다.
00:12:30이제 여러분은 자사 브랜드 제품이 사용된 모든 비디오를 갑자기 찾아낼 수 있게 됩니다.
00:12:34어떤 비디오든 말이죠.
00:12:35그렇죠?
00:12:35비디오 제목만 검색해서는 이런 걸 찾을 수 없습니다.
00:12:38비디오 인덱싱을 이용하면 관심 있는 구체적인 장면들을 실제로 찾아낼 수 있습니다.
00:12:45나무에서 사과가 떨어지는 장면처럼
00:12:47다양한 것들을요.
00:12:48그렇다면 무엇이 반환될까요?
00:12:50저희는 이 타임스탬프를 제공합니다.
00:12:52일치 점수도 제공해 드리는데,
00:12:53검색어와 얼마나 유사한지를 나타냅니다.
00:12:55그리고 당연히 프레임 수도 포함됩니다.
00:12:57찾고 계신 내용에 해당하는 프레임이 얼마나 되는지 말이죠.
00:13:03그렇다면 이것이 무엇을 바꿔놓을까요?
00:13:06정말 많은 것을 바꿔놓습니다.
00:13:07우선 낭비가 줄어듭니다.
00:13:09수백만 시간 분량의 비디오를 다운로드할 필요가 없습니다.
00:13:12관심 있는 정확하고 특정 동작들만
00:13:16콕 집어서 얻을 수 있으니까요.
00:13:20다시 말씀드리지만, 이는 로봇 학습에 매우 핵심적인 부분입니다.
00:13:24노이즈가 생기면 문제나 환각 현상(할루시네이션)이 발생하거든요.
00:13:28맞죠?
00:13:29이 기술은 그러한 노이즈를 제거해 줍니다.
00:13:34이게 어디에 유용할까요?
00:13:35로봇뿐만 아니라 자율주행 분야에도 당연히 유용합니다.
00:13:38예를 들어 웨이모(Waymo) 같은 경우 말이죠.
00:13:39그렇죠?
00:13:40블랙박스 영상 데이터를 통해 학습하는데,
00:13:43유튜브에는 수억 시간 분량의 블랙박스 영상이 존재합니다.
00:13:46엄청난 양의 블랙박스 영상이죠.
00:13:47사고 영상 즐겨 보시는 분 계신가요?
00:13:49블랙박스 사고 영상 같은 거요.
00:13:52다들 한 번쯤은 보셨을 겁니다.
00:13:53러시아의 난폭 운전 영상 같은 것들 말이죠.
00:13:55그렇죠?
00:13:56바로 이런 걸 말하는 겁니다.
00:13:58맞죠?
00:13:58영상은 이미 널려 있어요.
00:14:01그렇죠?
00:14:01신호를 위반하는 사람,
00:14:02빨간불에 정지하는 사람,
00:14:04좌회전하는 사람,
00:14:05우회전하는 사람 등등.
00:14:06기타 등등의 모든 장면이요.
00:14:06이 모든 게 학습용으로 정말 유용한 데이터가 될 수 있습니다.
00:14:11다른 월드 모델에도 마찬가지입니다.
00:14:13물리학 같은 거요.
00:14:14맞죠?
00:14:14로봇도 물리를 이해해야 합니다.
00:14:16중력이 무엇인지,
00:14:18어떻게 앉는지,
00:14:18어떻게 걷는지,
00:14:19어떻게 움직이는지를요.
00:14:21물론 직접 녹화하는 방법도 있습니다.
00:14:25요즘 몇몇 분들과 이야기를 나눠보면,
00:14:27수백만 명의 사람들에게 영상을 촬영하게 하더군요.
00:14:30“문 여는 모습 좀 녹화해 주실래요?” 하면서요.
00:14:33정말 말도 안 되는 일이죠.
00:14:34온라인에 모든 정보가 있는데 왜 백만 명이나 되는 사람을 시켜서 그걸 촬영하겠습니까?
00:14:39온라인은 세상에서 가장 거대한 데이터베이스 중 하나입니다.
00:14:43단지 사람들이 활용하기가 그리 쉽지 않을 뿐이죠.
00:14:46지금 우리에게 제공되는 유일한 검색 방식은 동영상 제목의 키워드 검색뿐입니다.
00:14:53그리고 웹상의 모든 공개 동영상이 한곳에 모인 출처가 있어야겠죠.
00:14:59유튜브나 비메오처럼 수많은 동영상 플랫폼이 존재합니다.
00:15:06수십억 시간 분량의 학습 데이터가 여러분이 가져가서
00:15:13수집하고 처리해주기를 기다리고 있습니다.
00:15:14그래서 저희 브라이트 데이터에서 이번에 새로 만든 제품이 있습니다.
00:15:18동영상을 인덱싱해서 특정 동작을 쉽게 찾을 수 있게 해주는 기능이죠.
00:15:23상상하시는 무엇이든 브랜드에도 매우 유용하게 쓰일 수 있습니다.
00:15:28단순히 AI 학습용 데이터에만 국한되지 않습니다.
00:15:31생각하시는 모든 용도로 다양하게 활용될 수 있죠.
00:15:35가령 게이머가 특정 스테이지를 깨는 법을 알고 싶을 때
00:15:40딱 들어맞는 제목의 동영상이 없을 수도 있습니다.
00:15:42그럴 때 해당 게임에서 스테이지를 깨는 실제 장면을 검색할 수 있는 거죠.
00:15:47무엇이든 가능합니다, 가능성은 무궁무진하죠.
00:15:52그럼 이제 발표를 마치도록 하겠습니다.
00:15:54질문이 있으시거나 이에 대해 더 많은 이야기를 나누고 싶으시다면
00:15:58편하게 링크드인으로 신청해 주세요.
00:16:01경청해 주셔서 진심으로 감사드립니다.
00:16:06더 자세히 대화하고 싶으신 분은 브라이트 데이터 부스로 와주시기 바랍니다.
00:16:10참석해 주셔서 감사합니다.
00:16:17다음에 또 뵙겠습니다.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video