피지컬 AI의 다음 난제, 알맞은 비디오 데이터 찾기 — 라파엘 레비(Rafael Levi), Bright Data

AAI Engineer
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00안녕하세요, 여러분. 환영합니다. 저를 보러 와주신 분들께 감사드립니다. 그리고
00:00:21그냥 자리를 지켜주고 계신 분들께도 감사드립니다. 즐거운 시간이 되도록 새로운 내용을 알려드리겠습니다.
00:00:26다시 소개해 드리자면, 제 이름은 라파엘이고 브라이트 데이터에서 8년 이상 근무하며 데이터를 수집하고 혁신을 도모하고 있습니다.
00:00:38오늘 저는 에이전틱 세계 모델 학습을 위한 비디오 디스커버리에 대해 말씀드리고자 하며, 이게 무엇인지 잠시 후에 설명해 드리겠습니다.
00:00:48그렇다면 오늘날 보고, 이해하고, 행동할 수 있는 시스템을 구축하려면 무엇이 필요할까요?
00:00:56우리는 AI가 무엇인지 파악했고 지속적으로 개선하고 있으니 그 부분은 어느 정도 해결되었습니다.
00:01:04하지만 이제 어려운 부분은 어떤 데이터를 제공하느냐입니다. 데이터 없는 AI는 그저 깡통에 불과하니까요.
00:01:13과거 역사를 잠시 돌이켜볼까요? 2022년에 구글은 이미지와 현실 세계의 행동으로 로봇을 학습시켰습니다.
00:01:25이후 비약적인 발전이 있었죠. 2023년에는 AI가 실제로 여러 로봇을 제어하기 시작했습니다.
00:01:372024년에는 오픈 소스가 공개되었습니다. 여기서 판도가 바뀌었죠. 오픈 소스가 생기자 모든 연구소가 AI에 접근하여 로봇에 적용하기 시작했습니다.
00:01:51이제 이러한 모델들은 휴머노이드 로봇을 구동하고 있습니다. 여기에 있는 대부분은 물론 원격 제어되는 것이 보이지만요.
00:02:00하지만 샌프란시스코에서는 웨이모가 운전자 없이 주행하고 있습니다. 정말 멋지지 않나요?
00:02:07처음 탔을 때는 죽는 줄 알았지만, 실제로는 정말 쾌적했습니다.
00:02:12그렇다면 어떻게 운전을 배웠을까요? 블랙박스 카메라 영상을 학습하며 스스로 학습해 나간 것입니다.
00:02:22모든 차에는 블랙박스가 있으니까요. 이를 AI에 제공하면 기계를 조작하는 방법을 스스로 알아낼 수 있습니다.
00:02:31말씀드렸듯이 AI 자체는 더 이상 어려운 부분이 아니며, 진짜 난관은 데이터입니다. 이것이 제가 이야기하고자 하는 주제입니다.
00:02:39대화형 LLM에는 수조 개의 단어와 텍스트가 존재합니다. 따라서 LLM을 학습시킬 텍스트 데이터는 아주 풍부합니다.
00:02:49이미지 생성 분야 역시 수십억 개의 라벨링된 이미지가 있어 거대한 데이터베이스가 구축되어 있습니다.
00:02:56하지만 로보틱스의 경우 동작하는 로봇 영상이 100만 개 정도에 불과해 매우 제한적이고 적은 데이터셋만 존재합니다.
00:03:09그래서 현재 많은 기업이 취하는 방식은 사람들에게 돈을 주고 특정 행동을 촬영하게 하는 것입니다.
00:03:20"문 열어보는 모습을 녹화해 주세요"라든가 "의자에 앉는 모습을 녹화해 주세요"라고 요청하죠.
00:03:28하지만 여기서 문제는 무언가를 하라고지시를 받으면 행동이 자연스럽지 않다는 점입니다.
00:03:34저는 이걸 '지시된 데이터'라고 부르는데, 촬영 목적으로 문을 열 때의 행동은
00:03:40그냥 집에 들어갈 때와는 완전히 다릅니다. 움직임 자체가 완전히 달라지죠.
00:03:45그렇다면 이 데이터가 로봇 학습에 적합할까요? 제 생각에는 아닙니다. 편향된 데이터이며 동일한 결과를 내지 못합니다.
00:03:53결국 직관적으로 학습했을 때만큼 로봇이 효과적으로 작동하지 못하겠죠.
00:03:59슬라이드에 몇 가지 예시를 담아봤습니다.
00:04:06인위적으로 연출된 데이터는 자연스럽게 수집된 데이터와 결코 같지 않습니다.
00:04:12또한 사람들은 카메라 앞에 서면 행동이 완전히 달라집니다.
00:04:16아시다시피 카메라를 울렁거려하는 사람들은 렌즈를 가져다 대는 순간 태도가 변하죠.
00:04:23하지만 현실 세계에서의 자연스러운 모습은 완전히 다릅니다.
00:04:27이것이 바로 우리 브라이트 데이터가 해결하려는 문제입니다.
00:04:35그렇다면 왜 기존의 데이터 소스로는 부족할까요?
00:04:37시뮬레이션은 가상이라 비용이 저렴하지만, 다들 비디오 게임 해보셨잖아요?
00:04:44게임 속 물리엔진이 정교해졌다고는 해도 로봇을 학습시키기엔 부족합니다.
00:04:50사람이 로봇을 수동 제어하는 방식도 가능하지만, 하루에 몇 시간이나 녹화할 수 있을까요?
00:04:57대규모 데이터를 얻으려면 얼마나 많은 인력이 필요할까요?
00:05:01매일 8시간씩 녹화한다고 해봅시다.
00:05:041년에 과연 몇 시간이나 확보할 수 있을까요?
00:05:07확장성이 떨어집니다.
00:05:09기존에 구축된 데이터셋도 있지만 앞서 말씀드렸듯 규모가 작습니다.
00:05:13현재로서는 약 100만 개의 영상뿐이죠.
00:05:15그렇다면 대안은 무엇일까요?
00:05:17대안은 바로 웹입니다.
00:05:20유튜브를 예로 들어봅시다.
00:05:22유튜브에 영상이 얼마나 많을까요?
00:05:25한 50억 개쯤 될까요?
00:05:28그 영상들 속에 로봇이 복제할 수 있는 행동이 얼마나 많이 들어있을까요?
00:05:34한번 생각해보세요.
00:05:351인칭 시점으로 문을 여는 영상이 얼마나 될 것 같으신가요?
00:05:42수백만 시간에 달합니다.
00:05:43놀라실 겁니다.
00:05:45웹 영상에는 매일 중력과 다양한 움직임이 담깁니다.
00:05:53원인과 결과, 특히 사고 영상은 가장 확실한 인과관계를 보여주죠.
00:06:00사람들이 물체를 다루는 수십억 시간의 데이터가 존재합니다.
00:06:04로봇 학습에 아주 훌륭한 자료지만, 문제는 무엇일까요?
00:06:08불필요한 노이즈가 너무 많다는 점입니다.
00:06:12예를 하나 들어볼까요?
00:06:14메타가 학습시킨 AI 모델 중 하나는 약 100만 시간 분량의 실제 영상 데이터를 학습했습니다.
00:06:21그리고 실제 로봇을 제어하는 데는 단 62시간의 로봇 데이터만 필요했습니다.
00:06:29생각해보면, 데이터는 공개적으로 수집된 것이었습니다.
00:06:33일반적인 영상들로 로봇을 학습시킨 뒤 단 62시간의 로봇 학습만으로 움직이기 시작했죠.
00:06:41시뮬레이션 없이 빠르게 자율주행 로봇 기술을 구현해낸 것입니다.
00:06:52하지만 일반 영상은 로봇이 어떻게 움직여야 하는지 보여주지 않죠?
00:06:54사람이 컵에 물을 따르는 영상이 로봇에게 무슨 유용한 정보가 되겠냐고 생각하실 수 있습니다.
00:07:01하지만 영상 속 행동을 AI가 구분하고 실제로 학습하게 하는 방식들이 존재합니다.
00:07:09두 프레임을 연속으로 비교하며 AI가 움직임의 차이를 측정합니다.
00:07:15이미지 A와 이미지 2 사이에서 발생하는 미세한 움직임 변화를
00:07:21AI가 측정할 수 있는 것이죠.
00:07:24영상 전체에 걸쳐 이 과정을 계속 수행하면 AI가 각도, 거리 등
00:07:30로봇 학습에 필요한 모든 것을 알아낼 수 있습니다.
00:07:34따라서 센서 데이터가 반드시 필요한 것은 아니지만, 유튜브 등에서 추출하거나
00:07:41다운로드한 영상만으로 100% 완벽한 데이터를 얻기는 어렵습니다.
00:07:48추가적인 후처리 작업이 필요하긴 하지만, 이미 가용한 방식입니다.
00:07:53기술은 이미 존재하며 가공하기만 하면 됩니다.
00:07:58예를 몇 가지 더 들어볼까요?
00:07:59엔비디아의 경우 코스모스 로봇을 학습시킬 때 비디오의 약 96%를 버립니다.
00:08:07이게 무슨 의미일까요?
00:08:09100만 시간 분량의 영상을 다운로드해도
00:08:12실제 쓸모있는 부분은 4%에 불과하고
00:08:15나머지는 전부 폐기된다는 뜻입니다.
00:08:16연산 자원 낭비이자,
00:08:18대역폭 낭비이고,
00:08:19저장 공간 낭비입니다.
00:08:21막대한 비용이 낭비되는 것이죠.
00:08:23스테이블 비디오 디퓨전 역시 다운로드하는 영상의 74%를 버리고 있습니다.
00:08:30브라이트 데이터는 이 문제를 해결하고 한 단계 더 나아가고자 합니다.
00:08:37저희가 제안하는 방식은 '선 검색, 후 수집'입니다.
00:08:41비디오를 미리 인덱싱하여 특정 행동을 직접 검색할 수 있도록 하는 것입니다.
00:08:50문 열기 행동을 예로 들었으니 계속 이 예시를 사용해봅시다.
00:08:55저희 플랫폼에서는 매우 구체적인 정보 입력이 가능합니다.
00:09:01"설거지하는 사람", "티셔츠 개는 사람" 같은 검색어로요.
00:09:06그러면 해당 동작이 포함된 비디오 클립만을 추출해 제공합니다.
00:09:13이게 무슨 의미일까요?
00:09:16데이터 수집 시 손실을 최소화할 수 있다는 의미입니다.
00:09:22저장 공간과 대역폭의 낭비도 줄어들죠.
00:09:25작동 방식을 조금 더 설명해 드리겠습니다.
00:09:27먼저 찾고자 하는 대상을 정의합니다.
00:09:32그러면 사전 인덱싱된 수십억 개의 비디오를 검색합니다.
00:09:36키워드가 아닌 '행동' 단위로 검색하죠.
00:09:39그리고 바로 사용할 수 있는 클립을 제공합니다.
00:09:43물론 이미 학습에 적합하도록 정제된 상태입니다.
00:09:47움직임이나 거리 센서 등에 맞게 약간의 가공만 거치면 됩니다.
00:09:52그러면 로봇에 즉시 입력할 수 있는 상태가 됩니다.
00:09:57저희 플랫폼이 실제 작동하는 모습을 담은 시연 영상을 준비했습니다.
00:10:02재생 버튼을 눌러보겠습니다.
00:10:07"싱크대에서 손으로 설거지하며 접시의 기름때를 제거하는 사람,
00:10:12수세미와 세제 사용, 헹굼 및 건조대에 접시 놓기 포함, 손 상호작용 클로즈업"
00:10:19지금 수십억 개의 비디오를 검색하는 과정이 진행 중입니다.
00:10:24이 녹화 영상은 조금 이전 것입니다.
00:10:26이 영상에서는 약 1억 개만 색인되었지만, 지금은 11억 개까지 늘어났습니다.
00:10:31여러분의 시간을 아끼기 위해 영상을 약간 배속 처리했습니다.
00:10:35검색 결과로 사람들이 설거지하는 비디오 클립들을 추출해줍니다.
00:10:41찾아낸 영상들이 바로 여기에 표시됩니다.
00:10:47검색된 일부 영상은 설거지와 직접 관련이 없을 수도 있습니다.
00:10:50주방 청소에 관한 영상일 수도 있고,
00:10:52다른 작업을 다룬 영상일 수도 있죠.
00:10:54또 다른 예시입니다.
00:10:55예를 들어 "다양한 옷을 접는 사람"입니다.
00:10:59그렇죠?
00:10:59설명을 조금 더 추가해봅시다.
00:11:01구체적인 설명을 제공할수록 더 정확한 결과를 얻을 수 있습니다.
00:11:06다시 배속으로 돌려보겠습니다.
00:11:08확인해보죠.
00:11:14어떤 검색어든 가능하다는 점을 강조하고 싶습니다.
00:11:16화장하는 모습도 가능합니다.
00:11:17특정 브랜드의 제품이 노출되는 영상 클립을 찾고 싶다면
00:11:21그러한 결과 역시 제공할 수 있습니다.
00:11:23사람들이 옷을 접는 모습이 보입니다.
00:11:26이제 로봇에게 옷 개는 방법을 학습시킬 수 있는 것이죠.
00:11:34당연히 모든 기능은 API로 활용할 수 있습니다.
00:11:36수동으로 직접 작업하시는 것을 바라는 사람은 없으니까요.
00:11:39맞죠?
00:11:39따라서 API를 통해 간편하게 호출할 수 있습니다.
00:11:41비디오의 스니펫과 URL을 반환받게 됩니다.
00:11:46직접 시청하고 싶으신 경우 원본 비디오 링크도 제공해 드립니다.
00:11:49하지만 여기서 핵심은 로봇을 학습시킬 수 있는 비디오 스니펫을 제공한다는 점입니다.
00:11:57여기 계신 분들 중에 실제로 로봇을 학습시키는 분이 계실지는 잘 모르겠네요.
00:12:01그래서 이것이 얼마나 유용한지 다른 예시를 하나 더 들어드리겠습니다.
00:12:04여러분에게 특정 브랜드가 있다고 해봅시다.
00:12:06그리고 여러분의 브랜드가 어떤 비디오에서 시연되고 있는지 알고 싶다고 가정해 보죠.
00:12:13비디오 제목은 중요하지 않습니다. 제품에 관한 제목이 아닐 수도 있으니까요.
00:12:19그저 누군가 팟캐스트를 진행하거나 뭔가를 녹화하는 영상일 수 있죠.
00:12:22하지만 영상 속에 한 여성이 화장을 하고 있는 모습이 보이고,
00:12:25탁자 위에 올려진 화장품이 여러분의 브랜드 제품인 것이 확인됩니다.
00:12:30이제 여러분은 자사 브랜드 제품이 사용된 모든 비디오를 갑자기 찾아낼 수 있게 됩니다.
00:12:34어떤 비디오든 말이죠.
00:12:35그렇죠?
00:12:35비디오 제목만 검색해서는 이런 걸 찾을 수 없습니다.
00:12:38비디오 인덱싱을 이용하면 관심 있는 구체적인 장면들을 실제로 찾아낼 수 있습니다.
00:12:45나무에서 사과가 떨어지는 장면처럼
00:12:47다양한 것들을요.
00:12:48그렇다면 무엇이 반환될까요?
00:12:50저희는 이 타임스탬프를 제공합니다.
00:12:52일치 점수도 제공해 드리는데,
00:12:53검색어와 얼마나 유사한지를 나타냅니다.
00:12:55그리고 당연히 프레임 수도 포함됩니다.
00:12:57찾고 계신 내용에 해당하는 프레임이 얼마나 되는지 말이죠.
00:13:03그렇다면 이것이 무엇을 바꿔놓을까요?
00:13:06정말 많은 것을 바꿔놓습니다.
00:13:07우선 낭비가 줄어듭니다.
00:13:09수백만 시간 분량의 비디오를 다운로드할 필요가 없습니다.
00:13:12관심 있는 정확하고 특정 동작들만
00:13:16콕 집어서 얻을 수 있으니까요.
00:13:20다시 말씀드리지만, 이는 로봇 학습에 매우 핵심적인 부분입니다.
00:13:24노이즈가 생기면 문제나 환각 현상(할루시네이션)이 발생하거든요.
00:13:28맞죠?
00:13:29이 기술은 그러한 노이즈를 제거해 줍니다.
00:13:34이게 어디에 유용할까요?
00:13:35로봇뿐만 아니라 자율주행 분야에도 당연히 유용합니다.
00:13:38예를 들어 웨이모(Waymo) 같은 경우 말이죠.
00:13:39그렇죠?
00:13:40블랙박스 영상 데이터를 통해 학습하는데,
00:13:43유튜브에는 수억 시간 분량의 블랙박스 영상이 존재합니다.
00:13:46엄청난 양의 블랙박스 영상이죠.
00:13:47사고 영상 즐겨 보시는 분 계신가요?
00:13:49블랙박스 사고 영상 같은 거요.
00:13:52다들 한 번쯤은 보셨을 겁니다.
00:13:53러시아의 난폭 운전 영상 같은 것들 말이죠.
00:13:55그렇죠?
00:13:56바로 이런 걸 말하는 겁니다.
00:13:58맞죠?
00:13:58영상은 이미 널려 있어요.
00:14:01그렇죠?
00:14:01신호를 위반하는 사람,
00:14:02빨간불에 정지하는 사람,
00:14:04좌회전하는 사람,
00:14:05우회전하는 사람 등등.
00:14:06기타 등등의 모든 장면이요.
00:14:06이 모든 게 학습용으로 정말 유용한 데이터가 될 수 있습니다.
00:14:11다른 월드 모델에도 마찬가지입니다.
00:14:13물리학 같은 거요.
00:14:14맞죠?
00:14:14로봇도 물리를 이해해야 합니다.
00:14:16중력이 무엇인지,
00:14:18어떻게 앉는지,
00:14:18어떻게 걷는지,
00:14:19어떻게 움직이는지를요.
00:14:21물론 직접 녹화하는 방법도 있습니다.
00:14:25요즘 몇몇 분들과 이야기를 나눠보면,
00:14:27수백만 명의 사람들에게 영상을 촬영하게 하더군요.
00:14:30“문 여는 모습 좀 녹화해 주실래요?” 하면서요.
00:14:33정말 말도 안 되는 일이죠.
00:14:34온라인에 모든 정보가 있는데 왜 백만 명이나 되는 사람을 시켜서 그걸 촬영하겠습니까?
00:14:39온라인은 세상에서 가장 거대한 데이터베이스 중 하나입니다.
00:14:43단지 사람들이 활용하기가 그리 쉽지 않을 뿐이죠.
00:14:46지금 우리에게 제공되는 유일한 검색 방식은 동영상 제목의 키워드 검색뿐입니다.
00:14:53그리고 웹상의 모든 공개 동영상이 한곳에 모인 출처가 있어야겠죠.
00:14:59유튜브나 비메오처럼 수많은 동영상 플랫폼이 존재합니다.
00:15:06수십억 시간 분량의 학습 데이터가 여러분이 가져가서
00:15:13수집하고 처리해주기를 기다리고 있습니다.
00:15:14그래서 저희 브라이트 데이터에서 이번에 새로 만든 제품이 있습니다.
00:15:18동영상을 인덱싱해서 특정 동작을 쉽게 찾을 수 있게 해주는 기능이죠.
00:15:23상상하시는 무엇이든 브랜드에도 매우 유용하게 쓰일 수 있습니다.
00:15:28단순히 AI 학습용 데이터에만 국한되지 않습니다.
00:15:31생각하시는 모든 용도로 다양하게 활용될 수 있죠.
00:15:35가령 게이머가 특정 스테이지를 깨는 법을 알고 싶을 때
00:15:40딱 들어맞는 제목의 동영상이 없을 수도 있습니다.
00:15:42그럴 때 해당 게임에서 스테이지를 깨는 실제 장면을 검색할 수 있는 거죠.
00:15:47무엇이든 가능합니다, 가능성은 무궁무진하죠.
00:15:52그럼 이제 발표를 마치도록 하겠습니다.
00:15:54질문이 있으시거나 이에 대해 더 많은 이야기를 나누고 싶으시다면
00:15:58편하게 링크드인으로 신청해 주세요.
00:16:01경청해 주셔서 진심으로 감사드립니다.
00:16:06더 자세히 대화하고 싶으신 분은 브라이트 데이터 부스로 와주시기 바랍니다.
00:16:10참석해 주셔서 감사합니다.
00:16:17다음에 또 뵙겠습니다.

Key Takeaway

피지컬 AI 및 로보틱스 개발의 병목인 데이터 부족 문제를 해결하기 위해, 11억 개 이상의 웹 동영상에서 동작 기반 타임스탬프 스니펫만 선별 수집하는 인덱싱 방식이 연산 자원과 대역폭 손실을 줄인다.

Highlights

  • 로봇 학습을 위한 영상 데이터셋은 약 100만 개에 불과하며, 연출된 촬영 방식은 편향된 행동을 유발한다.

  • 엔비디아 코스모스는 수집 비디오의 96%를, 스테이블 비디오 디퓨전은 74%를 데이터 불일치로 폐기한다.

  • 메타의 AI 모델은 100만 시간의 웹 영상과 62시간의 실제 로봇 데이터 결합만으로 자율 조작을 구현했다.

  • 웹 비디오에서 프레임 간 미세 변형을 측정하면 센서 데이터 없이도 각도와 거리 정보를 복원할 수 있다.

  • 브라이트 데이터의 '선 검색, 후 수집' 인덱싱은 11억 개 이상의 비디오에서 동작 단위의 스니펫을 API로 추출한다.

Timeline

피지컬 AI 개발의 병목: 데이터 부족과 연출 데이터의 한계

  • LLM 및 이미지 AI와 달리 로보틱스는 활용 가능한 학습 영상 데이터셋이 100만 개 수준에 그친다.
  • 금전적 대가를 지급하고 수집한 지시형 영상은 자연스러운 일상 동작과 구조적 차이를 보인다.
  • 카메라 의식 및 연출로 발생한 편향 데이터는 실제 환경에서 로봇의 추론 성능을 저하시킨다.

AI 모델 구조는 빠르게 고도화되었으나 로봇 구동을 위한 피지컬 데이터의 공급은 턱없이 부족하다. 수조 개의 단어로 학습하는 텍스트 모델이나 수십억 개의 라벨링 이미지를 사용하는 시각 모델과 달리, 물리적 동작을 담은 비디오 데이터셋은 현저히 적다. 이를 보완하기 위해 인위적으로 촬영한 데이터셋은 카메라 앞에서의 어색한 행동 패턴을 학습하게 만들어 실제 직관적 조작 실패로 이어진다.

기존 수집 방식의 한계와 웹 동영상 데이터의 잠재력

  • 가상 시뮬레이션 물리 엔진은 실제 물리 법칙을 완벽히 모사하지 못한다.
  • 사람이 원격으로 로봇을 조작하는 수동 수집 방식은 시간 및 비용 측면에서 확장성이 떨어진다.
  • 메타는 100만 시간의 일반 웹 비디오와 62시간의 로봇 데이터를 조합해 자율 조작을 구현했다.

시뮬레이션 환경은 비용이 저렴하지만 실제 환경과의 물리적 격차가 존재하며, 직접 조작을 통한 데이터 수집은 일일 작업량의 한계로 대규모 확장이 불가능하다. 반면 유튜브 등 웹상에 존재하는 수십억 개의 1인칭 시점 비디오, 사고 비디오, 상호작용 비디오는 실제 물리 법칙과 인과관계를 담고 있다. 연속된 두 프레임의 움직임 변화를 측정하는 후처리 기법을 적용하면 3D 센서 정보 없이도 로봇 학습에 필요한 공간 및 각도 데이터를 추출할 수 있다.

비디오 데이터 폐기 문제와 행동 단위 인덱싱 솔루션

  • 엔비디아 코스모스는 수집한 비디오 데이터의 96%를 무용성으로 인해 폐기한다.
  • 스테이블 비디오 디퓨전은 전체 다운로드 비디오 데이터의 74%를 버린다.
  • 행동 단위 비디오 인덱싱 기법은 11억 개 이상의 비디오 중 필요한 동작 구간만 선별 추출한다.

전체 영상을 무작위로 다운로드한 뒤 정제하는 기존 방식은 대역폭, 저장 공간, 연산 자원의 심각한 낭비를 초래한다. '선 검색, 후 수집' 구조를 도입하면 전체 비디오 대신 '설거지하는 손 동작'이나 '옷을 접는 동작' 등 구체적 텍스트 설명에 매칭되는 특정 프레임 구간만 정확히 추출할 수 있다. 이는 수집 데이터의 손실률을 극단적으로 낮춘다.

행동 인덱싱 API의 응답 데이터 구조와 확장 응용 분야

  • API 호출 시 원본 비디오 URL, 시작/종료 타임스탬프, 매칭 점수, 프레임 수를 반환한다.
  • 자율주행 학습, 물리학 월드 모델 구축, 비디오 내 브랜드 제품 노출 추적에 활용 가능하다.
  • 노이즈가 제거된 타임스탬프 스니펫만 학습에 제공되어 AI 모델의 할루시네이션을 방지한다.

개발자는 API를 통해 비디오 제목이나 키워드가 아닌 시각적 동작 기반의 검색 결과를 JSON 데이터 형태로 수신한다. 각 결과에는 고유 타임스탬프와 매칭 정확도가 포함되어 있어 불필요한 노이즈 데이터를 원천 차단한다. 해당 기술은 로봇 공학 외에도 도로 상황 블랙박스 영상을 활용한 자율주행 알고리즘 개선, 영상 내 특정 상표 노출 자동 검색 등 다양한 분야로 확장된다.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video