숏폼 비디오에서의 모달리티 불일치 및 독창성 귀속 — 아디티야 가우탐, Meta

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00Aditya Rahm: 안녕하세요, 여러분. 저는 Aditya입니다. 오늘은 두 가지 주요 문제에 대해 이야기해 보겠습니다.
00:00:17숏폼 플랫폼에서 발생하는 문제들이죠.
00:00:20이러한 문제들을 대규모로 처리하는 방법에 대해 말씀드리겠습니다.
00:00:25우선 시작하기 앞서, 다루고자 하는 데이터의 특징이 무엇인지,
00:00:28현재 우리가 실제로 해결하려는 두 가지 주요 문제가 무엇인지 이해하고,
00:00:33이 문제들을 대규모로 해결하기 위한 멀티 에이전트 시스템은 무엇인지 살펴보겠습니다.
00:00:39각 에이전트의 개별 문제를 해결하기 위해 구축할 수 있는 특화된 소형 VLM에는 어떤 것이 있는지,
00:00:46그리고 이러한 에이전트들을 어떻게 구축하며, 대규모에서 확장 가능하도록 만들기 위해
00:00:50최적화하는 다양한 방법은 무엇인지 살펴본 후
00:00:56단순한 정밀도와 재현율을 넘어 매우 종합적인 360도 관점의 평가법을 살펴보겠습니다.
00:01:00현재 이용 가능한 것은 무엇일까요?
00:01:01LLM 레벨, 도구, MCP 등 제반 요소를 바탕으로 전체 멀티 에이전트 파이프라인을 이해하는 방법도 다룹니다.
00:01:08존재하는 모든 요소를 말이죠.
00:01:09그런 다음 시각 정보 및 데이터 특화 최적화 기법에 대해 살펴볼 텐데,
00:01:14이 기법을 통해 지능형 워크플로를 모든 비디오에 적용할 필요는 없다는 판단을 내릴 수 있습니다.
00:01:20이러한 작업을 수행하기에 적합한 비디오의 소규모 집합을
00:01:25파악해 낼 수 있게 되는 거죠.
00:01:29마지막으로 시사점을 정리하며 마무리하겠습니다.
00:01:32실제 세계의 데이터는 매우 복잡합니다.
00:01:34우리가 다루는 스케일은 1억 건 이상이며 바이럴 콘텐츠도 수없이 많습니다.
00:01:39적대적 콘텐츠도 상당수 존재하죠.
00:01:42사람들은 시스템의 허점을 이용하려고 합니다.
00:01:43화면, 동영상, 이미지 속에는 다국어 텍스트가 가득합니다.
00:01:48그리고 데이터는 매우 가변적입니다.
00:01:50달마다 계속해서 변합니다.
00:01:52새로운 AI 도구가 쏟아져 나오는 등 많은 것이 변하죠.
00:01:54따라서 대단히 유동적입니다.
00:01:57즉, 비디오 데이터에는 데이터 표류 현상(Drift)을 비롯해 많은 문제가 수반됩니다.
00:02:00또한 우리가 해결하려는 문제에 명확한 정답(Ground Truth)이 없다는 점도 잘 알고 있습니다.
00:02:05이것들이 바로 실제 비디오 데이터셋에서 발생하는 기존의 문제점들입니다.
00:02:10첫 번째로 이야기할 문제는 모달리티 불일치(Modality Misalignment)입니다.
00:02:14첫 번째 유형인 모달리티 간 불일치(Intermodality)는 이미 해결된 문제입니다.
00:02:19CLIP 모델을 사용할 수 있죠.
00:02:20이미지, 비디오, 오디오, 텍스트에 대한 모달리티를 가져와서
00:02:25해당 임베딩의 코사인 유사도가 정확히 어떻게 나오는지 파악하면 됩니다.
00:02:29따라서 이는 훨씬 간단한 문제입니다.
00:02:31우리가 논의할 내용은 단일 모달리티 내 불일치(Intramodality) 문제를 처리하는 방식입니다.
00:02:37비디오를 예로 들어보겠습니다.
00:02:39긴 비디오가 하나 있습니다.
00:02:40그런데 갑자기 특정 광고나 정치적 의도, 특정 메시지 등
00:02:45원래 클릭했을 때 기대했던 내용과 상관없는 영상이 등장합니다.
00:02:49그렇다면 비디오의 짧은 구간들을 실제로 분석하여 이 문제를 이해하고
00:02:54원래 있어서는 안 될 이상 징후나 적대적 행위가
00:02:59어디에서 발생하는지 어떻게 파악할 수 있을까요?
00:03:01이 첫 번째 문제는 클립 및 프레임 단위에서 일어나는 상황을 파악하기 위해
00:03:05상당히 세밀한 수준의 비전 및 비디오 이해를 필요로 합니다.
00:03:10두 번째 문제는 비독창적 콘텐츠(Unoriginal Content)를 파악하는 것입니다.
00:03:14오늘날 AI 도구가 보급된 환경에서는 콘텐츠를 복제하기가 대단히 쉽습니다.
00:03:19누군가 영상을 업로드하면, 그것이 무단 복제되거나 변형되는 것을 보게 되는데
00:03:25도구들의 발전으로 영상을 변형하는 작업이 훨씬 쉬워졌습니다.
00:03:29그렇다면 이러한 비독창적 콘텐츠를 실제로 어떻게 감지할 수 있을까요?
00:03:33비디오의 출처는 어떻게 알아낼 수 있을까요?
00:03:35이 문제는 저작권 인정, 기여도 표기, 생태계 불균형 문제를 야기했습니다.
00:03:41사용자의 피로도도 상당한데, 노출되지 말아야 할 중복 비디오가 지나치게 많이 도배되고 있습니다.
00:03:47이제 멀티 에이전트 시스템에 대해 말씀드리자면, 단일 에이전트나 단일 LLM이 아닌
00:03:54멀티 에이전트로 이동하려는 이유는 이 문제가 매우 복잡하기 때문입니다.
00:03:57검색, 콘텐츠 이해, 그리고 추론의 각 단계마다
00:04:04대단히 특화된 노드와 정교한 이해 능력이 요구됩니다.
00:04:07단 하나의 에이전트나 LLM으로 문제를 해결할 수 있다면 굳이 멀티 에이전트 시스템을 쓸 필요가 없겠죠.
00:04:14중앙 집중형 두뇌가 동작하는 방식과 이 문제를 분해하는 방식은 다음과 같습니다.
00:04:22기본적으로 비디오와 비디오 ID 등이 검토자(Reviewer) 에이전트에 전달됩니다.
00:04:28이것이 중앙 집중형 에이전트입니다.
00:04:29기본적으로 오케스트레이터 역할을 수행하죠.
00:04:31신호를 분해하고 이미지 주변에서 무슨 일이 일어나는지 파악하는 API 게이트웨이라고 보시면 됩니다.
00:04:38이 에이전트가 하는 일은 인식자(Perceiver) 에이전트를 활용하는 것입니다. 인식자 에이전트는
00:04:46다양한 이미지 및 비디오 도구를 다룰 수 있는 매우 정교한 VLM 전문가라 할 수 있습니다.
00:04:52인식자 에이전트는 검토자 에이전트로부터 ID를 받아서 데이터베이스에서 비디오를 가져옵니다.
00:05:01다양한 도구, 시맨틱 임베딩, 시간에 따른 변화 등을 활용해 영상을 더 작은 단위로 분해합니다.
00:05:08발표 범위를 약간 벗어나지만, 고정 프레임 레이트로 처리하지 않도록 보장해 주는 당사의 기술입니다.
00:05:17대신 시간적 변화가 일어난 지점을 찾아 유사한 프레임들을 1~2개 프레임으로 압축합니다.
00:05:23그러면 인식자 에이전트는 클립 및 비디오 임베딩 수준에서 데이터를 추출하고, 태그, OCR 등 존재하는 모든 정보와
00:05:34자연어 설명, 몇 프레임부터 몇 프레임까지인지에 대한 타임스탬프와 메타데이터 구조를 확보합니다.
00:05:41그리고 해당 데이터를 검토자에게 전달합니다.
00:05:43검토자는 인식자 에이전트가 원시 형태(Raw form)로 제공한 타임스탬프 기반 JSON 객체를 임베딩, 시맨틱 ID, 태그, OCR 등과 함께 살펴봅니다.
00:05:52그리고 시점별 시간차 분석(Temporal Analysis)을 수행합니다.
00:05:55예를 들어 첫 프레임부터 360번째 프레임까지, 즉 6초까지는 스포츠에 관한 영상이었는데
00:06:056초에서 6.5초 사이의 특정 프레임 구간에서 갑자기 정치적 내용으로 전환되는 것을 포착합니다.
00:06:14이처럼 메타데이터를 확인하는 것만으로도 검토자 에이전트는 해당 시공간 영역에서
00:06:22어떤 이상 징후가 나타나는지 이해하고 파악할 수 있습니다.
00:06:23분석을 마치면 이것이 실제로 모달리티 불일치인지, 아니면 더 큰 문제가 존재하는지 판단합니다.
00:06:30검토자 에이전트는 검색자(Retriever) 에이전트와 통신하며 “내가 확인 중인 비디오가 이것인데
00:06:36중복을 제거하고 후처리해둔 메타데이터가 일부 있으니
00:06:41코퍼스에 존재하는 유사한 클립 정보를 제공해달라”고 요청합니다.
00:06:47그러면 검색자 에이전트는 인식자 에이전트가 제공한 모든 신호와 클립 및 전체 비디오의 메타데이터를 확인한 후, 이를 다양한 DB에 적응형으로 색인화합니다.
00:06:57예를 들어 주제(Topic)의 경우, 주제와 다수의 비디오가 연결된 역색인(Inverted index) 형태를 사용할 수 있습니다.
00:07:02임베딩의 경우에는 시중에 제공되는 벡터 데이터베이스를 활용합니다.
00:07:06그리고 추출된 다양한 엔티티에 대해서는 그래프 DB를 구축하여, 검토자 에이전트가 다중 DB, 엔티티, 메타데이터 구조를 파악할 수 있게 합니다.
00:07:16이를 색인화해 두면 온라인 추론 시점에 특정 클립과 유사한 클립, 유사한 엔티티 및 주제를 가져와 재현율(Recall)을 향상시킬 수 있습니다.
00:07:28이제 개별 에이전트에 대해 알아보겠습니다. 방금 인식자에 대해 말씀드렸죠.
00:07:32전체 비디오를 분석하고 시맨틱 임베딩 및 알고리즘을 바탕으로 시간적 분해를 수행한 뒤, VLM을 파인 튜닝하여
00:07:45각 클립과 전체 비디오에 대한 매우 구체적이고 세부적인 정보를 도출해 냅니다.
00:07:51우리는 대규모 환경을 다루고 있으므로 기존에 출시된 표준 VLM만으로는 한계가 있습니다.
00:07:56수십억 개의 프레임에 대해 작업을 수행하려면 압축이 필요하고, 이러한 모델을 실제로 처리할 비용 효율적인 방법이 필요합니다.
00:08:05그렇기 때문에 사전 학습, 파인 튜닝, 지식 증류, 양자화 기법을 도입하여
00:08:13이 특정한 문제에 맞춰 매우 특화된 VLM을 배포하고 해결하고자 합니다.
00:08:16이에 대해 간략히 말씀드리겠습니다.
00:08:19검색자 에이전트는 앞서 개괄적으로 설명해 드린 역할을 담당합니다.
00:08:22오프라인 처리 과정에서는 인식자 에이전트가 오프라인 방식으로 분해한 모든 신호를
00:08:29라이브러리로 가져와 대규모 오프라인 분석을 진행합니다.
00:08:34예를 들어 Ray 클러스터 같은 환경을 활용하는 것이죠.
00:08:37그런 다음 모든 메타데이터가 확보되면 이를 다양한 데이터베이스에 색인화합니다.
00:08:42주기적으로 오프라인 클러스터링을 수행해 유사 콘텐츠를 찾고 각 클립과 전체 비디오의 임베딩 ID 및 클러스터 ID를 할당합니다.
00:08:50이 데이터가 바로 온라인 추론 시 유사 비디오를 검색하는 데 사용됩니다.
00:08:56온라인 환경에서는 쿼리나 클립 ID, 메타데이터 세부 정보가 주어지면
00:09:01코퍼스 내에서 해당 클립과 유사한 대상이 무엇인지 파악합니다.
00:09:06유사도가 높은 다양한 항목들을 찾아내는 것이죠.
00:09:09따라서 데이터베이스를 조회하여 유사 클립, 유사 제작자 및 다양한 메타데이터 정보를 찾아냅니다.
00:09:16후보들을 재정렬하고, 기존의 스팸 점수 모델이나 분류기 점수 같은 도구를 활용하여
00:09:24스팸 가능성이 있거나 품질이 낮을 수 있는 후보 요소들을 걸러냅니다.
00:09:29상위 N개의 후보가 축출되면, 이를 검토자(Reviewer) agent에 전달합니다.
00:09:33검토 단계에서는 메인 콘텐츠 신호와 클립 임베딩을 실제 처리합니다.
00:09:39검색기(Retriever)가 제공한 유사한 동영상들이 있으면,
00:09:42이를 분석하고 검색기로부터 더 많은 데이터를 가져올지 판단합니다.
00:09:48따라서 검토자는 단일 클립의 모든 시공간적 신호를 확보하게 되며,
00:09:52유사한 클립과 작성자 정보 등 제반 유사 데이터를 종합적으로 파악합니다.
00:09:58또한 사용자가 이 영상과 어떻게 상호작용하는지에 대한 실시간 정보도 보유합니다.
00:10:03신고 내역이나 댓글의 분위기와 같은 감정 반응도 확인하죠.
00:10:13오프라인 신호나 VLM, 기타 agent들이 놓칠 수 있는 수많은 신호들을
00:10:18함께 반영하여 시청자 반응에 변화가 발생하는지 감지합니다.
00:10:22실시간으로 어떠한 반응이 오는지 확인하는 것이죠.
00:10:25영상을 단지 콘텐츠나 의미론적 측면에서만 분석하는 것이 아니라
00:10:30사용자 상호작용 관점까지 고려할 수 있도록 다양한 도구가 사용됩니다.
00:10:36이러한 신호들은 극히 중요합니다.
00:10:38이러한 처리 과정 전체를 바탕으로 에이전트 프레임워크를 구축했습니다.
00:10:44이 에이전트 프레임워크 내 3개 agent는 각각 특화된
00:10:50VLM 및 소형 VLM 모델을 통해 구동됩니다.
00:10:54우선 사전 학습(Pre-training)에 대해 설명해 드리겠습니다.
00:10:58일반적으로는 사전 학습된 모델을 가져와서
00:11:01비전 트랜스포머를 조금 미세 조정해 특정 목적에 맞게 튜닝하곤 합니다.
00:11:08하지만 공개된 범용 VLM 기반 파운데이션 모델들은
00:11:14정제되고 깔끔하게 튜닝된 웹 데이터셋으로 학습된 경우가 많습니다.
00:11:20반면 기업 내부의 특수 목적용 데이터는 그러한 특성을 띠지 않습니다.
00:11:26정제되어 있지 않죠.
00:11:27사용자가 생성한 데이터이며,
00:11:28특정한 워크플로를 위한 데이터입니다.
00:11:30즉, 이미지 토큰과 텍스트를 바탕으로 바닥부터 비전 트랜스포머를 학습시킬지,
00:11:37처음부터 사전 학습을 진행하는 것이 기존 모델 파인튜닝 대비 성능 차이를 내는지 확인해야 합니다.
00:11:42여기서 자체 사전 학습의 유용성이 드러납니다.
00:11:44비용은 좀 더 들지만 확실한 성능 향상(delta)을 가져온다면 매우 효과적입니다.
00:11:50두 번째 단계는 지시어 미세 조정(Instruction Fine-tuning)입니다.
00:11:54여기서 우리는 특정 정책과 가이드라인을 정의합니다.
00:11:57콘텐츠와 신호를 파악하고 특정 데이터셋에 맞춰 모델을 튜닝하는데,
00:12:04JSON 스키마와 같은 특정 출력 형식에 맞춰 모달리티 불일치,
00:12:10점수 중복, 검토자 agent가 제공하는 생각의 사슬(CoT) 추론 등을 학습시킵니다.
00:12:16구조를 보자면 먼저 비디오 클립이 입력됩니다.
00:12:17일차적으로 사전 학습을 거친 비전 인코더가 있고,
00:12:21이에 대해 추가 학습을 수행하게 됩니다.
00:12:23비전 트랜스포머와 언어 모델 사이에는 프로젝터가 위치하여
00:12:27두 구조를 연결하는 가교 역할을 수행합니다.
00:12:30그리고 해당 입력측 지시어 파인튜닝 데이터에 따라 최종 결과가 출력됩니다.
00:12:35이 과정이 도메인 특화 분야에서 모델 성능을 향상시키는 핵심 요소입니다.
00:12:45핵심 맥락은 역할과 정책, 메타데이터에 접목(grounding)할 도구,
00:12:50그리고 기타 가용한 수단들을 효율적으로 설정하는 것입니다.
00:12:54전체 정보를 간결하게 컨텍스트로 제공한 뒤,
00:13:01자체 라벨링 데이터를 파악하도록 합니다. 여기서 정의한 라벨은
00:13:06모달리티 관련 문제나 발견되는 오류 유형,
00:13:12모델에 반영되어야 할 생각의 사슬(CoT) 추론 과정,
00:13:15사람 검토자 관점의 최종 출력 형태 등을 포함합니다.
00:13:21즉 고품질 데이터셋을 구축하여 각 agent를 미세 조정하는 것입니다.
00:13:27비영상 및 다중 모달리티 측면을 이해하기 위한 사전 학습이 완료되면,
00:13:33그 후 미세 조정을 진행하여, 우리가 데이터셋을 실제로 처리하려는 방식에 맞게
00:13:38파인튜닝 단계로 진입합니다. 다음 단계는 DPO 단계입니다.
00:13:44DPO 기법은 사후 학습(post-training)에서 특정 영역이나 도메인,
00:13:51정책 이해도 등을 위해 모델을 미세 조정할 때 흔히 사용됩니다.
00:13:58또한 프로덕션 환경에서 다중 에이전트 시스템 및 LLM의 결과물이
00:14:02만족스럽지 못한 샘플들을 파악하는 데 매우 효과적으로 쓰입니다.
00:14:11실제 운용 중 수집되는 프로덕션 데이터셋에서
00:14:17대량의 추론이 일어날 때, 해당 데이터의 일부 샘플을 추출합니다.
00:14:23이를 사람이 라벨링한 데이터로 자체 학습시킨 'LLM 평가자(LLM as a judge)'에 통과시키고,
00:14:29사람의 검토 큐(human review queue)를 거쳐 실제 시스템 성능을 확인합니다.
00:14:36만약 성능이 뛰어나 각 문제별 예상 임계값인
00:14:4095%를 상회한다면 이상적입니다. 하지만 그렇지 않다면,
00:14:47모델이 제대로 처리하지 못한 샘플을 학습할 방안이 필요합니다.
00:14:52여기서 사람이 개입하는 방식(Human-in-the-loop)이 적용됩니다.
00:14:57agent 호출, LLM, MCP 등 모든 흔적을 추적하여 문제 발생 지점을 찾습니다.
00:15:02생각의 사슬 추론 문제인지, 부적절한 도구가 호출되었는지, 정보 검색 실패인지 검증합니다.
00:15:08모델 지능 수준과 하드니스(hardness) 수준에서
00:15:14각 연결점(hook 및 node)을 면밀히 분석하여 개선점을 파악합니다.
00:15:20시스템에서 잘못 추출된 샘플들을 보완하는 작업이죠.
00:15:28긍정/부정 샘플과 업데이트 대상을 확보한 후,
00:15:34모델을 재학습시켜 성능 향상을 도모합니다. 이 과정은
00:15:40샘플 분석, 재훈련, 모델 개선, 신규 프로덕션 데이터셋 확보로 이어지는
00:15:46지속적 개선 순환 구조이며, 데이터 표류(drift) 여부와 모델 동작을 점검합니다.
00:15:53따라서 하이브리드 검토(Human-in-the-loop)는 상시 진행되며,
00:15:58매일 프로덕션 샘플을 채취해 모델 및 LLM 평가자의 성능을 확인합니다.
00:16:05비용 문제와 대규모 처리 한계 때문에 프론티어급 대형 VLM 모델을
00:16:14기본으로 사용할 수는 없습니다. 연산 복잡도와 추론 비용이 커서 확장성이 떨어지기 때문입니다.
00:16:20우리는 매우 국소적인 문제를 해결하고자 합니다. 모델이 코딩 문제를 풀 수 있는지는 중요치 않습니다.
00:16:25오직 당사의 특정 도메인 문제 해결 여부만 중요하며, 이는 고객에게 노출되지 않는 내적 시스템입니다.
00:16:31따라서 오프-폴리시(Off-policy) 및 온-폴리시(On-policy) 지식 증류(Knowledge Distillation)를 적용하고,
00:16:37실험적 양자화를 실시하여 4비트 양자화나
00:16:41bfloat16 등이 어떻게 동작하는지 점검합니다.
00:16:47이후 지식 증류 및 양자화 규모별 비교표를 작성하여
00:16:54성능 목표치를 충족하는 지점과 실서비스 추론 환경에서
00:17:00연산 자원 및 비용 절감 효과가 최대화되는 지점을 산출합니다.
00:17:07문제 해결 자체도 중요하지만, 프로덕션 환경에서의 확장성과
00:17:13비용 효율성이 필수적이기 때문에 이 최적화는 대단히 중요합니다.
00:17:21시중의 범용 모델을 그대로 쓸 수 없는 이유가 여기에 있습니다. 평가 항목으로 돌아가서,
00:17:27첫째는 작업 성공 여부입니다. 모달리티 정렬 발생 여부 등은 이분법적입니다.
00:17:31따라서 정밀도(Precision), 재현율(Recall), F1 점수가 기본 지표가 됩니다.
00:17:37하지만 단지 최종 결과뿐 아니라 전체 시스템을 전체론적(holistic) 관점에서 파악해야 합니다.
00:17:42각 노드의 작동 상태, 검색 시스템 성능, 지연 시간 및 재현율,
00:17:47추론의 적절성을 확인합니다. 검토자 agent 등 추론이 적용되는
00:17:53각 agent 단계에서 출력되는 생각의 사슬(CoT) 품질은 어떠한지,
00:17:59과도한 연산(overthinking)이 일어나는지, 연산 예산을 줄여
00:18:04낮은 비용으로 양호한 결과를 낼 수 있는지 점검합니다.
00:18:09반대로 계획이나 추론 예산을 늘려 복잡한 문제 해결 시
00:18:16더 높은 성능과 정확도를 확보할 수도 있습니다.
00:18:22이처럼 적응형 추론 예산 관리(adaptive reasoning budgeting)는 대단히 중요합니다.
00:18:29다음은 견고성(robustness)입니다. 코너 케이스와 오류 발생률,
00:18:34오류가 발생하는 노드 및 훅(hook) 위치를 파악합니다.
00:18:39도구 호출 오류인지, 검색 부문의 문제인지, LLM 성능 미달인지 분류합니다.
00:18:45이어 시스템 효율성을 검토합니다. 단순 결과물 성능만 보는 것이 아니라,
00:18:51토큰 비용의 모든 요소와 호출되는 LLM을 확인합니다.
00:18:56비용 절감을 위해 LLM을 최적화할 수 있는지, 각 agent 및
00:19:01전체 시스템의 지연 시간과 효율성은 어떠한지 확인합니다.
00:19:08또한 LLM 평가자 항목에서는 예측 시스템에 존재하는 데이터 표류를 감시합니다.
00:19:14특히 사용자 생성 콘텐츠가 개입될 때 이러한 현상이 심화됩니다.
00:19:20평가용 LLM 평가자가 사람 검토 작업 대비 잘 작동하고 있는지 점검하여,
00:19:25새로운 데이터로 평가자 모델을 재학습시킬지 여부를 결정합니다.
00:19:30최적화 기법으로는 유사한 프레임을 검출해 하나로 압축하는
00:19:35시공간 축소 최적화(spatial-temporal reduction optimization)가 있습니다.
00:19:41이를 통해 전체 비디오 처리량을 획기적으로 줄일 수 있습니다.
00:19:47두 번째는 캐싱 기법입니다. 바이럴 콘텐츠처럼 동일하게 유입되는 영상이
00:19:52파이프라인 전체를 다시 거치지 않도록 높은 유사도 점수를 기반으로
00:19:57다중 에이전트 처리를 건너뛰고 바로 판정을 내립니다.
00:20:01세 번째는 메타데이터 가지치기(pruning)입니다.
00:20:07신뢰도가 검증된 크리에이터나 주제 등 메타데이터를 기반으로 대상 탐색 범위를 축소합니다.
00:20:12신뢰성 점수가 높고 영상 품질과 참여도가 우수한 크리에이터의
00:20:18모든 이미지와 비디오를 일일이 정밀 처리할 필요는 없기 때문입니다.
00:20:22이처럼 메타데이터를 활용하면 시스템에 투입조차 필요 없는 영상들을
00:20:27사전에 선별할 수 있으며, 관련 플래그를 설정하면 매우 유용합니다.
00:20:33오늘 강연의 핵심 시사점(takeaway)은 다음과 같습니다.
00:20:42문제 분해(Decomposition)가 핵심이며, 필요한 순간 적절히 문제를 분해해야 합니다.
00:20:50적응형 최적화는 ROI 및 비용 타당성 확보에 필수적입니다.
00:20:56면밀한 평가 체계는 전체 시스템과 VLM 구축의 근간이 됩니다.
00:21:02또한 장기적 지속 가능성을 위해 예측 모니터링과 정성적 개선이 필수적입니다.
00:21:08이것으로 발표를 마치겠습니다. 경청해 주셔서 감사합니다.

Key Takeaway

1억 건 이상의 대규모 숏폼 비디오 생태계에서 모달리티 불일치와 비독창적 콘텐츠 문제를 해결하려면 소형 VLM 기반의 멀티 에이전트 시스템과 적응형 프레임 압축, DPO 기반 지속적 학습 파이프라인을 통합 구축해야 한다.

Highlights

  • 단일 모달리티 내 불일치는 영상 중간에 무관한 광고나 정치 메시지가 기습 삽입되는 문제로 클립 단위의 세밀한 시공간 분석이 요구된다.

  • 멀티 에이전트 시스템은 검토자, 인식자, 검색자 에이전트로 역할을 분담해 1억 건 이상의 대규모 비디오 데이터를 효율적으로 처리한다.

  • 고정 프레임 레이트 대신 시간적 변화 지점을 포착해 유사 프레임을 1~2개로 압축하는 방식을 적용하여 비디오 처리량을 줄인다.

  • 범용 VLM의 한계를 극복하기 위해 정제되지 않은 내부 데이터 기반의 자체 사전 학습과 지시어 미세 조정을 거친 도메인 특화 소형 VLM을 배포한다.

  • 지식 증류 및 4비트 양자화 기법을 도입하여 대형 모델 대비 연산 자원과 프로덕션 추론 비용을 절감한다.

  • DPO 및 Human-in-the-loop 검토 순환 구조를 구축해 목표 성능 미달 샘플을 분석하고 데이터 표류 현상에 지속적으로 대응한다.

Timeline

대규모 숏폼 비디오 데이터의 복잡성과 주요 과제

  • 1억 건 이상의 대규모 숏폼 데이터는 지속적인 데이터 표류와 명확한 정답의 부재라는 특성을 갖는다.
  • 단일 모달리티 내 불일치는 영상 중간에 의도와 다른 광고나 적대적 콘텐츠가 삽입되는 문제로 클립 단위의 세밀한 분석을 요구한다.
  • AI 도구의 발달로 늘어난 비독창적 콘텐츠는 저작권 침해와 중복 노출에 따른 사용자 피로도를 유발한다.

실제 서비스 환경에서는 다국어 텍스트, 바이럴 콘텐츠, 시스템 허점을 노리는 적대적 콘텐츠가 얽혀 있어 데이터 가변성이 매우 높다. CLIP 기반 코사인 유사도로 해결 가능한 모달리티 간 불일치와 달리, 단일 영상 내부의 맥락 불일치는 프레임 및 클립 단위의 시공간 이해가 필수적이다. 비독창적 영상의 범람은 생태계의 기여도 표기 균형을 깨뜨리고 서비스 품질을 저하시킨다.

검토자·인식자·검색자 에이전트 중심의 오케스트레이션 구조

  • 오케스트레이터 역할을 하는 검토자 에이전트가 중앙에서 전체 신호를 분석하고 하위 에이전트를 제어한다.
  • 인식자 에이전트는 영상을 고정 프레임 레이트 대신 시간적 변화 지점 기준으로 1~2 프레임으로 압축하여 타임스탬프 기반 메타데이터를 추출한다.
  • 검색자 에이전트는 역색인, 벡터 DB, 그래프 DB를 결합한 적응형 색인으로 유사 클립과 엔티티를 검색해 재현율을 극대화한다.

단일 LLM으로는 비디오 이해, 검색, 추론을 대규모로 처리할 수 없어 역할이 분화된 멀티 에이전트 구조를 사용한다. 인식자가 비디오의 시간적 변화 구간을 감지하여 시맨틱 임베딩과 OCR, 태그 정보가 담긴 JSON 객체로 변환하면, 검토자는 이를 바탕으로 시공간 이상 징후를 감지한다. 검색자는 다중 DB를 동시 활용하여 유사 영상 및 크리에이터 메타데이터 후보군을 추출하고 추론 단계에 제공한다.

각 에이전트의 작동 방식과 온라인 추론 파이프라인

  • 인식자 에이전트는 오프라인 상태에서 수십억 개의 프레임을 분석하여 클립 및 비디오 임베딩을 생성한다.
  • 검색자 에이전트는 Ray 클러스터 기반 분석을 거쳐 온라인 추론 시 후보군을 재정렬하고 스팸 점수 모델로 저품질 영상을 필터링한다.
  • 검토자 에이전트는 콘텐츠 신호뿐만 아니라 신고 내역, 댓글 감정 반응 등 실시간 사용자 상호작용 데이터를 함께 반영한다.

인식자 에이전트는 대규모 오프라인 처리를 통해 비디오 신호를 사전에 압축 및 분해한다. 검색자는 라이브 환경에서 들어오는 쿼리에 대해 유사도가 높은 상위 N개의 후보를 추출한 뒤 스팸 분류기를 거쳐 선별된 목록을 검토자에게 넘긴다. 검토자는 VLM이나 오프라인 모델이 놓치기 쉬운 실시간 시청자 반응 지표를 결합하여 최종 판정을 내린다.

도메인 특화 VLM 파이프라인 및 사후 학습

  • 범용 파운데이션 모델의 한계를 극복하기 위해 정제되지 않은 내부 데이터 기반의 비전 트랜스포머 자체 사전 학습을 진행한다.
  • 지시어 미세 조정을 통해 JSON 스키마 출력 형식과 생각의 사슬 추론 과정을 정교하게 학습시킨다.
  • DPO 및 Human-in-the-loop 검토를 결합하여 추론 실패 샘플을 지속적으로 분석하고 재학습 체계에 반영한다.

정제된 웹 데이터 기반의 공개 VLM은 사용자 생성 데이터 중심의 기업 내부 워크플로에 적용하기 어렵다. 비전 인코더와 언어 모델 사이에 프로젝터를 배치하고 전용 가이드라인에 맞춰 지시어 미세 조정을 시행한다. 프로덕션 데이터 중 성능 목표치에 미달하는 샘플은 추적 훅을 통해 원인을 분석하고, 사람 검토자의 라벨링 데이터를 활용한 DPO 재학습 순환 구조로 데이터 표류에 대응한다.

지식 증류, 양자화 및 종합적 360도 평가 체계

  • 대형 VLM의 연산 비용을 줄이기 위해 오프/온 폴리시 지식 증류와 4비트 양자화를 적용한다.
  • 단순 정밀도와 재현율 외에 생각의 사슬 품질, 적응형 추론 예산, 견고성, 토큰 비용을 포함한 종합적 평가 지표를 운용한다.
  • 시공간 축소, 바이럴 콘텐츠 캐싱, 메타데이터 가지치기로 멀티 에이전트 시스템에 투입되는 연산량을 사전에 차단한다.

프로덕션 환경의 확장성을 위해 대형 모델을 소형 모델로 압축하는 지식 증류 및 양자화가 필수적이다. 평가 시에는 추론 예산 조절을 통해 복잡한 문제에는 연산을 늘리고 단순 작업에는 연산을 줄여 비용 효율성을 확보한다. 또한 동일 패턴으로 유입되는 바이럴 영상은 캐시를 통해 즉시 판정하고, 신뢰도 높은 크리에이터의 영상은 메타데이터 가지치기로 정밀 처리 대상에서 제외함으로써 파이프라인 전체의 처리량을 축소한다.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video