Transcript
00:00:00Aditya Rahm: 안녕하세요, 여러분. 저는 Aditya입니다. 오늘은 두 가지 주요 문제에 대해 이야기해 보겠습니다.
00:00:17숏폼 플랫폼에서 발생하는 문제들이죠.
00:00:20이러한 문제들을 대규모로 처리하는 방법에 대해 말씀드리겠습니다.
00:00:25우선 시작하기 앞서, 다루고자 하는 데이터의 특징이 무엇인지,
00:00:28현재 우리가 실제로 해결하려는 두 가지 주요 문제가 무엇인지 이해하고,
00:00:33이 문제들을 대규모로 해결하기 위한 멀티 에이전트 시스템은 무엇인지 살펴보겠습니다.
00:00:39각 에이전트의 개별 문제를 해결하기 위해 구축할 수 있는 특화된 소형 VLM에는 어떤 것이 있는지,
00:00:46그리고 이러한 에이전트들을 어떻게 구축하며, 대규모에서 확장 가능하도록 만들기 위해
00:00:50최적화하는 다양한 방법은 무엇인지 살펴본 후
00:00:56단순한 정밀도와 재현율을 넘어 매우 종합적인 360도 관점의 평가법을 살펴보겠습니다.
00:01:00현재 이용 가능한 것은 무엇일까요?
00:01:01LLM 레벨, 도구, MCP 등 제반 요소를 바탕으로 전체 멀티 에이전트 파이프라인을 이해하는 방법도 다룹니다.
00:01:08존재하는 모든 요소를 말이죠.
00:01:09그런 다음 시각 정보 및 데이터 특화 최적화 기법에 대해 살펴볼 텐데,
00:01:14이 기법을 통해 지능형 워크플로를 모든 비디오에 적용할 필요는 없다는 판단을 내릴 수 있습니다.
00:01:20이러한 작업을 수행하기에 적합한 비디오의 소규모 집합을
00:01:25파악해 낼 수 있게 되는 거죠.
00:01:29마지막으로 시사점을 정리하며 마무리하겠습니다.
00:01:32실제 세계의 데이터는 매우 복잡합니다.
00:01:34우리가 다루는 스케일은 1억 건 이상이며 바이럴 콘텐츠도 수없이 많습니다.
00:01:39적대적 콘텐츠도 상당수 존재하죠.
00:01:42사람들은 시스템의 허점을 이용하려고 합니다.
00:01:43화면, 동영상, 이미지 속에는 다국어 텍스트가 가득합니다.
00:01:48그리고 데이터는 매우 가변적입니다.
00:01:50달마다 계속해서 변합니다.
00:01:52새로운 AI 도구가 쏟아져 나오는 등 많은 것이 변하죠.
00:01:54따라서 대단히 유동적입니다.
00:01:57즉, 비디오 데이터에는 데이터 표류 현상(Drift)을 비롯해 많은 문제가 수반됩니다.
00:02:00또한 우리가 해결하려는 문제에 명확한 정답(Ground Truth)이 없다는 점도 잘 알고 있습니다.
00:02:05이것들이 바로 실제 비디오 데이터셋에서 발생하는 기존의 문제점들입니다.
00:02:10첫 번째로 이야기할 문제는 모달리티 불일치(Modality Misalignment)입니다.
00:02:14첫 번째 유형인 모달리티 간 불일치(Intermodality)는 이미 해결된 문제입니다.
00:02:19CLIP 모델을 사용할 수 있죠.
00:02:20이미지, 비디오, 오디오, 텍스트에 대한 모달리티를 가져와서
00:02:25해당 임베딩의 코사인 유사도가 정확히 어떻게 나오는지 파악하면 됩니다.
00:02:29따라서 이는 훨씬 간단한 문제입니다.
00:02:31우리가 논의할 내용은 단일 모달리티 내 불일치(Intramodality) 문제를 처리하는 방식입니다.
00:02:37비디오를 예로 들어보겠습니다.
00:02:39긴 비디오가 하나 있습니다.
00:02:40그런데 갑자기 특정 광고나 정치적 의도, 특정 메시지 등
00:02:45원래 클릭했을 때 기대했던 내용과 상관없는 영상이 등장합니다.
00:02:49그렇다면 비디오의 짧은 구간들을 실제로 분석하여 이 문제를 이해하고
00:02:54원래 있어서는 안 될 이상 징후나 적대적 행위가
00:02:59어디에서 발생하는지 어떻게 파악할 수 있을까요?
00:03:01이 첫 번째 문제는 클립 및 프레임 단위에서 일어나는 상황을 파악하기 위해
00:03:05상당히 세밀한 수준의 비전 및 비디오 이해를 필요로 합니다.
00:03:10두 번째 문제는 비독창적 콘텐츠(Unoriginal Content)를 파악하는 것입니다.
00:03:14오늘날 AI 도구가 보급된 환경에서는 콘텐츠를 복제하기가 대단히 쉽습니다.
00:03:19누군가 영상을 업로드하면, 그것이 무단 복제되거나 변형되는 것을 보게 되는데
00:03:25도구들의 발전으로 영상을 변형하는 작업이 훨씬 쉬워졌습니다.
00:03:29그렇다면 이러한 비독창적 콘텐츠를 실제로 어떻게 감지할 수 있을까요?
00:03:33비디오의 출처는 어떻게 알아낼 수 있을까요?
00:03:35이 문제는 저작권 인정, 기여도 표기, 생태계 불균형 문제를 야기했습니다.
00:03:41사용자의 피로도도 상당한데, 노출되지 말아야 할 중복 비디오가 지나치게 많이 도배되고 있습니다.
00:03:47이제 멀티 에이전트 시스템에 대해 말씀드리자면, 단일 에이전트나 단일 LLM이 아닌
00:03:54멀티 에이전트로 이동하려는 이유는 이 문제가 매우 복잡하기 때문입니다.
00:03:57검색, 콘텐츠 이해, 그리고 추론의 각 단계마다
00:04:04대단히 특화된 노드와 정교한 이해 능력이 요구됩니다.
00:04:07단 하나의 에이전트나 LLM으로 문제를 해결할 수 있다면 굳이 멀티 에이전트 시스템을 쓸 필요가 없겠죠.
00:04:14중앙 집중형 두뇌가 동작하는 방식과 이 문제를 분해하는 방식은 다음과 같습니다.
00:04:22기본적으로 비디오와 비디오 ID 등이 검토자(Reviewer) 에이전트에 전달됩니다.
00:04:28이것이 중앙 집중형 에이전트입니다.
00:04:29기본적으로 오케스트레이터 역할을 수행하죠.
00:04:31신호를 분해하고 이미지 주변에서 무슨 일이 일어나는지 파악하는 API 게이트웨이라고 보시면 됩니다.
00:04:38이 에이전트가 하는 일은 인식자(Perceiver) 에이전트를 활용하는 것입니다. 인식자 에이전트는
00:04:46다양한 이미지 및 비디오 도구를 다룰 수 있는 매우 정교한 VLM 전문가라 할 수 있습니다.
00:04:52인식자 에이전트는 검토자 에이전트로부터 ID를 받아서 데이터베이스에서 비디오를 가져옵니다.
00:05:01다양한 도구, 시맨틱 임베딩, 시간에 따른 변화 등을 활용해 영상을 더 작은 단위로 분해합니다.
00:05:08발표 범위를 약간 벗어나지만, 고정 프레임 레이트로 처리하지 않도록 보장해 주는 당사의 기술입니다.
00:05:17대신 시간적 변화가 일어난 지점을 찾아 유사한 프레임들을 1~2개 프레임으로 압축합니다.
00:05:23그러면 인식자 에이전트는 클립 및 비디오 임베딩 수준에서 데이터를 추출하고, 태그, OCR 등 존재하는 모든 정보와
00:05:34자연어 설명, 몇 프레임부터 몇 프레임까지인지에 대한 타임스탬프와 메타데이터 구조를 확보합니다.
00:05:41그리고 해당 데이터를 검토자에게 전달합니다.
00:05:43검토자는 인식자 에이전트가 원시 형태(Raw form)로 제공한 타임스탬프 기반 JSON 객체를 임베딩, 시맨틱 ID, 태그, OCR 등과 함께 살펴봅니다.
00:05:52그리고 시점별 시간차 분석(Temporal Analysis)을 수행합니다.
00:05:55예를 들어 첫 프레임부터 360번째 프레임까지, 즉 6초까지는 스포츠에 관한 영상이었는데
00:06:056초에서 6.5초 사이의 특정 프레임 구간에서 갑자기 정치적 내용으로 전환되는 것을 포착합니다.
00:06:14이처럼 메타데이터를 확인하는 것만으로도 검토자 에이전트는 해당 시공간 영역에서
00:06:22어떤 이상 징후가 나타나는지 이해하고 파악할 수 있습니다.
00:06:23분석을 마치면 이것이 실제로 모달리티 불일치인지, 아니면 더 큰 문제가 존재하는지 판단합니다.
00:06:30검토자 에이전트는 검색자(Retriever) 에이전트와 통신하며 “내가 확인 중인 비디오가 이것인데
00:06:36중복을 제거하고 후처리해둔 메타데이터가 일부 있으니
00:06:41코퍼스에 존재하는 유사한 클립 정보를 제공해달라”고 요청합니다.
00:06:47그러면 검색자 에이전트는 인식자 에이전트가 제공한 모든 신호와 클립 및 전체 비디오의 메타데이터를 확인한 후, 이를 다양한 DB에 적응형으로 색인화합니다.
00:06:57예를 들어 주제(Topic)의 경우, 주제와 다수의 비디오가 연결된 역색인(Inverted index) 형태를 사용할 수 있습니다.
00:07:02임베딩의 경우에는 시중에 제공되는 벡터 데이터베이스를 활용합니다.
00:07:06그리고 추출된 다양한 엔티티에 대해서는 그래프 DB를 구축하여, 검토자 에이전트가 다중 DB, 엔티티, 메타데이터 구조를 파악할 수 있게 합니다.
00:07:16이를 색인화해 두면 온라인 추론 시점에 특정 클립과 유사한 클립, 유사한 엔티티 및 주제를 가져와 재현율(Recall)을 향상시킬 수 있습니다.
00:07:28이제 개별 에이전트에 대해 알아보겠습니다. 방금 인식자에 대해 말씀드렸죠.
00:07:32전체 비디오를 분석하고 시맨틱 임베딩 및 알고리즘을 바탕으로 시간적 분해를 수행한 뒤, VLM을 파인 튜닝하여
00:07:45각 클립과 전체 비디오에 대한 매우 구체적이고 세부적인 정보를 도출해 냅니다.
00:07:51우리는 대규모 환경을 다루고 있으므로 기존에 출시된 표준 VLM만으로는 한계가 있습니다.
00:07:56수십억 개의 프레임에 대해 작업을 수행하려면 압축이 필요하고, 이러한 모델을 실제로 처리할 비용 효율적인 방법이 필요합니다.
00:08:05그렇기 때문에 사전 학습, 파인 튜닝, 지식 증류, 양자화 기법을 도입하여
00:08:13이 특정한 문제에 맞춰 매우 특화된 VLM을 배포하고 해결하고자 합니다.
00:08:16이에 대해 간략히 말씀드리겠습니다.
00:08:19검색자 에이전트는 앞서 개괄적으로 설명해 드린 역할을 담당합니다.
00:08:22오프라인 처리 과정에서는 인식자 에이전트가 오프라인 방식으로 분해한 모든 신호를
00:08:29라이브러리로 가져와 대규모 오프라인 분석을 진행합니다.
00:08:34예를 들어 Ray 클러스터 같은 환경을 활용하는 것이죠.
00:08:37그런 다음 모든 메타데이터가 확보되면 이를 다양한 데이터베이스에 색인화합니다.
00:08:42주기적으로 오프라인 클러스터링을 수행해 유사 콘텐츠를 찾고 각 클립과 전체 비디오의 임베딩 ID 및 클러스터 ID를 할당합니다.
00:08:50이 데이터가 바로 온라인 추론 시 유사 비디오를 검색하는 데 사용됩니다.
00:08:56온라인 환경에서는 쿼리나 클립 ID, 메타데이터 세부 정보가 주어지면
00:09:01코퍼스 내에서 해당 클립과 유사한 대상이 무엇인지 파악합니다.
00:09:06유사도가 높은 다양한 항목들을 찾아내는 것이죠.
00:09:09따라서 데이터베이스를 조회하여 유사 클립, 유사 제작자 및 다양한 메타데이터 정보를 찾아냅니다.
00:09:16후보들을 재정렬하고, 기존의 스팸 점수 모델이나 분류기 점수 같은 도구를 활용하여
00:09:24스팸 가능성이 있거나 품질이 낮을 수 있는 후보 요소들을 걸러냅니다.
00:09:29상위 N개의 후보가 축출되면, 이를 검토자(Reviewer) agent에 전달합니다.
00:09:33검토 단계에서는 메인 콘텐츠 신호와 클립 임베딩을 실제 처리합니다.
00:09:39검색기(Retriever)가 제공한 유사한 동영상들이 있으면,
00:09:42이를 분석하고 검색기로부터 더 많은 데이터를 가져올지 판단합니다.
00:09:48따라서 검토자는 단일 클립의 모든 시공간적 신호를 확보하게 되며,
00:09:52유사한 클립과 작성자 정보 등 제반 유사 데이터를 종합적으로 파악합니다.
00:09:58또한 사용자가 이 영상과 어떻게 상호작용하는지에 대한 실시간 정보도 보유합니다.
00:10:03신고 내역이나 댓글의 분위기와 같은 감정 반응도 확인하죠.
00:10:13오프라인 신호나 VLM, 기타 agent들이 놓칠 수 있는 수많은 신호들을
00:10:18함께 반영하여 시청자 반응에 변화가 발생하는지 감지합니다.
00:10:22실시간으로 어떠한 반응이 오는지 확인하는 것이죠.
00:10:25영상을 단지 콘텐츠나 의미론적 측면에서만 분석하는 것이 아니라
00:10:30사용자 상호작용 관점까지 고려할 수 있도록 다양한 도구가 사용됩니다.
00:10:36이러한 신호들은 극히 중요합니다.
00:10:38이러한 처리 과정 전체를 바탕으로 에이전트 프레임워크를 구축했습니다.
00:10:44이 에이전트 프레임워크 내 3개 agent는 각각 특화된
00:10:50VLM 및 소형 VLM 모델을 통해 구동됩니다.
00:10:54우선 사전 학습(Pre-training)에 대해 설명해 드리겠습니다.
00:10:58일반적으로는 사전 학습된 모델을 가져와서
00:11:01비전 트랜스포머를 조금 미세 조정해 특정 목적에 맞게 튜닝하곤 합니다.
00:11:08하지만 공개된 범용 VLM 기반 파운데이션 모델들은
00:11:14정제되고 깔끔하게 튜닝된 웹 데이터셋으로 학습된 경우가 많습니다.
00:11:20반면 기업 내부의 특수 목적용 데이터는 그러한 특성을 띠지 않습니다.
00:11:26정제되어 있지 않죠.
00:11:27사용자가 생성한 데이터이며,
00:11:28특정한 워크플로를 위한 데이터입니다.
00:11:30즉, 이미지 토큰과 텍스트를 바탕으로 바닥부터 비전 트랜스포머를 학습시킬지,
00:11:37처음부터 사전 학습을 진행하는 것이 기존 모델 파인튜닝 대비 성능 차이를 내는지 확인해야 합니다.
00:11:42여기서 자체 사전 학습의 유용성이 드러납니다.
00:11:44비용은 좀 더 들지만 확실한 성능 향상(delta)을 가져온다면 매우 효과적입니다.
00:11:50두 번째 단계는 지시어 미세 조정(Instruction Fine-tuning)입니다.
00:11:54여기서 우리는 특정 정책과 가이드라인을 정의합니다.
00:11:57콘텐츠와 신호를 파악하고 특정 데이터셋에 맞춰 모델을 튜닝하는데,
00:12:04JSON 스키마와 같은 특정 출력 형식에 맞춰 모달리티 불일치,
00:12:10점수 중복, 검토자 agent가 제공하는 생각의 사슬(CoT) 추론 등을 학습시킵니다.
00:12:16구조를 보자면 먼저 비디오 클립이 입력됩니다.
00:12:17일차적으로 사전 학습을 거친 비전 인코더가 있고,
00:12:21이에 대해 추가 학습을 수행하게 됩니다.
00:12:23비전 트랜스포머와 언어 모델 사이에는 프로젝터가 위치하여
00:12:27두 구조를 연결하는 가교 역할을 수행합니다.
00:12:30그리고 해당 입력측 지시어 파인튜닝 데이터에 따라 최종 결과가 출력됩니다.
00:12:35이 과정이 도메인 특화 분야에서 모델 성능을 향상시키는 핵심 요소입니다.
00:12:45핵심 맥락은 역할과 정책, 메타데이터에 접목(grounding)할 도구,
00:12:50그리고 기타 가용한 수단들을 효율적으로 설정하는 것입니다.
00:12:54전체 정보를 간결하게 컨텍스트로 제공한 뒤,
00:13:01자체 라벨링 데이터를 파악하도록 합니다. 여기서 정의한 라벨은
00:13:06모달리티 관련 문제나 발견되는 오류 유형,
00:13:12모델에 반영되어야 할 생각의 사슬(CoT) 추론 과정,
00:13:15사람 검토자 관점의 최종 출력 형태 등을 포함합니다.
00:13:21즉 고품질 데이터셋을 구축하여 각 agent를 미세 조정하는 것입니다.
00:13:27비영상 및 다중 모달리티 측면을 이해하기 위한 사전 학습이 완료되면,
00:13:33그 후 미세 조정을 진행하여, 우리가 데이터셋을 실제로 처리하려는 방식에 맞게
00:13:38파인튜닝 단계로 진입합니다. 다음 단계는 DPO 단계입니다.
00:13:44DPO 기법은 사후 학습(post-training)에서 특정 영역이나 도메인,
00:13:51정책 이해도 등을 위해 모델을 미세 조정할 때 흔히 사용됩니다.
00:13:58또한 프로덕션 환경에서 다중 에이전트 시스템 및 LLM의 결과물이
00:14:02만족스럽지 못한 샘플들을 파악하는 데 매우 효과적으로 쓰입니다.
00:14:11실제 운용 중 수집되는 프로덕션 데이터셋에서
00:14:17대량의 추론이 일어날 때, 해당 데이터의 일부 샘플을 추출합니다.
00:14:23이를 사람이 라벨링한 데이터로 자체 학습시킨 'LLM 평가자(LLM as a judge)'에 통과시키고,
00:14:29사람의 검토 큐(human review queue)를 거쳐 실제 시스템 성능을 확인합니다.
00:14:36만약 성능이 뛰어나 각 문제별 예상 임계값인
00:14:4095%를 상회한다면 이상적입니다. 하지만 그렇지 않다면,
00:14:47모델이 제대로 처리하지 못한 샘플을 학습할 방안이 필요합니다.
00:14:52여기서 사람이 개입하는 방식(Human-in-the-loop)이 적용됩니다.
00:14:57agent 호출, LLM, MCP 등 모든 흔적을 추적하여 문제 발생 지점을 찾습니다.
00:15:02생각의 사슬 추론 문제인지, 부적절한 도구가 호출되었는지, 정보 검색 실패인지 검증합니다.
00:15:08모델 지능 수준과 하드니스(hardness) 수준에서
00:15:14각 연결점(hook 및 node)을 면밀히 분석하여 개선점을 파악합니다.
00:15:20시스템에서 잘못 추출된 샘플들을 보완하는 작업이죠.
00:15:28긍정/부정 샘플과 업데이트 대상을 확보한 후,
00:15:34모델을 재학습시켜 성능 향상을 도모합니다. 이 과정은
00:15:40샘플 분석, 재훈련, 모델 개선, 신규 프로덕션 데이터셋 확보로 이어지는
00:15:46지속적 개선 순환 구조이며, 데이터 표류(drift) 여부와 모델 동작을 점검합니다.
00:15:53따라서 하이브리드 검토(Human-in-the-loop)는 상시 진행되며,
00:15:58매일 프로덕션 샘플을 채취해 모델 및 LLM 평가자의 성능을 확인합니다.
00:16:05비용 문제와 대규모 처리 한계 때문에 프론티어급 대형 VLM 모델을
00:16:14기본으로 사용할 수는 없습니다. 연산 복잡도와 추론 비용이 커서 확장성이 떨어지기 때문입니다.
00:16:20우리는 매우 국소적인 문제를 해결하고자 합니다. 모델이 코딩 문제를 풀 수 있는지는 중요치 않습니다.
00:16:25오직 당사의 특정 도메인 문제 해결 여부만 중요하며, 이는 고객에게 노출되지 않는 내적 시스템입니다.
00:16:31따라서 오프-폴리시(Off-policy) 및 온-폴리시(On-policy) 지식 증류(Knowledge Distillation)를 적용하고,
00:16:37실험적 양자화를 실시하여 4비트 양자화나
00:16:41bfloat16 등이 어떻게 동작하는지 점검합니다.
00:16:47이후 지식 증류 및 양자화 규모별 비교표를 작성하여
00:16:54성능 목표치를 충족하는 지점과 실서비스 추론 환경에서
00:17:00연산 자원 및 비용 절감 효과가 최대화되는 지점을 산출합니다.
00:17:07문제 해결 자체도 중요하지만, 프로덕션 환경에서의 확장성과
00:17:13비용 효율성이 필수적이기 때문에 이 최적화는 대단히 중요합니다.
00:17:21시중의 범용 모델을 그대로 쓸 수 없는 이유가 여기에 있습니다. 평가 항목으로 돌아가서,
00:17:27첫째는 작업 성공 여부입니다. 모달리티 정렬 발생 여부 등은 이분법적입니다.
00:17:31따라서 정밀도(Precision), 재현율(Recall), F1 점수가 기본 지표가 됩니다.
00:17:37하지만 단지 최종 결과뿐 아니라 전체 시스템을 전체론적(holistic) 관점에서 파악해야 합니다.
00:17:42각 노드의 작동 상태, 검색 시스템 성능, 지연 시간 및 재현율,
00:17:47추론의 적절성을 확인합니다. 검토자 agent 등 추론이 적용되는
00:17:53각 agent 단계에서 출력되는 생각의 사슬(CoT) 품질은 어떠한지,
00:17:59과도한 연산(overthinking)이 일어나는지, 연산 예산을 줄여
00:18:04낮은 비용으로 양호한 결과를 낼 수 있는지 점검합니다.
00:18:09반대로 계획이나 추론 예산을 늘려 복잡한 문제 해결 시
00:18:16더 높은 성능과 정확도를 확보할 수도 있습니다.
00:18:22이처럼 적응형 추론 예산 관리(adaptive reasoning budgeting)는 대단히 중요합니다.
00:18:29다음은 견고성(robustness)입니다. 코너 케이스와 오류 발생률,
00:18:34오류가 발생하는 노드 및 훅(hook) 위치를 파악합니다.
00:18:39도구 호출 오류인지, 검색 부문의 문제인지, LLM 성능 미달인지 분류합니다.
00:18:45이어 시스템 효율성을 검토합니다. 단순 결과물 성능만 보는 것이 아니라,
00:18:51토큰 비용의 모든 요소와 호출되는 LLM을 확인합니다.
00:18:56비용 절감을 위해 LLM을 최적화할 수 있는지, 각 agent 및
00:19:01전체 시스템의 지연 시간과 효율성은 어떠한지 확인합니다.
00:19:08또한 LLM 평가자 항목에서는 예측 시스템에 존재하는 데이터 표류를 감시합니다.
00:19:14특히 사용자 생성 콘텐츠가 개입될 때 이러한 현상이 심화됩니다.
00:19:20평가용 LLM 평가자가 사람 검토 작업 대비 잘 작동하고 있는지 점검하여,
00:19:25새로운 데이터로 평가자 모델을 재학습시킬지 여부를 결정합니다.
00:19:30최적화 기법으로는 유사한 프레임을 검출해 하나로 압축하는
00:19:35시공간 축소 최적화(spatial-temporal reduction optimization)가 있습니다.
00:19:41이를 통해 전체 비디오 처리량을 획기적으로 줄일 수 있습니다.
00:19:47두 번째는 캐싱 기법입니다. 바이럴 콘텐츠처럼 동일하게 유입되는 영상이
00:19:52파이프라인 전체를 다시 거치지 않도록 높은 유사도 점수를 기반으로
00:19:57다중 에이전트 처리를 건너뛰고 바로 판정을 내립니다.
00:20:01세 번째는 메타데이터 가지치기(pruning)입니다.
00:20:07신뢰도가 검증된 크리에이터나 주제 등 메타데이터를 기반으로 대상 탐색 범위를 축소합니다.
00:20:12신뢰성 점수가 높고 영상 품질과 참여도가 우수한 크리에이터의
00:20:18모든 이미지와 비디오를 일일이 정밀 처리할 필요는 없기 때문입니다.
00:20:22이처럼 메타데이터를 활용하면 시스템에 투입조차 필요 없는 영상들을
00:20:27사전에 선별할 수 있으며, 관련 플래그를 설정하면 매우 유용합니다.
00:20:33오늘 강연의 핵심 시사점(takeaway)은 다음과 같습니다.
00:20:42문제 분해(Decomposition)가 핵심이며, 필요한 순간 적절히 문제를 분해해야 합니다.
00:20:50적응형 최적화는 ROI 및 비용 타당성 확보에 필수적입니다.
00:20:56면밀한 평가 체계는 전체 시스템과 VLM 구축의 근간이 됩니다.
00:21:02또한 장기적 지속 가능성을 위해 예측 모니터링과 정성적 개선이 필수적입니다.
00:21:08이것으로 발표를 마치겠습니다. 경청해 주셔서 감사합니다.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video