Miskeselarasi Modalitas dan Atribusi Keaslian dalam Video Berdurasi Pendek — Aditya Gautam, Meta

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00Aditya Rahm: Halo semuanya, saya Aditya, dan kita akan membahas tentang dua masalah utama
00:00:17yang terjadi pada platform video berdurasi pendek.
00:00:20Kita akan membahas tentang bagaimana kita menangani hal-hal ini dalam skala besar.
00:00:25Jadi untuk memulainya, hal pertama adalah kita akan memahami apa saja karakteristik dari
00:00:28data yang coba kita tangani, apa dua masalah utama yang sebenarnya sedang kita
00:00:33kerjakan, dan apa saja sistem multi-agen untuk menyelesaikan masalah tersebut dalam skala besar.
00:00:39Apa saja VLM skala kecil khusus yang dapat kita bangun untuk menyelesaikan setiap
00:00:46masalah agen tersebut, dan bagaimana kita membangun agen-agen itu, apa saja berbagai cara untuk
00:00:50mengoptimalkannya, seperti membuatnya dapat ditingkatkan skalanya pada skala yang sangat besar, dan kemudian kita akan melihat
00:00:56ke evaluasinya secara holistik 360 derajat, bukan sekadar seperti precision recall.
00:01:00Apa saja yang ada di luar sana?
00:01:01Bagaimana kita memahami seluruh alur kerja multi-agen, baik dari tingkat LLM, alat, MCP, dan sebagainya,
00:01:08segalanya di luar sana.
00:01:09Lalu kita akan masuk ke teknik optimasi yang sangat spesifik untuk visi dan
00:01:14spesifik untuk data yang akan memungkinkan dan memberi kita kecerdasan untuk mengatakan bahwa kita tidak
00:01:20perlu melakukan alur kerja cerdas ini untuk semua video, kita dapat mengetahui kelompok kecil
00:01:25video mana yang harus menjadi kandidat untuk melakukan hal-hal ini.
00:01:29Dan kita akan mengakhiri dengan poin-poin kesimpulan.
00:01:32Jadi data di dunia nyata sangatlah kacau.
00:01:34Ini-- kita berbicara tentang skala 100 juta lebih dan jauh lebih banyak konten viral.
00:01:39Ada banyak konten beritikad buruk.
00:01:42Orang-orang berusaha memanipulasi sistem.
00:01:43Ada banyak teks multibahasa di layar serta dalam video dan gambar mereka.
00:01:48Dan datanya sangat dinamis.
00:01:50Datanya terus berubah dari bulan ke bulan.
00:01:52Berbagai alat AI terus bermunculan, segalanya di luar sana.
00:01:54Jadi ini benar-benar sangat dinamis.
00:01:57Artinya ada banyak masalah pergeseran data dan hal-hal lain yang menyertai data video.
00:02:00Dan kemudian kita tahu bahwa tidak ada kebenaran acuan yang jelas untuk masalah yang coba kita selesaikan.
00:02:05Jadi ini adalah masalah-masalah yang ada yang terjadi pada himpunan data video dunia nyata.
00:02:10Masalah pertama yang akan kita bahas adalah ketidaksesuaian modalitas,
00:02:14di mana yang pertama adalah intermodalitas, yang merupakan masalah yang sudah terselesaikan.
00:02:19Anda bisa memiliki model CLIP.
00:02:20Anda bisa memiliki modalitas pada gambar, video, audio, teks,
00:02:25dan mengetahui dengan pasti berapa kemiripan kosinus pada embedding tersebut dan menyelesaikannya.
00:02:29Jadi ini masalah yang jauh lebih sederhana.
00:02:31Apa yang akan kita bahas adalah bagaimana kita menangani masalah intramodalitas.
00:02:37Anggaplah ini seperti sebuah video.
00:02:39Kita memiliki sebuah video berdurasi panjang.
00:02:40Lalu tiba-tiba Anda melihat sesuatu, seperti iklan, agenda, hal-hal berbau politik,
00:02:45atau sesuatu di luar sana yang seharusnya tidak ada di dalam video saat Anda mengkliknya.
00:02:49Jadi bagaimana kita sebenarnya memeriksa segmen-segmen kecil dari video tersebut, memahami masalah ini,
00:02:54dan mengetahui di mana terdapat anomali atau semacam perilaku beritikad buruk di sana
00:02:59yang seharusnya tidak ada sejak awal.
00:03:01Jadi ini masalah pertama, yang membutuhkan banyak pemahaman mendalam, pemahaman visi,
00:03:05dan pemahaman video untuk melihat apa yang terjadi di tingkat klip dan tingkat bingkai yang sangat rinci.
00:03:10Masalah kedua adalah memahami konten yang tidak orisinal.
00:03:14Dalam ekonomi saat ini, dengan tersedianya alat-alat AI, sangat mudah untuk menduplikasi konten.
00:03:19Ketika seseorang mengunggah video atau semacamnya, kita melihat bahwa konten itu disalin, diubah,
00:03:25dan dengan berbagai alat, mengubah video-video ini menjadi jauh lebih mudah.
00:03:29Jadi bagaimana sebenarnya kita mendeteksi jenis konten yang tidak orisinal ini?
00:03:33Bagaimana cara kita mencari tahu sumber video tersebut?
00:03:35Dan hal ini sebenarnya telah menyebabkan masalah dalam atribusi, kredit, dan ketidakseimbangan ekosistem.
00:03:41Banyak terjadi kejenuhan pengguna, kita melihat banyak video berulang yang seharusnya tidak ada sejak awal.
00:03:47Beralih ke sistem multi-agen, hal pertama adalah mengapa kita beralih ke multi-agen,
00:03:54bukan agen tunggal atau LLM tunggal, karena masalahnya sangat kompleks.
00:03:57Ini membutuhkan simpul yang benar-benar terspesialisasi dan semacam pemahaman di setiap bagian pengambilan data,
00:04:04pemahaman konten, dan kemudian penalaran.
00:04:07Dan jika Anda dapat menyelesaikan masalah dengan satu agen, satu LLM, kita sebenarnya tidak perlu melakukannya pada sistem multi-agen.
00:04:14Jadi di sinilah otak terpusat, cara kita berpikir, semacam bagaimana dekomposisi masalah ini terjadi.
00:04:22Yang pertama pada dasarnya Anda memiliki video dan semacam ID video serta segalanya yang diberikan ke agen peninjau.
00:04:28Ini adalah agen terpusat.
00:04:29Ini pada dasarnya adalah pengatur alurnya.
00:04:31Anggaplah itu sebagai API gateway untuk melakukan dekomposisi sinyal dan menemukan apa yang terjadi di seputar gambar.
00:04:38Jadi apa yang dilakukan agen ini adalah mengambil agen Perceiver, dan agen Perceiver ini adalah pihak yang pada dasarnya dianggap
00:04:46sebagai ahli VLM yang sangat canggih dengan banyak alat gambar dan video yang tersedia.
00:04:52Agen Perceiver akan mengambil ID dari agen peninjau dan mengambil video tersebut dari basis data.
00:05:01Agen ini menguraikannya menjadi bagian-bagian lebih kecil menggunakan berbagai alat, embedding semantik yang berbeda, dan berbagai jenis perubahan temporal yang terjadi.
00:05:08Yang mana sedikit di luar cakupan pembicaraan kita ini, tetapi ini adalah teknik kita yang memastikan bahwa kita tidak melakukannya pada frame rate tetap.
00:05:17Melainkan kita menemukan di mana perubahan temporal terjadi dan mengompresi bingkai-bingkai serupa menjadi satu atau dua bingkai.
00:05:23Dan kemudian agen Perceiver mendapatkan semua data dari tingkat klip, tingkat embedding video, mendapatkan semua informasi tentang klip, embedding, tag, OCR, apa pun yang ada di sana,
00:05:34apa deskripsi bahasa alaminya, dan berapa stempel waktunya dari bingkai berapa ke bingkai berapa, seperti apa bentuk metadata tersebut.
00:05:41Agen tersebut memberikan data itu kepada peninjau.
00:05:43Peninjau akan memeriksa semua hal temporal ini, objek JSON yang disediakan oleh agen Perceiver dalam bentuk mentah, bersama dengan embedding, ID semantik, tag, OCR, dan segalanya.
00:05:52Dan agen tersebut melakukan analisis temporal.
00:05:55Agen memeriksa, oke, Anda tahu, dari bingkai pertama ke bingkai atau bingkai nomor 360, atau sampai detik keenam, itu adalah video yang membahas tentang olahraga.
00:06:05Dan tiba-tiba kita melihat dari detik ke-6 hingga 6,5 pada bingkai nomor ini ke ini, kita melihat bahwa ini berubah menjadi sesuatu berbau politik.
00:06:14Jadi hanya dengan melihat metadatanya, agen peninjau mampu memahami, mencerna, dan mengetahui secara persis apa anomali yang muncul dalam
00:06:22ruang temporal ini.
00:06:23Dan begitu melakukannya, agen menentukan apakah ini benar-benar ketidaksesuaian modalitas, atau ada masalah yang lebih besar di sana.
00:06:30Jadi agen peninjau akan memeriksa dan berbicara dengan agen pengambil data, dan menyampaikannya, "Hei, ini video yang sedang saya periksa."
00:06:36"Ini adalah beberapa metadata yang sudah saya bersihkan dari duplikasi dan saya pascaproses."
00:06:41"Sekarang berikan saya pemahaman tentang klip-klip serupa yang tersedia di dalam korpus data."
00:06:47Jadi agen pengambil data akan memeriksa semua sinyal yang diberikan oleh agen perceiver, semua metadata dari tingkat klip dan tingkat keseluruhan video, serta mengindeksnya ke dalam berbagai basis data secara adaptif.
00:06:57Misalnya, topiknya mungkin harus berupa indeks terbalik di mana kita memiliki topik dan banyak video.
00:07:02Untuk embedding, itu akan berupa basis data vektor yang tersedia di luar sana.
00:07:06Dan untuk berbagai jenis entitas yang diekstrak, kita memiliki basis data graf tempat agen peninjau akan mengetahui, oke, ini adalah beberapa basis data, ini adalah entitasnya, dan ini adalah metadatanya.
00:07:16Saya akan mengindeksnya sehingga pada saat inferensi daring, saya dapat mengetahui untuk klip tertentu apa saja klip serupa, entitas dan topik serupa yang tersedia untuk diambil dan meningkatkan recall.
00:07:28Jadi masuk ke masing-masing agen, kita telah membahas tentang perceiver.
00:07:32Agen itu memeriksa seluruh video, melakukan dekomposisi temporal menjadi klip-klip kecil berdasarkan embedding semantik dan beberapa algoritma, serta melakukan fine-tuning pada VLM untuk memancarkan semua informasi nyata yang konkret
00:07:45dan sangat rinci tentang setiap klip dan keseluruhan video.
00:07:51Karena kita berurusan pada skala yang sangat besar, itu berarti kita tidak bisa hanya menggunakan VLM standar yang ada di luar sana.
00:07:56Harus ada kompresi, harus ada cara yang hemat biaya untuk memproses model-model ini, untuk melakukannya pada miliaran bingkai.
00:08:05Di situlah kita masuk ke pra-pelatihan, fine-tuning, distilasi pengetahuan, kuantisasi untuk benar-benar menerapkan dan menyelesaikan VLM yang sangat,
00:08:13sangat terpesialisasi berdasarkan masalah khusus ini.
00:08:16Dan kita akan membahas hal itu secara singkat.
00:08:19Agen pengambil data adalah agen yang telah kita bahas secara umum.
00:08:22Dan kemudian apa yang dilakukannya dalam pemrosesan luring adalah bahwa semua sinyal yang diuraikan oleh agen perceiver secara luring,
00:08:29daripada menggunakan agen, Anda sebenarnya menggunakan pustaka itu dan melakukan analisis luring dalam skala besar.
00:08:34Katakanlah, kluster Ray atau semacamnya.
00:08:37Dan kemudian setelah Anda memiliki semua metadata tersebut, agen ini pada dasarnya mengindeksnya ke dalam berbagai basis data.
00:08:42Melakukan pengelompokan luring secara berkala dan menemukan apa saja konten yang serupa, berapa seharusnya ID embedding, berapa seharusnya ID kluster untuk setiap klip dan keseluruhan video.
00:08:50Jadi itulah data yang pada dasarnya digunakan oleh inferensi daring untuk menemukan video serupa.
00:08:56Dan secara daring, agen ini diberikan kueri atau ID klip beserta seluruh rincian metadatanya.
00:09:01Agen ini mencari tahu apa yang ada di dalam korpus data yang serupa dengan data ini.
00:09:06Apa saja hal-hal berbeda yang memiliki kemiripan tinggi.
00:09:09Jadi apa yang dilakukannya, agen ini memeriksa basis data, menemukan klip serupa, kreator serupa, dan berbagai informasi metadata.
00:09:16Mengurutkan ulang kandidat tersebut dan menggunakan beberapa alat, misalnya skor span model tradisional seperti skor klasifikasi,
00:09:24untuk melihat kandidat mana yang mungkin berupa spam, kurang berkualitas, dan hal-hal semacam itu.
00:09:29Setelah mendapatkan kandidat-kandidat teratas, ia mengembalikannya ke agen pengulas.
00:09:33Di situlah pengulas memproses: ini sinyal konten utama dan embedding klip saya.
00:09:39Ini adalah video serupa yang diberikan oleh agen pengambil.
00:09:42Mari dipikirkan lagi apakah perlu membuat ulang dan mengambil lebih banyak data dari agen pengambil.
00:09:48Jadi di situlah agen pengulas memiliki semua sinyal temporal dari satu klip.
00:09:52Ia memiliki semua informasi klip serupa, pemahaman, serta kreator serupa dan hal lainnya.
00:09:58Ia juga memiliki informasi real-time tentang cara pengguna berinteraksi dengan video ini.
00:10:03Berbagai jenis laporan atau komentar, bagaimana sentimen dari komentar-komentar tersebut, bukan?
00:10:13Banyak sinyal yang terlewat oleh sinyal luring, VLM, dan agen jenis lainnya,
00:10:18juga digabungkan untuk melihat apakah ada perubahan sentimen.
00:10:22Respons apa yang saya dapatkan secara real-time?
00:10:25Jadi ada berbagai alat yang tersedia untuk memahami video, tidak hanya dari kontennya
00:10:30dan perspektif semantik, tetapi juga dari perspektif interaksi pengguna.
00:10:36Sinyal-sinyal itu sangatlah penting.
00:10:38Setelah mendapatkan tugas ini dan semuanya, kami membangun alur kerja berbasis agen ini.
00:10:44Dan masing-masing dari alur kerja ini, ketiga agen ini didukung oleh VLM khusus
00:10:50dan VLM skala kecil.
00:10:54Jadi pertama-tama kita akan membahas pra-pelatihan.
00:10:58Biasanya, Anda melihat bahwa ada proses pra-pelatihan.
00:11:01Anda melakukan fine-tuning vision transformer sedikit demi sedikit untuk tujuan spesifik Anda.
00:11:08Masalahnya adalah VLM yang tersedia di luar sana, model fondasi dan model terdepan,
00:11:14dilatih dengan set data web yang sangat bersih, bagus, dan tertata dengan sangat baik.
00:11:20Namun, data internal untuk tujuan spesifik tidak memiliki karakteristik data yang sama.
00:11:26Datanya berantakan.
00:11:27Dihasilkan oleh pengguna.
00:11:28Khusus untuk alur kerja Anda.
00:11:30Artinya Anda perlu melatih ulang token gambar dan bahasa dari awal untuk melatih vision transformer Anda
00:11:37dan melihat apakah ada perbedaan antara melakukan fine-tuning dan melatih dari awal.
00:11:42Di situlah pra-pelatihan sangat berguna.
00:11:44Biayanya agak mahal, tetapi jika bisa memberikan peningkatan, hasilnya akan sangat bagus.
00:11:50Yang kedua adalah instruction fine-tuning, di mana kita memiliki dua masalah.
00:11:54Kami memiliki kebijakan dan panduan tertentu.
00:11:57Kami memahami konten dan sinyal yang ada, lalu melatihnya pada set data khusus tersebut dengan
00:12:04luaran tertentu berupa skema, seperti skema JSON, untuk memahami ketidaksesuaian modalitas,
00:12:10duplikasi skor, dan penalaran chain of thought yang diberikan oleh agen pengulas.
00:12:16Jadi di sini kita memiliki klip video.
00:12:17Kita punya vision encoder yang sudah kita latih sebelumnya.
00:12:21Sekarang kita melatihnya sedikit lebih lanjut.
00:12:23Ada proyektor yang berada di antara vision transformer dan model bahasa,
00:12:27yang berfungsi sebagai jembatan di antara keduanya.
00:12:30Lalu kita mendapatkan luaran tergantung pada data instruction fine-tuning yang dimiliki di bagian ini.
00:12:35Ini adalah bagian penting untuk meningkatkan performa model pada domain spesifik Anda.
00:12:45Jadi konteksnya adalah Anda memiliki peran, kebijakan, alat yang tersedia untuk
00:12:50mendasarkannya ke dalam metadata, dan hal-hal lain yang tersedia di luar sana.
00:12:54Berikan semuanya secara singkat ke dalam konteks, dan biarkan model memahami
00:13:01label terstruktur yang Anda temukan. Label ini merupakan label internal. Ini adalah label
00:13:06yang kami buat seperti apa modalitasnya, masalah apa saja yang kami temui,
00:13:12penalaran chain of thought apa yang harus ada pada model,
00:13:15dan seperti apa tampilan luarannya bagi pengulas manusia. Jadi ini seperti set data berkualitas
00:13:21sangat tinggi yang kita pakai untuk fine-tuning pada berbagai agen. Setelah kita selesai dengan
00:13:27pra-pelatihan hanya untuk memahami aspek visi atau aspek modalitas video lainnya,
00:13:33lalu kita melangkah ke penyesuaian agar model memahami dan memberikan konteks serta luaran
00:13:38sesuai cara pemrosesan data yang kita inginkan. Tahap berikutnya adalah tahap DPO,
00:13:44yaitu teknik yang sering digunakan dalam pasca-pelatihan untuk melakukan fine-tuning model
00:13:51ke ranah, domain, atau pemahaman kebijakan tertentu. Namun, teknik ini juga
00:13:58bisa sering digunakan dalam produksi untuk memahami sampel mana saja yang
00:14:02hasilnya kurang baik oleh sistem multi-agen dan LLM Anda. Jadi apa
00:14:11yang bisa dilakukan adalah: saat ada set data produksi yang masuk dan terjadi banyak inferensi,
00:14:17Anda mengambil sebagian sampel data dari produksi tersebut, lalu meneruskannya
00:14:23ke LLM penilai yang dilatih secara internal dengan set data berlabel manusia. Kemudian Anda menggunakan
00:14:29antrean peninjauan manusia untuk melihat performa yang dihasilkan pada sistem sebenarnya. Setelah mendapatkan
00:14:36hal tersebut, jika performanya luar biasa dan berada di atas ambang batas prediksi Anda,
00:14:40yaitu 95 persen untuk setiap masalah, itu bagus. Namun jika tidak, berarti harus ada cara
00:14:47untuk mempelajari sampel-sampel yang hasilnya kurang baik tersebut. Di situlah Anda melibatkan
00:14:52manusia dalam antrean. Manusia akan memahami semua jejak yang ada dari semua agen,
00:14:57panggilan LLM, MCP, dan menemukan di mana letak masalahnya. Apakah pada penalaran
00:15:02chain of thought? Atau ada alat yang salah dipanggil, atau pengambilan data yang tidak berhasil? Seluruh
00:15:08validasi dan pemahaman terhadap setiap kait dan simpul pada tingkat kecerdasan model,
00:15:14serta pada tingkat ketahanan, adalah hal yang Anda temukan untuk menentukan, “Oke, ini adalah perbaikan
00:15:20yang perlu saya lakukan pada sampel-sampel yang salah diambil oleh sistem kita.” Setelah memiliki
00:15:28hal itu, Anda punya sampel positif, sampel negatif, dan apa yang perlu diperbarui, lalu di situlah Anda
00:15:34melatih ulang model untuk melihat bagaimana kita bisa meningkatkannya lagi. Ini adalah peningkatan berkelanjutan
00:15:40di mana kita memeriksa sampel-sampel ini, melatih ulang, meningkatkan model, dan mendapatkan set data baru
00:15:46dari sampel produksi untuk mencoba memahami apakah terjadi pergeseran data atau apa yang sebenarnya
00:15:53dilakukan oleh model. Jadi, pelibatan manusia dalam proses ini selalu dilakukan secara berkelanjutan,
00:15:58di mana ada pengambilan sampel harian dari produksi untuk memahami kinerja model dan LLM penilai.
00:16:05Karena masalah biaya dan kemampuan untuk menyelesaikannya pada skala ini, kita tidak bisa menggunakan model VLM standar
00:16:14berukuran besar karena tidak dapat diskalakan, membutuhkan banyak inferensi, dan sangat rumit,
00:16:20sedangkan kita menyelesaikan masalah yang sangat spesifik. Saya tidak peduli apakah modelnya bisa menyelesaikan masalah
00:16:25pemrograman. Saya hanya peduli pada masalah domain spesifik saya. Itu saja. Ini tidak ditampilkan ke pelanggan,
00:16:31ini adalah masalah internal. Jadi saya akan melakukan distilasi pengetahuan off-policy dan on-policy
00:16:37serta melakukan sedikit kuantisasi berdasarkan beberapa eksperimen kuantisasi untuk memahami
00:16:41apakah 4-bit atau Bfloat yang berfungsi sangat baik. Lalu saya akan membuat tabel
00:16:47berbagai ukuran distilasi dan kuantisasi untuk memahami dan melihat di mana performa saya
00:16:54mencapai standar, serta di mana saya bisa menghemat banyak komputasi dan biaya sumber daya pada
00:17:00produksi inferensi dengan melakukan optimasi ini. Hal ini sangat krusial karena sebagai masalah
00:17:07yang telah kita selesaikan, semuanya bagus. Namun dalam produksi, sistem harus dapat diskalakan dan
00:17:13efisien dari segi biaya. Tidak bisa asal menggunakan solusi yang ada di pasar,
00:17:21karena kita menyelesaikan masalah yang sangat spesifik di sini. Kembali ke evaluasi, pada dasarnya,
00:17:27hal pertama adalah keberhasilan tugas. Tentu saja, ini adalah hal yang biner. Modalitas terjadi atau tidak
00:17:31terjadi. Apakah ada keselarasan atau ketidakselarasan. Presisi, recall, dan F1 score adalah matriks yang jelas untuk
00:17:37memahami keberhasilan tugas. Namun kita ingin melihat sistem secara menyeluruh,
00:17:42tidak hanya hasil akhirnya, tetapi apa yang terjadi pada setiap simpul, seberapa baik sistem pengambilan data
00:17:47bekerja, berapa latensi dan recall sistem, serta seberapa baik kita dapat menalar hal tersebut. Bagaimana penalaran
00:17:53chain of thought yang dihasilkan oleh model-model ini pada setiap tingkat agen atau di mana pun penalarannya
00:17:59berlaku, yang dalam kasus kita adalah agen pengulas? Dan bagaimana kualitasnya? Apakah
00:18:04terlalu rumit? Bisakah kita mengurangi anggaran di suatu bagian untuk memastikan model
00:18:09bekerja baik dengan anggaran lebih kecil? Atau bisakah kita meningkatkannya, anggaran perencanaan atau penalaran,
00:18:16agar memiliki anggaran lebih tinggi dan memastikan masalah rumit yang sedang kita selesaikan memiliki
00:18:22performa dan akurasi yang jauh lebih tinggi. Jadi, memiliki anggaran penalaran yang adaptif juga
00:18:29sangat penting. Lalu kita memiliki ketahanan. Kasus batas apa saja yang kita temui? Berapa tingkat kesalahan
00:18:34yang kita miliki? Di mana simpul dan kait terjadinya masalah? Apakah pemanggilan alat tidak
00:18:39bekerja dengan baik? Apakah bagian pengambilan data atau LLM kurang bekerja baik, dan hal-hal semacam itu. Dan
00:18:45kemudian kita memiliki efisiensi sistem di mana kita tidak hanya melihat performa luaran dan
00:18:51segalanya, tetapi juga melihat setiap aspek dari biaya token, LLM mana yang dipanggil? Bisakah
00:18:56kita mengoptimalkan LLM sedikit lagi untuk menghemat biaya? Efisiensi apa yang kita lihat dan bagaimana
00:19:01latensi dari setiap agen serta seluruh sistem jika digabungkan? Lalu kita punya LLM penilai di mana kita melihat
00:19:08bahwa dalam sistem prediksi apa pun, selalu terjadi pergeseran data, terutama ketika ada
00:19:14konten buatan pengguna. Jadi bagaimana LLM penilai kita, yang digunakan untuk evaluasi dan segalanya,
00:19:20bekerja dibandingkan dengan antrean manusia? Apakah ada pergeseran data? Apakah kita perlu melatih ulang LLM penilai
00:19:25dengan set data baru dari tim pelabelan? Atau bagaimana kita menanganinya? Dalam
00:19:30optimasi, kita memiliki optimasi pengurangan spasial-temporal, yang memeriksa bingkai gambar
00:19:35yang serupa dan mengompresnya menjadi satu aspek. Ini sangat menghemat total pemrosesan
00:19:41video secara signifikan. Yang kedua adalah penggunaan tembolok ketika ada konten viral
00:19:47yang bermunculan, dan Anda tidak ingin konten yang sama
00:19:52melewati seluruh alur pemrosesan. Di situlah Anda memanfaatkan skor kemiripan yang tinggi dan langsung melewati
00:19:57sistem multi-agen untuk langsung membuat keputusan. Yang ketiga, yang sangat penting,
00:20:01adalah pemangkasan metadata. Di sinilah kita memperkecil ruang dari banyak kandidat berdasarkan
00:20:07beberapa metadata, misalnya topik dan rekam jejak kreator yang sudah sangat baik.
00:20:12Artinya kita tidak perlu memproses semua gambar dan video dari kreator tersebut
00:20:18yang memiliki skor keaslian tinggi dan kinerjanya sangat baik,
00:20:22di mana kualitas video tinggi dan interaksinya bagus. Metadata seperti itu
00:20:27bisa digunakan untuk menyaring video agar tidak perlu masuk ke dalam sistem. Beberapa
00:20:33penanda ini akan sangat membantu. Poin penting terakhir yang bisa kita ambil dari ruangan ini adalah,
00:20:42dekomposisi masalah adalah kuncinya, yaitu mendekomposisi masalah saat diperlukan. Optimasi adaptif
00:20:50sangat penting untuk ROI dan kelayakan biaya. Evaluasi yang baik adalah hal terpenting. Segala sesuatunya
00:20:56bergantung pada hal ini. Ini adalah fondasi seluruh sistem dan VLM Anda. Pemantauan prediksi
00:21:02serta peningkatan kualitatif sangat penting untuk memastikan sistem berkelanjutan dalam jangka panjang.
00:21:08Dengan itu, saya akhiri. Terima kasih banyak sudah mendengarkan.

Key Takeaway

Sistem multi-agen berbasis VLM skala kecil terpesialisasi yang dikombinasikan dengan pemangkasan metadata dan optimasi spasial-temporal mampu menyelesaikan masalah ketidaksesuaian modalitas serta duplikasi konten pada skala 100 juta lebih video.

Highlights

  • Masalah ketidaksesuaian modalitas intramodalitas melibatkan deteksi anomali seperti iklan atau pesan politik yang terselip secara tiba-tiba di dalam video berdurasi panjang.

  • Arsitektur multi-agen terdiri dari tiga simpul khusus: Perceiver Agent untuk penguraian VLM, Retrieval Agent untuk pengindeksan basis data adaptif, dan Reviewer Agent sebagai pengatur alur kerja terpusat.

  • Proses pra-pelatihan ulang token gambar dan bahasa dari awal diperlukan karena set data internal buatan pengguna memiliki karakteristik yang jauh lebih acak dibanding set data web yang bersih.

  • Keterlibatan manusia dalam antrean produksi (human-in-the-loop) dilakukan melalui pengambilan sampel harian untuk mengevaluasi LLM penilai dan melatih ulang model via Direct Preference Optimization (DPO).

  • Pengurangan biaya komputasi inferensi dicapai melalui penggabungan bingkai serupa, pemangkasan metadata kreator berreputasi tinggi, dan pemanfaatan tembolok skor kemiripan untuk konten viral.

Timeline

Tantangan Pengolahan Data Video Berdurasi Pendek Skala Besar

  • Data video skala 100 juta lebih konten memiliki tingkat kompleksitas tinggi akibat pergeseran data harian dan ketiadaan kebenaran acuan yang jelas.
  • Konten beritikad buruk memanfaatkan alat AI untuk memanipulasi platform melalui teks multibahasa dan duplikasi cepat.

Pengolahan video pada skala besar menghadapi hambatan berupa tingginya dinamika perubahan data akibat kemunculan berbagai alat pembuat konten AI baru setiap bulan. Teks multibahasa yang tertanam pada gambar dan video memperumit proses verifikasi otomatis. Karakteristik data acak buatan pengguna ini tidak memiliki label kebenaran acuan yang konsisten, sehingga membutuhkan alur pemrosesan yang adaptif.

Ketidaksesuaian Modalitas dan Deteksi Konten Tidak Orisinal

  • Pencocokan intermodalitas telah terselesaikan menggunakan model kemiripan kosinus embedding seperti CLIP.
  • Anomali intramodalitas terjadi ketika segmen kecil video menyimpang dari topik utama, seperti sisipan iklan atau propaganda politik di tengah durasi.

Pemeriksaan kemiripan standar antara gambar, audio, dan teks tidak mampu mendeteksi manipulasi halus di dalam satu alur video. Kejenuhan pengguna terjadi akibat penyebaran video tak orisinal hasil salinan dan modifikasi cepat berbasis AI. Penanganan masalah ini memerlukan ekstraksi fitur pada tingkat bingkai dan klip secara rinci untuk melacak sumber asli serta atribusi pembuatan konten.

Arsitektur dan Interaksi Sistem Multi-Agen

  • Reviewer Agent berfungsi sebagai API gateway terpusat yang mengatur dekomposisi masalah dan analisis temporal.
  • Perceiver Agent mengompresi bingkai visual yang serupa dan mendistribusikan metadata berupa OCR, tag, serta deskripsi bahasa alami.
  • Retrieval Agent memanfaatkan kombinasi basis data vektor, indeks terbalik, dan basis data graf untuk pencarian konten serupa.

Kompleksitas masalah penalaran spasial-temporal tidak dapat diselesaikan secara efektif oleh satu LLM tunggal. Reviewer Agent mengirimkan ID video ke Perceiver Agent untuk menguraikan bingkai menjadi klip-klip kecil berdasarkan perubahan temporal semantik. Data terstruktur tersebut dikirim ke Retrieval Agent yang mengindeksnya ke dalam basis data graf untuk entitas dan basis data vektor untuk embedding, lalu memberikan kandidat video serupa kembali ke Reviewer Agent bersama data sentimen komentar real-time.

Pelatihan dan Optimasi VLM Terpesialisasi

  • Pra-pelatihan ulang vision transformer dari awal lebih efektif dibanding sekadar fine-tuning karena karakteristik data internal sangat berbeda dari set data web.
  • Instruction fine-tuning menggunakan proyektor khusus di antara vision encoder dan model bahasa untuk menghasilkan format skema JSON.
  • Distilasi pengetahuan off-policy dan kuantisasi model digunakan untuk memangkas biaya komputasi inferensi skala besar.

Model VLM komersial yang besar tidak efisien dan terlalu mahal untuk dijalankan pada miliaran bingkai video internal. Penggunaan sampel produksi harian dialirkan ke LLM penilai internal dan antrean peninjau manusia untuk mengidentifikasi kegagalan penalaran chain-of-thought atau pemanggilan alat. Sampel positif dan negatif hasil validasi manusia kemudian digunakan dalam tahap Direct Preference Optimization (DPO) untuk melatih ulang model secara berkelanjutan.

Metrik Evaluasi dan Pengurangan Beban Komputasi

  • Evaluasi alur kerja mencakup presisi biner, kualitas penalaran chain-of-thought adaptif, serta efisiensi biaya token per agen.
  • Kompresi spasial-temporal memadatkan bingkai gambar serupa menjadi satu bingkai representatif sebelum diproses.
  • Pemangkasan metadata melewati pemrosesan multi-agen untuk konten dari kreator yang memiliki rekam jejak keaslian tinggi.

Pengukuran kinerja tidak hanya mengandalkan nilai F1-score akhir, melainkan mencakup keandalan setiap kait pemanggilan alat dan latensi sistem. Sistem memanfaatkan tembolok berbasis skor kemiripan tinggi untuk langsung membuat keputusan pada konten viral tanpa melewati seluruh alur multi-agen. Pemanfaatan rekam jejak kredibilitas kreator mengurangi jumlah kandidat video yang perlu dianalisis secara mendalam oleh model VLM.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video