Hambatan AI Fisik Selanjutnya Adalah Menemukan Video yang Tepat — Rafael Levi, Bright Data
AAI Engineer
컴퓨터/소프트웨어경제 뉴스AI/미래기술
스크립트
00:00:00Halo semuanya, selamat datang. Bagi Anda yang memang datang untuk melihat saya, terima kasih. Bagi Anda yang
00:00:21sekadar bersantai di sini, terima kasih juga. Saya akan mencoba menghibur Anda sekalian, mengajarkan sesuatu yang baru.
00:00:26Sekali lagi, nama saya Rafael, saya bekerja di Bright Data, saya sudah di Bright Data selama lebih dari delapan tahun dan di Bright Data kami mengumpulkan data dan mencoba berinovasi.
00:00:38Jadi hari ini saya ingin berbicara tentang penemuan video untuk pelatihan model dunia agen, dan kita akan menjelaskan apa itu nanti.
00:00:48Jadi, apa yang dibutuhkan saat ini untuk membangun sistem yang dapat melihat, memahami, dan bertindak?
00:00:56Bukan? Maksud saya, kita sudah memahami apa itu AI, kita terus meningkatkannya, jadi bagian itu sudah teratasi,
00:01:04tetapi bagian yang sulit sekarang adalah data apa yang Anda berikan padanya, karena semua orang tahu AI tanpa data hanyalah sebuah kotak kosong.
00:01:13Benar? Jadi, mari kita tengok sedikit sejarahnya, ya? Pada tahun 2022, Google mengajari robot melalui gambar,
00:01:25tindakan di dunia nyata, bukan? Kemudian berlanjut, ada lonjakan besar. Pada tahun 2023, kita mendapati AI benar-benar mengendalikan banyak robot.
00:01:37Pada tahun 2024, open source mulai bermunculan. Nah, di situlah permainannya berubah. Begitu kita memiliki open source, semua laboratorium memiliki akses ke AI dan mereka mulai memasukkan AI ke dalam robot, bukan?
00:01:51Dan sekarang model-model ini sudah mengendalikan robot humanoid. Saya melihat beberapa di sini, tentu saja sebagian besar dikendalikan dari jarak jauh.
00:02:00Tapi maksud saya, di San Francisco, Anda punya Waymo yang berkendara tanpa pengemudi sama sekali. Keren sekali, bukan?
00:02:07Pertama kali saya naik ke mobil itu, saya pikir saya akan mati, tetapi ternyata sangat menyenangkan.
00:02:12Benar? Nah, menurut Anda bagaimana mobil itu belajar cara berkendara? Dengan mengajari dirinya sendiri, belajar dari kamera dasbor, bukan?
00:02:22Setiap mobil punya dasbor. Jadi jika Anda memberikan itu ke AI, AI dapat mencari tahu cara mengoperasikan mesin.
00:02:31Jadi seperti yang saya katakan, AI bukan lagi bagian yang sulit, melainkan datanya, dan inilah yang ingin saya bicarakan, ya?
00:02:39Untuk LLM percakapan, ada triliunan kata dan teks, bukan? Jadi kita punya begitu banyak data teks untuk melatih LLM.
00:02:49Untuk pembuatan gambar, kita punya miliaran gambar, gambar berlabel, jadi itu juga basis data yang sangat besar.
00:02:56Namun untuk robotika, hanya ada sekitar satu juta video. Itu adalah kumpulan data yang sangat kecil dan terbatas tentang robot yang melakukan berbagai hal, bukan?
00:03:09Dan gagasan di sini adalah bahwa, tentu saja, banyak perusahaan di luar sana yang membayar orang untuk merekam tindakan, bukan?
00:03:20Seperti contohnya, beri tahu, rekam cara Anda membuka pintu, atau rekam cara Anda duduk di kursi.
00:03:28Tetapi masalahnya adalah ketika seseorang diperintahkan untuk melakukan sesuatu, mereka tidak melakukannya secara alami.
00:03:34Jadi saya menyebutnya terarah, bukan? Jika Anda diminta merekam cara Anda membuka pintu, dan Anda melakukannya untuk seseorang,
00:03:40hasilnya tidak akan sama seperti saat Anda langsung masuk ke rumah begitu saja. Gerakannya benar-benar berbeda.
00:03:45Jadi, apakah data itu bagus untuk pelatihan robotika? Menurut asumsi saya, tidak. Itu data yang bias dan tidak memberikan hasil yang sama.
00:03:53Jadi jelas, robot tersebut tidak akan seefektif jika ia bekerja secara intuitif, bukan?
00:03:59Jadi saya hanya memasukkan beberapa contoh di slide, ya?
00:04:06Data yang dibuat secara manual tidak sama dengan data yang terkumpul secara alami, bukan?
00:04:12Faktanya juga, orang bertindak sangat berbeda saat berada di depan kamera.
00:04:16Sebagian dari Anda tahu, ada orang yang malu kamera, jadi begitu Anda mengarahkan kamera ke mereka, mereka berubah.
00:04:23Namun di dunia nyata, hal itu sama sekali berbeda.
00:04:27Jadi inilah yang coba kami selesaikan di Bright Data, ya?
00:04:35Sekali lagi, mengapa sumber data yang biasa digunakan itu tidak cukup, kan?
00:04:37Simulasi. Secara virtual, ini murah, tetapi ya, semua orang kan bermain video game.
00:04:44Fisika dalam video game hampir mendekati kenyataan, tetapi belum cukup bagus untuk melatih robot, bukan?
00:04:50Kendali manual, ketika seseorang mengendalikan robot, itu memang bisa dilakukan, tetapi berapa jam sehari Anda bisa merekam robot?
00:04:57Berapa banyak orang yang Anda butuhkan untuk mendapatkan data berskala sangat besar, bukan?
00:05:01Maksud saya, Anda mungkin bisa merekam delapan jam sehari, setiap hari.
00:05:04Berapa jam yang akan Anda dapatkan dalam setahun?
00:05:07Ini tidak benar-benar dapat ditingkatkan skalanya.
00:05:09Dan tentu saja, sudah ada kumpulan data siap pakai, tetapi seperti yang saya katakan sebelumnya, ukurannya kecil.
00:05:13Hanya ada sekitar satu juta video saat ini.
00:05:15Lalu apa alternatifnya?
00:05:17Alternatifnya adalah web.
00:05:20Mari kita pikirkan tentang YouTube.
00:05:22Ada berapa banyak video di YouTube?
00:05:25Entahlah, lima miliar video?
00:05:28Ada berapa banyak tindakan dalam video-video tersebut yang dapat ditiru oleh robot?
00:05:34Maksud saya, mari kita pikirkan.
00:05:35Menurut Anda, ada berapa banyak video seseorang yang membuka pintu dari sudut pandang orang pertama?
00:05:42Jutaan jam.
00:05:43Anda akan terkejut.
00:05:45Jadi setiap hari, video di web memperlihatkan gravitasi, gerakan, bukan?
00:05:53Jadi sebab dan akibat, tentunya kecelakaan adalah bentuk sebab dan akibat terbesar, bukan?
00:06:00Bagaimana orang menangani objek, dan miliaran jam video.
00:06:04Materi pelatihan yang sangat bagus untuk robot, tetapi apa masalahnya?
00:06:08Masalahnya adalah ada banyak sekali gangguan, bukan?
00:06:12Oh, dan sebagai contoh, ya?
00:06:14Salah satu model AI yang dilatih Meta, mereka memberinya sekitar satu juta jam video dunia nyata.
00:06:21Dan kemudian hanya dibutuhkan 62 jam data robotika nyata untuk benar-benar mengendalikan robot sungguhan.
00:06:29Jadi jika Anda memikirkannya, data tersebut dikumpulkan secara publik, bukan?
00:06:33Jadi AI melatih robot pada hal-hal acak, dan kemudian dalam 62 jam robotik, robot itu sudah bisa bergerak.
00:06:41Jadi tidak perlu simulasi, robotika otonom bisa diwujudkan dengan cepat.
00:06:52Namun video tersebut tidak memperlihatkan cara robot bergerak, bukan?
00:06:54Jadi Anda mungkin berpikir, seberapa berguna video seseorang yang menuangkan air ke dalam cangkir bagi sebuah robot?
00:07:01Sebenarnya ada metode di luar sana tentang bagaimana AI dapat membedakan dan benar-benar belajar dari tindakan yang ada di dalam video.
00:07:09Jika Anda mengambil dua bingkai, bingkai demi bingkai, dan AI mengukur perbedaan gerakannya, bukan?
00:07:15Jadi Anda memiliki gambar A dan gambar 2, dan ada gerakan kecil yang berubah di antara kedua gambar tersebut.
00:07:21AI sebenarnya dapat mengukur perubahan tersebut.
00:07:24Jadi jika Anda terus melakukan itu di sepanjang video, AI dapat mengukur sudut, jarak,
00:07:30dan segala hal yang dibutuhkannya untuk melatih robot, kan?
00:07:34Jadi kita tidak selalu membutuhkan data sensor, tetapi tentu saja, video itu sendiri yang Anda unduh
00:07:41dari YouTube atau video tempat Anda mengekstrak data tersebut tidak serta-merta membawa Anda 100% sampai ke sana.
00:07:48Anda memang perlu melakukan pemrosesan tambahan di atasnya, tetapi itu tersedia.
00:07:53Datanya ada di luar sana, dan yang perlu Anda lakukan hanyalah memprosesnya.
00:07:58Beberapa contoh lagi, ya?
00:07:59Misalnya NVIDIA, saat melatih robot Cosmos, mereka membuang sekitar 96% dari videonya.
00:08:07Lalu apa artinya itu?
00:08:09Merek mengunduh satu juta jam video,
00:08:12dan bagian yang benar-benar berguna hanya 4%.
00:08:15Sisanya terbuang begitu saja.
00:08:16Itu pemborosan komputasi.
00:08:18Itu pemborosan bandwidth.
00:08:19Itu pemborosan penyimpanan.
00:08:21Itu benar-benar pemborosan uang yang besar.
00:08:23Lalu, stable video diffusion membuang 74% dari video yang mereka unduh.
00:08:30Jadi di Bright Data, kami mencoba menyelesaikan masalah itu, dan kami mencoba melangkah satu tahap lebih maju.
00:08:37Jadi yang kami usulkan adalah cari dulu, kumpulkan kemudian.
00:08:41Yang kami lakukan adalah mengindeks video, dan memungkinkan Anda mencari tindakan tertentu.
00:08:50Karena kita sedang membicarakan seseorang yang membuka pintu, mari kita terus gunakan contoh itu.
00:08:55Yang dapat Anda lakukan di platform kami adalah memasukkan informasi yang terperinci, bukan?
00:09:01Sebuah kueri: orang mencuci piring, orang melipat kaus, dan sebagainya.
00:09:06Dan kami akan menyediakan cuplikan dari video yang berisi tindakan-tindakan tersebut.
00:09:13Jadi apa artinya itu?
00:09:16Artinya, makin sedikit pemborosan dalam pengumpulan data.
00:09:22Makin sedikit pemborosan penyimpanan dan bandwidth, bukan?
00:09:25Berikut penjelasan lebih lanjut tentang cara kerjanya.
00:09:27Tentu saja, Anda menentukan apa yang Anda cari.
00:09:32Kami mencari melalui miliaran video yang telah terindeks sebelumnya.
00:09:36Bukan berdasarkan kata kunci, melainkan berdasarkan tindakan.
00:09:39Dan kami menyediakan klip yang siap Anda gunakan.
00:09:43Dan tentunya, klip tersebut sudah disiapkan untuk pelatihan Anda.
00:09:47Jadi yang perlu Anda lakukan hanyalah memprosesnya sedikit, mungkin untuk gerak, sensor jarak, dan sebagainya.
00:09:52Dan itu siap dimasukkan ke dalam robot.
00:09:57Saya punya contoh video singkat tentang cara kerjanya di platform kami.
00:10:02Jadi izinkan saya memutarnya di sini, jika saya bisa menemukannya.
00:10:07Di sini kita melihat seseorang mencuci piring dengan tangan di wastafel, membersihkan lemak dari piring,
00:10:12menggunakan spons dan sabun, termasuk membilas dan menaruh piring ke rak pengering, interaksi tangan jarak dekat.
00:10:19Jadi saat ini, yang sedang terjadi adalah sistem mencari melalui miliaran video.
00:10:24Nah, pada video ini, ini agak lama.
00:10:26Kami baru punya sekitar 100 juta indeks di sana, tetapi sekarang kami sudah mencapai 1,1 miliar video.
00:10:31Dan sistem ini benar-benar akan... seperti ini sedikit dipercepat, jadi saya tidak ingin membuang-buang waktu Anda sekalian.
00:10:35Namun sistem ini akan memberi Anda klip dari video orang-orang yang sedang mencuci piring.
00:10:41Dan Anda bisa melihat di sini semua video yang kami temukan.
00:10:47Beberapa dari video ini mungkin tidak ada hubungannya dengan mencuci piring.
00:10:50Mungkin tentang membersihkan dapur.
00:10:52Mungkin ada hubungannya dengan hal lain.
00:10:54Dan ini contoh lainnya.
00:10:55Misalnya, manusia melipat berbagai jenis pakaian.
00:10:59Kan?
00:10:59Jadi, deskripsinya sedikit lebih banyak.
00:11:01Makin banyak deskripsi yang Anda berikan, makin banyak yang akan Anda dapatkan kembali.
00:11:06Sekali lagi, ini sedikit dipercepat.
00:11:08Mari kita lihat.
00:11:14Saya ingin Anda memahami, ini bisa berupa apa saja.
00:11:16Seseorang yang sedang berdandan.
00:11:17Katakanlah Anda memiliki merek dan ingin menemukan video tempat merek Anda muncul.
00:11:21Semua itu juga dapat disediakan.
00:11:23Jadi, Anda melihat orang-orang melipat pakaian.
00:11:26Jadi, sekarang Anda dapat melatih robot tentang cara melipat pakaian.
00:11:34Tentu saja, semuanya tersedia melalui API.
00:11:36Kami tidak berharap orang-orang melakukannya secara manual.
00:11:39Benar?
00:11:39Jadi, Anda dapat memicunya melalui API.
00:11:41Anda mendapatkan potongan klip video balikan dan URL-nya.
00:11:46Kami memberikan tautan ke video asli jika Anda ingin menontonnya.
00:11:49Namun hal utamanya adalah kami dapat memberikan cuplikan video untuk melatih sistem robotika Anda.
00:11:57Saya tidak tahu apakah ada di antara Anda yang sedang melatih robot.
00:12:01Jadi, saya akan berikan contoh lain seberapa berguna hal ini.
00:12:04Katakanlah Anda memiliki sebuah merek.
00:12:06Dan Anda ingin tahu di mana merek Anda didemonstrasikan dalam video.
00:12:13Judul video tidak masalah karena sebenarnya tidak membahas produk Anda secara langsung.
00:12:19Bisa jadi hanya seseorang yang sedang membuat siniar atau merekam sesuatu.
00:12:22Namun, Anda melihat seorang wanita sedang berdandan.
00:12:25Dan Anda melihat di meja bahwa itu adalah merek riasan milik Anda.
00:12:30Jadi, seketika Anda bisa menemukan semua video tempat merek Anda digunakan.
00:12:34Apa pun produknya.
00:12:35Bukan?
00:12:35Hanya dengan mencari judul video, Anda tidak akan menemukannya.
00:12:38Dengan pengindeksan video, Anda benar-benar bisa menemukan hal-hal spesifik yang diminati.
00:12:45Apel yang jatuh dari pohon.
00:12:47Dan seterusnya.
00:12:48Lalu, apa hasilnya?
00:12:50Kami menyajikan penanda waktu ini kepada Anda.
00:12:52Kami memberikan skor kecocokan.
00:12:53Seberapa dekat hasilnya dengan pencarian Anda.
00:12:55Dan tentu saja, jumlah bingkainya.
00:12:57Berapa banyak bingkai yang memuat hal yang Anda cari.
00:13:03Lalu, apa dampaknya?
00:13:06Ini mengubah banyak hal.
00:13:07Baiklah, meminimalkan pemborosan.
00:13:09Anda tidak perlu mengunduh jutaan jam video.
00:13:12Anda bisa langsung mendapatkan tindakan spesifik
00:13:16yang memang Anda butuhkan.
00:13:20Sekali lagi, ini sangat krusial untuk pelatihan robotika.
00:13:24Karena gangguan data menimbulkan masalah seperti halusinasi.
00:13:28Benar?
00:13:29Ini menghilangkan gangguan tersebut.
00:13:34Apa saja kegunaannya?
00:13:35Bukan hanya robot, tetapi jelas untuk kendaraan otonom.
00:13:38Misalnya Waymo.
00:13:39Benar?
00:13:40Dilatih menggunakan kamera dasbor.
00:13:43Dan ada jutaan, ratusan juta jam rekaman di YouTube.
00:13:46Dari kamera dasbor.
00:13:47Berapa banyak dari Anda yang suka menonton kecelakaan?
00:13:49Kecelakaan rekaman kamera dasbor.
00:13:52Saya yakin semua orang pernah menontonnya.
00:13:53Gaya mengemudi gila di Rusia.
00:13:55Benar?
00:13:56Jadi, itulah yang sedang kita bicarakan.
00:13:58Bukan?
00:13:58Videonya sudah tersedia di luar sana.
00:14:01Paham?
00:14:01Seseorang yang menerobos lampu merah.
00:14:02Seseorang yang berhenti di lampu merah.
00:14:04Belok kiri.
00:14:05Belok kanan.
00:14:06Dan seterusnya.
00:14:06Semua itu bisa menjadi data yang sangat berguna untuk pelatihan.
00:14:11Serta model dunia lainnya.
00:14:13Fisika.
00:14:14Benar?
00:14:14Robot perlu memahami fisika.
00:14:16Apa itu gravitasi?
00:14:18Bagaimana cara duduk?
00:14:18Bagaimana cara berjalan?
00:14:19Bagaimana cara bergerak?
00:14:21Tentu saja Anda bisa merekamnya terlebih dahulu.
00:14:25Saat ini saya sering berbicara dengan beberapa orang.
00:14:27Dan mereka menyuruh jutaan orang merekam video untuk mereka.
00:14:30“Bisakah kalian merekam cara kalian membuka pintu?”
00:14:33Itu konyol.
00:14:34Mengapa butuh sejuta orang untuk itu saat semuanya sudah tersedia secara daring?
00:14:39Internet adalah salah satu basis data terbesar yang ada.
00:14:43Hanya saja orang-orang tidak... menggunakannya tidak semudah itu, kan?
00:14:46Maksud saya, saat ini satu-satunya pencarian yang ada hanya berdasarkan kata kunci judul video.
00:14:53Dan tentu saja, satu sumber untuk seluruh web video publik di satu tempat.
00:14:59Maksud saya, kita punya YouTube, Vimeo, dan begitu banyak penyedia video lainnya di luar sana.
00:15:06Miliaran jam data pelatihan ada di sana, menunggu untuk Anda ambil,
00:15:13kumpulkan, dan proses.
00:15:14Jadi pada dasarnya, ini adalah produk baru yang kami buat di Bright Data.
00:15:18Mengindeks video agar Anda bisa menemukan tindakan tertentu.
00:15:23Apa pun yang terpikirkan oleh Anda, ini juga bisa berguna untuk merek.
00:15:28Ini bukan hanya untuk data pelatihan.
00:15:31Apa pun yang Anda bayangkan bisa saja berguna.
00:15:35Mungkin Anda seorang gamer dan ingin tahu cara menyelesaikan level ini.
00:15:40Namun tidak ada video yang pas seperti itu.
00:15:42Jadi Anda bisa mencari, orang yang menyelesaikan level di video gim, bukan?
00:15:47Apa pun itu, pilihannya ada di tangan Anda.
00:15:52Jadi, saya akan mengakhiri presentasi ini.
00:15:54Jika Anda memiliki pertanyaan atau ingin terhubung dan berbincang lebih lanjut,
00:15:58silakan tambahkan saya di LinkedIn.
00:16:01Dan ya, terima kasih banyak atas perhatian Anda sekalian.
00:16:06Saya ada di stan Bright Data jika Anda ingin berdiskusi lebih lanjut.
00:16:10Terima kasih sudah datang.
00:16:17Sampai jumpa lagi.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기