Transcript
00:00:00Saya rasa kita semua tahu betapa pesatnya kemajuan AI
00:00:15yang telah dicapai dalam lima tahun terakhir.
00:00:17Rasanya itu melebihi kemajuan selama 100 tahun terakhir.
00:00:22Dan apa yang sedang terjadi, terutama dalam AI,
00:00:24adalah AI merambah bahasa, lalu ucapan, audio, video.
00:00:28Dan semua orang antusias bahwa berikutnya adalah robotika.
00:00:32Dan antusiasme ini mencapai puncaknya tahun ini karena suatu alasan,
00:00:37yang masih di luar pemahaman saya.
00:00:40Dan Anda juga bisa melihat para pemimpin seperti Jensen
00:00:43membicarakan AI fisik sebagai garis depan robotika berikutnya.
00:00:46Jadi tampaknya jika Anda membuka Twitter atau LinkedIn,
00:00:49seolah-olah robotika sudah ada di sini.
00:00:51Dan kita akan memiliki robot rumah di rumah kita sekitar bulan Desember,
00:00:56seperti yang dikatakan oleh banyak orang.
00:00:58Namun saya di sini untuk menekankan bahwa robotika hampir selalu ada di sini
00:01:03selama 70 tahun terakhir.
00:01:06Sekarang, bagi Anda yang berkecimpung di bidang robotika dalam empat atau lima
00:01:10tahun terakhir, cobalah ambil kursus apa pun tentang robotika.
00:01:14Dan jika Anda dapat membedakan video robotika
00:01:17dari 30 tahun lalu dengan hari ini, saya traktir makan malam Anda.
00:01:23Jadi untuk memberi contoh, mari kita lihat robot ini.
00:01:26Jadi robot di sini adalah sebuah gambar.
00:01:27Dan tujuan robot ini adalah melihat gambar balok-balok ini
00:01:31dan menyusun balok-balok ini di depannya
00:01:34agar memiliki pola yang sama seperti di gambar.
00:01:37Oke?
00:01:38Ini adalah tugas yang sangat sederhana.
00:01:40Tetapi jika Anda pikirkan, ini adalah balok 3D.
00:01:42Anda harus melihat dan memahami bentuk 3D dari setiap sisi.
00:01:44Dan robot ini dapat melakukannya dengan cukup presisi.
00:01:47Ada tebakan seberapa lama usia hasil karya ini?
00:01:51Ada yang tahu?
00:01:51Tebak saja.
00:01:52Anda boleh menebak apa saja.
00:01:53Hah?
00:01:5440 tahun.
00:01:55Oke.
00:01:55Itu yang paling lama?
00:01:59Ini berasal dari tahun 1960-an.
00:02:01Ini jauh sebelum komputer ada.
00:02:03Oke?
00:02:04Jadi ini disebut Demo Salin MIT.
00:02:06Ini adalah awal dari...
00:02:09ini mendahului AI, seperti yang Anda kenal hari ini.
00:02:12Coba lihat yang ini.
00:02:17Salah satu pameran di kongres nuklir di Philadelphia
00:02:19memiliki formula sempurna untuk popularitas.
00:02:21Apa yang terjadi di sini, orang di balik layar
00:02:24mengendalikan robot-robot ini, sistem pemimpin-pengikut.
00:02:27Dan jika Anda melihat laboratorium besar mana pun, perusahaan besar mana pun,
00:02:31laboratorium akademik besar mana pun, cara mereka mendapatkan data,
00:02:33mereka menggunakan sistem teleoperasi, yang
00:02:35mengikuti prinsip yang sama persis?
00:02:38Ada tebakan tahun untuk yang satu ini?
00:02:40Operator terampil perangkat elektronik itu...
00:02:42Sekarang, semua orang akan mengoreksi tahunnya dengan gigih.
00:02:45Tapi ini dari tahun 1957, 68 tahun lalu.
00:02:49Oke?
00:02:51Tanyakan kepada siapa pun di keluarga Anda yang lebih tua dari...
00:02:53sebenarnya, mereka mungkin sudah tidak ada.
00:02:55Jadi karena ini...
00:02:57Anda harus bertanya kepada seseorang yang berusia 80 tahun,
00:02:59seperti apa keadaan teknologi pada waktu itu?
00:03:02Seperti RAM, untuk beberapa kb RAM saja, ukurannya seluas ruangan,
00:03:06pengaturan sebesar ini.
00:03:07Dan ini dari masa itu ketika orang bisa membuatnya berfungsi.
00:03:11Tidak hanya ini, Anda terus kembali setiap dekade,
00:03:14videonya terlihat sangat keren.
00:03:15Seperti inilah robot, humanoid, sedang berakrobat,
00:03:18bermain foosball dengan manusia.
00:03:21Dan ini juga dari masa, semuanya mendahului pembelajaran mendalam.
00:03:25Ini dari delapan tahun lalu.
00:03:26Jadi robot ini adalah hasil dari Berkeley,
00:03:29dapat membersihkan seluruh meja, dapat merapikan barang-barang ke dalam kotak.
00:03:33Ini dilakukan oleh satu mahasiswa pascasarjana dengan mesin satu GPU.
00:03:36Tidak lebih dari itu.
00:03:37Oke?
00:03:38Sekarang, gambaran ini—dan jika saya mewarnai semua video ini
00:03:41dari masa lalu dan menerapkan filter AI Generatif untuk suara modern,
00:03:45Anda tidak dapat membedakan apakah video ini dari tahun 1957
00:03:49atau dari hari ini.
00:03:50Dan ini bahkan bukan hasil yang paling tua.
00:03:52Yang paling tua mencapai tahun 1940-an.
00:03:54Oke?
00:03:55Jadi apa alasannya jika Anda melihat 70 tahun terakhir,
00:04:00setiap teknologi lainnya, setiap teknologi lainnya
00:04:02telah berkembang sangat jauh...
00:04:04pemahaman bahasa, visi komputer, ponsel, cip.
00:04:08Mengapa robotika terjebak di zaman purba ini begitu lama?
00:04:11Dan alasannya adalah otak secara umum.
00:04:14Robotika selalu didekati sebagai masalah perangkat keras
00:04:17dari awal.
00:04:18Dan inilah alasan mengapa segala sesuatu di sekitar robotika
00:04:21telah berkembang, tetapi robotika masih terjebak di tempat yang sama
00:04:24dari 70 tahun lalu.
00:04:25Jadi ada sebuah paradoks yang sangat terkenal bernama paradoks Moravec.
00:04:27Saya tidak tahu apakah Anda tahu tentang Moravec.
00:04:29Dia juga seorang profesor CMU, dan saya juga seorang profesor CMU.
00:04:32Jadi saya harus mengutipnya.
00:04:34Dia adalah salah satu tokoh pendiri AI.
00:04:36Setelah 30 tahun bekerja di bidang robotika,
00:04:39ia sampai pada kesimpulan yang sangat sederhana.
00:04:41Hal yang sulit itu mudah.
00:04:42Hal yang mudah itu sulit.
00:04:43Oke?
00:04:44Apa pun yang diyakini manusia sulit
00:04:45sangatlah mudah bagi komputer dan sebaliknya.
00:04:49Dan Anda dapat melihat hal itu terjadi tepat di depan mata Anda.
00:04:51Anda mungkin bilang mengerjakan matematika itu sulit.
00:04:53Medali emas Olimpiade Matematika sangat, sangat sulit.
00:04:56Menaiki tangga?
00:04:57Itu sangat mudah.
00:04:59Sekarang lihat sekeliling Anda dalam teknologi.
00:05:01Di mana posisi kita dalam hal apa yang telah dipecahkan
00:05:02dan apa yang belum dipecahkan.
00:05:04Jadi inilah robotika bagi Anda, oke?
00:05:05Ini sangat... ini bukan sekadar aplikasi lain dari AI.
00:05:09Ini adalah tujuan awal pendirian AI
00:05:12dan hanya sedikit kemajuan yang dicapai ke arah sana.
00:05:14Ini bukan sekadar aplikasi lain
00:05:15di mana jaringan mendalam dapat masuk dan menyerang bidang ini.
00:05:18Bidang ini harus dipikirkan dengan prinsip dasar yang fundamental
00:05:22dari awal.
00:05:23Ini adalah contoh yang sangat terkenal di mana
00:05:25Anda bisa membuat komputer mengalahkan Garry Kasparov dalam catur
00:05:29pada tahun 90-an, tetapi Anda tetap tidak memiliki komputer, robot,
00:05:34yang dapat mengambil bidak catur dan menyusunnya
00:05:36di atas papan catur.
00:05:37Nah, jadi bagaimana cara kita memecahkannya, oke?
00:05:43Jadi pada catatan yang lebih positif, kita memiliki resep rahasia
00:05:47untuk kesuksesan AI, benar?
00:05:49Anda mendapatkan kumpulan data besar.
00:05:51Anda melatih model besar.
00:05:52Dan keajaiban pun terjadi, oke?
00:05:54Sekarang, kita tahu templat ini bekerja dengan sangat baik
00:05:57di banyak topik, oke?
00:05:59Sekarang, dapatkah kita menerapkan resep yang sama pada robotika?
00:06:02Yah, itu tidak bisa langsung diterapkan karena kita tidak punya data.
00:06:06Tidak ada internet untuk data robotika.
00:06:09Dan seperti yang saya katakan tadi, Anda bisa pergi dan mengumpulkan data secara manual
00:06:12pada robot yang disebut teleoperasi.
00:06:14Dan seperti yang Anda perhatikan, teleoperasi bukanlah hal yang baru berumur lima tahun.
00:06:18Ini adalah hal yang sudah berumur 68 atau 70 tahun.
00:06:21Jadi bagian yang lucu adalah, jika Anda kembali
00:06:24dan melihat keseluruhan evolusi model GPT-3, GPT-4,
00:06:28kembali ke GPT-3 tiga tahun lalu.
00:06:31Rasanya seperti seumur hidup yang lalu.
00:06:33GPT-3 baru mulai berfungsi dan menarik perhatian orang
00:06:36ketika Anda dapat melatih model-model tersebut pada triliunan token.
00:06:40Jadi GPT-3 sudah mencapai 30 triliun token lebih.
00:06:42Dan hari ini, ratusan triliun token.
00:06:44Dan jika Anda mengumpulkan data secara manual melalui teleoperasi,
00:06:47butuh waktu sekitar satu menit untuk mendapatkan satu contoh.
00:06:49Anda bisa perhitungkan sendiri.
00:06:50Jika Anda melibatkan seluruh populasi AS, itu
00:06:53akan memakan waktu lebih dari satu abad untuk mencapai skala yang sama
00:06:55seperti GPT-3, yang ibaratnya--
00:06:59dan tidak ada orang yang menggunakan GPT-3 hari ini.
00:07:00Benar?
00:07:01Jadi ini sangat lambat dan mahal.
00:07:02Maka dalam bidang robotika, saya berpendapat belum ada
00:07:05yang benar-benar menskalakan robotika.
00:07:07Dan kita masih sangat jauh dari membahas penskalaan robotika
00:07:10seperti yang disaksikan di bidang-bidang lain.
00:07:14Benar?
00:07:14Jadi, inilah hal yang menjadi fokus kami.
00:07:17Scaled berusia sekitar tiga tahun.
00:07:19Tetapi saya telah mengerjakan masalah ini selama lebih dari satu dekade.
00:07:22Itulah satu-satunya hal yang saya lakukan sepanjang karier saya.
00:07:24Tidak ada yang lain.
00:07:26Jadi di Scale, tesis kami adalah
00:07:27membangun apa yang kami sebut kecerdasan multi-wujud (omnibodied intelligence).
00:07:32Robot apa pun, tugas apa pun, satu otak.
00:07:35Benar?
00:07:36Robot apa pun-- bisa berupa humanoid.
00:07:37Bisa berupa robot berkaki empat.
00:07:38Bisa berupa lengan robot pada ban berjalan atau tangan yang cekatan.
00:07:41Itu tidak terlalu penting.
00:07:42Dan bahkan hipotesis ini jauh lebih
00:07:45umum daripada yang mungkin dikatakan tentang manusia,
00:07:48karena kita mengendalikan tubuh kita sendiri.
00:07:50Lalu mengapa kita harus membuatnya begitu umum?
00:07:51Nah, argumennya adalah, dalam robotika,
00:07:54memang tidak ada data.
00:07:56Jadi saya tidak bisa memilih perangkat keras mana yang datanya harus saya gunakan.
00:07:59Dan kita seharusnya bisa menggunakan data dari berbagai jenis perangkat keras,
00:08:02berbagai jenis tugas, berbagai jenis skenario.
00:08:04Dan itulah satu-satunya cara untuk benar-benar mencapai
00:08:06skala seperti yang dicapai oleh model bahasa tiga tahun lalu.
00:08:10Dan tujuannya di sini adalah gagasan tentang robot apa pun,
00:08:13tugas apa pun, satu otak.
00:08:15Dan melalui ceramah ini, saya berharap dapat
00:08:16meyakinkan Anda mengapa inilah jalan yang tepat untuk robotika.
00:08:20Benar?
00:08:20Jadi ini adalah pengantar singkatnya.
00:08:23Namun sebelum saya masuk ke detail lebih lanjut,
00:08:24izinkan saya menunjukkan cuplikan hasil pratinjau.
00:08:28Jadi dalam hasil ini, setiap robot
00:08:31berasal dari perusahaan yang berbeda, perangkat keras yang berbeda.
00:08:34Dan semuanya dikendalikan oleh satu otak yang terampil,
00:08:37baik itu robot humanoid yang naik turun tangga,
00:08:39maupun berbagai macam skenario.
00:08:42Dan ini bukanlah hasil yang baru.
00:08:43Ini adalah hasil dari beberapa tahun lalu.
00:08:47Tahan terhadap gangguan.
00:08:51Anda dapat menempatkan mereka secara zero-shot di skenario baru.
00:09:03Jadi gagasannya di sini, setiap robot dalam video ini melakukan
00:09:08aksi apa pun di mana saja di dunia.
00:09:11Otak di balik layar terus berkembang,
00:09:13karena ini adalah otak multi-wujud.
00:09:15Ya, ini benar-benar sulit, bukan?
00:09:16Karena telur-telur itu baik-baik saja.
00:09:17Itulah cuplikan dari apa yang kami kerjakan.
00:09:33Jadi saya ingin membuat ceramah ini lebih bersifat ilmiah dan informatif
00:09:38daripada iklan perusahaan.
00:09:39Maka saya akan membahas bagaimana cara kita menskalakan data dalam robotika.
00:09:42Mari kita lihat kembali bagaimana orang-orang mengatasi hal ini.
00:09:45Saya akan meninjau kembali karier saya sendiri.
00:09:48Dan hipotesis saya mengenai data telah berubah dari tahun ke tahun.
00:09:51Ketika saya mulai bekerja dan menskalakan berbagai hal,
00:09:55gagasannya adalah, Anda dapat mengumpulkan data untuk robot secara manual,
00:09:59tetapi cara itu terlalu lambat.
00:10:00Dan robot seharusnya dibiarkan mengumpulkan data sendiri.
00:10:03Jadi kami memiliki gagasan tentang eksplorasi yang didorong oleh rasa ingin tahu,
00:10:06membiarkan robot menjelajah dengan rasa ingin tahu di lingkungan sekitar.
00:10:10Dan itu memiliki banyak sisi positif, seperti tidak diperlukannya manusia.
00:10:13Robot dapat pergi dan terus bermain, mengumpulkan lebih banyak data.
00:10:15Kami menyebutnya data bermain saat itu.
00:10:17Data itu sangat kaya, karena mencakup gaya, sensor, dan sudut sendi.
00:10:21Namun kesulitannya adalah, hal itu hanya ada di dunia fisik.
00:10:24Sehingga sangat sulit untuk diskalakan.
00:10:27Google pun melakukannya saat itu, dengan ratusan robot.
00:10:31Bahkan bagi Google, biayanya terlalu mahal dan skalanya terlalu lambat.
00:10:34Gagasan lainnya adalah, sekali lagi, teleoperasi.
00:10:36Seperti yang saya katakan, ini gagasan lama.
00:10:38Namun sekali lagi, masalahnya sama.
00:10:39Mustahil diskalakan, karena sekarang Anda tidak hanya butuh robot.
00:10:42Anda juga butuh manusia.
00:10:43Jadi biayanya bahkan lebih mahal.
00:10:45Dan keragamannya sangat terbatas.
00:10:46Karena bahkan jika Anda menempatkan robot dalam satu penyiapan dengan manusia,
00:10:50Anda bisa mendapatkan 1.000 contoh.
00:10:51Tetapi semuanya akan berada dalam penyiapan yang sama.
00:10:53Jadi yang idealnya Anda inginkan, membawa robot ke rumah baru
00:10:57setiap hari, skenario baru.
00:10:58Dan itu sangat mustahil untuk diskalakan.
00:11:01Kemudian kami mengalami terobosan besar dalam pembelajaran
00:11:03dari simulasi.
00:11:04Ini adalah salah satu hasil pertama di mana seseorang dapat
00:11:08menunjukkan pembelajaran penguatan mendalam, dilatih dalam simulasi,
00:11:12ditransfer ke robot nyata.
00:11:13Ini adalah makalah pemenang penghargaan pada saat itu.
00:11:16Dan sekarang digunakan di setiap humanoid, di setiap perusahaan di luar sana.
00:11:20Ini berasal dari laboratorium di Berkeley dan CMU.
00:11:23Namun sekali lagi, ada kelebihan dan kekurangannya.
00:11:25Sangat mudah untuk diskalakan.
00:11:27Tetapi keragamannya sulit didapat, karena Anda harus merekayasa
00:11:29setiap adegan dalam simulasi secara manual.
00:11:31Jadi jika Anda mendengarkan ini, tidak ada
00:11:34satu jawaban tunggal yang saya tuju.
00:11:35Tidak ada satu solusi tunggal.
00:11:39Ini adalah pekerjaan lain yang kami lakukan sebelumnya.
00:11:41Ini semua sebelum era skala.
00:11:43Belajar dari video manusia.
00:11:44Anda menonton manusia melakukan hal-hal, lalu robot menirunya.
00:11:47Sekali lagi, keragaman tinggi.
00:11:48Anda dapat menggunakan video dari YouTube, dan sebagainya.
00:11:50Sangat dapat disskalakan.
00:11:51Tetapi ini bentuk data yang sangat buruk,
00:11:54karena sangat jauh dari robot.
00:11:57Lalu apa solusinya di sini?
00:11:59Jawabannya adalah tidak ada jalan emas.
00:12:01Anda harus memikirkan data dalam konteks
00:12:05fitur yang berbeda.
00:12:06Dan menurut saya, hanya ada tiga fitur
00:12:09yang penting dalam bidang robotika--
00:12:12skalabilitas, keragaman, dan seberapa dekat Anda
00:12:15dengan sudut sendi robot Anda.
00:12:18Skalabilitas berarti, dapatkah saya dengan cepat menskalakannya di berbagai skenario?
00:12:22Keragaman berarti, dapatkah saya memperoleh data yang beragam?
00:12:25Karena hanya memiliki 100 triliun token
00:12:27sama sekali tidak berguna jika semuanya
00:12:29berada di lingkungan dan skenario yang sama.
00:12:32Dan kedekatan dengan robot berarti, seberapa jauh Anda
00:12:35dari kebenaran dasar sudut sendi milik robot?
00:12:38Jadi jika Anda melihat simulasi, sangat dapat disskalakan, kurang beragam,
00:12:42tetapi cukup dekat dengan robot.
00:12:44Video manusia sangat dapat diskalakan dan beragam,
00:12:46tetapi sangat jauh dari data robot.
00:12:47Anda harus belajar memetakan manusia ke robot.
00:12:49Dua cara lainnya, teleoperasi dan antarmuka manipulasi,
00:12:52berada di tengah-tengah.
00:12:54Dan Anda dapat melihat di sini, saat ini di seluruh dunia,
00:12:57jika Anda melihat berbagai perusahaan,
00:12:58mereka semua berfokus pada salah satu pendekatan ini.
00:13:01Sebagian besar menggunakan teleoperasi atau penyiapan Yumi.
00:13:05Sangat sedikit yang menggunakan hal lainnya.
00:13:07Tetapi tidak ada jawaban emas.
00:13:09Masing-masing memiliki kelemahan.
00:13:11Namun sisi baiknya di sini adalah semuanya saling melengkapi
00:13:15satu sama lain.
00:13:16Kekurangan mereka tidak persis sama persis
00:13:19antara satu dan lainnya.
00:13:20Di sinilah resep yang telah kita sepakati selama bertahun-tahun
00:13:24adalah menyadari-- memisahkan pelatihan menjadi dua bagian,
00:13:27pelatihan awal dan pascapelatihan.
00:13:29Tapi itu mengejutkan, bukan?
00:13:30Tapi bagaimana cara kita melatih awalnya?
00:13:31Anda ingin melakukan pra-pelatihan menggunakan data yang
00:13:32sangat terskala dan beragam, tetapi mungkin berkualitas rendah.
00:13:35Jadi simulasi, video manusia, dan seterusnya.
00:13:37Jadi begitulah cara Anda melakukan pra-pelatihan.
00:13:39Dan kemudian untuk pasca-pelatihan, Anda menggunakan data dari teleoperasi.
00:13:42Nah, apa itu data teleoperasi?
00:13:43Kualitasnya sangat tinggi, tetapi jumlahnya sedikit, oke?
00:13:47Kualitas tinggi, jumlah sedikit.
00:13:48Hal ini sangat mengingatkan kita pada resep dalam model bahasa.
00:13:51Anda melakukan pra-pelatihan data di internet.
00:13:53Kemudian Anda melakukan pasca-pelatihan untuk pengkodean, perusahaan Anda sendiri, dan sebagainya.
00:13:59Tetapi dalam robotika, ada satu kelompok lagi,
00:14:00yaitu data penerapan.
00:14:02Dan data penerapan sangat dapat diskalakan
00:14:05setelah penerapan diskalakan.
00:14:07Jadi seiring waktu, data ini akan mengambil alih semuanya.
00:14:11Dan apa yang coba kami bangun adalah apa
00:14:14yang kami sebut siklus roda gila data ini, yang
00:14:16mengambil data ini dari masa pasca-pelatihan
00:14:18dan memasukkannya kembali ke pra-pelatihan.
00:14:20Dan sekarang Anda dapat melihat mengapa gagasan otak multi-tubuh ini
00:14:23sangatlah penting, karena hal ini
00:14:25sangat kecil kemungkinannya Anda hanya memiliki satu robot, hanya satu
00:14:28versi yang dikerahkan selamanya dalam setiap tugas di seluruh dunia.
00:14:32Ini tidak pernah terjadi di bidang perangkat keras apa pun, kecuali cip,
00:14:36karena sangat sulit untuk manufaktur.
00:14:38Dan Anda masih dapat melihat, bahkan pada cip,
00:14:40cip inferensi terus berdatangan dari berbagai pihak
00:14:42untuk banyak perusahaan akhir-akhir ini.
00:14:43Jadi dalam perangkat keras, hal ini tidak pernah terjadi.
00:14:45Anda hanya memiliki satu versi robot, satu bentuk,
00:14:48itulah sebabnya kecerdasan multi-tubuh
00:14:50menjadi pemungkin dari apa yang kita sebut roda gila data penerapan.
00:14:56Jadi sekarang mari kita lihat beberapa hasil dengan sangat cepat.
00:14:58Sekarang, otak ini sangatlah umum,
00:15:00jadi kita dapat melakukan berbagai tugas dengan sangat cepat.
00:15:03Anda mungkin pernah melihat banyak tugas seperti melipat pakaian,
00:15:06dan sebagainya.
00:15:07Itu adalah tugas yang sangat populer di Silicon Valley karena suatu alasan.
00:15:10Dan argumen di sini adalah, kapan Anda pernah
00:15:14berpikir, saat melipat kaus, bahwa jika tangan saya meleset
00:15:18satu sentimeter saja, lipatan kaus saya akan menjadi hancur berantakan?
00:15:22Anda tidak berpikir seperti itu.
00:15:23Orang bahkan tidak berpikir saat melipat.
00:15:25Mereka hanya memegang di mana saja.
00:15:26Anda lakukan saja sesuatu.
00:15:27Jadi toleransi terhadap kesalahan sangat, sangat tinggi.
00:15:31Lalu mengapa tugas ini sulit?
00:15:35Siapa pun—mengapa orang-orang tertipu
00:15:38hingga percaya bahwa tugas ini sulit?
00:15:39Biarkan saya mengatakannya seperti itu.
00:15:42Kain, kan?
00:15:43Mengapa kain itu sulit?
00:15:46Simulasi, tapi toh tidak ada yang menggunakan simulasi.
00:15:48Ini semua dari teleoperasi.
00:15:49Mengapa ini sulit?
00:15:51Anda tahu mengapa ini sulit?
00:15:52Karena ini sulit untuk robotika versi klasik.
00:15:56Secara klasik dalam robotika, orang akan memodelkan seluruh fisika,
00:15:59membuat model dengan tangan, lalu melakukan ini.
00:16:01Sangat sulit untuk hal itu.
00:16:02Tetapi untuk robotika berbasis pembelajaran mendalam,
00:16:04ini adalah tugas termudah yang mungkin dilakukan,
00:16:06karena memiliki toleransi kesalahan yang tinggi.
00:16:08Jadi ini sepenuhnya—
00:16:09nah, begitu banyak perusahaan berfokus pada tugas ini.
00:16:12Nah, yang sulit adalah, menurut saya,
00:16:13sesuatu seperti, katakanlah, tugas ini.
00:16:17Jika saya tanyakan kepada Anda, sebelum melihat video ini,
00:16:19apakah tugas ini dapat dilakukan tanpa memiliki tangan?
00:16:22Kemungkinan besar, separuh orang akan mengatakan tidak,
00:16:24karena ini mengharuskan pemasangan—
00:16:25seperti, berapa banyak dari Anda yang kehilangan AirPod?
00:16:29Dan di perusahaan kami, ada saluran
00:16:30bernama airpod kanan, karena orang-orang terus
00:16:32kehilangan AirPod kanan mereka.
00:16:34Nah, dalam hal ini, robot tidak memiliki tangan.
00:16:36Ia memiliki penjepit.
00:16:37Jadi di sini, tugas ini sangat sulit bagi penjepit.
00:16:41Jadi ini membutuhkan tingkat kecerdasan yang lebih tinggi,
00:16:43karena lengan harus bergerak dan menyesuaikan diri
00:16:46untuk mengambil AirPod dengan cara yang benar,
00:16:49sehingga dapat dimasukkan, karena penjepit hanya dapat
00:16:52menutup seperti ini.
00:16:54Mereka sejajar dengan penjepit Anda.
00:16:55Jadi Anda tidak dapat memutar AirPod di bagian paling akhir.
00:16:59Nah, apa yang Anda lihat di sini, ini bukan AirPod asli.
00:17:02Itu adalah barang tiruan dari Temu, harganya sekitar $5, $10 masing-masing.
00:17:05Jadi tidak ada magnet di dalamnya.
00:17:07Jadi robot harus bekerja keras untuk memasukkannya dengan benar,
00:17:11karena tidak ada magnet yang menariknya dengan mudah.
00:17:13Jadi ini semua adalah barang tiruan.
00:17:15Ini bahkan lebih sulit daripada yang terlihat di video.
00:17:17Anda juga dapat—setelah Anda membangun otak umum di balik layar,
00:17:23Anda juga dapat pergi dan mempelajarinya dari berbagai video manusia
00:17:26tanpa harus memiliki data penyetelan halus apa pun
00:17:28pada waktu teleoperasi.
00:17:29Jadi dalam skenario ini, apa yang kami lakukan, kami
00:17:31melatihnya pada video manusia seperti ini, seperti video egosentris.
00:17:34Kami sekarang mencoba mentransfernya ke lebih banyak video sudut pandang orang ketiga.
00:17:38Dan jika sudut pandang orang ketiga berfungsi, Anda dapat belajar dari YouTube,
00:17:40segala jenis data sumber terbuka.
00:17:43Jadi dalam hal ini, kita melihat videonya,
00:17:45lalu kita menambahkan data robot kurang dari satu jam.
00:17:47Jadi transformasi yang sangat cepat.
00:17:50Dan kemudian itu dapat ditransfer ke robot humanoid.
00:17:53Nah, yang ini memiliki tangan.
00:17:54Tangan atau tanpa tangan adalah perdebatan besar.
00:17:57Orang sering menggunakan tangan sebagai alasan mengapa robotika belum
00:18:00sampai di sini, tetapi bukan itu masalahnya.
00:18:02Selalu kecerdasan di balik layar yang menentukan.
00:18:07Kami tidak mengerahkan tangan saat ini, karena belum ada
00:18:09yang tersedia yang dapat dikerahkan di pabrik.
00:18:12Semuanya rusak dalam waktu 100 jam.
00:18:14Pilih saja mana pun.
00:18:17Jika Anda memiliki tangan yang lebih baik, saya akan dengan senang hati
00:18:19membeli 10 unit secepatnya untuk diuji.
00:18:22Jadi ini adalah skenario yang tangguh.
00:18:25Nah, gagasannya adalah Anda dapat melakukan banyak tugas dengan mengamati manusia.
00:18:28Dan alasan mengapa kita dapat bekerja dengan data yang sangat sedikit,
00:18:31yaitu kurang dari satu jam data robot,
00:18:33adalah karena robot membayangkan berbagai hal di dalam kepalanya sendiri
00:18:36dan mencoba melipatgandakan pembelajaran untuk berbagai skenario.
00:18:39Apa yang Anda lihat di sini adalah video yang sepenuhnya palsu.
00:18:42Anda bisa menyebutnya mimpi robot.
00:18:43Jadi ini ada di dalam model robot itu sendiri,
00:18:45di mana ia dapat membayangkan berbagai skenario.
00:18:48Jadi ini bukan data nyata.
00:18:49Ini semua palsu dari model robot itu sendiri.
00:18:52Anda dapat mentransfernya ke tugas yang lebih kompleks
00:18:56dan bahkan perangkat keras dengan biaya lebih rendah.
00:18:57Jadi ini adalah tugas pembuatan telur, seperti membuat telur dadar.
00:19:02Nah di sini, seluruh pengaturan ini berbiaya sekitar $4.000.
00:19:06Jadi lengan robot yang sangat murah dibandingkan dengan apa yang Anda lihat di luar sana.
00:19:11Dan jika Anda perhatikan di sini, pengaturan ini terlalu murah
00:19:15bahkan untuk memiliki sensor apa pun.
00:19:16Jadi satu-satunya sensor di sini hanyalah kamera, tanpa sensor gaya, tanpa apa pun.
00:19:20Dan robot dapat melakukan tugas yang memerlukan gaya dari penglihatan.
00:19:25Sekarang, saya tidak mengatakan itu masa depan.
00:19:26Seperti Anda tidak boleh melakukan ini.
00:19:27Saya yakin sensor akan meningkat.
00:19:29Tetapi dari sensor yang ada, kita
00:19:33jauh tertinggal dalam hal pencapaian kita jika dilihat dari sudut pandang kecerdasan.
00:19:36Jadi ini dapat terus berlanjut.
00:19:38Ini penasihat saya dari Berkeley.
00:19:39Ia tidak percaya bahwa robot bisa melakukannya.
00:19:41Ia hanya berdiri selama sekitar satu jam.
00:19:43Dan robot terus membuat telur dadar.
00:19:45Dan bagian yang menarik di sini adalah
00:19:48ini adalah sistem ujung-ke-ujung sepenuhnya.
00:19:49Tidak ada mesin status, tidak ada apa pun.
00:19:51Jadi alasan robot membuat telur,
00:19:53karena ada piring kosong di depannya.
00:19:55Entah kenapa gambarnya berkedip-kedip.
00:19:56Entah kenapa ini naik turun.
00:19:58Tidak ada potongan dalam videonya.
00:20:00Saya jamin itu.
00:20:01Ini masalah HDMI.
00:20:02Jadi begitu piringnya diambil—
00:20:06maaf, saya tidak tahu kenapa ini terjadi.
00:20:08Ya, jadi tidak ada mesin status.
00:20:10Kapan robot mulai, kapan robot selesai,
00:20:11semuanya otomatis.
00:20:12Dan ini sangat tangguh bahkan terhadap gangguan.
00:20:14Anda bisa mengubah posisi objek.
00:20:16Anda bisa menambahkan—ini semua adalah objek yang belum pernah dilihat.
00:20:20Hanya wajan dan kompor gas yang sama.
00:20:22Selebihnya berbeda.
00:20:23Dan robot bisa terus berjalan.
00:20:25Jadi Anda mendapatkan ketahanan dasar.
00:20:27Jadi ini semua dilatih dengan data kurang dari 10 jam.
00:20:30Jadi datanya sangat sedikit untuk mempelajari ketahanan ini.
00:20:33Dan ini berasal dari model dasar di baliknya.
00:20:37Saya lewati ini demi menghemat waktu.
00:20:39Jadi tidak seperti alur robotika tradisional,
00:20:42di mana Anda memiliki perencanaan, pemetaan, dan sebagainya,
00:20:44ini adalah otak menyeluruh end-to-end.
00:20:46Sekarang, end-to-end adalah istilah yang banyak digunakan di berbagai bidang AI.
00:20:50Namun ketika saya bilang end-to-end, maksud saya benar-benar end-to-end.
00:20:53Sistem ini membaca langsung dari kamera.
00:20:55Sistem ini langsung menyalurkan daya ke motor.
00:20:59Jadi kami tidak menggunakan apa pun di antaranya, kecuali hanya PID
00:21:02di bagian paling akhir, untuk naik dari 100 ke 500 Hertz.
00:21:04Namun PID bukan kontribusi robotika.
00:21:06Ini sudah ada sebelumnya.
00:21:07Ini ada sejak Perang Dunia II atau semacamnya.
00:21:10Nah, bagian yang menarik adalah, penglihatan bagi kami
00:21:13hanyalah satu lagi masukan.
00:21:15Jadi tidak ada yang terlalu gila tentang itu.
00:21:17Jadi jika Anda pernah melihat—Anda mungkin pernah melihat banyak hasil
00:21:20robot menari, melakukan karate, kung fu, salto ke belakang.
00:21:23Coba ingat kembali, berapa banyak hasil
00:21:27yang pernah Anda lihat tentang robot naik turun tangga?
00:21:30Sangat sedikit.
00:21:31Bahkan perusahaan-perusahaan teratas di bidang humanoid,
00:21:34mereka belum pernah menunjukkannya melebihi satu sampel tangga
00:21:37hanya untuk mencentang kotak persyaratan.
00:21:39Dan orang-orang berbicara tentang humanoid yang akan datang, China versus AS.
00:21:42Semua ini semacam omong kosong.
00:21:44Begini, jika humanoid tidak bisa menaiki tangga,
00:21:47apa gunanya memiliki kaki?
00:21:50Itulah satu-satunya alasan mengapa Anda memiliki kaki.
00:21:51Nah, ini sebenarnya adalah paradoks Moravec yang sedang beraksi.
00:21:55Yang di sebelah kiri sebenarnya jauh lebih mudah bagi robot.
00:21:58Salto ke belakang, menari, itu jauh lebih mudah bagi robot.
00:22:01Dan Anda mungkin berpikir, OK, mengapa paradoks ini ada?
00:22:04Pikirkan satu tingkat lebih mendalam.
00:22:05Ketika robot melakukan salto ke belakang, ia
00:22:09hanya perlu tahu tentang tubuhnya sendiri, tidak ada yang lain.
00:22:13Benar kan?
00:22:13Jadi—dan ketika semuanya diketahui atau teramati sepenuhnya,
00:22:17itulah keahlian komputer.
00:22:20Karena mereka dapat mensimulasikan setiap pengaturan yang mungkin.
00:22:25Tetapi yang di sebelah kanan, bahkan sekadar memanjat tangga,
00:22:27mengharuskan melihat tangga terlebih dahulu.
00:22:30Atau berapa tingginya, berapa lebarnya.
00:22:32Anda tidak mengukur tinggi dan lebar secara persis,
00:22:34tetapi Anda menyesuaikan dengan semua gangguan.
00:22:35Dan itu membutuhkan penglihatan.
00:22:36Jadi tugas yang kanan membutuhkan pemahaman.
00:22:38Itulah mengapa hal itu sulit, dan Anda tidak melihat hal ini.
00:22:40Namun bagi kami, itu hanyalah hasil yang lain.
00:22:42Itu tidak terlalu penting.
00:22:43Jadi kami—kami merilis hasil ini satu setengah tahun lalu.
00:22:46Kami merekam ini dua setengah tahun lalu.
00:22:48Namun robot ini dapat melalui skenario apa pun.
00:22:52Robot ini tidak tersandung pada benda-benda.
00:22:53Robot ini sengaja melangkah melewati benda-benda.
00:22:55Dan tidak ada pemetaan atau perencanaan.
00:22:56Robot ini tidak membuat peta 3D dari lingkungan sekitar.
00:22:59Semuanya beroperasi dari kamera di bagian torso.
00:23:02Dan Anda bisa menempatkan ini di berbagai jenis pengaturan, berbagai jenis tangga.
00:23:05Saya bergerak lebih cepat di sini.
00:23:07Ini adalah, Anda tahu, tangga jalur evakuasi kebakaran.
00:23:11Agak aneh.
00:23:12Tangga evakuasi kebakaran digunakan saat ada kebakaran darurat.
00:23:15Dan itu adalah yang tersulit di setiap gedung.
00:23:17Jadi kami menguji di semua pengaturan tersebut.
00:23:20Tetapi Anda bisa menempatkan ini dengan cara apa pun.
00:23:21Anda bisa mengganggunya di tangga.
00:23:22Itu tidak jadi masalah.
00:23:23Ini adalah kemampuan manusia super.
00:23:25Karena robot tidak bisa melihat dirinya sedang ditarik.
00:23:27Jadi ini adalah faktor kejutan bagi robot
00:23:29bahwa ia ditarik saat sedang memanjat.
00:23:31Dan sekali lagi, ini adalah model yang sama di mana-mana
00:23:33dalam semua skenario ini.
00:23:35Jadi sangat mudah.
00:23:36Meskipun mudah, parkour memang terlihat menyenangkan.
00:23:40Dan orang-orang sering menganggap, seperti, ini adalah, Anda tahu,
00:23:45robot bisa melakukan semua ini.
00:23:47Namun ini jauh lebih mudah daripada yang saya tunjukkan sebelumnya.
00:23:51Dan bahkan jika Anda melihat video-video ini sekarang,
00:23:53banyak dari Anda akan merasa ini lebih mengesankan,
00:23:55meskipun saya sudah bilang ini mudah.
00:23:57Butuh waktu setengah jam untuk melatih ini,
00:23:59sementara yang sebelumnya butuh waktu jauh lebih lama dan jauh lebih
00:24:01sulit untuk dilatih.
00:24:03Jadi Anda bisa mengambil model dasar ini, dan Anda bisa mentransfernya
00:24:06ke berbagai tugas dengan sangat cepat.
00:24:08Jadi di sini, ini adalah hasil yang sangat lama
00:24:09dari sekitar satu setengah tahun lalu.
00:24:11Untuk memasukkan kabel LAN, dan sebagainya,
00:24:13kami sekarang memiliki sistem yang sangat canggih.
00:24:14Namun kami sudah menerapkan model-model ini
00:24:17di berbagai macam aplikasi.
00:24:18Jadi contohnya, untuk membangun siklus terbang data,
00:24:21bagian yang paling sulit adalah penerapannya sendiri.
00:24:24Ada begitu banyak masalah lain di luar kecerdasan
00:24:26dan perangkat keras yang muncul saat Anda menerapkan robotika.
00:24:30Ini tidak sama dengan menerapkan ChatGPT melalui aplikasi.
00:24:34Karena Anda harus mengatasi banyak—
00:24:36dan saya rasa Skydio memberikan presentasi sebelum ini,
00:24:38dan mereka dapat berbicara dengan Anda sepanjang hari
00:24:40tentang betapa sulitnya penerapan.
00:24:42Jadi kami harus mulai menerapkan sekarang,
00:24:44agar kita dapat memiliki siklus terbang data ini di masa depan yang dapat diperkirakan.
00:24:47Dan saya akan memberi Anda beberapa contoh penerapan yang sedang kami lakukan.
00:24:49Jadi salah satu contohnya bersama NVIDIA—
00:24:51seperti NVIDIA yang membuka pabrik pertama mereka di Houston.
00:24:54Dan GPU mereka, yang Anda gunakan sekarang,
00:24:56semuanya dibuat di luar AS, terutama di Taiwan.
00:24:59Dan semuanya dilakukan secara manual di sana.
00:25:01Dan manusia sangat efisien serta sangat, sangat bagus
00:25:04dalam membuat hal-hal ini.
00:25:05Tetapi mempertahankan biaya, skalabilitas, dan kapasitas produksi
00:25:08di sini di AS, sangat sulit untuk dipertahankan
00:25:10tanpa tenaga kerja ini.
00:25:11Jadi di sini, kami sedang mengotomatiskan perakitan GPU ini untuk mereka.
00:25:15Ini adalah—kami melakukan demo langsung di NVIDIA GTC.
00:25:19Ini sudah diterapkan di pabrik sejak minggu lalu,
00:25:21jadi sudah aktif.
00:25:22Namun bagian menarik yang ingin saya soroti—
00:25:25ini adalah tugas pabrik yang sangat tradisional.
00:25:29Tetapi jika Anda melihat keseluruhan pengaturannya,
00:25:32ini sangat acak, sangat bising.
00:25:36Dan jika Anda pergi ke pabrik mana pun dengan pengaturan tradisional,
00:25:38suasananya sangat bersih.
00:25:39Jadi di sini, robot dengan otak yang sama,
00:25:42tidak hanya dapat melakukan tugas yang sangat presisi,
00:25:44tetapi juga sangat tangguh terhadap segala jenis gangguan, yang
00:25:46berarti sekarang robot-robot ini tidak perlu berada di dalam sangkar.
00:25:50Dan mereka dapat langsung diterapkan di jalur perakitan pabrik ini
00:25:54tanpa ada perubahan apa pun pada lini pabrik.
00:25:56Berdampingan dengan manusia, dan di mana ada manusia, di situ ada kekacauan.
00:26:00Betulkan?
00:26:00Anda bisa menggunakan otak yang sama untuk aplikasi pengiriman.
00:26:02Jadi di sini, robot mengantar barang dari truk ke pintu rumah.
00:26:06Robot harus mencari letak pintu depan.
00:26:08Jadi ini masalah akal sehat.
00:26:09Ini bukan masalah mobilitas.
00:26:10Dan kita sudah lama mengirimkan paket
00:26:12serta bekerja di balik layar dengan banyak mitra
00:26:15untuk mengirimkan paket ke pintu depan rumah
00:26:17di area-area ini.
00:26:19Pengaturan serupa juga berfungsi di gudang dan tempat lainnya.
00:26:23Sekarang, untuk menutup pembahasan, menutup topik ini,
00:26:26saya menyebutkan ini adalah otak multi-tubuh.
00:26:29Dan saya harap sangat jelas mengapa sangat penting
00:26:31memiliki otak multi-tubuh untuk membangun roda terbang data.
00:26:34Namun ada satu manfaat tambahan.
00:26:35Dan manfaatnya adalah robot Anda mungkin rusak seiring waktu
00:26:38dan dalam skenario keselamatan.
00:26:41Dan keselamatan adalah hasil sampingan dari otak multi-tubuh ini.
00:26:44Karena jika Anda memiliki--
00:26:45kita bisa menaruhnya-- saya melewatkannya dengan sangat cepat.
00:26:47Anda dapat melihatnya secara daring.
00:26:48Ini semua ada secara daring.
00:26:49Namun kita dapat menerapkan otak yang sama pada setiap sistem ini,
00:26:52pada setiap robot ini.
00:26:55Dan dalam kasus ini, kita bahkan tidak melatihnya pada robot-robot ini.
00:26:58Ini sepenuhnya transfer zero-shot
00:27:00ke semua robot humanoid ini dan semuanya.
00:27:02Dan bahkan jika robot rusak, dan di sini kakinya patah,
00:27:05ia dapat pulih dalam waktu milidetik.
00:27:07Karena ketika kaki Anda patah, robot berkaki tiga Anda
00:27:10adalah robot yang baru.
00:27:12Jadi bentuk robot tidak terlalu menjadi masalah.
00:27:14Apa pun yang berubah, di sini kita menonaktifkan kaki robot.
00:27:17Ia belajar berjalan dengan dua kaki hanya dalam tiga kali percobaan.
00:27:21Jadi apa yang Anda lihat di layar adalah seluruh pelatihan
00:27:24untuk robot yang sedang terjadi pada sistem-sistem ini.
00:27:27Sehingga ia beradaptasi dalam beberapa milidetik hingga sekitar 30 detik.
00:27:32Dan seperti satu contoh di sini, ia berjalan menggunakan roda.
00:27:34Anda mengunci rodanya.
00:27:36Ia mulai berjalan.
00:27:37Ini adalah hasil sampingan lain dari otak multi-tubuh.
00:27:40Keselamatan memiliki makna yang sangat berbeda dengan model seperti ini
00:27:45ketika robot dapat terbang--
00:27:46atau maaf, ketika robot dapat berjalan atau beroperasi
00:27:49hanya dengan setengah tubuh.
00:27:50Saya menghapus beberapa adegan berdarah dari ini,
00:27:52tetapi kami juga memotong robot menjadi dua.
00:27:54Ia masih dapat bekerja dengan kedua bagian tersebut secara terpisah.
00:27:57Namun untuk itu, Anda bisa pergi ke YouTube.
00:27:59Dan hanya itu yang saya miliki.
00:28:00Terima kasih.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video