Робототехника застряла на месте на 70 лет — Дипак Патхак, Skild AI

Transcript

00:00:00Думаю, все вы знаете, какого прогресса достиг ИИ
00:00:15за последние пять лет.
00:00:17Кажется, это больше, чем за предыдущие 100 лет.
00:00:22И что происходит, особенно в сфере ИИ,
00:00:24так это то, что сначала ИИ освоил текст, затем речь, аудио, видео.
00:00:28И теперь все с восторгом ждут робототехнику.
00:00:32И этот ажиотаж почему-то достиг пика именно в этом году,
00:00:37что для меня до сих пор загадка.
00:00:40И вы можете видеть, как лидеры вроде Дженсена
00:00:43говорят о физическом ИИ как о следующем рубеже робототехники.
00:00:46Так что если открыть Twitter или LinkedIn,
00:00:49кажется, будто робототехника уже наступила.
00:00:51И домашние роботы появятся в наших домах где-то к декабрю,
00:00:56как утверждают многие.
00:00:58Но я здесь для того, чтобы напомнить: робототехника почти наступила
00:01:03уже как лет 70 назад.
00:01:06Те из вас, кто пришел в робототехнику за последние четыре-пять
00:01:10лет, пройдите любой курс по робототехнике.
00:01:14И если вы сможете отличить видео по робототехнике
00:01:1730-летней давности от сегодняшних, я угощаю вас ужином.
00:01:23Приведу пример: давайте посмотрим на этого робота.
00:01:26Вот робот, а вот изображение.
00:01:27Цель робота — посмотреть на картинку с кубиками
00:01:31и расставить эти кубики перед собой
00:01:34в точно такой же узор, как на картинке.
00:01:37Хорошо?
00:01:38Это предельно простая задача.
00:01:40Но если задуматься, это трехмерный кубик.
00:01:42Нужно распознать и понять 3D со всех сторон.
00:01:44И робот справляется с этим весьма точно.
00:01:47Есть догадки, скольким годам соответствует этот результат?
00:01:51Кто-нибудь?
00:01:51Просто предположите.
00:01:52Любые варианты.
00:01:53А?
00:01:5440 лет.
00:01:55Так.
00:01:55Кто больше?
00:01:59Это из 1960-х.
00:02:01Это было задолго до появления компьютеров.
00:02:03Понимаете?
00:02:04Это называется MIT Copy Demo.
00:02:06Это было началом...
00:02:09это было еще до появления ИИ в сегодняшнем понимании.
00:02:12Посмотрите на это.
00:02:17Один из экспонатов Ядерного конгресса в Филадельфии
00:02:19обладает идеальной формулой популярности.
00:02:21Что здесь происходит: человек за кулисами
00:02:24управляет этими роботами через систему “ведущий-ведомый”.
00:02:27И если посмотреть на любую крупную лабораторию или компанию,
00:02:31любую крупную научную лабораторию, как они собирают данные?
00:02:33Они используют систему телеуправления, которая
00:02:35работает по тем же самым принципам.
00:02:38Есть догадки, какого года это видео?
00:02:40Опытный оператор электронного устройства...
00:02:42Сразу предупреждаю, с годом вы сильно ошибетесь.
00:02:45Это 1957 год, 68 лет назад.
00:02:49Понимаете?
00:02:51Спросите любого в вашей семье, кто старше...
00:02:53хотя их, возможно, уже нет с нами.
00:02:55Потому что это...
00:02:57нужно спросить человека 80 лет,
00:02:59каков был уровень технологий в то время?
00:03:02Для нескольких килобайт ОЗУ требовалась система размером с комнату,
00:03:06вот такая огромная установка.
00:03:07И уже в то время люди смогли заставить это работать.
00:03:11И не только это: возвращаясь к каждому десятилетию,
00:03:14видео выглядят так же круто.
00:03:15Вот робот-гуманоид жонглирует,
00:03:18играет в кикер с человеком.
00:03:21И это тоже было еще до эпохи глубокого обучения.
00:03:25А вот это сделано восемь лет назад.
00:03:26Этот робот — результат работы Беркли,
00:03:29может убрать со стола, разложить вещи по коробкам.
00:03:33Это сделал один аспирант на компьютере с одной видеокартой.
00:03:36Ничего более.
00:03:37Понимаете?
00:03:38Так вот — и если я раскрашу все эти старые
00:03:41видео и наложу фильтр ИИ для современного голоса,
00:03:45вы не отличите, снято ли это видео в 1957 году
00:03:49или сегодня.
00:03:50И это даже не самые старые результаты.
00:03:52Самые старые уходят корнями в 1940-е.
00:03:54Ясно?
00:03:55Почему же за последние 70 лет
00:04:00любая другая технология,
00:04:02шагнула так далеко вперед —
00:04:04понимание языка, компьютерное зрение, мобильные телефоны, чипы?
00:04:08Почему робототехника застряла в каменном веке так надолго?
00:04:11Причина в отсутствии универсального мозга.
00:04:14К робототехнике всегда изначально относились
00:04:17как к аппаратной задаче.
00:04:18Вот почему всё вокруг робототехники
00:04:21прогрессирует, а сам отрасль топчется на месте
00:04:24последние 70 лет.
00:04:25Существует известный парадокс Моравека.
00:04:27Не знаю, слышали ли вы о Моравеке.
00:04:29Он тоже был профессором CMU, как и я.
00:04:32Так что я просто обязан его процитировать.
00:04:34Он был одним из основоположников ИИ.
00:04:36Проработав в робототехнике 30 лет,
00:04:39он пришел к очень простому выводу:
00:04:41“Сложное — это просто.
00:04:42Простое — это сложно”.
00:04:43Понимаете?
00:04:44Всё то, что человек считал сложным,
00:04:45для компьютеров оказалось невероятно простым, и наоборот.
00:04:49И вы видите, как это происходит прямо у вас на глазах.
00:04:51Вы скажете, что заниматься математикой сложно.
00:04:53Золотая медаль на Олимпиаде по математике — это действительно очень сложно.
00:04:56А подняться по лестнице?
00:04:57Это же проще простого.
00:04:59А теперь посмотрите вокруг на технологии.
00:05:01Где мы находимся с точки зрения того, что решено,
00:05:02а что до сих пор не решено.
00:05:04Вот вам и робототехника, понимаете?
00:05:05Это не просто очередное прикладное направление ИИ.
00:05:09Это то, ради чего ИИ изначально создавался
00:05:12и в чем продвинулся меньше всего.
00:05:14Это не очередная сфера,
00:05:15куда могут прийти глубокие сети и сразу всё решить.
00:05:18Здесь нужно исходить из фундаментальных первых принципов
00:05:22с самого нуля.
00:05:23Вот очень известный пример:
00:05:25компьютер может обыграть Гарри Каспарова в шахматы
00:05:29еще в 90-х, но у нас до сих пор нет компьютера или робота,
00:05:34который может взять шахматные фигуры и расставить их
00:05:36на шахматной доске.
00:05:37Так как же нам с этим справиться?
00:05:43Из более оптимистичного: у нас есть секретный рецепт
00:05:47успеха ИИ, верно?
00:05:49Берем большой набор данных.
00:05:51Обучаем большие модели.
00:05:52И происходит магия, так?
00:05:54Мы знаем, что эта схема отлично работает
00:05:57во многих областях.
00:05:59Можем ли мы применить тот же рецепт в робототехнике?
00:06:02Напрямую применить нельзя, потому что у нас нет данных.
00:06:06Нет «интернета» робототехнических данных.
00:06:09И как я уже говорил, данные можно собирать вручную
00:06:12на роботе через телеуправление.
00:06:14И заметьте, телеуправлению не пять лет.
00:06:18Ему уже 68 или 70 лет.
00:06:21Забавно то, что если вернуться назад
00:06:24и посмотреть на всю эволюцию моделей GPT-3 и GPT-4,
00:06:28вспомнить GPT-3 трехлетней давности —
00:06:31кажется, что это было в прошлой жизни.
00:06:33GPT-3 заработала и привлекла внимание людей только тогда,
00:06:36когда такие модели удалось обучить на триллионах токенов.
00:06:40В GPT-3 уже было более 30 триллионов токенов.
00:06:42А сегодня это сотни триллионов токенов.
00:06:44А если собирать данные вручную через телеуправление,
00:06:47у вас уйдет около минуты на один пример.
00:06:49Можете посчитать сами.
00:06:50Если бы вы задействовали всё население США, то
00:06:53вам потребовалось бы больше века, чтобы достичь того же масштаба,
00:06:55что и у GPT-3, которая вроде как...
00:06:59к тому же сегодня GPT-3 никто не использует.
00:07:00Понимаете?
00:07:01Так что это очень медленно и дорого.
00:07:02Поэтому я бы утверждает, что в робототехнике никто
00:07:05на самом деле ещё не масштабировал процесс.
00:07:07И мы очень далеки от того, чтобы говорить о масштабировании робототехники
00:07:10в тех объемах, в которых это произошло в других сферах.
00:07:14Ясно?
00:07:14И именно на этом мы сфокусировались.
00:07:17Компании Skild около трёх лет.
00:07:19Но я работаю над этой проблемой уже больше десяти лет.
00:07:22Это всё, чем я занимался в своей карьере.
00:07:24Больше ничем.
00:07:26Итак, гипотеза Skild заключается в том,
00:07:27чтобы создать так называемый универсальный телесный интеллект.
00:07:32Любой робот, любая задача, один мозг.
00:07:35Понимаете?
00:07:36Любой робот — это может быть гуманоид.
00:07:37Это может быть четырёхногий робот.
00:07:38Роботизированная рука на конвейере или ловкий захват.
00:07:41Это не имеет значения.
00:07:42И эта гипотеза даже намного
00:07:45более универсальна, чем то, на что способны люди,
00:07:48поскольку мы управляем только собственным телом.
00:07:50И зачем нам создавать нечто настолько универсальное?
00:07:51Аргумент в том, что в робототехнике
00:07:54в любом случае нет данных.
00:07:56Так что я не могу выбирать, с какого именно оборудования брать данные.
00:07:59Мы должны уметь использовать данные с любого типа железа,
00:08:02для любых задач и любых сценариев.
00:08:04И это единственный способ действительно достичь
00:08:06масштаба, которого языковые модели достигли три года назад.
00:08:10И цель здесь — реализовать идею: любой робот,
00:08:13любая задача, один мозг.
00:08:15Надеюсь, в ходе этого выступления я
00:08:16убежу вас, что именно так и стоит развивать робототехнику.
00:08:20Хорошо?
00:08:20Это было краткое введение.
00:08:23Но прежде чем перейти к деталям,
00:08:24позвольте показать вам небольшой тизер с результатами.
00:08:28В этом видео каждый робот
00:08:31создан разной компанией и имеет разное железо.
00:08:34И всеми ими управляет мозг Skild,
00:08:37будь то гуманоиды, поднимающиеся и спускающиеся по лестнице,
00:08:39в самых разных сценариях.
00:08:42И это не новые результаты.
00:08:43Здесь показаны кадры двухлетней давности.
00:08:47Устойчивость к внешним помехам.
00:08:51Их можно сразу, без подготовки, помещать в новые условия.
00:09:03Главная идея: каждый робот на этом видео может выполнять
00:09:08любые действия в любой точке мира.
00:09:11А управляющий ими мозг самообучается,
00:09:13потому что он универсален.
00:09:15Да, это действительно сложно, правда?
00:09:16Потому что с яйцами всё в порядке.
00:09:17Вот такой анонс того, над чем мы работаем.
00:09:33Я хочу сделать этот доклад более научным и информативным,
00:09:38а не просто рекламой компании.
00:09:39Поэтому я расскажу о том, как масштабировать данные в робототехнике.
00:09:42Давайте оглянемся назад и посмотрим, как люди решали эту проблему.
00:09:45Я посмотрю на свою собственную карьеру.
00:09:48Моя гипотеза относительно данных менялась с годами.
00:09:51Когда я только начинал работать над масштабированием,
00:09:55идея заключалась в том, что данные для роботов можно собирать вручную,
00:09:59но это слишком медленно.
00:10:00И роботам нужно дать возможность собирать данные самостоятельно.
00:10:03Так появилась концепция исследования, ведомого любопытством,
00:10:06когда роботы изучат окружающую среду с исследовательским интересом.
00:10:10У этого подхода много плюсов, например, не нужен человек.
00:10:13Роботы могут просто «играть» и собирать всё больше данных.
00:10:15Мы тогда называли это игровыми данными.
00:10:17Они очень богатые, так как содержат силы, данные датчиков и углы суставов.
00:10:21Сложность же в том, что всё это происходит только в физическом мире.
00:10:24Поэтому такой подход очень трудно масштабировать.
00:10:27Google в своё время задействовал сотни роботов.
00:10:31Но даже для Google масштабирование оказалось слишком дорогим и медленным.
00:10:34Другая идея — опять же, телеуправление.
00:10:36Как я уже сказал, идея старая.
00:10:38И проблемы у неё всё те же.
00:10:39Масштабировать невозможно, ведь теперь вам нужен не только робот,
00:10:42но еще и оператор-человек.
00:10:43Так что это выходят ещё дороже.
00:10:45И разнообразие данных крайне ограничено.
00:10:46Даже если поставить робота с человеком в одну обстановку,
00:10:50вы получите 1000 примеров,
00:10:51но все они будут сняты в одних и тех же условиях.
00:10:53В идеале же вам нужно каждый день переносить робота в новый дом,
00:10:57в новые условия.
00:10:58И это неимоверно сложно масштабировать.
00:11:01Затем произошел совершился прорыв в обучении
00:11:03на базе симуляций.
00:11:04Это был один из первых результатов, показавших,
00:11:08как глубокое обучение с подкреплением, обученное в симуляции,
00:11:12переносится на реального робота.
00:11:13Это была научная работа, получившая награды в то время.
00:11:16И теперь её используют в каждом гуманоиде в каждой компании.
00:11:20Это была разработка лабораторий Беркли и CMU.
00:11:23Но опять же, тут есть свои плюсы и минусы.
00:11:25Это легко масштабировать.
00:11:27Но добиться разнообразия трудно, потому что вам приходится
00:11:29вручную проектировать каждую сцену в симуляции.
00:11:31Так что если вы слушаете всё это, то понимаете,
00:11:34что единственного ответа у меня нет.
00:11:35Единственного универсального решения не существует.
00:11:39А вот ещё одна работа, которую мы сделала ранее.
00:11:41Это всё до этапа масштабирования.
00:11:43Обучение по видео с участием людей.
00:11:44Робот смотрит, как человек выполняет действия, а затем повторяет их.
00:11:47Снова высокое разнообразие.
00:11:48Можно брать видео с YouTube и прочих платформ.
00:11:50Отличная масштабируемость.
00:11:51Но это очень скудная форма данных,
00:11:54потому что они очень далеки от реальности робота.
00:11:57Так каково же решение?
00:11:59Ответ таков: прямого идеального пути нет.
00:12:01Вы должны рассматривать данные в контексте
00:12:05различных характеристик.
00:12:06И, по моему мнению, есть только три критерия,
00:12:09которые имеют значение в робототехнике:
00:12:12масштабируемость, разнообразие и то, насколько близко
00:12:15вы находитесь к углам суставов робота.
00:12:18Масштабируемость означает: могу ли я быстро развернуть решение на разную обстановку?
00:12:22Разнообразие значит: могу ли я получить разрозненные данные?
00:12:25Потому что наличие даже 100 триллионов токенов
00:12:27абсолютно бесполезно, если все они
00:12:29получены в одной и той же среде и в одинаковых сценариях.
00:12:32А близость к роботу означает, насколько вы далеки
00:12:35от точных показателей углов собственных суставов робота.
00:12:38Взгляните на симуляции: легко масштабируются, мало разнообразия,
00:12:42но умеренно близки к физическому роботу.
00:12:44Видео с людьми отличного масштабируются и очень разнообразны,
00:12:46но крайне далеки от данных самого робота.
00:12:47Вам придётся научиться сопоставлять человека и робота.
00:12:49Два других метода — телеуправление и интерфейсы манипуляции —
00:12:52находятся где-то посередине.
00:12:54И вы видите, что прямо сейчас по всему миру,
00:12:57если посмотреть на разные компании,
00:12:58все они фокусируются на каком-то одном из этих подходов.
00:13:01Большинство выбирает телеуправление или установки типа Yumi.
00:13:05И совсем немногие занимается остальным.
00:13:07Но золотой середины здесь нет.
00:13:09У каждого подхода есть свои минусы.
00:13:11Однако позитивный момент заключается в том, что все они дополняют
00:13:15друг друга.
00:13:16Их слабые стороны не совпадают полностью.
00:13:19друг с другом.
00:13:20Рецепт, к которому мы пришли за годы работы,
00:13:24заключается в том, чтобы разделить обучение на два этапа:
00:13:27предобучение и постобучение.
00:13:29Вряд ли это сюрприз, правда?
00:13:30Но как именно проводиться предобучение?
00:13:31Нужно проводить предобучение на данных,
00:13:32которые масштабируемы и разнообразны, но, возможно, низкого качества.
00:13:35То есть симуляции, видео с людьми и так далее.
00:13:37Вот так происходит предобучение.
00:13:39А для постобучения используются данные телеопераций.
00:13:42Что такое данные телеопераций?
00:13:43Они очень высокого качества, но их мало, понятно?
00:13:47Высокое качество, малый объем.
00:13:48Это сильно напоминает подход в языковых моделях.
00:13:51Вы предобучаете модель на данных из интернета,
00:13:53а затем постобучаете под написание кода, под задачи вашей компании и т. д.
00:13:59Но в робототехнике есть еще одна категория —
00:14:00данные развертывания.
00:14:02И данные развертывания отлично масштабируются,
00:14:05когда само развертывание становится массовым.
00:14:07Со временем эти данные вытеснят все остальные.
00:14:11И мы пытаемся построить то,
00:14:14что называем маховиком данных, который
00:14:16берет эти данные с этапа постобучения
00:14:18и возвращает их на этап предобучения.
00:14:20И теперь понятнее, почему идея универсального мозга робота
00:14:23чрезвычайно важна: ведь
00:14:25крайне маловероятно, что у вас будет лишь один робот, одна его
00:14:28версия, навсегда развернутая для абсолютно всех задач в мире.
00:14:32Такого не бывает ни в одной сфере железа, за исключением чипов,
00:14:36потому что их очень сложно производить.
00:14:38Но даже в сфере чипов вы видите,
00:14:40что чипы для инференса выходят постоянно
00:14:42у самых разных компаний.
00:14:43Так что в железе так не бывает.
00:14:45Не бывает одной единственной версии робота или его формы,
00:14:48вот почему мультимодальный интеллект
00:14:50является движителем этого маховика данных развертывания.
00:14:56Давайте быстренько взглянем на некоторые результаты.
00:14:58Этот мозг невероятно универсален,
00:15:00поэтому мы можем очень быстро выполнять самые разные задачи.
00:15:03Вы, возможно, видели множество задач вроде складывания белья
00:15:06и тому подобного.
00:15:07Почему-то это очень популярная задача в Кремниевой долине.
00:15:10И аргумент здесь вот какой: задумывались ли вы
00:15:14хоть раз, складывая футболку, что «если рука промахнется
00:15:18на один сантиметр, футболка превратится в кашу»?
00:15:22Вы так не думаете.
00:15:23Люди вообще не думают, когда складывают.
00:15:25Берут где попало.
00:15:26Просто делают и все.
00:15:27Так что допустимая погрешность здесь чрезвычайно высока.
00:15:31Почему же тогда эта задача считается сложной?
00:15:35Почему люди вообще поддаются заблуждению,
00:15:38будто эта задача сложная?
00:15:39Сформулирую вопрос так.
00:15:42Ткань, да?
00:15:43А почему ткань — это сложно?
00:15:46Из-за симуляции, но симуляцию тут все равно никто не использует.
00:15:48Это все сделано через телеоперацию.
00:15:49Так почему это сложно?
00:15:51Знаете, почему?
00:15:52Потому что это сложно для классической робототехники.
00:15:56Раньше в робототехнике вручную моделировали всю физику,
00:15:59создавали модели и только потом это делали.
00:16:01Для этого подхода задача очень сложная.
00:16:02Но для робототехники на базе глубокого обучения
00:16:04это простейшая из возможных задач,
00:16:06потому что здесь высокая погрешность.
00:16:08И поэтому абсолютно—
00:16:09сейчас столько компаний сфокусировано на этой задаче.
00:16:12А вот действительно сложной я бы назвал,
00:16:13скажем, вот такую задачу.
00:16:17Если бы я спросил вас до просмотра этого видео:
00:16:19«Выполнима ли эта задача без кистей рук?» —
00:16:22очень вероятно, половина ответила бы «нет»,
00:16:24потому что нужно вставить...
00:16:25кстати, кто из вас хоть раз терял AirPods?
00:16:29У нас в компании есть канал,
00:16:30который так и называется — «правый airpod»,
00:16:32потому что люди постоянно его теряют.
00:16:34Так вот, в данном случае у робота нет кисти.
00:16:36У него клешня.
00:16:37И для клешни эта задача очень сложная.
00:16:41Она требует более высокого интеллекта,
00:16:43потому что манипулятор должен повернуться и правильно сориентироваться,
00:16:46чтобы взять наушник именно так,
00:16:49как его потом можно будет вставить, ведь клешни
00:16:52сжимаются только так.
00:16:54Губки зажима параллельны.
00:16:55Так что довернуть наушник в самый последний момент нельзя.
00:16:59И то, что вы здесь видите, это не настоящие AirPods.
00:17:02Это подделки с Temu по 5-10 долларов за штуку.
00:17:05Так что магнита внутри у них нет.
00:17:07Роботу приходится сильно постараться, чтобы аккуратно вставить наушник,
00:17:11ведь магнита, который притянул бы его, нет.
00:17:13Так что все они поддельные.
00:17:15Это даже сложнее, чем кажется на видео.
00:17:17А еще, когда создаешь такой универсальный базовый мозг,
00:17:23можно обучать его просто по самым разным видео с людьми,
00:17:26вообще не используя данные тонкой настройки
00:17:28на этапе телеоперации.
00:17:29В данном сценарии мы обучали модель
00:17:31на видео с людьми от первого лица.
00:17:34Теперь мы пытаемся перенести это на видео от третьего лица.
00:17:38И если это сработает, то учиться можно будет по YouTube
00:17:40или любым открытым данным.
00:17:43То есть в данном случае мы смотрим видео,
00:17:45а затем добавляем менее часа данных робота.
00:17:47Очень быстрая адаптация.
00:17:50И после этого навык переносят на гуманоидных роботов.
00:17:53У этих моделей уже есть кисти рук.
00:17:54Нужны кисти рук или нет — большой спор.
00:17:57Люди часто оправдывают отсутствие роботов в жизни нехваткой кистей,
00:18:00но дело вовсе не в этом.
00:18:02Все упирается в интеллект, стоящий за этим.
00:18:07Сейчас мы не внедряем кисти рук, потому что нет
00:18:09вариантов, готовых к работе на заводах.
00:18:12Все они ломаются в течение 100 часов.
00:18:14Возьмите любые.
00:18:17Если у вас есть кисть получше, я с радостью
00:18:19куплю 10 штук прямо сейчас на тест.
00:18:22Так что речь о надежных сценариях.
00:18:25Суть в том, что можно выполнять много задач, наблюдая за людьми.
00:18:28И причина, по которой мы обходимся малым объемом данных —
00:18:31менее часа записанных манипуляций,
00:18:33заключается в том, что робот «воображает» вещи у себя в голове
00:18:36и пытается масштабировать обучение на множество ситуаций.
00:18:39То, что вы видите здесь, — полностью сгенерированное видео.
00:18:42Можно назвать это сном робота.
00:18:43Это внутри собственной модели робота,
00:18:45где он может представлять сценарии.
00:18:48Так что это не реальные данные.
00:18:49Это симуляция из собственной модели робота.
00:18:52Навык можно переносить на более сложные задачи
00:18:56и даже на более дешевое железо.
00:18:57Вот пример задачи по приготовлению яиц, а точнее омлета.
00:19:02Вся эта установка стоит около 4000 долларов.
00:19:06Невероятно дешевые манипуляторы по сравнению с тем, что есть на рынке.
00:19:11И если вы заметили, эта установка настолько дешевая,
00:19:15что на ней даже нет датчиков.
00:19:16Единственный сенсор тут — обычная камера, ни датчиков силы, ничего.
00:19:20И робот способен выполнять задачи, требующие контроля силы, чисто по картинке.
00:19:25Я не говорю, что именно в этом будущее,
00:19:26или что так и надо делать.
00:19:27Уверен, датчики еще усовершенствуются.
00:19:29Но даже с имеющимися сенсорами
00:19:33мы сильно недоиспользуем потенциал
00:19:36одного только интеллекта.
00:19:38Так что процесс можно продолжать бесконечно.
00:19:39Вот мой научный руководитель из Беркли.
00:19:41Он не верил, что роботы на это способны.
00:19:43Он просто стоял и смотрел около часа,
00:19:45пока робот продолжал готовить омлет.
00:19:48И интересная деталь заключается в том,
00:19:49что это сквозная end-to-end система.
00:19:51Здесь нет конечного автомата, вообще ничего.
00:19:53Робот готовит яйцо просто потому,
00:19:55что перед ним стоит пустая тарелка.
00:19:56Не знаю, почему картинка мигает.
00:19:58Видео идет без склеек,
00:20:00уверяю вас.
00:20:01Это проблема с HDMI.
00:20:02Итак, как только вы убираете тарелку...
00:20:06Извините, не знаю, почему так происходит.
00:20:08Да, тут нет конечного автомата.
00:20:10Когда робот начинает, когда заканчивает —
00:20:11всё полностью автоматизировано.
00:20:12И система устойчива даже к помехам.
00:20:14Можно менять предметы местами.
00:20:16Можно добавлять... все эти предметы для него новые.
00:20:20Прежними остаются только сковорода и плита.
00:20:22Всё остальное другое.
00:20:23И робот может продолжать работу дальше.
00:20:25То есть получается базовая надежность.
00:20:27Всё это обучено менее чем на 10 часах данных.
00:20:30Это очень малый объем для обучения такой адаптивности.
00:20:33И обеспечивается это базовой моделью на фоне.
00:20:37Я пропущу это в целях экономии времени.
00:20:39В отличие от традиционных систем робототехники,
00:20:42где есть планирование, картирование и так далее,
00:20:44здесь мы имеем сквозной (end-to-end) мозг.
00:20:46Термин “end-to-end” часто используют в сфере ИИ.
00:20:50Но когда я говорю “end-to-end”, я имею в виду именно это.
00:20:53Он считывает данные напрямую с камер
00:20:55и подает питание прямо на моторы.
00:20:59Мы ничего не используем между ними, кроме ПИД-регулятора
00:21:02в самом конце, чтобы перейти с 100 до 500 Гц.
00:21:04Но ПИД — это не вклад робототехники.
00:21:06Он появился раньше.
00:21:07Он восходит еще к Вторй мировой войне.
00:21:10Самое интересное, что зрение для нас —
00:21:13это просто еще один входящий сигнал.
00:21:15Так что ничего сверхъестественного тут нет.
00:21:17Возможно, вы уже видели множество роликов
00:21:20где роботы танцуют, занимаются карате, кунг-фу, делают сальто.
00:21:23А теперь вспомните, как много результатов
00:21:27вы видели, где роботы ходят вверх и вниз по лестнице?
00:21:30Очень мало.
00:21:31Даже ведущие компании в сфере гуманоидов
00:21:34показывали максимум одну ступеньку,
00:21:37просто чтобы поставить галочку.
00:21:39И люди говорят, что эра гуманоидов близко, Китай против США...
00:21:42Всё это чушь.
00:21:44Если гуманоиды не могут подниматься по лестнице,
00:21:47зачем им вообще ноги?
00:21:50Это единственная причина иметь ноги.
00:21:51На самом деле перед нами парадокс Моравека в действии.
00:21:55То, что слева, для робота гораздо проще.
00:21:58Сальто, танцы — это для робота намного проще.
00:22:01Вы спросите: “Почему этот парадокс существует?”
00:22:04Подумайте чуть глубже.
00:22:05Когда робот делает сальто, ему
00:22:09нужно знать только о своем собственном теле, и больше ни о чем.
00:22:13Так?
00:22:13Когда всё известно и полностью обозримо,
00:22:17компьютеры справляются идеально.
00:22:20Потому что они могут смоделировать любую конфигурацию.
00:22:25А то, что справа, — даже обычный подъем по лестнице —
00:22:27требует сначала увидеть эту лестницу.
00:22:30Понять ее высоту и ширину.
00:22:32Вы не измеряете высоту и ширину точ-в-точь,
00:22:34а подстраиваетесь под все изменения.
00:22:35И для этого нужно зрение.
00:22:36Так что вариант справа требует осмысления.
00:22:38Вот почему это сложно и встречается так редко.
00:22:40Но для нас это просто очередной результат.
00:22:42Не имеет особого значения.
00:22:43Мы опубликовали этот результат полтора года назад.
00:22:46А сняли видео два с половиной года назад.
00:22:48Но этот робот адаптируется к любой обстановке.
00:22:52Он не спотыкается о препятствия.
00:22:53Он намеренно перешагивает через них.
00:22:55И никакого картирования или планирования.
00:22:56Он не строит 3D-карту окружения.
00:22:59Всё работает только за счет камеры на торсе.
00:23:02И его можно поместить в условия с любыми лестницами.
00:23:05Я ускорюсь.
00:23:07Это, знаете ли, пожарные лестницы.
00:23:11С ними всё непросто.
00:23:12Пожарные лестницы нужны для срочной эвакуации при пожаре.
00:23:15И они самые сложные в любом здании.
00:23:17Поэтому мы тестируем робота на них.
00:23:20Но можно использовать их как угодно.
00:23:21Можно мешать ему на лестнице.
00:23:22Это не имеет значения.
00:23:23Это сверхчеловеческие возможности.
00:23:25Потому что робот не видит, что его тянут.
00:23:27И для робота это фактор внезапности,
00:23:29когда его тянут во время подъема.
00:23:31И опять же, везде используется одна модель
00:23:33во всех этих сценариях.
00:23:35Так что всё очень просто.
00:23:36И хотя это просто, паркур выглядит зрелищно.
00:23:40И людям часто кажется, мол,
00:23:45роботы умеют делать всё это.
00:23:47Но это намного проще того, что я показывал ранее.
00:23:51И даже смотря эти кадры сейчас,
00:23:53многие из вас найдут это более впечатляющим,
00:23:55хотя я говорю вам, что это легко.
00:23:57На обучение этому уходит полчаса,
00:23:59тогда как предыдущее занимает больше времени
00:24:01и обучается гораздо сложнее.
00:24:03То есть можно взять базовую модель и перенести ее
00:24:06на множество других задач очень быстро.
00:24:08Вот, например, очень старый результат
00:24:09полуторагодовалой давности.
00:24:11Для подключения LAN-кабелей и прочего
00:24:13сейчас у нас есть очень продвинутые системы.
00:24:14Но мы уже внедряем эти модели
00:24:17в самых разных сферах.
00:24:18Например, чтобы создать маховик данных,
00:24:21самое сложное — это само внедрение.
00:24:24Помимо интеллекта и «железа»,
00:24:26возникает куча других проблем при внедрении роботов.
00:24:30Это совсем не то же самое, что запустить ChatGPT в приложении.
00:24:34Потому что приходится решать множество...
00:24:36Кажется, до этого выступали Skydio,
00:24:38они могут целыми днями рассказывать вам
00:24:40о сложностях внедрения.
00:24:42Поэтому мы должны внедрять их уже сейчас,
00:24:44чтобы раскрутить маховик данных в обозримом будущем.
00:24:47И я приведу несколько примеров текущего внедрения.
00:24:49Один из примеров с NVIDIA...
00:24:51NVIDIA открывает свой первый завод в Хьюстоне.
00:24:54И их GPU, которыми вы сейчас пользуетесь,
00:24:56производятся за пределами США, в основном на Тайване.
00:24:59И там всё делают вручную.
00:25:01Люди невероятно эффективны и отлично справляются
00:25:04с производством этих вещей.
00:25:05Но удерживать затраты, масштабируемость и объем
00:25:08здесь, в США, очень трудно
00:25:10без соответствующей рабочей силы.
00:25:11Поэтому мы автоматизируем для них сборку GPU.
00:25:15Мы делали живое демо на NVIDIA GTC.
00:25:19На прошлой неделе систему уже запустили на заводе,
00:25:21так что она работает в реальном времени.
00:25:22Но главный момент, который я хочу подчеркнуть —
00:25:25это очень традиционная заводская задача.
00:25:29Но если посмотреть на весь процесс,
00:25:32он крайне хаотичен и полон шума.
00:25:36Если зайти на любой завод с традиционным подходом,
00:25:38там царит идеальный порядок.
00:25:39Здесь же робот с той же моделью мозга
00:25:42может выполнять не только высокоточные задачи,
00:25:44но и устойчиво работать при любых помехах,
00:25:46а значит, роботам больше не нужно находиться в клетке.
00:25:50Их можно внедрять прямо на конвейерные линии
00:25:54без какого-либо переоборудования фабрики.
00:25:56Рядом с людьми — а где люди, там всегда беспорядок.
00:26:00Верно?
00:26:00Тот же “мозг” можно применить и для доставки.
00:26:02Здесь робот доставляет посылку от грузовика до двери.
00:26:06Ему нужно понять, где находится входная дверь.
00:26:08То есть это задача на здравый смысл,
00:26:09а не проблема мобильности.
00:26:10И мы уже доставляли посылки,
00:26:12работая за кулисами со множеством партнеров,
00:26:15доставляя посылки прямо к порогу домов
00:26:17в этих районах.
00:26:19Та же система работает и на складах, и везде.
00:26:23И в завершение моего выступления
00:26:26я упоминал, что это универсальный разум.
00:26:29И, надеюсь, совершенно очевидно, почему кране важно
00:26:31иметь такой разум для маховика данных.
00:26:34Но есть еще одно преимущество.
00:26:35Оно заключается в том, что роботы могут ломаться со временем
00:26:38или в сценариях безопасности.
00:26:41А безопасность — это побочный продукт универсального разума.
00:26:44Потому что если у вас есть...
00:26:45мы можем поставить... Я просто быстренько пропущу.
00:26:47Вы можете посмотреть в сети.
00:26:48Всё это есть онлайн.
00:26:49Но мы можем внедрить один и тот же разум в каждую из этих систем,
00:26:52в каждого из этих роботов.
00:26:55И в данном случае мы их даже не обучали на этих роботах.
00:26:58Это абсолютно нулевой перенос знаний
00:27:00на всех этих гуманоидов и прочие системы.
00:27:02И даже если робот ломается — вот тут ломается нога,
00:27:05он восстанавливается за миллисекунды.
00:27:07Потому что, когда ломается нога, ваш трехногий робот
00:27:10становится совершенно новым роботом.
00:27:12Так что форма робота не имеет особого значения.
00:27:14Что бы ни менялось — вот здесь мы отключаем ноги робота,
00:27:17и он учится ходить на двух ногах всего за три попытки.
00:27:21То, что вы видите на экране, — это всё процесс обучения
00:27:24робота прямо внутри этих систем.
00:27:27Он адаптируется за время от нескольких миллисекунд до 30 секунд.
00:27:32И вот один из примеров: он едет на колесах.
00:27:34Залинивает колесо —
00:27:36он начинает идти пешком.
00:27:37Это еще один побочный продукт универсального разума.
00:27:40Безопасность обретает совсем иной смысл с такими моделями,
00:27:45когда робот может летать...
00:27:46ой, простите, когда роботы могут ходить или работать,
00:27:49имея лишь половину тела.
00:27:50Я убрал отсюда некоторые жесткие кадры,
00:27:52но мы также разрезали робота пополам,
00:27:54и он все равно может работать обеими половинами по отдельности.
00:27:57Но за этим вы можете сходить на YouTube.
00:27:59И на этом у меня всё.
00:28:00Спасибо.

Description

Show a robotics demo from 1957 next to one from today, and most people can't tell which is which. Deepak Pathak, co-founder and CEO of Skild AI and a professor at Carnegie Mellon, argues robotics stalled because it was treated as a hardware problem rather than a problem of building a general brain. Collecting robot data by teleoperation at one example a minute, he calculates, would take the entire US population more than a century to reach GPT-3 scale. Skild's answer is an "omni-bodied" brain: one model for any robot and any task. It's pre-trained on scalable data like simulation and human video, post-trained on teleoperation, and improved by a deployment flywheel. Pathak shows it inserting AirPods with a simple gripper, learning from human video with under an hour of robot data, and cooking omelets on $4,000 arms with only a camera. He explains why climbing stairs is harder than a backflip. He also shows GPU assembly for NVIDIA's Houston factory, and a robot learning to walk on two legs in three tries after its other legs are disabled. Speaker info: X/Twitter: @pathak2206 (https://x.com/pathak2206) LinkedIn: https://www.linkedin.com/in/pathak22 Website: https://www.cs.cmu.edu/~dpathak Related links: Skild AI: https://www.skild.ai Timestamps: 0:00 AI's progress and the robotics hype 1:02 Robotics has been "almost here" for 70 years 1:27 A 1960s block-copying robot 2:17 Teleoperation in 1957 3:57 Why robotics is stuck: the missing general brain 4:27 Moravec's paradox 5:42 There's no internet of robot data 7:22 Skild's thesis: one brain, any robot, any task 8:22 Teaser: many robots, one brain 9:31 How to scale robot data: a career retrospective 12:01 The three properties of robot data that matter 13:21 Pre-training, post-training and the deployment flywheel 14:56 Why laundry folding is actually easy 16:17 The AirPods task 17:21 Learning from human videos 18:36 The robot's "dream": imagined training data 18:56 Cooking omelets on $4,000 arms 20:41 Truly end-to-end: camera in, motor power out 21:21 Why stairs are harder than backflips 24:50 Deployment: GPU assembly for NVIDIA 26:00 Package delivery to the front door 26:25 Safety: adapting when the robot breaks

Community Posts

No posts yet. Be the first to write about this video!

Write about this video