스크립트
00:00:00Bueno, creo que empecemos. Soy Armin. Soy el cofundador y CEO de Perceptron.
00:00:20Entraremos un poco en lo que hacemos, pero hoy quiero hablar principalmente
00:00:25sobre nuestra postura de investigación: queremos alejarnos de las distinciones entre VLM, VLA,
00:00:32modelos de mundo o como quieran llamarlo, hacia algo que denominamos modelos fundacionales incorporados.
00:00:42Específicamente, lo que hacemos en Perceptron, nuestra estrella guía, es querer ser capaces de
00:00:48construir bases de IA física que nos permitan percibir, entender e interactuar
00:00:53con el mundo físico en tiempo real. Así que la misión principal es unir los
00:00:58mundos físico y digital. Fundamentalmente, nuestro objetivo es que dondequiera que haya un dispositivo,
00:01:07un instrumento, un robot, una cámara o un sensor, estemos ahí dotándolo de inteligencia.
00:01:14Y cuando hablamos de este paradigma de poder percibir, razonar
00:01:19y actuar, lo vemos como una unificación del modelado multimodal tradicional.
00:01:25Yo vine de FAIR. Estuve allí seis años y mi objetivo era descifrar cómo
00:01:31escalar las fórmulas para modelos multimodales. Una de las primeras cosas en las que empezamos a trabajar,
00:01:37y sobre la que hemos publicado mucho, fue la fusión temprana. Este concepto de incorporar
00:01:41todas estas modalidades lo antes posible. La verdadera complejidad radica en descubrir cuál es la
00:01:47manera correcta de representar adecuadamente todas las distintas modalidades, tanto en la entrada como en
00:01:52la salida, para representarlas de forma holística. Los VLM se han convertido en...
00:01:58Cuando hablo de modelos multimodales, seguro piensan en VLM. Es la capacidad de recibir
00:02:03alguna imagen, video y algo de texto, y poder generar texto básicamente. Hay variaciones de esto.
00:02:09Existen modelos como los ER, de razonamiento incorporado, capaces de emitir tal vez
00:02:15puntos de anclaje, o de hacer comprensión espacial o razonamiento un poco mejor.
00:02:20Luego tenemos los VLA, que extienden el dominio de salida más allá del texto hacia
00:02:25las acciones. Tradicionalmente, se han seguido construyendo sobre arquitecturas base de VLM estándar,
00:02:30aunque ha habido esfuerzos para migrar y alejarse
00:02:35de los VLM hacia modelos de mundo o modelos de acción del mundo, aunque nada muy
00:02:39fructífero por ahora. Y luego entramos en variantes más interesantes y complejas de modelos
00:02:46multimodales, como los modelos de mundo, donde básicamente generas video a partir de entradas,
00:02:51las cuales pueden ser imágenes, video o incluso imagen, video y acciones. El último punto del que
00:02:57hablaré es algo reciente, lo que llamamos modelos semánticos de mundo, donde no generas nada,
00:03:02sino que aprendes un tipo de representación que consideras útil a futuro. Lo que nosotros
00:03:08vemos como un modelo fundacional incorporado es un enfoque que te permite hacer tanto la percepción
00:03:13estándar como el razonamiento incorporado y el objetivo principal de control, todo en un mismo modelo.
00:03:20Poder razonar a través de distintos tipos de modalidades sensoriales en la entrada y hacer
00:03:25la mayor parte de lo mencionado en la salida, todo dentro de un modelo único y unificado.
00:03:31Muy rápidamente, hablaré de dos desafíos. Son desafíos fundamentales
00:03:35de investigación que afrontamos, y hablaré de cómo nuestra empresa los abordó
00:03:40y de lo que otros también están haciendo aquí.
00:03:43Primero, piensen puramente en intentar modelar algo como video,
00:03:48por ejemplo, una hora de video. Según la representación, podrías tener alrededor de
00:03:52un millón de tokens visuales entrando. La verdad es que no hay un valor de referencia real
00:03:57que puedas usar eficazmente. Se pueden hacer cosas, y la gente las ha hecho,
00:04:02como extraer las transcripciones, predecirlas a partir del video o etiquetar sintéticamente
00:04:08algunos fotogramas y hacer preguntas. Resulta que esto es un desperdicio enorme.
00:04:13Si lo piensas, entran un millón de tokens a tu modelo
00:04:16y estás calculando la pérdida en algo así como el 0,2 % de todos los tokens
00:04:22que entran. Esto es fundamentalmente problemático. Y lo cierto es que,
00:04:27de cualquier forma en que intentes solucionarlo, estás inyectando una señal de entrenamiento errónea.
00:04:31O la señal es muy dispersa, muy sintética o muy indiscriminada. Así que otros enfoques,
00:04:37más allá del enriquecimiento sintético, proponen predecir cada píxel. Es cierto,
00:04:42es una señal muy densa, pero asigna muy mal la atención. Estás...
00:04:47Tratas un píxel de fondo con el mismo grado de importancia que le das a
00:04:51la punta de una pinza, los puntos de contacto, los fallos específicos o la física.
00:04:56Lo que hacemos en Perceptron, y es parte de nuestra propiedad intelectual central,
00:05:01es pensar cómo luce un objetivo perceptivo natural. Específicamente, ¿cómo
00:05:06predecir de forma muy automática las percepciones que importarán en el futuro? Por ejemplo,
00:05:11podrías programar de forma fija que, en un brazo robótico, la punta de las pinzas
00:05:16es una percepción muy útil de predecir a futuro. Y ya han empezado a hacer esto.
00:05:20La gente de MOMO Act en AI2 lo ha hecho, e igual otros VLA.
00:05:26Pero sigue siendo una percepción programada. La pregunta es: ¿se puede hallar una forma
00:05:30automática para que el modelo aprenda semánticamente este objetivo tan único? La verdad es que
00:05:37lo hemos logrado. No revelaremos el cómo aquí, pero esto sugiere
00:05:41cómo abordamos el problema de la dispersión. El segundo problema central en el que nos enfocamos
00:05:49es la sobrecarga de contexto. Si tienes cámaras siempre encendidas o robots que no necesariamente
00:05:54esperan o paran, terminas teniendo que razonar sobre una cantidad enorme de tokens.
00:06:01El texto es denso y el video es disperso. La cuestión es si hay avances de arquitectura
00:06:08para manejar este problema de forma nativa, en lugar de intentar solucionar
00:06:13este desequilibrio a un nivel puramente sintético.
00:06:20Hay varias cosas por hacer. Un principio básico es empezar a entrenar
00:06:25las distintas modalidades de forma totalmente diferente. No puedes tratar los tokens de texto
00:06:31igual que los de imagen o los de audio y video. Una cosa que puedes empezar a considerar
00:06:36es enfocarte en la compresión espacial o de tokens. Se hacen cosas muy simplistas;
00:06:41nosotros empezamos con eso y funciona. Puedes considerar promediar
00:06:44representaciones por parches en un video o imagen. Y empiezas a obtener tasas de compresión
00:06:51interesantes, de hasta 10 veces. Aun así, esto es un truco provisional y no hay métodos
00:06:57arquitectónicos bien establecidos para resolverlo. Lo que hemos hecho en los últimos meses
00:07:04fue publicar nuestro enfoque para lidiar con variados grados de dispersión:
00:07:10dejar que el modelo determine a qué tokens prestar atención y a cuáles no.
00:07:14Publicamos nuestro artículo sobre mezcla de expertos dispersos en datos, lo cual te permite
00:07:19hacer esto. Le permite al modelo —bueno, hay un enrutador en él—
00:07:24predecir qué token procesar y cuál omitir, y lo hace casi
00:07:30de forma gratuita a través de las capas. Resulta que si dejas aprender al modelo,
00:07:36sin codificar a nivel rígido supuestos arquitectónicos significativos, realmente aprende.
00:07:43Si visualizas el cómputo disperso de datos que usan nuestros modelos, notas que
00:07:49aprenden innatamente a centrarse en información de muy alta densidad o relevante para la tarea.
00:07:56Arriba a la derecha se aprecia cómo el modelo decide enfocarse en el gráfico,
00:08:00en el cual tú como humano también te enfocarías, ya que es lo más interesante de
00:08:05la figura. Y resulta que incluso la asignación dependiente de la tarea termina ocurriendo
00:08:13también. Abajo a la izquierda, si haces una pregunta muy general,
00:08:18verás un gráfico de atención distribuido por toda la imagen. El modelo sencillamente
00:08:22no sabe cómo asignar el cómputo adecuadamente. En cambio, si le pides algo
00:08:27como segmentar toda la fruta, asignará más tokens a lo que
00:08:31considera tokens de fruta. Es un truco astuto que usamos y publicamos,
00:08:36y que otros empiezan a implementar: integrar a priori en la arquitectura elementos útiles para
00:08:43afrontar los desequilibrios de dispersión de las modalidades, pero sin ser restrictivos al punto de impedir
00:08:49que aprendan nativamente. Uniendo todo esto —quizá hayan visto
00:08:57el lanzamiento—, lanzamos hace unas semanas el que consideramos el primer modelo
00:09:03fundacional incorporado. Es un modelo a la vanguardia con respecto a Gemini
00:09:093.1 Pro; supera a Gemini Embodied Reasoning y cuesta unas 15 veces menos.
00:09:15Se entrenó con este conjunto de datos de un petabyte recopilado de prácticamente
00:09:20todo: desde rastreos web hasta nuestras fórmulas de entrenamiento intermedio o canalizaciones de datos sintéticos.
00:09:28Tenemos este petabyte de datos en texto, imágenes, videos y trayectorias. Estas trayectorias
00:09:34pueden ser muy generales: uso de escritorio o partidas de videojuegos.
00:09:41Y resulta que al hacer estas cosas, emergen propiedades sumamente interesantes.
00:09:46La propiedad principal que notamos, y que en retrospectiva resulta obvia,
00:09:50es que puedes empezar a pensar en las tareas clásicas de visión por computador como una tarea de agentes. Así que
00:09:57en este caso, replanteamos la detección como una tarea agéntica. Nuestro modelo puede, ya sabes,
00:10:02escribir código. Puede pedir hacer zoom en zonas específicas, puede cambiar el contraste. Y se puede
00:10:09ver aquí que es un problema muy difícil. Creo que hay todo un subreddit en Reddit de estos
00:10:14problemas para intentar encontrar objetos muy difíciles en imágenes. Y nuestros modelos hacen esto muy
00:10:19bien. Pero lo hacen con un sentido agéntico. Esto no es el clásico “detecta este
00:10:24cuadro”. Aquí es el modelo el que decide que necesita dividir las cosas en cuadrículas o cambiar el
00:10:28contraste. Propone un cuadro aquí... creo que sí, aumenta el contraste y logra encontrar el pájaro.
00:10:36De nuevo, muy difícil de hacer incluso para un humano, y los humanos somos muy buenos en tareas perceptivas,
00:10:42esto es algo bastante complicado de hacer. Y todo esto proviene de tener
00:10:46modelos corporizados de forma nativa que entienden cómo analizar diferentes modalidades.
00:10:51Siguiendo con esto, ¿cómo se relaciona con la postura general de la IA física respecto a la robótica?
00:10:57Tomé prestada esta diapositiva del equipo de GDM. Algo que estamos empezando a ver en los
00:11:04sistemas agénticos de robótica es esta separación entre lo que llamamos modelos de razonamiento corporizado u
00:11:11orquestadores, y los modelos de políticas táctiles. Puedes pensar en los problemas como, no sé,
00:11:17si estoy haciendo café y me toma tres minutos hacerlo, una opción que tengo
00:11:21es intentar forzar a todo mi VLA a averiguar cómo hacer esa tarea individual. O bien
00:11:26puedo usar un modelo orquestador que divida estas tareas en subtareas, con una política de
00:11:31control táctil ejecutándose por encima. Hay todo un espectro desde basarse solo en VLA
00:11:36hasta este tipo de sistema agéntico. Pero lo principal que quiero destacar es que
00:11:41el razonamiento corporizado es un problema muy interesante y complejo que aún está por resolverse.
00:11:46Dicho esto, nuestros modelos siguen estando en la frontera del razonamiento corporizado.
00:11:50Y al estar a la vanguardia, empezamos a ver cosas geniales que no habíamos visto antes.
00:11:55Aquí hay un ejemplo concreto de anotación de datos robóticos muy compleja, no de tipo egocéntrico,
00:11:59sino de datos robóticos. Se puede ver cómo el modelo va saltando de un lado a otro,
00:12:04examinando distintas partes del video, recortándolo, determinando si los
00:12:09subtítulos son correctos y autoverificando. Podemos hacer todo esto porque los modelos AR son rápidos.
00:12:15Son significativamente más baratos que cualquier otra cosa disponible. Si intentaras hacer esto con Gemini,
00:12:20este video costaría un par de dólares, mientras que para nosotros cuesta solo unos centavos.
00:12:24Y todo esto surge al disponer de estas capacidades avanzadas de razonamiento corporizado
00:12:29que anteriormente no habíamos visto en otros modelos.
00:12:37Bien, ahora voy a compartir el mayor avance en investigación que hemos logrado, y creo que
00:12:41compartiremos más sobre esto en las próximas semanas, probablemente en Twitter. Descubrimos
00:12:48nuevas leyes de escala para modelos fundacionales corporizados. Estos son modelos con los que se puede
00:12:53entrenar conjuntamente control, trayectoria, percepción
00:12:59y razonamiento corporizado. Si encuentras la forma adecuada de combinar todo esto
00:13:03junto con los objetivos correctos, empiezas a ver factores clave muy interesantes que
00:13:08quizás antes no podías percibir.
00:13:11El factor concreto del que hablaré es la capacidad de intercambiar datos generales de video
00:13:19de preentrenamiento por datos de teleoperación. Como sabemos, los datos de teleoperación son muy caros. Cuestan
00:13:25alrededor de 100 dólares por hora de datos. Con 100 dólares, puedo recolectar muchísimo más video de preentrenamiento.
00:13:32Lo que muestra este gráfico es que si solo se entrenan VLA puras, políticas puras, se obtiene un rango
00:13:39determinado. Se siguen aplicando las leyes de escala, por lo que se obtienen beneficios al añadir más
00:13:43datos de teleoperación. Sin embargo, los beneficios no son tan sustanciales como si entrenas verdaderamente
00:13:48estos modelos fundacionales corporizados unificados. Esto es lo que se observa en la parte inferior del gráfico.
00:13:55Y la ventaja genial que obtenemos es que se puede sustituir 10 veces menos datos de teleoperación si
00:14:03tienes 10 veces más datos de preentrenamiento en video. Hasta ahora, esto se ha mantenido con la capacidad de cómputo que
00:14:09tiene nuestra empresa. Seguiremos ampliando los límites para ver hasta dónde se pueden llevar estos modelos
00:14:16fundacionales corporizados. Aquí hay un par de videos de una política, y esperamos liberar en código abierto uno
00:14:28de los modelos más pequeños en un par de semanas. Todo se ejecuta de forma nativa dentro de un único modelo
00:14:33capaz de realizar el razonamiento corporizado para resolver la tarea. En realidad,
00:14:38está generando tokens de control. Se ve un poco inestable, pero está bien. Esperamos
00:14:43resolver eso a gran escala. Pueden verse tareas muy complejas que antes creo que
00:14:48serían muy difíciles para los VLA puros. Mirando el video de la derecha, se
00:14:54requiere que el modelo lea el título del libro, sepa qué tipo de libro
00:14:58es y luego lo clasifique adecuadamente en uno de los contenedores. Es una tarea multipaso
00:15:04entre percepción y control realmente difícil de lograr si usas un modelo de control puro
00:15:09de extremo a extremo que no es consciente de las distintas tareas perceptivas que debe cumplir para realizar la actividad.
00:15:23Sí, es bastante genial. También funciona muy bien en zero-shot directamente. Así que estamos entusiasmados de poner esto en
00:15:28manos de la gente en un par de semanas, en algún momento de julio.
00:15:33Dejaré un par de minutos para preguntas generales, pero si les interesa, pongámonos en contacto.
00:15:41Algo genial que hacemos en la empresa es que, a un grupo limitado de socios, les damos acceso a los pesos de Mark 1.
00:15:47Damos acceso a los pesos de nuestros modelos fundacionales corporizados más grandes. Envíenme un correo o un MD en Twitter, lo que sea más fácil.
00:15:58Y bueno, abriré el espacio. Quedan un par de minutos para preguntas.
00:16:02Gracias.
00:16:03Gracias.
00:16:05Gracias.
00:16:05Gracias.
00:16:09Gracias.
00:16:11Gracias.
00:16:13Gracias.
00:16:24Sí, creo que... la pregunta es: ¿cómo podemos dominar la comprensión temporal a este nivel?
00:16:31Es una buena pregunta. Para ser honesto, no está dominado. Todavía queda mucho trabajo para llegar a un punto donde se pueda desplegar confiablemente.
00:16:37Lo fundamental es: ¿cómo gestionar el contexto? Tienes un contexto relativamente limitado. Creo que los modelos aquí tienen un contexto de 1 millón, pero eso es fácil de llenar con un video de FPS alto.
00:17:06Así que hay que empezar a pensar si hay cosas interesantes que se puedan hacer. Les comento algo: solíamos hacer esto, aunque ya lo superamos, pero ¿cómo pensar en fotogramas clave frente a fotogramas delta?
00:17:19¿Cómo puedo gestionar mi contexto ajustando ambos? Y luego piensas, durante el objetivo de preentrenamiento, ¿cómo procesar de forma nativa cosas que resulten útiles para las tareas de robótica?
00:17:32Por ejemplo, algo muy básico con lo que incluso los modelos de Gemini solían tener dificultades (creo que los nuevos son bastante buenos) es identificar las cardinalidades.
00:17:40Diferenciar la izquierda de la derecha es muy difícil con rastreos a escala de internet, porque nadie en internet etiqueta necesariamente las cosas como “este objeto está a la izquierda de este otro” o “debajo de este otro”.
00:17:51Así que pensar en las distribuciones de datos desde el principio te da esta capacidad rápidamente. Además, el razonamiento corporizado era un enfoque muy concreto para nosotros, por eso creo que logramos superar a Gemini ER con relativamente menos cómputo.
00:18:07Sí, probablemente la solidez más impresionante que hemos visto en modelos VLA específicamente es que, si tomas uno de los modelos chinos
00:18:35e intentas ajustarlo para una política específica, con solo cambiar el fondo de la... no sé, incluso en la mesa, si cambias el fondo de la mesa, la política fallará.
00:18:47Lo verdaderamente interesante es que, si haces este tipo de modelado conjunto de percepción y control, eres mucho más resistente a este tipo de errores o a que la luz incida de forma ligeramente diferente.
00:18:56Y consideramos esto principalmente como una solidez ante el fondo que no necesariamente tienen los modelos tradicionales.
00:19:03Dicho esto, tampoco quiero exagerar... quiero decir, sigue siendo relativamente difícil.
00:19:07Si fuera a iluminar directamente con una linterna uno de los brazos, probablemente no funcionaría.
00:19:12Pero poder modelar estas cosas conjuntamente ayuda enormemente.
00:19:16También hacemos mucha aumentación en línea, simulando, por ejemplo, que una de las cámaras del brazo está apagada, ¿saben?
00:19:27Simulamos la luz del sol entrando desde cierta dirección, ¿de acuerdo?
00:19:31Hacemos estas cosas durante el entrenamiento para mejorar la solidez.
00:19:35Pero las grandes ganancias provienen de adoptar este paradigma de fusión temprana y llevarlo al dominio de la robótica.
00:19:43Genial.
00:19:44.
00:19:50¿Ah, bases de conocimiento?
00:19:52Es útil para... bueno, si quieres subtitular imágenes o videos, funciona bastante bien.
00:19:57Trabajamos con socios de robótica para anotaciones egocéntricas muy complejas como esta.
00:20:02Así que no se trata de construir sobre una ontología, sino de realizar una extracción estructurada muy profunda,
00:20:07algo en lo que creo que nuestros modelos son muy buenos.
00:20:10Sí.
00:20:11Por cierto, todo lo que mostré aquí está disponible en API públicas, así que pueden probarlo.
00:20:15Las evaluaciones de rendimiento son públicas.
00:20:17Creo que se me acabó el tiempo.
00:20:19Me están haciendo señas, así que puedo conversar afuera.
00:20:22Muchas gracias a todos.
00:20:27Gracias.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기