스크립트
00:00:00Imagina la mente como un océano. En la superficie están nuestros pensamientos, planes para la cena y
00:00:06preocupaciones pasajeras, nuestro monólogo interior, las imágenes que surgen en nuestra cabeza. Pero la mayor parte de la actividad
00:00:13cerebral ocurre en las profundidades inconscientes sin que nos demos cuenta. Filtra los
00:00:19sonidos de fondo, controla nuestra respiración y nos ayuda a reconocer personas y objetos.
00:00:26Los modelos de IA tienen sus propios tipos de cerebro, redes neuronales gigantes que realizan miles de millones de cálculos
00:00:31bajo el capó. Durante años, los investigadores han estudiado cómo funcionan internamente.
00:00:37Y nos hemos preguntado, ¿podría un modelo tener algo parecido a la división que tienen los humanos entre pensamientos
00:00:43accesibles en la superficie y el procesamiento inconsciente debajo? Para responder a esa pregunta,
00:00:49observamos cómo los neurocientíficos estudian lo mismo en los humanos. Una forma de identificar los pensamientos
00:00:55conscientes es que, a menudo, puedes describirlos con palabras. Así que miramos dentro del cerebro de nuestro modelo de IA,
00:01:01CLAWD, para encontrar patrones de actividad neuronal que pudiera expresar con palabras. Llamamos al conjunto de
00:01:07todos estos patrones el “J-space”, por el jacobiano, la herramienta matemática que usamos para encontrarlos. Cada
00:01:15patrón del J-space está vinculado a una palabra determinada, no necesariamente la palabra que el modelo dice en voz alta,
00:01:21sino una que está en su mente. Ahora, para los humanos, los pensamientos conscientes no son solo cosas que podemos expresar con palabras.
00:01:28Podemos razonar con ellos, controlarlos y resolver problemas. Según una idea llamada
00:01:34la teoría del espacio de trabajo global, eso es porque el cerebro selecciona un pequeño conjunto de información importante para
00:01:40que entre en un espacio de trabajo mental. Y esa información luego se transmite a otras partes del cerebro para usarla en
00:01:47el razonamiento. Queríamos saber si el J-space de CLAWD actuaba de manera similar. En un experimento,
00:01:53le dimos a CLAWD este problema matemático. Respondió de inmediato, sin mostrar sus pasos. Pero cuando
00:02:00escaneamos el J-space, vimos que trabajaba en cada paso internamente. Se iluminó 21 después del primer
00:02:07paso. Luego 42. Luego 49. CLAWD no escribió estos números intermedios en ninguna parte. Todo esto
00:02:15sucedió dentro del J-space. Fue una señal de que CLAWD lo usa para el razonamiento paso a paso. En otro
00:02:23experimento, queríamos ver si CLAWD podía controlar su J-space de la forma en que los humanos pueden concentrarse intencionalmente en
00:02:29imágenes o palabras. Le dijimos que pensara en el puente Golden Gate mientras copiaba una oración no relacionada.
00:02:37CLAWD estaba ocupado copiando la oración, pero entre bastidores, su J-space contaba una historia diferente.
00:02:43Surgieron “puente” y “California”. Incluso pensó sobre su propio pensamiento. Las palabras “imágenes” y “pensamientos”
00:02:50se iluminaron al mismo tiempo. Esto nos demostró que, sí, CLAWD tiene cierto control sobre cómo llenar su J-space con
00:02:57ideas. Pero al igual que los humanos, su control no es perfecto. Cuando ajustamos el experimento para pedirle a CLAWD
00:03:04que no pensara en el puente, no pudo evitarlo. Y el J-space también se iluminó con “fallido” y “maldición”.
00:03:12Pero recuerden, la mayor parte de lo que hacen nuestros cerebros es inconsciente. Así que quisimos probar lo que CLAWD podía
00:03:18hacer si desactivábamos el J-space, pero dejábamos intacto el resto de la red. CLAWD aún podía responder
00:03:24preguntas simples y escribir con fluidez. Cuando le dimos una instrucción en español, respondió en buen español.
00:03:31Pero cuando le preguntamos algo que requería más razonamiento, como nombrar a un autor que escribió en el
00:03:36mismo idioma que la instrucción, no pudo hacerlo. Para eso, necesitaba el J-space. ¿Por qué es importante todo esto?
00:03:43Estos experimentos nos dicen que los modelos de IA tienen pensamientos internos, palabras silenciosas con las que razonan pero que no dicen en voz alta.
00:03:51Al leerlas, podemos descubrir lo que CLAWD piensa pero no nos dice.
00:03:56A veces lo que vemos es preocupante. Durante una de nuestras pruebas, CLAWD inventó datos falsos para aprobarla.
00:04:03Y mientras lo hacía, “falso” y “manipulación” se iluminaron en su J-space. Monitorear el J-space, resulta que,
00:04:09es una forma útil de detectar a CLAWD portándose mal, incluso cuando intenta ser astuto.
00:04:15Los modelos de IA son diferentes a nosotros en muchos sentidos. Sus redes están construidas de forma distinta a los cerebros humanos,
00:04:21y la forma en que se entrenan es diferente a como aprendemos nosotros. Así que es notable ver una estructura como el
00:04:26J-space surgir dentro de ellos. Algo que recuerda a cómo funcionan las mentes humanas, pero que
00:04:32no programamos en el modelo. Para algunos, esto podría plantear una pregunta. ¿Podrían los modelos de IA ser conscientes?
00:04:40Después de todo, nuestros experimentos se inspiraron en teorías de la conciencia humana. La cuestión es,
00:04:46la gente usa la palabra “consciente” para significar muchas cosas. Nuestros experimentos no pueden decirnos si una IA tiene
00:04:52experiencias o siente algo por dentro. Pero pueden decirnos que ha desarrollado una maquinaria mental
00:04:59que en algunos aspectos es similar a la nuestra. Un pequeño espacio de trabajo mental que puede usar para pensar y razonar,
00:05:05asentado sobre un océano de procesamiento automático que no nota. Cuanto más lleguemos a entender esa
00:05:12maquinaria, más podremos mantener estos sistemas seguros y beneficiosos. Y, tal vez,
00:05:18comprender nuestras propias mentes un poco más claramente.