Este modelo de código abierto corrige el mayor defecto de la IA (ThinkingCap)
BBetter Stack
Computing/SoftwareSmall Business/Startups
Transcript
00:00:00Esta es la misma pregunta hecha al mismo modelo base.
00:00:03Observen los contadores de tokens aquí.
00:00:05Uno de ellos pasa mucho tiempo razonando sobre la pregunta.
00:00:09mientras que el otro ya ha completado la tarea.
00:00:12Y si revisamos ambos resultados, la respuesta a la pregunta es básicamente la misma.
00:00:16Pero el modelo de la derecha gastó muchos más tokens para llegar a la misma conclusión.
00:00:21Y eso es bastante genial, porque la única diferencia entre estos dos modelos.
00:00:24es que el de la izquierda está ejecutando Thinking Cap.
00:00:27una versión personalizada y optimizada del mismo modelo.
00:00:31cuyo objetivo es garantizar que obtengas resultados de la misma calidad.
00:00:34sacrificando menos tokens y llegando a tu respuesta dos veces más rápido.
00:00:39Así que en el video de hoy echaremos un vistazo a Thinking Cap.
00:00:42veremos cómo funciona y luego los probaremos nosotros mismos.
00:00:45para ver si realmente es un enfoque novedoso para ajustar modelos de IA.
00:00:50Va a ser muy divertido, así que vamos a sumergirnos en ello.
00:00:57Antes de hablar de Thinking Cap, retrocedamos un poco el tiempo para ver cómo llegamos aquí.
00:01:03El primer modelo disponible públicamente, GPT-3, se lanzó en 2020.
00:01:09y a finales de 2022.
00:01:11ChatGPT puso GPT-3.5 a disposición del público general por primera vez.
00:01:17Ahí fue cuando la relación de la mayoría de la gente con la IA realmente comenzó.
00:01:21GPT-4 le siguió en 2023, lo que supuso otro salto en capacidad.
00:01:25pero seguía teniendo fundamentalmente la misma idea.
00:01:28Predecir el siguiente token y responder de inmediato.
00:01:31Pero entonces, en septiembre de 2024, OpenAI lanzó o1.
00:01:37y este fue el primer modelo que utilizó un modo de pensamiento antes de responder.
00:01:42Así que en lugar de enviar una respuesta de inmediato.
00:01:45dedicaba tiempo y tokens adicionales a razonar sobre el problema primero.
00:01:49Ese único cambio arquitectónico dio inicio a la era de los modelos de razonamiento.
00:01:54DeepSeek R1 le siguió unos meses después.
00:01:56y llevó la misma idea al mundo del código abierto.
00:02:00Y bastante rápido.
00:02:01el razonamiento se convirtió en lo que todos los principales creadores de IA estaban lanzando.
00:02:05Pero ahora, poco más de un año después.
00:02:08empezamos a ver la tendencia contraria.
00:02:11Modelos ajustados específicamente para pensar menos y no más.
00:02:15En cierto modo, volvemos a lo básico.
00:02:17pero con todo lo que aprendimos de la era del razonamiento incorporado.
00:02:21Pero aquí está el detalle.
00:02:22Ese cambio hacia pensar más resolvió un problema y silenciosamente creó otro.
00:02:28Nadie les enseñó realmente a estos modelos cuándo dejar de pensar.
00:02:31Si le pides a un modelo de razonamiento algo genuinamente simple.
00:02:34igual consumirá miles de tokens.
00:02:37re-derivando cosas que ya había entendido tres frases atrás.
00:02:41repitiendo el mismo punto con palabras ligeramente distintas.
00:02:44o en el peor de los casos, empezará a entrar en bucle.
00:02:48Y lo digo casi literalmente.
00:02:50Déjenme mostrarles uno de los ejemplos más ridículos con los que me he topado.
00:02:54Este es Step 3.5 Flash.
00:02:56Y cuando estaba probando este modelo de razonamiento.
00:02:58simplemente le envié una sola palabra: hola.
00:03:01Y miren lo que hace con eso.
00:03:03Pasa varios párrafos debatiendo si está obligado a presentarse con su nombre de modelo exacto.
00:03:09si usar siempre el nombre exacto al presentarse significa que debe hacerlo siempre o solo cuando él decida.
00:03:19Luego sopesa si mencionar la fecha de hoy es relevante.
00:03:22Y al final, después de todo eso, llega a una respuesta que cualquiera de nosotros habría escrito en dos segundos.
00:03:28Hola, soy Step 3.5 Flash.
00:03:31¿Cómo puedo ayudarte hoy?
00:03:33Así que eso no es realmente razonar.
00:03:35Eso es un modelo entrenado para pensar, pero que nunca fue entrenado para saber cuándo ha terminado de pensar.
00:03:41Ahora bien, BottleCap AI es una startup europea enfocada específicamente en hacer que la inferencia sea más eficiente.
00:03:47Y lo que hicieron con Thinking Cap es sinceramente muy inteligente.
00:03:51Tomaron el modelo Qwen 2.5, la versión de 27 mil millones de parámetros.
00:03:55y no intentaban hacerlo más inteligente, ni enseñarle nuevas habilidades, ni cambiar su personalidad o tocar su comportamiento de seguridad.
00:04:04Lo único que querían cambiar era cuánta computación consume para llegar a una respuesta que ya era capaz de dar.
00:04:11Y eso suena sencillo, pero en realidad es más difícil de lo que parece.
00:04:15La forma perezosa de hacer que un modelo sea más rápido es simplemente cortar su razonamiento.
00:04:20Forzarlo a detenerse después de una cantidad X de tokens, haya terminado o no.
00:04:25Eso reducirá absolutamente el recuento de tokens.
00:04:27Pero también hará que el modelo se equivoque más a menudo, porque a veces realmente necesita esos pasos adicionales.
00:04:34Así que el verdadero desafío de ingeniería aquí no es hacerlo más corto.
00:04:38Es hacerlo más corto sin volverlo más tonto en secreto
00:04:42Y así es como lo hicieron en realidad.
00:04:44Partiendo del punto de control base de Qwen 2.5 de 27 mil millones de parámetros.
00:04:48lo entrenaron en un conjunto seleccionado de problemas que abarcaban múltiples dominios y niveles de dificultad.
00:04:55Y en lugar de premiar al modelo por obtener la respuesta correcta.
00:04:58lo premiaron por obtener la respuesta correcta de manera eficiente.
00:05:02Porque si a un modelo solo se le premia por la precisión, ser verboso no cuesta nada.
00:05:08No hay incentivo para dejar de pensar antes de tiempo.
00:05:10Pero al premiar explícitamente la eficiencia junto con la precisión.
00:05:14el modelo aprende a reconocer cuándo ya tiene suficiente para comprometerse con una respuesta.
00:05:19Como resultado, obtuvieron un modelo que se comporta casi idéntico al original.
00:05:23Ahora veamos los números, porque aquí es donde se pone interesante.
00:05:27A través de 12 pruebas comparativas fuera de dominio, es decir, problemas que no formaban parte de los datos de entrenamiento.
00:05:33Thinking Cap redujo sus tokens de pensamiento en un promedio del 45.8%.
00:05:37Y la precisión apenas cambió.
00:05:40Se movió menos de un punto porcentual en promedio.
00:05:43Y en las pruebas comparativas que formaban parte del dominio de entrenamiento.
00:05:46la reducción de tokens fue aún mayor, casi un 58%.
00:05:49Y en GSM8K específicamente, la precisión de hecho subió del 93.3% al 96.5%.
00:05:58También rastrearon algo llamado tasa de bucle.
00:06:00Con qué frecuencia un modelo se queda atascado refraseando el mismo razonamiento una y otra vez sin converger.
00:06:06como acabamos de ver en ese ejemplo de Step 3.5 Flash.
00:06:10Eso también bajó en la mayoría de las pruebas comparativas.
00:06:12lo que nos indica que gran parte del razonamiento adicional que hacían estos modelos nunca fue productivo.
00:06:18Era solo ruido que parecía esfuerzo.
00:06:21Bien, los números en el papel son una cosa, pero probémoslo nosotros mismos.
00:06:26Estoy ejecutando esta prueba en una máquina con una RTX 5090 con 64 gigabytes de RAM.
00:06:32Y le voy a hacer la misma pregunta a ambos modelos.
00:06:35¿Cuál es el entero positivo más pequeño n tal que n factorial tenga exactamente 100 ceros al final?
00:06:42Y para llegar a la respuesta de esta pregunta, tiene que usar la fórmula de Legendre.
00:06:47lo cual para esta pregunta en particular arrojaría una respuesta de 405.
00:06:51Solo hay una respuesta correcta.
00:06:53No hay términos medios.
00:06:55Así que si obtenemos 405, sabemos que el modelo ha respondido correctamente.
00:07:00Muy bien, primero ejecutemos el modelo estándar cuantizado Qwen 2.5 de 27 mil millones de parámetros.
00:07:05y veamos cómo se comporta.
00:07:07Y como pueden ver desde el principio, la velocidad de tokens no es tan mala.
00:07:12Promedia unos 60 tokens por segundo.
00:07:14Pero miren cuánto está pensando este modelo.
00:07:17Es absolutamente ridículo.
00:07:20Ya pasamos largamente el minuto y sigue escupiendo tokens solo en la parte de razonamiento.
00:07:26Tuve que acelerar la vista previa aquí porque el tiempo total superaba los dos minutos.
00:07:30Pero aun así, al final obtuvimos el resultado correcto, que es 405, lo cual es bueno.
00:07:37Pero miren el tiempo total transcurrido.
00:07:39Son 140 segundos.
00:07:41Y miren el gasto de tokens.
00:07:43Se gastaron más de 7,000 tokens solo en razonamiento, y apenas 900 tokens en imprimir la respuesta.
00:07:52Así que este ejemplo demuestra claramente lo ridículamente exagerado que razona Qwen sobre cada solicitud.
00:07:59Ahora cambiemos a la versión Thinking Cap del mismo modelo.
00:08:02Y para que conste, estamos usando el mismo modelo de 27 mil millones de parámetros con la misma cuantización.
00:08:08Y como pueden ver aquí, han pasado 20 segundos y ya terminamos de razonar.
00:08:13Y apenas 9 segundos después, obtenemos la respuesta, que en este caso también es correcta, 405.
00:08:19Y miren qué diferencia tan drástica.
00:08:21No solo gastamos menos de 2,000 tokens en total, de los cuales solo 1,100 se asignaron al razonamiento.
00:08:30sino que también obtuvimos una velocidad ligeramente mayor de 62 tokens por segundo.
00:08:36Así que en todas las métricas, este modelo arrasa por completo con el Qwen 2.5 base.
00:08:42Es más rápido, más eficiente, cuesta menos tokens y te da la misma respuesta correcta.
00:08:48Así que esta es una mejora bastante impresionante.
00:08:51Y aquí hay un detalle de su informe que debo mencionar, porque es un accidente genuinamente gracioso.
00:08:57Su objetivo original era acortar solo la traza de pensamiento, es decir, la parte de razonamiento.
00:09:02manteniendo la respuesta final exactamente de la misma longitud que antes.
00:09:06Pero tuvieron un error de programación.
00:09:07El acortamiento se aplicó accidentalmente a la respuesta final también, no solo al pensamiento.
00:09:12Así que corrigieron el error, pero al parecer, internamente, a todos les gustó más la versión con el fallo.
00:09:18Su teoría es que los humanos se cansan al escribir respuestas largas, por lo que naturalmente comprimimos lo que decimos.
00:09:25Y estos modelos nunca habían tenido ese tipo de fatiga integrada hasta ahora.
00:09:29Así que terminaron lanzando la versión rota y concisa de todos modos, y guardando la técnicamente correcta para un lanzamiento futuro.
00:09:37Así que ahí lo tienen, amigos.
00:09:38Eso es Thinking Cap en pocas palabras.
00:09:40Supongo que la gran conclusión de todo esto es que siempre hemos creído que cuanto más piensan los modelos, más inteligentes son.
00:09:48Mientras que Thinking Cap acaba de demostrar que no es necesariamente el caso.
00:09:53Una vez que realmente lo entrenas para ello, puedes obtener resultados de la misma calidad por una fracción del costo, sin sacrificar prácticamente nada.
00:10:01Si quieres probar el modelo por tu cuenta, está disponible libremente en Hugging Face bajo la licencia Apache 2.0.
00:10:08Y quiero saber qué opinan, amigos.
00:10:10¿Qué opinan de este nuevo enfoque?
00:10:12¿Ven alguna ventaja o desventaja en esta técnica?
00:10:15Hágannos saber en la sección de comentarios más abajo.
00:10:17Y amigos, si les gustan este tipo de análisis técnicos, háganmelo saber destrozando ese botón de me gusta debajo del video.
00:10:23Y también, no olviden suscribirse a nuestro canal.
00:10:26Este ha sido Andrés de BetterStack, y nos vemos en los próximos videos.