Este modelo de código abierto corrige el mayor defecto de la IA (ThinkingCap)

BBetter Stack
Computing/SoftwareSmall Business/Startups

Transcript

00:00:00Esta es la misma pregunta hecha al mismo modelo base.
00:00:03Observen los contadores de tokens aquí.
00:00:05Uno de ellos pasa mucho tiempo razonando sobre la pregunta.
00:00:09mientras que el otro ya ha completado la tarea.
00:00:12Y si revisamos ambos resultados, la respuesta a la pregunta es básicamente la misma.
00:00:16Pero el modelo de la derecha gastó muchos más tokens para llegar a la misma conclusión.
00:00:21Y eso es bastante genial, porque la única diferencia entre estos dos modelos.
00:00:24es que el de la izquierda está ejecutando Thinking Cap.
00:00:27una versión personalizada y optimizada del mismo modelo.
00:00:31cuyo objetivo es garantizar que obtengas resultados de la misma calidad.
00:00:34sacrificando menos tokens y llegando a tu respuesta dos veces más rápido.
00:00:39Así que en el video de hoy echaremos un vistazo a Thinking Cap.
00:00:42veremos cómo funciona y luego los probaremos nosotros mismos.
00:00:45para ver si realmente es un enfoque novedoso para ajustar modelos de IA.
00:00:50Va a ser muy divertido, así que vamos a sumergirnos en ello.
00:00:57Antes de hablar de Thinking Cap, retrocedamos un poco el tiempo para ver cómo llegamos aquí.
00:01:03El primer modelo disponible públicamente, GPT-3, se lanzó en 2020.
00:01:09y a finales de 2022.
00:01:11ChatGPT puso GPT-3.5 a disposición del público general por primera vez.
00:01:17Ahí fue cuando la relación de la mayoría de la gente con la IA realmente comenzó.
00:01:21GPT-4 le siguió en 2023, lo que supuso otro salto en capacidad.
00:01:25pero seguía teniendo fundamentalmente la misma idea.
00:01:28Predecir el siguiente token y responder de inmediato.
00:01:31Pero entonces, en septiembre de 2024, OpenAI lanzó o1.
00:01:37y este fue el primer modelo que utilizó un modo de pensamiento antes de responder.
00:01:42Así que en lugar de enviar una respuesta de inmediato.
00:01:45dedicaba tiempo y tokens adicionales a razonar sobre el problema primero.
00:01:49Ese único cambio arquitectónico dio inicio a la era de los modelos de razonamiento.
00:01:54DeepSeek R1 le siguió unos meses después.
00:01:56y llevó la misma idea al mundo del código abierto.
00:02:00Y bastante rápido.
00:02:01el razonamiento se convirtió en lo que todos los principales creadores de IA estaban lanzando.
00:02:05Pero ahora, poco más de un año después.
00:02:08empezamos a ver la tendencia contraria.
00:02:11Modelos ajustados específicamente para pensar menos y no más.
00:02:15En cierto modo, volvemos a lo básico.
00:02:17pero con todo lo que aprendimos de la era del razonamiento incorporado.
00:02:21Pero aquí está el detalle.
00:02:22Ese cambio hacia pensar más resolvió un problema y silenciosamente creó otro.
00:02:28Nadie les enseñó realmente a estos modelos cuándo dejar de pensar.
00:02:31Si le pides a un modelo de razonamiento algo genuinamente simple.
00:02:34igual consumirá miles de tokens.
00:02:37re-derivando cosas que ya había entendido tres frases atrás.
00:02:41repitiendo el mismo punto con palabras ligeramente distintas.
00:02:44o en el peor de los casos, empezará a entrar en bucle.
00:02:48Y lo digo casi literalmente.
00:02:50Déjenme mostrarles uno de los ejemplos más ridículos con los que me he topado.
00:02:54Este es Step 3.5 Flash.
00:02:56Y cuando estaba probando este modelo de razonamiento.
00:02:58simplemente le envié una sola palabra: hola.
00:03:01Y miren lo que hace con eso.
00:03:03Pasa varios párrafos debatiendo si está obligado a presentarse con su nombre de modelo exacto.
00:03:09si usar siempre el nombre exacto al presentarse significa que debe hacerlo siempre o solo cuando él decida.
00:03:19Luego sopesa si mencionar la fecha de hoy es relevante.
00:03:22Y al final, después de todo eso, llega a una respuesta que cualquiera de nosotros habría escrito en dos segundos.
00:03:28Hola, soy Step 3.5 Flash.
00:03:31¿Cómo puedo ayudarte hoy?
00:03:33Así que eso no es realmente razonar.
00:03:35Eso es un modelo entrenado para pensar, pero que nunca fue entrenado para saber cuándo ha terminado de pensar.
00:03:41Ahora bien, BottleCap AI es una startup europea enfocada específicamente en hacer que la inferencia sea más eficiente.
00:03:47Y lo que hicieron con Thinking Cap es sinceramente muy inteligente.
00:03:51Tomaron el modelo Qwen 2.5, la versión de 27 mil millones de parámetros.
00:03:55y no intentaban hacerlo más inteligente, ni enseñarle nuevas habilidades, ni cambiar su personalidad o tocar su comportamiento de seguridad.
00:04:04Lo único que querían cambiar era cuánta computación consume para llegar a una respuesta que ya era capaz de dar.
00:04:11Y eso suena sencillo, pero en realidad es más difícil de lo que parece.
00:04:15La forma perezosa de hacer que un modelo sea más rápido es simplemente cortar su razonamiento.
00:04:20Forzarlo a detenerse después de una cantidad X de tokens, haya terminado o no.
00:04:25Eso reducirá absolutamente el recuento de tokens.
00:04:27Pero también hará que el modelo se equivoque más a menudo, porque a veces realmente necesita esos pasos adicionales.
00:04:34Así que el verdadero desafío de ingeniería aquí no es hacerlo más corto.
00:04:38Es hacerlo más corto sin volverlo más tonto en secreto
00:04:42Y así es como lo hicieron en realidad.
00:04:44Partiendo del punto de control base de Qwen 2.5 de 27 mil millones de parámetros.
00:04:48lo entrenaron en un conjunto seleccionado de problemas que abarcaban múltiples dominios y niveles de dificultad.
00:04:55Y en lugar de premiar al modelo por obtener la respuesta correcta.
00:04:58lo premiaron por obtener la respuesta correcta de manera eficiente.
00:05:02Porque si a un modelo solo se le premia por la precisión, ser verboso no cuesta nada.
00:05:08No hay incentivo para dejar de pensar antes de tiempo.
00:05:10Pero al premiar explícitamente la eficiencia junto con la precisión.
00:05:14el modelo aprende a reconocer cuándo ya tiene suficiente para comprometerse con una respuesta.
00:05:19Como resultado, obtuvieron un modelo que se comporta casi idéntico al original.
00:05:23Ahora veamos los números, porque aquí es donde se pone interesante.
00:05:27A través de 12 pruebas comparativas fuera de dominio, es decir, problemas que no formaban parte de los datos de entrenamiento.
00:05:33Thinking Cap redujo sus tokens de pensamiento en un promedio del 45.8%.
00:05:37Y la precisión apenas cambió.
00:05:40Se movió menos de un punto porcentual en promedio.
00:05:43Y en las pruebas comparativas que formaban parte del dominio de entrenamiento.
00:05:46la reducción de tokens fue aún mayor, casi un 58%.
00:05:49Y en GSM8K específicamente, la precisión de hecho subió del 93.3% al 96.5%.
00:05:58También rastrearon algo llamado tasa de bucle.
00:06:00Con qué frecuencia un modelo se queda atascado refraseando el mismo razonamiento una y otra vez sin converger.
00:06:06como acabamos de ver en ese ejemplo de Step 3.5 Flash.
00:06:10Eso también bajó en la mayoría de las pruebas comparativas.
00:06:12lo que nos indica que gran parte del razonamiento adicional que hacían estos modelos nunca fue productivo.
00:06:18Era solo ruido que parecía esfuerzo.
00:06:21Bien, los números en el papel son una cosa, pero probémoslo nosotros mismos.
00:06:26Estoy ejecutando esta prueba en una máquina con una RTX 5090 con 64 gigabytes de RAM.
00:06:32Y le voy a hacer la misma pregunta a ambos modelos.
00:06:35¿Cuál es el entero positivo más pequeño n tal que n factorial tenga exactamente 100 ceros al final?
00:06:42Y para llegar a la respuesta de esta pregunta, tiene que usar la fórmula de Legendre.
00:06:47lo cual para esta pregunta en particular arrojaría una respuesta de 405.
00:06:51Solo hay una respuesta correcta.
00:06:53No hay términos medios.
00:06:55Así que si obtenemos 405, sabemos que el modelo ha respondido correctamente.
00:07:00Muy bien, primero ejecutemos el modelo estándar cuantizado Qwen 2.5 de 27 mil millones de parámetros.
00:07:05y veamos cómo se comporta.
00:07:07Y como pueden ver desde el principio, la velocidad de tokens no es tan mala.
00:07:12Promedia unos 60 tokens por segundo.
00:07:14Pero miren cuánto está pensando este modelo.
00:07:17Es absolutamente ridículo.
00:07:20Ya pasamos largamente el minuto y sigue escupiendo tokens solo en la parte de razonamiento.
00:07:26Tuve que acelerar la vista previa aquí porque el tiempo total superaba los dos minutos.
00:07:30Pero aun así, al final obtuvimos el resultado correcto, que es 405, lo cual es bueno.
00:07:37Pero miren el tiempo total transcurrido.
00:07:39Son 140 segundos.
00:07:41Y miren el gasto de tokens.
00:07:43Se gastaron más de 7,000 tokens solo en razonamiento, y apenas 900 tokens en imprimir la respuesta.
00:07:52Así que este ejemplo demuestra claramente lo ridículamente exagerado que razona Qwen sobre cada solicitud.
00:07:59Ahora cambiemos a la versión Thinking Cap del mismo modelo.
00:08:02Y para que conste, estamos usando el mismo modelo de 27 mil millones de parámetros con la misma cuantización.
00:08:08Y como pueden ver aquí, han pasado 20 segundos y ya terminamos de razonar.
00:08:13Y apenas 9 segundos después, obtenemos la respuesta, que en este caso también es correcta, 405.
00:08:19Y miren qué diferencia tan drástica.
00:08:21No solo gastamos menos de 2,000 tokens en total, de los cuales solo 1,100 se asignaron al razonamiento.
00:08:30sino que también obtuvimos una velocidad ligeramente mayor de 62 tokens por segundo.
00:08:36Así que en todas las métricas, este modelo arrasa por completo con el Qwen 2.5 base.
00:08:42Es más rápido, más eficiente, cuesta menos tokens y te da la misma respuesta correcta.
00:08:48Así que esta es una mejora bastante impresionante.
00:08:51Y aquí hay un detalle de su informe que debo mencionar, porque es un accidente genuinamente gracioso.
00:08:57Su objetivo original era acortar solo la traza de pensamiento, es decir, la parte de razonamiento.
00:09:02manteniendo la respuesta final exactamente de la misma longitud que antes.
00:09:06Pero tuvieron un error de programación.
00:09:07El acortamiento se aplicó accidentalmente a la respuesta final también, no solo al pensamiento.
00:09:12Así que corrigieron el error, pero al parecer, internamente, a todos les gustó más la versión con el fallo.
00:09:18Su teoría es que los humanos se cansan al escribir respuestas largas, por lo que naturalmente comprimimos lo que decimos.
00:09:25Y estos modelos nunca habían tenido ese tipo de fatiga integrada hasta ahora.
00:09:29Así que terminaron lanzando la versión rota y concisa de todos modos, y guardando la técnicamente correcta para un lanzamiento futuro.
00:09:37Así que ahí lo tienen, amigos.
00:09:38Eso es Thinking Cap en pocas palabras.
00:09:40Supongo que la gran conclusión de todo esto es que siempre hemos creído que cuanto más piensan los modelos, más inteligentes son.
00:09:48Mientras que Thinking Cap acaba de demostrar que no es necesariamente el caso.
00:09:53Una vez que realmente lo entrenas para ello, puedes obtener resultados de la misma calidad por una fracción del costo, sin sacrificar prácticamente nada.
00:10:01Si quieres probar el modelo por tu cuenta, está disponible libremente en Hugging Face bajo la licencia Apache 2.0.
00:10:08Y quiero saber qué opinan, amigos.
00:10:10¿Qué opinan de este nuevo enfoque?
00:10:12¿Ven alguna ventaja o desventaja en esta técnica?
00:10:15Hágannos saber en la sección de comentarios más abajo.
00:10:17Y amigos, si les gustan este tipo de análisis técnicos, háganmelo saber destrozando ese botón de me gusta debajo del video.
00:10:23Y también, no olviden suscribirse a nuestro canal.
00:10:26Este ha sido Andrés de BetterStack, y nos vemos en los próximos videos.

Key Takeaway

Thinking Cap optimiza el modelo Qwen 2.5 de 27 mil millones de parámetros para reducir los tokens de pensamiento en casi un 46 por ciento sin sacrificar precisión.

Highlights

  • Thinking Cap reduce los tokens de pensamiento en un 45.8 por ciento en promedio a través de 12 pruebas comparativas fuera de dominio.

  • El modelo base utilizado es Qwen 2.5 en su versión de 27 mil millones de parámetros.

  • La precisión del modelo se mantuvo casi intacta, moviéndose menos de un punto porcentual en promedio tras aplicar la optimización.

  • En la prueba específica GSM8K, la precisión aumentó del 93.3 por ciento al 96.5 por ciento con Thinking Cap.

  • La ejecución de la prueba matemática tardó 140 segundos con el modelo estándar y gastó más de 7,000 tokens en razonamiento.

Timeline

Evolución de los modelos de razonamiento

  • OpenAI lanzó el modelo o1 en septiembre de 2024 como el primer sistema con modo de pensamiento previo.
  • Los modelos actuales de razonamiento consumen miles de tokens incluso en tareas simples porque carecen de un mecanismo para detenerse.
  • Step 3.5 Flash genera múltiples párrafos de debate interno incluso al recibir una sola palabra como saludo.

La industria de la inteligencia artificial pasó de predecir tokens de manera inmediata a implementar fases de razonamiento previo. Sin embargo, este cambio arquitectónico introdujo el problema del pensamiento redundante y los bucles infinitos en consultas sencillas.

Desarrollo y rendimiento de Thinking Cap

  • BottleCap AI desarrolló Thinking Cap utilizando el modelo Qwen 2.5 de 27 mil millones de parámetros.
  • El entrenamiento premió la eficiencia junto con la precisión para enseñar al modelo cuándo detener el razonamiento.
  • La reducción de tokens alcanzó casi el 58 por ciento en las pruebas dentro del dominio de entrenamiento.

Evitar que el modelo perdiera capacidad exigió un entrenamiento basado en recompensar respuestas correctas logradas con menor computación. Las pruebas demuestran una caída del 45.8 por ciento en tokens de pensamiento con variaciones mínimas en la precisión general.

Prueba práctica y conclusión

  • La prueba matemática con la fórmula de Legendre arrojó 405 como respuesta correcta en ambos modelos.
  • El modelo estándar requirió 140 segundos y más de 7,000 tokens de razonamiento para completar la tarea.
  • El modelo optimizado resolvió la misma pregunta en un tiempo significativamente menor y con menos de 2,000 tokens en total.

La demostración práctica en una máquina con una tarjeta gráfica RTX 5090 evidencia la diferencia de velocidad y consumo. Thinking Cap demuestra que los modelos no necesitan pensar excesivamente para ofrecer resultados de idéntica calidad.

Community Posts

View all posts