스크립트
00:00:00Thinking Machines, la empresa emergente de 12 mil millones de la ex-CTO de OpenAI Mira Moretti, acaba de lanzar su
00:00:05primer modelo. Tiene 975 mil millones de parámetros, su licencia es Apache 2.0 y los pesos están todos
00:00:12en Hugging Face para que cualquiera los descargue. Y aunque no compite con los laboratorios de vanguardia
00:00:17como Anthropic, su objetivo real es ser ajustado específicamente con su propia plataforma,
00:00:22Tinker. Así que si necesitas un modelo entrenado para una tarea muy específica,
00:00:25entonces este puede ser exactamente lo que buscas. Hoy veremos por qué querrías usar
00:00:29este modelo específicamente y todas las razones por las que querrías ajustarlo. Y hay una forma súper
00:00:35interesante en la que este modelo procesa audio y video, que nunca antes había visto. Así que quédate
00:00:40porque también cubriremos eso en este video. Y cubrimos temas de IA constantemente en
00:00:44este canal. Así que si quieres mantenerte al día, suscríbete a BetterStack.
00:00:52Thinking Machines es muy sincera sobre el hecho de que su nuevo modelo no es tan fuerte como prácticamente
00:00:57cualquier modelo general en el mercado. Y lo dicen en su publicación de lanzamiento. Así que solo están gestionando
00:01:01expectativas y puedes ver por qué en las pruebas comparativas. En seguimiento de instrucciones, supera a GLM 5.2,
00:01:07de 79.8 a 73.3. Pero en Terminal Bench, donde los agentes actúan y hacen trabajo real, sale muy mal parado
00:01:14con un 63.8 frente al 82.7. Así que es bueno siguiendo órdenes, pero mucho más débil resolviendo cosas por sí solo.
00:01:21Sin embargo, es un gran punto de partida si tu intención es hacer un ajuste fino. Bajo el capó, es una mezcla de
00:01:27expertos. Así que hay 975 mil millones de parámetros en total, pero cada capa contiene 256 expertos únicos y cada token
00:01:35solo se envía a seis de ellos, lo que significa que solo unos 41 mil millones de parámetros están haciendo trabajo en
00:01:41ningún momento dado. También es multimodal. Así que las imágenes, el texto y el audio entran. Y la forma en que lo hace es muy
00:01:47diferente a cualquier modelo que hayas visto antes. Normalmente, cuando un modelo maneja audio, por ejemplo,
00:01:52hay un modelo de voz separado frente al modelo de lenguaje que transcribe el texto y luego
00:01:56pasa esa transcripción al modelo de lenguaje. Las imágenes pueden funcionar de la misma manera. Un codificador de visión analiza
00:02:02la imagen y luego crea una descripción para ella y se la pasa al modelo de lenguaje.
00:02:07Y por supuesto, hacer esto significa que habrá alguna forma de pérdida de datos en el camino.
00:02:11Inkling no hace nada de eso. El audio entra directamente como un espectrograma, por lo que las bandas de frecuencia brutas del
00:02:16sonido se dividen en fragmentos. Las imágenes también entran como parches de 40 por 40 píxeles. Ambos caen directamente en el
00:02:23mismo espacio donde viven los tokens de texto y el modelo los procesa todos juntos. Así que nada se reduce
00:02:28a texto. Por lo tanto, teóricamente debería haber mucha menos pérdida de datos y compresión al procesar
00:02:35cosas como audio y video específicamente con el modelo Inkling. Y de hecho, en comparación con la mayoría
00:02:40de los modelos generalistas que no admiten audio sin procesar en absoluto, Inkling destaca claramente. Ahora bien, si
00:02:46deberías hacer un ajuste fino se reduce a tus objetivos específicos. La regla general es que
00:02:50el ajuste fino le enseña a un modelo cómo responder, no qué saber. Por ejemplo, el tono de voz o salidas estructuradas
00:02:57rígidas donde se necesitarían miles de ejemplos en el contexto para guiar la respuesta del modelo
00:03:02porque pasar miles de ejemplos mediante un aviso (prompt) sería simplemente poco práctico. También el costo y la latencia
00:03:08de la destilación, donde realizar una tarea específica con un modelo general sería considerablemente más caro
00:03:13que ajustar un modelo más pequeño. Básicamente, si hay alguna situación en la que necesites miles de
00:03:18ejemplos para obtener un resultado decente, eso podría beneficiarse del ajuste fino. Pero si necesitas que el modelo sepa
00:03:23cosas que no sabe, entonces no hagas un ajuste fino. De hecho, hay un documento muy citado que compara la recuperación
00:03:28frente al ajuste fino y la recuperación gana consistentemente. Y si quieres un mejor razonamiento, el ajuste fino puede
00:03:34empeorarlo porque degrada la cadena de pensamiento del modelo. Y curiosamente, los modelos más pequeños
00:03:40sufren más. Pero específicamente para trabajos especializados, los resultados del ajuste fino pueden ser excelentes. Si tomamos a
00:03:46Harvey, que crea herramientas de IA para firmas de abogados, entrenaron un modelo pequeño para extraer citas de documentos legales.
00:03:52Midieron su F1, que es una métrica utilizada para evaluar el rendimiento de un modelo de clasificación. Y el ajuste
00:03:58fino los llevó de 0.56 a 0.68. Y cara a cara contra GPT 4o, el modelo más pequeño ganó o empató el 93%
00:04:07de las veces. E incluso corrió más rápido. Thinking Machines incluso muestra una demostración obligando a Inkling a no
00:04:12usar nunca la letra E, donde literalmente puedes pedirle que se ajuste a sí mismo a través de Tinker. Luego procede a
00:04:18crear el conjunto de datos de entrenamiento y puede ejecutar todo el proceso de ajuste fino de forma totalmente automática. Y
00:04:24el resultado de esto es un modelo que tiene una fobia severa a la letra épsilon y de alguna manera las respuestas aún tienen sentido.
00:04:29Pero aquí no estás reentrenando todo el modelo. En realidad estás usando algo llamado LoRa,
00:04:32que significa adaptación de bajo rango (low-rank adaptation). En lugar de entrenar todo el modelo, LoRa congela los pesos originales
00:04:38e inyecta matrices más pequeñas y ligeras para capturar nuevos datos específicos. Esto proporciona ventajas de
00:04:44costo y velocidad para el post-entrenamiento en comparación con ajustar un modelo completo, lo que probablemente sería
00:04:49poco práctico. Ahora bien, Tinker ya admite varios modelos abiertos como Qwen, Kimi, DeepSeek, NemoTron de Nvidia
00:04:55y GPT OSS de OpenAI. E Inkling es uno de los más caros, ¿entonces por qué molestarse con él?
00:05:02Bueno, hay dos razones y ya las hemos cubierto un poco. La primera es el audio. De todos los
00:05:06modelos de la plataforma, Inkling es el único que acepta audio. Muchos admiten imágenes,
00:05:11Kimi y la mayoría de los modelos Qwen manejan la visión bien, pero ninguno maneja realmente sonido
00:05:16crudo. Y también han lanzado tres recetas de guías (cookbooks) para acompañarlo, como el reconocimiento de voz
00:05:20y la clasificación de estilo de habla. Así que el modelo puede decirte cómo se dijo algo, no solo qué se
00:05:26dijo. Y también hay un ejemplo médico entrenado con recetas dictadas, enseñándole nombres de medicamentos que
00:05:31la mayoría de los modelos destrozarían. La segunda es el esfuerzo de pensamiento. Inkling te permite configurar qué tan duro
00:05:36piensa con un número del cero al uno. La mayoría de los modelos te dan un interruptor de dos o tres configuraciones. GPT OSS
00:05:42te da bajo, medio y alto, por ejemplo, pero Inkling te da un control deslizante completo. Así que la gran
00:05:47pregunta es: ¿deberías usarlo realmente? Bueno, si quieres que un modelo funcione tal como viene, entonces este probablemente
00:05:52no sea el caso. Y ellos mismos son explícitos al respecto. Pero si tienes una tarea especializada de alto
00:05:56volumen, algunos datos etiquetados reales y una forma de calificar la salida, ajustar un modelo abierto pequeño es una de las
00:06:02cosas más subestimadas que puedes hacer ahora mismo. Y con plataformas como Tinker, es mucho más fácil.
00:06:07Y si Inkling es el que debes probar, se reduce realmente a lo que le estás suministrando.
00:06:11Si entra audio, Inkling es una opción sólida y ningún otro modelo en Tinker acepta audio sin
00:06:16procesar en este momento. Y si buscas el mejor modelo generalista abierto actual, acabamos de hacer un
00:06:21video sobre Kimi K3 que puedes ver aquí, y ha obtenido resultados increíble. Pero por lo demás,
00:06:26gracias por ver. He sido Warren de BetterStack y nos vemos en el próximo.