Inkling: Este modelo de peso abierto quiere ser ajustado

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Thinking Machines, la empresa emergente de 12 mil millones de la ex-CTO de OpenAI Mira Moretti, acaba de lanzar su
00:00:05primer modelo. Tiene 975 mil millones de parámetros, su licencia es Apache 2.0 y los pesos están todos
00:00:12en Hugging Face para que cualquiera los descargue. Y aunque no compite con los laboratorios de vanguardia
00:00:17como Anthropic, su objetivo real es ser ajustado específicamente con su propia plataforma,
00:00:22Tinker. Así que si necesitas un modelo entrenado para una tarea muy específica,
00:00:25entonces este puede ser exactamente lo que buscas. Hoy veremos por qué querrías usar
00:00:29este modelo específicamente y todas las razones por las que querrías ajustarlo. Y hay una forma súper
00:00:35interesante en la que este modelo procesa audio y video, que nunca antes había visto. Así que quédate
00:00:40porque también cubriremos eso en este video. Y cubrimos temas de IA constantemente en
00:00:44este canal. Así que si quieres mantenerte al día, suscríbete a BetterStack.
00:00:52Thinking Machines es muy sincera sobre el hecho de que su nuevo modelo no es tan fuerte como prácticamente
00:00:57cualquier modelo general en el mercado. Y lo dicen en su publicación de lanzamiento. Así que solo están gestionando
00:01:01expectativas y puedes ver por qué en las pruebas comparativas. En seguimiento de instrucciones, supera a GLM 5.2,
00:01:07de 79.8 a 73.3. Pero en Terminal Bench, donde los agentes actúan y hacen trabajo real, sale muy mal parado
00:01:14con un 63.8 frente al 82.7. Así que es bueno siguiendo órdenes, pero mucho más débil resolviendo cosas por sí solo.
00:01:21Sin embargo, es un gran punto de partida si tu intención es hacer un ajuste fino. Bajo el capó, es una mezcla de
00:01:27expertos. Así que hay 975 mil millones de parámetros en total, pero cada capa contiene 256 expertos únicos y cada token
00:01:35solo se envía a seis de ellos, lo que significa que solo unos 41 mil millones de parámetros están haciendo trabajo en
00:01:41ningún momento dado. También es multimodal. Así que las imágenes, el texto y el audio entran. Y la forma en que lo hace es muy
00:01:47diferente a cualquier modelo que hayas visto antes. Normalmente, cuando un modelo maneja audio, por ejemplo,
00:01:52hay un modelo de voz separado frente al modelo de lenguaje que transcribe el texto y luego
00:01:56pasa esa transcripción al modelo de lenguaje. Las imágenes pueden funcionar de la misma manera. Un codificador de visión analiza
00:02:02la imagen y luego crea una descripción para ella y se la pasa al modelo de lenguaje.
00:02:07Y por supuesto, hacer esto significa que habrá alguna forma de pérdida de datos en el camino.
00:02:11Inkling no hace nada de eso. El audio entra directamente como un espectrograma, por lo que las bandas de frecuencia brutas del
00:02:16sonido se dividen en fragmentos. Las imágenes también entran como parches de 40 por 40 píxeles. Ambos caen directamente en el
00:02:23mismo espacio donde viven los tokens de texto y el modelo los procesa todos juntos. Así que nada se reduce
00:02:28a texto. Por lo tanto, teóricamente debería haber mucha menos pérdida de datos y compresión al procesar
00:02:35cosas como audio y video específicamente con el modelo Inkling. Y de hecho, en comparación con la mayoría
00:02:40de los modelos generalistas que no admiten audio sin procesar en absoluto, Inkling destaca claramente. Ahora bien, si
00:02:46deberías hacer un ajuste fino se reduce a tus objetivos específicos. La regla general es que
00:02:50el ajuste fino le enseña a un modelo cómo responder, no qué saber. Por ejemplo, el tono de voz o salidas estructuradas
00:02:57rígidas donde se necesitarían miles de ejemplos en el contexto para guiar la respuesta del modelo
00:03:02porque pasar miles de ejemplos mediante un aviso (prompt) sería simplemente poco práctico. También el costo y la latencia
00:03:08de la destilación, donde realizar una tarea específica con un modelo general sería considerablemente más caro
00:03:13que ajustar un modelo más pequeño. Básicamente, si hay alguna situación en la que necesites miles de
00:03:18ejemplos para obtener un resultado decente, eso podría beneficiarse del ajuste fino. Pero si necesitas que el modelo sepa
00:03:23cosas que no sabe, entonces no hagas un ajuste fino. De hecho, hay un documento muy citado que compara la recuperación
00:03:28frente al ajuste fino y la recuperación gana consistentemente. Y si quieres un mejor razonamiento, el ajuste fino puede
00:03:34empeorarlo porque degrada la cadena de pensamiento del modelo. Y curiosamente, los modelos más pequeños
00:03:40sufren más. Pero específicamente para trabajos especializados, los resultados del ajuste fino pueden ser excelentes. Si tomamos a
00:03:46Harvey, que crea herramientas de IA para firmas de abogados, entrenaron un modelo pequeño para extraer citas de documentos legales.
00:03:52Midieron su F1, que es una métrica utilizada para evaluar el rendimiento de un modelo de clasificación. Y el ajuste
00:03:58fino los llevó de 0.56 a 0.68. Y cara a cara contra GPT 4o, el modelo más pequeño ganó o empató el 93%
00:04:07de las veces. E incluso corrió más rápido. Thinking Machines incluso muestra una demostración obligando a Inkling a no
00:04:12usar nunca la letra E, donde literalmente puedes pedirle que se ajuste a sí mismo a través de Tinker. Luego procede a
00:04:18crear el conjunto de datos de entrenamiento y puede ejecutar todo el proceso de ajuste fino de forma totalmente automática. Y
00:04:24el resultado de esto es un modelo que tiene una fobia severa a la letra épsilon y de alguna manera las respuestas aún tienen sentido.
00:04:29Pero aquí no estás reentrenando todo el modelo. En realidad estás usando algo llamado LoRa,
00:04:32que significa adaptación de bajo rango (low-rank adaptation). En lugar de entrenar todo el modelo, LoRa congela los pesos originales
00:04:38e inyecta matrices más pequeñas y ligeras para capturar nuevos datos específicos. Esto proporciona ventajas de
00:04:44costo y velocidad para el post-entrenamiento en comparación con ajustar un modelo completo, lo que probablemente sería
00:04:49poco práctico. Ahora bien, Tinker ya admite varios modelos abiertos como Qwen, Kimi, DeepSeek, NemoTron de Nvidia
00:04:55y GPT OSS de OpenAI. E Inkling es uno de los más caros, ¿entonces por qué molestarse con él?
00:05:02Bueno, hay dos razones y ya las hemos cubierto un poco. La primera es el audio. De todos los
00:05:06modelos de la plataforma, Inkling es el único que acepta audio. Muchos admiten imágenes,
00:05:11Kimi y la mayoría de los modelos Qwen manejan la visión bien, pero ninguno maneja realmente sonido
00:05:16crudo. Y también han lanzado tres recetas de guías (cookbooks) para acompañarlo, como el reconocimiento de voz
00:05:20y la clasificación de estilo de habla. Así que el modelo puede decirte cómo se dijo algo, no solo qué se
00:05:26dijo. Y también hay un ejemplo médico entrenado con recetas dictadas, enseñándole nombres de medicamentos que
00:05:31la mayoría de los modelos destrozarían. La segunda es el esfuerzo de pensamiento. Inkling te permite configurar qué tan duro
00:05:36piensa con un número del cero al uno. La mayoría de los modelos te dan un interruptor de dos o tres configuraciones. GPT OSS
00:05:42te da bajo, medio y alto, por ejemplo, pero Inkling te da un control deslizante completo. Así que la gran
00:05:47pregunta es: ¿deberías usarlo realmente? Bueno, si quieres que un modelo funcione tal como viene, entonces este probablemente
00:05:52no sea el caso. Y ellos mismos son explícitos al respecto. Pero si tienes una tarea especializada de alto
00:05:56volumen, algunos datos etiquetados reales y una forma de calificar la salida, ajustar un modelo abierto pequeño es una de las
00:06:02cosas más subestimadas que puedes hacer ahora mismo. Y con plataformas como Tinker, es mucho más fácil.
00:06:07Y si Inkling es el que debes probar, se reduce realmente a lo que le estás suministrando.
00:06:11Si entra audio, Inkling es una opción sólida y ningún otro modelo en Tinker acepta audio sin
00:06:16procesar en este momento. Y si buscas el mejor modelo generalista abierto actual, acabamos de hacer un
00:06:21video sobre Kimi K3 que puedes ver aquí, y ha obtenido resultados increíble. Pero por lo demás,
00:06:26gracias por ver. He sido Warren de BetterStack y nos vemos en el próximo.

핵심 요약

Inkling ofrece procesamiento multimodal nativo de audio y video junto con ajuste fino optimizado mediante Tinker para tareas especializadas de alto volumen.

하이라이트

  • Thinking Machines lanza su primer modelo, Inkling, con 975 mil millones de parámetros y licencia Apache 2.0 en Hugging Face.

  • Inkling procesa audio como espectrogramas e imágenes como parches de 40 por 40 píxeles sin transcripción intermedia previa.

  • El rendimiento en Terminal Bench alcanza el 63.8 por ciento, frente al 82.7 por ciento de otros modelos generales en tareas autónomas.

  • El ajuste fino mediante LoRa utiliza matrices ligeras para congelar pesos originales y reducir costos operativos.

  • La plataforma Tinker permite configurar el esfuerzo de pensamiento con una escala numérica precisa de cero a uno.

타임라인

Lanzamiento y arquitectura base de Inkling

  • El modelo cuenta con 975 mil millones de parámetros totales bajo una licencia Apache 2.0.
  • El seguimiento de instrucciones supera a GLM 5.2 con un puntaje de 79.8 frente a 73.3.
  • La ejecución en Terminal Bench se sitúa en 63.8 por ciento, lo que muestra debilidad frente a agentes autónomos.

Thinking Machines presenta un modelo inicial diseñado específicamente para recibir ajustes mediante la plataforma Tinker. Las pruebas comparativas demuestran un rendimiento sólido al seguir directrices específicas, aunque exhibe limitaciones operativas en la resolución de tareas autónomas complejas dentro de entornos terminales.

Procesamiento multimodal sin pérdida de datos

  • La arquitectura mezcla expertos donde cada token se dirige a seis de los 256 expertos únicos por capa.
  • El audio ingresa directamente como bandas de frecuencia brutas en forma de espectrograma.
  • Las imágenes entran como parches de 40 por 40 píxeles directamente en el espacio de tokens.

El sistema omite los codificadores externos tradicionales que convierten audio o video en transcripciones de texto intermedias. Esta integración directa en el mismo espacio vectorial reduce drásticamente la pérdida de información y optimiza el rendimiento frente a modelos generalistas convencionales que carecen de soporte para sonido crudo.

Criterios y métodos para el ajuste fino

  • El ajuste fino modifica la respuesta del modelo y no añade conocimiento factual nuevo.
  • La recuperación de información supera sistemáticamente al ajuste fino cuando se requiere conocimiento externo.
  • El modelo especializado de Harvey mejora su métrica F1 de 0.56 a 0.68 en extracción de citas legales.

La aplicación de técnicas de post-entrenamiento resulta útil para definir tonos de voz o salidas estructuradas rígidas que requerirían miles de ejemplos en el contexto. Sin embargo, alterar el modelo base puede degradar las cadenas de razonamiento, por lo que se recomienda únicamente en tareas especializadas donde el rendimiento operativo supera la necesidad de conocimiento bruto.

Adaptación LoRa y ventajas operativas en Tinker

  • La adaptación de bajo rango (LoRa) congela los pesos originales e inyecta matrices ligeras.
  • Inkling destaca como el único modelo en Tinker que procesa audio nativo mediante tres guías de recetas específicas.
  • El control deslizante de esfuerzo de pensamiento permite regular el procesamiento con valores numéricos entre cero y uno.

La plataforma Tinker automatiza la creación de conjuntos de datos y la ejecución de LoRa para evitar el reentrenamiento completo del sistema. Inkling justifica su costo superior frente a alternativas abiertas gracias a su capacidad exclusiva para manejar audio sin procesar y ofrecer un control granular sobre la profundidad del razonamiento analítico.

커뮤니티 글

모든 글 보기