Kimi K3 está al nivel de Fable... (deberían estar preocupados)

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Kimi K3 ya está aquí y, sinceramente, es bastante impactante. No solo alcanzó a Opus y
00:00:04GPT 5.5, también alcanzó a Fable y a GPT 5.6. Los modelos abiertos no están tan atrás como pensamos
00:00:10al principio. Vamos a echarle un vistazo. Empecemos con el anuncio. Kimi K3 es un modelo de 2,8 billones
00:00:19de parámetros construido sobre Kimi Delta Retention y Attention Residuals con capacidades de visión
00:00:24nativas y una ventana de contexto de 1 millón de tokens. Es el primer modelo abierto de 3 billones de clase mundial
00:00:29diseñado para inteligencia de vanguardia en codificación de largo alcance, trabajo intelectual y razonamiento.
00:00:34En todos los puntos de referencia que muestran en este blog, Kimi K3 está justo detrás de Fable
00:00:38y GPT 5.6 Soul, o incluso superándolos en algunas otras áreas. Es un salto tan loco
00:00:43que no creo que mucha gente lo haya predicho. Obviamente, esto es según su propio punto de referencia, así que veamos
00:00:47la inteligencia artificial y los de terceros, y me complace decir que los resultados prácticamente
00:00:52coinciden. En este benchmark, podemos ver que alrededor del 80% de los que ven esto no están suscritos,
00:00:56así que adelante, haz clic en ese botón de suscripción si quieres mantenerte al día con todo lo relacionado con el desarrollo de software
00:01:00y la IA. Pasando a los benchmarks reales, empezando con el índice de codificación, obtiene una puntuación de 76,2 en
00:01:06esto, que es 0,3 puntos detrás de Fable 5 y es ligeramente más que GPT 5,5, más que Opus 4,8 y
00:01:12más que GPT 5.6 Luna, y solo pierde ligeramente ante GPT 5.6 Soul y Terra. Mira este salto que
00:01:19han hecho desde su último modelo. Si luego echamos un vistazo al índice de agentes, la historia es la misma.
00:01:23Aquí es tercero, perdiendo solo ante Fable y Soul, pero eso sigue siendo seriamente impresionante, y ya estás
00:01:29acostumbrado a esto a estas alturas, pero es exactamente lo mismo en el índice de inteligencia también. Así que incluso los
00:01:32benchmarks de terceros confirman que este modelo es increíble. Lamentablemente, aún no tenemos los resultados de SWE profundo al momento de
00:01:38grabar esto, pero si echamos un vistazo a nuestros propios benchmarks, se puede ver que volvió a quedar tercero.
00:01:42Este modelo simplemente parece demasiado bueno para ser verdad. Los únicos aspectos negativos que puedo encontrar con este modelo es
00:01:46que es un poco caro. A menos que tengas una supercomputadora en tu casa, no creo que
00:01:50vayas a ejecutar este localmente, así que si lo usas a través de la API, en realidad tiene un precio de 3 dólares por
00:01:54un millón de tokens de entrada y 15 dólares por un millón de tokens de salida. Este es un gran salto desde Kimi K 2.6
00:02:00y tiene aproximadamente el mismo precio que Sonic 5 cuando ese descuento desaparece, pero es más barato que Fable 5,
00:02:06Opus y GPT 5.6. El precio de la API tampoco lo es todo, así que si lo vemos en la práctica con el costo
00:02:12por tarea aquí, en realidad es similar a GPT 5.6 Soul y es aproximadamente la mitad del precio de Opus 4.8 y por
00:02:17supuesto es más barato que Fable y Sonic 5. Por lo tanto, es competitivo con esos modelos cerrados de frontera, pero
00:02:22para aquellos de ustedes que aman los modelos abiertos porque son un poco más baratos, este modelo probablemente
00:02:26no sea para ustedes. GLM 5.2 es la segunda mejor opción aquí y cuesta la mitad. Tampoco es el
00:02:31modelo más rápido, pero para mí parece bastante competitivo para este nivel de inteligencia.
00:02:36En general, honestamente es bastante difícil decir algo negativo sobre este modelo, así que saltemos
00:02:40y veamos algunas de mis pruebas locales. La primera prueba a la que sometí estos modelos fue crearme un
00:02:44juego de carreras de Fórmula 1 completo en 3.js, todo en un único index.html, y este es Kimi K3 funcionando
00:02:50a través de Open Router. También lo probé en Kimi Code, esa CLI, solo para ver si el arnés cambia
00:02:56algo. Puedes ver aquí abajo que pensó durante 14 minutos antes de comenzar y, en general, le tomó
00:03:0035 minutos crear esta aplicación web en 3.js y costó 1,24 dólares en tokens de API. Y los resultados que obtuve son
00:03:06bastante impresionantes. Obviamente, esto no tiene acceso a ningún activo externo, así que está haciendo todo lo posible para crear
00:03:11estos modelos. Pero la pista funciona. Tenemos nuestros corredores de IA y parecen ser capaces de dar la vuelta a la
00:03:16pista. Puedes ver que las barreras funcionan, así que no puedo atravesarlas. Nuestra posición se está actualizando.
00:03:21Tenemos nuestro mapa actualizándose. Tenemos nuestro tiempo actual actualizándose, así como las vueltas también. He hecho
00:03:25una vuelta completa y confirmo que todo eso funciona. Así que es un resultado bastante bueno para lo que nos dio Kimi K3.
00:03:30Como dije, también probé los diferentes arneses. Así que este es Kimi K3, pero en Kimi Code. Y este
00:03:35diría que se ve un poco mejor. Hizo un mejor trabajo con los activos, aunque eso es solo una
00:03:39guía de estilo. Hay un poco de retraso allí con esos modelos, pero el manejo es un poco mejor.
00:03:43Los controles siguen invertidos y, de hecho, parece ser un patrón en muchas de estas aplicaciones de 3.js
00:03:48por alguna razón. Pero, de nuevo, todo esto se maneja muy bien y tiene características como que irse
00:03:52de la pista me va a ralentizar. Y sí, también ha hecho un trabajo bastante impresionante. Pero ahora comparemos
00:03:57esto con los modelos Frontier. Tenemos Fable 5 aquí en Claude Code, que estaba al máximo, y tomó
00:04:0144 minutos para hacer mi aplicación 3.js. Luego también tenemos GPT 5.6 Sol al máximo también. Y este
00:04:07tomó 18 minutos. Este es el resultado que me dio Fable. Así que tenemos Fable GP aquí. Y diría
00:04:12que se ve un poco mejor quizás. Pero de nuevo, todo esto es solo una elección estilística. Y los controles
00:04:17no están realmente invertidos en este. También hay un poco de tambaleo de la cámara, que creo que es un buen
00:04:22estilo. Y de nuevo, todo parece estar funcionando en este como en todos los demás. He probado haciendo
00:04:26una vuelta completa de esto, tan difícil como es. También tenemos algunas colisiones aquí, como pueden ver. Pero sí,
00:04:31todo parece estar funcionando y es bastante comparable a lo que nos dio Kimi K3. Es una historia similar
00:04:35con GPT 5.6 Sol. Como pueden ver, tenemos un juego funcional aquí. Aunque notaré que la carretera aquí
00:04:40es césped. En realidad no renderizó eso. Y todo parece estar funcionando. Los controles
00:04:44están invertidos en este también. Y también tenemos algunos activos al revés. No sé por qué a estos modelos
00:04:48parece gustarles hacer eso. El único que no lo hizo fue Fable. Y también la pista aquí se vuelve un poco
00:04:53desordenada. Así que este es en realidad el único que no me hizo una pista funcional. Para añadir una comparación final,
00:04:57también comprobé lo que me daría GLM 5.2, ya que es el siguiente mejor modelo abierto. Y este
00:05:02pensó durante 5 minutos y 58 segundos. Aunque no lo terminó en un solo prompt. En realidad hubo
00:05:07algunos errores. Así que tuve que volver con otro prompt. Incluso entonces, cuando finalmente hice que el juego funcionara,
00:05:11pueden ver que hay muchos errores en este. En primer lugar, no empezamos de la manera correcta en la pista.
00:05:15Y no hay realmente una pista para empezar. Y también se ve mucho peor que los otros.
00:05:20Así que hay un pequeño paso adelante cuando subimos a Kimi K3. Pasando a la prueba 2. Pedí un
00:05:25panel de gestión de finanzas personales. Esto va a construir la aplicación full-stack con un front-end
00:05:29y un back-end. Lo único que dije que no quería es autenticación. Y también le pedí que sembrara algunos datos.
00:05:33Hice esto de nuevo en Open Router con K3. Y luego también en Kimi Code. Así que este está en Open
00:05:38Router. Y puedes ver que en total tomó 56 minutos hacerme la aplicación. Y también me costó
00:05:431,30 dólares. Este es el resultado que me dieron. Y honestamente, no puedo quejarme de esto.
00:05:48Es exactamente lo que pedí. Es un panel de gestión de finanzas personales. Diría que se ve
00:05:53realmente bien también. Y tenemos todas las características como las páginas adicionales aquí. Y he
00:05:57comprobado la adición de fondos y el envío de dinero. Todo funciona. Así que ha hecho un muy buen trabajo. Ahora también estoy
00:06:01siempre curioso por ver qué herramientas usó para realizar la tarea. Porque en realidad no le doy ninguna
00:06:05instrucción sobre qué stack usar en el prompt. Puedes ver que para el front-end aquí usó
00:06:09React y React DOM. En realidad no usó ningún enrutador ni nada por el estilo. De hecho, construyó su
00:06:12propio sistema de vistas. Así que probablemente hubiera preferido que usara algo como React Router,
00:06:16TanStack o Next.js. Y luego, en el back-end, también construyó su propio servidor. Creo que
00:06:21este está usando Express.js como podemos ver aquí abajo. Pero luego también construyó su base de datos usando solo un
00:06:26archivo JSON. No usó ninguna SQLite ni nada por el estilo, o Drizzle, que probablemente me habría gustado
00:06:31ver si íbamos a escalar esta aplicación en
00:06:35eso en el prompt. Pero siempre me gusta ver qué elegirán por defecto. Este es un
00:06:38resultado que obtuve usando K3 a través de Kimi Code. Y pueden ver que este es un poco más simple.
00:06:43Solo tiene una página y no tiene nuestra barra lateral. De nuevo, todas las funciones funcionan y tiene
00:06:47un aspecto bastante similar al que obtuvimos de Open Router. Sin embargo, mirando el código,
00:06:51prefiero lo que nos dio Kimi Code aquí con K3. Tiene un front end bastante similar donde
00:06:55solo usa react y ninguna biblioteca de enrutamiento. Pero el servidor sí usó una base de datos. Pueden ver
00:06:59que está construido y expresado aquí. De hecho, tenemos una base de datos de finanzas y está usando node
00:07:04SQLite. Ahora, si comparan esto nuevamente con los modelos de frontera, este es Fable 5 en Claude Code.
00:07:08Pueden ver que trabajó durante 56 minutos con ese esfuerzo máximo. Y luego también tengo GPT 5.6 Soul max
00:07:13donde pensó durante 31 minutos para crear la aplicación. Esto es lo que nos dio Fable 5 y
00:07:17honestamente es un diseño bastante similar. Quiero decir, no hay mucho más que realmente se pueda hacer con un
00:07:21panel de finanzas personales. Y todas las funciones funcionan aquí. De hecho, ha optado por un poco de
00:07:25estilo diferente para las fuentes, lo que he visto que Fable y Opus hacen mucho últimamente. Parece que
00:07:29lo están reentrenando para alejarse de algunos de esos aspectos anteriores de IA que tenían y están integrando un nuevo
00:07:34aspecto de IA. Y este parece ser el que están eligiendo. Diría que estos gráficos son en realidad un poco
00:07:38más inútiles que lo que obtuvimos de Kimi K3. Pero, en general, se ve bastante similar y funciona
00:07:43básicamente igual. Incluso el código es muy parecido. Pueden ver que eligió React para el front
00:07:47end y tampoco usó un router. Escribió el suyo. Y luego también en la base de datos
00:07:51usó correctamente una base de datos. Así que estamos usando Node SQL en este también. Y para el
00:07:57servidor real, solo está ejecutando Express 2. Pasando a GPT 5.6 Soul, sin embargo. Este es un poco
00:08:02extraño. Definitivamente es mi diseño favorito de todos. Y de nuevo, todas las funciones
00:08:06funcionan. Avísenme si están de acuerdo en que este es el mejor diseño. Pero la parte extraña está en el código.
00:08:11Este es definitivamente el código de aplicación más completo que hemos visto en estos ejemplos. De hecho,
00:08:15construyó una aplicación NextJS completa y usó Drizzle tal como yo lo haría. Y usó NextJS
00:08:20también para el front end, así como para el servidor. Pero la parte que me parece un poco extraña es que
00:08:24eligió alojarlo en Cloudflare, lo cual no es extraño por sí mismo, pero también lo usó para Next. Y no es
00:08:29necesariamente que no lo recomendaría. Solo creo que está un poco sin probar. Y es bastante
00:08:33nuevo, lo que demuestra que realmente están impulsando a GPT 5.6 Soul para usar esto. Y solo puedo especular
00:08:38sobre por qué, pero parece que podría ser porque así es como funcionan realmente los sitios de ChatGPT. Pueden
00:08:42ver aquí que en realidad decidió alojar esto para mí en esa función de sitio de ChatGPT, aunque no le pedí
00:08:47que lo hiciera. Personalmente, no me gusta mucho eso cuando estoy programando una aplicación. No quiero
00:08:50que lo aloje por mí. Preferiría manejar todo eso yo mismo. Pero podría haber preguntado eso en el
00:08:54prompt. Preferiría tener que pedirle que lo aloje, en lugar de al revés.
00:08:58El resultado final que tengo aquí es GLM 5.2, y este ha hecho algo bastante similar a lo que Kimi K3
00:09:04hizo en Kimi Code, donde solo construyó esta página única. Pero de nuevo, todas las funciones funcionan y sí
00:09:08pienso que este diseño es bastante agradable. GLM 5.2 en realidad tardó 15 minutos en hacer esto y pueden ver que costó
00:09:13un dólar y 11 centavos. En cuanto al código real, GLM 5.2 también eligió seguir la ruta de Next.js
00:09:19lo cual sí me gusta. Pero construyó su propio almacén en lugar de usar una base de datos. Así que todo esto
00:09:24está solo en la memoria en JavaScript. Así que por mi rápida prueba allí, creo que Kimi K3 sí destaca con Fable
00:09:29y GPT 5.6 Soul y cumple con las expectativas que le dan los benchmarks. Y honestamente, se está
00:09:33haciendo bastante difícil mostrarles cuán poderosos son estos modelos en una demostración en video. Tienden a
00:09:38tener que usarlos durante el transcurso de una semana en una base de código de producción para ver realmente la calidad
00:09:42del código. Si tienen alguna idea para pruebas que pueda mostrar realmente en un video que
00:09:46someta a estos modelos a una prueba difícil, háganmelo saber en los comentarios a continuación. También quiero
00:09:50mostrar algunos de los ejemplos que tenían en su blog técnico. Pueden ver que Kimi
00:09:53K3 construyó este juego aquí, pero tuvo otra herramienta para generar realmente estos activos, así que el vaquero y
00:09:58el caballo no fueron generados por K3. Fueron hechos en otra parte. Pueden ver que ha hecho un muy buen trabajo
00:10:03de esto en 3GS. Y la otra cosa que es una locura es este diseño de chip. Pueden ver que, como una prueba temprana
00:10:08de concepto, Kimi K3 diseñó un chip para servir a un modelo nano construido sobre su propia arquitectura. En un único
00:10:13funcionamiento autónomo de 48 horas, K3 construyó, optimizó y verificó el chip usando herramientas de código abierto. Así que, con suerte,
00:10:19han visto que este modelo es absolutamente increíble y definitivamente será un golpe para
00:10:23estos laboratorios cerrados de frontera. O al menos lo será cuando realmente lancen los pesos. No los han
00:10:27lanzado todavía, pero planean hacerlo. Así que espero que los veamos muy pronto. ¿Qué piensan
00:10:32sobre esto? ¿Esperaban que un laboratorio chino se pusiera al día tan rápido? ¿Y les atrae este modelo?
00:10:36Déjenmelo saber en los comentarios a continuación. Mientras están allí, suscríbanse. Y como siempre, nos vemos en el próximo.

핵심 요약

Kimi K3 se posiciona como un modelo abierto de 3 billones de parámetros capaz de competir directamente en razonamiento y codificación con modelos cerrados como Fable 5 y GPT 5.6 Soul.

하이라이트

  • Kimi K3 presenta 2,8 billones de parámetros y una ventana de contexto de 1 millón de tokens.

  • En índices de codificación, Kimi K3 alcanza una puntuación de 76,2, situándose a solo 0,3 puntos de Fable 5.

  • La ejecución de una aplicación 3.js completa mediante la API de Kimi K3 tiene un coste de 1,24 dólares.

  • El coste de la API de Kimi K3 es de 3 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida.

  • Kimi K3 diseñó, optimizó y verificó un chip para un modelo nano utilizando herramientas de código abierto en un ciclo autónomo de 48 horas.

타임라인

Especificaciones y rendimiento de Kimi K3

  • Kimi K3 utiliza arquitectura Kimi Delta Retention y Attention Residuals.
  • Los benchmarks de terceros sitúan a Kimi K3 consistentemente entre los tres mejores modelos en codificación y agentes.
  • El modelo presenta un precio competitivo frente a los modelos frontera, siendo más barato que Fable 5, Opus y GPT 5.6.

El modelo integra capacidades de visión nativas y una vasta ventana de contexto de 1 millón de tokens. Aunque el precio de la API es superior al de modelos abiertos más simples, su rendimiento en tareas complejas justifica su posicionamiento en el nivel de inteligencia de los modelos de frontera cerrados.

Pruebas prácticas: Desarrollo de software

  • La generación de un juego de carreras en 3.js tomó 35 minutos y costó 1,24 dólares en tokens.
  • En la creación de un panel de finanzas personales, Kimi K3 produjo código funcional, aunque con estructuras de enrutamiento propias en lugar de librerías estándar.
  • Frente a modelos como Fable 5 y GPT 5.6, Kimi K3 entrega resultados comparables en funcionalidad y diseño.

Las pruebas de desarrollo revelan que Kimi K3 es capaz de construir aplicaciones completas desde cero, manejando lógica de front-end y back-end. A pesar de ligeras variaciones en la elección de librerías como React Router o bases de datos SQLite frente a alternativas, la calidad del código generado es altamente competitiva con los estándares actuales de la industria.

Capacidades técnicas avanzadas y disponibilidad

  • Kimi K3 demostró capacidad para diseñar chips de silicio mediante herramientas de código abierto.
  • Los pesos del modelo aún no han sido publicados, pero existe un plan para su lanzamiento futuro.
  • El modelo destaca por su habilidad para integrarse en flujos de trabajo de producción complejos.

Más allá del software, Kimi K3 ha mostrado autonomía en tareas de ingeniería de hardware mediante la gestión de procesos de 48 horas sin intervención. La expectativa del mercado se centra ahora en la liberación de los pesos para permitir su ejecución fuera de la API.

커뮤니티 글

모든 글 보기