Kimi K3 est au niveau de Fable... (ils ont du souci à se faire)

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Kimi K3 est arrivé et honnêtement, il est plutôt bluffant. Il ne s'est pas contenté de rattraper Opus et
00:00:04GPT 5.5, il a rattrapé Fable et GPT 5.6. Les modèles open source ne sont pas aussi en retard qu'on le
00:00:10pensait au début. Regardons ça de plus près. Commençons par l'annonce. Kimi K3 est un modèle à 2,8 billions
00:00:19de paramètres, construit sur l'architecture Kimi Delta Retention and Attention Residuals, doté d'une vision native
00:00:24et d'une fenêtre de contexte d'un million de jetons. C'est le premier modèle open source au monde de la classe des 3 billions
00:00:29conçu pour une intelligence de pointe dans le codage à long terme, le travail intellectuel et le raisonnement.
00:00:34Sur tous les benchmarks présentés dans leur blog, Kimi K3 suit Fable
00:00:38et GPT 5.6 Soul, voire les surpasse dans certains domaines. C'est un bond tellement incroyable
00:00:43que peu de gens l'avaient prédit. Évidemment, il s'agit de leurs propres benchmarks, alors jetons un œil
00:00:47aux benchmarks tiers, et je suis heureux de dire que les résultats correspondent
00:00:52globalement. Sur ce benchmark, on peut voir qu'environ 80 % d'entre vous ne sont pas abonnés,
00:00:56alors n'hésitez pas à cliquer sur ce bouton d'abonnement pour rester au courant de tout ce qui concerne le développement
00:01:00logiciel et l'IA. Passons aux vrais benchmarks, en commençant par l'indice de codage, où il obtient un score de 76,2.
00:01:06C'est 0,3 point derrière Fable 5, et légèrement au-dessus de GPT 5.5, d'Opus 4.8, et
00:01:12de GPT 5.6 Luna, et il ne perd que légèrement face à GPT 5.6 Soul et Terra. Regardez le bond qu'ils
00:01:19ont fait depuis leur dernier modèle. Si on regarde l'indice agentique, c'est la même chose.
00:01:23Il est troisième ici, derrière Fable et Soul, mais c'est toujours très impressionnant. Vous avez
00:01:29l'habitude maintenant, mais c'est exactement la même chose pour l'indice d'intelligence. Donc, même les
00:01:32benchmarks tiers confirment que ce modèle est génial. Malheureusement, nous n'avons pas encore les résultats de deep SWE au moment
00:01:38d'enregistrer ceci, mais d'après nos propres benchmarks, vous pouvez voir qu'il est arrivé troisième à nouveau.
00:01:42Ce modèle semble vraiment trop beau pour être vrai. Les seuls inconvénients que je trouve à ce modèle,
00:01:46c'est qu'il est un peu coûteux. À moins d'avoir un supercalculateur chez vous, je ne pense pas que
00:01:50vous allez le faire tourner localement. Via l'API, il est facturé 3 $ pour un
00:01:54million de jetons en entrée et 15 $ pour un million en sortie. C'est une sacrée avancée par rapport à Kimi K 2.6
00:02:00et c'est à peu près le même prix que Sonic 5 une fois la remise terminée, mais c'est moins cher que Fable 5,
00:02:06Opus et GPT 5.6. Le prix de l'API ne fait pas tout, donc si l'on regarde en pratique avec le coût
00:02:12par tâche, c'est similaire à GPT 5.6 Soul, environ la moitié du prix d'Opus 4.8 et
00:02:17bien sûr, c'est moins cher que Fable et Sonic 5. Il est donc compétitif face aux modèles fermés de pointe, mais
00:02:22pour ceux qui adorent les modèles open source parce qu'ils sont un peu moins chers, ce modèle ne sera
00:02:26probablement pas pour vous. GLM 5.2 est la deuxième meilleure option ici et coûte deux fois moins cher. Il n'est pas non plus le
00:02:31modèle le plus rapide, mais il me semble assez compétitif pour ce niveau d'intelligence.
00:02:36Dans l'ensemble, c'est honnêtement difficile de trouver quelque chose à redire sur ce modèle, alors plongeons
00:02:40directement dans mes tests locaux. Le premier test consistait à créer un
00:02:44jeu de course de Formule 1 complet en 3.js, dans un seul fichier index.html, avec Kimi K3 via
00:02:50Open Router. Je l'ai aussi testé dans Kimi Code, le CLI, juste pour voir si l'outil changeait
00:02:56quoi que ce soit. Vous pouvez voir en bas qu'il a réfléchi pendant 14 minutes avant de commencer, et globalement, il lui a fallu
00:03:0035 minutes pour créer cette application web 3.js, pour un coût de 1,24 $ en jetons API. Et les résultats sont
00:03:06plutôt impressionnants. Évidemment, il n'a accès à aucun asset externe, il fait donc de son mieux pour créer
00:03:11ces modèles. Mais la piste fonctionne. Nos pilotes IA semblent capables de parcourir la
00:03:16piste. Vous pouvez voir que les barrières fonctionnent, je ne peux pas les traverser. Notre position est mise à jour.
00:03:21La carte se met à jour. L'heure actuelle ainsi que les tours se mettent à jour. J'ai effectué
00:03:25un tour complet pour confirmer que tout fonctionne. C'est un très bon résultat de la part de Kimi K3.
00:03:30Comme je l'ai dit, j'ai aussi testé différents outils. Voici Kimi K3 dans Kimi Code. Celui-ci
00:03:35a l'air un peu plus joli. Il a fait un meilleur travail avec les assets, bien que ce ne soit qu'un
00:03:39guide de style. Il y a un peu de lag avec ces modèles, mais la maniabilité est un peu meilleure.
00:03:43Les commandes sont toujours inversées, ce qui semble être une tendance sur ces applications 3.js
00:03:48pour une raison quelconque. Mais encore une fois, tout se manipule très bien, et il y a des fonctionnalités comme le fait que sortir
00:03:52de la piste me ralentit. C'est un travail assez impressionnant. Maintenant, comparons
00:03:57cela aux modèles de pointe. Nous avons Fable 5 dans Claude Code en mode max, et il a fallu
00:04:0144 minutes pour créer mon application 3.js. Nous avons aussi GPT 5.6 Soul en mode max également. Il
00:04:07a pris 18 minutes. Voici le résultat que Fable m'a donné. Nous avons Fable GP ici. Je dirais
00:04:12qu'il est peut-être un peu plus joli. Mais encore une fois, tout cela n'est qu'une question de style. Les commandes
00:04:17ne sont pas inversées ici. Il y a un petit tremblement de caméra que je trouve sympa
00:04:22comme style. Et tout semble fonctionner ici, comme pour les autres. J'ai testé
00:04:26un tour complet, aussi difficile que cela soit. Il y a aussi des collisions, comme vous pouvez le voir. Mais oui,
00:04:31tout semble fonctionner, c'est assez comparable à ce que Kimi K3 nous a donné. C'est une histoire similaire
00:04:35avec GPT 5.6 Soul. Comme vous pouvez le voir, nous avons un jeu qui fonctionne. Cependant, notez que la route ici
00:04:40est faite d'herbe. Il ne l'a pas vraiment rendue. Et tout semble fonctionner. Les commandes
00:04:44sont inversées sur celui-ci aussi. Il y a aussi quelques assets à l'envers. Je ne sais pas pourquoi ces modèles
00:04:48aiment faire ça. Le seul qui ne l'a pas fait, c'est Fable. De plus, la piste devient un peu
00:04:53embrouillée. C'est donc le seul qui n'a pas créé une piste fonctionnelle. Pour une comparaison finale,
00:04:57j'ai aussi vérifié ce que GLM 5.2 me donnerait, car c'est le deuxième meilleur modèle open source. Il
00:05:02a réfléchi pendant 5 minutes et 58 secondes. Bien qu'il n'ait pas fini en une seule invite. Il y avait
00:05:07pas mal de bugs, donc j'ai dû utiliser une autre invite. Même après cela, quand j'ai enfin eu le jeu,
00:05:11on voit qu'il y a beaucoup de bugs. Premièrement, nous ne commençons pas dans le bon sens sur la piste.
00:05:15Et il n'y a pas vraiment de piste au départ. Et ça a l'air beaucoup moins bien que les autres.
00:05:20Il y a donc une progression lorsque l'on passe à Kimi K3. Passons au test 2. J'ai demandé un
00:05:25tableau de bord de gestion des finances personnelles. Cela va construire une application full-stack avec un front-end
00:05:29et un back-end. La seule chose que je ne voulais pas, c'est l'authentification. J'ai aussi demandé d'insérer des données.
00:05:33J'ai refait ce test sur open router avec K3, puis dans Kimi code. Celui-ci est sur open
00:05:38router. Vous pouvez voir qu'il a fallu 56 minutes pour créer l'application, pour un coût
00:05:43de 1,30 $. Voici le résultat. Honnêtement, je ne peux pas me plaindre.
00:05:48C'est exactement ce que j'ai demandé. C'est un tableau de bord de gestion des finances personnelles. Je dirais qu'il a l'air
00:05:53très bien aussi. On a toutes les fonctionnalités, comme les pages supplémentaires. J'ai
00:05:57vérifié l'ajout de fonds et l'envoi d'argent. Tout fonctionne. Très bon travail. Maintenant, je suis
00:06:01toujours curieux de voir quels outils il a utilisés. Parce que je ne donne aucune
00:06:05instruction sur la stack à utiliser dans l'invite. Pour le front-end, il a choisi
00:06:09react et react dom. Il n'a pas utilisé de routeur. Il a construit son
00:06:12propre système de vue. J'aurais préféré qu'il utilise react router,
00:06:16tan stack ou next.js. Pour le back-end, il a aussi construit son propre serveur.
00:06:21Celui-ci utilise express.js, comme on peut le voir ici. Mais il a aussi construit sa base de données avec un
00:06:26fichier JSON. Pas de SQLite, pas de drizzle, ce que j'aurais aimé voir pour
00:06:31faire évoluer l'application. Mais là encore, j'aurais pu le préciser dans l'invite. J'aime voir ce qu'ils choisissent
00:06:35par défaut. Voici le résultat obtenu avec K3 via Kimi code. C'est un peu plus simple.
00:06:38Une seule page, sans barre latérale. Toutes les fonctionnalités fonctionnent et il a
00:06:43un look similaire à ce qu'on a obtenu avec open router. En regardant le code, je
00:06:47préfère ce que Kimi code nous a donné avec K3. Le front-end utilise react,
00:06:51sans bibliothèque de routage. Mais le serveur a utilisé une base de données. Vous pouvez voir
00:06:55qu'il est construit avec express. On a une base de données financière qui utilise node
00:06:59SQLite. Si on compare aux modèles de pointe, voici Fable 5 dans Claude code.
00:07:04Il a travaillé pendant 56 minutes en mode max. Et voici GPT 5.6 Soul max,
00:07:08qui a réfléchi 31 minutes pour créer l'application. Voici ce que Fable 5 nous a donné, et
00:07:13honnêtement, le design est similaire. On ne peut pas faire grand-chose de plus avec un
00:07:17tableau de bord de finances personnelles. Toutes les fonctionnalités fonctionnent. Il a choisi un
00:07:21style de police différent, ce que j'ai vu Fable et Opus faire souvent. Ils semblent se
00:07:25réentraîner pour s'éloigner des anciens looks IA et construire un nouveau look IA.
00:07:29Et c'est celui qu'ils choisissent. Ces graphiques sont un peu plus inutiles
00:07:34que ce que nous avons eu avec Kimi K3. Mais globalement, ça se ressemble et ça fonctionne
00:07:38de la même manière. Le code est assez similaire. Il a choisi React pour le front-end,
00:07:43et n'a pas utilisé de routeur. Il a écrit le sien. Pour la base de données,
00:07:47il a utilisé une base de données correctement. Nous utilisons Node SQL.
00:07:51Pour le serveur, il utilise Express 2. Passons à GPT 5.6 Soul. C'est un cas
00:07:57étrange. C'est mon design préféré. Toutes les fonctionnalités
00:08:02fonctionnent. Dites-moi si vous trouvez que c'est le meilleur design. Mais le plus étrange est le code.
00:08:06C'est le code d'application le plus complet que nous ayons vu. Il
00:08:11a construit une application NextJS complète et a utilisé Drizzle, comme je l'aurais fait. Il a utilisé NextJS
00:08:15pour le front-end et le serveur. Mais je trouve étrange qu'il
00:08:20ait choisi de l'héberger sur Cloudflare, ce qui n'est pas bizarre en soi, mais il a utilisé for Next.
00:08:24Je ne dis pas que je ne le recommanderais pas. Je pense juste que c'est un peu non testé. Et c'est assez
00:08:29nouveau, ce qui montre qu'ils poussent GPT 5.6 Soul à utiliser cela. Je peux seulement spéculer sur
00:08:33la raison, mais il semble que ce soit comme ça que fonctionnent les sites ChatGPT. On
00:08:38peut voir qu'il a décidé d'héberger ceci pour moi sur la fonction site ChatGPT, alors que je ne l'ai pas demandé.
00:08:42Personnellement, je n'aime pas trop ça quand je code une application. Je ne veux pas
00:08:47qu'il l'héberge pour moi. Je préfère gérer cela moi-même. Mais j'aurais pu le demander dans l'invite.
00:08:50Je préférerais avoir à le demander plutôt que l'inverse.
00:08:54Le résultat final est GLM 5.2, qui a fait quelque chose de similaire à Kimi K3
00:08:58dans Kimi Code, où il n'a construit qu'une seule page. Mais toutes les fonctionnalités fonctionnent et je trouve
00:09:04ce design assez joli. GLM 5.2 a pris 15 minutes, pour un coût
00:09:08d'un dollar et 11 cents. Pour le code, GLM 5.2 a choisi la voie Next.js
00:09:13ce que j'apprécie. Mais il a construit son propre magasin au lieu d'une base de données. Tout cela
00:09:19est en mémoire en JavaScript. D'après mes tests, Kimi K3 est au niveau de Fable
00:09:24et GPT 5.6 Soul, et est à la hauteur de l'engouement suscité par les benchmarks.
00:09:29Honnêtement, c'est difficile de vous montrer à quel point ces modèles sont puissants en une démonstration vidéo. Il faut
00:09:33les utiliser pendant une semaine dans une base de code de production pour voir la qualité
00:09:38du code. Si vous avez des idées de tests pour une vidéo qui mettraient vraiment
00:09:42ces modèles à rude épreuve, dites-le-moi dans les commentaires. Je veux aussi
00:09:46montrer des exemples de leur blog technique. Kimi
00:09:50K3 a construit ce jeu, mais a utilisé un autre outil pour générer les assets, donc le cow-boy et
00:09:53le cheval n'ont pas été générés par K3. Ils ont été faits ailleurs. Il a fait un très bon travail
00:09:58en 3GS. L'autre chose folle, c'est ce design de puce. Comme preuve de concept, Kimi
00:10:03K3 a conçu une puce pour faire fonctionner un nano-modèle basé sur sa propre architecture. En une seule
00:10:08exécution autonome de 48 heures, K3 a construit, optimisé et vérifié la puce en utilisant des outils open source. Donc, j'espère
00:10:13que vous avez vu que ce modèle est absolument génial, et il va certainement porter un coup
00:10:19aux labos fermés de pointe. Ou du moins quand ils publieront les poids. Ils ne les ont pas
00:10:23encore publiés, mais ils prévoient de le faire. J'espère qu'on les verra bientôt. Qu'en pensez-vous
00:10:27? Vous attendiez-vous à ce qu'un labo chinois rattrape son retard si vite ? Et est-ce que ce modèle vous attire ?
00:10:32Dites-le-moi dans les commentaires. Pendant que vous y êtes, abonnez-vous. Et comme toujours, on se voit à la prochaine.
00:10:36Dites-le-moi dans les commentaires. Pendant que vous y êtes, abonnez-vous. Et comme toujours, on se voit à la prochaine.

핵심 요약

Kimi K3 rivalise avec les meilleurs modèles fermés comme Fable 5 et GPT 5.6 Soul en matière de codage et de raisonnement complexe, marquant une avancée majeure pour les modèles open source de classe 3 billions.

하이라이트

  • Kimi K3 est un modèle open source doté de 2,8 billions de paramètres avec vision native et une fenêtre de contexte d'un million de jetons.

  • Le modèle obtient un indice de codage de 76,2 sur les benchmarks tiers, le plaçant juste derrière Fable 5.

  • L'utilisation de l'API coûte 3 $ par million de jetons en entrée et 15 $ en sortie, ce qui est moins cher que Fable 5, Opus et GPT 5.6.

  • En test de développement, Kimi K3 a généré une application 3.js complète en 35 minutes pour un coût de 1,24 $.

  • Le modèle a démontré sa capacité à concevoir, optimiser et vérifier une puce pour un nano-modèle en 48 heures de travail autonome.

타임라인

Présentation et capacités de Kimi K3

  • Kimi K3 utilise l'architecture Kimi Delta Retention and Attention Residuals.
  • Les benchmarks placent ce modèle au niveau ou au-dessus de Fable et GPT 5.6.
  • Le modèle est spécialisé dans le codage à long terme et le raisonnement complexe.

Kimi K3 s'impose comme le premier modèle open source mondial de la classe des 3 billions de paramètres. Ses performances sur les tests tiers confirment ses capacités, avec un score de 76,2 sur l'indice de codage, se positionnant ainsi comme un concurrent sérieux pour les modèles fermés de pointe.

Analyse des coûts et compétitivité

  • L'API est facturée 3 $ par million de jetons en entrée et 15 $ en sortie.
  • Le coût par tâche est environ deux fois moins élevé que celui d'Opus 4.8.
  • Le modèle n'est pas optimisé pour une exécution locale grand public.

Bien que coûteux à faire tourner localement sans infrastructure spécialisée, le prix de l'API reste compétitif face aux modèles fermés. Il ne rivalise pas avec les modèles open source moins onéreux comme GLM 5.2, mais il offre une alternative économiquement avantageuse par rapport à Fable 5 ou GPT 5.6.

Tests pratiques de développement

  • La création d'un jeu de course 3.js a nécessité 35 minutes de génération pour un coût de 1,24 $.
  • La construction d'un tableau de bord de finances personnelles a démontré une gestion efficace du front-end et du back-end.
  • La comparaison avec GPT 5.6 Soul et Fable 5 révèle une qualité de code et une logique fonctionnelle équivalentes.

Les tests locaux, incluant des jeux en 3.js et des applications full-stack, confirment que Kimi K3 génère des solutions fonctionnelles sans assistance externe. Bien que les choix technologiques par défaut varient, les applications produites sont comparables en qualité et en design aux standards actuels de l'industrie.

Potentiel technique et perspectives

  • Kimi K3 a conçu une puce matérielle en 48 heures de manière autonome.
  • Les poids du modèle seront rendus publics prochainement selon l'annonce.
  • La performance globale place ce modèle Chinois comme une menace directe pour les labos fermés.

Au-delà du code logiciel, Kimi K3 prouve sa puissance par la conception matérielle, ayant optimisé une puce pour un nano-modèle. Cette démonstration renforce l'idée d'un changement de dynamique dans le secteur de l'IA, avec une rapidité de rattrapage surprenante de la part des développeurs Chinois.

커뮤니티 글

모든 글 보기