Kimi K3 est au niveau de Fable... (ils ont du souci à se faire)
BBetter Stack
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00Kimi K3 est arrivé et honnêtement, il est plutôt bluffant. Il ne s'est pas contenté de rattraper Opus et
00:00:04GPT 5.5, il a rattrapé Fable et GPT 5.6. Les modèles open source ne sont pas aussi en retard qu'on le
00:00:10pensait au début. Regardons ça de plus près. Commençons par l'annonce. Kimi K3 est un modèle à 2,8 billions
00:00:19de paramètres, construit sur l'architecture Kimi Delta Retention and Attention Residuals, doté d'une vision native
00:00:24et d'une fenêtre de contexte d'un million de jetons. C'est le premier modèle open source au monde de la classe des 3 billions
00:00:29conçu pour une intelligence de pointe dans le codage à long terme, le travail intellectuel et le raisonnement.
00:00:34Sur tous les benchmarks présentés dans leur blog, Kimi K3 suit Fable
00:00:38et GPT 5.6 Soul, voire les surpasse dans certains domaines. C'est un bond tellement incroyable
00:00:43que peu de gens l'avaient prédit. Évidemment, il s'agit de leurs propres benchmarks, alors jetons un œil
00:00:47aux benchmarks tiers, et je suis heureux de dire que les résultats correspondent
00:00:52globalement. Sur ce benchmark, on peut voir qu'environ 80 % d'entre vous ne sont pas abonnés,
00:00:56alors n'hésitez pas à cliquer sur ce bouton d'abonnement pour rester au courant de tout ce qui concerne le développement
00:01:00logiciel et l'IA. Passons aux vrais benchmarks, en commençant par l'indice de codage, où il obtient un score de 76,2.
00:01:06C'est 0,3 point derrière Fable 5, et légèrement au-dessus de GPT 5.5, d'Opus 4.8, et
00:01:12de GPT 5.6 Luna, et il ne perd que légèrement face à GPT 5.6 Soul et Terra. Regardez le bond qu'ils
00:01:19ont fait depuis leur dernier modèle. Si on regarde l'indice agentique, c'est la même chose.
00:01:23Il est troisième ici, derrière Fable et Soul, mais c'est toujours très impressionnant. Vous avez
00:01:29l'habitude maintenant, mais c'est exactement la même chose pour l'indice d'intelligence. Donc, même les
00:01:32benchmarks tiers confirment que ce modèle est génial. Malheureusement, nous n'avons pas encore les résultats de deep SWE au moment
00:01:38d'enregistrer ceci, mais d'après nos propres benchmarks, vous pouvez voir qu'il est arrivé troisième à nouveau.
00:01:42Ce modèle semble vraiment trop beau pour être vrai. Les seuls inconvénients que je trouve à ce modèle,
00:01:46c'est qu'il est un peu coûteux. À moins d'avoir un supercalculateur chez vous, je ne pense pas que
00:01:50vous allez le faire tourner localement. Via l'API, il est facturé 3 $ pour un
00:01:54million de jetons en entrée et 15 $ pour un million en sortie. C'est une sacrée avancée par rapport à Kimi K 2.6
00:02:00et c'est à peu près le même prix que Sonic 5 une fois la remise terminée, mais c'est moins cher que Fable 5,
00:02:06Opus et GPT 5.6. Le prix de l'API ne fait pas tout, donc si l'on regarde en pratique avec le coût
00:02:12par tâche, c'est similaire à GPT 5.6 Soul, environ la moitié du prix d'Opus 4.8 et
00:02:17bien sûr, c'est moins cher que Fable et Sonic 5. Il est donc compétitif face aux modèles fermés de pointe, mais
00:02:22pour ceux qui adorent les modèles open source parce qu'ils sont un peu moins chers, ce modèle ne sera
00:02:26probablement pas pour vous. GLM 5.2 est la deuxième meilleure option ici et coûte deux fois moins cher. Il n'est pas non plus le
00:02:31modèle le plus rapide, mais il me semble assez compétitif pour ce niveau d'intelligence.
00:02:36Dans l'ensemble, c'est honnêtement difficile de trouver quelque chose à redire sur ce modèle, alors plongeons
00:02:40directement dans mes tests locaux. Le premier test consistait à créer un
00:02:44jeu de course de Formule 1 complet en 3.js, dans un seul fichier index.html, avec Kimi K3 via
00:02:50Open Router. Je l'ai aussi testé dans Kimi Code, le CLI, juste pour voir si l'outil changeait
00:02:56quoi que ce soit. Vous pouvez voir en bas qu'il a réfléchi pendant 14 minutes avant de commencer, et globalement, il lui a fallu
00:03:0035 minutes pour créer cette application web 3.js, pour un coût de 1,24 $ en jetons API. Et les résultats sont
00:03:06plutôt impressionnants. Évidemment, il n'a accès à aucun asset externe, il fait donc de son mieux pour créer
00:03:11ces modèles. Mais la piste fonctionne. Nos pilotes IA semblent capables de parcourir la
00:03:16piste. Vous pouvez voir que les barrières fonctionnent, je ne peux pas les traverser. Notre position est mise à jour.
00:03:21La carte se met à jour. L'heure actuelle ainsi que les tours se mettent à jour. J'ai effectué
00:03:25un tour complet pour confirmer que tout fonctionne. C'est un très bon résultat de la part de Kimi K3.
00:03:30Comme je l'ai dit, j'ai aussi testé différents outils. Voici Kimi K3 dans Kimi Code. Celui-ci
00:03:35a l'air un peu plus joli. Il a fait un meilleur travail avec les assets, bien que ce ne soit qu'un
00:03:39guide de style. Il y a un peu de lag avec ces modèles, mais la maniabilité est un peu meilleure.
00:03:43Les commandes sont toujours inversées, ce qui semble être une tendance sur ces applications 3.js
00:03:48pour une raison quelconque. Mais encore une fois, tout se manipule très bien, et il y a des fonctionnalités comme le fait que sortir
00:03:52de la piste me ralentit. C'est un travail assez impressionnant. Maintenant, comparons
00:03:57cela aux modèles de pointe. Nous avons Fable 5 dans Claude Code en mode max, et il a fallu
00:04:0144 minutes pour créer mon application 3.js. Nous avons aussi GPT 5.6 Soul en mode max également. Il
00:04:07a pris 18 minutes. Voici le résultat que Fable m'a donné. Nous avons Fable GP ici. Je dirais
00:04:12qu'il est peut-être un peu plus joli. Mais encore une fois, tout cela n'est qu'une question de style. Les commandes
00:04:17ne sont pas inversées ici. Il y a un petit tremblement de caméra que je trouve sympa
00:04:22comme style. Et tout semble fonctionner ici, comme pour les autres. J'ai testé
00:04:26un tour complet, aussi difficile que cela soit. Il y a aussi des collisions, comme vous pouvez le voir. Mais oui,
00:04:31tout semble fonctionner, c'est assez comparable à ce que Kimi K3 nous a donné. C'est une histoire similaire
00:04:35avec GPT 5.6 Soul. Comme vous pouvez le voir, nous avons un jeu qui fonctionne. Cependant, notez que la route ici
00:04:40est faite d'herbe. Il ne l'a pas vraiment rendue. Et tout semble fonctionner. Les commandes
00:04:44sont inversées sur celui-ci aussi. Il y a aussi quelques assets à l'envers. Je ne sais pas pourquoi ces modèles
00:04:48aiment faire ça. Le seul qui ne l'a pas fait, c'est Fable. De plus, la piste devient un peu
00:04:53embrouillée. C'est donc le seul qui n'a pas créé une piste fonctionnelle. Pour une comparaison finale,
00:04:57j'ai aussi vérifié ce que GLM 5.2 me donnerait, car c'est le deuxième meilleur modèle open source. Il
00:05:02a réfléchi pendant 5 minutes et 58 secondes. Bien qu'il n'ait pas fini en une seule invite. Il y avait
00:05:07pas mal de bugs, donc j'ai dû utiliser une autre invite. Même après cela, quand j'ai enfin eu le jeu,
00:05:11on voit qu'il y a beaucoup de bugs. Premièrement, nous ne commençons pas dans le bon sens sur la piste.
00:05:15Et il n'y a pas vraiment de piste au départ. Et ça a l'air beaucoup moins bien que les autres.
00:05:20Il y a donc une progression lorsque l'on passe à Kimi K3. Passons au test 2. J'ai demandé un
00:05:25tableau de bord de gestion des finances personnelles. Cela va construire une application full-stack avec un front-end
00:05:29et un back-end. La seule chose que je ne voulais pas, c'est l'authentification. J'ai aussi demandé d'insérer des données.
00:05:33J'ai refait ce test sur open router avec K3, puis dans Kimi code. Celui-ci est sur open
00:05:38router. Vous pouvez voir qu'il a fallu 56 minutes pour créer l'application, pour un coût
00:05:43de 1,30 $. Voici le résultat. Honnêtement, je ne peux pas me plaindre.
00:05:48C'est exactement ce que j'ai demandé. C'est un tableau de bord de gestion des finances personnelles. Je dirais qu'il a l'air
00:05:53très bien aussi. On a toutes les fonctionnalités, comme les pages supplémentaires. J'ai
00:05:57vérifié l'ajout de fonds et l'envoi d'argent. Tout fonctionne. Très bon travail. Maintenant, je suis
00:06:01toujours curieux de voir quels outils il a utilisés. Parce que je ne donne aucune
00:06:05instruction sur la stack à utiliser dans l'invite. Pour le front-end, il a choisi
00:06:09react et react dom. Il n'a pas utilisé de routeur. Il a construit son
00:06:12propre système de vue. J'aurais préféré qu'il utilise react router,
00:06:16tan stack ou next.js. Pour le back-end, il a aussi construit son propre serveur.
00:06:21Celui-ci utilise express.js, comme on peut le voir ici. Mais il a aussi construit sa base de données avec un
00:06:26fichier JSON. Pas de SQLite, pas de drizzle, ce que j'aurais aimé voir pour
00:06:31faire évoluer l'application. Mais là encore, j'aurais pu le préciser dans l'invite. J'aime voir ce qu'ils choisissent
00:06:35par défaut. Voici le résultat obtenu avec K3 via Kimi code. C'est un peu plus simple.
00:06:38Une seule page, sans barre latérale. Toutes les fonctionnalités fonctionnent et il a
00:06:43un look similaire à ce qu'on a obtenu avec open router. En regardant le code, je
00:06:47préfère ce que Kimi code nous a donné avec K3. Le front-end utilise react,
00:06:51sans bibliothèque de routage. Mais le serveur a utilisé une base de données. Vous pouvez voir
00:06:55qu'il est construit avec express. On a une base de données financière qui utilise node
00:06:59SQLite. Si on compare aux modèles de pointe, voici Fable 5 dans Claude code.
00:07:04Il a travaillé pendant 56 minutes en mode max. Et voici GPT 5.6 Soul max,
00:07:08qui a réfléchi 31 minutes pour créer l'application. Voici ce que Fable 5 nous a donné, et
00:07:13honnêtement, le design est similaire. On ne peut pas faire grand-chose de plus avec un
00:07:17tableau de bord de finances personnelles. Toutes les fonctionnalités fonctionnent. Il a choisi un
00:07:21style de police différent, ce que j'ai vu Fable et Opus faire souvent. Ils semblent se
00:07:25réentraîner pour s'éloigner des anciens looks IA et construire un nouveau look IA.
00:07:29Et c'est celui qu'ils choisissent. Ces graphiques sont un peu plus inutiles
00:07:34que ce que nous avons eu avec Kimi K3. Mais globalement, ça se ressemble et ça fonctionne
00:07:38de la même manière. Le code est assez similaire. Il a choisi React pour le front-end,
00:07:43et n'a pas utilisé de routeur. Il a écrit le sien. Pour la base de données,
00:07:47il a utilisé une base de données correctement. Nous utilisons Node SQL.
00:07:51Pour le serveur, il utilise Express 2. Passons à GPT 5.6 Soul. C'est un cas
00:07:57étrange. C'est mon design préféré. Toutes les fonctionnalités
00:08:02fonctionnent. Dites-moi si vous trouvez que c'est le meilleur design. Mais le plus étrange est le code.
00:08:06C'est le code d'application le plus complet que nous ayons vu. Il
00:08:11a construit une application NextJS complète et a utilisé Drizzle, comme je l'aurais fait. Il a utilisé NextJS
00:08:15pour le front-end et le serveur. Mais je trouve étrange qu'il
00:08:20ait choisi de l'héberger sur Cloudflare, ce qui n'est pas bizarre en soi, mais il a utilisé for Next.
00:08:24Je ne dis pas que je ne le recommanderais pas. Je pense juste que c'est un peu non testé. Et c'est assez
00:08:29nouveau, ce qui montre qu'ils poussent GPT 5.6 Soul à utiliser cela. Je peux seulement spéculer sur
00:08:33la raison, mais il semble que ce soit comme ça que fonctionnent les sites ChatGPT. On
00:08:38peut voir qu'il a décidé d'héberger ceci pour moi sur la fonction site ChatGPT, alors que je ne l'ai pas demandé.
00:08:42Personnellement, je n'aime pas trop ça quand je code une application. Je ne veux pas
00:08:47qu'il l'héberge pour moi. Je préfère gérer cela moi-même. Mais j'aurais pu le demander dans l'invite.
00:08:50Je préférerais avoir à le demander plutôt que l'inverse.
00:08:54Le résultat final est GLM 5.2, qui a fait quelque chose de similaire à Kimi K3
00:08:58dans Kimi Code, où il n'a construit qu'une seule page. Mais toutes les fonctionnalités fonctionnent et je trouve
00:09:04ce design assez joli. GLM 5.2 a pris 15 minutes, pour un coût
00:09:08d'un dollar et 11 cents. Pour le code, GLM 5.2 a choisi la voie Next.js
00:09:13ce que j'apprécie. Mais il a construit son propre magasin au lieu d'une base de données. Tout cela
00:09:19est en mémoire en JavaScript. D'après mes tests, Kimi K3 est au niveau de Fable
00:09:24et GPT 5.6 Soul, et est à la hauteur de l'engouement suscité par les benchmarks.
00:09:29Honnêtement, c'est difficile de vous montrer à quel point ces modèles sont puissants en une démonstration vidéo. Il faut
00:09:33les utiliser pendant une semaine dans une base de code de production pour voir la qualité
00:09:38du code. Si vous avez des idées de tests pour une vidéo qui mettraient vraiment
00:09:42ces modèles à rude épreuve, dites-le-moi dans les commentaires. Je veux aussi
00:09:46montrer des exemples de leur blog technique. Kimi
00:09:50K3 a construit ce jeu, mais a utilisé un autre outil pour générer les assets, donc le cow-boy et
00:09:53le cheval n'ont pas été générés par K3. Ils ont été faits ailleurs. Il a fait un très bon travail
00:09:58en 3GS. L'autre chose folle, c'est ce design de puce. Comme preuve de concept, Kimi
00:10:03K3 a conçu une puce pour faire fonctionner un nano-modèle basé sur sa propre architecture. En une seule
00:10:08exécution autonome de 48 heures, K3 a construit, optimisé et vérifié la puce en utilisant des outils open source. Donc, j'espère
00:10:13que vous avez vu que ce modèle est absolument génial, et il va certainement porter un coup
00:10:19aux labos fermés de pointe. Ou du moins quand ils publieront les poids. Ils ne les ont pas
00:10:23encore publiés, mais ils prévoient de le faire. J'espère qu'on les verra bientôt. Qu'en pensez-vous
00:10:27? Vous attendiez-vous à ce qu'un labo chinois rattrape son retard si vite ? Et est-ce que ce modèle vous attire ?
00:10:32Dites-le-moi dans les commentaires. Pendant que vous y êtes, abonnez-vous. Et comme toujours, on se voit à la prochaine.
00:10:36Dites-le-moi dans les commentaires. Pendant que vous y êtes, abonnez-vous. Et comme toujours, on se voit à la prochaine.