Kimi K3 ist auf Fable-Niveau... (sie sollten sich Sorgen machen)
BBetter Stack
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00Kimi K3 ist da und ehrlich gesagt ist das schon schockierend. Es hat nicht nur zu Opus und
00:00:04GPT 5.5 aufgeschlossen, sondern auch zu Fable und GPT 5.6. Die offenen Modelle sind gar nicht so weit hinten, wie wir anfangs
00:00:10dachten. Schauen wir es uns an. Beginnen wir mit unserer Ankündigung. Kimi K3 ist ein Modell mit 2,8 Billionen
00:00:19Parametern, das auf Kimi Delta Retention and Attention Residuals basiert und native Vision-
00:00:24Funktionen sowie ein 1-Million-Token-Kontextfenster besitzt. Es ist das weltweit erste offene Modell der 3-Billionen-Klasse,
00:00:29das für Spitzenleistungen in den Bereichen Long-Horizon-Coding, Wissensarbeit und logisches Schlussfolgern konzipiert ist.
00:00:34In allen Benchmarks, die sie in diesem Blog zeigen, liegt Kimi K3 entweder knapp hinter Fable
00:00:38und GPT 5.6 Soul oder übertrifft sie sogar in einigen anderen Bereichen. Das ist so ein verrückter Sprung,
00:00:43den, glaube ich, nicht viele vorhergesehen haben. Natürlich basiert das auf ihren eigenen Benchmarks, also werfen wir einen Blick
00:00:47auf KI-Analysen und Drittanbieter-Tests, und ich freue mich sagen zu können, dass die Ergebnisse so ziemlich
00:00:52übereinstimmen. Bei diesem Benchmark sehen wir, dass etwa 80 % der Zuschauer hier nicht abonniert haben,
00:00:56also klickt gerne auf den Abonnieren-Button, wenn ihr bei allem rund um Softwareentwicklung
00:01:00und KI auf dem Laufenden bleiben wollt. Zu den echten Benchmarks: Der Coding-Index liegt bei 76,2,
00:01:06was 0,3 Punkte hinter Fable 5 liegt und leicht über GPT 5.5, mehr als Opus 4.8 und
00:01:12mehr als GPT 5.6 Luna; es verliert nur leicht gegen GPT 5.6 Soul und Terra. Schaut euch diesen Sprung an,
00:01:19den sie seit ihrem letzten Modell gemacht haben. Wenn wir uns nun den Agentic-Index ansehen, ist es dasselbe.
00:01:23Es ist hier auf dem dritten Platz und verliert nur gegen Fable und Soul, aber das ist wirklich immer noch beeindruckend, und ihr seid
00:01:29das ja mittlerweile gewohnt, aber es ist exakt dasselbe beim Intelligence-Index. Also bestätigen sogar die
00:01:32Drittanbieter-Benchmarks, dass dieses Modell fantastisch ist. Leider haben wir zum Zeitpunkt dieser Aufnahme noch keine
00:01:38Deep-SWE-Ergebnisse, aber wenn wir unsere eigenen Benchmarks betrachten, sieht man, dass es wieder den dritten Platz belegte.
00:01:42Dieses Modell scheint einfach zu gut, um wahr zu sein. Die einzigen Nachteile, die ich bei diesem Modell finden kann, sind,
00:01:46dass es ein wenig teuer ist. Außer ihr habt einen Supercomputer zu Hause, werdet ihr es wohl
00:01:50nicht lokal laufen lassen. Über die API kostet es 3 $ für eine
00:01:54Million Input-Tokens und 15 $ für eine Million Output-Tokens. Das ist ein ziemlicher Schritt nach oben von Kimi K 2.6
00:02:00und es liegt preislich etwa auf dem Niveau von Sonic 5, wenn der Rabatt wegfällt, aber es ist günstiger als Fable 5,
00:02:06Opus und GPT 5.6. API-Preise sind auch nicht alles; wenn wir uns also die Kosten pro
00:02:12Aufgabe ansehen, ist es tatsächlich ähnlich wie GPT 5.6 Soul und etwa halb so teuer wie Opus 4.8 und
00:02:17natürlich günstiger als Fable und Sonic 5. Es ist also konkurrenzfähig mit diesen geschlossenen Frontier-Modellen, aber
00:02:22für diejenigen unter euch, die offene Modelle lieben, weil sie ein wenig günstiger sind, ist dieses Modell wahrscheinlich
00:02:26nichts für euch. GLM 5.2 ist hier die zweitbeste Option und halb so teuer. Es ist auch nicht das
00:02:31schnellste Modell überhaupt, aber für mich wirkt es bei diesem Intelligenzniveau ziemlich wettbewerbsfähig.
00:02:36Alles in allem ist es wirklich schwer, irgendetwas Negatives über dieses Modell zu sagen, also legen wir einfach los
00:02:40und sehen uns einige meiner lokalen Tests an. Der erste Test, dem ich diese Modelle unterzogen habe, war die Erstellung eines
00:02:44kompletten Formel-1-Rennspiels in 3.js, alles in einer einzigen index.html, und hier sehen wir Kimi K3 über
00:02:50Open Router. Ich habe es auch in Kimi Code getestet, diesem CLI, nur um zu sehen, ob das Framework
00:02:56irgendetwas ändert. Man kann hier unten sehen, dass es 14 Minuten nachdachte, bevor es begann, und insgesamt hat es
00:03:0035 Minuten gebraucht, um diese 3.js-Web-App zu erstellen, und es hat 1,24 $ an API-Tokens gekostet. Und die Ergebnisse,
00:03:06die ich zurückbekam, sind ziemlich beeindruckend. Natürlich hat dies keinen Zugriff auf externe Assets, also gibt es sein Bestes bei der Erstellung
00:03:11dieser Modelle. Aber die Strecke funktioniert. Wir haben unsere KI-Rennfahrer und sie scheinen in der Lage zu sein, die
00:03:16Strecke zu umrunden. Man sieht, dass die Barrieren tatsächlich funktionieren, sodass ich nicht durch sie hindurchfahren kann. Unsere Position wird aktualisiert.
00:03:21Unsere Karte wird aktualisiert. Unsere aktuelle Zeit wird aktualisiert, ebenso wie die Runden. Ich habe eine
00:03:25volle Runde absolviert und bestätigt, dass alles funktioniert. Es ist also ein ziemlich gutes Ergebnis für das, was uns Kimi K3 geliefert hat.
00:03:30Wie gesagt, ich habe auch die verschiedenen Frameworks getestet. Das ist also Kimi K3, aber in Kimi Code. Und dieses hier
00:03:35würde ich sagen, sieht ein bisschen besser aus. Es hat bessere Arbeit mit den Assets geleistet, obwohl das nur ein
00:03:39Styleguide ist. Es gibt dort eine gewisse Verzögerung bei diesen Modellen, aber die Handhabung ist ein bisschen besser.
00:03:43Die Steuerung ist immer noch invertiert, was anscheinend ein Muster bei vielen dieser 3.js-Anwendungen
00:03:48aus irgendeinem Grund ist. Aber auch hier lässt sich alles sehr gut bedienen, und es hat Funktionen wie: Wenn man von der
00:03:52Strecke abkommt, wird man langsamer. Ja, es hat auch eine ziemlich beeindruckende Arbeit geleistet. Aber vergleichen wir das jetzt
00:03:57mit den Frontier-Modellen. Wir haben Fable 5 hier in Claude Code, das war auf “Max” eingestellt, und es hat
00:04:0144 Minuten gedauert, meine 3.js-Anwendung zu erstellen. Dann haben wir auch noch GPT 5.6 Sol, ebenfalls auf “Max”. Und dieses
00:04:07hat 18 Minuten gebraucht. Dies ist das Ergebnis, das mir Fable geliefert hat. Also haben wir Fable GP hier. Und ich würde sagen,
00:04:12dass es vielleicht etwas besser aussieht. Aber auch hier ist das alles nur eine stilistische Entscheidung. Und die Steuerung
00:04:17ist in diesem Fall tatsächlich nicht invertiert. Es gibt auch ein wenig Kamerawackeln, was ich für einen netten
00:04:22Stil halte. Und auch hier scheint alles zu funktionieren, wie bei allen anderen. Ich habe getestet, eine
00:04:26komplette Runde damit zu drehen, so schwer es auch ist. Wir haben hier auch einige Kollisionen, wie ihr sehen könnt. Aber ja,
00:04:31alles scheint zu funktionieren, und es ist ziemlich vergleichbar mit dem, was Kimi K3 uns geliefert hat. Eine ähnliche Geschichte
00:04:35ist es bei GPT 5.6 Sol. Wie ihr sehen könnt, haben wir hier ein funktionierendes Spiel. Ich merke allerdings an, dass die Straße hier
00:04:40aus Gras besteht. Das wurde nicht richtig gerendert. Und alles scheint zu funktionieren. Die Steuerung
00:04:44ist auch hier invertiert. Und wir haben auch ein paar rückwärts dargestellte Assets. Ich weiß nicht, warum diese Modelle
00:04:48das anscheinend gerne tun. Das einzige, das das nicht getan hat, war Fable. Außerdem wird die Strecke hier ein bisschen
00:04:53durcheinander. Das ist also tatsächlich das einzige, das mir keine funktionierende Strecke erstellt hat. Um noch einen letzten Vergleich
00:04:57hinzuzufügen: Ich habe auch geprüft, was mir GLM 5.2 liefern würde, da es das zweitbeste offene Modell ist. Und dieses
00:05:02hat für 5 Minuten und 58 Sekunden nachgedacht. Obwohl es das nicht in einem Prompt abgeschlossen hat. Es gab tatsächlich
00:05:07ein paar Fehler. Also musste ich mit einem weiteren Prompt nachbessern. Selbst dann, als ich das Spiel schließlich zum Laufen brachte,
00:05:11konnte man sehen, dass es viele Fehler gibt. Erstens starten wir nicht richtig auf der Strecke.
00:05:15Und es gibt nicht wirklich eine Strecke, um ehrlich zu sein. Außerdem sieht es viel schlechter aus als die anderen.
00:05:20Es gibt also einen deutlichen Schritt nach vorne, wenn wir zu Kimi K3 übergehen. Weiter zu Test 2. Ich habe nach einem
00:05:25Dashboard zur Verwaltung persönlicher Finanzen gefragt. Das soll eine Full-Stack-Anwendung mit Front-
00:05:29End und Back-End erstellen. Das einzige, was ich nicht wollte, ist Authentifizierung. Ich habe es außerdem gebeten, einige Daten zu seeden.
00:05:33Ich habe dies wieder in Open Router mit K3 gemacht. Und dann auch in Kimi Code. Also dieses hier ist in Open
00:05:38Router. Und man kann sehen, dass es insgesamt 56 Minuten gedauert hat, die Anwendung zu erstellen. Und es hat mich auch
00:05:431,30 $ gekostet. Das ist jedoch das Ergebnis, das sie mir geliefert haben. Ehrlich gesagt kann ich mich nicht wirklich darüber beschweren.
00:05:48Das ist genau das, wonach ich gefragt habe. Es ist ein Dashboard zur Verwaltung persönlicher Finanzen. Ich würde sagen, es sieht
00:05:53auch wirklich schön aus. Und wir haben alle Funktionen wie die zusätzlichen Seiten hier. Und ich habe
00:05:57das Hinzufügen von Geldern und das Senden von Geld überprüft. Alles funktioniert. Also hat es eine sehr gute Arbeit geleistet. Jetzt bin ich auch
00:06:01immer neugierig zu sehen, welche Tools es für die Aufgabe verwendet hat. Denn ich gebe in dem Prompt tatsächlich keine
00:06:05Anweisungen, welchen Stack es verwenden soll. Man kann sehen, dass es für das Frontend hier mit
00:06:09React und React DOM gearbeitet hat. Es hat eigentlich keinen Router oder Ähnliches verwendet. Es hat tatsächlich sein
00:06:12eigenes Ansichtssystem gebaut. Also hätte ich wahrscheinlich bevorzugt, dass es etwas wie React Router,
00:06:16TanStack oder Next.js verwendet. Und dann hat es auf dem Backend auch seinen eigenen Server gebaut. Ich glaube,
00:06:21dieses hier verwendet Express.js, wie wir hier unten sehen können. Aber dann hat es auch seine Datenbank einfach mit einer
00:06:26JSON-Datei erstellt. Hat kein SQLite oder Ähnliches oder Drizzle verwendet, was ich wahrscheinlich gerne gesehen hätte,
00:06:31wenn wir diese App in Zukunft skalieren wollten. Aber natürlich hätte ich das in den Prompt schreiben können. Aber ich sehe immer gerne, was diese als Standard wählen. Dies ist ein
00:06:35Ergebnis, das ich tatsächlich mit K3 via Kimi Code erhalten habe. Man kann sehen, dass dieses hier tatsächlich etwas einfacher ist.
00:06:38Es ist nur eine Seite und es hat nicht unsere Seitenleiste. Wiederum funktionieren alle Funktionen und es hat
00:06:43ein ziemlich ähnliches Aussehen wie das, was wir von Open Router bekommen haben. Wenn man sich den Code ansieht,
00:06:47bevorzuge ich tatsächlich das, was Kimi Code uns hier mit K3 gegeben hat. Es hat ein ziemlich ähnliches Frontend, bei dem es
00:06:51einfach React und keine Routing-Bibliothek verwendet. Aber der Server hat tatsächlich eine Datenbank verwendet. Man kann sehen,
00:06:55es ist hier mit Express gebaut. Wir haben tatsächlich eine Finanzdatenbank und es verwendet tatsächlich Node
00:06:59SQLite. Wenn man das nun wieder mit den Frontier-Modellen vergleicht: Dies ist Fable 5 in Claude Code.
00:07:04Man kann sehen, dass es 56 Minuten lang mit diesem maximalen Aufwand gearbeitet hat. Und dann habe ich auch noch GPT 5.6 Soul Max,
00:07:08wo es 31 Minuten nachgedacht hat, um die Anwendung zu erstellen. Hier ist, was Fable 5 uns gegeben hat, und
00:07:13ehrlich gesagt ist es ein ziemlich ähnliches Design. Ich meine, es gibt nicht viel mehr, was man tatsächlich mit einem
00:07:17Finanz-Dashboard machen kann. Und alle Funktionen funktionieren hier auch. Es hat sich tatsächlich ein bisschen für eine
00:07:21andere Stilrichtung bei den Schriftarten entschieden, was ich bei Fable und Opus in letzter Zeit öfter gesehen habe. Sie scheinen
00:07:25sie umzuschulen, um sich von einigen dieser früheren KI-Looks, die sie hatten, zu entfernen, und sie bauen einen neuen
00:07:29KI-Look auf. Und das scheint derjenige zu sein, den sie wählen. Ich würde sagen, diese Diagramme sind tatsächlich etwas
00:07:34nutzloser als das, was wir von Kimi K3 bekommen haben. Aber alles in allem sieht es ziemlich ähnlich aus und es funktioniert
00:07:38im Grunde genauso. Sogar der Code ist ziemlich ähnlich. Man kann sehen, dass es React für das Frontend gewählt hat
00:07:43und es hat auch keinen Router verwendet. Es hat seinen eigenen geschrieben. Und dann auch in der Datenbank hat
00:07:47es erfolgreich eine Datenbank korrekt verwendet. Wir verwenden also auch hier Node SQL. Und für den
00:07:51tatsächlichen Server läuft es einfach mit Express 2. Weiter zu GPT 5.6 Soul. Das ist ein bisschen ein
00:07:57seltsames Modell. Es ist definitiv mein liebstes Design von allen. Und auch hier funktionieren alle Funktionen.
00:08:02Lasst mich wissen, ob ihr zustimmt, dass dies das beste Design ist. Aber der seltsame Teil ist im Code.
00:08:06Dies ist definitiv der vollständigste Anwendungscode, den wir in diesen Beispielen gesehen haben. Es
00:08:11hat tatsächlich eine vollständige Next.js-Anwendung gebaut und Drizzle verwendet, genau wie ich es tun würde. Und es hat Next.js
00:08:15auch für das Frontend sowie den Server verwendet. Aber der Teil, den ich ein bisschen seltsam finde, ist, dass es
00:08:20sich entschieden hat, es auf Cloudflare zu hosten, was an sich nicht seltsam ist, aber es hat auch “For Next” verwendet.
00:08:24Es ist nicht unbedingt so, dass ich das nicht empfehlen würde. Ich denke nur, es ist ein bisschen ungetestet. Und es ist ziemlich
00:08:29neu, was zeigt, dass sie GPT 5.6 Soul tatsächlich dazu drängen, dies zu verwenden. Und ich kann nur spekulieren,
00:08:33warum, aber es scheint, als könnte es daran liegen, dass so diese ChatGPT-Sites tatsächlich funktionieren. Man kann
00:08:38hier sehen, dass es sich tatsächlich dazu entschieden hat, dies für mich auf der ChatGPT-Site-Funktion zu hosten, obwohl ich es nicht
00:08:42darum gebeten habe. Ich persönlich mag das nicht besonders, wenn ich eine Anwendung schreibe. Ich möchte nicht,
00:08:47dass es das für mich hostet. Ich würde es lieber alles selbst in die Hand nehmen. Aber ich hätte das in dem
00:08:50Prompt verlangen können. Ich würde irgendwie bevorzugen, dass ich es darum bitten muss, es zu hosten, anstatt umgekehrt.
00:08:54Das letzte Ergebnis, das ich hier habe, ist GLM 5.2, und dieses hat etwas Ähnliches getan wie Kimi K3
00:08:58in Kimi Code, wo es einfach diese Einzelseite erstellt hat. Aber auch hier funktionieren alle Funktionen und ich finde,
00:09:04dieses Design ist ziemlich schön. GLM 5.2 hat tatsächlich 15 Minuten gebraucht, um das zu tun, und man kann sehen, es hat
00:09:08mich 1,11 $ gekostet. Was den tatsächlichen Code betrifft, hat GLM 5.2 sich ebenfalls für den Next.js-Weg entschieden,
00:09:13was ich tatsächlich mag. Aber es hat seinen eigenen Store erstellt, anstatt eine Datenbank zu verwenden. Also alles davon
00:09:19ist nur im Arbeitsspeicher in JavaScript. Also denke ich nach meinem kurzen Test, dass Kimi K3 mit Fable
00:09:24und GPT 5.6 Soul mithalten kann und dem Hype gerecht wird, den die Benchmarks ihm verleihen. Und ehrlich gesagt wird es
00:09:29ziemlich schwer, euch nur zu zeigen, wie leistungsfähig diese Modelle in einer Videodemonstration sind. Man muss sie tendenziell
00:09:33über den Verlauf einer Woche in einer Produktionscodebasis verwenden, um die Qualität
00:09:38des Codes tatsächlich zu sehen. Wenn ihr irgendwelche Ideen für Tests habt, die ich tatsächlich in einem Video zeigen kann, die diese
00:09:42Modelle wirklich einem harten Test unterziehen würden, lasst es mich in den Kommentaren unten wissen. Ich möchte auch
00:09:46einige der Beispiele zeigen, die sie in ihrem Tech-Blog hatten. Man kann sehen, dass Kimi
00:09:50K3 dieses Spiel hier gebaut hat, aber ein anderes Tool hatte, um diese Assets tatsächlich zu generieren, also der Cowboy und
00:09:53das Pferd wurden nicht von K3 generiert. Sie kamen woanders her. Man kann sehen, dass er sehr gute Arbeit
00:09:58damit in 3.js geleistet hat. Und die andere Sache, die verrückt ist, ist das Chip-Design. Man kann als frühen
00:10:03Proof-of-Concept sehen, dass Kimi K3 einen Chip entworfen hat, um ein Nano-Modell zu bedienen, das auf seiner eigenen Architektur basiert. In einem einzigen
00:10:0848-Stunden-autonomen Lauf hat K3 den Chip mithilfe von Open-Source-Tools gebaut, optimiert und verifiziert. Also hoffentlich
00:10:13habt ihr gesehen, dass dieses Modell absolut fantastisch ist und es wird definitiv ein ziemlicher Schlag für
00:10:19diese geschlossenen Frontier-Labore. Oder zumindest wird es das sein, wenn sie die Gewichte tatsächlich freigeben. Sie haben sie noch nicht
00:10:23freigegeben, aber sie planen dies zu tun. Ich hoffe also, wir sehen sie sehr bald. Was denkt ihr
00:10:27darüber? Habt ihr erwartet, dass ein chinesisches Labor so schnell aufschließt? Und spricht euch dieses Modell an?
00:10:32Lasst es mich in den Kommentaren unten wissen. Während ihr dort seid, abonniert. Und wie immer, wir sehen uns im nächsten.
00:10:36Wie immer, wir sehen uns beim nächsten Mal.