스크립트
00:00:00Hat ein chinesisches Open-Weight-Modell gerade GPT 5.6 und Fable 5 vom Thron gestoßen?
00:00:05Nun, falls du in den letzten 24 Stunden auf YouTube oder Twitter unterwegs warst,
00:00:08wurdest du wahrscheinlich mit diesen Diagrammen bombardiert, die zeigen, dass KimiK3 genauso gut abschneidet,
00:00:13wenn nicht sogar besser als das Beste, was Anthropic und OpenAI zu bieten haben,
00:00:17und das zu einem Bruchteil des Preises.
00:00:20Aber sollte man dem Hype glauben?
00:00:22Genau das werden wir im heutigen Video beantworten,
00:00:24während wir uns genauer ansehen, was diese Benchmarks wirklich aussagen,
00:00:28und einen direkten Vergleich zwischen GPT 5.6, Fable 5 und K3 anstellen,
00:00:34in dem einen Bereich, in dem KimiK3 bessere Zahlen liefert als alle anderen: Frontend-Design.
00:00:40Am Ende dieses Videos werden wir eine viel bessere Vorstellung davon haben, ob KimiK3 der neue König ist.
00:00:46Beginnen wir also mit den Zahlen und Benchmarks für KimiK3,
00:00:49denn daraus lässt sich tatsächlich viel ableiten,
00:00:51und es gibt einige Nuancen, die über diese Diagramme hinausgehen,
00:00:53die man überall sieht, wobei diese beiden die populärsten sind.
00:00:57Wenn wir über KimiK3 sprechen, handelt es sich um ein Open-Weight-Modell mit 2,8 Billionen Parametern.
00:01:02Wenn wir von Open-Weight sprechen, meinen wir Open-Source,
00:01:05das bedeutet nicht, dass du es auf deinem Computer laufen lassen kannst.
00:01:07Wir sprechen hier von Hardware im Wert von Millionen, um so etwas auszuführen.
00:01:11Aber es ist trotzdem großartig, dass es Open-Weight ist,
00:01:12sodass wir tatsächlich sehen können, wie alle Parameter abgestimmt sind,
00:01:15im Gegensatz zu Fable 5 oder GPT 5.6, wo das für uns unsichtbar ist.
00:01:20Wie schneidet es nun bei den Zahlen ab?
00:01:23Das verdanken wir Kimi und ihrem Moonshot-Labor,
00:01:27und es zeigt, dass es wieder mit Fable 5 und GPT 5.6 konkurriert,
00:01:31bei all diesen wichtigen Programmier-Benchmarks.
00:01:34Das andere Diagramm, das du herumgeistern siehst, ist dieses hier.
00:01:36Es stammt von arena.ai und misst ihren Frontend-Code.
00:01:40Dieser Benchmark funktioniert so: Wenn du zu arena.ai gehst und fragst:
00:01:44Hey, erstelle mir eine Landingpage,
00:01:45erhältst du zwei Antworten von zwei verschiedenen Modellen,
00:01:49und du weißt nicht, welches welches ist.
00:01:50Es ist wie der Pepsi-Test, und du wählst das aus, das dir besser gefällt.
00:01:53Im Laufe der Zeit sehen wir, welche Modelle gegen ihre Konkurrenten gewählt wurden.
00:01:57Und im Moment hat Kimi K3 besser abgeschnitten als jedes andere Modell in diesem Bereich.
00:02:01Aber verstehe, dass dies sehr, sehr subjektiv ist.
00:02:03Wenn wir uns also diese beiden Diagramme ansehen,
00:02:05und das mit der Preisgestaltung dieser Modelle vergleichen,
00:02:08sehen wir, dass Kimi K3 auch extrem günstig ist.
00:02:13Der Input kostet 3 $ pro Million Token, verglichen mit Fable, das 10 $ kostet,
00:02:17im Vergleich zu 5.6, das 5 $ kostet.
00:02:20Es kostet also 60% von 5.6,
00:02:23und es kostet 30% von Fable 5 beim Input.
00:02:26Und beim Output ist es die Hälfte der Kosten von 5.6,
00:02:29und es sind 30% der Kosten von Fable 5.
00:02:32Also viel billiger, und es ist im Grunde genauso gut, wenn nicht sogar besser.
00:02:35Was gibt es also nicht zu mögen?
00:02:36Aber hier müssen wir anfangen, ein wenig tiefer einzutauchen,
00:02:38in Bezug auf Kosten und Geschwindigkeit.
00:02:40Denn es ist eine Sache zu sehen: Oh, pro Million Token,
00:02:43kostet es 3 $ und das andere 10 $.
00:02:45Nun, wie viele Token verbraucht es eigentlich?
00:02:46Nicht alle Modelle werden in Bezug auf Token-Effizienz gleich behandelt.
00:02:49Tatsächlich neigen diese chinesischen Open-Source-Modelle dazu, Token-Fresser zu sein,
00:02:53was bedeutet, dass es auf dem Papier sehr billig ist.
00:02:56Was bedeutet das in der Realität?
00:02:57Und wie schneidet es im Vergleich zu diesen Typen ab,
00:02:58die tatsächlich sehr, sehr token-effizient sind, wie GPT 5.6?
00:03:01Nun, wenn wir uns das von Artificial Analysis ansehen,
00:03:03einem unabhängigen Benchmarker,
00:03:05haben sie einen Kosten-pro-Intelligenz-Index-Wert.
00:03:09Wie viel kostet es also, diese Aufgaben zu erledigen?
00:03:11Kimi K3, hier direkt, liegt bei 0,95 $.
00:03:15Im Vergleich zu GPT 5.6, sole, liegt es bei 1,04 $.
00:03:20Also etwas teurer.
00:03:23Wenn wir uns 5.5 extra high ansehen, weißt du, es ist hier.
00:03:26Wenn wir uns Terra ansehen, das 5.6 auf Max ist,
00:03:29ist es der halbe Preis von Kimi K3.
00:03:30Nun, im Vergleich zu Claude, richtig, ziemlich teuer.
00:03:35Fable 5, 2,75 $.
00:03:38Diese Kostenersparnis trifft also definitiv zu,
00:03:40wenn wir Fable mit Kimi K3 vergleichen.
00:03:42Aber wenn wir es mit 5.6 vergleichen, kein großer Unterschied.
00:03:46Wir reden von etwa 10% oder weniger.
00:03:49Und tatsächlich gibt es bestimmte Fälle, in denen Terra,
00:03:51einige dieser kleineren Modelle im 5.6-Bereich,
00:03:54tatsächlich die Hälfte der Kosten von Kimi K3 haben.
00:03:56Nun, das andere, worauf wir achten wollen, ist die Zeit,
00:03:58denn Zeit ist sicherlich eine Währung,
00:03:59auf die wir achten sollten.
00:04:01Historisch gesehen sind diese Open-Source-Modelle aus China langsam.
00:04:04Und das kann man hier sehen.
00:04:05Das langsamste Modell der Gruppe ist das alte Kimi K2.6.
00:04:09Nun, Kimi K3 ist deutlich besser geworden.
00:04:12In diesem Diagramm liegt es bei sechs Minuten.
00:04:14Wenn wir das mit Fable 5 vergleichen,
00:04:17liegt Fable 5 bei fünf Minuten und 5.6 bei 4,7 Minuten.
00:04:21Also, weißt du, es ist weniger token-effizient und es ist langsamer.
00:04:27Aber insgesamt viel billiger als Fable 5
00:04:32und ungefähr auf Augenhöhe mit 5.6.
00:04:34Nun, der letzte Benchmark, über den ich sprechen möchte,
00:04:35ist der Omniscience Index.
00:04:37Dieser misst Halluzinationen.
00:04:39Sie stellen dem Modell eine Reihe sehr schwieriger Fragen,
00:04:42auf die es möglicherweise die Antwort weiß oder nicht.
00:04:44Und es wird danach bewertet: Hat es das Richtige getroffen?
00:04:46Hat es das Falsche getroffen?
00:04:47Oder sagt es: Ich weiß es nicht?
00:04:49Du bekommst einen Punkt, wenn du es richtig hast.
00:04:50Du verlierst einen Punkt, wenn du es falsch hast.
00:04:52Und du bekommst eine Null, wenn du einfach sagst: Ich weiß es nicht.
00:04:54Und wir können hier sehen, und das ist von 100,
00:04:57dass Fable 5 mit 40 Punkten am besten abschneidet.
00:05:005.6 liegt weit dahinter mit 22.
00:05:03Und dann liegt Kimi K3 bei 18.
00:05:06Und ich denke, dieser Benchmark ist wirklich wichtig,
00:05:08wenn du diese Agenten in einem Kontext verwendest,
00:05:10der einfach viel Nuancen erfordert
00:05:11und in dem es viel Grauzonen gibt.
00:05:13Wenn wir also all diese Benchmarks zusammennehmen,
00:05:14denke ich, was wir daraus lernen sollten,
00:05:16ist, dass Kimi K3 auf dem Papier extrem leistungsstark ist.
00:05:19Wenn wir jedoch darüber sprechen, wie billig es ist,
00:05:21ist das eher übertrieben,
00:05:23vor allem, wenn wir es mit den GPT-Modellen vergleichen,
00:05:25die extrem token-effizient sind.
00:05:27Darüber hinaus ist Kimi K3 auch ein klein wenig langsamer.
00:05:30Also wird es einfach zu einer Frage,
00:05:32was von diesen drei Dingen für dich am wichtigsten ist
00:05:34in Bezug auf Leistung, Kosten und Geschwindigkeit.
00:05:38Lass uns also jetzt zum Frontend-Test
00:05:39zwischen diesen drei Modellen übergehen.
00:05:40Hier auf der linken Seite
00:05:42habe ich Fable 5 in Claude Code laufen.
00:05:45Und auf der rechten Seite habe ich Kimi K3,
00:05:46das ebenfalls in Claude Code läuft.
00:05:49Und hier hinten habe ich Codex.
00:05:51Das ist also der Prompt, den ich ihm geben werde.
00:05:54Und ich sage ihm, dass ich möchte, dass es
00:05:55ein 3D-Globus-Reise-Dashboard baut,
00:05:57das sich anfühlt wie eine Szene aus meinem Sci-Fi-Film,
00:05:59nicht nur eine Website.
00:06:01Ich sage ihm, dass ich möchte, dass es im Grunde
00:06:02zu einem visuellen Spektakel wird.
00:06:04Und ich möchte, dass es ziemlich kreativ wird.
00:06:06Tatsächlich sage ich: Überrasche mich
00:06:08mit mindestens einer Idee, die ich noch nie zuvor gesehen habe.
00:06:10Ich versuche, mit diesem Prompt nicht zu spezifisch zu sein,
00:06:13weil ich irgendwie sehen möchte,
00:06:14wie alle diese Modelle divergieren
00:06:15und was sie tatsächlich für mich bauen.
00:06:16Stellen wir sie also auf die Probe.
00:06:20Alles klar, also alle drei sind fertig
00:06:22mit dem Bau ihrer Website.
00:06:23Also werden wir sie alle durchgehen.
00:06:24Und dann am Ende
00:06:25vergleichen wir die tatsächlichen Kosten,
00:06:28die Menge der verwendeten Token und die Zeit.
00:06:30Fangen wir also mit Kimi 3 an.
00:06:34Also, los geht's.
00:06:35Wir haben die 3D-Erde.
00:06:37Ich kann hinein- und herauszoomen.
00:06:38Ich kann sie herum bewegen.
00:06:41Nicht super hohe Wiedergabetreue,
00:06:43aber das ist in Ordnung.
00:06:43Wenn ich auf etwas wie Mexiko-Stadt klicke,
00:06:46passiert nichts wirklich.
00:06:51Was noch?
00:06:51Es gibt einige andere Punkte hier,
00:06:53wie Kapstadt.
00:06:55Hier auf der linken Seite
00:06:56werden einige aktive Routen angezeigt.
00:06:58Wenn ich also auf eine aktive Route wie Tokio klicke,
00:07:01bringt es mich tatsächlich dorthin.
00:07:02Und dann hier auf der rechten Seite,
00:07:04werde ich ein wenig umherziehen.
00:07:05Wir können sehen, weißt du,
00:07:07es ist eine lange Zeit,
00:07:08Wetter,
00:07:09das beste Fenster, um dorthin zu reisen,
00:07:10Einreise,
00:07:11und dann so etwas wie
00:07:12wie viel es gerade kostet.
00:07:16Und während ich hier auf der linken Seite durch die Dinge klicke,
00:07:19weißt du,
00:07:20bringt es mich zu diesen verschiedenen Städten,
00:07:21sowie all ihren Statistiken.
00:07:23Also insgesamt,
00:07:24ziemlich cool.
00:07:24Und du kannst sehen, wie es auch die Erde
00:07:26sozusagen unterteilt hat,
00:07:29weißt du,
00:07:29Tag versus Nacht und all das.
00:07:31Also insgesamt,
00:07:31es sieht ziemlich süß aus.
00:07:32Jetzt werfen wir einen Blick auf Fable 5.
00:07:34Also gleich zu Beginn,
00:07:36würde ich sagen, diese Grafiken
00:07:38sehen ein bisschen sauberer aus,
00:07:39richtig?
00:07:39Wenn wir diese beiden vergleichen,
00:07:40sieht das einfach ein bisschen knackiger aus.
00:07:43Wir haben auch eine gewisse Beleuchtung,
00:07:44was cool ist.
00:07:45Wir haben das Gleiche wie
00:07:46Tag,
00:07:46Nacht-Aufschlüsselung,
00:07:47aber ich kann tatsächlich,
00:07:49ich habe ein Scrollrad,
00:07:51eine kleine Sache hier
00:07:52wo ich zwischen Tag und Nacht umschalten kann,
00:07:55was ziemlich genial ist.
00:07:57Ich kann nicht ganz so weit hineinzoomen,
00:08:00aber ich sehe mehr von diesen Städten,
00:08:02und es sieht etwas hochauflösender aus.
00:08:04Wenn ich also auf eine davon klicke,
00:08:06genau,
00:08:06das Gleiche wie vorher,
00:08:08es werden einige Statistiken angezeigt.
00:08:09Breitengrad und Längengrad zeigen die Bedingungen,
00:08:11in Bezug auf Wetter und Zeit
00:08:12und dann so etwas wie die Kosten.
00:08:15Zeigt den Rückflugpreis,
00:08:16obwohl ich mir nicht ganz sicher bin,
00:08:17woher das eigentlich kommt.
00:08:19Wenn ich hier links klicke,
00:08:21dasselbe in Grün,
00:08:22es bringt mich zu dieser Stadt.
00:08:24Ich kann einige der Statistiken sehen,
00:08:25sowie die Kosten.
00:08:27Ich denke insgesamt,
00:08:29was die Qualität der Benutzeroberfläche
00:08:33zwischen den beiden angeht,
00:08:34bevorzuge ich wohl das,
00:08:36was Fable 5 herausgebracht hat,
00:08:38besonders diese Art von,
00:08:40wissen Sie,
00:08:41Tag-Nacht-Sache,
00:08:42die dort passiert.
00:08:44Und interessanterweise
00:08:45sieht es so aus,
00:08:46als ob sich die Kosten aktualisieren,
00:08:48wenn ich tagsüber
00:08:48den Zeitpunkt ändere,
00:08:50die Kosten auf der rechten Seite,
00:08:51je nachdem,
00:08:52wann man dort
00:08:53tatsächlich landen würde.
00:08:55Also ziemlich gut.
00:08:56Und jetzt schauen wir uns GPT 5.6 an.
00:08:59Erste Eindrücke:
00:09:01fühlt sich wie ein Rückschritt an
00:09:02im Vergleich zu dem,
00:09:03was wir bei Kimi K3
00:09:04und Fable
00:09:04im Bezug auf den Globus sahen.
00:09:06Diese Globen
00:09:07bieten definitiv mehr Details
00:09:09und sind weitaus
00:09:09eindrucksvoller.
00:09:11Dies,
00:09:11ich denke, sie sind fast
00:09:12eher auf einen Sci-Fi-Look gegangen.
00:09:15Das hat so zufällige,
00:09:17es ist wie,
00:09:17sollen das sein?
00:09:19Okay.
00:09:20Also, dasselbe,
00:09:21wenn ich hier auf bestimmte Städte klicke,
00:09:23wie Singapur,
00:09:24das taucht auf,
00:09:24aber es überlappt
00:09:26den Globus selbst
00:09:27und der Text ist so klein,
00:09:29dass es schwer zu lesen ist.
00:09:31Ich habe hier unten zwar
00:09:33eine Art Tag-Nacht-Schieberegler,
00:09:35so wie wir ihn
00:09:36dort bei Fable 5 hatten,
00:09:37aber er ist nicht so toll.
00:09:39Und wenn es Nacht ist,
00:09:42kann man nicht einmal
00:09:43den Kontinent selbst sehen.
00:09:44Ich schätze,
00:09:45diese Lichter
00:09:46sollen Städte darstellen.
00:09:47Wenn ich hier links klicke,
00:09:49ja,
00:09:50wie schon zuvor,
00:09:51bringt uns das zu den eigentlichen Städten.
00:09:53Aber wie gesagt,
00:09:53fühlt sich definitiv an wie ein Schritt nach unten
00:09:54im Vergleich zu den letzten zwei.
00:09:56Insgesamt,
00:09:56wenn wir diese drei vergleichen,
00:09:57würde ich Fable 5 auf den ersten Platz setzen.
00:10:00Nicht weit dahinter,
00:10:02würde ich Kimi K3 einordnen,
00:10:04und auf den dritten Platz
00:10:05würde ich GPT 5.6 setzen.
00:10:07Vergleichen wir nun Tokens,
00:10:09Zeit und Kosten,
00:10:10denn wir haben das Endergebnis gesehen,
00:10:11aber was mussten wir eigentlich
00:10:13dafür bezahlen?
00:10:15Wir hatten Kimi,
00:10:16wir hatten Fable
00:10:17und dann hatten wir Codex,
00:10:19was ich einfach als X bezeichne.
00:10:21Was die Tokens betrifft,
00:10:24Kimi war bei weitem am schwersten.
00:10:26Es brauchte 21,5 Millionen Tokens,
00:10:30um das zu erreichen.
00:10:31Und was die Zeit betrifft,
00:10:33es brauchte eine Stunde
00:10:35und 33 Minuten.
00:10:37Also über 90 Minuten,
00:10:39um das
00:10:39mit 21,5 Millionen Tokens zu erstellen.
00:10:42Die Kosten,
00:10:42und das kommt alles
00:10:43von Open Router,
00:10:44lagen bei 8,66 $.
00:10:47Jetzt sprechen wir über Fable.
00:10:49Bei den Tokens:
00:10:50es verbrauchte 3,5 Millionen.
00:10:53Was die Zeit betrifft,
00:10:55es dauerte nur 17 Minuten
00:10:56und die Gesamtkosten
00:10:58lagen bei 11,64 $.
00:11:00Also nochmal:
00:11:02wovon habe ich
00:11:02zu Beginn gesprochen?
00:11:03Wir sprachen über Geschwindigkeit
00:11:04und Token-Effizienz.
00:11:06Kimi K3 liegt eindeutig
00:11:07weit hinter Fable,
00:11:09was das angeht,
00:11:09besonders wenn es
00:11:11um die Zeit geht.
00:11:11Und als wir uns
00:11:12die Token-zu-Token-Kosten
00:11:14pro Million anschauten,
00:11:15war es wie,
00:11:16oh,
00:11:16ein Drittel der Kosten
00:11:17von Fable.
00:11:18Nun,
00:11:19in der Realität
00:11:20nicht ganz so sehr.
00:11:20Immer noch billiger als Fable.
00:11:22Verstehen Sie mich nicht falsch,
00:11:23aber bei weitem nicht
00:11:25so effizient.
00:11:26Dann hatten wir Codex,
00:11:27von dessen Ergebnis
00:11:28ich ehrlich gesagt
00:11:28etwas enttäuscht war.
00:11:29Es brauchte 5,6 Millionen Tokens.
00:11:32Zeitlich,
00:11:33brauchte es 25 Minuten
00:11:35und die Gesamtkosten
00:11:36lagen bei 5,66 $.
00:11:38Falls Sie sich fragen,
00:11:39warum Tokens
00:11:40und Kosten
00:11:42und warum das
00:11:42nicht genau zusammenpasst
00:11:43für Inputs
00:11:44versus Outputs
00:11:44und das, was beworben wird,
00:11:46verstehen Sie, dass es
00:11:47bei allen drei
00:11:48viel Caching gibt.
00:11:49Was bedeutet das
00:11:51in etwa?
00:11:52Nun,
00:11:52das große Ding ist Kimi,
00:11:53oder?
00:11:55Sehr schwer
00:11:56bei den Tokens
00:11:57und es dauerte ewig.
00:11:59Es dauerte eineinhalb
00:12:00Stunden.
00:12:00Ehrlich gesagt,
00:12:01als ich dieses Video machte,
00:12:01dachte ich,
00:12:02oh,
00:12:02vielleicht mache ich
00:12:03wissen Sie,
00:12:03drei,
00:12:04vielleicht sogar vier Beispiele.
00:12:05Nein,
00:12:06ich sitze hier nicht
00:12:0720 Stunden lang daran.
00:12:09Und,
00:12:09wissen Sie,
00:12:10also weit hinten
00:12:11in diesen zwei Punkten
00:12:12gegenüber den Frontier-Modellen,
00:12:13aber insgesamt,
00:12:14war die Ausgabe solide.
00:12:15Wissen Sie,
00:12:15ich dachte, es hat
00:12:16einen wirklich guten Job gemacht,
00:12:17alles in allem.
00:12:18Und das teuerste
00:12:19von allen,
00:12:20offensichtlich,
00:12:20war Fable.
00:12:21wobei Codex
00:12:22am günstigsten war.
00:12:24Was können wir also wirklich
00:12:26daraus lernen?
00:12:27Nun,
00:12:27ich denke, was wir
00:12:29zumindest hier
00:12:29im Frontend-Bereich lernen,
00:12:31und das gilt wahrscheinlich
00:12:32auch für das Coding,
00:12:32wenn wir die
00:12:33Benchmarks
00:12:33für bare Münze nehmen,
00:12:34ist, dass Kimi
00:12:36mithalten kann.
00:12:37Kimi K3
00:12:38ist ein Open-Source-Modell,
00:12:39das mit Fable
00:12:40in 5.6 mithalten kann.
00:12:42Allerdings
00:12:43ist es nicht so günstig,
00:12:45wie man erwarten würde.
00:12:46In bestimmten Fällen
00:12:47ist es teurer.
00:12:49Und es ist einfach langsam.
00:12:51Es ist wirklich so langsam.
00:12:54Was für viele Leute
00:12:55ein Ausschlusskriterium
00:12:55darstellen könnte,
00:12:56je nachdem, was man tut.
00:12:58Aber,
00:12:58wenn das für Sie in Ordnung ist,
00:13:01wissen Sie,
00:13:02dann ist das vielleicht
00:13:03gar kein so großer Nachteil.
00:13:03Aber ich glaube,
00:13:04das Wichtigste,
00:13:05das bei all den Benchmarks
00:13:06und Zahlen
00:13:06etwas untergeht,
00:13:07sind wirklich die Kosten.
00:13:08Oder?
00:13:09Denn es ist nicht
00:13:09so günstig,
00:13:10wie man erwarten würde,
00:13:11aufgrund der Ineffizienz,
00:13:12wenn es darum geht,
00:13:12tatsächlich Token zu nutzen.
00:13:14Daher verabschiede ich mich nun von euch.
00:13:15Ich hoffe, ich konnte
00:13:16etwas mehr Klarheit
00:13:16über Kimi K3 schaffen.
00:13:17Ich finde es fantastisch.
00:13:18Wir haben ein Open-Source-Modell,
00:13:19das mithalten kann.
00:13:20Aber lasst uns nicht
00:13:21zu voreilig sein,
00:13:22was die rohe Leistung
00:13:23und speziell
00:13:23die Kosten angeht.
00:13:24Sowohl in Bezug auf
00:13:25Geld
00:13:26als auch Zeit.
00:13:27Lasst mich also in den Kommentaren
00:13:28wissen, was ihr denkt.
00:13:29Checkt unbedingt
00:13:30Chase AIA Plus aus,
00:13:31falls ihr euch
00:13:31meine Cloud Code Masterclass
00:13:32holen wollt,
00:13:32die heutzutage auch
00:13:33eine Codex Masterclass
00:13:34beinhaltet.
00:13:35Davon abgesehen,
00:13:36sehen wir uns bald.
00:13:37Und das war es.
00:13:39Bis zum nächsten Mal.