Dieses Open-Source-Modell hat gerade Claude Fable 5 geschlagen

CChase AI
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Hat ein chinesisches Open-Weight-Modell gerade GPT 5.6 und Fable 5 vom Thron gestoßen?
00:00:05Nun, falls du in den letzten 24 Stunden auf YouTube oder Twitter unterwegs warst,
00:00:08wurdest du wahrscheinlich mit diesen Diagrammen bombardiert, die zeigen, dass KimiK3 genauso gut abschneidet,
00:00:13wenn nicht sogar besser als das Beste, was Anthropic und OpenAI zu bieten haben,
00:00:17und das zu einem Bruchteil des Preises.
00:00:20Aber sollte man dem Hype glauben?
00:00:22Genau das werden wir im heutigen Video beantworten,
00:00:24während wir uns genauer ansehen, was diese Benchmarks wirklich aussagen,
00:00:28und einen direkten Vergleich zwischen GPT 5.6, Fable 5 und K3 anstellen,
00:00:34in dem einen Bereich, in dem KimiK3 bessere Zahlen liefert als alle anderen: Frontend-Design.
00:00:40Am Ende dieses Videos werden wir eine viel bessere Vorstellung davon haben, ob KimiK3 der neue König ist.
00:00:46Beginnen wir also mit den Zahlen und Benchmarks für KimiK3,
00:00:49denn daraus lässt sich tatsächlich viel ableiten,
00:00:51und es gibt einige Nuancen, die über diese Diagramme hinausgehen,
00:00:53die man überall sieht, wobei diese beiden die populärsten sind.
00:00:57Wenn wir über KimiK3 sprechen, handelt es sich um ein Open-Weight-Modell mit 2,8 Billionen Parametern.
00:01:02Wenn wir von Open-Weight sprechen, meinen wir Open-Source,
00:01:05das bedeutet nicht, dass du es auf deinem Computer laufen lassen kannst.
00:01:07Wir sprechen hier von Hardware im Wert von Millionen, um so etwas auszuführen.
00:01:11Aber es ist trotzdem großartig, dass es Open-Weight ist,
00:01:12sodass wir tatsächlich sehen können, wie alle Parameter abgestimmt sind,
00:01:15im Gegensatz zu Fable 5 oder GPT 5.6, wo das für uns unsichtbar ist.
00:01:20Wie schneidet es nun bei den Zahlen ab?
00:01:23Das verdanken wir Kimi und ihrem Moonshot-Labor,
00:01:27und es zeigt, dass es wieder mit Fable 5 und GPT 5.6 konkurriert,
00:01:31bei all diesen wichtigen Programmier-Benchmarks.
00:01:34Das andere Diagramm, das du herumgeistern siehst, ist dieses hier.
00:01:36Es stammt von arena.ai und misst ihren Frontend-Code.
00:01:40Dieser Benchmark funktioniert so: Wenn du zu arena.ai gehst und fragst:
00:01:44Hey, erstelle mir eine Landingpage,
00:01:45erhältst du zwei Antworten von zwei verschiedenen Modellen,
00:01:49und du weißt nicht, welches welches ist.
00:01:50Es ist wie der Pepsi-Test, und du wählst das aus, das dir besser gefällt.
00:01:53Im Laufe der Zeit sehen wir, welche Modelle gegen ihre Konkurrenten gewählt wurden.
00:01:57Und im Moment hat Kimi K3 besser abgeschnitten als jedes andere Modell in diesem Bereich.
00:02:01Aber verstehe, dass dies sehr, sehr subjektiv ist.
00:02:03Wenn wir uns also diese beiden Diagramme ansehen,
00:02:05und das mit der Preisgestaltung dieser Modelle vergleichen,
00:02:08sehen wir, dass Kimi K3 auch extrem günstig ist.
00:02:13Der Input kostet 3 $ pro Million Token, verglichen mit Fable, das 10 $ kostet,
00:02:17im Vergleich zu 5.6, das 5 $ kostet.
00:02:20Es kostet also 60% von 5.6,
00:02:23und es kostet 30% von Fable 5 beim Input.
00:02:26Und beim Output ist es die Hälfte der Kosten von 5.6,
00:02:29und es sind 30% der Kosten von Fable 5.
00:02:32Also viel billiger, und es ist im Grunde genauso gut, wenn nicht sogar besser.
00:02:35Was gibt es also nicht zu mögen?
00:02:36Aber hier müssen wir anfangen, ein wenig tiefer einzutauchen,
00:02:38in Bezug auf Kosten und Geschwindigkeit.
00:02:40Denn es ist eine Sache zu sehen: Oh, pro Million Token,
00:02:43kostet es 3 $ und das andere 10 $.
00:02:45Nun, wie viele Token verbraucht es eigentlich?
00:02:46Nicht alle Modelle werden in Bezug auf Token-Effizienz gleich behandelt.
00:02:49Tatsächlich neigen diese chinesischen Open-Source-Modelle dazu, Token-Fresser zu sein,
00:02:53was bedeutet, dass es auf dem Papier sehr billig ist.
00:02:56Was bedeutet das in der Realität?
00:02:57Und wie schneidet es im Vergleich zu diesen Typen ab,
00:02:58die tatsächlich sehr, sehr token-effizient sind, wie GPT 5.6?
00:03:01Nun, wenn wir uns das von Artificial Analysis ansehen,
00:03:03einem unabhängigen Benchmarker,
00:03:05haben sie einen Kosten-pro-Intelligenz-Index-Wert.
00:03:09Wie viel kostet es also, diese Aufgaben zu erledigen?
00:03:11Kimi K3, hier direkt, liegt bei 0,95 $.
00:03:15Im Vergleich zu GPT 5.6, sole, liegt es bei 1,04 $.
00:03:20Also etwas teurer.
00:03:23Wenn wir uns 5.5 extra high ansehen, weißt du, es ist hier.
00:03:26Wenn wir uns Terra ansehen, das 5.6 auf Max ist,
00:03:29ist es der halbe Preis von Kimi K3.
00:03:30Nun, im Vergleich zu Claude, richtig, ziemlich teuer.
00:03:35Fable 5, 2,75 $.
00:03:38Diese Kostenersparnis trifft also definitiv zu,
00:03:40wenn wir Fable mit Kimi K3 vergleichen.
00:03:42Aber wenn wir es mit 5.6 vergleichen, kein großer Unterschied.
00:03:46Wir reden von etwa 10% oder weniger.
00:03:49Und tatsächlich gibt es bestimmte Fälle, in denen Terra,
00:03:51einige dieser kleineren Modelle im 5.6-Bereich,
00:03:54tatsächlich die Hälfte der Kosten von Kimi K3 haben.
00:03:56Nun, das andere, worauf wir achten wollen, ist die Zeit,
00:03:58denn Zeit ist sicherlich eine Währung,
00:03:59auf die wir achten sollten.
00:04:01Historisch gesehen sind diese Open-Source-Modelle aus China langsam.
00:04:04Und das kann man hier sehen.
00:04:05Das langsamste Modell der Gruppe ist das alte Kimi K2.6.
00:04:09Nun, Kimi K3 ist deutlich besser geworden.
00:04:12In diesem Diagramm liegt es bei sechs Minuten.
00:04:14Wenn wir das mit Fable 5 vergleichen,
00:04:17liegt Fable 5 bei fünf Minuten und 5.6 bei 4,7 Minuten.
00:04:21Also, weißt du, es ist weniger token-effizient und es ist langsamer.
00:04:27Aber insgesamt viel billiger als Fable 5
00:04:32und ungefähr auf Augenhöhe mit 5.6.
00:04:34Nun, der letzte Benchmark, über den ich sprechen möchte,
00:04:35ist der Omniscience Index.
00:04:37Dieser misst Halluzinationen.
00:04:39Sie stellen dem Modell eine Reihe sehr schwieriger Fragen,
00:04:42auf die es möglicherweise die Antwort weiß oder nicht.
00:04:44Und es wird danach bewertet: Hat es das Richtige getroffen?
00:04:46Hat es das Falsche getroffen?
00:04:47Oder sagt es: Ich weiß es nicht?
00:04:49Du bekommst einen Punkt, wenn du es richtig hast.
00:04:50Du verlierst einen Punkt, wenn du es falsch hast.
00:04:52Und du bekommst eine Null, wenn du einfach sagst: Ich weiß es nicht.
00:04:54Und wir können hier sehen, und das ist von 100,
00:04:57dass Fable 5 mit 40 Punkten am besten abschneidet.
00:05:005.6 liegt weit dahinter mit 22.
00:05:03Und dann liegt Kimi K3 bei 18.
00:05:06Und ich denke, dieser Benchmark ist wirklich wichtig,
00:05:08wenn du diese Agenten in einem Kontext verwendest,
00:05:10der einfach viel Nuancen erfordert
00:05:11und in dem es viel Grauzonen gibt.
00:05:13Wenn wir also all diese Benchmarks zusammennehmen,
00:05:14denke ich, was wir daraus lernen sollten,
00:05:16ist, dass Kimi K3 auf dem Papier extrem leistungsstark ist.
00:05:19Wenn wir jedoch darüber sprechen, wie billig es ist,
00:05:21ist das eher übertrieben,
00:05:23vor allem, wenn wir es mit den GPT-Modellen vergleichen,
00:05:25die extrem token-effizient sind.
00:05:27Darüber hinaus ist Kimi K3 auch ein klein wenig langsamer.
00:05:30Also wird es einfach zu einer Frage,
00:05:32was von diesen drei Dingen für dich am wichtigsten ist
00:05:34in Bezug auf Leistung, Kosten und Geschwindigkeit.
00:05:38Lass uns also jetzt zum Frontend-Test
00:05:39zwischen diesen drei Modellen übergehen.
00:05:40Hier auf der linken Seite
00:05:42habe ich Fable 5 in Claude Code laufen.
00:05:45Und auf der rechten Seite habe ich Kimi K3,
00:05:46das ebenfalls in Claude Code läuft.
00:05:49Und hier hinten habe ich Codex.
00:05:51Das ist also der Prompt, den ich ihm geben werde.
00:05:54Und ich sage ihm, dass ich möchte, dass es
00:05:55ein 3D-Globus-Reise-Dashboard baut,
00:05:57das sich anfühlt wie eine Szene aus meinem Sci-Fi-Film,
00:05:59nicht nur eine Website.
00:06:01Ich sage ihm, dass ich möchte, dass es im Grunde
00:06:02zu einem visuellen Spektakel wird.
00:06:04Und ich möchte, dass es ziemlich kreativ wird.
00:06:06Tatsächlich sage ich: Überrasche mich
00:06:08mit mindestens einer Idee, die ich noch nie zuvor gesehen habe.
00:06:10Ich versuche, mit diesem Prompt nicht zu spezifisch zu sein,
00:06:13weil ich irgendwie sehen möchte,
00:06:14wie alle diese Modelle divergieren
00:06:15und was sie tatsächlich für mich bauen.
00:06:16Stellen wir sie also auf die Probe.
00:06:20Alles klar, also alle drei sind fertig
00:06:22mit dem Bau ihrer Website.
00:06:23Also werden wir sie alle durchgehen.
00:06:24Und dann am Ende
00:06:25vergleichen wir die tatsächlichen Kosten,
00:06:28die Menge der verwendeten Token und die Zeit.
00:06:30Fangen wir also mit Kimi 3 an.
00:06:34Also, los geht's.
00:06:35Wir haben die 3D-Erde.
00:06:37Ich kann hinein- und herauszoomen.
00:06:38Ich kann sie herum bewegen.
00:06:41Nicht super hohe Wiedergabetreue,
00:06:43aber das ist in Ordnung.
00:06:43Wenn ich auf etwas wie Mexiko-Stadt klicke,
00:06:46passiert nichts wirklich.
00:06:51Was noch?
00:06:51Es gibt einige andere Punkte hier,
00:06:53wie Kapstadt.
00:06:55Hier auf der linken Seite
00:06:56werden einige aktive Routen angezeigt.
00:06:58Wenn ich also auf eine aktive Route wie Tokio klicke,
00:07:01bringt es mich tatsächlich dorthin.
00:07:02Und dann hier auf der rechten Seite,
00:07:04werde ich ein wenig umherziehen.
00:07:05Wir können sehen, weißt du,
00:07:07es ist eine lange Zeit,
00:07:08Wetter,
00:07:09das beste Fenster, um dorthin zu reisen,
00:07:10Einreise,
00:07:11und dann so etwas wie
00:07:12wie viel es gerade kostet.
00:07:16Und während ich hier auf der linken Seite durch die Dinge klicke,
00:07:19weißt du,
00:07:20bringt es mich zu diesen verschiedenen Städten,
00:07:21sowie all ihren Statistiken.
00:07:23Also insgesamt,
00:07:24ziemlich cool.
00:07:24Und du kannst sehen, wie es auch die Erde
00:07:26sozusagen unterteilt hat,
00:07:29weißt du,
00:07:29Tag versus Nacht und all das.
00:07:31Also insgesamt,
00:07:31es sieht ziemlich süß aus.
00:07:32Jetzt werfen wir einen Blick auf Fable 5.
00:07:34Also gleich zu Beginn,
00:07:36würde ich sagen, diese Grafiken
00:07:38sehen ein bisschen sauberer aus,
00:07:39richtig?
00:07:39Wenn wir diese beiden vergleichen,
00:07:40sieht das einfach ein bisschen knackiger aus.
00:07:43Wir haben auch eine gewisse Beleuchtung,
00:07:44was cool ist.
00:07:45Wir haben das Gleiche wie
00:07:46Tag,
00:07:46Nacht-Aufschlüsselung,
00:07:47aber ich kann tatsächlich,
00:07:49ich habe ein Scrollrad,
00:07:51eine kleine Sache hier
00:07:52wo ich zwischen Tag und Nacht umschalten kann,
00:07:55was ziemlich genial ist.
00:07:57Ich kann nicht ganz so weit hineinzoomen,
00:08:00aber ich sehe mehr von diesen Städten,
00:08:02und es sieht etwas hochauflösender aus.
00:08:04Wenn ich also auf eine davon klicke,
00:08:06genau,
00:08:06das Gleiche wie vorher,
00:08:08es werden einige Statistiken angezeigt.
00:08:09Breitengrad und Längengrad zeigen die Bedingungen,
00:08:11in Bezug auf Wetter und Zeit
00:08:12und dann so etwas wie die Kosten.
00:08:15Zeigt den Rückflugpreis,
00:08:16obwohl ich mir nicht ganz sicher bin,
00:08:17woher das eigentlich kommt.
00:08:19Wenn ich hier links klicke,
00:08:21dasselbe in Grün,
00:08:22es bringt mich zu dieser Stadt.
00:08:24Ich kann einige der Statistiken sehen,
00:08:25sowie die Kosten.
00:08:27Ich denke insgesamt,
00:08:29was die Qualität der Benutzeroberfläche
00:08:33zwischen den beiden angeht,
00:08:34bevorzuge ich wohl das,
00:08:36was Fable 5 herausgebracht hat,
00:08:38besonders diese Art von,
00:08:40wissen Sie,
00:08:41Tag-Nacht-Sache,
00:08:42die dort passiert.
00:08:44Und interessanterweise
00:08:45sieht es so aus,
00:08:46als ob sich die Kosten aktualisieren,
00:08:48wenn ich tagsüber
00:08:48den Zeitpunkt ändere,
00:08:50die Kosten auf der rechten Seite,
00:08:51je nachdem,
00:08:52wann man dort
00:08:53tatsächlich landen würde.
00:08:55Also ziemlich gut.
00:08:56Und jetzt schauen wir uns GPT 5.6 an.
00:08:59Erste Eindrücke:
00:09:01fühlt sich wie ein Rückschritt an
00:09:02im Vergleich zu dem,
00:09:03was wir bei Kimi K3
00:09:04und Fable
00:09:04im Bezug auf den Globus sahen.
00:09:06Diese Globen
00:09:07bieten definitiv mehr Details
00:09:09und sind weitaus
00:09:09eindrucksvoller.
00:09:11Dies,
00:09:11ich denke, sie sind fast
00:09:12eher auf einen Sci-Fi-Look gegangen.
00:09:15Das hat so zufällige,
00:09:17es ist wie,
00:09:17sollen das sein?
00:09:19Okay.
00:09:20Also, dasselbe,
00:09:21wenn ich hier auf bestimmte Städte klicke,
00:09:23wie Singapur,
00:09:24das taucht auf,
00:09:24aber es überlappt
00:09:26den Globus selbst
00:09:27und der Text ist so klein,
00:09:29dass es schwer zu lesen ist.
00:09:31Ich habe hier unten zwar
00:09:33eine Art Tag-Nacht-Schieberegler,
00:09:35so wie wir ihn
00:09:36dort bei Fable 5 hatten,
00:09:37aber er ist nicht so toll.
00:09:39Und wenn es Nacht ist,
00:09:42kann man nicht einmal
00:09:43den Kontinent selbst sehen.
00:09:44Ich schätze,
00:09:45diese Lichter
00:09:46sollen Städte darstellen.
00:09:47Wenn ich hier links klicke,
00:09:49ja,
00:09:50wie schon zuvor,
00:09:51bringt uns das zu den eigentlichen Städten.
00:09:53Aber wie gesagt,
00:09:53fühlt sich definitiv an wie ein Schritt nach unten
00:09:54im Vergleich zu den letzten zwei.
00:09:56Insgesamt,
00:09:56wenn wir diese drei vergleichen,
00:09:57würde ich Fable 5 auf den ersten Platz setzen.
00:10:00Nicht weit dahinter,
00:10:02würde ich Kimi K3 einordnen,
00:10:04und auf den dritten Platz
00:10:05würde ich GPT 5.6 setzen.
00:10:07Vergleichen wir nun Tokens,
00:10:09Zeit und Kosten,
00:10:10denn wir haben das Endergebnis gesehen,
00:10:11aber was mussten wir eigentlich
00:10:13dafür bezahlen?
00:10:15Wir hatten Kimi,
00:10:16wir hatten Fable
00:10:17und dann hatten wir Codex,
00:10:19was ich einfach als X bezeichne.
00:10:21Was die Tokens betrifft,
00:10:24Kimi war bei weitem am schwersten.
00:10:26Es brauchte 21,5 Millionen Tokens,
00:10:30um das zu erreichen.
00:10:31Und was die Zeit betrifft,
00:10:33es brauchte eine Stunde
00:10:35und 33 Minuten.
00:10:37Also über 90 Minuten,
00:10:39um das
00:10:39mit 21,5 Millionen Tokens zu erstellen.
00:10:42Die Kosten,
00:10:42und das kommt alles
00:10:43von Open Router,
00:10:44lagen bei 8,66 $.
00:10:47Jetzt sprechen wir über Fable.
00:10:49Bei den Tokens:
00:10:50es verbrauchte 3,5 Millionen.
00:10:53Was die Zeit betrifft,
00:10:55es dauerte nur 17 Minuten
00:10:56und die Gesamtkosten
00:10:58lagen bei 11,64 $.
00:11:00Also nochmal:
00:11:02wovon habe ich
00:11:02zu Beginn gesprochen?
00:11:03Wir sprachen über Geschwindigkeit
00:11:04und Token-Effizienz.
00:11:06Kimi K3 liegt eindeutig
00:11:07weit hinter Fable,
00:11:09was das angeht,
00:11:09besonders wenn es
00:11:11um die Zeit geht.
00:11:11Und als wir uns
00:11:12die Token-zu-Token-Kosten
00:11:14pro Million anschauten,
00:11:15war es wie,
00:11:16oh,
00:11:16ein Drittel der Kosten
00:11:17von Fable.
00:11:18Nun,
00:11:19in der Realität
00:11:20nicht ganz so sehr.
00:11:20Immer noch billiger als Fable.
00:11:22Verstehen Sie mich nicht falsch,
00:11:23aber bei weitem nicht
00:11:25so effizient.
00:11:26Dann hatten wir Codex,
00:11:27von dessen Ergebnis
00:11:28ich ehrlich gesagt
00:11:28etwas enttäuscht war.
00:11:29Es brauchte 5,6 Millionen Tokens.
00:11:32Zeitlich,
00:11:33brauchte es 25 Minuten
00:11:35und die Gesamtkosten
00:11:36lagen bei 5,66 $.
00:11:38Falls Sie sich fragen,
00:11:39warum Tokens
00:11:40und Kosten
00:11:42und warum das
00:11:42nicht genau zusammenpasst
00:11:43für Inputs
00:11:44versus Outputs
00:11:44und das, was beworben wird,
00:11:46verstehen Sie, dass es
00:11:47bei allen drei
00:11:48viel Caching gibt.
00:11:49Was bedeutet das
00:11:51in etwa?
00:11:52Nun,
00:11:52das große Ding ist Kimi,
00:11:53oder?
00:11:55Sehr schwer
00:11:56bei den Tokens
00:11:57und es dauerte ewig.
00:11:59Es dauerte eineinhalb
00:12:00Stunden.
00:12:00Ehrlich gesagt,
00:12:01als ich dieses Video machte,
00:12:01dachte ich,
00:12:02oh,
00:12:02vielleicht mache ich
00:12:03wissen Sie,
00:12:03drei,
00:12:04vielleicht sogar vier Beispiele.
00:12:05Nein,
00:12:06ich sitze hier nicht
00:12:0720 Stunden lang daran.
00:12:09Und,
00:12:09wissen Sie,
00:12:10also weit hinten
00:12:11in diesen zwei Punkten
00:12:12gegenüber den Frontier-Modellen,
00:12:13aber insgesamt,
00:12:14war die Ausgabe solide.
00:12:15Wissen Sie,
00:12:15ich dachte, es hat
00:12:16einen wirklich guten Job gemacht,
00:12:17alles in allem.
00:12:18Und das teuerste
00:12:19von allen,
00:12:20offensichtlich,
00:12:20war Fable.
00:12:21wobei Codex
00:12:22am günstigsten war.
00:12:24Was können wir also wirklich
00:12:26daraus lernen?
00:12:27Nun,
00:12:27ich denke, was wir
00:12:29zumindest hier
00:12:29im Frontend-Bereich lernen,
00:12:31und das gilt wahrscheinlich
00:12:32auch für das Coding,
00:12:32wenn wir die
00:12:33Benchmarks
00:12:33für bare Münze nehmen,
00:12:34ist, dass Kimi
00:12:36mithalten kann.
00:12:37Kimi K3
00:12:38ist ein Open-Source-Modell,
00:12:39das mit Fable
00:12:40in 5.6 mithalten kann.
00:12:42Allerdings
00:12:43ist es nicht so günstig,
00:12:45wie man erwarten würde.
00:12:46In bestimmten Fällen
00:12:47ist es teurer.
00:12:49Und es ist einfach langsam.
00:12:51Es ist wirklich so langsam.
00:12:54Was für viele Leute
00:12:55ein Ausschlusskriterium
00:12:55darstellen könnte,
00:12:56je nachdem, was man tut.
00:12:58Aber,
00:12:58wenn das für Sie in Ordnung ist,
00:13:01wissen Sie,
00:13:02dann ist das vielleicht
00:13:03gar kein so großer Nachteil.
00:13:03Aber ich glaube,
00:13:04das Wichtigste,
00:13:05das bei all den Benchmarks
00:13:06und Zahlen
00:13:06etwas untergeht,
00:13:07sind wirklich die Kosten.
00:13:08Oder?
00:13:09Denn es ist nicht
00:13:09so günstig,
00:13:10wie man erwarten würde,
00:13:11aufgrund der Ineffizienz,
00:13:12wenn es darum geht,
00:13:12tatsächlich Token zu nutzen.
00:13:14Daher verabschiede ich mich nun von euch.
00:13:15Ich hoffe, ich konnte
00:13:16etwas mehr Klarheit
00:13:16über Kimi K3 schaffen.
00:13:17Ich finde es fantastisch.
00:13:18Wir haben ein Open-Source-Modell,
00:13:19das mithalten kann.
00:13:20Aber lasst uns nicht
00:13:21zu voreilig sein,
00:13:22was die rohe Leistung
00:13:23und speziell
00:13:23die Kosten angeht.
00:13:24Sowohl in Bezug auf
00:13:25Geld
00:13:26als auch Zeit.
00:13:27Lasst mich also in den Kommentaren
00:13:28wissen, was ihr denkt.
00:13:29Checkt unbedingt
00:13:30Chase AIA Plus aus,
00:13:31falls ihr euch
00:13:31meine Cloud Code Masterclass
00:13:32holen wollt,
00:13:32die heutzutage auch
00:13:33eine Codex Masterclass
00:13:34beinhaltet.
00:13:35Davon abgesehen,
00:13:36sehen wir uns bald.
00:13:37Und das war es.
00:13:39Bis zum nächsten Mal.

핵심 요약

Kimi K3 ist zwar bei den Token-Listenpreisen günstiger, verliert jedoch durch mangelnde Token-Effizienz und langsame Verarbeitungszeiten den Wettbewerbsvorteil gegenüber Modellen wie Fable 5 oder GPT 5.6.

하이라이트

  • Kimi K3 ist ein Open-Weight-Modell mit 2,8 Billionen Parametern, das in Programmier-Benchmarks mit GPT 5.6 und Fable 5 konkurriert.

  • Die Eingabekosten für Kimi K3 liegen bei 3 $ pro Million Token, was 60 % der Kosten von GPT 5.6 und 30 % der Kosten von Fable 5 entspricht.

  • Trotz niedrigerer Token-Preise ist die reale Kosten-pro-Intelligenz-Effizienz von Kimi K3 mit 0,95 $ kaum günstiger als die 1,04 $ von GPT 5.6.

  • Kimi K3 benötigt für eine 3D-Dashboard-Aufgabe 21,5 Millionen Token und 93 Minuten Laufzeit, während Fable 5 dieselbe Aufgabe mit 3,5 Millionen Token in 17 Minuten erledigt.

  • Im Halluzinations-Benchmark erreicht Fable 5 einen Wert von 40 Punkten, gefolgt von GPT 5.6 mit 22 Punkten und Kimi K3 mit 18 Punkten.

타임라인

Benchmark-Analyse von Kimi K3

  • Kimi K3 tritt als 2,8 Billionen Parameter Modell gegen GPT 5.6 und Fable 5 an.
  • Benchmark-Ergebnisse auf arena.ai zeigen eine hohe Performance bei Frontend-Aufgaben.
  • Die Listenpreise für Kimi K3 liegen bei 3 $ (Input) pro Million Token.

Kimi K3 wird als Open-Weight-Modell präsentiert, das für den Betrieb massiver Hardware bedarf. Trotz beeindruckender Zahlen in Programmier-Benchmarks und hoher Beliebtheit in subjektiven Tests auf arena.ai, weist das Modell erhebliche Preisvorteile auf dem Papier auf. Diese Preisgestaltung unterscheidet sich jedoch signifikant von der realen Kosten-Effizienz.

Reale Kosten- und Geschwindigkeitseffizienz

  • Kimi K3 zeigt eine schlechtere Token-Effizienz als GPT 5.6 und Fable 5.
  • Die Verarbeitungszeit von Kimi K3 liegt bei sechs Minuten, während GPT 5.6 4,7 Minuten benötigt.
  • Der Omniscience Index zur Halluzinationsmessung ordnet Kimi K3 mit 18 Punkten hinter Fable 5 (40 Punkte) ein.

Unabhängige Analysen zeigen, dass Kimi K3 weniger token-effizient ist und langsamer arbeitet als Konkurrenzmodelle. Die Kostenersparnis gegenüber GPT 5.6 beträgt weniger als 10 %, was die Attraktivität durch bloße Listenpreise relativiert. Zusätzlich weist der Omniscience Index darauf hin, dass Kimi K3 in Kontexten mit hoher Nuance anfälliger für falsche Antworten ist.

Praktischer Frontend-Vergleich

  • Fable 5 liefert die sauberste Benutzeroberfläche mit interaktiver Tag-Nacht-Schaltung.
  • Kimi K3 produziert solide Ergebnisse, zeigt aber Schwächen bei der Zoom-Funktion und Detailtiefe.
  • GPT 5.6 schneidet im direkten Vergleich mit unübersichtlicher Textdarstellung am schwächsten ab.

Beim Bau eines 3D-Globus-Reise-Dashboards zeigt sich eine klare Rangfolge in der UI-Qualität. Fable 5 überzeugt durch klare Grafiken und intuitive Features wie eine Zeitsteuerung. Kimi K3 positioniert sich auf dem zweiten Platz mit funktionaler Ausgabe, während GPT 5.6 durch schlechte Lesbarkeit und visuelle Mängel den dritten Platz belegt.

Ressourcenverbrauch und Gesamtfazit

  • Kimi K3 verbrauchte für das Dashboard 21,5 Millionen Token und 93 Minuten Rechenzeit.
  • Fable 5 benötigte für dasselbe Projekt 3,5 Millionen Token und 17 Minuten.
  • Die hohen Gesamtkosten und langen Wartezeiten machen Kimi K3 für viele Anwendungsbereiche ineffizient.

Die finale Messung offenbart, dass Kimi K3 trotz günstigerer Token-Preise aufgrund des extrem hohen Verbrauchs und der langen Rechenzeit keine echte Kosten-Alternative zu Modellen wie Fable 5 darstellt. Während das Modell in der Lage ist, qualitativ solide Arbeit zu leisten, stellen die Geschwindigkeit und Ineffizienz beim Token-Verbrauch in der Praxis signifikante Nachteile dar.

커뮤니티 글

모든 글 보기