스크립트
00:00:00Momentan gibt es ein Top-Modell, das man völlig kostenlos nutzen kann, und niemand weiß, was es ist.
00:00:04Es heißt Oxalpha und ist kostenlos auf Open Router, OpenCode, Klein und News Portal verfügbar. Es hat ein
00:00:081-Millionen-Token-Kontextfenster, verarbeitet Text, Bilder sowie Videos und liefert wirklich
00:00:13beeindruckende Ergebnisse. Und obwohl niemand verrät, was es ist, haben wir einige ziemlich gute Hinweise.
00:00:22Das Ganze fing an, als OpenCode twitterte: Oxalpha-Stealth-Modell für die nächste Woche kostenlos.
00:00:261 Million Kontext, multimodal, keine Datenspeicherung und Kapazitäten für ein Hundertillionen
00:00:31Tokens pro Tag. Darauf folgte eine Ankündigung von Open Router, und News Research
00:00:36gab an, sie hätten eine Kapazität von einer Billiarde Tokens pro Tag. Verdammt, das ist ein verdammt großer
00:00:40Stealth-Launch! Bevor wir nun Detektiv spielen, lohnt sich die Frage: Lohnt sich das überhaupt?
00:00:44Ist dieses Modell tatsächlich gut? Die Antwort ist gemischt. Klein twitterte diesen Benchmark, der zeigt,
00:00:49wie es Fable und Soul bei Deep SW Bench ziemlich deutlich schlägt. Meiner Meinung nach ist das jedoch irreführend, und
00:00:54wer behauptet, das sei besser als Fable, betreibt Clickbait oder übertreibt maßlos. Ich bin
00:00:58nicht hier, um das zu tun – abonniert also gerne, wenn ihr das zu schätzen wisst. Die Quelle dafür war Bens Tweet,
00:01:03in dem er es durch 10 Aufgaben auf Deep SWE jagte. Ja, dabei schlug es GPT 5.6, aber bei einem
00:01:08vollständigeren Durchlauf liegt es eher bei 63 %, was es in die Nähe von Grok, DeepSeek, Gemini oder Fable
00:01:14und Soul 5.6 bei mittlerem Aufwand bringt. Behaltet das für eure Vergleiche im Hinterkopf! Etwas anderes
00:01:18Interessantes ist jedoch, dass es anscheinend im Schnitt 47.000 Ausgabe-Tokens lieferte, was es näher an die kommerziellen
00:01:23Modelle rückt. Aber ich muss sagen, ich glaube nicht, dass es eines ist. Es gibt im Moment einfach so viele Spekulationen auf Twitter,
00:01:28dass wir uns – anstatt all diese konkurrierenden Benchmarks zu vergleichen – einfach selbst ein Bild machen sollten.
00:01:32Also habe ich die üblichen Tests durchgeführt, die ich bei allen Modellen mache, wenn sie veröffentlicht werden. Der erste
00:01:36betrifft ein persönliches Finanzmanagement-Dashboard mit einer Menge Funktionen, ohne ihm jedoch den zu
00:01:40verwendenden Tech-Stack vorzugeben. Ich wollte einfach eine Full-Stack-Anwendung, da ich ziemlich neugierig bin, welchen Tech-Stack diese
00:01:44Modelle tatsächlich wählen. Hier seht ihr, ich habe Oxalpha verwendet, es hat 84.000 Tokens verbraucht und lief tatsächlich 45 Minuten lang.
00:01:50Das Gute ist jedoch: Dieses Modell ist völlig kostenlos. Ich habe es außerdem verglichen mit Fable Medium, Soul
00:01:55Medium, DeepSeek, GLM 5.3, Gemini 3.7 Flash und Kimi K3. Da ich mir ziemlich sicher bin, dass dies ein offenes Modell ist,
00:02:01möchte ich es mit ihnen vergleichen, bin aber auch gespannt, wie es gegen die Spitzenmodelle abschneidet.
00:02:05Das war das Ergebnis, das mir Oxalpha in diesem einzigen Prompt geliefert hat, und ich muss sagen, ich bin ziemlich
00:02:09beeindruckt. Das ist eine unglaublich gut nutzbare App, mir gefällt die UI, sie sieht ziemlich nach Shadcn aus. All diese
00:02:15Seiten funktionieren, ich habe überprüft, dass die Funktionen intakt sind, und insgesamt, wie gesagt, ist es eine nutzbare App. Ich könnte sie
00:02:20selbst verwenden. Wenn ich eine persönliche Software entwickeln würde, würde ich mich nicht beschweren, wenn sie so aussähe.
00:02:24Was den eigentlichen Code angeht, hat es ebenfalls einen ziemlich vernünftigen Stack gewählt. Es hat Next.js verwendet, was
00:02:28mich wirklich nicht stört, und es hat außerdem Drizzle und Better SQLite eingesetzt, was ein sehr guter Schritt ist. Es nutzte
00:02:33eine echte Datenbank, was einige dieser Modelle nicht tun. Insgesamt hat es bei dieser App für ein persönliches Finanz-Dashboard wirklich gute Arbeit geleistet,
00:02:37einen guten Stack gewählt und die App ist einsatzbereit. Als Nächstes sehen wir, was
00:02:42DeepSeek V4 Pro mir geliefert hat, und ich muss sagen, als ich das das erste Mal sah, dachte ich, Oxalpha könnte eines
00:02:46der DeepSeek-Modelle sein, da diese UIs unglaublich ähnlich sind. Aber auch hier gilt: Dies ist eine
00:02:50sehr gut nutzbare UI, daran gab es nichts zu meckern. Es sieht sehr nach einer Shadcn-App aus, und all diese Reiter für
00:02:55Konten, Transaktionen und Ziele funktionieren, außer dass es eigentlich keine Reiter sind, sondern man einfach zu einem anderen
00:02:59Punkt auf der Seite springt. Das unterscheidet sich also ein wenig von Oxalpha, aber die UIs sind
00:03:03unglaublich ähnlich und der Code im Wesentlichen auch. Wenn wir uns den gewählten Stack ansehen, hat es ebenfalls Next.js
00:03:08und Better SQLite gewählt. Der einzige Unterschied ist, dass es kein Drizzle nutzte, sondern seinen eigenen Weg ging,
00:03:12indem es direkt auf die Datenbank zugriff. Ich hätte diese Drizzle-Schicht bevorzugt. DeepSeek hat für diese Aufgabe tatsächlich 15
00:03:16Minuten gebraucht und 19 Cent gekostet. Und obwohl es viele Ähnlichkeiten mit Oxalpha gibt, glaube ich nicht,
00:03:21dass es Oxalpha ist – und ihr werdet gleich erfahren, warum. Um mit den offenen Modellen fortzufahren, sehen wir hier,
00:03:25was Kimi K3 mir geliefert hat, das viele für das beste offene Modell im Moment halten.
00:03:29Dieses brauchte tatsächlich 38 Minuten und kostete mich 1 Dollar und 92 Cent, preislich gab es hier also einen ziemlichen Sprung.
00:03:34Auch dieses sieht dem, was wir von Oxalpha kennen, sehr ähnlich. Oxalpha ist definitiv ein chinesisches
00:03:39offenes Modell oder basiert zumindest darauf, da sie alle im Grunde dasselbe UI-Design verwenden. Man sieht,
00:03:44dass alles funktioniert; es hat ein schönes Dashboard, wir haben eine Kontoseite, Transaktionen und Ziele. Dieses hier ähnelt
00:03:48Oxalpha insofern etwas mehr, als dafür tatsächlich separate Seiten angelegt wurden. Aber auch hier sieht alles ziemlich
00:03:52standardmäßig aus und ist einsatzbereit. Wo sich Kimi jedoch stark unterscheidet, ist der Code: Es hat einfach
00:03:56ein einfaches React-Frontend gewählt, ohne Routing oder dergleichen. Und für das
00:04:00Backend wählte es einen Express-Server sowie Node SQLite für die Datenbank. Es hat also zwar eine Datenbank,
00:04:05aber um ehrlich zu sein, bevorzuge ich für 1 Dollar und 92 Cent das, was mir Oxalpha und DeepSeek geliefert haben,
00:04:10nämlich eine vollständige Next.js-App, die ich in Zukunft skalieren kann. Nun mache ich einen kurzen Abstecher
00:04:14weg von den offenen Modellen und konzentriere mich auf die geschlossenen. Das hat mir Fable Medium geliefert: Da es sich
00:04:19offensichtlich auf diesem mittleren Level befindet, möchte es nicht lange nachdenken, weshalb es nur 3 Minuten und 42 Sekunden dauerte,
00:04:23mich aber dennoch 2 Dollar und 60 Cent kostete – das mit Abstand teuerste von allen.
00:04:27Die Ergebnisse sind ziemlich ernüchternd: Es ist nur eine einzelne Seite. Sie tut zwar, was sie verspricht, ich kann Geld
00:04:32senden, Guthaben aufladen und das alles funktioniert – aber das ist nur eine einfache React-App mit einem Express-
00:04:36Backend, und sie verwendet noch nicht mal eine echte Datenbank, sondern speichert alles im Arbeitsspeicher von JavaScript. Wenn ich die Seite
00:04:41also aktualisiere, ist alles weg. Ich denke, das Fazit hierbei ist: Wenn man nicht zu einigen
00:04:45dieser offenen Modelle wechselt, um bei diesen komplexeren Denkvorgängen Geld zu sparen, verpasst man definitiv etwas.
00:04:49Ein ziemlich ähnliches Bild ergibt sich bei GPT 5.6 Soul auf mittlerem Aufwandsniveau. Es ist eine recht nette UI,
00:04:54das sieht sehr nach GPT aus, es liebt all diese Monospace-Akzente sowie diese Seitenränder, aber ich
00:04:58kann mich über das Aussehen der UI nicht wirklich beschweren. Allerdings funktionieren die Funktionen nicht wirklich: Wir können weder den Reiter
00:05:03für Konten noch Transaktionen, Investitionen oder Ziele aufrufen, sie wurden nicht implementiert. Man kann Geld senden und Guthaben aufladen,
00:05:08aber es wurde als Next.js-App gebaut, ohne wiederum eine echte Datenbank zu verwenden. Es wird
00:05:12wiederum alles in JavaScript gespeichert, wahrscheinlich weil es dafür nur vier Minuten aufgewendet hat und es
00:05:16mich 33 Cent gekostet hat. Das letzte geschlossene Modell, das ich ausprobiert habe, war Gemini 3.7 Flash, und das auf einer
00:05:21hohen Stufe, da es in den Benchmarks damit übereinstimmt. Man sieht, dass dies eine sehr ähnliche UI ist wie die,
00:05:26die uns die offenen Modelle geliefert haben. Ich nenne das mal die letzte Generation von KI-UIs, sie hat immer diesen ähnlichen
00:05:31Stil, wobei Fable und OpenAI anscheinend davon abrücken. Hier funktioniert jedoch alles und
00:05:36all diese Reiter funktionieren tatsächlich und enthalten Inhalte – Pluspunkte also für Gemini 3.7
00:05:41Flash an dieser Stelle. Das Ganze dauerte etwa 10 Minuten und kostete 50 Cent. Was den gewählten
00:05:46Tech-Stack angeht: Es handelt sich hierbei tatsächlich um eine Next.js-Anwendung, allerdings wurde keine echte Datenbank verwendet, womit es GPT 5.6 recht ähnlich ist.
00:05:50Kommen wir also zu unserem letzten Vergleich: GLM 5.3. Ich habe mir dieses aus gutem Grund bis zum Schluss aufgehoben.
00:05:56Wie ihr seht, ist die UI ziemlich schön, sie schlägt einen anderen Stil ein als die anderen, hat aber immer noch
00:06:00etwas von diesem Grün, das anscheinend alle verwenden. Dieses hier hat sich tatsächlich für einen Light-Modus entschieden, und was
00:06:04die Funktionen angeht, gleicht es im Wesentlichen all den anderen, und sie sind alle
00:06:08voll funktionsfähig. Die Generierung dieses Modells dauerte etwa 15 Minuten, und wie sich herausstellte, kostete es mich fünf Dollar,
00:06:13was es somit zum teuersten macht. Der interessante Teil betrifft jedoch den gewählten Stack:
00:06:17Es wählte eine Next.js-Anwendung, nutzte Better SQLite sowie Drizzle – es ist also exakt dasselbe
00:06:23Setup wie bei Oxalpha. Als ich das sah, beschloss ich Claude zu bitten, all diese Codebasen zu vergleichen,
00:06:28nach Gemeinsamkeiten zu suchen und einzuschätzen, welches Modell das Stealth-Modell sein könnte. Dies ist eine Zusammenfassung
00:06:32von Claudes Ergebnissen: Wie ihr seht, hält es das Stealth-Modell für ein GLM-Modell. Betrachtet man die Tests,
00:06:36die Claude durchgeführt hat, bestand einer darin, strukturelle Muster zu vergleichen – also Dinge wie die Zusammensetzung von Komponenten
00:06:40–, und es stellte fest, dass GLM 5.3 22,4 % Übereinstimmung mit dem Stealth-Modell aufweist, was höher ist als
00:06:46bei allen anderen. Das einzige, das nahe herankommt, ist DeepSeek mit 19 %. Allerdings wird angemerkt, dass dies ein
00:06:50falsch-positives Ergebnis sein könnte, da Drizzle sowohl in Oxalpha als auch in GLM 5.3 verwendet wurde und dies die einzigen sind,
00:06:55die es einsetzen. Wenn man Drizzle herausrechnet, hat DeepSeek tatsächlich am meisten mit unserem Stealth-
00:07:00Modell gemeinsam. Könnte es sich hierbei also tatsächlich um ein DeepSeek-Modell handeln? Nun, die Antwort lautet wahrscheinlich nein, denn als Nächstes
00:07:04wurden einige seltene Merkmale untersucht – nicht offensichtliche Entscheidungen in jeder Codebasis –, und es zeigte sich, dass das Stealth-
00:07:08Modell und GLM 5.3 viele davon teilten. Beide verwendeten eine Pass-Amount-To-Cents-Funktion, und diese Funktion war
00:07:14praktisch identisch. Beide nutzten Drizzle ORM und beide schrieben außerdem die README neu; keines der anderen
00:07:18Projekte tat dies. Dies waren die einzigen, die die README umschrieben, und die README selbst besitzt eine identische
00:07:23Struktur. Aus all dieser Analyse ist es also ziemlich wahrscheinlich, dass dies ein GLM-Modell ist oder zumindest GLM als Basis verwendet hat.
00:07:29Man muss sich dabei nicht nur auf mein Wort verlassen; viele andere haben sich das ebenfalls angesehen und herausgefunden,
00:07:33dass der Tokenizer praktisch identisch mit dem von GLM ist, es gibt dieselben Fehlermeldungen aus wie GLM-Modelle und
00:07:38vielleicht der stärkste Hinweis: Der Video-Encoder in diesem Modell verwendet exakt dieselben Tokens wie das GLM-
00:07:43Vision-Modell. Ich werde den Link zu dieser Seite unten verlinken, die eine Liste weiterer Ähnlichkeiten enthält, aber ich denke,
00:07:47es ist ziemlich offensichtlich, dass dies ein GLM-Modell ist. Es könnte sich um GLM 5.5 handeln, das jetzt multimodal ist,
00:07:52oder vielleicht um eine post-trainierte Version von GLM 5.3 oder – noch spannender – um eine Flash-Version. Es muss
00:07:57nicht einmal von ZAI sein, da GLM offen ist, könnte dies ein anderes Unternehmen sein, das GLM als Basis genommen
00:08:02hat. Insgesamt ist es jedoch einfach ein sehr kompetentes Modell zu einem unschlagbaren Preis.
00:08:07Und das läuft noch bis zum 27., nutzt es also, solange ihr könnt! Wisst nur, dass Prompts und
00:08:11Completions vom Anbieter gespeichert werden, aber anscheinend nicht für das Training verwendet werden. Was glaubt
00:08:15ihr, was dieses Modell ist? Lasst es mich in den Kommentaren unten wissen und abonniert in der Zwischenzeit,
00:08:19wie immer. Bis zum nächsten Mal!
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기