Ox Alpha – Nutze das, solange es KOSTENLOS ist (Stealth-Modell)

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Momentan gibt es ein Top-Modell, das man völlig kostenlos nutzen kann, und niemand weiß, was es ist.
00:00:04Es heißt Oxalpha und ist kostenlos auf Open Router, OpenCode, Klein und News Portal verfügbar. Es hat ein
00:00:081-Millionen-Token-Kontextfenster, verarbeitet Text, Bilder sowie Videos und liefert wirklich
00:00:13beeindruckende Ergebnisse. Und obwohl niemand verrät, was es ist, haben wir einige ziemlich gute Hinweise.
00:00:22Das Ganze fing an, als OpenCode twitterte: Oxalpha-Stealth-Modell für die nächste Woche kostenlos.
00:00:261 Million Kontext, multimodal, keine Datenspeicherung und Kapazitäten für ein Hundertillionen
00:00:31Tokens pro Tag. Darauf folgte eine Ankündigung von Open Router, und News Research
00:00:36gab an, sie hätten eine Kapazität von einer Billiarde Tokens pro Tag. Verdammt, das ist ein verdammt großer
00:00:40Stealth-Launch! Bevor wir nun Detektiv spielen, lohnt sich die Frage: Lohnt sich das überhaupt?
00:00:44Ist dieses Modell tatsächlich gut? Die Antwort ist gemischt. Klein twitterte diesen Benchmark, der zeigt,
00:00:49wie es Fable und Soul bei Deep SW Bench ziemlich deutlich schlägt. Meiner Meinung nach ist das jedoch irreführend, und
00:00:54wer behauptet, das sei besser als Fable, betreibt Clickbait oder übertreibt maßlos. Ich bin
00:00:58nicht hier, um das zu tun – abonniert also gerne, wenn ihr das zu schätzen wisst. Die Quelle dafür war Bens Tweet,
00:01:03in dem er es durch 10 Aufgaben auf Deep SWE jagte. Ja, dabei schlug es GPT 5.6, aber bei einem
00:01:08vollständigeren Durchlauf liegt es eher bei 63 %, was es in die Nähe von Grok, DeepSeek, Gemini oder Fable
00:01:14und Soul 5.6 bei mittlerem Aufwand bringt. Behaltet das für eure Vergleiche im Hinterkopf! Etwas anderes
00:01:18Interessantes ist jedoch, dass es anscheinend im Schnitt 47.000 Ausgabe-Tokens lieferte, was es näher an die kommerziellen
00:01:23Modelle rückt. Aber ich muss sagen, ich glaube nicht, dass es eines ist. Es gibt im Moment einfach so viele Spekulationen auf Twitter,
00:01:28dass wir uns – anstatt all diese konkurrierenden Benchmarks zu vergleichen – einfach selbst ein Bild machen sollten.
00:01:32Also habe ich die üblichen Tests durchgeführt, die ich bei allen Modellen mache, wenn sie veröffentlicht werden. Der erste
00:01:36betrifft ein persönliches Finanzmanagement-Dashboard mit einer Menge Funktionen, ohne ihm jedoch den zu
00:01:40verwendenden Tech-Stack vorzugeben. Ich wollte einfach eine Full-Stack-Anwendung, da ich ziemlich neugierig bin, welchen Tech-Stack diese
00:01:44Modelle tatsächlich wählen. Hier seht ihr, ich habe Oxalpha verwendet, es hat 84.000 Tokens verbraucht und lief tatsächlich 45 Minuten lang.
00:01:50Das Gute ist jedoch: Dieses Modell ist völlig kostenlos. Ich habe es außerdem verglichen mit Fable Medium, Soul
00:01:55Medium, DeepSeek, GLM 5.3, Gemini 3.7 Flash und Kimi K3. Da ich mir ziemlich sicher bin, dass dies ein offenes Modell ist,
00:02:01möchte ich es mit ihnen vergleichen, bin aber auch gespannt, wie es gegen die Spitzenmodelle abschneidet.
00:02:05Das war das Ergebnis, das mir Oxalpha in diesem einzigen Prompt geliefert hat, und ich muss sagen, ich bin ziemlich
00:02:09beeindruckt. Das ist eine unglaublich gut nutzbare App, mir gefällt die UI, sie sieht ziemlich nach Shadcn aus. All diese
00:02:15Seiten funktionieren, ich habe überprüft, dass die Funktionen intakt sind, und insgesamt, wie gesagt, ist es eine nutzbare App. Ich könnte sie
00:02:20selbst verwenden. Wenn ich eine persönliche Software entwickeln würde, würde ich mich nicht beschweren, wenn sie so aussähe.
00:02:24Was den eigentlichen Code angeht, hat es ebenfalls einen ziemlich vernünftigen Stack gewählt. Es hat Next.js verwendet, was
00:02:28mich wirklich nicht stört, und es hat außerdem Drizzle und Better SQLite eingesetzt, was ein sehr guter Schritt ist. Es nutzte
00:02:33eine echte Datenbank, was einige dieser Modelle nicht tun. Insgesamt hat es bei dieser App für ein persönliches Finanz-Dashboard wirklich gute Arbeit geleistet,
00:02:37einen guten Stack gewählt und die App ist einsatzbereit. Als Nächstes sehen wir, was
00:02:42DeepSeek V4 Pro mir geliefert hat, und ich muss sagen, als ich das das erste Mal sah, dachte ich, Oxalpha könnte eines
00:02:46der DeepSeek-Modelle sein, da diese UIs unglaublich ähnlich sind. Aber auch hier gilt: Dies ist eine
00:02:50sehr gut nutzbare UI, daran gab es nichts zu meckern. Es sieht sehr nach einer Shadcn-App aus, und all diese Reiter für
00:02:55Konten, Transaktionen und Ziele funktionieren, außer dass es eigentlich keine Reiter sind, sondern man einfach zu einem anderen
00:02:59Punkt auf der Seite springt. Das unterscheidet sich also ein wenig von Oxalpha, aber die UIs sind
00:03:03unglaublich ähnlich und der Code im Wesentlichen auch. Wenn wir uns den gewählten Stack ansehen, hat es ebenfalls Next.js
00:03:08und Better SQLite gewählt. Der einzige Unterschied ist, dass es kein Drizzle nutzte, sondern seinen eigenen Weg ging,
00:03:12indem es direkt auf die Datenbank zugriff. Ich hätte diese Drizzle-Schicht bevorzugt. DeepSeek hat für diese Aufgabe tatsächlich 15
00:03:16Minuten gebraucht und 19 Cent gekostet. Und obwohl es viele Ähnlichkeiten mit Oxalpha gibt, glaube ich nicht,
00:03:21dass es Oxalpha ist – und ihr werdet gleich erfahren, warum. Um mit den offenen Modellen fortzufahren, sehen wir hier,
00:03:25was Kimi K3 mir geliefert hat, das viele für das beste offene Modell im Moment halten.
00:03:29Dieses brauchte tatsächlich 38 Minuten und kostete mich 1 Dollar und 92 Cent, preislich gab es hier also einen ziemlichen Sprung.
00:03:34Auch dieses sieht dem, was wir von Oxalpha kennen, sehr ähnlich. Oxalpha ist definitiv ein chinesisches
00:03:39offenes Modell oder basiert zumindest darauf, da sie alle im Grunde dasselbe UI-Design verwenden. Man sieht,
00:03:44dass alles funktioniert; es hat ein schönes Dashboard, wir haben eine Kontoseite, Transaktionen und Ziele. Dieses hier ähnelt
00:03:48Oxalpha insofern etwas mehr, als dafür tatsächlich separate Seiten angelegt wurden. Aber auch hier sieht alles ziemlich
00:03:52standardmäßig aus und ist einsatzbereit. Wo sich Kimi jedoch stark unterscheidet, ist der Code: Es hat einfach
00:03:56ein einfaches React-Frontend gewählt, ohne Routing oder dergleichen. Und für das
00:04:00Backend wählte es einen Express-Server sowie Node SQLite für die Datenbank. Es hat also zwar eine Datenbank,
00:04:05aber um ehrlich zu sein, bevorzuge ich für 1 Dollar und 92 Cent das, was mir Oxalpha und DeepSeek geliefert haben,
00:04:10nämlich eine vollständige Next.js-App, die ich in Zukunft skalieren kann. Nun mache ich einen kurzen Abstecher
00:04:14weg von den offenen Modellen und konzentriere mich auf die geschlossenen. Das hat mir Fable Medium geliefert: Da es sich
00:04:19offensichtlich auf diesem mittleren Level befindet, möchte es nicht lange nachdenken, weshalb es nur 3 Minuten und 42 Sekunden dauerte,
00:04:23mich aber dennoch 2 Dollar und 60 Cent kostete – das mit Abstand teuerste von allen.
00:04:27Die Ergebnisse sind ziemlich ernüchternd: Es ist nur eine einzelne Seite. Sie tut zwar, was sie verspricht, ich kann Geld
00:04:32senden, Guthaben aufladen und das alles funktioniert – aber das ist nur eine einfache React-App mit einem Express-
00:04:36Backend, und sie verwendet noch nicht mal eine echte Datenbank, sondern speichert alles im Arbeitsspeicher von JavaScript. Wenn ich die Seite
00:04:41also aktualisiere, ist alles weg. Ich denke, das Fazit hierbei ist: Wenn man nicht zu einigen
00:04:45dieser offenen Modelle wechselt, um bei diesen komplexeren Denkvorgängen Geld zu sparen, verpasst man definitiv etwas.
00:04:49Ein ziemlich ähnliches Bild ergibt sich bei GPT 5.6 Soul auf mittlerem Aufwandsniveau. Es ist eine recht nette UI,
00:04:54das sieht sehr nach GPT aus, es liebt all diese Monospace-Akzente sowie diese Seitenränder, aber ich
00:04:58kann mich über das Aussehen der UI nicht wirklich beschweren. Allerdings funktionieren die Funktionen nicht wirklich: Wir können weder den Reiter
00:05:03für Konten noch Transaktionen, Investitionen oder Ziele aufrufen, sie wurden nicht implementiert. Man kann Geld senden und Guthaben aufladen,
00:05:08aber es wurde als Next.js-App gebaut, ohne wiederum eine echte Datenbank zu verwenden. Es wird
00:05:12wiederum alles in JavaScript gespeichert, wahrscheinlich weil es dafür nur vier Minuten aufgewendet hat und es
00:05:16mich 33 Cent gekostet hat. Das letzte geschlossene Modell, das ich ausprobiert habe, war Gemini 3.7 Flash, und das auf einer
00:05:21hohen Stufe, da es in den Benchmarks damit übereinstimmt. Man sieht, dass dies eine sehr ähnliche UI ist wie die,
00:05:26die uns die offenen Modelle geliefert haben. Ich nenne das mal die letzte Generation von KI-UIs, sie hat immer diesen ähnlichen
00:05:31Stil, wobei Fable und OpenAI anscheinend davon abrücken. Hier funktioniert jedoch alles und
00:05:36all diese Reiter funktionieren tatsächlich und enthalten Inhalte – Pluspunkte also für Gemini 3.7
00:05:41Flash an dieser Stelle. Das Ganze dauerte etwa 10 Minuten und kostete 50 Cent. Was den gewählten
00:05:46Tech-Stack angeht: Es handelt sich hierbei tatsächlich um eine Next.js-Anwendung, allerdings wurde keine echte Datenbank verwendet, womit es GPT 5.6 recht ähnlich ist.
00:05:50Kommen wir also zu unserem letzten Vergleich: GLM 5.3. Ich habe mir dieses aus gutem Grund bis zum Schluss aufgehoben.
00:05:56Wie ihr seht, ist die UI ziemlich schön, sie schlägt einen anderen Stil ein als die anderen, hat aber immer noch
00:06:00etwas von diesem Grün, das anscheinend alle verwenden. Dieses hier hat sich tatsächlich für einen Light-Modus entschieden, und was
00:06:04die Funktionen angeht, gleicht es im Wesentlichen all den anderen, und sie sind alle
00:06:08voll funktionsfähig. Die Generierung dieses Modells dauerte etwa 15 Minuten, und wie sich herausstellte, kostete es mich fünf Dollar,
00:06:13was es somit zum teuersten macht. Der interessante Teil betrifft jedoch den gewählten Stack:
00:06:17Es wählte eine Next.js-Anwendung, nutzte Better SQLite sowie Drizzle – es ist also exakt dasselbe
00:06:23Setup wie bei Oxalpha. Als ich das sah, beschloss ich Claude zu bitten, all diese Codebasen zu vergleichen,
00:06:28nach Gemeinsamkeiten zu suchen und einzuschätzen, welches Modell das Stealth-Modell sein könnte. Dies ist eine Zusammenfassung
00:06:32von Claudes Ergebnissen: Wie ihr seht, hält es das Stealth-Modell für ein GLM-Modell. Betrachtet man die Tests,
00:06:36die Claude durchgeführt hat, bestand einer darin, strukturelle Muster zu vergleichen – also Dinge wie die Zusammensetzung von Komponenten
00:06:40–, und es stellte fest, dass GLM 5.3 22,4 % Übereinstimmung mit dem Stealth-Modell aufweist, was höher ist als
00:06:46bei allen anderen. Das einzige, das nahe herankommt, ist DeepSeek mit 19 %. Allerdings wird angemerkt, dass dies ein
00:06:50falsch-positives Ergebnis sein könnte, da Drizzle sowohl in Oxalpha als auch in GLM 5.3 verwendet wurde und dies die einzigen sind,
00:06:55die es einsetzen. Wenn man Drizzle herausrechnet, hat DeepSeek tatsächlich am meisten mit unserem Stealth-
00:07:00Modell gemeinsam. Könnte es sich hierbei also tatsächlich um ein DeepSeek-Modell handeln? Nun, die Antwort lautet wahrscheinlich nein, denn als Nächstes
00:07:04wurden einige seltene Merkmale untersucht – nicht offensichtliche Entscheidungen in jeder Codebasis –, und es zeigte sich, dass das Stealth-
00:07:08Modell und GLM 5.3 viele davon teilten. Beide verwendeten eine Pass-Amount-To-Cents-Funktion, und diese Funktion war
00:07:14praktisch identisch. Beide nutzten Drizzle ORM und beide schrieben außerdem die README neu; keines der anderen
00:07:18Projekte tat dies. Dies waren die einzigen, die die README umschrieben, und die README selbst besitzt eine identische
00:07:23Struktur. Aus all dieser Analyse ist es also ziemlich wahrscheinlich, dass dies ein GLM-Modell ist oder zumindest GLM als Basis verwendet hat.
00:07:29Man muss sich dabei nicht nur auf mein Wort verlassen; viele andere haben sich das ebenfalls angesehen und herausgefunden,
00:07:33dass der Tokenizer praktisch identisch mit dem von GLM ist, es gibt dieselben Fehlermeldungen aus wie GLM-Modelle und
00:07:38vielleicht der stärkste Hinweis: Der Video-Encoder in diesem Modell verwendet exakt dieselben Tokens wie das GLM-
00:07:43Vision-Modell. Ich werde den Link zu dieser Seite unten verlinken, die eine Liste weiterer Ähnlichkeiten enthält, aber ich denke,
00:07:47es ist ziemlich offensichtlich, dass dies ein GLM-Modell ist. Es könnte sich um GLM 5.5 handeln, das jetzt multimodal ist,
00:07:52oder vielleicht um eine post-trainierte Version von GLM 5.3 oder – noch spannender – um eine Flash-Version. Es muss
00:07:57nicht einmal von ZAI sein, da GLM offen ist, könnte dies ein anderes Unternehmen sein, das GLM als Basis genommen
00:08:02hat. Insgesamt ist es jedoch einfach ein sehr kompetentes Modell zu einem unschlagbaren Preis.
00:08:07Und das läuft noch bis zum 27., nutzt es also, solange ihr könnt! Wisst nur, dass Prompts und
00:08:11Completions vom Anbieter gespeichert werden, aber anscheinend nicht für das Training verwendet werden. Was glaubt
00:08:15ihr, was dieses Modell ist? Lasst es mich in den Kommentaren unten wissen und abonniert in der Zwischenzeit,
00:08:19wie immer. Bis zum nächsten Mal!

핵심 요약

Oxalpha ist ein kostenloses Stealth-Modell mit einem 1-Millionen-Token-Kontextfenster, dessen technische Merkmale und Code-Strukturen stark auf eine Basis oder Version von GLM hindeuten.

하이라이트

  • Das Modell Oxalpha bietet ein Kontextfenster von 1 Million Token und verarbeitet Text, Bilder sowie Videos völlig kostenlos.

  • Der Test einer Full-Stack-Anwendung verbrauchte 84.000 Token und lief 45 Minuten lang.

  • Das DeepSeek V4 Pro benötigte 15 Minuten und kostete 19 Cent für dieselbe Anwendung.

  • Kimi K3 kostete 1 Dollar und 92 Cent und nutzte ein einfaches React-Frontend mit einem Express-Server.

  • Fable Medium dauerte 3 Minuten und 42 Sekunden und kostete 2 Dollar und 60 Cent.

  • GLM 5.3 erwies sich mit 5 Dollar als das teuerste Modell in diesem Vergleich.

  • Strukturelle Vergleiche durch Claude zeigen eine hohe Übereinstimmung zwischen Oxalpha und GLM 5.3.

타임라인

Vorstellung von Oxalpha und den Plattformen

  • Oxalpha ist auf Plattformen wie Open Router, OpenCode und Klein verfügbar.
  • Das Modell unterstützt ein Kontextfenster von einer Million Token.
  • OpenCode und Open Research berichten über extrem hohe Kapazitäten von Billionen bis Billiarden Token pro Tag.

Das Stealth-Modell tauchte ohne offizielle Ankündigung des Anbieters auf und unterstützt multimodale Eingaben wie Text, Bilder und Videos. Mehrere Plattformen meldeten massive Token-Kapazitäten für diesen kostenlosen Testzeitraum. Dies löste sofort Spekulationen über den wahren Ursprung und die Identität des Modells aus.

Leistungsvergleich mit Full-Stack-Anwendungen

  • Oxalpha erstellte ein persönliches Finanzmanagement-Dashboard mit Next.js, Drizzle und Better SQLite.
  • Der Generierungsprozess verbrauchte 84.000 Token und dauerte 45 Minuten.
  • Die Benutzeroberfläche und die zugrundeliegende Architektur erwiesen sich als sofort einsatzbereit.

Zur Messung der tatsächlichen Leistung wird eine komplexe Full-Stack-App ohne vorgegebenen Tech-Stack gefordert. Oxalpha liefert in einem einzigen Prompt eine vollständig nutzbare Benutzeroberfläche im Shadcn-Stil. Im Gegensatz zu schwächeren Modellen setzt es dabei auf eine echte relationale Datenbankstruktur.

Vergleich mit DeepSeek V4 Pro und Kimi K3

  • DeepSeek V4 Pro benötigte 15 Minuten und kostete 19 Cent.
  • Kimi K3 kostete 1 Dollar und 92 Cent und nutzte Node SQLite mit einem Express-Server.
  • Die Benutzeroberflächen aller offenen Modelle weisen starke visuelle Ähnlichkeiten auf.

Der direkte Vergleich mit anderen offenen Modellen zeigt deutliche Unterschiede bei Kosten und Architektur. Während DeepSeek V4 Pro einen ähnlichen Tech-Stack wie Oxalpha wählt, verzichtet Kimi K3 auf das Next.js-Framework. Dennoch bieten die offenen Modelle im Vergleich zu geschlossenen Alternativen deutlich bessere Ergebnisse für komplexe App-Entwicklungen.

Vergleich mit geschlossenen Modellen

  • Fable Medium kostete 2 Dollar und 60 Cent und speicherte Daten nur im JavaScript-Arbeitsspeicher.
  • GPT 5.6 Soul kostete 33 Cent, implementierte jedoch wesentliche Reiter nicht.
  • Gemini 3.7 Flash lieferte eine funktionierende Next.js-Anwendung für 50 Cent.

Geschlossene Modelle schneiden bei dieser Programmieraufgabe teilweise überraschend schwach ab. Mehrere kostenpflichtige Alternativen vernachlässigen echte Datenbanken und speichern Daten flüchtig im Arbeitsspeicher. Nur wenige geschlossene Modelle erreichen die funktionale Tiefe der Top-Modelle aus dem Open-Source-Bereich.

Analyse der Code-Gemeinsamkeiten und GLM-Ursprung

  • GLM 5.3 erwies sich mit 5 Dollar als das teuerste Modell im Test.
  • Claude-Analysen zeigen identische Funktionen wie Pass-Amount-To-Cents und gleiche README-Strukturen.
  • Der Video-Encoder und der Tokenizer von Oxalpha stimmen exakt mit GLM überein.

Eine detaillierte Code-Analyse durch Claude deckt spezifische Merkmale auf, die Oxalpha eindeutig mit GLM 5.3 verknüpfen. Identische Code-Abschnitte, Dateistrukturen und Fehlermeldungen bestätigen die Vermutung. Damit handelt es sich bei Oxalpha höchstwahrscheinlich um eine Variante, Flash-Version oder Nachfolgeversion der GLM-Modellfamilie.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기