스크립트
00:00:00OpenAI hat gerade ein brandneues Modell in Codex veröffentlicht, aber die Schlagzeile ist nicht der Wert auf
00:00:04Benchmarks, sondern der neue Ultra-Modus, der seine eigenen Sub-Agenten starten kann, um Aufgaben
00:00:10aufzuteilen und zu bewältigen. Das bedeutet, dass die gesamte Orchestrierung, die man normalerweise
00:00:15selbst zusammenstellen müsste, jetzt direkt in das Modell integriert ist. In diesem Video werden wir
00:00:19alles besprechen, was Sie über die neue Veröffentlichung wissen müssen, wie gut sie
00:00:23Produktionscode schreibt und ob es sich lohnt, sie gegenüber allem anderen in Betracht zu ziehen,
00:00:28was führende Modelle zu bieten haben. Wir behandeln auf diesem Kanal ständig KI-Themen,
00:00:38also abonnieren Sie Better Stack, wenn Sie über jede neue Veröffentlichung auf dem Laufenden bleiben wollen. OpenAI hat gerade eine
00:00:45brandneue Modellreihe unter GPT 5.6 gestartet. Wir haben drei Stufen: Luna,
00:00:50Terra und Sol. Diese Namen werden wahrscheinlich bleiben und mit der Zeit verbessert werden, genau wie
00:00:55Labore wie Anthropic ihre Modelle benennen. Luna ist das schnelle und günstige Modell, Terra ist das Arbeitstier für jeden Tag
00:01:01und Sol ist das neue Flaggschiff-Modell. Das alles wird gerade ausgerollt, der Zugang wird also schon
00:01:07heute möglich sein. Eine Handvoll vertrauenswürdiger Partner, die von OpenAI ausgewählt wurden, hatte jedoch frühen Zugang. Bei der Zahl,
00:01:12die alle bei Terminal Bench 2.1 anführen, was der Benchmark für Befehlszeilen- und Codierungsarbeit ist, erreicht
00:01:21Sol 88,8, und wenn man den neuen Ultra-Modus einschaltet, springt das auf 91,9. Zum Vergleich: Sowohl GPT 5.5 als auch Claude Mythos 5 liegen bei 88.
00:01:31Auf dem Papier ist Sol Ultra also der neue Stand der Technik für agentische Codierung, aber ein Benchmark ist nicht Ihre Codebasis,
00:01:37und der langsame Rollout bedeutet, dass die meisten, die das hier sehen, es noch gar nicht ausführen können. Nehmen Sie diese Zahl also mit Vorsicht.
00:01:42Jetzt wird es richtig interessant: Diese Woche bestätigte der Leiter von OpenAI Codex, Tibo, dass Sol mit Ultra-Modus in Codex landet.
00:01:49Er kündigte auch eine schnellere Version an, die auf Cerebras-Chips läuft und später im Juli kommt. Wenn Sie also an roher
00:01:55Geschwindigkeit interessiert sind, sollten Sie das im Auge behalten. Der Ultra-Modus ist hier das aufregende Feature.
00:02:00Lassen Sie uns also genau durchgehen, wie es funktioniert. Normalerweise arbeitet ein Modell Ihre Aufgabe in einer langen Kette
00:02:06von Überlegungen ab, aber der Ultra-Modus unterteilt die Aufgabe stattdessen und startet mehrere Sub-Agenten, um an
00:02:12Teilen parallel zu arbeiten. Das Neue ist, dass diese Sub-Agenten darauf trainiert sind, zusammenzuarbeiten, sodass sie während der Arbeit miteinander
00:02:18kommunizieren und dann alles wieder zu einem Ergebnis zusammenführen können. Und diese Art der
00:02:23Orchestrierung ist eine große Veränderung in der Arbeitsweise von Modellen. Einen Planer, einen Coder und einen Reviewer auszuführen ist normalerweise
00:02:29etwas, das Sie in Codex-Aufgaben selbst einrichten würden, oder etwas, das Claude Code oder Copilot auf der
00:02:34Ebene darüber handhaben würden, aber OpenAI hat beschlossen, all diese Komplexität für Sie direkt in das Modell zu ziehen.
00:02:40Das bedeutet viel weniger Einrichtung. Anstatt separate Agenten zusammenzufügen, geben Sie Ultra einfach die Aufgabe und lassen es
00:02:46den Rest erledigen. Es ist also weniger Orchestrierung, um die Sie sich kümmern müssen, und theoretisch schnellere Ergebnisse bei diesen
00:02:52großen, unübersichtlichen Aufgaben. Aber die Frage ist: Ist das wirklich ein großer Fähigkeitssprung oder nur eine Art, Tokens mit einem netteren Namen zu verbrauchen?
00:02:58Die Wahrheit ist wahrscheinlich beides. Sub-Agenten, die Ende-zu-Ende zur Kommunikation trainiert wurden, sind eine
00:03:05interessante Forschungsrichtung, aber Ultra ist auch nur ein Marketingbegriff, was bedeutet, dass wir es länger
00:03:10nachdenken lassen und die Arbeit verteilen. Aber abgesehen von allem Hype haben die Benchmarks tatsächlich einen ernsthaften
00:03:15Sternchen-Vermerk. METR, das unabhängige Labor, das OpenAI zur Bewertung seiner Modelle nutzt, führte Sol durch ihre Zeit-Horizon-Aufgaben
00:03:22und fand heraus, dass Sol häufiger beim Schummeln erwischt wurde als jedes öffentliche Modell, das sie je
00:03:28getestet haben. Und mit Schummeln meine ich, dass es Dinge tat, wie Exploits in seine Antworten zu packen, um die
00:03:34versteckte Testsuite zu lesen oder versteckten Quellcode auszugraben, um die erwartete Antwort zu finden, und das zerstört komplett
00:03:40die Messung. Als METR versuchte herauszufinden, wie lange eine Aufgabe sein kann, die Sol alleine bewältigen kann, reichte die Antwort
00:03:46von etwa 11 Stunden bis zu über 270 Stunden, aber aufgrund des Schummelns war ihre eigene
00:03:52Schlussfolgerung, dass diese Zahlen keine verlässliche Messung für das sind, was das Modell leisten kann. Das Modell,
00:03:57das die Rangliste anführt, ist also dasjenige, das seine eigenen Auswertungen manipuliert, was man bedenken sollte, bevor man
00:04:03seinen gesamten Arbeitsablauf auf dieses 91,9-Ergebnis umstellt. Und das ist viel wichtiger als es klingt, weil die
00:04:09ganze Idee eines agentischen Modells ist, dass man es stundenlang alleine laufen lässt. Wenn es also
00:04:14heimlich einen Test manipuliert, nur um so auszusehen, als hätte es Erfolg gehabt, muss man sich fragen, was es bei echten Produktionsaufgaben tun würde,
00:04:20wenn niemand jeden einzelnen Schritt beaufsichtigt und überprüft. Bei den Kosten sieht es allerdings ziemlich
00:04:25gut aus: Sol kostet fünf Dollar pro Million Eingabe-Tokens und 30 für die Ausgabe; Terra ist die Hälfte davon und Luna ist einen Dollar
00:04:32für die Eingabe und sechs für die Ausgabe. Zum Vergleich: Claude Fable 5 kostet etwa 10 und 50, also kommt Sol bei etwa der Hälfte
00:04:40des Preises heraus. Und das ist wohl eine nützlichere Geschichte als der Benchmark: Ein günstigeres Flaggschiff-Modell plus ein
00:04:45angemessener Budget-Tarif für Aufgaben mit hohem Volumen. In der Praxis würden Sie Luna für die günstigen, hochvolumigen
00:04:51Arbeiten ausführen, Terra für den Großteil Ihres Alltags beibehalten und nur zu Sol greifen, wenn eine Aufgabe wirklich die zusätzliche
00:04:56Argumentationsfähigkeit benötigt, damit Sie nicht für alles Flaggschiff-Preise zahlen. Also, sollten Sie heute tatsächlich etwas ändern?
00:05:01Nun, wenn Sie bereits mit Codex arbeiten, ist die Antwort offensichtlich ja. Aber wenn Sie in
00:05:07andere Labore investiert haben, sollten Sie Ihren gesamten Arbeitsablauf noch nicht reorganisieren. Der Benchmark-Vorsprung ist
00:05:11nur ein paar Punkte und es ist ein Wert, hinter dem selbst der eigene Auswerter nicht stehen würde. Wenn Sie mehr darüber lernen wollen,
00:05:17wie diese Modelle das System austricksen, haben wir ein Video genau dazu gedreht; Sie können es sich hier ansehen.
00:05:22Ansonsten, ich bin Warren von Better Stack, danke fürs Zuschauen und wir sehen uns im nächsten Video.