Kombiniere Fable 5 & Sol 5.6 mit dieser einen Fähigkeit (oder falle zurück)
CChase AI
Computing/SoftwareManagementInternet Technology
Transcript
00:00:00GPT 5.6, alias Sol, erscheint morgen und die große Frage, die sich jeder stellt, ist:
00:00:05Schlägt dieses neue Modell Claude Fable? Nun, ich denke, das ist die falsche Frage.
00:00:11Anstatt herauszufinden, welches dieser Modelle besser ist, sollten wir fragen: Wie können wir
00:00:16diese beiden leistungsstarken Modelle zusammen nutzen? Und im heutigen Video zeige ich Ihnen eine Fähigkeit,
00:00:20die genau das tut. Diese Fähigkeit beinhaltet einen hochgeladenen Plan-Modus, der auf Matt Pococks
00:00:26„Grill me“ basiert. Dann haben wir eine gegensätzliche Planungssitzung, in der Claude und Codex
00:00:30gegeneinander antreten, bis sie zu einem Ergebnis kommen. Sobald wir bereit sind, nehmen wir diesen Fable-gesteuerten Plan und übergeben ihn
00:00:37an Codex, das ab morgen Sol 5.6 beinhalten wird. Nachdem Codex an die Arbeit geht, lassen wir Fable
00:00:44den gesamten Prozess überprüfen. Alles in allem erhalten wir nicht nur das Beste aus beiden Modellen, wir
00:00:49sparen auch Token im Vergleich dazu, wenn Fable alles allein erledigen würde. Ich zeige Ihnen also, wie
00:00:54das funktioniert, wir machen eine schnelle Demo und dann gebe ich Ihnen die Fähigkeit. Warum sollten wir uns also
00:00:58überhaupt darum kümmern, eine Fähigkeit zu erstellen, bei der Fable den Großteil der Planung übernimmt und wir es dann an
00:01:02Sol 5.6 weitergeben? Nun, der erste Grund ist: Sol 5.6 ist extrem leistungsstark, zumindest laut den Benchmarks.
00:01:10Mit Vorsicht zu genießen, da dies von OpenAI kommt, aber wenn wir uns Sol 5.6 Ultra und das Standard-
00:01:175.6 Sol ansehen, sehen wir Zahlen im Terminal Bench 2.1, die es vor Claude Mythos setzen, ganz zu schweigen von Fable 5.
00:01:24Der zweite Grund ist die Token-Effizienz. Es gibt einen echten Grund, warum man so viele Inhalte darüber sieht,
00:01:29wie wir die Nutzung von Fable reduzieren können. Die Ansätze sind Dinge wie der Advisor-Modus, bei dem man
00:01:35im Wesentlichen Fable planen lässt und Opus ausführen. Warum Opus ausführen lassen, wenn ich zum gleichen Preis
00:01:425.6 oder 5.5 nehmen könnte? Der Punkt ist, wir nutzen das gleiche Konstrukt, aber mit einem besseren Modell
00:01:49und wohl einem günstigeren Modell als Opus. Wenn wir uns 5.6 ansehen, ist es token-effizienter als 5.5, was
00:01:56schon token-effizienter als Opus 4.6 war, und das sehen wir in den Daten. Was wir hier gerade sehen,
00:02:02ist GPT 5.5 auf „Extra High“. Die Erfolgsquote bei diesem Benchmark lag bei 23 % für 1,24 $. Wenn ich mir 5.6 ansehe,
00:02:12ist es ein 25-%-Ergebnis, also eine höhere Punktzahl für 56 Cent, also viel günstiger und damit viel effizienter. Und wenn wir
00:02:20direkte Vergleiche zwischen 5.5 und Opus 4.8 ziehen, gibt es wirklich keinen Wettbewerb. Höhere Erfolgsquoten, niedrigere Kosten.
00:02:28Wir nehmen also im Grunde die gleiche Idee und verstärken sie mit dieser 5.6-Verbesserung.
00:02:33Wie funktioniert die Fähigkeit also eigentlich? Nun, ich habe tatsächlich ein paar Fähigkeiten für Sie. Im luftleeren Raum haben wir
00:02:38die Codex-Build-Fähigkeit. Das ist die Idee, dass Sie mit Fable einen Plan erstellt haben und Codex einfach hingeht,
00:02:43um diese spezielle Funktion oder das spezielle Produkt zu erstellen. Ich habe auch eine aktualisierte
00:02:48„Grill me“-Codex-Funktion hinzugefügt. Ich habe schon einmal ein Video über diese Fähigkeit gemacht, und was wir getan haben, ist, dass wir
00:02:54die Idee hinzugefügt haben, dass GPT 5.6 tatsächlich Dinge für uns baut. Wenn wir uns also den
00:03:01umfassenderen „Grill me“-Codex ansehen, der die große Fähigkeit ist, erfolgt dies in vier Stufen. Die Idee ist, Sie haben
00:03:08irgendein Projekt, irgendeine Funktion, mit der Sie beginnen möchten, und Sie starten es mit „Grill me“-Codex, und
00:03:12das erste, was passiert, ist ein Interview. Dieses Interview ist buchstäblich die „Grill me“-Fähigkeit von
00:03:18Matt Pocock. Es ist also ein Plan-Modus auf Steroiden. Er geht viel tiefer, als es Claude Code normalerweise tun würde,
00:03:23und wir machen das mit Fable. Alles klar, Fable sitzt hier am Steuer. Zweitens haben wir gegensätzliche
00:03:30Planung. Fable hat sich also den Plan ausgedacht. Wir nehmen dann diesen Fable-Plan und schieben ihn an Codex.
00:03:37Heute im Video ist das 5.5, aber morgen wird das 5.6 sein, und Fable und Codex gehen hin
00:03:43und her für maximal fünf Iterationen, bei denen Fable sagt: „Hey, hier ist der Plan.“ Codex sagt: „Okay, sieht gut aus,
00:03:49außer x, y und z.“ Dann sagt Fable: „Äh, ich stimme zu / ich stimme nicht zu“, und sie gehen hin und her, bis sie
00:03:54einen Konsens erreichen. Sobald sie diesen Konsens erreicht haben – und hier passieren die Upgrades –, pushen wir jetzt
00:04:01den tatsächlichen Build an Codex, an 5.5 heute und 5.6 morgen. Ich denke, das ist viel besser, als
00:04:09die Dinge an Opus oder Sonnet abzugeben oder den Advisor-Modus in Cloud Code zu verwenden, weil diese GPT-Modelle
00:04:14einfach besser sind als diese kleineren Anthropic-Modelle und sie billiger sind. Es ist also wirklich ein Szenario, in dem es,
00:04:21außer man ist total Anti-GPT und Anti-Codex, schwer ist, das Gegenteil zu behaupten, besonders wenn wir an einen Punkt kommen,
00:04:27an dem Fable quasi vom Markt verschwindet. Und zuletzt, wenn Codex den Build beendet, kommt Fable,
00:04:32überprüft, was es getan hat, und geht durch maximal zwei
00:04:37Iterationen, bei denen Fable zum Beispiel denkt, dass Codex etwas falsch gemacht hat. Es wird sagen: „Hey Codex, du hast
00:04:42das falsch gemacht, korrigiere es.“ Das wird es zweimal tun; wenn es beim dritten Mal nicht komplett ist, wird Fable
00:04:47es selbst bereinigen. Das ist also der Prozess, durch den wir meiner Meinung nach das Beste aus OpenAI und
00:04:54Anthropic bekommen. Nun, bevor wir in die Demo springen, ein kurzes Wort von unserem heutigen Sponsor: mir! Ich habe gerade meine
00:04:59Cloud-Code-Masterclass in Chase AI Plus veröffentlicht, und sie ist der beste Weg, um von Null zum KI-Entwickler zu werden,
00:05:04besonders wenn Sie keinen technischen Hintergrund haben. Ich aktualisiere das jede Woche, wir konzentrieren
00:05:09uns auf reale Anwendungsfälle und es beinhaltet auch eine Codex-Masterclass. Wenn Sie es also ein bisschen
00:05:15ernster mit KI meinen und keine Ahnung haben, wo Sie anfangen sollen, ist dies der richtige Ort für Sie. Es wird einen Link
00:05:19im angepinnten Kommentar geben. Nun, das Installieren und Nutzen der Fähigkeit ist ziemlich unkompliziert, ich werde einen Link zum
00:05:24GitHub in die Beschreibung setzen. Um das zu nutzen, geben wir einfach „/grill me codex“ ein
00:05:28und geben eine Aufforderung ein, was wir bauen wollen. Wir wollen also Trip Atlas bauen, was
00:05:33eine stilisierte, filmische Reiseplaner-Web-App ist, und ich gehe ein wenig näher auf die Details ein,
00:05:38was es sein soll, richtig? Ich möchte, dass es cool aussieht, ich kann die verschiedenen Orte eingeben, die ich besuche, und so weiter,
00:05:42und sobald ich das mache, wird der „Grill me“-Abschnitt des Plans gestartet,
00:05:46was, wenn Sie mit Matt Pococks Arbeit vertraut sind, im Wesentlichen nur ein Plan-Modus auf
00:05:51Steroiden ist. Er wird mir acht, neun, zehn verschiedene Fragen stellen, ich gehe viel tiefer als bei Ihrem Standard-
00:05:56Plan-Modus. Er fragt mich also, wofür das ist. Wir werden sagen, das ist für ein echtes persönliches
00:06:01Tool, nicht nur eine Video-Demo. Und für jede dieser Fragen gibt es auch Empfehlungen. Wenn Sie also
00:06:06verwirrt sind, was ich wählen sollte und warum, ist das alles für Sie dargelegt. Jetzt fragt es nach Geocoding
00:06:11und es wird mit dieser Reihe von Fragen fortfahren, bis es zufrieden damit ist, was wir
00:06:15erstellen. Ich werde jetzt den Rest der Fragen überspringen, weil Sie sich vorstellen können,
00:06:19wie die nächsten sieben oder acht Fragen aussehen werden, und wir werden zur gegensätzlichen Planung
00:06:24Phase übergehen. Wie Sie hier sehen können, hat es den Plan geschrieben und es erstellt auch eine Markdown-Datei, in der es das Hin und Her
00:06:28zwischen Codex und Cloud Code protokolliert. Im Moment befinden wir uns in Runde eins, wo es
00:06:34an GPT weitergegeben wird, und man kann sehen, wie sie hier im Protokoll hin und her gehen. Aber in diesem
00:06:41Fall hat es nur zwei Runden gedauert, bis es genehmigt wurde. Wir können sehen, was die zwei Akte verbessert haben,
00:06:47wissen Sie, die Identität eines echten persönlichen Tools fixiert, wie der tatsächliche Stack aussehen wird,
00:06:53und dann hatte es 12 Erkenntnisse in der zweiten Runde, bezogen auf so etwas wie die Härtung des Datenkerns. Sobald dies
00:06:59Hin und Her abgeschlossen ist, haben Sie ein paar Optionen: Entweder baut Codex es, so wie wir es
00:07:05von Anfang an besprochen haben. Wir haben die Option, es einfach von Claude bauen zu lassen, wenn ich also aus irgendeinem Grund
00:07:09GPT nicht einbeziehen möchte, können Sie es bei Fable belassen oder Sie können hier stoppen. Aber wir werden weitermachen
00:07:14und Codex das bauen lassen, und auch hier können wir hin und her gehen, wenn Sie denken: „Nun, GPT 5.6 wird
00:07:20besser sein als Fable oder 5.5 gegenüber Opus 4.8.“ Am Ende des Tages ist der wahre Wert, der nicht wirklich
00:07:26bestritten werden kann, die Token-Effizienz, besonders wenn 5.6 auch nur annähernd das ist, was die Benchmarks
00:07:34behaupten. Codex hat den Build also abgeschlossen, und Sie können sehen, was jetzt passiert: die Überprüfungsphase.
00:07:40Fable geht jetzt alles durch, was Codex gebaut hat, und dann geht es zurück zu Codex
00:07:44und sagt: „Das ist falsch, das war richtig.“ Denken Sie daran, es wird zwei Iterationen davon machen, bevor es heißt: „Hey,
00:07:49ich möchte fahren.“ Es übernimmt das Steuer und fängt selbst an, den Code zu schreiben. Nun ist Fable mit
00:07:54seiner Überprüfung fertig. Es sagte, es gab ein paar Abweichungen, die es alle für vernünftig hielt, geht über die
00:07:59Dateien und all das, und jetzt fragt es: „Hey, willst du committen oder willst du es dir ansehen?“ Also
00:08:02lassen Sie uns einen Blick darauf werfen, was es tatsächlich gebaut hat. Hier haben wir also eine Art
00:08:08Weltkarte, und es sieht so aus, als hätte es einige benutzerdefinierte Grafiken mit dem GPT-Bildgenerator erstellt,
00:08:14sodass Sie den Trip benennen können, Sie können Stopps hinzufügen, hier links können Sie eingeben, wo
00:08:20Sie hinfahren und dann sozusagen, was Sie an diesen verschiedenen Orten tun werden. Es hat auch
00:08:25diese filmische Wiedergabe, und ich werde das einfach stummschalten, also schauen wir mal, was hier passiert.
00:08:31Es sieht so aus, als ob ich mich hierher bewege. Sie sehen sozusagen dieses seltsame Flugzeug, das von Punkt zu Punkt hüpft,
00:08:38was, wie es aussieht, als SVG erstellt wurde. Da sind kleine Reisepassstempel und bumm, da geht es los. Also
00:08:45wissen Sie, da ist vieles, was wir tun könnten, damit es besser aussieht, aber im Allgemeinen hat es
00:08:52gebaut, was wir gesagt haben, richtig? Alles funktioniert hier tatsächlich. Wissen Sie, wenn ich Dinge hier lösche,
00:08:57lösche einige, kann ich sie nach oben/unten verschieben, ich kann Dinge ändern, sagen wir, wir haben Tokio hinzugefügt, auf einmal
00:09:04zeigt es tatsächlich, wie weit dieser Stopp entfernt ist, das ist interessant. Wenn ich das zur Route hinzufüge, da gehen wir hin.
00:09:11Also, wissen Sie, ich habe das tatsächlich gebaut, ich denke, es wäre ein guter, kein schlechter erster Durchgang, und
00:09:17worum es hier wirklich ging, war nur das Zeigen dieses Workflows in Aktion. Sie können auch hier unten sehen,
00:09:21dass wir in Bezug auf unsere Nutzung nur etwa 130.000 Token auf der Fable-Seite verbrannt haben, um das Ganze
00:09:26zu erledigen. Das ist also die Fähigkeit in Aktion, hoffentlich haben Sie eine Menge davon, sobald 5.6 erscheint.
00:09:31Wie immer, lassen Sie mich in den Kommentaren wissen, was Sie von diesem Video hielten, stellen Sie sicher, dass Sie sich Chase AI Plus ansehen
00:09:37und wir sehen uns.