Kombiniere Fable 5 & Sol 5.6 mit dieser einen Fähigkeit (oder falle zurück)

CChase AI
Computing/SoftwareManagementInternet Technology

Transcript

00:00:00GPT 5.6, alias Sol, erscheint morgen und die große Frage, die sich jeder stellt, ist:
00:00:05Schlägt dieses neue Modell Claude Fable? Nun, ich denke, das ist die falsche Frage.
00:00:11Anstatt herauszufinden, welches dieser Modelle besser ist, sollten wir fragen: Wie können wir
00:00:16diese beiden leistungsstarken Modelle zusammen nutzen? Und im heutigen Video zeige ich Ihnen eine Fähigkeit,
00:00:20die genau das tut. Diese Fähigkeit beinhaltet einen hochgeladenen Plan-Modus, der auf Matt Pococks
00:00:26„Grill me“ basiert. Dann haben wir eine gegensätzliche Planungssitzung, in der Claude und Codex
00:00:30gegeneinander antreten, bis sie zu einem Ergebnis kommen. Sobald wir bereit sind, nehmen wir diesen Fable-gesteuerten Plan und übergeben ihn
00:00:37an Codex, das ab morgen Sol 5.6 beinhalten wird. Nachdem Codex an die Arbeit geht, lassen wir Fable
00:00:44den gesamten Prozess überprüfen. Alles in allem erhalten wir nicht nur das Beste aus beiden Modellen, wir
00:00:49sparen auch Token im Vergleich dazu, wenn Fable alles allein erledigen würde. Ich zeige Ihnen also, wie
00:00:54das funktioniert, wir machen eine schnelle Demo und dann gebe ich Ihnen die Fähigkeit. Warum sollten wir uns also
00:00:58überhaupt darum kümmern, eine Fähigkeit zu erstellen, bei der Fable den Großteil der Planung übernimmt und wir es dann an
00:01:02Sol 5.6 weitergeben? Nun, der erste Grund ist: Sol 5.6 ist extrem leistungsstark, zumindest laut den Benchmarks.
00:01:10Mit Vorsicht zu genießen, da dies von OpenAI kommt, aber wenn wir uns Sol 5.6 Ultra und das Standard-
00:01:175.6 Sol ansehen, sehen wir Zahlen im Terminal Bench 2.1, die es vor Claude Mythos setzen, ganz zu schweigen von Fable 5.
00:01:24Der zweite Grund ist die Token-Effizienz. Es gibt einen echten Grund, warum man so viele Inhalte darüber sieht,
00:01:29wie wir die Nutzung von Fable reduzieren können. Die Ansätze sind Dinge wie der Advisor-Modus, bei dem man
00:01:35im Wesentlichen Fable planen lässt und Opus ausführen. Warum Opus ausführen lassen, wenn ich zum gleichen Preis
00:01:425.6 oder 5.5 nehmen könnte? Der Punkt ist, wir nutzen das gleiche Konstrukt, aber mit einem besseren Modell
00:01:49und wohl einem günstigeren Modell als Opus. Wenn wir uns 5.6 ansehen, ist es token-effizienter als 5.5, was
00:01:56schon token-effizienter als Opus 4.6 war, und das sehen wir in den Daten. Was wir hier gerade sehen,
00:02:02ist GPT 5.5 auf „Extra High“. Die Erfolgsquote bei diesem Benchmark lag bei 23 % für 1,24 $. Wenn ich mir 5.6 ansehe,
00:02:12ist es ein 25-%-Ergebnis, also eine höhere Punktzahl für 56 Cent, also viel günstiger und damit viel effizienter. Und wenn wir
00:02:20direkte Vergleiche zwischen 5.5 und Opus 4.8 ziehen, gibt es wirklich keinen Wettbewerb. Höhere Erfolgsquoten, niedrigere Kosten.
00:02:28Wir nehmen also im Grunde die gleiche Idee und verstärken sie mit dieser 5.6-Verbesserung.
00:02:33Wie funktioniert die Fähigkeit also eigentlich? Nun, ich habe tatsächlich ein paar Fähigkeiten für Sie. Im luftleeren Raum haben wir
00:02:38die Codex-Build-Fähigkeit. Das ist die Idee, dass Sie mit Fable einen Plan erstellt haben und Codex einfach hingeht,
00:02:43um diese spezielle Funktion oder das spezielle Produkt zu erstellen. Ich habe auch eine aktualisierte
00:02:48„Grill me“-Codex-Funktion hinzugefügt. Ich habe schon einmal ein Video über diese Fähigkeit gemacht, und was wir getan haben, ist, dass wir
00:02:54die Idee hinzugefügt haben, dass GPT 5.6 tatsächlich Dinge für uns baut. Wenn wir uns also den
00:03:01umfassenderen „Grill me“-Codex ansehen, der die große Fähigkeit ist, erfolgt dies in vier Stufen. Die Idee ist, Sie haben
00:03:08irgendein Projekt, irgendeine Funktion, mit der Sie beginnen möchten, und Sie starten es mit „Grill me“-Codex, und
00:03:12das erste, was passiert, ist ein Interview. Dieses Interview ist buchstäblich die „Grill me“-Fähigkeit von
00:03:18Matt Pocock. Es ist also ein Plan-Modus auf Steroiden. Er geht viel tiefer, als es Claude Code normalerweise tun würde,
00:03:23und wir machen das mit Fable. Alles klar, Fable sitzt hier am Steuer. Zweitens haben wir gegensätzliche
00:03:30Planung. Fable hat sich also den Plan ausgedacht. Wir nehmen dann diesen Fable-Plan und schieben ihn an Codex.
00:03:37Heute im Video ist das 5.5, aber morgen wird das 5.6 sein, und Fable und Codex gehen hin
00:03:43und her für maximal fünf Iterationen, bei denen Fable sagt: „Hey, hier ist der Plan.“ Codex sagt: „Okay, sieht gut aus,
00:03:49außer x, y und z.“ Dann sagt Fable: „Äh, ich stimme zu / ich stimme nicht zu“, und sie gehen hin und her, bis sie
00:03:54einen Konsens erreichen. Sobald sie diesen Konsens erreicht haben – und hier passieren die Upgrades –, pushen wir jetzt
00:04:01den tatsächlichen Build an Codex, an 5.5 heute und 5.6 morgen. Ich denke, das ist viel besser, als
00:04:09die Dinge an Opus oder Sonnet abzugeben oder den Advisor-Modus in Cloud Code zu verwenden, weil diese GPT-Modelle
00:04:14einfach besser sind als diese kleineren Anthropic-Modelle und sie billiger sind. Es ist also wirklich ein Szenario, in dem es,
00:04:21außer man ist total Anti-GPT und Anti-Codex, schwer ist, das Gegenteil zu behaupten, besonders wenn wir an einen Punkt kommen,
00:04:27an dem Fable quasi vom Markt verschwindet. Und zuletzt, wenn Codex den Build beendet, kommt Fable,
00:04:32überprüft, was es getan hat, und geht durch maximal zwei
00:04:37Iterationen, bei denen Fable zum Beispiel denkt, dass Codex etwas falsch gemacht hat. Es wird sagen: „Hey Codex, du hast
00:04:42das falsch gemacht, korrigiere es.“ Das wird es zweimal tun; wenn es beim dritten Mal nicht komplett ist, wird Fable
00:04:47es selbst bereinigen. Das ist also der Prozess, durch den wir meiner Meinung nach das Beste aus OpenAI und
00:04:54Anthropic bekommen. Nun, bevor wir in die Demo springen, ein kurzes Wort von unserem heutigen Sponsor: mir! Ich habe gerade meine
00:04:59Cloud-Code-Masterclass in Chase AI Plus veröffentlicht, und sie ist der beste Weg, um von Null zum KI-Entwickler zu werden,
00:05:04besonders wenn Sie keinen technischen Hintergrund haben. Ich aktualisiere das jede Woche, wir konzentrieren
00:05:09uns auf reale Anwendungsfälle und es beinhaltet auch eine Codex-Masterclass. Wenn Sie es also ein bisschen
00:05:15ernster mit KI meinen und keine Ahnung haben, wo Sie anfangen sollen, ist dies der richtige Ort für Sie. Es wird einen Link
00:05:19im angepinnten Kommentar geben. Nun, das Installieren und Nutzen der Fähigkeit ist ziemlich unkompliziert, ich werde einen Link zum
00:05:24GitHub in die Beschreibung setzen. Um das zu nutzen, geben wir einfach „/grill me codex“ ein
00:05:28und geben eine Aufforderung ein, was wir bauen wollen. Wir wollen also Trip Atlas bauen, was
00:05:33eine stilisierte, filmische Reiseplaner-Web-App ist, und ich gehe ein wenig näher auf die Details ein,
00:05:38was es sein soll, richtig? Ich möchte, dass es cool aussieht, ich kann die verschiedenen Orte eingeben, die ich besuche, und so weiter,
00:05:42und sobald ich das mache, wird der „Grill me“-Abschnitt des Plans gestartet,
00:05:46was, wenn Sie mit Matt Pococks Arbeit vertraut sind, im Wesentlichen nur ein Plan-Modus auf
00:05:51Steroiden ist. Er wird mir acht, neun, zehn verschiedene Fragen stellen, ich gehe viel tiefer als bei Ihrem Standard-
00:05:56Plan-Modus. Er fragt mich also, wofür das ist. Wir werden sagen, das ist für ein echtes persönliches
00:06:01Tool, nicht nur eine Video-Demo. Und für jede dieser Fragen gibt es auch Empfehlungen. Wenn Sie also
00:06:06verwirrt sind, was ich wählen sollte und warum, ist das alles für Sie dargelegt. Jetzt fragt es nach Geocoding
00:06:11und es wird mit dieser Reihe von Fragen fortfahren, bis es zufrieden damit ist, was wir
00:06:15erstellen. Ich werde jetzt den Rest der Fragen überspringen, weil Sie sich vorstellen können,
00:06:19wie die nächsten sieben oder acht Fragen aussehen werden, und wir werden zur gegensätzlichen Planung
00:06:24Phase übergehen. Wie Sie hier sehen können, hat es den Plan geschrieben und es erstellt auch eine Markdown-Datei, in der es das Hin und Her
00:06:28zwischen Codex und Cloud Code protokolliert. Im Moment befinden wir uns in Runde eins, wo es
00:06:34an GPT weitergegeben wird, und man kann sehen, wie sie hier im Protokoll hin und her gehen. Aber in diesem
00:06:41Fall hat es nur zwei Runden gedauert, bis es genehmigt wurde. Wir können sehen, was die zwei Akte verbessert haben,
00:06:47wissen Sie, die Identität eines echten persönlichen Tools fixiert, wie der tatsächliche Stack aussehen wird,
00:06:53und dann hatte es 12 Erkenntnisse in der zweiten Runde, bezogen auf so etwas wie die Härtung des Datenkerns. Sobald dies
00:06:59Hin und Her abgeschlossen ist, haben Sie ein paar Optionen: Entweder baut Codex es, so wie wir es
00:07:05von Anfang an besprochen haben. Wir haben die Option, es einfach von Claude bauen zu lassen, wenn ich also aus irgendeinem Grund
00:07:09GPT nicht einbeziehen möchte, können Sie es bei Fable belassen oder Sie können hier stoppen. Aber wir werden weitermachen
00:07:14und Codex das bauen lassen, und auch hier können wir hin und her gehen, wenn Sie denken: „Nun, GPT 5.6 wird
00:07:20besser sein als Fable oder 5.5 gegenüber Opus 4.8.“ Am Ende des Tages ist der wahre Wert, der nicht wirklich
00:07:26bestritten werden kann, die Token-Effizienz, besonders wenn 5.6 auch nur annähernd das ist, was die Benchmarks
00:07:34behaupten. Codex hat den Build also abgeschlossen, und Sie können sehen, was jetzt passiert: die Überprüfungsphase.
00:07:40Fable geht jetzt alles durch, was Codex gebaut hat, und dann geht es zurück zu Codex
00:07:44und sagt: „Das ist falsch, das war richtig.“ Denken Sie daran, es wird zwei Iterationen davon machen, bevor es heißt: „Hey,
00:07:49ich möchte fahren.“ Es übernimmt das Steuer und fängt selbst an, den Code zu schreiben. Nun ist Fable mit
00:07:54seiner Überprüfung fertig. Es sagte, es gab ein paar Abweichungen, die es alle für vernünftig hielt, geht über die
00:07:59Dateien und all das, und jetzt fragt es: „Hey, willst du committen oder willst du es dir ansehen?“ Also
00:08:02lassen Sie uns einen Blick darauf werfen, was es tatsächlich gebaut hat. Hier haben wir also eine Art
00:08:08Weltkarte, und es sieht so aus, als hätte es einige benutzerdefinierte Grafiken mit dem GPT-Bildgenerator erstellt,
00:08:14sodass Sie den Trip benennen können, Sie können Stopps hinzufügen, hier links können Sie eingeben, wo
00:08:20Sie hinfahren und dann sozusagen, was Sie an diesen verschiedenen Orten tun werden. Es hat auch
00:08:25diese filmische Wiedergabe, und ich werde das einfach stummschalten, also schauen wir mal, was hier passiert.
00:08:31Es sieht so aus, als ob ich mich hierher bewege. Sie sehen sozusagen dieses seltsame Flugzeug, das von Punkt zu Punkt hüpft,
00:08:38was, wie es aussieht, als SVG erstellt wurde. Da sind kleine Reisepassstempel und bumm, da geht es los. Also
00:08:45wissen Sie, da ist vieles, was wir tun könnten, damit es besser aussieht, aber im Allgemeinen hat es
00:08:52gebaut, was wir gesagt haben, richtig? Alles funktioniert hier tatsächlich. Wissen Sie, wenn ich Dinge hier lösche,
00:08:57lösche einige, kann ich sie nach oben/unten verschieben, ich kann Dinge ändern, sagen wir, wir haben Tokio hinzugefügt, auf einmal
00:09:04zeigt es tatsächlich, wie weit dieser Stopp entfernt ist, das ist interessant. Wenn ich das zur Route hinzufüge, da gehen wir hin.
00:09:11Also, wissen Sie, ich habe das tatsächlich gebaut, ich denke, es wäre ein guter, kein schlechter erster Durchgang, und
00:09:17worum es hier wirklich ging, war nur das Zeigen dieses Workflows in Aktion. Sie können auch hier unten sehen,
00:09:21dass wir in Bezug auf unsere Nutzung nur etwa 130.000 Token auf der Fable-Seite verbrannt haben, um das Ganze
00:09:26zu erledigen. Das ist also die Fähigkeit in Aktion, hoffentlich haben Sie eine Menge davon, sobald 5.6 erscheint.
00:09:31Wie immer, lassen Sie mich in den Kommentaren wissen, was Sie von diesem Video hielten, stellen Sie sicher, dass Sie sich Chase AI Plus ansehen
00:09:37und wir sehen uns.

Key Takeaway

Durch die Nutzung von Fable als Planungsinstanz und Codex mit GPT 5.6 als ausführende Einheit lassen sich Software-Projekte kosteneffizienter und mit höherer Erfolgsquote umsetzen.

Highlights

  • GPT 5.6 erzielt in Benchmarks wie dem Terminal Bench 2.1 höhere Erfolgsquoten als Fable 5 und Claude Mythos.

  • Der Einsatz von GPT 5.6 zur Codegenerierung kostet 56 Cent pro Vorgang, während der Vorgänger GPT 5.5 für dasselbe Ergebnis 1,24 $ benötigt.

  • Ein vierstufiger Prozess kombiniert Fable für die Planung mit Codex (integriert mit GPT 5.6) für die Umsetzung und Überprüfung.

  • Gegensätzliche Planungssitzungen zwischen Fable und Codex finden in maximal fünf Iterationen statt, um einen Konsens zu erreichen.

  • Nach der Implementierung durch Codex korrigiert Fable den Code in zwei weiteren Iterationszyklen und bereinigt den Prozess bei Bedarf selbst.

  • Der Workflow reduziert den Token-Verbrauch auf etwa 130.000 Einheiten pro Projekt.

Timeline

Strategische Vorteile von GPT 5.6 und Token-Effizienz

  • GPT 5.6 bietet eine höhere Leistung als Fable 5 oder frühere Claude-Modelle.
  • Die Kosten für die Codegenerierung sinken mit GPT 5.6 von 1,24 $ auf 56 Cent pro Benchmark-Erfolg.
  • Die Kombination der Modelle ermöglicht eine effizientere Token-Nutzung als der Einsatz eines einzelnen Modells.

Die Wahl zwischen Modellen wie Fable und Sol (GPT 5.6) sollte nicht als Konkurrenzkampf, sondern als synergetische Zusammenarbeit betrachtet werden. Während Fable als Planungsinstanz dient, übernimmt Sol 5.6 die rechenintensive Ausführung. Daten zeigen eine deutliche Steigerung der Erfolgsquote bei gleichzeitiger Reduzierung der Kosten um mehr als 50 Prozent im Vergleich zu GPT 5.5.

Der vierstufige Workflow zur App-Entwicklung

  • Das Projekt beginnt mit einer intensiven Interviewphase basierend auf dem Grill-me-Modell.
  • Modelle treten in einer gegensätzlichen Planungsphase in den Diskurs, bis ein Konsens vorliegt.
  • Codex implementiert den finalen Plan, der anschließend von Fable auf Korrektheit geprüft wird.

Der Prozess gliedert sich in vier Phasen: Ein tiefgehendes Interview zur Anforderungsanalyse, die gegensätzliche Planung, die eigentliche Build-Phase durch Codex und eine abschließende Validierung durch Fable. Dieser strukturierte Ablauf stellt sicher, dass das Endprodukt sowohl die initialen Anforderungen erfüllt als auch syntaktisch und funktional korrekt ist.

Praktische Demonstration und Anwendung

  • Die Installation der Fähigkeit erfolgt einfach über GitHub-Anweisungen.
  • Das Tool Trip Atlas wurde als filmische Web-App mit interaktiven Kartenkomponenten innerhalb des Workflows erstellt.
  • Die abschließende Überprüfung durch Fable garantiert die Qualität und korrigiert Fehler direkt im Code.

Die Demonstration zeigt die Erstellung der Anwendung Trip Atlas, wobei das System selbstständig SVG-Grafiken und komplexe Navigationslogik implementiert. Der gesamte Prozess verbrauchte lediglich 130.000 Token. Die Überprüfung durch Fable erfolgt in zwei Zyklen, wobei das Modell bei anhaltenden Abweichungen selbstständig Korrekturen am Code vornimmt.

Community Posts

View all posts