Dieses Open-Source-Repo löst Claudes größtes Problem

CChase AI
컴퓨터/소프트웨어

스크립트

00:00:00Man kann Claude nicht einfach seine eigene Arbeit bewerten lassen. Das ist ein riesiges Problem, das jedoch
00:00:05von dieser Fähigkeit gelöst wird. Sie nennt sich Claudex Loop und das Prinzip dahinter ist einfach. Anstatt Claude
00:00:09für die Planung, Umsetzung und Benotung seiner eigenen Arbeit verantwortlich zu machen, holen wir Codex hinzu,
00:00:16damit es sich ebenfalls den Plan und die Ausführung von Claude ansieht und sagt: Hey, das sieht gut aus,
00:00:22das nicht, das solltest du ändern. Denn eines der großen Probleme bei jedem einzelnen KI-Modell da draußen
00:00:25ist, dass sie ihre eigene Arbeit sehr positiv bewerten. Wenn ich Claude frage, wie gut der von ihm
00:00:30erstellte Plan ist, wird es sagen: Das Ding ist genial. Deshalb ist es wichtig, Systeme zu haben,
00:00:35bei denen wir einen zweiten Blick auf das werfen lassen können, was das erste Modell gebaut hat, um zu sagen: Daumen hoch,
00:00:40Daumen runter und warum. Heute zeige ich dir also nicht nur diese Fähigkeit, sondern erkläre auch,
00:00:44wie sie im Hintergrund funktioniert, und wir machen eine kurze Demo. Nun, die Fähigkeit ist in vier Phasen unterteilt,
00:00:48und die Idee ist, dass du sie aufrufst, bevor du irgendeine Funktion hinzufügst oder ein völlig neues
00:00:53Grünwiesenprojekt startest. Der allgemeine Gedanke ist, dass wir, unabhängig davon, was sich das erste Modell als Plan ausdenkt
00:00:58oder ausführt, warten, bis das zweite Modell es sich ansieht und sagt: Hey, das sieht großartig aus,
00:01:02bevor wir bei großen Dingen fortfahren. In der ersten Phase betreiben wir etwas Aufklärung. Wir
00:01:07gehen tatsächlich ins Internet, Claude wird erkunden, ob die Antworten überhaupt
00:01:10existieren. Wir haben die Möglichkeit, die tiefe Recherche zu nutzen, den integrierten dynamischen Workflow, wenn wir
00:01:15wirklich tief in die Antworten einsteigen wollen, die wir erhalten. Danach gehen wir in die Befragungsphase über.
00:01:20Betrachte das als eine Reihe von Fragen im erweiterten Planungsmodus, bei der wir versuchen, uns mit Claude
00:01:25auf denselben Stand zu bringen, bevor es seinen ersten Plan erstellt. Zweitens holen wir hier das zweite
00:01:28Modell ins Boot. Dies ist die Überprüfungsphase. Claude Code erstellt also, nachdem es einen Plan basierend auf allem,
00:01:34worüber wir gesprochen und recherchiert haben, ausgearbeitet hat, deine standardmäßige plan.md.
00:01:38Von dort aus überprüft Codex den Plan in einer schreibgeschützten Sandbox und sagt:
00:01:43Entweder ist dies genehmigt oder wir müssen X, Y und Z überarbeiten. Es sendet diese Antwort dann
00:01:49mitsamt den Überarbeitungen an Claude Code. Claude Code sieht es sich an, sagt: Ich stimme zu, ich stimme nicht zu.
00:01:55Und dann sendet es seine Änderungen zurück. Diese Schleife läuft bis zu fünf Mal. Nun, ich habe
00:02:01es noch nie erlebt, dass sie tatsächlich nach fünf Mal stecken blieb oder wir keinen genehmigten Zustand erreichten. Allerdings habe ich
00:02:06sie bei fünf gestoppt; du kannst das mit der Fähigkeit ganz einfach ändern, damit sie nicht in einer seltsamen
00:02:11Endlosschleife feststeckt und du ewig und ewig Token verbrauchst. Das gibt dir eine sehr klare,
00:02:15harte Grenze, damit du nicht in dieser Situation stecken bleibst. Schließlich, sobald sich Claude und Codex geeinigt haben
00:02:20und ein Plan erstellt wurde, gehen wir in die Build-Phase über. Nun gibt dir diese Fähigkeit die Möglichkeit,
00:02:24nicht nur Claude bauen zu lassen, sondern du kannst auch Codex Dinge bauen lassen. Aber welches Modell
00:02:30es auch immer baut, das zweite Modell wird sich noch einmal ansehen, was es tatsächlich geschaffen hat, bevor es
00:02:34mit irgendetwas fortfährt. Und im Hintergrund gibt es auch hier viele verschiedene Variablen, die du anpassen kannst.
00:02:38Wie ich bereits erwähnt habe, haben wir den Überprüfungsabschnitt, der auf fünf eingestellt ist. Im Build-Abschnitt,
00:02:43wenn wir Codex einen Blick darauf werfen lassen, was wir gebaut haben, habe ich das wieder auf zwei Schleifen reduziert,
00:02:48nur um nicht in solche Endlosschleifen-Szenarien zu geraten. Und ich bin eigentlich nie auf
00:02:52Probleme gestoßen, bei denen ich das Gefühl hatte: Oh, das muss ich erhöhen. Aber du kannst damit herumspielen. Des Weiteren
00:02:56kannst du noch mehr damit herumspielen und tatsächlich ein lokales Modell anstelle von Codex einbinden,
00:03:00falls das auch dein bevorzugter Ansatz ist. Wenn du nun die vorherige Version der Fähigkeit nutzt,
00:03:04die Grill Me Codex hieß, sind die Änderungen, auf die du beim Claudix Loop achten solltest,
00:03:08ein verbesserter Befragungsmodus. Er geht also mit seiner Fragestellung tiefer. Und in
00:03:13der Ausführungsphase haben wir Codex stärker integriert. Wir können also wieder genauer hinsehen, wenn es um den
00:03:18tatsächlich erstellten Code geht. Als Nächstes kommt also die eigentliche Demo. Bevor wir uns jedoch darauf stürzen,
00:03:23ein kurzes Wort vom heutigen Sponsor: mir. Ich habe gerade eine komplett aktualisierte Version meiner
00:03:28Claude Code Masterclass in Chase AI Plus veröffentlicht, und das ist der beste Weg, um vom Anfänger zum KI-Entwickler zu werden,
00:03:33besonders wenn du keinen technischen Hintergrund hast. Wir konzentrieren uns auf reale Anwendungsfälle. Dies wird
00:03:38jede einzelne Woche aktualisiert. Wenn du also jemand bist, der in diesem wahnsinnigen Tool besser werden möchte, und du
00:03:42eben keinen Softwareentwicklungshintergrund hast, ist das genau das Richtige für dich. Wenn du es dir also
00:03:47ansehen möchtest, gibt es einen Link dazu im angepinnten Kommentar. Für die heutige Demo nutzen wir
00:03:51den Claudex Loop, um Calendee nachzubauen. Falls du nicht weißt, was Calendee ist: Es ist eine Terminierungs-Web-App,
00:03:56du gibst Leuten einen Link, sie können deinen Kalender sehen, Zeiten aussuchen, und es erstellt automatisch
00:04:00entweder einen Zoom-Link oder einen Google Meet. Es ist also etwas, das viele Leute nutzen und tatsächlich
00:04:05dafür bezahlen. Aber ich dachte mir: Hey, warum erstellen wir das nicht einfach selbst und sparen uns, weißt du, 10 Dollar
00:04:09im Monat oder was auch immer ich dafür zahle – ich sollte das wahrscheinlich wissen. Also werde ich einfach
00:04:13den Befehl Claudex Loop eingeben, meine Gedanken frei aussprechen und etwas sagen
00:04:18wie: Ich möchte den Claudex Loop nutzen, um im Wesentlichen unsere eigene Version von Calendee zu erstellen.
00:04:25Im Moment würde ich wahrscheinlich einfach Google Meet anstelle von Zoom verwenden. Aber ich möchte, dass es mit
00:04:32meinem Kalender verknüpft ist und im Grunde Calendee mit all den Hauptfunktionen nachbildet. Lass uns das also
00:04:38einfach mal machen. Zu Beginn befinden wir uns in Phase Null, der Forschungsphase. Sie sagt also:
00:04:41Hey, wie möchtest du diese Recherche eigentlich durchführen? Entweder machen wir die Websuche, was im Grunde deine
00:04:46Standard-Claude ist, die ein paar Sub-Agenten losschickt, oder wollen wir die volle Tiefenrecherche starten? Nun,
00:04:50bei dieser Fähigkeit habe ich sie auf Opus festgelegt. Wie du weißt, wenn du bei Tiefenrecherche auf
00:04:56Fable gehst und einfach deep research eingibst, ruft das Fable-Sub-Agenten auf, die deinen Verbrauch ziemlich
00:05:01in die Höhe treiben können. Daher habe ich es im Moment so eingestellt, dass es direkt Opus verwendet, um dir einfach zu helfen. Auch hier gilt:
00:05:05Du kannst das absolut tun. Es empfiehlt Web, aber ehrlich gesagt werde ich es tief machen lassen, um zu sehen,
00:05:10was dabei herauskommt. Es wird mir den vorgeschlagenen Prompt für die Tiefenrecherche und die Fragen zeigen, auf die
00:05:14es tatsächlich Antworten finden will. Es muss also etwas über Google Kalender, Meet, Fallstricke im Terminierungsbereich
00:05:19und im Allgemeinen über den Tech-Stack wissen. Wenn ich das genehmige, sagen wir einfach: Leg los. Und wenn ich
00:05:25es bearbeiten wollte, ist das ganz einfach. Claude ist mit der Tiefenrecherche fertig und hat dann eine
00:05:29Annahmen-Liste erstellt, was im Wesentlichen eine Liste von allem ist, von dem es annimmt, dass du es für dieses
00:05:36Projekt möchtest. Danach hat es weitere Fragen für uns, bei denen wir uns durch verschiedene Pfade
00:05:40arbeiten können. Aber das sind die Dinge, bei denen es sagt: Hey, ich glaube, hier gibt es nicht viele Fragen.
00:05:44Entweder kannst du dem einfach einen Daumen nach oben geben und es wird all das tun. Das wird dann
00:05:48irgendwie in den Plan eingebaut. Oder du kannst sagen: Hey, eigentlich möchte ich den Stack ändern oder: Hey, ich möchte ändern,
00:05:53wie wir mit Erinnerungen und Dingen dieser Art umgehen. Aber vorerst sagen wir: Hey,
00:05:57das ist bestätigt. Und dann gehen wir zu der sogenannten tragenden
00:06:01Ebene über. Wir alle lieben den Begriff tragend. Das wird jetzt an alles angehängt,
00:06:05was Claude tut. Nun gehen wir also zu diesen tragenden Fragen über. Die erste Frage lautet:
00:06:09Auf welchem Google-Konto befindet sich dein echter Kalender? Bei all diesen Fragen, unabhängig von deinem
00:06:13Projekt, wird dir eine Reihe von Fragen zusammen mit einer Empfehlung gegeben. Wenn du also keine Ahnung hast,
00:06:17kannst du einfach den Empfehlungen folgen. Aber ganz ehrlich, als Best Practice, wenn du absolut keine Ahnung hast, was Claude
00:06:23dir bezüglich potenzieller Antworten oder was auch immer vor sich geht erzählt, empfehle ich dir dringend,
00:06:27in diesen anderen Bereich zu gehen und im Grunde einfach so etwas zu sagen wie: Erkläre das näher. So wirst
00:06:32du tatsächlich gut, wenn es um KI und das Erstellen von Dingen geht, und bist nicht nur ein
00:06:35Akzeptanz-Affe, der immer und immer wieder auf Empfohlen klickt. Wenn du es nicht weißt, bitte Claude,
00:06:40es dir weiter zu erklären, bis du es verstehst. Das ist der einzige Weg, wie du tatsächlich
00:06:44lernen wirst, auch wenn das etwas außerhalb des Rahmens dieses Videos liegt. Wir entscheiden uns also für persönliches Gmail, und ich
00:06:49werde tatsächlich zu dem Zeitpunkt vorspulen, nachdem ich all diese Fragen beantwortet habe, da du wahrscheinlich verstanden hast,
00:06:53wie diese Phase funktioniert. Nach der Beantwortung der tragenden Fragen gehen wir zu einigen
00:06:58kosmetischen Entscheidungen über, die wiederum die Basisfunktionalität der Anwendung nicht wirklich verändern.
00:07:02In diesem Szenario werden sie alle ähnlich wie die Annahmen-Liste aufgelistet. Du kannst also entweder sagen,
00:07:08dies ist akzeptabel und es wird einfach damit fortfahren, oder du kannst sagen: Hey, ändere eins,
00:07:12ändere zwei, ändere was auch immer. Ich habe es so eingerichtet, damit du diesen Prozess etwas beschleunigen kannst.
00:07:16Nachdem wir diese kosmetischen Fragen beantwortet haben, gehen wir zu Phase zwei über. Claude schreibt
00:07:20diese plan.markdown-Datei und sie wird dann über GPT 5.6 Sol an Codex gesendet. Von dort aus
00:07:27haben sie ihr Hin und Her für maximal fünf Runden oder bis sie ein akzeptiertes
00:07:32Urteil erreichen. Claude und Codex gingen also fünf Runden lang hin und her. Zu Beginn gab es 27 Probleme,
00:07:37die in Runde eins zur Sprache gebracht wurden, und wir sind bei Runde fünf angelangt, und das Problem ist, dass es immer noch ein paar
00:07:43weitere Probleme gibt. Sie haben kein akzeptiertes Urteil erreicht. Ich habe vorhin erwähnt, dass mir das noch nie
00:07:47passiert ist, daher bin ich fast froh, dass es hier passiert ist. Wir haben also fünf Runden erreicht. Sie haben es noch nicht
00:07:51herausgefunden. Es gibt immer noch ein paar kleinere Probleme. Was möchtest du tun? Nun, du hast Möglichkeiten.
00:07:56Du kannst hier aufhören, es so belassen. Du kannst den Deadlock-Zustand einfach akzeptieren oder du kannst ihn
00:08:01Das werden wir also tun, und dann sehen wir, was passiert, wenn sie endlich
00:08:05auf derselben Wellenlänge sind. Aber es ist gut zu wissen und zu sehen, dass wir zwar diese festen
00:08:11GRENZEN haben, zum Beispiel fünf Runden, aber darauf nicht festgenagelt sind. Wenn Sie diesen Punkt wie hier erreichen,
00:08:15können Sie das Ganze ganz einfach verlängern. Nach sieben Runden haben sie sich also geeinigt, und jetzt wird
00:08:19Sie gefragt, wer das Ganze eigentlich bauen soll. Entweder lassen wir Claude bauen und Codex
00:08:24wirft einen Blick darauf, oder wir drehen es um: Codex baut und Claude wirft einen Blick darauf. In bestimmten Situationen,
00:08:29je nachdem, was wir tun, bietet es Ihnen auch die Option für einen Tandembau. Nehmen wir also
00:08:33an, wir würden etwas erstellen, das Asset-Generierung erfordert oder bei dem so etwas wie GPT-Bilder
00:08:38ins Spiel gebracht werden. Nun, es wird auch heißen: Hey, holen wir Codex für diesen speziellen
00:08:43Teil des Projekts hinzu. In diesem Fall lassen wir jedoch Claude bauen. Und jetzt wird
00:08:47es anfangen, das zu erstellen, was Open Book genannt wird. Claude konnte also die Kalenderdemo fertigstellen,
00:08:51die wir uns hier ansehen. Mal sehen, ob es tatsächlich funktioniert. Und dann gehen wir zurück und
00:08:55tauchen wirklich in das ein, was Codex zu diesem gesamten Prozess beigetragen hat. Wir haben also den Einführungsanruf und dann eine Arbeitssitzung.
00:09:01Wenn wir also zum Einführungsanruf gehen, können wir eine Reihe verschiedener Zeiten und Zeitpläne sehen,
00:09:07die tatsächlich mit meinem Gmail-Kalender synchronisiert sind. Nehmen wir also an, ich wähle etwas für den 31.
00:09:12aus und ich wähle 10 Uhr. Sie können einfach meinen Namen hinzufügen, wir geben meine E-Mail ein. Und dann bestätigen wir die Buchung.
00:09:23Und wir können sehen, dass die E-Mail mit einem Beitrittslink an uns gesendet wurde. Und ich kann auch meinen gesamten Kalender sehen,
00:09:28ich habe auch ein einfaches Artefakt erstellen lassen, das visuell aufschlüsselt, was Codex zu diesem
00:09:33gesamten Prozess beigetragen hat. Wir haben vorhin darüber gesprochen, diese Hin- und Her-Phase, in der Claude den Plan hatte und
00:09:38Codex seine Anpassungen vorgenommen hat, beziehungsweise vorgeschlagene Anpassungen, die sich über
00:09:42sieben Runden dauerte. Es fing mit 27 Problemen an. Und man sieht, wie es in jeder Runde weniger wurde, bis
00:09:48wir in Runde sieben schließlich ein genehmigtes Urteil hatten. Und hier sind nun einige Dinge, auf die Codex
00:09:52Claude während der Planungsphase tatsächlich aufmerksam gemacht hat, wie etwa, dass die Einschränkung für Doppelbuchungen
00:09:57nicht kompilierbar war und der OAuth-Verbindungsablauf Probleme bereitete. Es gab auch Probleme mit der Nebenläufigkeit,
00:10:03dass zwei Umbuchungen derselben Reservierung gleichzeitig erfolgreich sein konnten, und so weiter und so fort, viele Randfälle.
00:10:08Nun, in der Erstellungsphase hat Claude diesen verbesserten Plan umgesetzt, den wir nach den
00:10:12sieben Runden hatten. Und dann tauchte eine neue Codex-Sitzung auf, mit völlig frischem Speicher, neuem Kontext-
00:10:17fenster – sie hatte den Plan nicht gelesen. Und dann las sie den Code anhand der tatsächlichen Spezifikation, was erstellt
00:10:23wurde im Vergleich zu dem, was tatsächlich geplant war. Sie kam also mit 23 Befunden zurück, 19 wurden akzeptiert und behoben, vier
00:10:29wurden abgelehnt. Hier sind also einige Dinge, die Codex in dieser Erstellungsphase fand: Das Zeitraster verschob sich nach
00:10:34jeder Besprechung, das Verwaltungstoken lag im Klartext vor, alle Ereignisse blockierten die falschen Stunden.
00:10:39Und nochmals mehr Dinge, bei denen man wiederum argumentieren könnte, es seien Randfälle, aber es hätte
00:10:44Claude lange Zeit gekostet, sie zu finden. Wenn Codex also von Anfang an nie dabei gewesen wäre,
00:10:48wie hätte das ausgesehen? Nun, wir hätten fehlerhafte Funktionen gehabt, wir hätten Buchungen, die
00:10:53in der Datenbank existieren und sonst nirgendwo, und so weiter. Wäre das in Wirklichkeit nun tatsächlich so gewesen, wenn wir
00:10:58uns nur auf Claude verlassen hätten? Vermutlich hätten wir am Anfang einfach ein paar weitere Iterationen gebraucht und wären
00:11:03schließlich zu etwas gelangt, das wahrscheinlich funktionierte. Aber mit Codex haben wir viele dieser Probleme bereits in der
00:11:08Planungsphase gefunden. Wir mussten also keine Token verbrennen und danach noch mehr Token verbrennen. Und wir waren
00:11:14in der Lage, diese Dinge mit Codex zu testen und sie uns mit Codex anzusehen, bevor wir in die Produktion übergingen. Alles in allem
00:11:21spart Ihnen das viel Zeit und Geld. Das ist also die Claudex-Schleife in Aktion. Wenn Sie selbst Zugang dazu
00:11:26möchten, werde ich einen Link dazu in den angepinnten Kommentar setzen. Abgesehen davon sehen wir uns das nächste Mal.

핵심 요약

Das Open-Source-Tool Claudex Loop eliminiert Claudes positive Selbstbewertung durch ein sekundäres Modell wie Codex, das Pläne und Code in iterativen Schleifen auf kritische Randfälle prüft.

하이라이트

  • Das Open-Source-Repository Claudex Loop bindet ein zweites Modell wie Codex zur objektiven Bewertung von Claude ein, um Selbstbewertungsfehler zu verhindern.

  • Der Review-Prozess läuft über bis zu fünf Runden in einer schreibgeschützten Sandbox, in der Pläne automatisch auf Fehler geprüft werden.

  • Bei der Nachbildung einer Kalender-Web-App mit Claudex Loop deckte Codex in sieben Runden 27 initiale Probleme wie Doppelbuchungskonflikte auf.

  • In der Erstellungsphase fand Codex nach einem frischen Kontextlesen 23 zusätzliche Fehler, darunter im Klartext vorliegende Verwaltungstokens.

타임라인

Das Problem der einseitigen KI-Bewertung

  • Claude bewertet seine eigene Arbeit grundsätzlich als genial und erkennt eigene Planungsfehler nicht.
  • Claudex Loop fügt ein zweites Modell wie Codex hinzu, um Pläne objektiv zu überprüfen und Korrekturen vorzunehmen.
  • Der strukturierte Workflow teilt sich in Phasen wie Recherche, Befragung, Überprüfung und Erstellung auf.
  • Die Überprüfungsschleife stoppt standardmäßig nach fünf Runden, um Endlosschleifen und unnötigen Token-Verbrauch zu verhindern.

Einzelne KI-Modelle neigen dazu, ihre eigenen Pläne unkritisch zu bewerten. Durch die Integration von Codex entsteht ein unabhängiges Korrektiv, das Pläne in einer schreibgeschützten Sandbox validiert. Dieser strukturierte Ansatz beginnt mit einer Aufklärungs- und Befragungsphase, bevor der eigentliche Bauprozess startet. Anpassbare Variablen erlauben es Entwicklern, die Anzahl der Schleifen zu begrenzen oder lokale Modelle einzubinden.

Praktische Anwendung am Beispiel einer Kalender-App

  • Über den Befehl Claudex Loop wird eine Calendee-Alternative mit Google-Kalender-Integration gestartet.
  • In der Planungsphase identifizierte Codex nach sieben Runden und 27 anfänglichen Problemen kritische Logikfehler wie Nebenläufigkeitsprobleme bei Buchungen.
  • Die anschließende Code-Prüfung durch Codex mit frischem Kontext deckte 19 behobene Fehler wie im Klartext gespeicherte Tokens auf.
  • Der Einsatz eines sekundären Modells verhindert fehlerhafte Funktionen und spart langfristig Token-Kosten sowie Entwicklungszeit.

Die praktische Demonstration zeigt die Nachbildung einer Terminierungs-Web-App. Während der Planungsphase korrigiert das System schwerwiegende Fehler wie nicht kompilierbare Doppelbuchungseinschränkungen. Nach der Umsetzung analysiert eine frische Codex-Sitzung den erstellten Code und behebt Probleme wie verschobene Zeitraster. Diese doppelte Absicherung führt zu stabileren Anwendungen, bevor diese in die Produktion übergehen.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기