스크립트
00:00:00Man kann Claude nicht einfach seine eigene Arbeit bewerten lassen. Das ist ein riesiges Problem, das jedoch
00:00:05von dieser Fähigkeit gelöst wird. Sie nennt sich Claudex Loop und das Prinzip dahinter ist einfach. Anstatt Claude
00:00:09für die Planung, Umsetzung und Benotung seiner eigenen Arbeit verantwortlich zu machen, holen wir Codex hinzu,
00:00:16damit es sich ebenfalls den Plan und die Ausführung von Claude ansieht und sagt: Hey, das sieht gut aus,
00:00:22das nicht, das solltest du ändern. Denn eines der großen Probleme bei jedem einzelnen KI-Modell da draußen
00:00:25ist, dass sie ihre eigene Arbeit sehr positiv bewerten. Wenn ich Claude frage, wie gut der von ihm
00:00:30erstellte Plan ist, wird es sagen: Das Ding ist genial. Deshalb ist es wichtig, Systeme zu haben,
00:00:35bei denen wir einen zweiten Blick auf das werfen lassen können, was das erste Modell gebaut hat, um zu sagen: Daumen hoch,
00:00:40Daumen runter und warum. Heute zeige ich dir also nicht nur diese Fähigkeit, sondern erkläre auch,
00:00:44wie sie im Hintergrund funktioniert, und wir machen eine kurze Demo. Nun, die Fähigkeit ist in vier Phasen unterteilt,
00:00:48und die Idee ist, dass du sie aufrufst, bevor du irgendeine Funktion hinzufügst oder ein völlig neues
00:00:53Grünwiesenprojekt startest. Der allgemeine Gedanke ist, dass wir, unabhängig davon, was sich das erste Modell als Plan ausdenkt
00:00:58oder ausführt, warten, bis das zweite Modell es sich ansieht und sagt: Hey, das sieht großartig aus,
00:01:02bevor wir bei großen Dingen fortfahren. In der ersten Phase betreiben wir etwas Aufklärung. Wir
00:01:07gehen tatsächlich ins Internet, Claude wird erkunden, ob die Antworten überhaupt
00:01:10existieren. Wir haben die Möglichkeit, die tiefe Recherche zu nutzen, den integrierten dynamischen Workflow, wenn wir
00:01:15wirklich tief in die Antworten einsteigen wollen, die wir erhalten. Danach gehen wir in die Befragungsphase über.
00:01:20Betrachte das als eine Reihe von Fragen im erweiterten Planungsmodus, bei der wir versuchen, uns mit Claude
00:01:25auf denselben Stand zu bringen, bevor es seinen ersten Plan erstellt. Zweitens holen wir hier das zweite
00:01:28Modell ins Boot. Dies ist die Überprüfungsphase. Claude Code erstellt also, nachdem es einen Plan basierend auf allem,
00:01:34worüber wir gesprochen und recherchiert haben, ausgearbeitet hat, deine standardmäßige plan.md.
00:01:38Von dort aus überprüft Codex den Plan in einer schreibgeschützten Sandbox und sagt:
00:01:43Entweder ist dies genehmigt oder wir müssen X, Y und Z überarbeiten. Es sendet diese Antwort dann
00:01:49mitsamt den Überarbeitungen an Claude Code. Claude Code sieht es sich an, sagt: Ich stimme zu, ich stimme nicht zu.
00:01:55Und dann sendet es seine Änderungen zurück. Diese Schleife läuft bis zu fünf Mal. Nun, ich habe
00:02:01es noch nie erlebt, dass sie tatsächlich nach fünf Mal stecken blieb oder wir keinen genehmigten Zustand erreichten. Allerdings habe ich
00:02:06sie bei fünf gestoppt; du kannst das mit der Fähigkeit ganz einfach ändern, damit sie nicht in einer seltsamen
00:02:11Endlosschleife feststeckt und du ewig und ewig Token verbrauchst. Das gibt dir eine sehr klare,
00:02:15harte Grenze, damit du nicht in dieser Situation stecken bleibst. Schließlich, sobald sich Claude und Codex geeinigt haben
00:02:20und ein Plan erstellt wurde, gehen wir in die Build-Phase über. Nun gibt dir diese Fähigkeit die Möglichkeit,
00:02:24nicht nur Claude bauen zu lassen, sondern du kannst auch Codex Dinge bauen lassen. Aber welches Modell
00:02:30es auch immer baut, das zweite Modell wird sich noch einmal ansehen, was es tatsächlich geschaffen hat, bevor es
00:02:34mit irgendetwas fortfährt. Und im Hintergrund gibt es auch hier viele verschiedene Variablen, die du anpassen kannst.
00:02:38Wie ich bereits erwähnt habe, haben wir den Überprüfungsabschnitt, der auf fünf eingestellt ist. Im Build-Abschnitt,
00:02:43wenn wir Codex einen Blick darauf werfen lassen, was wir gebaut haben, habe ich das wieder auf zwei Schleifen reduziert,
00:02:48nur um nicht in solche Endlosschleifen-Szenarien zu geraten. Und ich bin eigentlich nie auf
00:02:52Probleme gestoßen, bei denen ich das Gefühl hatte: Oh, das muss ich erhöhen. Aber du kannst damit herumspielen. Des Weiteren
00:02:56kannst du noch mehr damit herumspielen und tatsächlich ein lokales Modell anstelle von Codex einbinden,
00:03:00falls das auch dein bevorzugter Ansatz ist. Wenn du nun die vorherige Version der Fähigkeit nutzt,
00:03:04die Grill Me Codex hieß, sind die Änderungen, auf die du beim Claudix Loop achten solltest,
00:03:08ein verbesserter Befragungsmodus. Er geht also mit seiner Fragestellung tiefer. Und in
00:03:13der Ausführungsphase haben wir Codex stärker integriert. Wir können also wieder genauer hinsehen, wenn es um den
00:03:18tatsächlich erstellten Code geht. Als Nächstes kommt also die eigentliche Demo. Bevor wir uns jedoch darauf stürzen,
00:03:23ein kurzes Wort vom heutigen Sponsor: mir. Ich habe gerade eine komplett aktualisierte Version meiner
00:03:28Claude Code Masterclass in Chase AI Plus veröffentlicht, und das ist der beste Weg, um vom Anfänger zum KI-Entwickler zu werden,
00:03:33besonders wenn du keinen technischen Hintergrund hast. Wir konzentrieren uns auf reale Anwendungsfälle. Dies wird
00:03:38jede einzelne Woche aktualisiert. Wenn du also jemand bist, der in diesem wahnsinnigen Tool besser werden möchte, und du
00:03:42eben keinen Softwareentwicklungshintergrund hast, ist das genau das Richtige für dich. Wenn du es dir also
00:03:47ansehen möchtest, gibt es einen Link dazu im angepinnten Kommentar. Für die heutige Demo nutzen wir
00:03:51den Claudex Loop, um Calendee nachzubauen. Falls du nicht weißt, was Calendee ist: Es ist eine Terminierungs-Web-App,
00:03:56du gibst Leuten einen Link, sie können deinen Kalender sehen, Zeiten aussuchen, und es erstellt automatisch
00:04:00entweder einen Zoom-Link oder einen Google Meet. Es ist also etwas, das viele Leute nutzen und tatsächlich
00:04:05dafür bezahlen. Aber ich dachte mir: Hey, warum erstellen wir das nicht einfach selbst und sparen uns, weißt du, 10 Dollar
00:04:09im Monat oder was auch immer ich dafür zahle – ich sollte das wahrscheinlich wissen. Also werde ich einfach
00:04:13den Befehl Claudex Loop eingeben, meine Gedanken frei aussprechen und etwas sagen
00:04:18wie: Ich möchte den Claudex Loop nutzen, um im Wesentlichen unsere eigene Version von Calendee zu erstellen.
00:04:25Im Moment würde ich wahrscheinlich einfach Google Meet anstelle von Zoom verwenden. Aber ich möchte, dass es mit
00:04:32meinem Kalender verknüpft ist und im Grunde Calendee mit all den Hauptfunktionen nachbildet. Lass uns das also
00:04:38einfach mal machen. Zu Beginn befinden wir uns in Phase Null, der Forschungsphase. Sie sagt also:
00:04:41Hey, wie möchtest du diese Recherche eigentlich durchführen? Entweder machen wir die Websuche, was im Grunde deine
00:04:46Standard-Claude ist, die ein paar Sub-Agenten losschickt, oder wollen wir die volle Tiefenrecherche starten? Nun,
00:04:50bei dieser Fähigkeit habe ich sie auf Opus festgelegt. Wie du weißt, wenn du bei Tiefenrecherche auf
00:04:56Fable gehst und einfach deep research eingibst, ruft das Fable-Sub-Agenten auf, die deinen Verbrauch ziemlich
00:05:01in die Höhe treiben können. Daher habe ich es im Moment so eingestellt, dass es direkt Opus verwendet, um dir einfach zu helfen. Auch hier gilt:
00:05:05Du kannst das absolut tun. Es empfiehlt Web, aber ehrlich gesagt werde ich es tief machen lassen, um zu sehen,
00:05:10was dabei herauskommt. Es wird mir den vorgeschlagenen Prompt für die Tiefenrecherche und die Fragen zeigen, auf die
00:05:14es tatsächlich Antworten finden will. Es muss also etwas über Google Kalender, Meet, Fallstricke im Terminierungsbereich
00:05:19und im Allgemeinen über den Tech-Stack wissen. Wenn ich das genehmige, sagen wir einfach: Leg los. Und wenn ich
00:05:25es bearbeiten wollte, ist das ganz einfach. Claude ist mit der Tiefenrecherche fertig und hat dann eine
00:05:29Annahmen-Liste erstellt, was im Wesentlichen eine Liste von allem ist, von dem es annimmt, dass du es für dieses
00:05:36Projekt möchtest. Danach hat es weitere Fragen für uns, bei denen wir uns durch verschiedene Pfade
00:05:40arbeiten können. Aber das sind die Dinge, bei denen es sagt: Hey, ich glaube, hier gibt es nicht viele Fragen.
00:05:44Entweder kannst du dem einfach einen Daumen nach oben geben und es wird all das tun. Das wird dann
00:05:48irgendwie in den Plan eingebaut. Oder du kannst sagen: Hey, eigentlich möchte ich den Stack ändern oder: Hey, ich möchte ändern,
00:05:53wie wir mit Erinnerungen und Dingen dieser Art umgehen. Aber vorerst sagen wir: Hey,
00:05:57das ist bestätigt. Und dann gehen wir zu der sogenannten tragenden
00:06:01Ebene über. Wir alle lieben den Begriff tragend. Das wird jetzt an alles angehängt,
00:06:05was Claude tut. Nun gehen wir also zu diesen tragenden Fragen über. Die erste Frage lautet:
00:06:09Auf welchem Google-Konto befindet sich dein echter Kalender? Bei all diesen Fragen, unabhängig von deinem
00:06:13Projekt, wird dir eine Reihe von Fragen zusammen mit einer Empfehlung gegeben. Wenn du also keine Ahnung hast,
00:06:17kannst du einfach den Empfehlungen folgen. Aber ganz ehrlich, als Best Practice, wenn du absolut keine Ahnung hast, was Claude
00:06:23dir bezüglich potenzieller Antworten oder was auch immer vor sich geht erzählt, empfehle ich dir dringend,
00:06:27in diesen anderen Bereich zu gehen und im Grunde einfach so etwas zu sagen wie: Erkläre das näher. So wirst
00:06:32du tatsächlich gut, wenn es um KI und das Erstellen von Dingen geht, und bist nicht nur ein
00:06:35Akzeptanz-Affe, der immer und immer wieder auf Empfohlen klickt. Wenn du es nicht weißt, bitte Claude,
00:06:40es dir weiter zu erklären, bis du es verstehst. Das ist der einzige Weg, wie du tatsächlich
00:06:44lernen wirst, auch wenn das etwas außerhalb des Rahmens dieses Videos liegt. Wir entscheiden uns also für persönliches Gmail, und ich
00:06:49werde tatsächlich zu dem Zeitpunkt vorspulen, nachdem ich all diese Fragen beantwortet habe, da du wahrscheinlich verstanden hast,
00:06:53wie diese Phase funktioniert. Nach der Beantwortung der tragenden Fragen gehen wir zu einigen
00:06:58kosmetischen Entscheidungen über, die wiederum die Basisfunktionalität der Anwendung nicht wirklich verändern.
00:07:02In diesem Szenario werden sie alle ähnlich wie die Annahmen-Liste aufgelistet. Du kannst also entweder sagen,
00:07:08dies ist akzeptabel und es wird einfach damit fortfahren, oder du kannst sagen: Hey, ändere eins,
00:07:12ändere zwei, ändere was auch immer. Ich habe es so eingerichtet, damit du diesen Prozess etwas beschleunigen kannst.
00:07:16Nachdem wir diese kosmetischen Fragen beantwortet haben, gehen wir zu Phase zwei über. Claude schreibt
00:07:20diese plan.markdown-Datei und sie wird dann über GPT 5.6 Sol an Codex gesendet. Von dort aus
00:07:27haben sie ihr Hin und Her für maximal fünf Runden oder bis sie ein akzeptiertes
00:07:32Urteil erreichen. Claude und Codex gingen also fünf Runden lang hin und her. Zu Beginn gab es 27 Probleme,
00:07:37die in Runde eins zur Sprache gebracht wurden, und wir sind bei Runde fünf angelangt, und das Problem ist, dass es immer noch ein paar
00:07:43weitere Probleme gibt. Sie haben kein akzeptiertes Urteil erreicht. Ich habe vorhin erwähnt, dass mir das noch nie
00:07:47passiert ist, daher bin ich fast froh, dass es hier passiert ist. Wir haben also fünf Runden erreicht. Sie haben es noch nicht
00:07:51herausgefunden. Es gibt immer noch ein paar kleinere Probleme. Was möchtest du tun? Nun, du hast Möglichkeiten.
00:07:56Du kannst hier aufhören, es so belassen. Du kannst den Deadlock-Zustand einfach akzeptieren oder du kannst ihn
00:08:01Das werden wir also tun, und dann sehen wir, was passiert, wenn sie endlich
00:08:05auf derselben Wellenlänge sind. Aber es ist gut zu wissen und zu sehen, dass wir zwar diese festen
00:08:11GRENZEN haben, zum Beispiel fünf Runden, aber darauf nicht festgenagelt sind. Wenn Sie diesen Punkt wie hier erreichen,
00:08:15können Sie das Ganze ganz einfach verlängern. Nach sieben Runden haben sie sich also geeinigt, und jetzt wird
00:08:19Sie gefragt, wer das Ganze eigentlich bauen soll. Entweder lassen wir Claude bauen und Codex
00:08:24wirft einen Blick darauf, oder wir drehen es um: Codex baut und Claude wirft einen Blick darauf. In bestimmten Situationen,
00:08:29je nachdem, was wir tun, bietet es Ihnen auch die Option für einen Tandembau. Nehmen wir also
00:08:33an, wir würden etwas erstellen, das Asset-Generierung erfordert oder bei dem so etwas wie GPT-Bilder
00:08:38ins Spiel gebracht werden. Nun, es wird auch heißen: Hey, holen wir Codex für diesen speziellen
00:08:43Teil des Projekts hinzu. In diesem Fall lassen wir jedoch Claude bauen. Und jetzt wird
00:08:47es anfangen, das zu erstellen, was Open Book genannt wird. Claude konnte also die Kalenderdemo fertigstellen,
00:08:51die wir uns hier ansehen. Mal sehen, ob es tatsächlich funktioniert. Und dann gehen wir zurück und
00:08:55tauchen wirklich in das ein, was Codex zu diesem gesamten Prozess beigetragen hat. Wir haben also den Einführungsanruf und dann eine Arbeitssitzung.
00:09:01Wenn wir also zum Einführungsanruf gehen, können wir eine Reihe verschiedener Zeiten und Zeitpläne sehen,
00:09:07die tatsächlich mit meinem Gmail-Kalender synchronisiert sind. Nehmen wir also an, ich wähle etwas für den 31.
00:09:12aus und ich wähle 10 Uhr. Sie können einfach meinen Namen hinzufügen, wir geben meine E-Mail ein. Und dann bestätigen wir die Buchung.
00:09:23Und wir können sehen, dass die E-Mail mit einem Beitrittslink an uns gesendet wurde. Und ich kann auch meinen gesamten Kalender sehen,
00:09:28ich habe auch ein einfaches Artefakt erstellen lassen, das visuell aufschlüsselt, was Codex zu diesem
00:09:33gesamten Prozess beigetragen hat. Wir haben vorhin darüber gesprochen, diese Hin- und Her-Phase, in der Claude den Plan hatte und
00:09:38Codex seine Anpassungen vorgenommen hat, beziehungsweise vorgeschlagene Anpassungen, die sich über
00:09:42sieben Runden dauerte. Es fing mit 27 Problemen an. Und man sieht, wie es in jeder Runde weniger wurde, bis
00:09:48wir in Runde sieben schließlich ein genehmigtes Urteil hatten. Und hier sind nun einige Dinge, auf die Codex
00:09:52Claude während der Planungsphase tatsächlich aufmerksam gemacht hat, wie etwa, dass die Einschränkung für Doppelbuchungen
00:09:57nicht kompilierbar war und der OAuth-Verbindungsablauf Probleme bereitete. Es gab auch Probleme mit der Nebenläufigkeit,
00:10:03dass zwei Umbuchungen derselben Reservierung gleichzeitig erfolgreich sein konnten, und so weiter und so fort, viele Randfälle.
00:10:08Nun, in der Erstellungsphase hat Claude diesen verbesserten Plan umgesetzt, den wir nach den
00:10:12sieben Runden hatten. Und dann tauchte eine neue Codex-Sitzung auf, mit völlig frischem Speicher, neuem Kontext-
00:10:17fenster – sie hatte den Plan nicht gelesen. Und dann las sie den Code anhand der tatsächlichen Spezifikation, was erstellt
00:10:23wurde im Vergleich zu dem, was tatsächlich geplant war. Sie kam also mit 23 Befunden zurück, 19 wurden akzeptiert und behoben, vier
00:10:29wurden abgelehnt. Hier sind also einige Dinge, die Codex in dieser Erstellungsphase fand: Das Zeitraster verschob sich nach
00:10:34jeder Besprechung, das Verwaltungstoken lag im Klartext vor, alle Ereignisse blockierten die falschen Stunden.
00:10:39Und nochmals mehr Dinge, bei denen man wiederum argumentieren könnte, es seien Randfälle, aber es hätte
00:10:44Claude lange Zeit gekostet, sie zu finden. Wenn Codex also von Anfang an nie dabei gewesen wäre,
00:10:48wie hätte das ausgesehen? Nun, wir hätten fehlerhafte Funktionen gehabt, wir hätten Buchungen, die
00:10:53in der Datenbank existieren und sonst nirgendwo, und so weiter. Wäre das in Wirklichkeit nun tatsächlich so gewesen, wenn wir
00:10:58uns nur auf Claude verlassen hätten? Vermutlich hätten wir am Anfang einfach ein paar weitere Iterationen gebraucht und wären
00:11:03schließlich zu etwas gelangt, das wahrscheinlich funktionierte. Aber mit Codex haben wir viele dieser Probleme bereits in der
00:11:08Planungsphase gefunden. Wir mussten also keine Token verbrennen und danach noch mehr Token verbrennen. Und wir waren
00:11:14in der Lage, diese Dinge mit Codex zu testen und sie uns mit Codex anzusehen, bevor wir in die Produktion übergingen. Alles in allem
00:11:21spart Ihnen das viel Zeit und Geld. Das ist also die Claudex-Schleife in Aktion. Wenn Sie selbst Zugang dazu
00:11:26möchten, werde ich einen Link dazu in den angepinnten Kommentar setzen. Abgesehen davon sehen wir uns das nächste Mal.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기