Die Gauntlet-Schleife hat einen riesigen Fehler... Diese Claude-Fähigkeit hat ihn gerade behoben

AAI LABS
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Es gibt eine Art von Schleife, die in letzter Zeit stark beworben wird, und sie nennt sich Gauntlet-Schleife.
00:00:04Es ist eine Schleife, mit der Leute tatsächlich riesige Apps und richtig hochwertige Spiele in einem einzigen Durchlauf bauen können.
00:00:10Wir haben ihr zum Beispiel ein riesiges Produkt zum Erstellen gegeben, und obwohl es über eine Stunde dauerte, konnte sie den Job fehlerfrei abschließen.
00:00:16Und der Prompt hinter all dem ist bei Weitem nicht so komplex, wie man erwarten würde.
00:00:20Aber das ist der Teil, von dem dir jeder erzählt.
00:00:22Was sie dir nicht erzählen, ist, dass diese Schleife zwei große Probleme hat und genau diese Probleme der Grund sind,
00:00:28warum sie zwar für Spiele geeignet ist, aber nicht für ein echtes Projekt.
00:00:31Man könnte also denken, dass das Beheben eine völlig neue Technik erfordert, aber das tut es nicht, da die Lösung bereits auf unerwartete Weise entwickelt und veröffentlicht wurde.
00:00:38Falls du das zum ersten Mal siehst: Willkommen.
00:00:40Wir sind ein Softwareunternehmen und das ist unser Kanal AI Labs, wo wir dir zeigen, wie du dein Business mit KI optimierst.
00:00:45Und wenn du kein eigenes hast, kannst du diese Fähigkeiten nutzen, um dafür bezahlt zu werden, es für jemand anderen zu optimieren.
00:00:50In diesem Video schauen wir uns die Schleife an, was diese beiden Probleme sind und wie sie bereits gelöst wurden.
00:00:55Falls du bereits weißt, was eine Gauntlet-Schleife ist, springe zum nächsten Abschnitt, da dieser Teil nur der Hintergrund ist.
00:01:00Bevor wir zur Gauntlet-Schleife kommen, musst du wissen, was eine Schleife überhaupt ist.
00:01:04Vor Schleifen warst du derjenige, der alles überprüft hat, wenn du etwas mit Claude gebaut hast.
00:01:07Du schickst einen Prompt, es gibt dir etwas zurück, du schaust es dir an, sagst ihm, was falsch ist, und machst solange weiter, bis es stimmt.
00:01:13Eine Schleife liegt vor, wenn dieses Hin und Her entfällt.
00:01:16Du gibst dem Agenten das Ziel und den Standard vor, den er erreichen muss, und er überprüft seine Arbeit so lange selbst, bis er dort ankommt.
00:01:21Du siehst das Ergebnis erst am Ende.
00:01:23Die Gauntlet-Schleife ist eine neue Art von Schleife, die in letzter Zeit häufig die Runde macht.
00:01:27Leute haben sie genutzt, um Spiele, 3D-Welten und vollständige Websites allein aus einem einzigen Prompt zu bauen.
00:01:32Aber was dahintersteckt, ist viel simpler, als die Ergebnisse erscheinen lassen, denn die gesamte Methode ist ein Prompt von nur drei Zeilen Länge, und das setzt die Schleife in Gang.
00:01:40Das Ganze begann, als Matt Schumer auf X eine Demo eines Ego-Shooters postete und sagte, Claude habe ihn aus einem einzigen Prompt gebaut, ohne bestehende Assets zu verwenden.
00:01:50Deshalb wurde der Beitrag so populär, denn dass ein Modell ein vollständig spielbares Spiel mit einem Prompt erzeugt, war nicht das, was die Leute diesen Modellen zu dem Zeitpunkt zutrauten.
00:01:57Ein paar Tage später veröffentlichte er, wie er das Spiel tatsächlich gebaut hatte, und gab der Methode auch den Namen Gauntlet-Schleife.
00:02:03Er hätte dem Agenten sagen können, dass das Spiel gut sein soll, aber “gut” ist etwas, das er selbst entscheidet, und ein Agent, der seinen eigenen Standard festlegt, winkt seine eigene Arbeit durch.
00:02:11Also gab er ihm stattdessen ein echtes Spiel, an dem die Arbeit gemessen werden musste.
00:02:14Und sobald die Methode draußen war, fingen andere an, sie selbst auszuprobieren.
00:02:17Andrej Karpathy, eines der Gründungsmitglieder von OpenAI, sagte, solche Ergebnisse seien wichtig, weil Arbeit von so hoher Qualität früher nie wert war produziert zu werden, wenn der Zeitaufwand den Nutzen nie rechtfertigte.
00:02:28Ein Modell hat dieses Limit nicht, also experimentierten die Leute mit verschiedenen Ideen, die die Grenzen des Modells bis zum Maximum ausreizten.
00:02:34Bevor wir uns jedoch weiter damit beschäftigen, wäre es toll, wenn du den Kanal abonnierst und den Hype-Button drückst.
00:02:39Diese kleine Geste der Unterstützung hilft uns enorm weiter.
00:02:43Lass uns nun verstehen, wie diese Schleife im Inneren funktioniert.
00:02:46Schumer veröffentlichte den genauen Prompt, den er verwendet hatte, und es waren nur drei Zeilen, die das gesamte Spiel bauten.
00:02:51Jede Zeile kümmert sich um einen anderen Teil des Builds und sie ist einfach genug, dass du dieselben drei Zeilen für das schreiben kannst, was du gerade machst.
00:02:57Die erste Zeile definiert, was du baust.
00:03:00Bei Schumer war es der Bau eines Ego-Shooters.
00:03:02Und die zweite Hälfte dieser Zeile definiert, welche Qualität er erreichen musste, nämlich das Niveau der neuesten Call of Duty-Spiele.
00:03:09Er forderte AAA-Qualität – so nennt die Branche ihre Spiele mit den größten Budgets –, und stellte klar, dass es buchstäblich in allem perfekt sein musste, von den Texturen bis zur Physik.
00:03:18Die zweite Zeile bestimmt, wie gebaut werden soll, und diese Zeile entscheidet, wie die Arbeit aufgeteilt wird.
00:03:23Du sagst dem Hauptagenten, dass er das Ziel selbst in kleinere Teile zerlegen und jeden Teil an einen eigenen Subagenten übergeben soll.
00:03:28Falls du nicht weißt, was Subagenten sind: Das sind separate Agenten, die der Hauptagent startet, und jeder von ihnen arbeitet an seiner eigenen kleinen Aufgabe in seinem eigenen Speicher, ohne zu sehen, was die anderen tun.
00:03:38Und der Prompt ist diesbezüglich sehr spezifisch.
00:03:40Der Agent muss die Arbeit selbst aufteilen, damit dieser Aufwand nicht an dir hängen bleibt.
00:03:44Aber der Agent muss dennoch wissen, ob er sich in die richtige Richtung bewegt, und dafür ist der Kritiker da.
00:03:49Der Prompt legt eine Schleife auf jeden Agenten, den der Hauptagent erzeugt, und um die Arbeit jedes Einzelnen zu überprüfen, weist er ihm einen separaten Subagenten zu.
00:03:56Dieser Überprüfungs-Subagent wird als Kritiker bezeichnet.
00:03:58Die einzige Aufgabe des Kritikers besteht darin, die Arbeit zu prüfen, und wenn sie nicht gut genug ist, schickt er sie zur Korrektur an den Ersteller-Agenten zurück, bis sie es ist.
00:04:04Der Kritiker baut selbst nie etwas und startet ohne Erinnerung an das, was zuvor geschah, sodass er nicht weiß, wer die Arbeit gemacht hat oder wie oft dieser Teil bereits zurückgeschickt wurde.
00:04:13Er muss bei der Bewertung des Ganzen einfach gnadenlos und kritisch ehrlich sein.
00:04:16Die dritte Zeile ist das tatsächliche Qualitätsniveau, das das Endergebnis erreichen soll, und das sagt dem Kritiker, wann er aufhören darf.
00:04:23Schumer setzt Call of Duty als Standard dafür fest, wie das vom Agenten gebaute Spiel aussehen soll.
00:04:28Seine Anweisung lautet, dass der Kritiker die beiden buchstäblich blind vergleichen und sagen soll, welches besser aussieht.
00:04:33“Blind” bedeutet hier lediglich, dass ihm nicht gesagt wird, welches von Claude erstellt wurde, sodass er nicht weiß, welches das Produkt und welches das von Claude entworfene Spiel ist, woraufhin er einfach das Spiel auswählt, das von beiden besser ist.
00:04:43Und es gibt noch ein weiteres Wort am Ende dieses Prompts, das man kennen sollte, nämlich Ultracode.
00:04:47Das ist ein Schlüsselwort in Claude Code, und wenn man es einfügt, wird das Ganze zu einem dynamischen Workflow,
00:04:52was eine Funktion ist, die eine ganze Flotte dieser Subagenten gleichzeitig ausführt, anstatt die Arbeit auf nur wenige aufzuteilen.
00:04:58Und wenn man die Arbeit so ausführt, nennen wir das tatsächlich einen Graphen.
00:05:01Falls du nicht weißt, was Graphen sind: Sie sind im Grunde eine fortgeschrittene Form von Schleifen,
00:05:05bei denen viele verschiedene Subagenten in Schleifen laufen, statt dass ein einzelner Agent alleine schleift,
00:05:09was genau das ist, was die Gauntlet-Schleife tut.
00:05:12Wenn du unsere früheren Videos gesehen hast, weißt du, dass wir so etwas bereits lange vor seiner Beliebtheit als Gauntlet-Schleife behandelt haben.
00:05:18Und was die Gauntlet-Schleife zeichnet, ist ein Diamant-Graph: oben eine Aufgabe, die sich in mehrere parallel laufende Subagenten aufspaltet
00:05:26und dann wieder in einem einzigen Agenten zusammenläuft, der all ihre Erkenntnisse zu einer Antwort bündelt.
00:05:31Das gesamte Konzept der Gauntlet-Schleife ist für dich also vielleicht nichts Neues, aber was du nicht weißt, ist, dass diese Schleife einige große Probleme hat.
00:05:38Bevor wir jedoch über die Probleme sprechen, hören wir ein Wort von unserem Sponsor.
00:05:42Wenn du das Programmieren lernst, sind es echte Daten, die ein Portfolioprojekt wirklich hervorheben.
00:05:47Die meisten Anfängerprojekte laufen mit gefälschten Beispieldaten.
00:05:49Der Haken an der Sache ist, dass echte Daten zu beschaffen normalerweise Scraping bedeutet, und das ist ein Kopfschmerz, den niemand will.
00:05:54Hier kommt SERP API ins Spiel.
00:05:55Es liefert dir saubere, strukturierte Suchergebnisse von Google, YouTube und mehr in einem einzigen API-Aufruf
00:06:00und übernimmt den Scraping-Stress für dich – Captchas, Proxies, einfach alles.
00:06:04Du erhältst Millionen echter Datenpunkte als sauberes JSON und schärfst deine Datenkompetenz beim Bauen.
00:06:09Anstatt des nächsten To-Do-Listen-Konservenprojekts könntest du einen Live-Preis-Tracker mit ihrer Google Shopping API bauen
00:06:14oder ein Trend-Dashboard, das über ihre Google Trends API angetrieben wird, um in Echtzeit zu zeigen, was gerade aufsteigt.
00:06:19Das ist der Unterschied zwischen einem Projekt, das nach Tutorial aussieht, und einem, das dir einen Job verschafft.
00:06:24Du kannst mit 250 kostenlosen Credits starten – klicke einfach auf den Link in der Beschreibung oder scne den QR-Code auf dem Bildschirm.
00:06:30Ein großes Dankeschön an SERP API für das Sponsoring dieses Videos.
00:06:33Ungeachtet dessen, wie viele Leute auf X und YouTube ganze Projekte mit der Gauntlet-Schleife in einem Durchlauf erstellen,
00:06:38erkennen viele die zugrundeliegenden Probleme nicht.
00:06:40Es gibt zwei große Probleme.
00:06:42Das erste ist, dass der Hauptagent vollständig für die Überprüfung verantwortlich ist.
00:06:45Er verwaltet eigenständig, wie er die Kritiker startet und ihre Anweisungen schreibt.
00:06:49Im Grunde hast du also weder Kontrolle über die Agenten noch darüber, wie der Beurteilungs-Prompt an die Kritiker übergeben wird.
00:06:55Alles, was du ihm gegeben hast, war ein Spiel zum Vergleich, und darüber hinaus besagt der Prompt einfach:
00:06:59sei ein wirklich strenger Kritiker und überprüfe es visuell.
00:07:01Und wir haben das auf dem Kanal schon früher gesagt: Das Überprüfen ist etwas, das man konkreter festlegen sollte, anstatt den Agenten eigenständig verifizieren zu lassen.
00:07:08Das bedeutet also, dass der Agent alles selbst herausfindet, und bei dem Umfang, in dem er arbeitet,
00:07:14wirst du langfristig nicht herausfinden können, was das Problem verursacht hat.
00:07:17Das zweite Problem entscheidet darüber, ob diese Methode überhaupt für dich funktioniert.
00:07:21Die Messlatte für die Qualität in diesem Prompt ist ein bestehendes Produkt.
00:07:24Schumer hat es als Call of Duty festgelegt – ein bereits veröffentlichtes Spiel –, sodass der Kritiker etwas Echtes hatte, woran er die Arbeit messen konnte, anstatt selbst zu entscheiden, was gut bedeutet.
00:07:32Das ist der einzige Grund, warum das funktioniert hat.
00:07:34Und das ist in Ordnung, wenn man ein Spiel baut, weil es immer etwas gibt, womit man es vergleichen kann.
00:07:38Gasselbe gilt für eine Landingpage, die du erstellst, oder eine 3D-Welt.
00:07:42Du benennst, was du bauen willst, der Kritiker geht hin, schaut es sich an und wählt aus, welche der beiden Versionen besser ist.
00:07:46Aber wenn du etwas Neues baust, gibt es keine bestehende App, an der man diesen Maßstab anlegen könnte.
00:07:51Der Kritiker erfindet einen Standard und fängt an, die Arbeit danach durchzuwinken.
00:07:54Und wenn du merkst, dass die Richtung nicht deinen Wünschen entspricht, hast du viel Zeit und Token verschwendet.
00:07:59Du kommst also zu einem Stapel von Features zurück, die alle auf einmal und gegen einen Standard gebaut wurden, den sich der Agent selbst ausgedacht hat.
00:08:05Und nichts zu haben, womit man die Arbeit vergleichen kann, ist der Normalfall, nicht die Ausnahme.
00:08:09Wenn du die Abrechnungsregeln erstellst, nach denen dein eigenes Unternehmen läuft, gibt es nichts Fertiges, das du dem Kritiker zur Überprüfung geben könntest.
00:08:15Die Gauntlet-Schleife funktioniert also, wenn es etwas gibt, das nah genug zum Kopieren ist, und sie bricht in dem Moment zusammen, in dem das nicht der Fall ist.
00:08:21Es gibt eine Lösung dafür, und sie besteht aus zwei Teilen.
00:08:23Der erste ist die Verifizierung, bei der du die Prüfungen richtig planst, anstatt den Agenten sie erfinden zu lassen – das haben wir im Video zum Thema Graph Engineering behandelt.
00:08:30Der zweite Teil besteht darin, der Schleife konkrete Anforderungen zu geben, damit sie nicht von dem abweicht, was du willst.
00:08:35Und hier kommt ein Tool namens Wayfinder ins Spiel.
00:08:37Wayfinder wurde von Matt Pocock entwickelt.
00:08:39Er ist Softwareentwickler und hat eine Reihe von Skills veröffentlicht, die man installieren kann, und jeder ist für eine andere Aufgabe gedacht.
00:08:46Wayfinder ist sein intensiver Planungs-Skill, und seinen eigenen Worten nach basiert er auf den Grundlagen der Arbeitsplanung, die er lernte, bevor es KI gab.
00:08:54Und er ist überhaupt nicht ans Programmieren gebunden.
00:08:56Man kann ihn für alles verwenden, was man planen muss.
00:08:59Und der Grund, warum es diesen Skill überhaupt gibt, ist ein Problem, auf das Sie wahrscheinlich schon gestoßen sind.
00:09:03Wenn man etwas Großes mit einem Agenten plant, ist das Ziel klar, aber der Weg dorthin nicht.
00:09:08Und diese Strecke dazwischen nennt Pocock den Nebel.
00:09:11Der Agent sagt einem nie, wenn er sich im Nebel befindet.
00:09:13Er füllt die Lücke mit eigenen Annahmen und plant weiter, als wäre die Sache geklärt.
00:09:18Was man also zurückbekommt, ist ein Plan, der fertig aussieht, aber erfundene Teile in der Mitte enthält.
00:09:22Daraus baut er eine Karte.
00:09:23Jede Entscheidung, die noch getroffen werden muss, landet als eigene Frage auf dieser Karte, und diese Fragen werden in zwei Gruppen aufgeteilt.
00:09:30Es gibt diejenigen, die man sofort klären kann, weil alles, wovon sie abhängen, bereits entschieden wurde,
00:09:35und diejenigen, die noch im Nebel liegen, weil etwas, das man noch nicht untersucht hat, sie aufhält.
00:09:39Und genau das ist der Teil, der für uns zählt.
00:09:41Wenn Wayfinder auf Nebel stößt, raten sie nicht.
00:09:43Er schickt den Agenten los, um den Nebel zu lichten, und das kann durch Recherchen geschehen,
00:09:47oder indem man etwas Grobes baut, um es sich anzusehen und darauf zu reagieren, oder durch eine reale Aufgabe wie die Anmeldung bei einem Dienst, um ihn zu bewerten.
00:09:54Jeder dieser Punkte wird für sich behandelt, und sobald er geklärt ist, wandert die Antwort zurück auf die Karte und schaltet frei, was darauf gewartet hat.
00:10:01Man arbeitet sich Frage für Frage durch diese Karte, bis kein Nebel mehr übrig ist.
00:10:04Was am Ende bleibt, ist jede Entscheidung schriftlich festgehalten mit der dazugehörigen Begründung,
00:10:09und Wayfinder verwandelt das Ganze in eine einzige Spezifikation, also im Grunde das eine Dokument, das darlegt, was man baut und warum.
00:10:15Und genau das macht Wayfinder zur Lösung für die Spießrutenlauf-Schleife, denn genau wie Call of Duty als Maßstab für das Spiel diente,
00:10:21wird eine Spezifikation zu demselben Maßstab und zu einer Möglichkeit zu überprüfen, was das zu bauende Ding als fertig kennzeichnet.
00:10:27Diese Spezifikation ist genau das Ding, das das Problem mit dem Planungsnebel löst, über das wir gesprochen haben.
00:10:32Jede Entscheidung darin wurde tatsächlich getroffen, statt nur angenommen zu werden,
00:10:35sodass der Kritiker, wenn man die Abrechnungsregeln für das eigene Unternehmen baut oder etwas anderes ohne Vorlage,
00:10:40immer noch etwas Handfestes hat, womit er arbeiten kann, anstatt einen eigenen Standard zu erfinden.
00:10:44Um Ihnen also zu zeigen, wie das funktioniert, nehmen wir dieses HR-System als Beispiel.
00:10:49Leute können das nutzen, um Urlaub zu beantragen, Beschwerden einzureichen und mehr.
00:10:52Wenn Sie nun den originalen Wayfinder installieren möchten, können Sie das über den GitHub-Link unten tun.
00:10:56Das GitHub-Repository enthält einen Installationsbefehl, den Sie in Claude Code ausführen können.
00:11:01Aber es gibt ein Problem mit dem originalen Skill.
00:11:03Wayfinder ist in seiner Planung sehr umfassend, da er darauf ausgelegt ist, einen den ganzen Weg bis zu einer fertigen Spezifikation zu führen.
00:11:09Das war nicht das, was wir brauchten. Wir wollten nur den Teil, der zu Klarheit führt,
00:11:13damit wir am Ende einen vollständigen Plan und sonst nichts haben.
00:11:16Wenn man den originalen Wayfinder-Skill ausführt, nimmt er jede Entscheidung, die man während der Fragerunde getroffen hat,
00:11:21und verwandelt jede einzelne in eine separate Anforderungsdatei, auf die der Agent zurückgreifen kann.
00:11:26Er definierte, was zu bauen ist, aber wir wollten einen Schlüssel, mit dem sich der Agent selbst überprüfen kann.
00:11:31Also baten wir Claude, den Skill so zu ändern, dass er nicht für jede Entscheidung eine eigene Datei schreibt,
00:11:36sondern diese Entscheidungen in einen einzigen Antwortschlüssel umwandelt, gegen den sich der Agent immer wieder selbst prüfen kann.
00:11:41Er hat den Skill komplett neu geschrieben, die Hauptteile des Originals beibehalten und den Rest auf das andere Ziel zugeschnitten.
00:11:47Das Ergebnis ist eine viel einfachere Version, eine, die nur zwei Dateien schreibt,
00:11:51die Karte und den Antwortschlüssel, anstelle der separaten Tickets, die das Original erzeugt.
00:11:55Aber hier ist noch etwas Interessantes. Der Wayfinder-Skill funktioniert nicht von alleine.
00:11:59Er ruft auch andere Skills von Matt Pocock auf, aber in unserer Version haben wir auch das reduziert.
00:12:03Sie brauchen nur diese drei Skills, die Sie ebenfalls über den GitHub-Link unten bekommen können.
00:12:07Zum Beispiel nutzt der Wayfinder-Skill Grill.me für den Befragungsteil des Planungsprozesses.
00:12:12Um ihn zu nutzen, öffneten wir Claude Code und führten den Wayfinder-Befehl aus,
00:12:15weil dies einer dieser Skills ist, die der Agent nicht von alleine startet.
00:12:18Dann sagten wir ihm, was wir wollten, nämlich dieses HR-System.
00:12:21Und er fing an, uns zu befragen.
00:12:23Er fragte, für wen die App eigentlich gedacht ist, was unbedingt hinein muss und was nicht,
00:12:27dann, wie das Ergebnis aussehen soll und was schiefgehen könnte, sobald die Leute sie benutzen.
00:12:31Es war ein langes Hin und Her, das bei 34 Fragen endete.
00:12:34Sobald wir alle beantwortet hatten, schloss er das Interview ab und schrieb zwei Dateien in einen .wayfinder-Ordner.
00:12:39Die erste ist die Karte, die jede Entscheidung enthält, die wir getroffen haben,
00:12:42den Grund hinter jeder einzelnen und wie das fertige Ding aussehen soll.
00:12:46Die zweite ist der Antwortschlüssel, und der besteht aus nichts anderem als Prüfungen,
00:12:49bei denen jede Zeile entweder als bestanden oder nicht bestanden zurückkommt.
00:12:52Um also die Spießrutenlauf-Schleife zu starten, brauchten wir einen Prompt.
00:12:55Wir kopierten genau den, den Matt gepostet hatte, und gaben ihn Claude.
00:12:58Dann bittet man ihn, diesen Prompt für die App umzuschreiben, die man baut,
00:13:01was in unserem Fall das HR-System war.
00:13:03Das einzige, was man ändert, ist das, woran es gemessen wird.
00:13:06Anstelle eines Spiels sagt man ihm, die Vertrauensquelle sei der .wayfinder-Ordner,
00:13:10der aus der Planung hervorgegangen ist, und alles wird anhand dessen überprüft, was darin steht,
00:13:13ganz genau so, wie Call of Duty im Original funktionierte.
00:13:16Und Claude gibt das Ganze im selben Spießrutenlauf-Format zurück, nur eben für Ihre App geschrieben.
00:13:20Von da an lief es genauso wie das Original.
00:13:23Es plante die Unter-Agenten, nur dass sie dieses Mal den Antwortschlüssel hatten, um alles zu überprüfen.
00:13:27Wir sagten ihm, dass es kein „ungefähr richtig“ und keine Abkürzungen gibt.
00:13:30Es plante, was es als Erstes bauen würde, dann die Tools, die es installieren musste,
00:13:34und dann die Fundamentarbeiten, damit die Agenten etwas Handfestes zum Aufbauen hatten.
00:13:37Danach startete es eine Menge Agenten auf einmal, jeden für einen anderen Teil des Systems.
00:13:42Der Build dauerte 1 Stunde und 33 Minuten und verbrauchte etwa 40% unseres Sitzungslimits.
00:13:47Und wenn wir das über die API statt über unseren Max-Tarif hätten laufen lassen,
00:13:50hätte derselbe Build ungefähr 116 Dollar gekostet, was eine Menge ist.
00:13:54Aber was dabei herauskam, war genau die App, wie wir sie geplant hatten.
00:13:58Jedes gewünschte Feature funktionierte einwandfrei in der App,
00:14:00auch wenn sie einige Probleme hatte, aber insgesamt war es das, was unserer benötigten Implementierung am nächsten kam.
00:14:05Der Skill, den wir dafür erstellt haben, zusammen mit allen anderen Ressourcen,
00:14:09ist in AI Labs Pro verfügbar, unserer Community.
00:14:12Wenn Sie also unseren Wert schätzen und den Kanal unterstützen möchten,
00:14:15ist dies der beste Weg dafür.
00:14:17Der Link ist in der Beschreibung.
00:14:18Das bringt uns an das Ende dieses Videos.
00:14:20Wenn Sie den Kanal unterstützen und uns helfen möchten, weiterhin solche Videos zu machen,
00:14:24können Sie das über den Super-Thanks-Button unten tun.
00:14:26Wie immer vielen Dank fürs Zusehen, und bis zum nächsten Mal.

Key Takeaway

Die Gauntlet-Schleife ermöglicht die Erstellung komplexer Software aus nur drei Zeilen, erfordert jedoch eine präzise Spezifikation wie Wayfinder, um das Problem des fehlenden Qualitätsmaßstabs zu lösen.

Highlights

  • Die Gauntlet-Schleife baut Spiele und Anwendungen aus einem einzigen, dreizeiligen Prompt.

  • Der dreizeilige Prompt besteht aus der Beschreibung des Ziels mit AAA-Qualität, der Aufteilung in Subagenten und einem etablierten Referenzprodukt als Maßstab.

  • Das erste große Problem der Gauntlet-Schleife ist die alleinige Überprüfung durch den Hauptagenten ohne externe Qualitätskontrolle.

  • Das zweite Problem zeigt sich, wenn keine bestehende Vorlage existiert, da der Agent den Standard selbst erfindet und zu falschen Ergebnissen führt.

  • Das Planungstool Wayfinder basiert auf einer Befragung und erstellt eine strukturierte Karte sowie einen Antwortschlüssel zur Validierung.

  • Der modifizierte Build des HR-System-Projekts dauerte 1 Stunde und 33 Minuten, verbrauchte 40% des Sitzungslimits und kostete via API 116 Dollar.

Timeline

Grundlagen der Gauntlet-Schleife

  • Die Gauntlet-Schleife automatisiert den Erstellungsprozess, sodass Agenten ihre Arbeit eigenständig überprüfen, bis ein Ziel erreicht ist.
  • Matt Schumer popularisierte die Methode mit einem Ego-Shooter, den Claude aus einem einzigen Prompt ohne bestehende Assets erstellte.
  • Die Methode stützt sich auf einen dreizeiligen Prompt, der das Ziel, die Aufteilung in Subagenten und einen externen Qualitätsmaßstab definiert.

Traditionell erfordert die Entwicklung mit KI ein ständiges Hin und Her zwischen Prompt und manueller Korrektur. Die Gauntlet-Schleife eliminiert diesen Aufwand, indem sie Agenten eigenständig korrigieren lässt. Ein von Matt Schumer veröffentlichter Prompt nutzte Call of Duty als visuellen und spielmechanischen Maßstab, was zu überraschend hochwertigen Ergebnissen führte.

Struktur und Probleme der Schleife

  • Der dreizeilige Prompt steuert den Aufbau, die Erstellung von Subagenten und die visuelle Überprüfung durch einen Kritiker.
  • Das erste Kernproblem ist die fehlende Kontrolle über die Kritiker, da der Hauptagent den Beurteilungs-Prompt eigenständig verwaltet.
  • Das zweite Problem tritt auf, wenn kein echtes Referenzprodukt existiert, weshalb der Agent den Standard erfindet und abweicht.

Die erste Zeile des Prompts definiert das Produkt und die AAA-Qualität. Die zweite Zeile teilt die Aufgaben auf Subagenten auf, während Kritiker-Agenten die Ergebnisse blind mit dem Referenzprodukt vergleichen. Ohne eine externe Referenz wie ein fertiges Spiel bricht dieses System jedoch zusammen, da der Agent ohne klaren Standard unkontrollierte Annahmen trifft.

Lösung durch Wayfinder und Projektergebnis

  • Wayfinder dient als Planungs-Skill, der unklare Anforderungen durch gezielte Fragen in eine präzise Spezifikation überführt.
  • Die angepasste Version reduziert die Ausgabe auf eine Karte und einen konkreten Antwortschlüssel als Prüfbasis für Agenten.
  • Ein vollständiges HR-System entstand in 1 Stunde und 33 Minuten, verbrauchte 40% des Sitzungslimits und kostete rund 116 Dollar.

Um das Problem des fehlenden Standards zu lösen, kommt Wayfinder zum Einsatz. Nach einer Befragung generiert das Tool eine Karte aller Entscheidungen und einen Antwortschlüssel. Wird dieser Schlüssel als Vertrauensquelle in den Gauntlet-Prompt integriert, arbeiten die Subagenten zielgerichtet und fehlerfrei an komplexen Individualprojekten.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video