Transcript
00:00:00Du hast wahrscheinlich schon von Agenten-Loops gehört, da sie gerade überall gehypt werden.
00:00:05Vielleicht denkst du, das sei nur eine Methode der KI-Unternehmen, damit du mehr für deren
00:00:09Produkte ausgibst, weil diese Loops viele Tokens verbrauchen. Aber das passiert nur, wenn man
00:00:13den falschen Loop-Typ für die Aufgabe wählt. Wie du weißt, sind wir ein Softwareunternehmen und wir haben
00:00:18mit diesen Loops bei unseren KI-Coding-Aufgaben experimentiert. Dabei haben wir die verschiedenen
00:00:23Arten von Loops und ihre jeweiligen Anwendungsgebiete kartiert. Von all den Loops, die wir
00:00:28aufgesetzt haben, zeigen wir dir hier die, die wir als wirklich nützlich empfunden haben. Wir zeigen dir auch,
00:00:33wie man jeden einzelnen einrichtet und wie sie deinen Workflow beeinflussen. Bevor wir zu den verschiedenen
00:00:38Loop-Arten kommen, lass uns kurz rekapitulieren, was Loop-Engineering eigentlich ist, für alle, die
00:00:43neu hier sind. Wir gehen nicht tief ins Detail, aber für die volle Analyse schau in unser vorheriges Video
00:00:48auf dem Kanal. Der Kern von Loop-Engineering ist, dass du aufhörst, die Prompts zu schreiben,
00:00:53die den Agenten steuern, und das Ganze in ein System verwandelst, das den Loop selbst schreibt. Anstatt deine
00:00:58Zeit mit dem Einrichten und dem Schreiben langer, sorgfältig strukturierter Prompts zu verbringen, nur damit es baut,
00:01:02lässt du den Agenten alles eigenständig erledigen. Er lernt dazu, wächst an den Problemen, auf die er
00:01:07stößt, und findet heraus, was als Nächstes zu tun ist. Das ist ein echter Agenten-Loop. Im
00:01:12letzten Video haben wir Loops basierend auf dem Ergebnis in zwei Typen unterteilt: den deterministischen Loop und
00:01:18den nicht-deterministischen Loop. Ein deterministischer Loop ist einer, bei dem du das Ergebnis bereits kennst,
00:01:22sodass der Agent eine klare Methode hat, seine Arbeit selbst zu überprüfen, und er arbeitet weiter, bis
00:01:27er es erreicht hat. Ein nicht-deterministischer Loop ist einer, bei dem du das nicht weißt, also gibt es keine solide Möglichkeit
00:01:32für den Agenten, seine Arbeit zu überprüfen, was bedeutet, dass du andere Wege brauchst, damit umzugehen. Aber das war eine grobe Einteilung,
00:01:36und wir haben nur eine Art gezeigt, sie einzurichten. Sie können auf viele verschiedene Arten gebaut werden,
00:01:41und jedes Setup ändert, was du tun kannst. Der erste Typ ist einer, den die meisten von euch wahrscheinlich schon benutzt haben.
00:01:46Er ist im Grunde der Baustein für jeden anderen Loop, und das klarste Beispiel ist der Zielbefehl (Goal Command).
00:01:51Wir nennen ihn den zustandslosen Loop, und er bedeutet im Grunde, dass der Loop nichts behält oder sich
00:01:56verbessert, während er arbeitet. Es gibt keinen Teil, in dem er aus dem Geschehen lernt und besser wird. Genau das
00:02:01macht diese Loops zu den einfachsten, die es gibt. Der eine, den du von dieser Art wahrscheinlich schon
00:02:05gesehen hast, ist der “Ralph-Loop”, und er ist zustandslos, weil er niemals ein Gedächtnis behielt. Er führte nur dieselbe Aufgabe
00:02:10immer wieder aus, und in dem Moment, als er sah, dass die Aufgabe beendet war, stoppte er. Wie du vielleicht schon
00:02:15über den Zielbefehl weißt, ist er das beste Beispiel für den zustandslosen Loop. Um ihn zu verwenden, sagst du ihm, was
00:02:19du bauen willst, direkt nach dem Zielbefehl. Von da an setzt Claude das als Ziel und beginnt
00:02:25daran zu arbeiten. Dann verwendet der Hauptagent jedes Mal, wenn er entscheidet, dass eine Aufgabe erledigt ist, ein kleineres Modell,
00:02:30um die Arbeit doppelt zu überprüfen. In Claude Code ist dieses kleinere Modell Haiku. Es überprüft alles, was der Agent
00:02:35gemacht hat, anhand der Anforderungen, die du im Prompt gegeben hast, und wenn die Aufgabe nicht vollständig erledigt ist,
00:02:38fordert es den Agenten erneut auf, das zu beenden, was er verpasst hat. Aber es gibt ein Problem mit diesem Loop. Er verlässt sich
00:02:43vollständig auf das Modell, um zu entscheiden, ob eine Aufgabe erledigt ist, ohne einen Maßstab, an dem man die Arbeit messen könnte.
00:02:48Deshalb funktioniert er am besten bei Funktionen, deren Anforderungen man auf eine harte, konkrete
00:02:53Weise überprüfen kann. Eine Möglichkeit, das zu tun, sind Tests. Wie wir in unserem letzten Video besprochen haben, schreiben wir die Tests,
00:02:58bevor wir Claude bitten, irgendeine Funktion zu bauen. Auf diese Weise, wenn Claude diese Funktion auf eine Weise ändert, die sie nicht sollte,
00:03:03werfen die Tests einen Fehler und sagen Claude, dass seine Implementierung nicht stimmt. Und sobald wir Tests
00:03:08für jede Funktion haben, können wir dem Agenten echte Autonomie geben und ihn arbeiten lassen, ohne uns Sorgen zu machen, dass er
00:03:12andere Funktionen kaputt macht oder die, die wir wollen, falsch baut. Sobald du die Tests geschrieben hast,
00:03:17kannst du Claude Code bitten, das Ziel so zu setzen, dass diese Funktion alle Tests besteht. Und er schreibt weiter
00:03:22Code, führt die Tests aus, um sich selbst zu überprüfen, und macht weiter, bis jeder Test besteht. Sobald sie alle
00:03:27bestehen, bedeutet das, die Funktion ist korrekt gebaut und Claude wird das Ziel als abgeschlossen markieren. Da der Agent
00:03:33alleine arbeitet, wirst du eine Zeile zu deiner Claude.md-Datei hinzufügen wollen. Diese Zeile weist den Agenten an,
00:03:38jede funktionierende Version der App zu speichern. Auf diese Weise, wenn er die App irgendwann später kaputt macht,
00:03:43kann er einfach auf die letzte funktionierende Version zurücksetzen und von dort aus weitermachen, anstatt zu versuchen,
00:03:47Änderungen aus dem Gedächtnis rückgängig zu machen. Aber bevor wir zu weiteren Typen übergehen, lassen wir ein Wort von unserem Sponsor.
00:03:53Minimax. Minimax hat gerade M3 veröffentlicht und es ist das erste Open-Weight-Modell, das bei drei Dingen gleichzeitig
00:03:59an der Spitze steht: Coding, eine Million-Token-Kontext und native Multimodalität. Also haben wir die M3-API
00:04:06direkt in Claude Code integriert und ihr eine echte Aufgabe gegeben: Recherche zu den Top-Elektroautos, die jetzt erhältlich sind,
00:04:11und ein Live-Vergleichs-Dashboard bauen. M3 hat es von dort an alleine übernommen. Es hat das Web durchsucht, echte
00:04:17Spezifikationen und Preise abgerufen und dann ein funktionierendes Dashboard von Grund auf geliefert. Du kannst verschiedene EV-Marken suchen,
00:04:22ihre neuesten Modelle durchsuchen und alles aktualisiert sich in Echtzeit. Beim autonomen Browsen schlägt es Opus 4.7
00:04:28und sein Million-Token-Kontext hielt jede Seite plus die gesamte Codebasis in einem Fenster. Aber Agenten-Läufe
00:04:34wie dieser verbrauchen viele Tokens und da kommt der Minimax-Token-Plan ins Spiel. Wähle einen Token-Plan für feste
00:04:40Kosten oder Pay-as-you-go für Flexibilität. Text, Bild, Sprache und Musik teilen sich denselben Token-Pool mit den
00:04:46höchsten Kontingenten. Pläne beginnen bei nur 20 Dollar pro Monat, also klicke auf den ersten Link in der Beschreibung
00:04:51und erhalte exklusive 12 % Rabatt. Der zustandslose Loop, den wir gerade durchlaufen haben, hält keinen Zustand. Er erledigt alles
00:04:58selbstständig aus den Anweisungen ohne Selbstverbesserung während des Prozesses. Der nächste Typ funktioniert genau anders
00:05:03herum, und wir nennen ihn den Lern-Loop. Ein Lern-Loop funktioniert anders. Anstatt nur eine
00:05:08Aufgabe zu erledigen und zu stoppen, wie ein zustandsloser Loop oder der Zielbefehl, konzentriert er sich darauf, etwas zu verbessern,
00:05:13das du wiederholt verwendest, sei es eine Fähigkeit oder ein Workflow. Die Art, wie er das tut, ist einfach. Er führt die Fähigkeit aus,
00:05:18beobachtet, wie er abgeschnitten hat, und verbessert sie dann basierend auf dem, was er gelernt hat, wobei er eine vollständige Aufzeichnung
00:05:23jeder Lektion auf dem Weg behält. Sodass, wenn du die Fähigkeit ausführst, wenn du sie tatsächlich benutzt, der Agent
00:05:28weiß, was in der Vergangenheit Probleme verursacht hat, damit er nicht dazu neigt. Du kannst diese Art von Loop für eine Menge Dinge
00:05:33einsetzen. Zum Beispiel haben wir auf unserer Community-Website mehrere Fähigkeiten gebaut, um
00:05:38verschiedene wiederholte Workflows beim Zusammenstellen der Seite zu handhaben. Aber das Bauen einer Fähigkeit wirft eine offensichtliche
00:05:43Frage auf, nämlich wie du überhaupt wissen würdest, ob sie so funktioniert, wie sie sollte. Also, um das zu beantworten, haben wir
00:05:48einen vollständigen Lern-Loop eingerichtet. Wir haben dies getan, indem wir einen Skill-Loop-Befehl erstellt haben, der den Loop auslöst. Dieser Befehl
00:05:53enthält Anweisungen, einen Skill-Verbesserungs-Agenten aufzurufen und ihn so lange aufzurufen, bis keine
00:05:58Verbesserungen mehr übrig sind. Dieser Skill-Verbesserer ist tatsächlich ein Agent, den wir erstellt haben, der die Fähigkeit durch
00:06:03Beurteilung ihrer Qualität, Testen in mehreren Bereichen und Beobachten der auftretenden Probleme verbessert. Um ihn zu verwenden,
00:06:08führst du einfach den Befehl aus und übergibst die Fähigkeit, die du verbessern möchtest, und er macht sich an die Arbeit. Dieser Loop
00:06:14läuft in mehreren Runden. In jeder Runde führt er eine Reihe von Tests durch und überprüft nach dem Vornehmen seiner Änderungen.
00:06:19Dann startet er eine separate Claude-Sitzung, die nur an dem Prompt arbeitet, den du übergibst, und im
00:06:24Hintergrund läuft, ohne anzuhalten, um für irgendetwas um Erlaubnis zu bitten, und die Ausgabe zurückmeldet. Innerhalb dieser
00:06:29Sitzungen führt er die Implementierung auf zwei Arten aus, eine mit der Fähigkeit und eine ohne, damit er messen kann, welche
00:06:34tatsächliche Auswirkung die Fähigkeit hat. Dieser Vergleich lässt ihn genau bestimmen, was verbessert werden muss, und er nimmt
00:06:40diese Änderungen direkt vor. Aber der wichtigste Teil ist die Learning.md-Datei, die er erstellt. Diese Datei
00:06:46gibt dem Agenten eine Möglichkeit zu wissen, was funktioniert und was nicht, und sie lebt innerhalb der Fähigkeit selbst. Es ist
00:06:51im Grunde ein Verbesserungs-Tagebuch, das alles dokumentiert, was der Agent in einem strukturierten Format lernt.
00:06:56Es zeichnet auf, was er versucht hat und was das Ergebnis war, sowohl mit der Fähigkeit als auch ohne, dann listet es die
00:07:00Lektionen auf, die er über alle Runden, die er durchlaufen hat, aufgegriffen hat, und so macht er immer weiter Runde um
00:07:05Runde, bis die Fähigkeit in die bestmögliche Version ihrer selbst verfeinert ist. Du kannst dasselbe
00:07:09Setup verwenden, um jeden Workflow zu verbessern, den du hast. In unserem letzten Video haben wir gezeigt, wie man einen Loop mit
00:07:14zwei Agenten baut, einen, der die Implementierung handhabt, und einen anderen, der die Arbeit überprüft und Rückkorrekturen für
00:07:20den Implementierungs-Agenten meldet. Es gibt ein Problem mit diesem Setup, nämlich dass ein einziger Überprüfungs-Agent
00:07:25jeden Aspekt der Überprüfung alleine handhabt. Aber eine Überprüfung geht nie nur um einen Aspekt. Sie kommt immer
00:07:30aus verschiedenen Perspektiven und das ist zu viel Boden für einen einzelnen Agenten, um ihn alleine abzudecken. Es ist
00:07:35besser, das auf verschiedene Agenten aufzuteilen, denn wenn mehrere Agenten über mehrere
00:07:40Dimensionen hinweg überprüfen, decken sie die blinden Flecken ab, die jeder einzelne Agent übersehen würde, und das macht die Überprüfung viel
00:07:46vollständiger. Die Idee ist nah an dem LLM-Rat (Council), den Andrej Karpathy veröffentlicht hat, was ein Rat von
00:07:51mehreren Agenten ist, die miteinander reden und sich über ein Thema streiten, das du ihnen übergibst, wobei sie die Argumentation von
00:07:56mehreren Modellen nutzen, um zur richtigen Antwort zu gelangen. Für das Erstellen eines Multi-Agenten-Loops musst du
00:08:00mehrere Agenten erstellen. Also zum Beispiel haben wir vier Agenten in dem Loop erstellt, den wir eingerichtet haben. Der erste prüft auf
00:08:05faktische Korrektheit und er kommt mit Tools wie Websuche, damit er sich auf echten Quellen stützen kann.
00:08:10Der zweite ist ein Domain-Prüfungs-Agent, der prüft, ob das, was überprüft wird, tatsächlich
00:08:15relevant für das ist, was wir versuchen zu tun. Der dritte ist ein Sicherheits-Kritiker-Agent, der sich die Sicherheitsfragen ansieht,
00:08:20wie sensible Inhalte, zusammen mit Sicherheitsrisiken und Richtlinienverletzungen, die Probleme verursachen könnten
00:08:25im weiteren Verlauf. Und der letzte ist der Stil-Kritiker, der sicherstellt, dass der Inhalt klar und gut geschrieben
00:08:30und auf den Stil zugeschnitten ist, den wir anstreben. Du kannst diese Agenten für jede Aufgabe verwenden, egal ob es Coding ist oder nicht.
00:08:35Was diese vier verbindet, ist ein Orchestrierungs-Befehl (Orchestrate Command), den wir erstellt haben. Dieser Befehl enthält die
00:08:40detaillierten Anweisungen, wie er alle vier Agenten verwalten und koordinieren und das Feedback handhaben sollte,
00:08:46das jeder zurückmeldet. Um den Loop zu starten, führst du den Orchestrierungs-Befehl aus und bittest ihn, das zu überprüfen,
00:08:51was du willst, und er startet alle Agenten für den Prozess. Der Orchestrierungs-Befehl läuft ebenfalls in mehreren
00:08:56Runden, wobei er jeden Agenten in jeder Runde startet. Der Hauptagent wendet alle Korrekturen an, die in Runde
00:09:01eins gemeldet wurden, dann startet er sie alle wieder für die nächste Runde. Am Ende des letzten Durchgangs hast du
00:09:06die App in viel besserem Zustand. Wenn du lieber möchtest, dass die Agenten direkt kommunizieren, kannst du den Agenten-Team-
00:09:12Workflow verwenden, den wir in einem früheren Video behandelt haben, was dir mehr die Erfahrung des LLM-Rats bietet, ohne dass ein
00:09:17Agent die gesamte Kommunikation handhabt. Aber wir haben uns für den Orchestrator entschieden, weil ein Agent den
00:09:22Kontext der vorherigen Runden halten muss, um den Workflow ordnungsgemäß zu koordinieren. Eine weitere Art, zu der wir oft greifen,
00:09:27ist der Überprüfungs-Loop (Verification Loop). Er verwendet ebenfalls mehrere Agenten, bei denen einer die Implementierung durchführt und der andere
00:09:33diese Implementierung bewertet, und die einzige Aufgabe des Implementierers ist es, diese Bewertung so hoch wie möglich
00:09:38gegenüber einem festgelegten Metrik-Satz zu bekommen. Um das einzurichten, haben wir einen Befehl erstellt, der den gesamten Loop koordiniert, der den
00:09:43ganzen Überprüfungs-Workflow eigenständig ausführt. Wie du bereits weißt, hat Cursor die “thermonukleare Überprüfung”. Es ist tatsächlich
00:09:48eine wirklich leistungsstarke Überprüfungs-Fähigkeit, die prüft, wie sauber und gesund der Code ist, damit er einfach weiter auszubauen ist
00:09:54später. Sie auditiert den gesamten Code und gibt eine tiefgehende Überprüfung mit unverhandelbaren Standards zurück, sodass
00:09:59du die höchste Qualität der Überprüfung garantiert bekommst, die sie produzieren kann. Um das zu tun, führt sie einen dynamischen Workflow aus.
00:10:04Die Überprüfung muss sich über viele Kategorien erstrecken, und ein dynamischer Workflow ist der beste Weg, das zu handhaben,
00:10:09da er die Arbeit über mehrere Unter-Agenten verteilt, die jeweils einen anderen Aspekt gleichzeitig übernehmen.
00:10:15Wie wir vorhin erwähnt haben, haben wir zwei Agenten erstellt, die als Spieler in diesem Loop agieren. Der erste ist
00:10:20der Implementierer, dessen Aufgabe es ist, den PRD zu lesen und dann die erforderliche Funktionalität zu bauen. Der zweite
00:10:25ist der “thermonukleare Code-Überprüfer”, und seine einzige Aufgabe ist es, eine Bewertungsnote zurückzugeben. Da alles, was er tut,
00:10:30ist überprüfen und bewerten, hat er keine Tools für Änderungen. Um ihn auszulösen, führst du den Überprüfungs-Loop-Befehl aus.
00:10:35Er beginnt damit, zu verstehen, was die App bauen soll, dann startet er eine thermonukleare Überprüfung für
00:10:40Runde eins. Diese erste Überprüfung markiert die Probleme, die sie findet, einschließlich eines kritischen, das die
00:10:45App daran hindert, überhaupt zu starten. Sie zeichnet die Ergebnisse in einer JSON-Datei auf und startet den Implementierungs-Agenten,
00:10:51um sie zu beheben. Der Loop geht von dort aus weiter, aber behalte eines im Kopf. Da er über so
00:10:56viele Dimensionen hinweg überprüft, dauert es sehr lange und verbraucht viele Tokens, da der dynamische Workflow,
00:11:01der ihn antreibt, die Arbeit über eine ganze Reihe von Unter-Agenten gleichzeitig verteilt. Also würden wir ihn nicht empfehlen, es sei denn,
00:11:06du hast bereits die ganze App in einem größeren Maßstab gebaut und willst sie gründlich überprüft haben. Du kannst auch
00:11:12diesen selben Loop ohne den dynamischen Workflow bauen, indem du einen normalen Überprüfungs-Agenten verwendest, der weniger Zeit braucht und
00:11:17viel weniger Tokens verbraucht. Und wenn dir das Video bisher gefällt, abonniere den Kanal und drücke auf
00:11:22den Hype-Button. Diese kleine Geste der Unterstützung geht für uns einen langen Weg. Von jedem Loop, den wir dir gezeigt haben,
00:11:28hatte bisher keiner einen separaten Schritt für die Verbesserung des Loops selbst, aber das ist wirklich der Kern dessen, was ein
00:11:33Loop tun soll. Hier kommt der Workflow-Verbesserungs-Loop ins Spiel. Was dieser Loop tut, ist einen
00:11:38Schritt über das bloße Wiederholen der Aufgabe hinauszugehen. Anstatt sie nur immer wieder auszuführen, schaut er sich den Prozess
00:11:43selbst an und schlägt Verbesserungen am Workflow vor. Nun könntest du denken, der Lern-Loop von vorhin
00:11:48tut das bereits, aber da gibt es einen echten Unterschied. Der Lern-Loop verbessert eine Fähigkeit, ein Stück innerhalb
00:11:53des Prozesses. Dieser hier verbessert den Loop selbst, den ganzen Prozess, den du eingerichtet hast. Der Einstiegspunkt ist ein
00:11:58Iterier-Befehl (Iterate Command), der als Orchestrator für alles fungiert, was während jedes Laufs passiert. Es gibt
00:12:03dieses Mal drei Agenten. Der erste ist ein Ersteller-Agent (Builder Agent), der die Implementierung handhabt und eine
00:12:08der Anforderungen der App bei jedem Lauf liefert. Der zweite ist ein Bewerter (Scorer), der diese Implementierung gegen eine
00:12:13Rubrik prüft, die wir definiert haben, um als Qualitäts-Leitplanke der App zu dienen, und die Arbeit aus 100 bewertet. Und der
00:12:19dritte ist der Prozessoptimierungs-Agent, derjenige, der tatsächlich die Selbstverbesserung handhabt.
00:12:24Normalerweise durchläuft ein Loop denselben Zyklus, in dem er plant, implementiert, überprüft und wiederholt, aber dieser
00:12:29Agent fügt einen zusätzlichen Schritt hinzu, die Loop-Iteration noch einmal durchzugehen und Möglichkeiten vorzuschlagen, sie besser zu machen.
00:12:35Um ihn zu verwenden, führst du einfach den Befehl “iterate all” aus. Mit “all” meinen wir, dass wir die gesamte App implementieren,
00:12:40unterteilt in Teile innerhalb eines einzigen Workflows. Der Loop beginnt damit, den Ersteller-Agenten zu starten,
00:12:44dann bewertet der Bewerter, was er gegen die Rubrik gebaut hat, und zeichnet die Bewertung in einer JSON-Datei auf, die
00:12:49jede Runde verfolgt. Dann tritt der Prozessoptimierungs-Agent in Aktion und geht die Konversation durch, um
00:12:55alles zu finden, was den Workflow verbessern könnte, und stellt sicher, dass die App in hoher Qualität gebaut wird und die
00:13:00richtigen Schritte befolgt werden. Also am Ende dieses Workflows gehst du nicht nur mit einer
00:13:04gebauten App weg, du gehst mit einem Workflow weg, der getestet und verfeinert wurde, bei dem jeder Schritt als
00:13:10einer validiert wurde, der tatsächlich da sein muss. Das bringt uns an das Ende dieses Videos. Wenn du den Kanal unterstützen
00:13:15und uns helfen möchtest, weiterhin Videos wie dieses zu machen, kannst du das tun, indem du den “Super Thanks”-Button unten verwendest.
00:13:20Wie immer danke fürs Zuschauen und ich sehe dich im nächsten Video.