So solltest du Claude Loops wirklich nutzen

AAI LABS
Computing/SoftwareInternet Technology

Transcript

00:00:00Du hast wahrscheinlich schon von Agenten-Loops gehört, da sie gerade überall gehypt werden.
00:00:05Vielleicht denkst du, das sei nur eine Methode der KI-Unternehmen, damit du mehr für deren
00:00:09Produkte ausgibst, weil diese Loops viele Tokens verbrauchen. Aber das passiert nur, wenn man
00:00:13den falschen Loop-Typ für die Aufgabe wählt. Wie du weißt, sind wir ein Softwareunternehmen und wir haben
00:00:18mit diesen Loops bei unseren KI-Coding-Aufgaben experimentiert. Dabei haben wir die verschiedenen
00:00:23Arten von Loops und ihre jeweiligen Anwendungsgebiete kartiert. Von all den Loops, die wir
00:00:28aufgesetzt haben, zeigen wir dir hier die, die wir als wirklich nützlich empfunden haben. Wir zeigen dir auch,
00:00:33wie man jeden einzelnen einrichtet und wie sie deinen Workflow beeinflussen. Bevor wir zu den verschiedenen
00:00:38Loop-Arten kommen, lass uns kurz rekapitulieren, was Loop-Engineering eigentlich ist, für alle, die
00:00:43neu hier sind. Wir gehen nicht tief ins Detail, aber für die volle Analyse schau in unser vorheriges Video
00:00:48auf dem Kanal. Der Kern von Loop-Engineering ist, dass du aufhörst, die Prompts zu schreiben,
00:00:53die den Agenten steuern, und das Ganze in ein System verwandelst, das den Loop selbst schreibt. Anstatt deine
00:00:58Zeit mit dem Einrichten und dem Schreiben langer, sorgfältig strukturierter Prompts zu verbringen, nur damit es baut,
00:01:02lässt du den Agenten alles eigenständig erledigen. Er lernt dazu, wächst an den Problemen, auf die er
00:01:07stößt, und findet heraus, was als Nächstes zu tun ist. Das ist ein echter Agenten-Loop. Im
00:01:12letzten Video haben wir Loops basierend auf dem Ergebnis in zwei Typen unterteilt: den deterministischen Loop und
00:01:18den nicht-deterministischen Loop. Ein deterministischer Loop ist einer, bei dem du das Ergebnis bereits kennst,
00:01:22sodass der Agent eine klare Methode hat, seine Arbeit selbst zu überprüfen, und er arbeitet weiter, bis
00:01:27er es erreicht hat. Ein nicht-deterministischer Loop ist einer, bei dem du das nicht weißt, also gibt es keine solide Möglichkeit
00:01:32für den Agenten, seine Arbeit zu überprüfen, was bedeutet, dass du andere Wege brauchst, damit umzugehen. Aber das war eine grobe Einteilung,
00:01:36und wir haben nur eine Art gezeigt, sie einzurichten. Sie können auf viele verschiedene Arten gebaut werden,
00:01:41und jedes Setup ändert, was du tun kannst. Der erste Typ ist einer, den die meisten von euch wahrscheinlich schon benutzt haben.
00:01:46Er ist im Grunde der Baustein für jeden anderen Loop, und das klarste Beispiel ist der Zielbefehl (Goal Command).
00:01:51Wir nennen ihn den zustandslosen Loop, und er bedeutet im Grunde, dass der Loop nichts behält oder sich
00:01:56verbessert, während er arbeitet. Es gibt keinen Teil, in dem er aus dem Geschehen lernt und besser wird. Genau das
00:02:01macht diese Loops zu den einfachsten, die es gibt. Der eine, den du von dieser Art wahrscheinlich schon
00:02:05gesehen hast, ist der “Ralph-Loop”, und er ist zustandslos, weil er niemals ein Gedächtnis behielt. Er führte nur dieselbe Aufgabe
00:02:10immer wieder aus, und in dem Moment, als er sah, dass die Aufgabe beendet war, stoppte er. Wie du vielleicht schon
00:02:15über den Zielbefehl weißt, ist er das beste Beispiel für den zustandslosen Loop. Um ihn zu verwenden, sagst du ihm, was
00:02:19du bauen willst, direkt nach dem Zielbefehl. Von da an setzt Claude das als Ziel und beginnt
00:02:25daran zu arbeiten. Dann verwendet der Hauptagent jedes Mal, wenn er entscheidet, dass eine Aufgabe erledigt ist, ein kleineres Modell,
00:02:30um die Arbeit doppelt zu überprüfen. In Claude Code ist dieses kleinere Modell Haiku. Es überprüft alles, was der Agent
00:02:35gemacht hat, anhand der Anforderungen, die du im Prompt gegeben hast, und wenn die Aufgabe nicht vollständig erledigt ist,
00:02:38fordert es den Agenten erneut auf, das zu beenden, was er verpasst hat. Aber es gibt ein Problem mit diesem Loop. Er verlässt sich
00:02:43vollständig auf das Modell, um zu entscheiden, ob eine Aufgabe erledigt ist, ohne einen Maßstab, an dem man die Arbeit messen könnte.
00:02:48Deshalb funktioniert er am besten bei Funktionen, deren Anforderungen man auf eine harte, konkrete
00:02:53Weise überprüfen kann. Eine Möglichkeit, das zu tun, sind Tests. Wie wir in unserem letzten Video besprochen haben, schreiben wir die Tests,
00:02:58bevor wir Claude bitten, irgendeine Funktion zu bauen. Auf diese Weise, wenn Claude diese Funktion auf eine Weise ändert, die sie nicht sollte,
00:03:03werfen die Tests einen Fehler und sagen Claude, dass seine Implementierung nicht stimmt. Und sobald wir Tests
00:03:08für jede Funktion haben, können wir dem Agenten echte Autonomie geben und ihn arbeiten lassen, ohne uns Sorgen zu machen, dass er
00:03:12andere Funktionen kaputt macht oder die, die wir wollen, falsch baut. Sobald du die Tests geschrieben hast,
00:03:17kannst du Claude Code bitten, das Ziel so zu setzen, dass diese Funktion alle Tests besteht. Und er schreibt weiter
00:03:22Code, führt die Tests aus, um sich selbst zu überprüfen, und macht weiter, bis jeder Test besteht. Sobald sie alle
00:03:27bestehen, bedeutet das, die Funktion ist korrekt gebaut und Claude wird das Ziel als abgeschlossen markieren. Da der Agent
00:03:33alleine arbeitet, wirst du eine Zeile zu deiner Claude.md-Datei hinzufügen wollen. Diese Zeile weist den Agenten an,
00:03:38jede funktionierende Version der App zu speichern. Auf diese Weise, wenn er die App irgendwann später kaputt macht,
00:03:43kann er einfach auf die letzte funktionierende Version zurücksetzen und von dort aus weitermachen, anstatt zu versuchen,
00:03:47Änderungen aus dem Gedächtnis rückgängig zu machen. Aber bevor wir zu weiteren Typen übergehen, lassen wir ein Wort von unserem Sponsor.
00:03:53Minimax. Minimax hat gerade M3 veröffentlicht und es ist das erste Open-Weight-Modell, das bei drei Dingen gleichzeitig
00:03:59an der Spitze steht: Coding, eine Million-Token-Kontext und native Multimodalität. Also haben wir die M3-API
00:04:06direkt in Claude Code integriert und ihr eine echte Aufgabe gegeben: Recherche zu den Top-Elektroautos, die jetzt erhältlich sind,
00:04:11und ein Live-Vergleichs-Dashboard bauen. M3 hat es von dort an alleine übernommen. Es hat das Web durchsucht, echte
00:04:17Spezifikationen und Preise abgerufen und dann ein funktionierendes Dashboard von Grund auf geliefert. Du kannst verschiedene EV-Marken suchen,
00:04:22ihre neuesten Modelle durchsuchen und alles aktualisiert sich in Echtzeit. Beim autonomen Browsen schlägt es Opus 4.7
00:04:28und sein Million-Token-Kontext hielt jede Seite plus die gesamte Codebasis in einem Fenster. Aber Agenten-Läufe
00:04:34wie dieser verbrauchen viele Tokens und da kommt der Minimax-Token-Plan ins Spiel. Wähle einen Token-Plan für feste
00:04:40Kosten oder Pay-as-you-go für Flexibilität. Text, Bild, Sprache und Musik teilen sich denselben Token-Pool mit den
00:04:46höchsten Kontingenten. Pläne beginnen bei nur 20 Dollar pro Monat, also klicke auf den ersten Link in der Beschreibung
00:04:51und erhalte exklusive 12 % Rabatt. Der zustandslose Loop, den wir gerade durchlaufen haben, hält keinen Zustand. Er erledigt alles
00:04:58selbstständig aus den Anweisungen ohne Selbstverbesserung während des Prozesses. Der nächste Typ funktioniert genau anders
00:05:03herum, und wir nennen ihn den Lern-Loop. Ein Lern-Loop funktioniert anders. Anstatt nur eine
00:05:08Aufgabe zu erledigen und zu stoppen, wie ein zustandsloser Loop oder der Zielbefehl, konzentriert er sich darauf, etwas zu verbessern,
00:05:13das du wiederholt verwendest, sei es eine Fähigkeit oder ein Workflow. Die Art, wie er das tut, ist einfach. Er führt die Fähigkeit aus,
00:05:18beobachtet, wie er abgeschnitten hat, und verbessert sie dann basierend auf dem, was er gelernt hat, wobei er eine vollständige Aufzeichnung
00:05:23jeder Lektion auf dem Weg behält. Sodass, wenn du die Fähigkeit ausführst, wenn du sie tatsächlich benutzt, der Agent
00:05:28weiß, was in der Vergangenheit Probleme verursacht hat, damit er nicht dazu neigt. Du kannst diese Art von Loop für eine Menge Dinge
00:05:33einsetzen. Zum Beispiel haben wir auf unserer Community-Website mehrere Fähigkeiten gebaut, um
00:05:38verschiedene wiederholte Workflows beim Zusammenstellen der Seite zu handhaben. Aber das Bauen einer Fähigkeit wirft eine offensichtliche
00:05:43Frage auf, nämlich wie du überhaupt wissen würdest, ob sie so funktioniert, wie sie sollte. Also, um das zu beantworten, haben wir
00:05:48einen vollständigen Lern-Loop eingerichtet. Wir haben dies getan, indem wir einen Skill-Loop-Befehl erstellt haben, der den Loop auslöst. Dieser Befehl
00:05:53enthält Anweisungen, einen Skill-Verbesserungs-Agenten aufzurufen und ihn so lange aufzurufen, bis keine
00:05:58Verbesserungen mehr übrig sind. Dieser Skill-Verbesserer ist tatsächlich ein Agent, den wir erstellt haben, der die Fähigkeit durch
00:06:03Beurteilung ihrer Qualität, Testen in mehreren Bereichen und Beobachten der auftretenden Probleme verbessert. Um ihn zu verwenden,
00:06:08führst du einfach den Befehl aus und übergibst die Fähigkeit, die du verbessern möchtest, und er macht sich an die Arbeit. Dieser Loop
00:06:14läuft in mehreren Runden. In jeder Runde führt er eine Reihe von Tests durch und überprüft nach dem Vornehmen seiner Änderungen.
00:06:19Dann startet er eine separate Claude-Sitzung, die nur an dem Prompt arbeitet, den du übergibst, und im
00:06:24Hintergrund läuft, ohne anzuhalten, um für irgendetwas um Erlaubnis zu bitten, und die Ausgabe zurückmeldet. Innerhalb dieser
00:06:29Sitzungen führt er die Implementierung auf zwei Arten aus, eine mit der Fähigkeit und eine ohne, damit er messen kann, welche
00:06:34tatsächliche Auswirkung die Fähigkeit hat. Dieser Vergleich lässt ihn genau bestimmen, was verbessert werden muss, und er nimmt
00:06:40diese Änderungen direkt vor. Aber der wichtigste Teil ist die Learning.md-Datei, die er erstellt. Diese Datei
00:06:46gibt dem Agenten eine Möglichkeit zu wissen, was funktioniert und was nicht, und sie lebt innerhalb der Fähigkeit selbst. Es ist
00:06:51im Grunde ein Verbesserungs-Tagebuch, das alles dokumentiert, was der Agent in einem strukturierten Format lernt.
00:06:56Es zeichnet auf, was er versucht hat und was das Ergebnis war, sowohl mit der Fähigkeit als auch ohne, dann listet es die
00:07:00Lektionen auf, die er über alle Runden, die er durchlaufen hat, aufgegriffen hat, und so macht er immer weiter Runde um
00:07:05Runde, bis die Fähigkeit in die bestmögliche Version ihrer selbst verfeinert ist. Du kannst dasselbe
00:07:09Setup verwenden, um jeden Workflow zu verbessern, den du hast. In unserem letzten Video haben wir gezeigt, wie man einen Loop mit
00:07:14zwei Agenten baut, einen, der die Implementierung handhabt, und einen anderen, der die Arbeit überprüft und Rückkorrekturen für
00:07:20den Implementierungs-Agenten meldet. Es gibt ein Problem mit diesem Setup, nämlich dass ein einziger Überprüfungs-Agent
00:07:25jeden Aspekt der Überprüfung alleine handhabt. Aber eine Überprüfung geht nie nur um einen Aspekt. Sie kommt immer
00:07:30aus verschiedenen Perspektiven und das ist zu viel Boden für einen einzelnen Agenten, um ihn alleine abzudecken. Es ist
00:07:35besser, das auf verschiedene Agenten aufzuteilen, denn wenn mehrere Agenten über mehrere
00:07:40Dimensionen hinweg überprüfen, decken sie die blinden Flecken ab, die jeder einzelne Agent übersehen würde, und das macht die Überprüfung viel
00:07:46vollständiger. Die Idee ist nah an dem LLM-Rat (Council), den Andrej Karpathy veröffentlicht hat, was ein Rat von
00:07:51mehreren Agenten ist, die miteinander reden und sich über ein Thema streiten, das du ihnen übergibst, wobei sie die Argumentation von
00:07:56mehreren Modellen nutzen, um zur richtigen Antwort zu gelangen. Für das Erstellen eines Multi-Agenten-Loops musst du
00:08:00mehrere Agenten erstellen. Also zum Beispiel haben wir vier Agenten in dem Loop erstellt, den wir eingerichtet haben. Der erste prüft auf
00:08:05faktische Korrektheit und er kommt mit Tools wie Websuche, damit er sich auf echten Quellen stützen kann.
00:08:10Der zweite ist ein Domain-Prüfungs-Agent, der prüft, ob das, was überprüft wird, tatsächlich
00:08:15relevant für das ist, was wir versuchen zu tun. Der dritte ist ein Sicherheits-Kritiker-Agent, der sich die Sicherheitsfragen ansieht,
00:08:20wie sensible Inhalte, zusammen mit Sicherheitsrisiken und Richtlinienverletzungen, die Probleme verursachen könnten
00:08:25im weiteren Verlauf. Und der letzte ist der Stil-Kritiker, der sicherstellt, dass der Inhalt klar und gut geschrieben
00:08:30und auf den Stil zugeschnitten ist, den wir anstreben. Du kannst diese Agenten für jede Aufgabe verwenden, egal ob es Coding ist oder nicht.
00:08:35Was diese vier verbindet, ist ein Orchestrierungs-Befehl (Orchestrate Command), den wir erstellt haben. Dieser Befehl enthält die
00:08:40detaillierten Anweisungen, wie er alle vier Agenten verwalten und koordinieren und das Feedback handhaben sollte,
00:08:46das jeder zurückmeldet. Um den Loop zu starten, führst du den Orchestrierungs-Befehl aus und bittest ihn, das zu überprüfen,
00:08:51was du willst, und er startet alle Agenten für den Prozess. Der Orchestrierungs-Befehl läuft ebenfalls in mehreren
00:08:56Runden, wobei er jeden Agenten in jeder Runde startet. Der Hauptagent wendet alle Korrekturen an, die in Runde
00:09:01eins gemeldet wurden, dann startet er sie alle wieder für die nächste Runde. Am Ende des letzten Durchgangs hast du
00:09:06die App in viel besserem Zustand. Wenn du lieber möchtest, dass die Agenten direkt kommunizieren, kannst du den Agenten-Team-
00:09:12Workflow verwenden, den wir in einem früheren Video behandelt haben, was dir mehr die Erfahrung des LLM-Rats bietet, ohne dass ein
00:09:17Agent die gesamte Kommunikation handhabt. Aber wir haben uns für den Orchestrator entschieden, weil ein Agent den
00:09:22Kontext der vorherigen Runden halten muss, um den Workflow ordnungsgemäß zu koordinieren. Eine weitere Art, zu der wir oft greifen,
00:09:27ist der Überprüfungs-Loop (Verification Loop). Er verwendet ebenfalls mehrere Agenten, bei denen einer die Implementierung durchführt und der andere
00:09:33diese Implementierung bewertet, und die einzige Aufgabe des Implementierers ist es, diese Bewertung so hoch wie möglich
00:09:38gegenüber einem festgelegten Metrik-Satz zu bekommen. Um das einzurichten, haben wir einen Befehl erstellt, der den gesamten Loop koordiniert, der den
00:09:43ganzen Überprüfungs-Workflow eigenständig ausführt. Wie du bereits weißt, hat Cursor die “thermonukleare Überprüfung”. Es ist tatsächlich
00:09:48eine wirklich leistungsstarke Überprüfungs-Fähigkeit, die prüft, wie sauber und gesund der Code ist, damit er einfach weiter auszubauen ist
00:09:54später. Sie auditiert den gesamten Code und gibt eine tiefgehende Überprüfung mit unverhandelbaren Standards zurück, sodass
00:09:59du die höchste Qualität der Überprüfung garantiert bekommst, die sie produzieren kann. Um das zu tun, führt sie einen dynamischen Workflow aus.
00:10:04Die Überprüfung muss sich über viele Kategorien erstrecken, und ein dynamischer Workflow ist der beste Weg, das zu handhaben,
00:10:09da er die Arbeit über mehrere Unter-Agenten verteilt, die jeweils einen anderen Aspekt gleichzeitig übernehmen.
00:10:15Wie wir vorhin erwähnt haben, haben wir zwei Agenten erstellt, die als Spieler in diesem Loop agieren. Der erste ist
00:10:20der Implementierer, dessen Aufgabe es ist, den PRD zu lesen und dann die erforderliche Funktionalität zu bauen. Der zweite
00:10:25ist der “thermonukleare Code-Überprüfer”, und seine einzige Aufgabe ist es, eine Bewertungsnote zurückzugeben. Da alles, was er tut,
00:10:30ist überprüfen und bewerten, hat er keine Tools für Änderungen. Um ihn auszulösen, führst du den Überprüfungs-Loop-Befehl aus.
00:10:35Er beginnt damit, zu verstehen, was die App bauen soll, dann startet er eine thermonukleare Überprüfung für
00:10:40Runde eins. Diese erste Überprüfung markiert die Probleme, die sie findet, einschließlich eines kritischen, das die
00:10:45App daran hindert, überhaupt zu starten. Sie zeichnet die Ergebnisse in einer JSON-Datei auf und startet den Implementierungs-Agenten,
00:10:51um sie zu beheben. Der Loop geht von dort aus weiter, aber behalte eines im Kopf. Da er über so
00:10:56viele Dimensionen hinweg überprüft, dauert es sehr lange und verbraucht viele Tokens, da der dynamische Workflow,
00:11:01der ihn antreibt, die Arbeit über eine ganze Reihe von Unter-Agenten gleichzeitig verteilt. Also würden wir ihn nicht empfehlen, es sei denn,
00:11:06du hast bereits die ganze App in einem größeren Maßstab gebaut und willst sie gründlich überprüft haben. Du kannst auch
00:11:12diesen selben Loop ohne den dynamischen Workflow bauen, indem du einen normalen Überprüfungs-Agenten verwendest, der weniger Zeit braucht und
00:11:17viel weniger Tokens verbraucht. Und wenn dir das Video bisher gefällt, abonniere den Kanal und drücke auf
00:11:22den Hype-Button. Diese kleine Geste der Unterstützung geht für uns einen langen Weg. Von jedem Loop, den wir dir gezeigt haben,
00:11:28hatte bisher keiner einen separaten Schritt für die Verbesserung des Loops selbst, aber das ist wirklich der Kern dessen, was ein
00:11:33Loop tun soll. Hier kommt der Workflow-Verbesserungs-Loop ins Spiel. Was dieser Loop tut, ist einen
00:11:38Schritt über das bloße Wiederholen der Aufgabe hinauszugehen. Anstatt sie nur immer wieder auszuführen, schaut er sich den Prozess
00:11:43selbst an und schlägt Verbesserungen am Workflow vor. Nun könntest du denken, der Lern-Loop von vorhin
00:11:48tut das bereits, aber da gibt es einen echten Unterschied. Der Lern-Loop verbessert eine Fähigkeit, ein Stück innerhalb
00:11:53des Prozesses. Dieser hier verbessert den Loop selbst, den ganzen Prozess, den du eingerichtet hast. Der Einstiegspunkt ist ein
00:11:58Iterier-Befehl (Iterate Command), der als Orchestrator für alles fungiert, was während jedes Laufs passiert. Es gibt
00:12:03dieses Mal drei Agenten. Der erste ist ein Ersteller-Agent (Builder Agent), der die Implementierung handhabt und eine
00:12:08der Anforderungen der App bei jedem Lauf liefert. Der zweite ist ein Bewerter (Scorer), der diese Implementierung gegen eine
00:12:13Rubrik prüft, die wir definiert haben, um als Qualitäts-Leitplanke der App zu dienen, und die Arbeit aus 100 bewertet. Und der
00:12:19dritte ist der Prozessoptimierungs-Agent, derjenige, der tatsächlich die Selbstverbesserung handhabt.
00:12:24Normalerweise durchläuft ein Loop denselben Zyklus, in dem er plant, implementiert, überprüft und wiederholt, aber dieser
00:12:29Agent fügt einen zusätzlichen Schritt hinzu, die Loop-Iteration noch einmal durchzugehen und Möglichkeiten vorzuschlagen, sie besser zu machen.
00:12:35Um ihn zu verwenden, führst du einfach den Befehl “iterate all” aus. Mit “all” meinen wir, dass wir die gesamte App implementieren,
00:12:40unterteilt in Teile innerhalb eines einzigen Workflows. Der Loop beginnt damit, den Ersteller-Agenten zu starten,
00:12:44dann bewertet der Bewerter, was er gegen die Rubrik gebaut hat, und zeichnet die Bewertung in einer JSON-Datei auf, die
00:12:49jede Runde verfolgt. Dann tritt der Prozessoptimierungs-Agent in Aktion und geht die Konversation durch, um
00:12:55alles zu finden, was den Workflow verbessern könnte, und stellt sicher, dass die App in hoher Qualität gebaut wird und die
00:13:00richtigen Schritte befolgt werden. Also am Ende dieses Workflows gehst du nicht nur mit einer
00:13:04gebauten App weg, du gehst mit einem Workflow weg, der getestet und verfeinert wurde, bei dem jeder Schritt als
00:13:10einer validiert wurde, der tatsächlich da sein muss. Das bringt uns an das Ende dieses Videos. Wenn du den Kanal unterstützen
00:13:15und uns helfen möchtest, weiterhin Videos wie dieses zu machen, kannst du das tun, indem du den “Super Thanks”-Button unten verwendest.
00:13:20Wie immer danke fürs Zuschauen und ich sehe dich im nächsten Video.

Key Takeaway

Die Wahl des richtigen Loop-Typs, vom einfachen zustandslosen Zielbefehl bis hin zum komplexen Workflow-Verbesserungs-Loop, bestimmt maßgeblich die Effizienz und Qualität bei der autonomen KI-Code-Entwicklung.

Highlights

  • Agenten-Loops steuern KI-Prozesse eigenständig, indem sie an Problemen lernen und den nächsten Arbeitsschritt autonom bestimmen.

  • Der zustandslose Loop benötigt keine eigene Speicherkapazität und erzielt bei deterministischen Aufgaben, wie dem Bestehen vordefinierter Tests, die besten Ergebnisse.

  • Ein Lern-Loop verfeinert Fähigkeiten über mehrere Runden durch ein strukturiertes 'Verbesserungs-Tagebuch' in einer Learning.md-Datei.

  • Multi-Agenten-Orchestrierung minimiert blinde Flecken durch den Einsatz spezialisierter Agenten für Faktenprüfung, Domänenrelevanz, Sicherheit und Stil.

  • Der Workflow-Verbesserungs-Loop nutzt einen Prozessoptimierungs-Agenten, um nicht nur die Aufgabe, sondern den gesamten Ablauf basierend auf einer Qualitäts-Rubrik zu verfeinern.

Timeline

Grundlagen des Loop-Engineerings

  • Agenten-Loops ersetzen manuelle, starre Prompts durch ein selbsterlernendes System.
  • Determinierte Loops eignen sich für Aufgaben mit bekanntem Ziel, nicht-determinierte für unklare Anforderungen.

Das Konzept transformiert das Prompt-Design in ein dynamisches System, in dem der Agent selbstständig lernt und den nächsten Schritt definiert. Die Unterscheidung zwischen deterministischen und nicht-deterministischen Loops hängt davon ab, ob der Agent das Ergebnis selbst überprüfen kann.

Zustandslose Loops und zielorientierte Autonomie

  • Zustandslose Loops wie der Zielbefehl speichern keine Informationen aus vergangenen Iterationen.
  • Die Integration von vorab geschriebenen Tests stellt sicher, dass Claude Code Funktionen korrekt baut und den Zielbefehl erst bei Bestehen aller Tests als erledigt markiert.

Zustandslose Loops sind die einfachste Form und agieren ohne Gedächtnis. Durch das Hinterlegen von Tests in der Entwicklung kann der Agent autonom arbeiten, während ein kleineres Modell wie Haiku zur Qualitätssicherung die Einhaltung der Anforderungen prüft.

Lern-Loops zur kontinuierlichen Verbesserung

  • Lern-Loops konzentrieren sich auf die langfristige Verbesserung spezifischer Fähigkeiten durch wiederholte Ausführung und Analyse.
  • Eine Learning.md-Datei dient als strukturiertes Tagebuch, in dem alle Lektionen und Ergebnisse für zukünftige Iterationen festgehalten werden.

Anstatt nach der Aufgabe zu stoppen, führt dieser Loop den Prozess mehrfach durch und vergleicht Implementierungen mit und ohne die jeweilige Fähigkeit. Der Agent lernt aus vergangenen Fehlern, indem er das strukturierte Tagebuch innerhalb der Fähigkeit selbst aktualisiert.

Multi-Agenten-Systeme für komplexe Überprüfungen

  • Die Verteilung von Überprüfungsaufgaben auf mehrere spezialisierte Agenten deckt blinde Flecken einzelner Instanzen ab.
  • Ein Orchestrierungs-Befehl koordiniert vier Agenten für Fakten, Domänenrelevanz, Sicherheit und Stil.

Ein einzelner Überprüfungs-Agent ist oft mit der Komplexität überfordert, weshalb eine Aufteilung auf ein Team (ähnlich einem LLM-Rat) notwendig ist. Ein zentraler Orchestrator verwaltet den Kontext über mehrere Runden hinweg und implementiert Korrekturen schrittweise.

Workflow-Verbesserungs-Loop zur Prozessoptimierung

  • Der Workflow-Verbesserungs-Loop optimiert den gesamten Ablaufprozess, nicht nur einzelne Fähigkeiten.
  • Drei Agenten (Ersteller, Bewerter, Prozessoptimierer) verfeinern bei jedem Durchlauf sowohl die App-Qualität als auch die Workflow-Struktur.

Der Prozessoptimierungs-Agent bewertet den gesamten Zyklus anhand einer 100-Punkte-Rubrik. Ziel ist es, nach Abschluss nicht nur eine fertige Anwendung zu erhalten, sondern einen validierten und optimierten Arbeitsprozess für zukünftige Aufgaben.

Community Posts

View all posts