Vom Programmieren zu Knowledge-Work-Agenten — Karan Vaidya, Composio

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00Hallo zusammen, ich bin Karan Vedya, Mitgründer und CTO von Composio.
00:00:19Die meisten Tool-Aufrufe von Agenten
00:00:21finden heutzutage immer noch in einem Bereich statt.
00:00:23Keine Überraschung: Es ist die Softwareentwicklung.
00:00:26Alle anderen Arbeitsbereiche hinken weit hinterher.
00:00:29Wenn Modelle immer besser werden, dann
00:00:32warum sind wir immer noch auf agentisches Programmieren beschränkt?
00:00:35Das ist die Billionen-Dollar-Frage, die ich heute beantworten möchte.
00:00:43Vor drei Jahren waren Coding-Agenten nichts weiter als Autovervollständigung.
00:00:47Heute ist die Softwareentwicklung komplett autonom.
00:00:50Wir sind von ständigem Tab-Drücken zu „Lass Claude mal machen“ übergegangen.
00:00:56Das ist einfach magisch.
00:00:59Und warum ging das beim Programmieren so schnell?
00:01:04Die meisten würden vermuten, es liegt an den Modellen.
00:01:06Ja, die Modelle sind im Laufe der letzten zwei bis drei Jahre deutlich besser geworden, und das Gleiche gilt für
00:01:13die Harnesses wie Claude Code, Codex und Cursor.
00:01:17Aber für sich allein hätte das nicht ausgereicht.
00:01:20Es hat nur deshalb funktioniert, weil die gesamte Infrastruktur und die Systeme rund ums Programmieren buchstäblich
00:01:26für Agenten ausgelegt waren.
00:01:27Code wurde genau mit der Unterstützung geliefert, die Agenten brauchten.
00:01:31Man hat das Repository, den Commit-Verlauf, Tests, CI/CD, Code-Reviews, Linter und die Möglichkeit zum Revert, falls
00:01:39etwas schiefgeht.
00:01:39Die Art von Dingen, die einem Vertrauen in die Agents gibt, die Systeme rund um den Code.
00:01:45Jetzt setzen wir dieselben großartigen Agenten auf alles andere an: Kundenservice, Finanzen, Vertrieb.
00:01:54Aber die Agenten, die beim Programmieren phänomenal abgeschnitten haben, arbeiten hier im Grunde blind, weil die
00:02:00Infrastruktur rund um das Programmieren in anderen Bereichen gar nicht existiert.
00:02:04Wie schließen wir also die Lücke zwischen Coding-Agenten und Wissensarbeits-Agenten?
00:02:11Wir glauben, es liegt an sechs Kern-Primitiven. Das Programmieren hatte alle sechs, während die Wissensarbeit
00:02:19keine einzige hat.
00:02:20Und genau das müssen wir aufbauen.
00:02:24Das erste ist die Zentralisierung.
00:02:26Coding-Agenten haben unter anderem deshalb so gut funktioniert, weil sie sich sehr nah an der Quelle der Wahrheit befanden.
00:02:34Sie kannten das Was, das Warum und das Wie.
00:02:37Man gibt ihnen das Repository und Infrastructure as Code, schließt den Kreis und lässt das Modell
00:02:43machen.
00:02:44Der Agent beginnt mit allem, was er braucht, an einem einzigen Ort – nämlich der Codebasis.
00:02:51Genau das fehlt der Wissensarbeit heute.
00:02:55Zum Beispiel ist ein einzelner Deal über fünf verschiedene Plattformen verstreut.
00:03:00Die Datensätze sind in Salesforce, die Dokumente in Notion, E-Mails in Gmail, Unterhaltungen in
00:03:05Slack und der Support-Verlauf in Zendesk.
00:03:09Es gibt keine einheitliche Informationsquelle, keinen zentralen Ort für alle Daten.
00:03:14Beim Programmieren ist alles getrennt, aber jede Anwendung hat ihren eigenen Login.
00:03:18Bevor ein Wissensarbeits-Agent überhaupt mit der Arbeit beginnen kann, muss er alle Fäden
00:03:23selbst zusammensuchen und miteinander verknüpfen.
00:03:27Und das ist erst der Ausgangspunkt, von dem aus Coding-Agenten gestartet sind.
00:03:30Die hatten das alles bereits.
00:03:32Wie kann man also erwarten, dass ein Wissensarbeits-Agent die gleiche Arbeit leistet wie ein Coding-Agent?
00:03:39Das Erste, was wir also bauen, ist die fehlende Zentrale.
00:03:42Ein Ort, an dem all Ihre Apps, all Ihre Verbindungen und all Ihre Logins existieren.
00:03:46So muss der Agent nicht die mühsame Arbeit leisten, sie alle selbst zusammenzuknüpfen.
00:03:51Er findet alles an einem einzigen Ort.
00:03:55Und er erhält dieselbe Basis, mit der Coding-Agenten gestartet sind: das Repository und Informationen
00:03:59über alle Stacks hinweg an einem einzigen Ort.
00:04:02Das ist das Fundament, von dem aus Sie starten, und Sie können Ihrem Agenten Schreibrechte erteilen.
00:04:09Das Nächste, was ein Agent braucht, ist ein Sinn für Geschichte – die Fähigkeit, in die Vergangenheit zu blicken.
00:04:16Im Code bekommt man das umsonst.
00:04:18Git speichert jede einzelne Änderung und jeden Schritt, der jemals vorgenommen wurde.
00:04:23So kann der Agent immer zurückblicken und nachvollziehen, wie eine bestimmte Änderung zustande kam.
00:04:27Warum etwas funktioniert hat oder warum etwas schiefgegangen ist.
00:04:31Denken Sie an die Art von Aufgaben, die Sie Ihrem Agenten tatsächlich stellen.
00:04:34Wir mussten in der Vergangenheit eine Änderung wegen eines Fehlers rückgängig machen, aber das war ziemlich mühsam.
00:04:40Kannst du dir das ansehen und es wiederherstellen?
00:04:43Er liest einfach den Verlauf durch, holt es zurück und legt los.
00:04:46Die Historie ist dabei nicht nur für den Agenten da.
00:04:49Sie dient auch Ihnen dazu, nachzuvollziehen, was der Agent eigentlich tut.
00:04:53Sie können sehen, was er tut, wo er Fehler macht und wo er erfolgreich ist.
00:04:58Und anstatt blind dem zu vertrauen, was der Agent Ihnen sagt, können Sie einfach in diesen Apps
00:05:04nachsehen, was er getan hat.
00:05:09Stellen Sie nun dieselben Fragen in Bezug auf die Wissensarbeit.
00:05:12Was hat dazu geführt, dass sich das CRM in seinem heutigen Zustand befindet?
00:05:16Wie hat mein Kollege diese fantastische E-Mail verfasst, die zum Abschluss des Deals geführt hat?
00:05:22Wie lautet der genaue Prozess, um ein Support-Ticket zu eskalieren oder sogar zu lösen?
00:05:27Die Antworten sind über hunderte Apps verstreut, und keine davon speichert den Verlauf.
00:05:31Deshalb hat der Agent kein Gedächtnis.
00:05:33Er fängt fast jedes Mal bei einem leeren Zustand an.
00:05:36Er hat keine Ahnung, was zuvor ausprobiert wurde, was funktionierte und was nicht.
00:05:40Und auch Sie haben keine Möglichkeit, das nachzuvollziehen.
00:05:44Sobald der Agent läuft, teilt er Ihnen mit, dass er fertig ist.
00:05:47Sie wissen jedoch nicht, ob er es tatsächlich erfolgreich erledigt hat.
00:05:49Es gibt keine Möglichkeit herauszufinden, ob das stimmt oder nicht.
00:05:52Genau das fehlt: eine Dokumentation der Arbeit.
00:05:56Da nun endlich alles über einen einzigen Ort läuft – diese Zentralisierung –, können wir
00:06:02eine Schicht darüber legen: den Verlauf.
00:06:06Jede einzelne Aktion, die der Agent unternimmt, kann über alle Apps hinweg protokolliert werden.
00:06:12Was er berührt hat, was er übersprungen hat, was funktioniert hat und was nicht.
00:06:17Dadurch erhält der Agent erstens ein Gedächtnis.
00:06:20Er kann zurückblicken, wie ähnliche Aufgaben früher erledigt wurden, was erfolgreich war, und dies wiederholen.
00:06:28Er fängt nicht jedes Mal bei Null an.
00:06:31Zweitens gewinnen Sie Vertrauen.
00:06:33Sie können endlich genau sehen, was der Agent tut.
00:06:36Anstatt also nur zu hoffen, dass er das Richtige tut, können Sie es überprüfen und eingreifen, wenn er Mist baut.
00:06:44Und je öfter Sie sehen, dass er das Richtige tut, desto mehr Vertrauen fassen Sie und übertragen ihm weitere Aufgaben.
00:06:50Das Nächste, was ein Agent braucht, ist Kontext.
00:06:53Wenn man darüber nachdenkt, gibt es im Grunde zwei Arten von Kontext.
00:06:57Das Erste ist der Aufbau der Plattform, die Architektur.
00:07:01Wie Dinge ineinandergreifen, wie sie verknüpft sind und wie die Daten fließen.
00:07:05Das ist wie eine Landkarte, die ein Senior Engineer im Kopf hat und für deren Entwicklung ein Junior etwa drei Monate braucht.
00:07:12Das Zweite ist der Stil.
00:07:13Das ist nicht das, was objektiv richtig ist, sondern eher, wie „gut“ in Ihrem Unternehmen aussieht.
00:07:19Wie Sie Dinge tun, Dinge wie Linter, Typprüfungen und so weiter.
00:07:24Oder vielleicht verwenden Sie einen TypeScript-Decorator, den sonst niemand nutzt.
00:07:29Das steht nicht unbedingt irgendwo in einem Handbuch.
00:07:32Es steckt eher in Ihrer Codebasis.
00:07:34Es ist komplett in Ihrer Codebasis verfügbar.
00:07:35Der Agent kann also nachschauen und die Vorgaben, Ihre Vorlieben, Linter, Formatierer usw. herausfinden.
00:07:45Kommen wir nun zur Wissensarbeit, da verhält es sich genauso.
00:07:48Angenommen, Sie schreiben ein Dokument für einen Kunden.
00:07:50Um überhaupt anzufangen, müsste ich die Datenbank öffnen, um die Nutzung abzurufen und zu prüfen, wie sie Dinge tatsächlich verwendet haben,
00:07:58sowie Salesforce konsultieren, um die Deal-Details einzusehen.
00:08:01Erst dann kann ich überhaupt die erste Zeile des Dokuments schreiben.
00:08:05Die Antwort war nicht isoliert in nur einem dieser Tools zu finden.
00:08:09Ich kann dieses Dokument schreiben, weil ich die Fäden all dieser Tools in meinem Kopf zu einem einzigen Kontext zusammenwebe.
00:08:15Wenn man Historie und Kontext zusammenfügt, bildet man ab, wie die Organisation funktioniert.
00:08:21Und dieser Teil steht dem Agenten nicht einfach so zur Verfügung.
00:08:26So wie wir Zentralisierung und Protokollierung eingeführt haben – das soeben erstellte Protokoll, das dem Agenten Gedächtnis verleiht und Ihnen die Überprüfung ermöglicht –, passiert noch etwas Interessantes.
00:08:36Es leistet noch etwas Wichtiges.
00:08:38Wenn man genug davon protokolliert, was jeder Agent tut, fängt man an, Muster zu erkennen.
00:08:42Man erkennt, wie das Unternehmen arbeitet, und entwickelt Fähigkeiten, die eine Art Destillat der bisherigen Arbeitsweise des Unternehmens darstellen.
00:08:51Welche Ansätze funktionieren, welche nicht, was in der Vergangenheit zu Fehlschlägen geführt hat usw.
00:08:57Das Protokoll ist nicht länger nur eine bloße Aufzeichnung dessen, was passiert ist.
00:09:01Es ist ein Abbild davon, wie Ihr Unternehmen funktioniert.
00:09:03Und das wirkt auf drei verschiedenen Ebenen.
00:09:06Wie ein Tool im Allgemeinen funktioniert, was für jede Person gilt.
00:09:09Wie ein Unternehmen Dinge tut und wie Sie es bevorzugen, Dinge zu tun.
00:09:13Was für Sie gut aussieht.
00:09:15Und genau das ist der Kontext, der einem Agenten für Wissensarbeit fehlte.
00:09:19Wie die Arbeit tatsächlich erledigt wird.
00:09:21Eine Art echtes Handbuch.
00:09:23Und die Präferenzen eines Unternehmens oder eines einzelnen Benutzers.
00:09:27Nun kann der Agent Abfragen dazu stellen und muss nicht länger raten, wie das Unternehmen agiert.
00:09:34Der andere Grund, warum Coding-Agenten so gut funktionieren.
00:09:37Sie testen sich selbst.
00:09:38Die Arbeit prüft sich selbst.
00:09:40Verifizierung.
00:09:41Sobald der Agent Code schreibt, folgt eine Reihe von Prüfungen.
00:09:44Unittests können kleine Fehler abfangen.
00:09:47Integrationstests fangen jene ab, die erst drei Module weiter Auswirkung zeigen.
00:09:52Das Typsystem würde gar nicht erst funktionieren und laufen, wenn etwas schiefginge.
00:09:57Der Compiler würde nicht einmal bauen.
00:10:00Darüber hinaus liegen die Softwareprüfungen.
00:10:02Linter, Formatierer, bugbot.md, Review-Fähigkeiten und so weiter.
00:10:06Und diese stellen sicher, dass der Code den Standards entspricht, die Ihr Team gerne befolgt.
00:10:12Nichts davon trifft auf Sie.
00:10:14Der Agent schließt die Schleife eigenständig und stellt sicher, dass er den Standard einhält und den Code lauffähig macht.
00:10:21Nun, denken Sie an Folgendes: Vor einiger Zeit habe ich meine Open Claw auf eine Recruiting-Aktion angesetzt.
00:10:28Massen-E-Mails an Kandidaten.
00:10:30Es lief.
00:10:31Es hat Unmengen an E-Mails verschickt.
00:10:34Einige von Ihnen haben vielleicht auch eine von meiner Open Claw bekommen.
00:10:37Es hat genau das getan, was ich ihm gesagt habe.
00:10:40Es war auch eine Katastrophe.
00:10:42Die Sorte, die auf Twitter landet und meinen Namen trägt.
00:10:46Ja, ich schätze, man sieht da ein ziemliches Desaster.
00:10:51Ich war nicht gerade glücklich, als das passierte.
00:10:54Und folgendes:
00:10:55Jede Überprüfung aus der vorherigen Folie wäre durchgegangen.
00:10:58Die E-Mails waren gültig.
00:11:00Die Adressen waren real.
00:11:00Sie erreichten tatsächlich echte Personen, die gepostet hatten.
00:11:04Es gab auf der Welt keinen Test, der wirklich hinterfragt hätte, worauf es ankam.
00:11:10Hätte das überhaupt rausgehen dürfen?
00:11:13Das ist die Lücke.
00:11:14Im Code sagen Ihnen diese Tests, was falsch und richtig ist.
00:11:17Hier hat mir das Internet gesagt, dass ich falsch lag.
00:11:21Also bauen wir die Prüfungen ein, die fehlen.
00:11:24Das Problem im obigen Thread war nicht, dass die Ansprache falsch war.
00:11:28Sondern dass sie rausging, bevor ich überhaupt davon erfuhr.
00:11:31Die Lösung ist also einfach.
00:11:33Abfangen, bevor es überhaupt real ist.
00:11:35Wir tun dies also auf zwei Arten.
00:11:37Erstens: Bevor der Agent etwas sendet, prüft er die Entwürfe von E-Mails, die ich zuvor gesendet habe, ob sie meinem Stil und der Qualität entsprechen, die ich mag.
00:11:47Zweitens: Bevor wir in einem realen Szenario etwas Destruktives tun, stellen wir dem Agenten Sandboxes zur Verfügung, die echte Tools emulieren, und er kann Aktionen in diesen Sandboxes ausführen.
00:11:59Anstatt dass der Explosionsradius die reale Welt trifft, trifft er eine Sandbox, und ich kann es überprüfen, bevor der Agent das Echte tut.
00:12:07Nimmt man beides zusammen, hat man etwas, das Wissensarbeit noch nie hatte.
00:12:11Eine Möglichkeit für den Agenten, seine eigene Arbeit zu prüfen, bevor sie real ist.
00:12:16Er kann endlich seinen eigenen Kreislauf schließen, anstatt auf Sie zu warten, und mit alledem können Sie der Aktion vertrauen, ohne mit Tweets bombardiert zu werden, die ich verfasse.
00:12:29Als Nächstes braucht der Agent Governance.
00:12:32Vertrauen aufzubauen bedeutet zu kontrollieren, was der Agent tun kann, und die richtigen Wände um ihn herum zu errichten.
00:12:39Im Code ist dies weitgehend gelöst und weist mehrere Schichten auf.
00:12:44Der Agent kann auf seinem eigenen Branch tun, was er will, aber er kann nicht nach Main mergen.
00:12:49Ein menschlicher Reviewer sitzt vor dem Mergen nach Main dazwischen.
00:12:52Kritische Dateien haben Code Owners, sodass bei jedem Berühren die richtigen Leute einbezogen werden.
00:12:58Wir nutzen Agenten für Vorschau-Deployments, lassen sie niemals die Produktions-Deployments berühren, sodass wir das dort kontrollieren.
00:13:04Governance ist kein einzelnes Tor, sondern mehrere, und jedes variiert in seiner Größe je nach dem Explosionsradius, den es darstellt.
00:13:12Nichts davon bremst den Agenten in sicheren Bereichen aus, es verhindert lediglich, dass er die Produktion vermasselt.
00:13:19Und je enger diese Grenzen sind, desto mehr können Sie dem Agenten vertrauen und ihn Amok laufen lassen.
00:13:25Sie haben das wahrscheinlich gesehen.
00:13:27Die Director of Alignment beim Meta Super Intelligence Lab hat einen Agenten an ihre E-Mail angeschlossen, und er fing an, ihre E-Mails zu zerstören und viele davon zu löschen.
00:13:36Sie sagte ihm, er solle aufhören, und er machte weiter. Schließlich musste sie zu einer physischen Maschine rennen, um ihn zu stoppen, aber da waren bereits 200 E-Mails verschwunden.
00:13:45Sie hatte es ihm vorher im Prompt aufgetragen, in solchen Fällen vor dem Handeln zu bestätigen, aber das war nur ein Prompt, der wahrscheinlich komprimiert wurde.
00:13:53Und wenn jemand, dessen einzige Aufgabe KI-Alignment ist, den Agenten nicht richtig prompten kann, dann kann es wahrscheinlich keiner von uns.
00:14:03Und das ist der wahre Grund, warum diesen Agenten so schwer zu vertrauen ist – nicht, weil sie schlechter als die Coding-Agenten sind, sondern weil keine Wand um sie herum ist.
00:14:12Im Code war die Wand bereits in das System eingebaut, während wir zuvor entwickelt haben.
00:14:17Wissensarbeit hat hier und da auch ein paar Teile.
00:14:20Zum Beispiel hat Gmail Scopes.
00:14:21Salesforce hat Berechtigungsstufen.
00:14:23Aber es ist so verstreut, dass es sehr schwer ist, echte Kontrolle zu haben, und meistens machen die Leute es am Ende über Prompting.
00:14:32Und Prompting ist fragil.
00:14:34Der Agent wird Schlupflöcher finden.
00:14:36Dinge werden komprimiert.
00:14:38Und im großen Maßstab wird einer dieser Zäune brechen, und Sie werden sich in derselben Lage befinden, in der 200 Ihrer wichtigen E-Mails verschwinden.
00:14:47Was würde ihn also tatsächlich stoppen? Keine bessere Anweisung, sondern eine Wand, die der Agent nicht überqueren kann, selbst wenn er vergaß, dass diese Wand existierte.
00:15:00Also bauen wir diese Wände in zwei Schichten.
00:15:03Die erste Schicht ist deterministisch: Kontrolle darüber, was der Agent erreichen kann und worauf er Zugriff hat.
00:15:09Ein Recruiting-Agent kann wahrscheinlich einfach die E-Mails lesen.
00:15:13Ein Support-Agent kann einen E-Mail-Entwurf erstellen, diesen aber nicht tatsächlich senden.
00:15:17Die Grenze liegt außerhalb dieser Agenten.
00:15:19Sie kann weder vom Agenten diskutiert noch vergessen oder komprimiert werden.
00:15:24Anweisungen schlugen fehl, weil sie im Speicher des Agenten im Prompt lebten.
00:15:28Das tut dies nicht.
00:15:30Aber der Zugriff allein hätte sie nicht gerettet, weil sie tatsächlich einen E-Mail-Agenten baute.
00:15:36Also brauchte er definitiv Zugriff auf diese E-Mail.
00:15:39Das andere, was wir tun, ist Richtlinien bereitzustellen, mit denen Sie in natürlicher Sprache festlegen können, was der Agent selbst mit diesen Zugriffen tun darf.
00:15:49Also Dinge wie: Löschen Sie niemals mehr als 10 E-Mails ohne meine Erlaubnis.
00:15:53Versenden Sie niemals E-Mails außerhalb einer bestimmten Domain.
00:15:56Regeln, die das Verhalten selbst mit diesem Zugriff kontrollieren.
00:16:00Zwischen diesen beiden Dingen steuert also eine Schicht, was der Agent erreichen kann, und die andere Schicht steuert das Verhalten bei dem, was er mit dieser Reichweite anfangen kann.
00:16:09Zusammen ist das echte Governance für den Agenten.
00:16:11Man bittet den Agenten nicht nur sich zu benehmen, sondern erzwingt, was er tun kann.
00:16:17Die letzte Säule: Reversibilität.
00:16:20Und hier kommen wir an, wenn Dinge schiefgehen.
00:16:25Kann ich es rückgängig machen?
00:16:27Im Code können Sie das fast immer.
00:16:30Jede Änderung wird aufgezeichnet.
00:16:32Dinge können zurückgenommen werden.
00:16:33Sie können den letzten Commit per `git revert` zurücknehmen oder per `git bisect` den Commit finden, der Ihre Produktion beschädigt hat, und ihn rückgängig machen.
00:16:41Ich sage ja nicht, dass es gut ist.
00:16:44Das werde ich nicht vorgeben.
00:16:45Wenn Dinge in die Produktion gelangen und kaputtgehen, ist das immer schlecht.
00:16:48Aber es ist dennoch nicht endgültig.
00:16:50Sie können immer noch davon zurücktreten.
00:16:51Und genau das gibt Ihnen das Vertrauen, Ihre Agenten werkeln zu lassen und etwas Magie vollbringen zu lassen.
00:16:57Denn selbst wenn sie Dinge beschädigen, haben Sie einen Weg zurück.
00:17:03Für Wissensarbeit gibt es keinen Rückgängig-Button.
00:17:05Dinge wie: Denken Sie an den Posteingang.
00:17:07Diese 200 E-Mails sind weg.
00:17:09Sie sind verschwunden.
00:17:10Das ist übrigens der Normalfall.
00:17:12Der Katastrophenfall ist eine gesendete E-Mail, die Sie nicht rückgängig machen können.
00:17:15Eine Überweisung, die bereits getätigt wurde, sodass Sie das Geld nicht zurückbekommen.
00:17:18Ein gelöschter Datensatz, für immer weg.
00:17:20Die meisten Aktionen in der Wissensarbeit haben tatsächlich keinen Rückgängig-Button.
00:17:24Und das verändert die ganze Gleichung.
00:17:27Das verändert den Explosionsradius.
00:17:29Bei Code können Sie dem Agenten im Nachhinein vertrauen.
00:17:31Lassen Sie ihn laufen.
00:17:32Prüfen Sie das Ergebnis.
00:17:33Machen Sie es rückgängig, wenn es falsch ist.
00:17:34Hier gibt es kein Zurück.
00:17:36Der einzige Ausweg für Sie ist es, vor der Handlung des Agenten zu vertrauen.
00:17:40Das ist es, was diese Agenten auf eine Weise gefährlich erscheinen lässt, wie es Coding-Agenten nie waren.
00:17:44Es liegt nicht daran, dass sie oft scheitern.
00:17:46Es liegt daran, dass ein Fehler dort für immer ist.
00:17:49Entweder Sie gehen ganz nach vorne oder lassen ihn niemals agieren.
00:17:55Seien wir ehrlich.
00:17:56Reversibilität lässt sich in der Wissensarbeit am schwersten replizieren.
00:17:59Echtes Undo, so wie es für Code existiert, existiert wahrscheinlich nicht in allen Szenarien der Wissensarbeit.
00:18:04Aber wir haben einige Szenarien, in denen Undo existiert, und wir rufen sie auf.
00:18:09Nehmen wir an, Sie fügen ein Label hinzu.
00:18:11Sie können das Label danach wieder entfernen.
00:18:14Aber bei Aktionen, die Sie überhaupt nicht rückgängig machen können – wie Hard Deletes, die E-Mails aus Ihrem Posteingang verschwinden lassen –
00:18:21stellen wir wiederum eine Sandbox bereit, in der der Agent die Sache zuerst in der Sandbox tun kann,
00:18:25und Sie können sie überprüfen, bevor sie tatsächlich in die Produktionsumgebung übergeht.
00:18:30Nichts davon berührt die reale Welt.
00:18:31Das ist der ganze Wandel.
00:18:32Im Code können Sie den Fehler nach seinem Auftreten rückgängig machen.
00:18:35Hier fangen Sie ihn ab, bevor er es tut.
00:18:37Anderes Timing, dasselbe Ergebnis.
00:18:39Ein Fehler, der nicht hängen bleibt.
00:18:41Denken Sie noch einmal nach.
00:18:42Die Aktionen, die wir umkehren konnten, würden wir mit einem Rückgängig-Button versehen.
00:18:45Diejenigen, die wir nicht konnten, würden den Agenten zuerst in die Sandbox führen,
00:18:48und sie würde benachrichtigt: Ihre 1.200 E-Mails werden gelöscht.
00:18:52Wollen Sie das?
00:18:54Es ist noch nicht getan.
00:18:57Aber über Milliarden von Aktionen hinweg, die wir durchlaufen,
00:19:00lernen wir auf dem Weg, welche zurückgenommen werden können und welche nicht,
00:19:04und bereiten die Sandbox dementsprechend vor.
00:19:09Wenn Sie heute eine Sache mitnehmen, dann diese.
00:19:11Zwei Jahre lang war das Modell der Flaschenhals.
00:19:14Also rannte jeder immer besseren Modellen hinterher.
00:19:17Jetzt sind die Modelle gut genug geworden, dass Softwareentwicklung zu 100% autonom ist.
00:19:23Aber jetzt ist alles andere der Flaschenhals.
00:19:26Dasselbe Modell, das Ihren Code schreibt, kann auch Ihr Recruiting, den Vertrieb und andere Wissensarbeit erledigen.
00:19:36Aber im Moment arbeitet es blind.
00:19:39Keine Historie, kein Kontext, keine Möglichkeiten zur Verifizierung, keine Leitplanken, kein Undo.
00:19:44Der Flaschenhals hat sich also verschoben.
00:19:48Jetzt ist es die Infrastruktur, die noch niemand gebaut hat, und genau das bauen wir bei Composio.
00:19:54Ja, wir treiben insgesamt eine Milliarde Tool-Aufrufe an, 300 Millionen Tool-Aufrufe finden jeden Monat statt.
00:20:02Und wenn Sie einen Agenten bauen, verweisen Sie ihn einfach auf Composio und sehen Sie zu, wie die Magie für die Wissensarbeit geschieht.
00:20:08Und wenn Sie das Substrat der Zukunft für KI-Agenten bauen möchten, dann kommen Sie bitte zu mir.
00:20:13Wir stellen definitiv ein, und es gibt noch sehr, sehr viel zu tun.
00:20:17Die Modelle werden weiter besser werden.
00:20:19Der Flaschenhals werden nicht die Modelle sein.
00:20:21Es werden die Dinge drum herum sein.
00:20:22Vielen Dank.

Key Takeaway

Die vollständige Autonomie von KI-Agenten in der Wissensarbeit erfordert sechs fehlende Infrastruktur-Primitive wie Zentralisierung und Verifizierung, da leistungsstarke Modelle allein ohne diese Leitplanken zu unkontrollierten Fehlern führen.

Highlights

  • Softwareentwicklung funktioniert vollständig autonom, während andere Wissensarbeitsbereiche weit hinterherhinken.

  • Der Aufstieg von Coding-Agenten scheiterte nicht an den Modellen, sondern an der für Agenten optimierten Infrastruktur.

  • Wissensarbeit benötigt sechs Kern-Primitiven: Zentralisierung, Historie, Kontext, Verifizierung, Governance und Reversibilität.

  • Eine unzureichend kontrollierte Recruiting-Aktion von Open Claw demonstrierte die katastrophalen Folgen fehlender Prüfungen in der Praxis.

  • Composio verarbeitet monatlich 300 Millionen Tool-Aufrufe zur Unterstützung von KI-Agenten.

  • Die Entwicklung künftiger Agenten scheitert nicht an den KI-Modellen, sondern an der fehlenden Infrastruktur in Unternehmen.

Timeline

Der Zustand von Coding- und Wissensarbeits-Agenten

  • Softwareentwicklung profitiert von vollkommen autonomen Agenten.
  • Alle anderen Arbeitsbereiche wie Kundenservice oder Finanzen hinken stark hinterher.
  • Die Infrastruktur rund um den Code ermöglicht den Erfolg von Coding-Agenten.

Coding-Agenten entwickelten sich innerhalb von drei Jahren von einfachen Autovervollständigungen zu autonomen Systemen. Dieser Wandel gelang, weil Repositories, Commits, CI/CD und Linter eine perfekt vorbereitete Umgebung bieten. Ohne diese Systeme arbeiten Agenten in anderen Bereichen völlig blind.

Zentralisierung als Basis für Agenten

  • Wissensarbeit ist über zahlreiche verschiedene Plattformen verstreut.
  • Ein einzelner Deal verteilt sich auf Salesforce, Notion, Gmail, Slack und Zendesk.
  • Eine zentrale Informationsquelle fehlt in der Wissensarbeit gänzlich.

Coding-Agenten greifen direkt auf ein zentrales Repository als einzige Quelle der Wahrheit zu. Wissensarbeits-Agenten müssen hingegen erst mühsam Daten aus Dutzenden getrennten Anwendungen zusammenklauben. Eine einheitliche Plattform mit allen Logins schafft das notwendige Fundament.

Historie und Protokollierung für ein Gedächtnis

  • Git speichert im Code jede Änderung und bietet dem Agenten eine lückenlose Historie.
  • Wissensarbeit besitzt keine vergleichbare Dokumentation vergangener Schritte.
  • Protokolle ermöglichen dem Agenten ein Gedächtnis und dem Menschen die Überprüfung.

Ohne Historie starten Wissensarbeits-Agenten bei jeder Aufgabe in einem leeren Zustand und wiederholen Fehler. Durch eine zentrale Protokollierung aller Aktionen entsteht ein unternehmensweites Handbuch, das sowohl dem Agenten als auch dem Menschen maximale Transparenz liefert.

Kontext und Verifizierung vor der Realität

  • Software-Agenten nutzen Unittests, Integrationstests und Compiler zur Selbstprüfung.
  • Unkontrollierte E-Mail-Aktionen von Agenten führen im realen Betrieb zu verheerenden Ergebnissen.
  • Sandboxes fangen destruktive Aktionen vor dem Kontakt mit der Realität ab.

Im Code prüfen Compiler und Linter jede Zeile automatisch auf Fehler, bevor sie ausgeführt wird. Eine unüberlegte Recruiting-Aktion mit Open Claw zeigte hingegen, dass echte Tests in der Wissensarbeit oft fehlen. Sandboxes und Stilvergleiche lösen dieses Problem durch Simulationen vor dem echten Versand.

Governance und Reversibilität in der Praxis

  • Echte Governance erfordert deterministische Wände anstelle von fragilen Prompts.
  • Fehler in der Wissensarbeit besitzen oft keinen Rückgängig-Button wie Git Revert.
  • Composio stellt die fehlende Infrastruktur bereit, um Agenten sicher einzusetzen.

Einfache Prompts reichen nicht aus, um das Verhalten von Agenten zu kontrollieren, wie der Ausfall bei Meta zeigte. Deterministische Zugriffskontrollen und Richtlinien verhindern unbefugte Aktionen. Da ein Undo in der Wissensarbeit selten existiert, fangen Sandboxes und Protokolle die Risiken ab.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video