Schlupfloch: Adversarial Agents To Stress Test Your Morality — Brendan Rappazzo, Morgan Stanley
AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Ich werde über mein Projekt Loophole sprechen. Ich bin eigentlich Forscher für maschinelles Lernen bei Morgan
00:00:17Stanley, aber das hat nichts mit Morgan Stanley zu tun. Das ist einfach ein Open-Source-Projekt, das ich
00:00:23aus Spaß aufgebaut habe. Um zu Beginn einen Überblick zu geben: Es ist im Grunde ein Spiel,
00:00:30das auf einem adversariellen Agenten-Framework basiert. Man legt seine Moralvorstellungen fest, ein Agent
00:00:37kodifiziert diese in ein Rechtssystem, und dann versuchen diese beiden Agenten, Widersprüche
00:00:42in Ihrer Moral zu finden. In letzter Zeit habe ich verschiedene Erweiterungen darauf aufgebaut. Aber ich
00:00:49wollte erst einmal mit der Entstehungsgeschichte beginnen und wie ich auf diese Idee gekommen bin. Das Ganze
00:00:56fing vor langer Zeit an, als ich meine DNA für einen Abstammungstest an 23andMe geschickt hatte. Und ich
00:01:05hörte in letzter Zeit immer öfter, wie DNA-Proben natürlich verwendet werden können, um
00:01:11Verbrechen aufzuklären, bei Forensik und ungelösten Fällen. Und ich dachte darüber nach, dass ich im Grunde
00:01:17überall abgelehnt hatte, weil ich Angst vor diesem schiefen Weg hatte und wie meine DNA verwendet würde.
00:01:26Aber es gibt bestimmte Fälle, für die ich mich bereit erklären würde. Und es ist irgendwie interessant. Ich dachte,
00:01:31wenn mir jemand Fall für Fall präsentieren könnte: Wir verwenden Ihre DNA,
00:01:37um diesen ungelösten Fall oder diesen Mord aufzuklären, könnte ich mit Ja oder Nein stimmen. Und ich weiß, wo
00:01:43die Definition und die Nuancen meiner Moral liegen. Aber natürlich ist es kognitiv unheimlich aufwendig,
00:01:51das alles Fall für Fall aufzuzählen. Es gibt derzeit einfach keinen guten Weg dafür.
00:01:58Und dann dachte ich etwas übergeordneter nach, dass es viele Analogien zum Rechtssystem als Ganzes gibt.
00:02:04Eine Art, ein Rechtssystem in unserer Gesellschaft zu betrachten, ist im Grunde der Versuch,
00:02:10unsere eigenen moralischen Überzeugungen zu kodifizieren. Und ich denke, auf ähnliche Weise ist
00:02:17das Finden der wahren Nuancen unserer Moral und dessen, was das Gesetz sein sollte, eine wirklich schwierige
00:02:23Übersetzungsaufgabe. Oft neigen wir dazu, zu allgemein zu sein, weil das Finden dieser Nuancen
00:02:30sehr schwierig ist. Und wenn man versucht, eine perfekte Übersetzung zu erstellen, kann das zu
00:02:36seltsamen Sonderfällen oder Fehlfunktionen führen. Ich denke sogar, wenn wir uns politisch
00:02:42untereinander verhalten, streiten wir uns oft eher über Kernwerte, bei denen wir uns eigentlich gar nicht
00:02:48widersprechen, anstatt die wirklich nuancierten Punkte unserer Moral zu erforschen.
00:02:57Und ich denke, wenn man diesem breiteren Rechtsbeispiel folgt, stützen wir uns im englischen
00:03:02Common-Law-System deshalb so stark auf Präzedenzfälle, weil wir wissen, dass
00:03:09das Finden dieser Nuancen und nuancierten Grenzen schwierig ist. Also verlassen wir uns auf kluge Richter,
00:03:16um das Gesetz richtig zu interpretieren und anzuwenden. Und natürlich, selbst beim Obersten Gerichtshof,
00:03:22können Dinge nach oben getragen werden und wir können entscheiden, ob ein Gesetz überhaupt gültig ist.
00:03:28Die Idee war also: Kann man seine Moral nehmen und eine Art synthetische Präzedenzfallgenerierung durchführen?
00:03:34Das ist von Hand überwältigend, aber die neue Generation von LLMs ist endlich schlau genug,
00:03:42diese Art von hochstufiger moralischer Argumentation durchzuführen. Das war der Ausgangspunkt für dieses Spiel.
00:03:48Das war also quasi der Ausgangspunkt für dieses Spiel. Und ich möchte Sie einfach durch
00:03:55und dann auch über die verschiedenen Zweige sprechen, die ich auf Basis dieses Open-Source-Projekts
00:04:00entwickelt habe, da es sich in einige interessante Richtungen entwickeln könnte.
00:04:05Auf einer hohen Ebene funktioniert das Spiel so: Man nutzt natürliche Sprache,
00:04:12und das Ganze passiert in einer Art terminalbasierten Spiel, bei dem man seine Moral definiert.
00:04:19Das können allgemeine Moralvorstellungen sein oder solche zu einem bestimmten Thema. Dann gibt es einen Agenten,
00:04:24der diese Moralvorstellungen nimmt und ein reichhaltiges juristisches, kodifiziertes Rechtssystem entwirft.
00:04:31Das Ganze läuft in einer Schleife ab, in der ein Agent beauftragt wird, Schlupflöcher in Ihrem System zu finden,
00:04:38also etwas, das immoral, aber legal ist. Ein anderer soll eine Übergriffigkeit finden,
00:04:45also Dinge, die eigentlich moralisch, aber laut Ihrem System illegal sind. Und ein Schiedsrichter-Agent betrachtet
00:04:52Ihre Moral, den erstellten Gesetzestext und diese synthetischen Präzedenzfälle. Zuerst prüft er, ob er automatisch patchen kann –
00:04:58vielleicht war der ursprüngliche Entwurf Ihres Gesetzestextes eine unvollkommene Übersetzung,
00:05:05es liegt kein echter Widerspruch vor und er kann dieses Update einfach automatisch vornehmen.
00:05:10Oder es handelt sich um eine Unterpezifizierung oder einen Widerspruch in Ihrer Moral.
00:05:16In diesem Fall wird es Ihnen als Benutzer vorgelegt, damit Sie als Richter eine Entscheidung treffen.
00:05:22Läuft es noch bei Ihnen? Bei mir ist es verschwunden.
00:05:26Wenn Sie neugierig auf das Spiel sind, spielen Sie es gerne. Es ist komplett auf GitHub,
00:05:31aber ich wollte nur ein paar Beispiele zeigen. Das ist viel Text, es geht also eher darum,
00:05:37die Form von Ein- und Ausgabe zu zeigen. So geben Sie Ihre Eingabe ein, und um auf das DNA-Beispiel zurückzukommen,
00:05:44könnten Sie eine Reihe moralischer Prinzipien angeben.
00:06:10Das kodifizierte Rechtssystem hat dann, um nur auf die Form zu schauen, eine wirklich juristische Präambel, Artikel und Paragraphen, und versucht wirklich, in präziser Rechtssprache geschrieben zu sein.
00:06:24Dann werden die verschiedenen synthetischen Präzedenzfälle vorgeschlagen. In diesem Fall geht es um ein Schlupfloch, das gefunden wurde: Eine Versicherungsgesellschaft
00:06:34hat ein prädiktives Modell für maschinelles Lernen trainiert, nicht mit Ihrer DNA, sondern mit DNA-Artefakten. Es heißt also, das ist eigentlich immoral, aber nach Ihrem System derzeit legal.
00:06:46In diesem Fall stellte sich heraus, dass ein automatisches Patch möglich ist. Man erhält dann eine Git-ähnliche Differenzansicht des ursprünglichen Rechtssystems und der Änderungen,
00:06:58die vorgenommen werden mussten, um die Konsistenz mit Ihrer Moral zu gewährleisten. Hier ist ein Beispiel für eine Übergriffigkeit. Dabei wurde festgestellt, dass kein automatisches Patch möglich war. Es geht darum,
00:07:08dass jemand seine DNA für die Genforschung einreicht, der Forscher aber feststellt, dass diese Person eine seltene, aber behandelbare Erbkrankheit hat.
00:07:17Derzeit besagt Ihre Moral jedoch, dass es nicht erlaubt sein sollte, diese Krankheit der einreichenden Person offenzulegen. Dies wurde also an den Benutzer, an mich, herangetragen, um eine Entscheidung zu treffen. Wenn man die Entscheidung trifft, erhält man dieses gepatchte Rechtssystem.
00:07:33Es ist also ein unterhaltsames Spiel. Ich habe es auf Twitter gepostet und als Open Source auf GitHub geteilt. Für mich war es mit Abstand der Beitrag mit der größten Reichweite. Es hat mich darüber nachdenken lassen, dass viele Leute es einfach lustig fanden,
00:07:50um seine Moral einem Stresstest zu unterziehen und interessante Widersprüche zu entdecken. Aber es ließ mich auch fragen: Steckt da vielleicht noch mehr dahinter?
00:07:59Könnte das praktischere oder weitreichendere Implikationen haben? Ich spreche über drei verschiedene Bereiche: Der erste, der den Rechtsbereich verlässt und praktischer ausgerichtet ist, betrifft eine automatisierte Methode zur Erstellung von Verfassungen für Chatbots oder Agenten im Allgemeinen. Angenommen, Sie sind ein Unternehmen und möchten einen kundenorientierten Chatbot,
00:08:29der sich an einen moralischen Kodex halten und bestimmte Themen ansprechen oder meiden soll. In einem Zweig habe ich das so formuliert, dass man auf ähnliche Weise seine Moral und die Gesprächsthemen des Chatbots definiert. Dann wird ein kodifizierter System-Prompt erstellt, und adversarielle Agenten versuchen, den Bot dazu zu bringen, über Dinge zu sprechen, die er nicht tun sollte, oder sich zu weigern, über Dinge zu sprechen, die er ansprechen sollte.
00:08:56Ich sehe darin eine Analogie oder Methode ähnlich wie GEPA, die jedoch auf die Erstellung kodifizierter System-Prompts abzielt.
00:09:03Der zweite Anwendungsfall, der mich besonders interessiert, ist die Nutzung als Methode für ad-hoc- oder dezentrale Verträge. Im einfachen Fall kann man festlegen, wie mit den eigenen Daten oder der Privatsphäre online umgegangen werden soll, und dieses adversarielle Spiel durchlaufen, um ein kodifiziertes Rechtssystem für den eigenen Online-Datenschutz zu erhalten.
00:09:30Wenn Apple beispielsweise neue Nutzungsbedingungen veröffentlicht, kann man die Widersprüche zwischen dem eigenen Rechtssystem und Apples Bedingungen ermitteln und so Abweichungen oder synthetische Fälle aufdecken, die zu einem Konflikt zwischen Ihrer Moral und dem Handeln des Unternehmens führen.
00:09:57Handelt es sich um ein großes Unternehmen, können Sie das wahrscheinlich nicht ändern und es ist keine Verhandlung, aber Sie sind zumindest besser über den Vertrag informiert, den Sie unterschreiben.
00:10:08Dezentraler gedacht, wenn man Verträge ohne eine zentrale Durchsetzungsbehörde abschließen möchte, möglicherweise länderübergreifend.
00:10:23Man kann seine Moral und Vorstellungen für die Zusammenarbeit definieren – etwa bei Auftragsarbeiten, der Bezahlung und den damit verbundenen moralischen Vorstellungen –, und die Gegenpartei tut dasselbe.
00:10:40Am Ende erhalten beide einen strichtesteten, kodifizierten Vertrag, können eventuelle Meinungsverschiedenheiten vor der Einigung aufdecken und haben mehr Vertrauen in den Vertrag als Ganzes.
00:10:55Der letzte und vielleicht ambitionierteste Aspekt betrifft eine intelligentere oder effizientere Regierung.
00:11:07Es gäbe dabei viele Datenschutz- und Logistikprobleme, aber wenn man diese ausblendet und groß denkt:
00:11:15Für Wähler und Bürger könnte dies ein sehr interessanter Weg sein: Wenn Sie Ihre Moral definieren und einen strichtesteten Gesetzestext besitzen, könnten Sie jeden neuen Gesetzentwurf oder Politiker gegen Ihren Vertrag laufen lassen
00:11:28und Punkte aufdecken, bei denen Sie anderer Meinung sind oder die für Sie unmoralisch sind oder einen Widerspruch darstellen.
00:11:41Ich denke auch, dass wir alle viel Nuance in unseren Gefühlen haben, und dies ist ein Weg, zu dieser Nuance vorzudringen, anstatt nur über Werte zu streiten,
00:11:57wobei sich die Werte oft gar nicht widersprechen.
00:12:01Praktischer für Gesetzgeber: Man könnte sich vorstellen, vor der Einbringung eines Gesetzentwurfs eine Simulation aller anderen Gesetzgeber in einem Gremium durchzuführen, um ihn einem Stresstest zu unterziehen.
00:12:15Der dritte Zweig, den ich an diesem Projekt entwickelt habe, war genau das für den US-Senat.
00:12:18Genau das habe ich für den US-Senat versucht umzusetzen.
00:12:24Dazu ließ ich Claude zunächst das Abstimmungsverhalten und alle öffentlichen Daten aller aktuellen US-Senatoren analysieren, deren moralisches System erstellen und es durch den Loophole-Prozess laufen lassen, um einen kodifizierten Gesetzestext zu erhalten.
00:12:43Auf diesem System kann man jeden vorgeschlagenen Gesetzentwurf oder einen eigenen Entwurf einreichen und Claude simulieren lassen, wie jeder Senator abstimmen würde.
00:12:56Hier sieht man eine Aufschlüsselung einiger Senatoren, wie sie tendieren und welche Begründung hinter der Stimme steht.
00:13:07Es ist einfach interessant zu sehen, wie die Leute bei einem vorgeschlagenen Gesetz abstimmen würden.
00:13:16Aber das wird – ganz im Sinne der Konferenz – zu einer eigenen verifizierbaren Domäne oder Schleife.
00:13:22Man kann den Gesetzentwurf optimieren (Hill-Climbing), um eine Zweidrittelmehrheit oder die für die Verabschiedung nötigen Stimmen zu erreichen.
00:13:30Bei einem von mir getesteten Medicare-Gesetz, das ursprünglich bei einer 50/50-Abstimmung stand, wurden Möglichkeiten gefunden, den Gesetzestext so zu optimieren, dass es mit 52 Stimmen angenommen wurde.
00:13:45Dies zeigt, wie die Kernprinzipien des Gesetzes mit den Verträgen jedes Senators abgeglichen und Änderungen gefunden werden können, ohne die Kernpunkte oder die Moral des Gesetzes zu verletzen.
00:14:09Zudem können die erforderlichen Änderungen nach Priorität geordnet werden, um die Stimmenzahl zu maximieren, sodass man als Benutzer die Kompromisse selbst wählen kann.
00:14:23Das Neueste, das ich an diesem Zweig ausprobiert habe, betrifft die Frage, ob dies zu einer noch effizienteren Regierung führen kann, bei der jeder Wähler
00:14:38in einem Staat seinen eigenen Gesetzestext besitzt und man Gesetzentwürfe einreichen und die Übereinstimmung mit den tatsächlichen Wählern messen kann.
00:14:50Dazu habe ich NVIDIAs großartigen Datensatz von USA-Personas verwendet – 500 Personas pro Bundesstaat als repräsentativer Querschnitt der Bevölkerung.
00:15:03Basierend auf der Persona wurden Moral und Rechtsvertrag entworfen, um jeden gewünschten Gesetzentwurf gegen die einzelnen Bundesstaaten zu testen.
00:15:15Man kann messen, wie sehr die Leute das Gesetz mögen oder wie sehr es mit ihrer Moral übereinstimmt, und den Entwurf für die Bevölkerung optimieren.
00:15:25Zusammenfassend lässt sich sagen: Zumindest ist es ein ziemlich unterhaltsames Spiel. Ich bin voreingenommen, aber es macht großen Spaß, verschiedene Themen auszuprobieren, seine Moral einzugeben und nach Widersprüchen zu suchen.
00:15:40Oft wirft das spannende Fragen auf. Sobald man diese Nuancen hinzufügt, finden die Agenten keine Widersprüche mehr, und man hat ein konsistentes, nuanciertes moralisches System.
00:15:56Mich interessiert jedoch, ob es echte Anwendungen für dezentrale oder bessere Verträge gibt und ob Gesetzgeber damit Gesetze einem Stresstest unterziehen können, um bessere und repräsentativere Gesetze für die Menschen im Wahlkreis zu schreiben.
00:16:19Dieser QR-Code führt zum Senatssimulator – ich ermutige Sie zum Ausprobieren. Der andere führt zu meiner Website mit dem vollständigen Loophole-GitHub. Bitte spielen Sie damit und forken Sie es, ich freue mich über Mitwirkende. Vielen Dank.
00:16:49Vielen Dank.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기