Vacío legal: Agentes adversarios para poner a prueba tu moral — Brendan Rappazzo, Morgan Stanley
AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Voy a hablar sobre mi proyecto Loophole. En realidad soy investigador de aprendizaje automático en Morgan
00:00:17Stanley, pero esto no tiene nada que ver con Morgan Stanley. Es solo un proyecto de código abierto que
00:00:23he estado construyendo por diversión. Y para dar una idea general al principio, es básicamente un juego
00:00:30que puedes jugar, construido sobre un marco de agentes adversarios. Así que especificas tus morales, un
00:00:37agente las codifica en un sistema legal, y luego estos dos agentes adversarios intentan encontrar
00:00:42contradicciones en tus morales. Y últimamente he estado construyendo diferentes extensiones encima. Pero
00:00:49quería, ya sabes, empezar con la historia de origen y cómo se me ocurrió esta idea. Y esto realmente
00:00:56comenzó, hace mucho tiempo envié mi ADN a 23andMe para pruebas de ascendencia. Y seguía escuchando
00:01:05sobre, ya sabes, más recientemente cómo las muestras de ADN pueden usarse, por supuesto, para ayudar a resolver
00:01:11crímenes y toda esta forense y casos sin resolver. Y pensaba en cómo me había desvinculado de
00:01:17todo porque, ya sabes, tenía miedo de esa pendiente resbaladiza y de cómo se usaría mi ADN.
00:01:26Pero, ya sabes, hay ciertos casos con los que estaría bien. Y es un poco interesante. Pensaba,
00:01:31ya sabes, si alguien pudiera presentarme caso por caso, usaremos tu ADN para
00:01:37ayudar a resolver este caso sin resolver o este asesinato, podría decir que sí o que no. Y sé dónde está
00:01:43la definición y el matiz de mis morales. Y, pero, ya sabes, por supuesto, enumerar todo esto
00:01:51caso por caso es cognitivamente prohibitivo. No hay una buena manera de hacer esto
00:01:58actualmente. Y luego pensé, de forma más general, que hay muchas analogías con
00:02:04el sistema legal en su conjunto. Entonces, una forma de pensar qué es un sistema legal en nuestra sociedad
00:02:10es en realidad solo una forma en que intentamos codificar nuestras propias creencias morales. Y creo que de manera similar,
00:02:17encontrar el verdadero matiz de nuestras morales y lo que debería ser la ley es una tarea de traducción muy difícil
00:02:23difícil. Y a menudo creo que caemos en el error de ser demasiado generales porque, ya sabes,
00:02:30encontrar ese matiz es muy difícil. Y si intentas tener una traducción perfecta, puede llevar a
00:02:36este tipo de casos extraños o modos de fallo extraños. E incluso pienso que, entre pares, cuando
00:02:42nos relacionamos políticamente, muchas veces los desacuerdos son más bien pelear por
00:02:48valores fundamentales en los que realmente no discrepamos, en lugar de explorar los puntos más matizados de nuestra moral.
00:02:57Y creo que, siguiendo ese ejemplo legal más amplio, en el sistema de
00:03:02derecho consuetudinario inglés, es por eso que dependemos tanto de la jurisprudencia, porque sabemos que
00:03:09encontrar este matiz y estos límites matizados es difícil. Y por eso confiamos en un buen arbitraje para
00:03:16interpretar y aplicar la ley correctamente. Y, por supuesto, incluso con la Corte Suprema,
00:03:22las cosas pueden elevarse y podemos decidir si una ley es válida o no.
00:03:28Y esa era un poco la idea: ¿puedes tomar tus morales y hacer este tipo de
00:03:34generación de jurisprudencia sintética? Esto es abrumador de hacer a mano, pero parece que la
00:03:42nueva generación de LLM finalmente es lo suficientemente inteligente como para hacer este tipo de razonamiento moral de alto nivel.
00:03:48Y ese fue el punto de partida para este juego. Y solo quiero llevarlos a través de
00:03:55el lanzamiento inicial del juego, la configuración, cómo funciona, y también hablar de algunas de las diferentes
00:04:00ramas que he estado construyendo sobre este proyecto de código abierto porque creo que puede ir en direcciones
00:04:05interesantes. Y a un alto nivel, cómo funciona el juego es que tú, en lenguaje natural,
00:04:12y todo esto sucede, es como un juego basado en terminal, especificas tus morales. Y podría ser
00:04:19tus morales generales o tal vez sobre un tema específico. Y luego hay un agente que toma esas morales
00:04:24y redacta una jerga legal muy rica, un sistema legal codificado. Y luego opera en este bucle
00:04:31donde se le instruye a un agente que intente encontrar lagunas en tu sistema, es decir, algo que sea
00:04:38inmoral pero legal. Y a otro se le pide que encuentre extralimitaciones, cosas que en realidad son morales pero
00:04:45ilegales dado tu sistema. Y un agente juez observa tus morales, el código legal producido,
00:04:52y estos ejemplos de jurisprudencia sintética. Primero ve si puede auto-parchar, como si quizás el
00:04:58borrador original de tu código legal fuera una traducción imperfecta y no hubiera realmente
00:05:05una contradicción y pudiera hacer esta actualización automáticamente. O tal vez sea una
00:05:10subespecificación de tus morales o algún tipo de contradicción en ellas. Y en ese caso,
00:05:16te lo plantea a ti como usuario para que seas el juez y tomes una determinación.
00:05:22¿Sigue activo para ti? A mí me desapareció.
00:05:26Así que sé que, si tienes curiosidad sobre el juego, lo jugarás. Está todo en
00:05:31GitHub, pero solo quería mostrar algunos ejemplos. Y esto es mucho texto, así que se trata más de
00:05:37mostrar la forma de la entrada y la salida. Así es como proporcionarías tu entrada y volviendo al ejemplo del ADN podrías, ya sabes,
00:05:44De acuerdo. Sé que, si tienes curiosidad sobre el juego lo jugarás, está todo en GitHub, pero solo quería mostrar algunos ejemplos y esto es mucho texto, así que se trata más de mostrar la forma de la entrada y la salida. Así es como proporcionarías tu entrada y volviendo al ejemplo del ADN podrías, ya sabes, especificar un número de principios morales.
00:06:10Y luego el sistema legal codificado, de nuevo, mirando solo la forma, tiene un preámbulo con jerga muy legal, artículos, secciones, intentando realmente ser escrito en un lenguaje legal preciso.
00:06:24Y luego se sugieren los diferentes tipos de jurisprudencia sintética. En este caso, habla de un vacío legal que encontró donde una compañía de seguros
00:06:34entrenó un modelo predictivo de aprendizaje automático, no en tu ADN, sino en artefactos del ADN. Y dice que esto es inmoral, pero actualmente legal según tu sistema.
00:06:46Y en este caso, descubrió que podía hacer este auto-parcheo. Y luego obtienes una diferencia estilo git de tu sistema legal original. Y luego la diferencia que tuvo que hacer para asegurar
00:06:58que esto fuera consistente con tus morales. Y este es un ejemplo de extralimitación. Y en este caso, descubrió que no podía hacer el auto-parcheo. Así que habla de
00:07:08que alguien envía su ADN para investigación genética, pero el investigador descubre que tiene un trastorno genético raro pero tratable.
00:07:17Pero actualmente, tus morales dicen que esto no debería permitirse, que puedan revelar esta enfermedad a la persona que lo envía. Y esto se planteó al usuario, a mí, para tomar una decisión. Y de manera similar, cuando tomas la decisión, obtienes este sistema legal parcheado.
00:07:33Y entonces, es solo un juego divertido. Y lo publiqué en Twitter y lo compartí como código abierto en GitHub. Y para mí, al menos, fue de lejos la publicación más viral que he tenido. Y me hizo pensar que mucha gente dijo que era divertido.
00:07:50Podías someter tus morales a una prueba de estrés, ver si tienes contradicciones interesantes. Pero también me hizo pensar, ¿hay algo más aquí? ¿Podría esto
00:07:59tener implicaciones de mayor alcance o más prácticas? Así que hablaré de tres ramas diferentes explorando la primera, alejándonos del área legal y pensando de manera más práctica en una forma automática de hacer constituciones para chatbots o para agentes en general, donde, digamos que eres una empresa y quieres tener un agente o chatbot que atienda al cliente,
00:08:29y quieres que se adhiera a un código moral, pero también que haya cosas de las que hable y de las que no. En una rama lo he formulado para que tú, de manera similar, escribas tus morales, escribas de lo que el chatbot debe y no debe hablar. Y luego intenta escribir este mensaje de sistema codificado, y tienes a estos agentes adversarios intentando que hable de algo que no debería, o se niegue a hablar de algo que sí.
00:08:56Y lo veo como un método análogo a GEPA, pero dirigido a construir estos mensajes de sistema codificados.
00:09:03El segundo caso de uso que me interesa particularmente es pensar en ello como una forma de hacer contratos más ad hoc o descentralizados. Creo que en un caso simple, digamos que puedes especificar cómo quieres que se manejen tus datos o privacidad en línea, y puedes pasar por este juego adversarial para obtener este sistema legal codificado de cómo quieres que se manejen tus datos en línea.
00:09:30Y si vas a, digamos que Apple lanza nuevos términos de servicio o algo así, puedes ejecutar las contradicciones entre tu sistema legal y los términos de servicio de Apple y sacar a la luz cualquier contradicción interesante o casos sintéticos donde esto llevaría a una diferencia entre tus morales, lo que tú quieres y lo que la empresa está haciendo.
00:09:57Y ya sabes, en el caso de que sea una gran empresa, tal vez no puedas cambiar nada, no es una negociación, pero al menos puedes tener mejor información sobre el contrato que estás firmando.
00:10:08Pero también creo que en el caso de pensar de forma más descentralizada, si intentas tener contratos sin una autoridad central que los haga cumplir, e intentas hacer contratos entre diferentes países.
00:10:23Pensar en si puedes especificar tus morales y cómo quieres interactuar, tal vez sea trabajo contratado, cómo quieres que te paguen por tu trabajo y las diferentes morales que lo rodean, y la otra parte puede hacer lo mismo.
00:10:40Y luego ambos obtienen este contrato codificado probado bajo estrés y pueden encontrar los desacuerdos si los hay y sacarlos a la luz antes de acordar, y así pueden tener más confianza en el contrato en su conjunto.
00:10:55Y lo último, y quizás el ángulo más ambicioso, es pensar en un gobierno más inteligente o más eficiente.
00:11:07Creo que habría muchos problemas de privacidad y logísticos diferentes, pero ignorándolos por ahora y pensando en grande.
00:11:15Creo que para los votantes o constituyentes, esto podría ser una forma muy interesante si defines tus morales, tienes este código legal probado bajo estrés, y cualquier nuevo proyecto de ley o político que surja,
00:11:28podrías contrastar tu contrato con el de ellos y sacar a la luz cuáles son los casos en los que no estarías de acuerdo o puntos interesantes que te parezcan inmorales o una contradicción.
00:11:41También creo que, en relación mutua, todos tenemos muchos matices en la forma en que sentimos las cosas y esta es una forma de llegar a ese matiz en lugar de discutir solo sobre valores,
00:11:57lo cual, ya sabes, a menudo los valores no están en contradicción.
00:12:01Y luego, tal vez de manera más práctica para los legisladores, podrías imaginar que si quieres proponer un proyecto de ley y puedes tener una simulación de todos los demás legisladores en un cuerpo legislativo,
00:12:15podrías someterlo a una prueba de estrés antes de presentarlo.
00:12:18Y así, la tercera rama que he estado construyendo en este proyecto es que intenté hacer esto para el Senado de EE. UU.
00:12:24Y lo que hice fue primero hacer que Claude revisara a todos los senadores actuales de EE. UU. y analizara su historial de votaciones y cualquier otra cosa pública para construir su sistema moral, y luego lo pasé por el proceso de bucle para obtener un código legal codificado.
00:12:43Y en este sistema puedes tomar cualquier proyecto de ley actual que se esté proponiendo o incluso proponer el tuyo propio y enviarlo, y puedes hacer que Claude simule cómo votaría cada senador.
00:12:56Y aquí puedes ver un desglose de algunos senadores, hacia dónde se inclinan y el razonamiento detrás del voto.
00:13:07Y creo que es interesante pensar en ver cómo votaría la gente ante una propuesta de legislación.
00:13:16Pero esto también se convierte, acorde con el tema de la conferencia, en su propio dominio o bucle verificable.
00:13:22Y podrías pensar incluso en optimizar el proyecto de ley hacia conseguir una supermayoría o lo que necesites para que se apruebe.
00:13:30Y en este caso, este proyecto de ley de Medicare que estaba probando, descubrí que originalmente comenzó como una votación de 50/50 y encontró formas de optimizar el lenguaje del proyecto de ley para que se aprobara con 52 votos.
00:13:45Y creo que este es un ejemplo de cómo puede encontrar los principios básicos del proyecto de ley y probarlo contra el contrato de cada senador y ver si hay alguna forma de cambiar el lenguaje sin violar los principios o la moral básica del proyecto de ley y hacer esos auto-parches de esa manera.
00:14:09Y también puede ordenar por rango los cambios que tendrían que implementarse para maximizar los votos y tú, como usuario, puedes elegir las compensaciones de esa manera.
00:14:23Y lo último que he estado probando más recientemente con esta rama es observar, en un panorama aún más amplio, si esto puede llevar a un gobierno aún más eficiente donde tengas a cada constituyente
00:14:38en un estado o distrito con su código legal y puedas enviar cualquier proyecto de ley y medir el acuerdo entre los votantes reales.
00:14:50Y para esto tomé, NVIDIA tiene este gran conjunto de datos de personas de EE. UU., así que tomé 500 personas por estado y se supone que representan bien a la población del estado.
00:15:03Hice el mismo proceso de hacer que, dada la persona, redactaran sus morales, su contrato legal y luego tomar cualquier proyecto de ley que te interese y ejecutarlo contra cada estado.
00:15:15Y también puedes medir cuánto le gusta a la gente este proyecto de ley o cuánto está de acuerdo con sus morales y luego optimizar el proyecto de ley para la gente.
00:15:25Y para concluir, al menos creo que es un juego bastante divertido, soy parcial, pero es muy divertido probar diferentes cosas que te importan, poner tus morales y ver si hay contradicciones.
00:15:40A menudo planteará preguntas muy interesantes y una vez que proporcionas ese matiz, el juego, los agentes no podrán encontrar más contradicciones y puedes sentirte bien de tener un sistema moral consistente y matizado.
00:15:56Pero me interesa explorar si esto podría tener aplicaciones reales para contratos descentralizados o mejores, y quizás incluso para los legisladores como una forma de someter a prueba sus proyectos de ley y pensar en cómo escribir mejores leyes que sean mejores para la gente de su distrito o más representativas de lo que la gente de su distrito quiere.
00:16:19Y este código QR es para el simulador del Senado, así que te animo a que juegues si estás interesado. Y el otro es a mi sitio web, que tiene el Loophole completo en GitHub. Y por favor, juéguenlo, háganle fork. Me encantaría tener otros colaboradores. Gracias.
00:16:49Gracias.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기