Brecha: Agentes Adversariais Para Testar a Sua Moralidade — Brendan Rappazzo, Morgan Stanley
AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Vou falar sobre o meu projeto Loophole. Sou pesquisador de aprendizado de máquina na Morgan
00:00:17Stanley, mas isso não tem nada a ver com a Morgan Stanley. É apenas um projeto de código aberto que
00:00:23venho construindo por diversão. Para dar uma visão geral para começar, é basicamente um jogo que
00:00:30você pode jogar, construído sobre uma estrutura de agentes adversariais. Você especifica sua moral, um
00:00:37agente codifica isso em um sistema legal, e então esses dois agentes adversariais tentam encontrar
00:00:42contradições na sua moral. E ultimamente tenho construído várias extensões sobre ele. Mas eu
00:00:49queria, sabe, começar com a história de origem e como tive essa ideia. E isso
00:00:56realmente começou, sabe, há muito tempo eu enviei meu DNA para o 23andMe para um teste de ancestralidade. E eu
00:01:05vinha ouvindo sobre, sabe, mais recentemente como as amostras de DNA podem ser usadas, é claro, para ajudar a resolver
00:01:11crimes e toda essa parte de forense e casos antigos. E eu estava pensando em como eu havia optado por não participar
00:01:17de tudo porque, sabe, eu tinha medo desse tipo de declive escorregadio e de como meu DNA seria usado.
00:01:26Mas, sabe, existem certos casos com os quais eu concordaria. E é meio interessante. Eu estava
00:01:31pensando, tipo, sabe, se alguém pudesse me apresentar caso a caso, sabe, vamos usar seu DNA para
00:01:37vender, sabe, ajudar a resolver este caso antigo ou este assassinato, eu poderia dizer sim ou não. E eu sei onde
00:01:43está a definição e a nuance da minha moral. E, mas, sabe, é claro, enumerar tudo isso
00:01:51caso a caso é realmente proibitivo em termos cognitivos. Tipo, não há uma boa maneira de fazer isso
00:01:58atualmente. E então pensei, de forma mais ampla, que há muitas analogias com o
00:02:04sistema legal como um todo. Então, sabe, uma maneira de pensar sobre o que é um sistema legal em nossa sociedade
00:02:10é realmente apenas uma forma de tentarmos codificar nossas próprias crenças morais. E acho que, de maneira semelhante,
00:02:17encontrar a verdadeira nuance da nossa moral e o que a lei deveria ser é uma tarefa de tradução
00:02:23muito difícil. E acho que muitas vezes acabamos errando por ser genéricos demais porque, sabe,
00:02:30encontrar essa nuance é realmente difícil. E se você tentar ter uma tradução perfeita, isso pode levar
00:02:36a esses tipos de casos limite estranhos ou modos de falha estranhos. E eu até acho que, de igual para igual, quando
00:02:42nos relacionamos politicamente uns com os outros, muitas vezes as divergências são mais sobre brigar por
00:02:48valores centrais com os quais realmente não discordamos, em vez de explorar os pontos cheios de nuances da nossa moral.
00:02:57E acho que, seguindo esse exemplo legal mais amplo, acho que no, sabe,
00:03:02sistema de direito consuetudinário inglês, é por isso que dependemos tanto da jurisprudência, porque sabemos que
00:03:09encontrar essa nuance e esses limites sutis é difícil. E por isso contamos com julgamentos inteligentes para
00:03:16interpretar e aplicar a lei corretamente. E, claro, mesmo com a Suprema Corte,
00:03:22as coisas podem subir de instância e podemos decidir se uma lei é válida ou não.
00:03:28E então essa era a ideia, tipo: você pode pegar sua moral e fazer esse tipo de
00:03:34geração sintética de jurisprudência? Então, sabe, isso é exaustivo de fazer manualmente, mas parece que a
00:03:42nova geração de LLMs finalmente é inteligente o suficiente para fazer esse tipo de raciocínio moral de alto nível.
00:03:48E esse foi o ponto de partida para este jogo. E eu só quero apresentar a vocês
00:03:55o lançamento inicial do jogo, a configuração, como funciona, e também falar sobre alguns dos diferentes
00:04:00ramos que tenho construído sobre este projeto de código aberto, porque acho que ele pode seguir
00:04:05direções interessantes. E, em alto nível, como o jogo funciona é você com linguagem natural,
00:04:12e tudo isso acontece, é como se fosse um jogo baseado em terminal, você especifica sua moral. E pode ser
00:04:19sua moral geral ou talvez sobre um assunto específico. E então há um agente que pega essa moral
00:04:24e redige um juridiquês muito rico, um sistema legal codificado. E então ele opera nesse loop
00:04:31onde um agente é instruído a tentar encontrar brechas no seu sistema, algo que seja
00:04:38imoral, mas legal. E outro recebe instruções para encontrar abusos, ou seja, coisas que são moralmente corretas, mas
00:04:45ilegais dado o seu sistema. E um agente de julgamento analisa a sua moral, o código legal produzido
00:04:52e esses exemplos sintéticos de jurisprudência. Primeiro, ele vê se pode fazer um auto-patch, como se
00:04:58o rascunho original do seu código legal fosse uma tradução imperfeita e não houvesse realmente
00:05:05uma contradição, e ele pudesse apenas fazer essa atualização automaticamente. Ou talvez seja uma
00:05:10subespecificação da sua moral ou algum tipo de contradição na sua moral. E nesse caso,
00:05:16ele apresenta isso a você como usuário para ser o juiz e tomar uma decisão.
00:05:22Ainda está rodando para você? Para mim sumiu.
00:05:26Então, eu sei que, se você, espero que se tiver curiosidade sobre o jogo, vá jogá-lo. Está tudo no
00:05:31GitHub, mas eu só queria mostrar alguns exemplos. E como é muito texto, trata-se mais de
00:05:37mostrar o formato de entrada e saída. Então, é assim que você forneceria sua entrada e, voltando ao exemplo do DNA, você poderia, sabe,
00:05:44Ok. Então, eu sei que, se você, espero que se tiver curiosidade sobre o jogo, vá jogá-lo, está tudo no GitHub, mas eu só queria mostrar alguns exemplos e isso é muito texto, então é mais sobre mostrar o formato da entrada e da saída. Então, é assim que você forneceria sua entrada e, voltando ao exemplo do DNA, você poderia, sabe, especificar alguns princípios morais.
00:06:10E então o sistema legal codificado, novamente, olhando apenas para o formato, tem um preâmbulo com muito juridiquês, artigos, seções, tentando realmente ser escrito em linguagem jurídica precisa.
00:06:24E então esses diferentes tipos de jurisprudência sintética são sugeridos. Então, neste caso, fala sobre uma brecha que foi encontrada em que uma companhia de seguros
00:06:34treinou um modelo preditivo de aprendizado de máquina, não com base no seu DNA, mas em artefatos do DNA. E diz, sabe, que isso é na verdade imoral, mas atualmente legal dado o seu sistema.
00:06:46E neste caso, constatou-se que era possível fazer esse tipo de auto-patch. E então você obtém essa diferença estilo git do seu sistema legal original e a diferença que teve de ser feita para garantir,
00:06:58sabe, que isso fosse consistente com a sua moral. E este é um exemplo de abuso. E neste caso, descobriu-se que não era possível fazer o auto-patch. Então fala sobre,
00:07:08sabe, alguém envia seu DNA para pesquisa genética, mas o pesquisador descobre que essa pessoa tem um distúrbio genético raro, mas tratável.
00:07:17Mas atualmente, a sua moral diz que isso não deveria ser permitido, que eles poderiam revelar essa doença à pessoa que fez o envio. E isso foi levado ao usuário, a mim, para tomar uma decisão. E da mesma forma, quando você toma a decisão, você obtém esse sistema legal corrigido.
00:07:33E então, sabe, é só um jogo divertido. Eu postei no Twitter e compartilhei em código aberto no GitHub. E para mim, pelo menos, foi de longe a postagem mais viral que já tive. E isso me fez pensar que muitas pessoas acharam divertido.
00:07:50Você podia testar os limites da sua moral, ver se tinha alguma contradição interessante. Mas também me fez pensar, será que há algo mais aqui? Tipo, poderia ser,
00:07:59sabe, ter implicações mais práticas ou de maior alcance? E então vou falar sobre três ramos diferentes na exploração do primeiro, saindo da área jurídica e pensando em algo mais prático: uma forma automatizada de criar constituições para chatbots ou, na verdade, para agentes em geral, onde, digamos que você seja uma empresa e queira ter um agente ou chatbot voltado para o cliente,
00:08:29e queira que ele siga um código moral, mas também tenha diretrizes sobre o que deve e o que não deve falar. Em um dos ramos, formulei isso de modo que você, da mesma forma, escreva sua moral, escreva o que o chatbot deve e não deve discutir. E então ele tenta escrever esse prompt de sistema codificado, e você tem esses agentes adversariais tentando fazê-lo falar sobre algo que não deveria ou recusar falar sobre algo que deveria.
00:08:56E eu vejo isso como uma analogia ou método análogo ao GEPA, mas voltado para a construção desses prompts de sistema codificados.
00:09:03O segundo caso de uso que me interessa particularmente é pensar nisso como uma maneira de fazer contratos mais ad hoc ou descentralizados. Penso que, num caso simples, por exemplo, você pode especificar como deseja que seus dados ou privacidade sejam tratados online, e passar por esse jogo adversarial para obter um sistema legal codificado de como quer que seus dados sejam manuseados.
00:09:30E se você for, sabe, digamos que a Apple lance novos termos de serviço ou algo assim, você pode executar as contradições entre o seu sistema legal e os termos de serviço da Apple e destacar quaisquer contradições interessantes ou casos sintéticos em que isso geraria uma diferença entre o que sua moral e seus desejos determinam e o que a empresa está fazendo.
00:09:57E, claro, se for uma grande empresa, talvez você não consiga mudar nada, não é uma negociação, mas pelo menos você fica mais bem informado sobre o contrato que está assinando.
00:10:08Mas também penso que, num cenário mais descentralizado, se você está tentando fazer contratos sem alguma autoridade central para aplicá-los, e está tentando firmar contratos entre diferentes países,
00:10:23pensar se você pode especificar sua moral e como deseja interagir — talvez seja apenas um trabalho contratado, como você quer que seu trabalho seja pago e a moralidade em torno disso —, a outra parte pode fazer o mesmo.
00:10:40E então ambos obtêm esse contrato codificado e testado contra falhas, podendo encontrar divergências, caso existam, e trazê-las à tona antes de concordar, gerando mais confiança no contrato como um todo.
00:10:55E o último ponto, talvez mais aspiracional, é pensar em um governo mais inteligente ou mais eficiente.
00:11:07Acho que haveria vários problemas de privacidade e logísticos, mas ignorando-os por enquanto e pensando em grande escala,
00:11:15para eleitores ou constituintes, isso poderia ser uma forma muito interessante: se você define sua moral e tem esse código legal testado contra falhas, qualquer novo projeto de lei ou político que surja,
00:11:28você poderia confrontar seu contrato com o deles e revelar quais são os pontos de discordância ou aspectos interessantes que parecem imorais para você ou representam uma contradição.
00:11:41Também acho que, na nossa relação mútua, todos nós temos muitas nuances na forma como sentimos as coisas, e esta é uma maneira de alcançar essa nuance, em vez de discutir apenas valores,
00:11:57sendo que muitas vezes os valores não estão em contradição.
00:12:01E de forma um pouco mais prática para os legisladores, você pode imaginar que, se quiser propor um projeto de lei e puder simular todos os outros legisladores em um órgão legislativo,
00:12:15poderá testar o projeto exaustivamente antes de enviá-lo.
00:12:18E o terceiro ramo que tenho desenvolvido neste projeto foi tentar fazer isso para o Senado dos EUA.
00:12:24O que fiz foi pedir primeiro ao Claude que analisasse todos os senadores atuais dos EUA, olhasse o histórico de votações de cada um e qualquer outra informação pública, construísse o sistema moral deles e o executasse pelo processo do Loophole para obter um código legal codificado.
00:12:43E então, nesse sistema, você pode pegar qualquer projeto de lei atual que esteja sendo proposto, ou até propor o seu próprio, enviá-lo e pedir ao Claude que simule como cada senador votaria.
00:12:56Aqui você pode ver um panorama de alguns senadores, para onde estão inclinados e o raciocínio por trás do voto.
00:13:07E acho interessante pensar em ver como as pessoas votariam em uma proposta legislativa.
00:13:16Mas isso também se torna, dentro do tema da conferência, seu próprio domínio ou loop verificável.
00:13:22E você pode pensar em otimizar o projeto de lei para obter uma supermaioria ou o que for necessário para aprová-lo.
00:13:30Neste caso, o projeto de lei de Medicare que eu estava testando começou com uma votação de 50 a 50, e o sistema encontrou maneiras de refinar a linguagem do projeto para que ele fosse aprovado com 52 votos.
00:13:45Este é um exemplo de como o sistema consegue encontrar os princípios fundamentais do projeto de lei, testá-lo contra o contrato de cada senador e verificar se há alguma forma de alterar a redação sem violar esses princípios ou a moral central do projeto, realizando esses ajustes automaticamente.
00:14:09Ele também pode classificar por ordem de prioridade as mudanças necessárias para maximizar os votos, permitindo que você, como usuário, escolha as concessões dessa forma.
00:14:23E a última coisa que venho testando mais recentemente com este ramo é analisar, de forma ainda mais ampla, se isso pode levar a um governo mais eficiente, onde cada constituinte
00:14:38em um estado ou distrito possui seu próprio código legal, permitindo enviar qualquer projeto de lei e medir o nível de concordância entre os eleitores reais.
00:14:50Para isso, usei o ótimo conjunto de dados de personas dos EUA da NVIDIA, pegando 500 personas por estado para representar bem a população estadual.
00:15:03Fiz o mesmo processo: com base na persona, redigi a moral deles, o contrato legal correspondente e, então, peguei qualquer projeto de lei de interesse e o testei contra cada estado.
00:15:15Você também pode medir o quanto as pessoas gostam desse projeto ou o quanto ele está alinhado com a moral delas, fazendo essa otimização voltada para a população.
00:15:25Para concluir, no mínimo, acho que é um jogo bem divertido — sou suspeito para falar —, mas é muito legal testar coisas com as quais você se importa, inserir sua moral e ver se há contradições.
00:15:40Muitas vezes, isso levanta perguntas muito interessantes e, uma vez que você fornece essa nuance, os agentes não conseguem mais encontrar contradições, permitindo que você sinta que possui um sistema moral consistente e matizado.
00:15:56Mas tenho interesse em explorar se há aplicações reais para contratos descentralizados ou melhores e, talvez, até para legisladores testarem seus projetos de lei e escreverem leis melhores e mais representativas para os cidadãos de seus distritos.
00:16:19Este QR code direciona para o simulador do Senado, então incentivo vocês a jogarem se tiverem interesse. O outro leva ao meu site, que contém o repositório completo do Loophole no GitHub. Por favor, brinquem com ele, façam um fork. Adoraria ter outros contribuidores. Obrigado.
00:16:49Obrigado.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기