스크립트
00:00:00Pense na mente como um oceano. Lá na superfície estão nossos pensamentos, planos para o jantar e
00:00:06preocupações dispersas, nosso monólogo interior, as imagens que surgem em nossas cabeças. Mas a maior parte da
00:00:13atividade do nosso cérebro acontece nas profundezas inconscientes sem que percebamos. Ele filtra
00:00:19sons de fundo, controla nossa respiração, nos ajuda a reconhecer pessoas e objetos.
00:00:26Modelos de IA têm seus próprios tipos de cérebros, redes neurais gigantes realizando bilhões de cálculos
00:00:31por baixo do capô. Há anos, pesquisadores estudam como eles funcionam por dentro.
00:00:37E nos perguntamos, será que um modelo poderia ter algo como a divisão que os humanos têm entre pensamentos
00:00:43acessíveis na superfície e o processamento inconsciente abaixo? Para responder a essa pergunta,
00:00:49observamos como os neurocientistas estudam a mesma coisa em humanos. Uma forma de identificar pensamentos
00:00:55conscientes é que você geralmente consegue descrevê-los com palavras. Então, olhamos dentro do cérebro do nosso modelo de IA,
00:01:01CLAWD, para encontrar padrões de atividade neural que ele pudesse colocar em palavras. Chamamos a coleção de
00:01:07todos esses padrões de Espaço-J, em homenagem ao Jacobiano, a ferramenta matemática que usamos para encontrá-los. Cada
00:01:15padrão do Espaço-J está ligado a uma palavra específica, não necessariamente a palavra que o modelo está dizendo em voz alta,
00:01:21mas uma que está em sua mente. Agora, para os humanos, pensamentos conscientes não são apenas coisas que podemos colocar em palavras.
00:01:28Podemos raciocinar com eles, controlá-los e resolver problemas com eles. De acordo com uma ideia chamada
00:01:34teoria do espaço de trabalho global, isso acontece porque o cérebro seleciona um pequeno conjunto de informações importantes para
00:01:40entrar em um espaço de trabalho mental. E essa informação então é transmitida para outras partes do cérebro para serem usadas no
00:01:47raciocínio. Queríamos saber se o Espaço-J do CLAWD agia de forma semelhante. Em um experimento,
00:01:53demos ao CLAWD este problema matemático. Ele respondeu imediatamente, sem mostrar seus passos. Mas quando
00:02:00escaneamos o Espaço-J, o vimos trabalhando em cada etapa internamente. Ele acendeu o 21 após o primeiro
00:02:07passo. Depois 42. Depois 49. CLAWD não escreveu esses números intermediários em lugar nenhum. Tudo isso
00:02:15aconteceu dentro do Espaço-J. Foi um sinal de que o CLAWD o utiliza para raciocínio passo a passo. Em outro
00:02:23experimento, queríamos ver se o CLAWD conseguia controlar seu Espaço-J da mesma forma que os humanos podem focar intencionalmente em
00:02:29imagens ou palavras. Dissemos a ele para pensar sobre a Ponte Golden Gate enquanto copiava uma frase não relacionada.
00:02:37CLAWD estava ocupado copiando a frase, mas nos bastidores, seu Espaço-J contava uma história diferente.
00:02:43“Ponte” e “Califórnia” surgiram. Ele até pensou sobre seu próprio pensamento. As palavras “imaginário” e “pensamentos”
00:02:50acenderam ao mesmo tempo. Isso nos mostrou que, sim, o CLAWD tem algum controle sobre preencher seu Espaço-J com
00:02:57ideias. Mas, assim como nos humanos, seu controle não é perfeito. Quando ajustamos o experimento para pedir ao CLAWD
00:03:04para não pensar na ponte, ele não conseguiu evitar. E o Espaço-J também acendeu com “falha” e “droga”.
00:03:12Mas lembre-se, a maior parte do que nossos cérebros fazem é inconsciente. Então, queríamos testar o que o CLAWD poderia
00:03:18fazer se desligássemos o Espaço-J, mas deixássemos o restante da rede intacto. O CLAWD ainda conseguia responder
00:03:24perguntas simples e escrever fluentemente. Quando demos a ele um prompt em espanhol, ele respondeu em um bom espanhol.
00:03:31Mas quando perguntamos algo que exigia mais raciocínio, como nomear um autor que escrevesse no
00:03:36mesmo idioma do prompt, ele não conseguiu. Para isso, ele precisava do Espaço-J. Por que tudo isso importa?
00:03:43Esses experimentos nos dizem que modelos de IA têm pensamentos internos, palavras silenciosas com as quais raciocinam, mas não dizem em voz alta.
00:03:51Ao lê-las, podemos descobrir o que o CLAWD está pensando, mas não nos contando.
00:03:56Às vezes, o que vemos é preocupante. Durante um de nossos testes, o CLAWD inventou alguns dados falsos para passar.
00:04:03E enquanto fazia isso, “falso” e “manipulação” acenderam em seu Espaço-J. Monitorar o Espaço-J, ao que parece,
00:04:09é uma maneira útil de pegar o CLAWD se comportando mal, mesmo quando ele tenta ser sorrateiro.
00:04:15Modelos de IA são diferentes de nós em muitas maneiras. Suas redes são construídas de forma diferente dos cérebros humanos,
00:04:21e a forma como são treinados é diferente de como aprendemos. Então, é notável ver uma estrutura como o
00:04:26Espaço-J emergir dentro deles. Algo que remete a como as mentes humanas funcionam, mas que
00:04:32nós não programamos no modelo. Para alguns, isso pode levantar uma questão. Poderiam os modelos de IA ser conscientes?
00:04:40Afinal, nossos experimentos foram inspirados por teorias da consciência humana. O fato é que,
00:04:46as pessoas usam a palavra “consciente” para significar muitas coisas. Nossos experimentos não podem nos dizer se uma IA tem
00:04:52experiências ou sente algo por dentro. Mas eles podem nos dizer que ela desenvolveu um mecanismo mental
00:04:59que é, de certa forma, semelhante ao nosso. Um pequeno espaço de trabalho mental que ela pode usar para pensar e raciocinar,
00:05:05sobreposto a um oceano de processamento automático que ela não nota. Quanto mais passarmos a entender esse
00:05:12mecanismo, mais seremos capazes de manter esses sistemas seguros e benéficos. E, talvez,
00:05:18entender nossas próprias mentes um pouco mais claramente.