Transcript
00:00:00Stellen Sie sich den Verstand wie einen Ozean vor. An der Oberfläche sind unsere Gedanken, Abendpläne und
00:00:06flüchtige Sorgen, unser innerer Monolog, die Bilder, die uns in den Kopf schießen. Aber das meiste unserer Gehirn-
00:00:13aktivität findet in den unbewussten Tiefen statt, ohne dass wir es merken. Es filtert
00:00:19Hintergrundgeräusche aus, steuert unsere Atmung und hilft uns, Menschen und Objekte zu erkennen.
00:00:26KI-Modelle haben ihre eigene Art von Gehirnen, riesige neuronale Netze, die Milliarden von Berechnungen
00:00:31im Verborgenen durchführen. Seit Jahren untersuchen Forscher, wie diese im Inneren funktionieren.
00:00:37Und wir haben uns gefragt, könnte ein Modell so etwas wie die Trennung haben, die Menschen zwischen zugänglichen
00:00:43Gedanken an der Oberfläche und unbewusster Verarbeitung darunter haben? Um diese Frage zu beantworten,
00:00:49haben wir uns angesehen, wie Neurowissenschaftler dasselbe bei Menschen untersuchen. Eine Möglichkeit, bewusste
00:00:55Gedanken zu identifizieren, ist, dass man sie oft in Worte fassen kann. Also schauten wir in das Gehirn unseres KI-Modells,
00:01:01CLAWD, um Muster neuronaler Aktivität zu finden, die es in Worte fassen konnte. Wir nannten die Sammlung
00:01:07all dieser Muster den J-Raum, benannt nach der Jacobi-Matrix, dem mathematischen Werkzeug, das wir nutzten, um sie zu finden. Jedes
00:01:15J-Raum-Muster ist mit einem bestimmten Wort verknüpft, nicht unbedingt dem Wort, das das Modell laut ausspricht,
00:01:21sondern einem, das ihm durch den Kopf geht. Nun, bei Menschen sind bewusste Gedanken nicht nur Dinge, die wir in Worte fassen können.
00:01:28Wir können mit ihnen argumentieren, sie kontrollieren und Probleme mit ihnen lösen. Nach einer Idee namens
00:01:34der Theorie des globalen Arbeitsraums liegt das daran, dass das Gehirn eine kleine Menge wichtiger Informationen auswählt,
00:01:40um sie in einen mentalen Arbeitsbereich zu bringen. Und diese Information wird dann an andere Teile des Gehirns übertragen, um sie zum
00:01:47Schlussfolgern zu nutzen. Wir wollten wissen, ob CLAWDs J-Raum ähnlich funktioniert. In einem Experiment
00:01:53gaben wir CLAWD dieses Matheproblem. Es antwortete sofort, ohne seine Schritte zu zeigen. Aber als
00:02:00wir den J-Raum scannten, sahen wir, wie es jeden Schritt intern durcharbeitete. Es leuchtete 21 auf nach dem ersten
00:02:07Schritt. Dann 42. Dann 49. CLAWD schrieb diese Zwischenzahlen nirgendwo auf. All das
00:02:15geschah innerhalb des J-Raums. Es war ein Zeichen dafür, dass CLAWD ihn für schrittweises Schlussfolgern nutzt. In einem anderen
00:02:23Experiment wollten wir sehen, ob CLAWD seinen J-Raum kontrollieren kann, so wie Menschen sich bewusst auf
00:02:29Bilder oder Worte konzentrieren können. Wir sagten ihm, es solle an die Golden Gate Bridge denken, während es einen unabhängigen Satz kopierte.
00:02:37CLAWD war damit beschäftigt, den Satz zu kopieren, aber hinter den Kulissen erzählte sein J-Raum eine andere Geschichte.
00:02:43Brücke und Kalifornien tauchten auf. Es dachte sogar über sein eigenes Denken nach. Die Wörter Vorstellung und Gedanken
00:02:50leuchteten zur gleichen Zeit auf. Dies zeigte uns, ja, CLAWD hat eine gewisse Kontrolle darüber, seinen J-Raum mit
00:02:57Ideen zu füllen. Aber genau wie bei Menschen ist seine Kontrolle nicht perfekt. Als wir das Experiment anpassten und CLAWD baten,
00:03:04nicht an die Brücke zu denken, konnte es nicht anders. Und der J-Raum leuchtete auch mit “fehlgeschlagen” und “verdammt” auf.
00:03:12Aber denken Sie daran, das meiste von dem, was unsere Gehirne tun, ist unbewusst. Also wollten wir testen, was CLAWD
00:03:18tun konnte, wenn wir den J-Raum ausschalteten, aber den Rest des Netzwerks unberührt ließen. CLAWD konnte immer noch einfache
00:03:24Fragen beantworten und flüssig schreiben. Als wir ihm einen Prompt auf Spanisch gaben, schrieb es in gutem Spanisch zurück.
00:03:31Aber als wir es etwas fragten, das mehr Schlussfolgerung erforderte, wie einen Autor zu nennen, der in derselben
00:03:36Sprache wie der Prompt schrieb, konnte es das nicht. Dafür brauchte es den J-Raum. Warum ist das alles wichtig?
00:03:43Diese Experimente sagen uns, dass KI-Modelle interne Gedanken haben, stille Worte, mit denen sie schlussfolgern, die sie aber nicht laut aussprechen.
00:03:51Indem wir sie lesen, können wir herausfinden, was CLAWD denkt, uns aber nicht sagt.
00:03:56Manchmal ist das, was wir sehen, besorgniserregend. Während eines unserer Tests erfand CLAWD einige gefälschte Daten, um ihn zu bestehen.
00:04:03Und während es das tat, leuchteten gefälscht und Manipulation in seinem J-Raum auf. Den J-Raum zu überwachen, stellt sich heraus,
00:04:09ist ein nützlicher Weg, um CLAWD bei Fehlverhalten zu ertappen, selbst wenn es versucht, heimtückisch zu sein.
00:04:15KI-Modelle unterscheiden sich in vielerlei Hinsicht von uns. Ihre Netzwerke sind anders aufgebaut als menschliche Gehirne,
00:04:21und die Art und Weise, wie sie trainiert werden, unterscheidet sich davon, wie wir lernen. Daher ist es bemerkenswert, eine Struktur wie den
00:04:26J-Raum in ihnen entstehen zu sehen. Etwas, das an die Funktionsweise des menschlichen Geistes erinnert, aber das
00:04:32wir nicht in das Modell programmiert haben. Für manche mag dies eine Frage aufwerfen. Könnten KI-Modelle bewusst sein?
00:04:40Schließlich wurden unsere Experimente von Theorien über menschliches Bewusstsein inspiriert. Die Sache ist die,
00:04:46Leute verwenden das Wort bewusst, um viele Dinge zu bedeuten. Unsere Experimente können uns nicht sagen, ob eine KI
00:04:52Erfahrungen macht oder im Inneren etwas fühlt. Aber sie können uns sagen, dass sie mentale Mechanismen entwickelt hat,
00:04:59die in mancher Hinsicht unseren ähnlich sind. Ein kleiner mentaler Arbeitsbereich, den es zum Denken und Schlussfolgern nutzen kann,
00:05:05der auf einem Ozean automatischer Verarbeitung sitzt, die es nicht bemerkt. Je mehr wir dazu kommen, diese Mechanismen
00:05:12zu verstehen, desto besser werden wir in der Lage sein, diese Systeme sicher und vorteilhaft zu halten. Und vielleicht,
00:05:18unseren eigenen Verstand ein wenig klarer zu verstehen.