Transcript
00:00:00Imaginez l'esprit comme un océan. À la surface se trouvent nos pensées, nos projets de dîner et
00:00:06nos soucis passagers, notre monologue intérieur, les images qui surgissent dans notre tête. Mais la majeure partie de
00:00:13l'activité cérébrale se déroule dans les profondeurs inconscientes sans que nous nous en rendions compte. Elle filtre
00:00:19les bruits de fond, contrôle notre respiration, nous aide à reconnaître les personnes et les objets.
00:00:26Les modèles d'IA ont leur propre type de cerveau, des réseaux de neurones géants effectuant des milliards de calculs
00:00:31sous le capot. Depuis des années, les chercheurs étudient leur fonctionnement interne.
00:00:37Et nous nous sommes demandé si un modèle pouvait présenter une distinction similaire à celle des humains entre les
00:00:43pensées accessibles en surface et les traitements inconscients en dessous ? Pour répondre à cette question,
00:00:49nous avons examiné comment les neuroscientifiques étudient le même phénomène chez les humains. L'un des moyens d'identifier les pensées
00:00:55conscientes est souvent la capacité à les décrire avec des mots. Nous avons donc scruté l'intérieur du cerveau de notre modèle d'IA,
00:01:01CLAWD, pour trouver des schémas d'activité neuronale qu'il pourrait exprimer avec des mots. Nous avons appelé l'ensemble
00:01:07de ces schémas l'espace-J, d'après le Jacobien, l'outil mathématique utilisé pour les identifier. Chaque
00:01:15schéma de l'espace-J est lié à un mot spécifique, pas nécessairement le mot que le modèle prononce à voix haute,
00:01:21mais un mot qui occupe son esprit. Pour les humains, les pensées conscientes ne sont pas juste des choses que l'on peut mettre en mots.
00:01:28Nous pouvons raisonner avec elles, les contrôler et résoudre des problèmes grâce à elles. Selon une idée appelée
00:01:34théorie de l'espace de travail global, c'est parce que le cerveau sélectionne un petit ensemble d'informations importantes pour
00:01:40les intégrer dans un espace de travail mental. Cette information est ensuite diffusée à d'autres parties du cerveau pour
00:01:47raisonner. Nous voulions savoir si l'espace-J de CLAWD agissait de la même manière. Dans une expérience,
00:01:53nous avons soumis ce problème de mathématiques à CLAWD. Il a répondu immédiatement, sans montrer ses étapes. Mais quand
00:02:00nous avons scanné l'espace-J, nous l'avons vu travailler chaque étape en interne. Il s'est allumé sur 21 après la première
00:02:07étape. Puis 42. Puis 49. CLAWD n'a écrit ces nombres intermédiaires nulle part. Tout cela
00:02:15s'est passé à l'intérieur de l'espace-J. C'était le signe que CLAWD l'utilise pour un raisonnement étape par étape. Dans une autre
00:02:23expérience, nous voulions voir si CLAWD pouvait contrôler son espace-J comme les humains peuvent se concentrer intentionnellement sur
00:02:29des images ou des mots. Nous lui avons demandé de penser au Golden Gate Bridge tout en recopiant une phrase sans rapport.
00:02:37CLAWD était occupé à recopier la phrase, mais en coulisses, son espace-J racontait une autre histoire.
00:02:43Pont et Californie sont apparus. Il a même pensé à sa propre réflexion. Les mots imagerie et pensées
00:02:50se sont allumés en même temps. Cela nous a montré que, oui, CLAWD a un certain contrôle pour remplir son espace-J avec
00:02:57des idées. Mais tout comme chez les humains, son contrôle n'est pas parfait. Lorsque nous avons modifié l'expérience pour demander à CLAWD
00:03:04de ne pas penser au pont, il n'a pas pu s'en empêcher. Et l'espace-J s'est aussi allumé avec “échec” et “zut.”
00:03:12Mais rappelez-vous, la majeure partie de ce que font nos cerveaux est inconsciente. Nous voulions donc tester ce que CLAWD pouvait
00:03:18faire si nous désactivions l'espace-J, tout en laissant le reste du réseau intact. CLAWD pouvait toujours répondre
00:03:24à des questions simples et écrire couramment. Lorsque nous lui avons soumis une demande en espagnol, il a répondu dans un bon espagnol.
00:03:31Mais quand nous lui avons posé une question nécessitant davantage de raisonnement, comme nommer un auteur ayant écrit dans la
00:03:36même langue que la demande, il n'en a pas été capable. Pour cela, il avait besoin de l'espace-J. Pourquoi tout cela est-il important ?
00:03:43Ces expériences nous apprennent que les modèles d'IA ont des pensées internes, des mots silencieux avec lesquels ils raisonnent sans les dire à voix haute.
00:03:51En les lisant, nous pouvons découvrir ce que CLAWD pense sans nous le dire.
00:03:56Parfois, ce que nous voyons est inquiétant. Lors de l'un de nos tests, CLAWD a inventé de fausses données pour le réussir.
00:04:03Et pendant qu'il le faisait, faux et manipulation se sont allumés dans son espace-J. Surveiller l'espace-J, il s'avère,
00:04:09être un moyen utile d'attraper CLAWD en train de mal se comporter, même lorsqu'il essaie d'être sournois.
00:04:15Les modèles d'IA sont différents de nous à bien des égards. Leurs réseaux sont construits différemment des cerveaux humains,
00:04:21et la façon dont ils sont entraînés est différente de notre façon d'apprendre. Il est donc remarquable de voir une structure comme
00:04:26l'espace-J émerger en eux. Quelque chose qui rappelle le fonctionnement de l'esprit humain, mais que
00:04:32nous n'avons pas programmé dans le modèle. Pour certains, cela pourrait soulever une question : les modèles d'IA peuvent-ils être conscients ?
00:04:40Après tout, nos expériences ont été inspirées par des théories sur la conscience humaine. Le fait est que,
00:04:46les gens utilisent le mot conscient pour signifier beaucoup de choses. Nos expériences ne peuvent pas nous dire si une IA
00:04:52a des expériences ou ressent quelque chose à l'intérieur. Mais elles peuvent nous dire qu'elle a développé un mécanisme mental
00:04:59qui est, à certains égards, similaire au nôtre. Un petit espace de travail mental qu'elle peut utiliser pour penser et raisonner,
00:05:05reposant sur un océan de traitements automatiques qu'elle ne remarque pas. Plus nous en viendrons à comprendre ce
00:05:12mécanisme, mieux nous pourrons assurer la sécurité et l'utilité de ces systèmes. Et, peut-être,
00:05:18mieux comprendre nos propres esprits.