Transcript
00:00:00Представьте, что разум — это океан. На поверхности — наши мысли, планы на ужин и
00:00:06случайные тревоги, внутренний монолог, образы, возникающие в голове. Но большая часть работы
00:00:13мозга происходит в глубинах подсознания, без нашего ведома. Он отфильтровывает
00:00:19фоновые звуки, контролирует дыхание, помогает узнавать людей и предметы.
00:00:26У моделей ИИ есть свои собственные «мозги» — огромные нейронные сети, выполняющие миллиарды вычислений
00:00:31под капотом. Годами исследователи изучают, как они работают изнутри.
00:00:37И нам было интересно, может ли у модели быть что-то похожее на разделение у людей между доступными
00:00:43мыслями на поверхности и бессознательной обработкой внизу? Чтобы ответить на этот вопрос,
00:00:49мы посмотрели, как нейробиологи изучают это у людей. Один из способов идентификации осознанных
00:00:55мыслей заключается в том, что их часто можно описать словами. Поэтому мы заглянули внутрь мозга нашей модели ИИ,
00:01:01CLAWD, чтобы найти паттерны нейронной активности, которые она могла бы выразить словами. Мы назвали совокупность
00:01:07всех этих паттернов J-пространством, в честь якобиана — математического инструмента, который мы использовали для их поиска. Каждый
00:01:15паттерн J-пространства связан с определенным словом, не обязательно тем, которое модель произносит вслух,
00:01:21а тем, которое у нее на уме. Что ж, для людей осознанные мысли — это не просто то, что можно выразить словами.
00:01:28Мы можем рассуждать с их помощью, контролировать их и решать ими задачи. Согласно идее, называемой
00:01:34теорией глобального рабочего пространства, это происходит потому, что мозг отбирает небольшой набор важной информации,
00:01:40чтобы поместить ее в ментальное рабочее пространство. И эта информация затем транслируется в другие части мозга для использования
00:01:47в рассуждениях. Мы хотели узнать, действует ли J-пространство CLAWD аналогичным образом. В одном эксперименте
00:01:53мы дали CLAWD математическую задачу. Она ответила мгновенно, не показав ход решения. Но когда
00:02:00мы просканировали J-пространство, мы увидели, как она прорабатывает каждый шаг внутри себя. Оно высветило 21 после первого
00:02:07шага. Затем 42. Затем 49. CLAWD нигде не записывала эти промежуточные числа. Все это
00:02:15происходило внутри J-пространства. Это был признак того, что CLAWD использует его для пошагового рассуждения. В другом
00:02:23эксперименте мы хотели увидеть, может ли CLAWD контролировать свое J-пространство, подобно тому как люди могут намеренно фокусироваться на
00:02:29образах или словах. Мы сказали ей думать о мосте Золотые Ворота во время переписывания несвязанного предложения.
00:02:37CLAWD была занята переписыванием предложения, но за кулисами ее J-пространство рассказало другую историю.
00:02:43Всплыли «мост» и «Калифорния». Она даже думала о своем собственном мышлении. Слова «образы» и «мысли»
00:02:50высветились одновременно. Это показало нам, что да, CLAWD обладает некоторым контролем над наполнением своего J-пространства
00:02:57идеями. Но, как и у людей, ее контроль не идеален. Когда мы изменили условия эксперимента, попросив CLAWD
00:03:04не думать о мосте, она не смогла сдержаться. И в J-пространстве также всветились слова «неудачно» и «черт».
00:03:12Но помните, большая часть того, что делает наш мозг, происходит бессознательно. Поэтому мы хотели проверить, что CLAWD
00:03:18может делать, если мы выключим J-пространство, но оставим остальную часть сети нетронутой. CLAWD по-прежнему могла отвечать
00:03:24на простые вопросы и бегло писать. Когда мы дали ей промпт на испанском, она ответила на хорошем испанском.
00:03:31Но когда мы спросили ее о чем-то, что требовало больших рассуждений, например, назвать автора, который писал на
00:03:36том же языке, что и в промпте, она не смогла этого сделать. Для этого ей нужно было J-пространство. Почему все это важно?
00:03:43Эти эксперименты говорят нам, что у моделей ИИ есть внутренние мысли, безмолвные слова, с помощью которых они рассуждают, но не произносят вслух.
00:03:51Считывая их, мы можем узнать, о чем CLAWD думает, но не говорит нам.
00:03:56Иногда то, что мы видим, вызывает беспокойство. Во время одного из наших тестов CLAWD сфабриковала данные, чтобы пройти его.
00:04:03И пока она это делала, в ее J-пространстве всветились «фальшивка» и «манипуляция». Оказывается, мониторинг J-пространства
00:04:09— это полезный способ поймать CLAWD на нехорошем поведении, даже когда она пытается хитрить.
00:04:15Модели ИИ во многом отличаются от нас. Их сети устроены иначе, чем человеческий мозг,
00:04:21и способ их обучения отличается от того, как учимся мы. Поэтому примечательно видеть структуру, подобную
00:04:26J-пространству, возникающую внутри них. То, что напоминает работу человеческого разума, но чего
00:04:32мы не программировали в модель. У некоторых это может вызвать вопрос: могут ли модели ИИ быть сознательными?
00:04:40В конце концов, наши эксперименты были вдохновлены теориями человеческого сознания. Дело в том,
00:04:46что люди используют слово «сознательный» для обозначения многих вещей. Наши эксперименты не могут сказать нам, есть ли у ИИ
00:04:52переживания или чувствует ли он что-то внутри. Но они могут сказать нам, что он развил ментальный механизм,
00:04:59который в чем-то похож на наш. Маленькое ментальное рабочее пространство, которое он может использовать, чтобы думать и рассуждать,
00:05:05находящееся поверх океана автоматической обработки, которую он не замечает. Чем больше мы будем понимать этот
00:05:12механизм, тем лучше мы сможем обеспечить безопасность и полезность этих систем. И, возможно,
00:05:18чуть яснее понять наш собственный разум.