Исследование моделей преобразования речи в речь в Google DeepMind — Валерия Ву Фон и Том Оуян, Google DeepMind

AAI Engineer
Computing/SoftwareConsumer Electronics

Transcript

00:00:00практически без шумов в изолированной среде, они происходят на ходу, в поезде, пока
00:00:04вы идете на прогулку, и именно такие возможности мы хотим предоставить с помощью
00:00:08модели речевого ввода-вывода. И наконец, еще одна вещь, которая нас очень радует, — это не просто голосовой вывод, но и мультимодальный
00:00:15вывод. Мы верим, что настоящий рубеж разговорного ОИИ (AGI)
00:00:20также потребует визуального присутствия. Поэтому мы рады запустить нашу первую пилотную демо-версию с Citi в Cloud Next,
00:00:26которая поддерживает настраиваемые аватары в реальном времени, и вы можете персонализировать что угодно: от
00:00:33гиперреалистичного человека до мультяшной внешности и всего, что между ними. На базе той же
00:00:38модели речевого ввода-вывода, как мы уже показывали, она обеспечивает синхронизацию губ на разных языках с низкой задержкой
00:00:43и действительно плавный непрерывный разговор с визуальным присутствием. Так что позвольте мне
00:00:48показать вам демо, которое также объединяет нашу диаграмму Венна, и то, что нас во всем этом радует —
00:00:54это напоминает мне о фонде на обучение моей дочери. Как у нас с этим дела?
00:01:00У вас все отлично, Джексон. Я также нашла новую возможность, которая поможет вам достичь цели еще быстрее.
00:01:06О, я вижу, Лиза только что присоединилась к вам. Привет, Лиза! Она, наверное, так рада своему поступлению в колледж.
00:01:12Поздравляю, замечательно видеть, как ваши цели по накоплениям воплощаются в жизнь.
00:01:16Отлично, это хорошие новости. Я всегда шучу, что аудио пользователя на испанском хуже, чем аудио самой модели, но... это просто чтобы показать, как наша диаграмма Венна, объединяющая
00:01:34мультимодальность на входе и выходе, вызовы инструментов для извлечения релевантных примеров от пользователя,
00:01:40а также разговорную плавность с ИИ начинают постепенно объединяться в такого рода
00:01:45демо, и мы рады продолжать раздвигать границы этого. И в заключение, пожалуй,
00:01:50последняя мысль, которой мы хотели бы с вами поделиться, заключается в том, что мы верим: ОИИ не будут печатать на клавиатуре, на нем будут говорить,
00:01:57и чтобы на нем можно было говорить, многое должно работать вместе в единой,
00:02:01универсальной модели с поддержкой промптов, которая позволяет пользователю переключаться между всеми видами режимов разговора,
00:02:06которые мы рассматриваем — от перевода до выполнения действий, мозгового штурма и свободных рассуждений. И мы
00:02:12истинно верим в силу этих речевых моделей, способных обеспечить такое бесшовное переключение.
00:02:17Поэтому мы рады расширять границы в этом направлении. Так что, если вы заинтересованы или хотите узнать больше,
00:02:22пожалуйста, подходите к нам пообщаться, и большое спасибо всем за внимание.
00:02:26пожалуйста, подходите общаться с нами, и огромное спасибо вам за то, что при пришли
00:02:46вам
00:02:56Спасибо.

Key Takeaway

Разговорный общий искусственный интеллект реализуется через универсальную модель речевого ввода-вывода с поддержкой промптов, которая обеспечивает настраиваемые аватары в реальном времени с синхронизацией губ на разных языках и бесшовное переключение между режимами от перевода до выполнения действий.

Highlights

  • Первая пилотная демо-версия модели речевого ввода-вывода с поддержкой настраиваемых аватаров в реальном времени запускается с Citi в Cloud Next.

  • Модель речевого ввода-вывода обеспечивает синхронизацию губ на разных языках с низкой задержкой для непрерывного разговора с визуальным присутствием.

  • Разговорный общий искусственный интеллект требует визуального присутствия с поддержкой персонализированных аватаров от гиперреалистичных людей до мультяшных внешностей.

  • Универсальная модель речевого ввода-вывода с поддержкой промптов объединяет мультимодальность на входе и выходе, вызовы инструментов и разговорную плавность.

Timeline

Мультимодальные возможности речевого ввода-вывода и аватары в реальном времени

  • Модели речевого ввода-вывода функционируют в реальных условиях вне изолированных сред.
  • Первая пилотная демо-версия с Citi в Cloud Next поддерживает настраиваемые аватары в реальном времени.
  • Аватары варьируются от гиперреалистичных людей до мультяшных внешностей.

Разговорный общий искусственный интеллект требует визуального присутствия в дополнение к голосовому выводу. Модель речевого ввода-вывода обеспечивает синхронизацию губ на разных языках с низкой задержкой для плавного непрерывного разговора. Демонстрация системы иллюстрирует достижение целей по накоплениям на примере пользователей Jackson и Lisa.

Интеграция диаграмм Венна и универсальные модели речевого взаимодействия

  • Диаграмма Венна объединяет мультимодальность на входе и выходе, вызовы инструментов и разговорную плавность.
  • Будущий общий искусственный интеллект использует речевой ввод вместо печати на клавиатуре.
  • Единая универсальная модель с поддержкой промптов позволяет переключаться между переводом, выполнением действий, мозговым штурмом и свободными рассуждениями.

Системы речевого ввода-вывода объединяют несколько компонентов взаимодействия в единую архитектуру. Универсальная модель поддерживает бесшовное переключение между различными разговорными режимами для выполнения пользовательских задач.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video