Исследование моделей преобразования речи в речь в Google DeepMind — Валерия Ву Фон и Том Оуян, Google DeepMind
AAI Engineer
Computing/SoftwareConsumer Electronics
Transcript
00:00:00практически без шумов в изолированной среде, они происходят на ходу, в поезде, пока
00:00:04вы идете на прогулку, и именно такие возможности мы хотим предоставить с помощью
00:00:08модели речевого ввода-вывода. И наконец, еще одна вещь, которая нас очень радует, — это не просто голосовой вывод, но и мультимодальный
00:00:15вывод. Мы верим, что настоящий рубеж разговорного ОИИ (AGI)
00:00:20также потребует визуального присутствия. Поэтому мы рады запустить нашу первую пилотную демо-версию с Citi в Cloud Next,
00:00:26которая поддерживает настраиваемые аватары в реальном времени, и вы можете персонализировать что угодно: от
00:00:33гиперреалистичного человека до мультяшной внешности и всего, что между ними. На базе той же
00:00:38модели речевого ввода-вывода, как мы уже показывали, она обеспечивает синхронизацию губ на разных языках с низкой задержкой
00:00:43и действительно плавный непрерывный разговор с визуальным присутствием. Так что позвольте мне
00:00:48показать вам демо, которое также объединяет нашу диаграмму Венна, и то, что нас во всем этом радует —
00:00:54это напоминает мне о фонде на обучение моей дочери. Как у нас с этим дела?
00:01:00У вас все отлично, Джексон. Я также нашла новую возможность, которая поможет вам достичь цели еще быстрее.
00:01:06О, я вижу, Лиза только что присоединилась к вам. Привет, Лиза! Она, наверное, так рада своему поступлению в колледж.
00:01:12Поздравляю, замечательно видеть, как ваши цели по накоплениям воплощаются в жизнь.
00:01:16Отлично, это хорошие новости. Я всегда шучу, что аудио пользователя на испанском хуже, чем аудио самой модели, но... это просто чтобы показать, как наша диаграмма Венна, объединяющая
00:01:34мультимодальность на входе и выходе, вызовы инструментов для извлечения релевантных примеров от пользователя,
00:01:40а также разговорную плавность с ИИ начинают постепенно объединяться в такого рода
00:01:45демо, и мы рады продолжать раздвигать границы этого. И в заключение, пожалуй,
00:01:50последняя мысль, которой мы хотели бы с вами поделиться, заключается в том, что мы верим: ОИИ не будут печатать на клавиатуре, на нем будут говорить,
00:01:57и чтобы на нем можно было говорить, многое должно работать вместе в единой,
00:02:01универсальной модели с поддержкой промптов, которая позволяет пользователю переключаться между всеми видами режимов разговора,
00:02:06которые мы рассматриваем — от перевода до выполнения действий, мозгового штурма и свободных рассуждений. И мы
00:02:12истинно верим в силу этих речевых моделей, способных обеспечить такое бесшовное переключение.
00:02:17Поэтому мы рады расширять границы в этом направлении. Так что, если вы заинтересованы или хотите узнать больше,
00:02:22пожалуйста, подходите к нам пообщаться, и большое спасибо всем за внимание.
00:02:26пожалуйста, подходите общаться с нами, и огромное спасибо вам за то, что при пришли
00:02:46вам
00:02:56Спасибо.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video