"Меня зовут... меня зовут...": Лингвистическая карта для голосовых агентов — Мидам Ким, ServiceNow

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Итак, всем привет. Меня зовут Мидам Ким. Я ML-инженер в компании ServiceNow, и сегодня я
00:00:25расскажу о лингвистическом фреймворке для VoiceAI. Кратко о себе, чтобы вы
00:00:37понимали мой бэкграунд. Как я уже сказала, я ML-инженер в ServiceNow, но при этом
00:00:42я всю жизнь исследую речевую коммуникацию в реальных условиях. Мой
00:00:48девиз — «заниматься лингвистикой», и сегодня я хочу передать вам
00:00:54именно эту лингвистическую оптику. Слушайте, а вы сталкивались с сбоями в работе VoiceAI? Думаю,
00:01:05как и каждый из нас. Я приведу пример из личного опыта. Итак,
00:01:15бот спрашивает меня: «Не могли бы вы произнести ваше имя по буквам?» И я не торопясь начинаю диктовать
00:01:22свое имя: «Да, М-И-Д-А-М». А бот отвечает: «Уточняю, М-И-Д-А-Н?» На что я говорю: «Нет, М-И-Д-А-М».
00:01:40И тут я начинаю раздражаться все сильнее, потому что мое имя — М-И-Д-А-М, а не М-И-Д-А-Н. Затем он спрашивает: «Теперь назовите ваш номер счета». Я впадаю в замешательство. Что еще за номер счета? Пытаюсь найти эту информацию.
00:02:09Ищу нужные данные: «Так, какой именно? Должно быть...» И медленно начинаю диктовать номер счета по буквам и цифрам: «А-Х-4-5-1». Я делала паузы, потому что не привыкла читать такие непривычные номера, и вдруг бот перебивает меня. Он говорит: «Запись не найдена». И даже
00:02:14не попытавшись разобрать слова, снова просит повторить: «Пожалуйста, повторите». Я уже в стрессе. Бот снова: «Запись не найдена». Затем без всяких попыток просит повторить: «Не могли бы вы повторить?» Я окончательно выхожу из себя, а бот опять: «Не удалось найти вашу запись».
00:02:21Я надиктовываю: «А, Х, 4, 5, 1», делаю паузу, потому что не привыкла произносить
00:02:30такой странный номер, а бот меня перебивает и выдает: «Не удалось найти вашу
00:02:36запись». И, даже не попытавшись разобраться, снова просит произнести: «Не могли бы вы
00:02:42повторить?» В этот момент я невероятно раздражена и выливаю это: «Переведите
00:02:46меня на оператора, я больше не хочу с тобой общаться». К сожалению, на сегодняшний день это весьма
00:02:51типичный сценарий поведения голосового ИИ. Поэтому я
00:02:57хочу разобраться, как мы можем решить эту проблему с помощью лингвистики. Голосовой ИИ сейчас
00:03:06на подъеме, однако пользователи все еще часто предпочитают операторов-людей,
00:03:11а не голосовых агентов. Как же сгладить эту проблему? Но для начала: в чем же
00:03:19заключаются реальные сложности? Думаю, нам стоит обратиться к базовой системе,
00:03:25помогающей осмыслить сквозную архитектуру VoiceAI — к лингвистике. Как
00:03:35все мы прекрасно знаем, человеческое общение — это совместный процесс. Подобно
00:03:41тому, что происходит между нами прямо сейчас: я передаю вам звуки и слова, вы их
00:03:48слышите, и если это диалог, вы отвечаете своими звуками и
00:03:53словами. Тот самый постоянный обмен в процессе интеракции. И при этом
00:04:02мы непрерывно обрабатываем данные и обновляем свои ментальные модели. В этом и заключается
00:04:09суть совместной коммуникации людей. Я убеждена, что общение человека с голосовым
00:04:18ИИ также должно быть устроено по этому принципу. Ведь это
00:04:25единственный знакомый нам формат общения. Как вид, человечество
00:04:30эволюционировало тысячелетиями, выстраивая коммуникацию, и мы привыкли к определенным нормам.
00:04:35Того же самого мы ждем и от ботов. Давайте разберем сбойный сценарий моего разговора
00:04:45с голосовым агентом через призму этой концепции. Смотрите, у каждой из сторон есть каналы восприятия и речи.
00:04:53Я начинаю произносить имя по буквам, а бот распознает
00:05:04разницу между М и Н неверно. Это сбой модуля распознавания речи (STT) на этапе восприятия. Затем модуль синтеза речи (TTS) применяет
00:05:14к моему имени исключительно английские правила чтения: М-И-Д-А-М заменяется на М-И-Д-А-Н в американском
00:05:22варианте. Я сбита с толку, но пока проявляю снисходительность — подобное
00:05:29случается часто, даже с людьми. Ничего страшного. Но когда бот заговорил
00:05:36про номер счета, а я без понятия, что это за номер, замешательство нарастает. Тем не менее, я стараюсь подстроиться:
00:05:44нахожу код, начинаю его зачитывать, но распознавание речи некорректно считывает
00:05:52словесный блок. Меня обрывают на полуслове и перебивают. Это вызывает сильное
00:06:06раздражение. А когда от меня требуют повторить ровно то же самое, становится
00:06:14очевидно: бот совершенно не синхронизирует со мной ментальную модель. К тому же он максимально грубо даже не пытается
00:06:22использовать уточняющие вопросы — привычную для людей стратегию. Я не желаю продолжать этот
00:06:28разговор и прошу переключить на человека. Давайте вернемся к нашей схеме. Вот
00:06:38ключевые лингвистические элементы, которые мы ожидаем и успешно поддерживаем в диалоге людей.
00:06:47У нас есть канал восприятия (слух) и канал речи, а также составляющие:
00:06:52звуки, слова, взаимодействие и ментальная модель. Первый вопрос: насколько хорошо бот распознает
00:06:59речь пользователя? Сюда относятся соответствующие технические термины. Далее идет
00:07:09второй компонент на канале восприятия — слова. Понимает ли бот слова
00:07:17человека? Третий момент: умеет ли бот выдерживать правильную паузу, чтобы вступить в разговор? Это относится к диалоговому взаимодействию.
00:07:28Наконец, ментальная модель: считывает ли бот намерение пользователя при слуховом восприятии?
00:07:38Теперь перейдем к каналу речи. Здесь важна произносительная сторона (звуковой пласт),
00:07:43а также то, подбирает ли бот понятную для пользователя лексику.
00:07:53В блоке взаимодействия: своевременно ли бот подает реплики? И последнее: предоставляет ли он
00:08:01именно ту информацию, которая действительно нужна человеку?
00:08:05Существует огромное количество инженерных, лингвистических и когнитивных понятий,
00:08:13и теперь отчетливо видно, как каждое из них занимает свое место в этой лингвистической системе.
00:08:23Самое главное: все эти элементы тесно взаимосвязаны, а не существуют по отдельности.
00:08:30Они взаимно влияют друг на друга. Если вы хотите качественно проработать уровень звука,
00:08:36вам придется учитывать уровень слов. А занимаясь звуками и лексикой,
00:08:43необходимо закладывать механики взаимодействия: очерёдность реплик и момент вступления в разговор.
00:08:50И наконец, если ваша цель — успешное выполнение задачи (а это главная задача уровня ментальной модели), вам понадобятся абсолютно все эти уровни.
00:09:02Уберите хоть одну деталь — и ваш голосовой агент потерпит неудачу.
00:09:09Каждый из этих элементов должен быть идеально выстроен и согласован с остальными.
00:09:17Кроме того, важно помнить: процесс разворачивается во времени.
00:09:26Что я имею в виду? В отличие от текстового чата, где история переписки перед глазами,
00:09:34в голосовом интерфейсе все иначе. Вы произносите фразу, бот отвечает, происходит обмен репликами...
00:09:45...и все эти звуковые волны — колебания воздуха — моментально исчезают.
00:09:53Единственное, что остается и действительно имеет значение, — это ментальная модель в голове пользователя.
00:10:00Звуки, слова и взаимодействия растворяются в ту же секунду, когда произнесены,
00:10:04но ментальная модель продолжает жить и развиваться во времени.
00:10:09Именно на нее вы должны
00:10:12ориентироваться, чтобы пользователь остался доволен.
00:10:16Что мы можем сделать,
00:10:19чтобы бот соответствовал высоким ожиданиям человека?
00:10:25В наш арсенал входит подбор качественных ASR-моделей, их точная настройка и постобработка,
00:10:34выбор подходящих TTS-моделей, конфигурация и предобработка данных,
00:10:38продуманное формирование словаря, общее понимание которого есть и у бота, и у пользователя,
00:10:46а также четкая настройка задержек откликов и момента вступления в диалог.
00:10:52И что чрезвычайно важно — здорово, если нам удастся реализовать точное распознавание эмоций и реакцию на них,
00:10:59а также удержание контекста. Под контекстом я подразумеваю совокупность всех этих параметров.
00:11:07Причем подход обязан быть динамичным, ведь условия постоянно меняются в процессе разговора.
00:11:16Нам необходимо управлять этой системой гибко, отслеживая весь таймлайн
00:11:21для самых разных типов пользователей.
00:11:24У детей и других групп людей будут совершенно разные ожидания, которые мы обязаны оправдывать —
00:11:32не только когда они в хорошем настроении, но и когда они чем-то недовольны.
00:11:36Только построив такую систему, можно добиться гибкой и по-настоящему масштабируемой оркестрации VoiceAI.
00:11:42Это невероятно сложная задача.
00:11:48Принято считать, что голос — самый естественный способ общения, но на практике это далеко не так просто.
00:11:54За этой бесшовному эффективностью стоит грамотная лингвистическая оркестрация.
00:11:59Если бот не справляется с этой задачей, происходящее превращается в полный провал.
00:12:07Фокус на лингвистическом фреймворке открывает колоссальные бизнес-перспективы, ведь вы сможете
00:12:17минимизировать раздражение пользователей, сбои при выполнении задач, сбросы звонков, скрытые ошибки и переводы на операторов.
00:12:28Команда ServiceNow разработала качественный сквозной бенчмарк под названием eva bench. Вы можете использовать его для оценки состояния вашего голосового агента.
00:12:43Главные выводы.
00:12:45Голосовой ИИ — это совместный процесс взаимодействия
00:12:49бота и пользователя, а не просто технический конвейер.
00:12:54И мы должны удовлетворять потребности пользователя на всех уровнях в режиме реального времени.
00:12:59Я не даю вам сегодня готового универсального решения, потому что его просто не существует.
00:13:04Ключ к решению кроется внутри вас и вашей системы.
00:13:10Сегодня я поделилась с вами лингвистическим фреймворком, который вы можете применить
00:13:16для диагностики своей системы и взять за основу при её проектировании.
00:13:21Вы можете опробовать eva, а также глубже изучать лингвистику и нанимать лингвистов.
00:13:28Еще один важный момент, о котором хочется напомнить:
00:13:31бизнес-задачи неотделимы от лингвистических задач,
00:13:35когда речь идет о голосовом ИИ.
00:13:37Ведь процесс общения голосом глубоко лингвистичен, человечен и когнитивен.
00:13:45И в заключение я хочу задать вам вопрос на перспективу.
00:13:50Собеседники всегда адаптивны. Я уверена, что за время моего выступления
00:13:59вы немного привыкли ко мне, к моему манере речи, акценту
00:14:05и используемой лексике. При личной встрече вам будет куда комфортнее
00:14:12общаться со мной, потому что вы были внимательны ко мне. Люди подстраиваются под собеседника,
00:14:18и пользователь точно так же адаптируется к голосовому агенту во время разговора. Готова ли ваша система к тому,
00:14:27чтобы в следующий раз взаимодействие стало еще более эффективным?
00:14:31Язык постоянно трансформируется. Готов ли ваш голосовой агент к изменениям в языке через полгода или год?
00:14:44Станет ли ваш голосовой агент лучше к следующему разу? Большое спасибо.
00:14:57Спасибо вам.
00:14:57Большое спасибо.
00:14:57Спасибо за внимание.
00:15:04Спасибо.

핵심 요약

Голосовой ИИ требует комплексной лингвистической оркестрации на уровнях звуков, слов, паузирования и динамических ментальных моделей, иначе сбои ASR и TTS приводят к сбросам звонков и отказу от автоматизации.

하이라이트

  • Голосовой ИИ часто терпит неудачу из-за разрыва ментальных моделей пользователя и системы при сбоях распознавания речи (ASR) и синтеза (TTS).

  • Человеческая коммуникация — это динамический совместный процесс, где звуки и слова исчезают сразу после произнесения, а сохраняется только ментальная модель.

  • Выстраивание VoiceAI требует одновременной согласованности звукового уровня, словаря, механик очередности реплик и управления контекстом во времени.

  • Отказ от адаптации к изменению языка и эмоциональному состоянию человека ведет к сбросам звонков, незавершенным задачам и переводам на операторов.

  • Оценку и диагностику сквозной архитектуры голосового агента позволяет проводить специализированный бенчмарк eva bench от ServiceNow.

타임라인

Сбои пользовательского опыта в традиционных голосовых агентах

  • Текущие системы голосового ИИ регулярно сбиваются при распознавании непривычных имен и буквенно-цифровых кодов.
  • Прерывание пользователя на полуслове и отсутствие уточняющих вопросов вызывают непреодолимое раздражение и отказ от диалога.

Пользователи часто сталкиваются со сбоями, когда голосовой агент подменяет произнесенные буквы (например, «М» на «Н») из-за англоязычных паттернов TTS или обрывает речь во время естественных пауз. Вместо использования привычных для людей уточняющих вопросов бот просто заставляет повторять ввод заново. Это разрушает диалог и заставляет требовать перевода на оператора-человека.

Лингвистическая база и концепция совместной коммуникации

  • Человеческое общение представляет собой непрерывный совместный процесс обновления ментальных моделей через каналы восприятия и речи.
  • Ошибки модуля STT на этапе восприятия и некорректная работа TTS на этапе речи разрушают синхронизацию между ботом и человеку.

Тысячелетия эволюции сформировали у людей четкие ожидания от диалога: стороны постоянно обмениваются звуками, распознают слова и оперативно корректируют ментальные представления. В случае VoiceAI сбой STT на этапе восприятия приводит к ошибочному считыванию словарных блоков, а жесткий TTS применяет неверные фонетические правила. Отсутствие синхронизации ментальной модели делает общение неполноценным.

Структура лингвистического фреймворка VoiceAI

  • Диалоговый фреймворк включает звуки, слова, интерактивное взаимодействие и ментальную модель на каналах восприятия и речи.
  • Звуковые волны растворяются мгновенно после произнесения, поэтому единственным ценным результатом разговора остается развивающаяся во времени ментальная модель.
  • Исключение хотя бы одного лингвистического уровня приводит к неизбежному провалу всей системы голосового агента.

Качественный голосовой агент требует взаимной интеграции распознавания звуков, понимания слов, корректного паузирования и точной интерпретации намерений. В отличие от текстового чата, где сохраняется история перед глазами, в голосовом интерфейсе произнесенные звуки исчезают в ту же секунду. Внимание разработчиков должно быть полностью сфокусировано на ментальной модели пользователя, которая продолжает жить во времени.

Практическая оркестрация и бизнес-эффект лингвистического подхода

  • Гибкая оркестрация включает точную настройку ASR/TTS, формирование общего словаря, управление задержками, удержание контекста и распознавание эмоций.
  • Фокус на лингвистической системе сокращает сбросы звонков, незавершенные задачи, скрытые ошибки и избыточные переводы на операторов.
  • Для оценки и диагностики состояния голосового агента используется сквозной бенчмарк eva bench.

Бесшовная работа VoiceAI достигается непрерывным отслеживанием таймлайна диалога для разных категорий пользователей с учетом их эмоционального состояния и изменений языка. Бизнес-задачи голосового ИИ неотделимы от лингвистических, так как процесс речевого общения глубинно когнитивен. Бенчмарк eva bench позволяет протестировать и спроектировать адаптивную систему, готовую к языковым трансформациям.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기