"내 이름은... 내 이름은...": 음성 에이전트를 위한 언어 지도 — 미담 김, ServiceNow

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00안녕하세요, 여러분. 저는 ServiceNow의 ML 엔지니어 김미담입니다. 오늘
00:00:25음성 AI를 위한 언어학적 프레임워크에 대해 말씀드리려 합니다. 제 배경을 간단히 소개하자면,
00:00:37말씀드렸듯이 ServiceNow의 ML 엔지니어이자,
00:00:42실제 환경에서의 음성 소통을 평생 연구해 온 연구자이기도 합니다. 제
00:00:48좌우명은 언어학을 실천하는 것이며, 오늘 여러분께
00:00:54언어학이라는 시각을 전해드리고자 합니다. 혹시 음성 AI 오류를 경험해 보신 적 있으신가요? 아마
00:01:05다들 있으실 겁니다. 제가 직접 경험했던 사례를 하나 소개해 드리겠습니다.
00:01:15봇이 제게 “이름의 철자를 말씀해 주시겠어요?”라고 물었고, 저는 천천히 철자를 부르기 시작했습니다.
00:01:22“네, M-I-D-A-M입니다.” 그러자 봇이 “확인해 드리겠습니다. M-I-D-A-N이 맞나요?”라고 하더군요. 그래서 “아니요, M-I-D-A-M입니다”라고 했습니다.
00:01:40제 이름은 M-I-D-A-N이 아니라 M-I-D-A-M인데 말이죠. 약간 짜증이 나기 시작했습니다. 그러더니 봇이 “이제 계좌 번호가 어떻게 되나요?”라고 묻더군요. 순간 당황스러웠습니다. 계좌 번호라니 그게 무슨 소릴까 싶어 관련 정보를 찾아보려고 애썼죠.
00:02:09어떤 건지 찾다가, 아마 맞겠지 싶어 계좌 번호 철자를 천천히 부르기 시작했습니다. “A-X-4-5-1...” 생소한 숫자를 읽느라 시간이 좀 걸렸는데, 봇이 제 말을 중간에 끊어버렸습니다. 그러더니 “기록을 찾을 수 없습니다”라고 하더군요. 제대로
00:02:14시도조차 하지 않고 다시 말해 달라고 요청했습니다. “다시 한번 말씀해 주시겠어요?” 스트레스가 쌓이기 시작했죠. 그러고는 “기록을 찾을 수 없습니다”라고 반복했습니다. 그러더니
00:02:21“A, X, 4, 5, 1”을 불러주는데, 생소한 숫자를 읽느라 시간이 걸렸더니
00:02:30봇이 말을 말을 끊고는 기록을 찾을 수 없다며
00:02:36제대로 알아보지도 않고 다시 말씀해 달라고 하더군요.
00:02:42“다시 말해 주시겠어요?”라는 말에 너무 화가 나서 “상담원 연결해 주세요,
00:02:46더 이상 대화하고 싶지 않네요”라고 말해버렸죠. 안타깝게도 현시점
00:02:51음성 AI에서 매우 전형적으로 나타나는 패턴입니다.
00:02:57그래서 언어학을 통해 이 문제를 어떻게 해결할 수 있을지 짚어보고자 합니다. 음성 AI 시장은
00:03:06급성장하고 있지만, 사용자들은 여전히 음성 에이전트보다 사람 상담원을 선호하곤 합니다.
00:03:11이 문제를 어떻게 완화할 수 있을까요? 하지만 그전에, 근본적인
00:03:19실제 문제는 무엇일까요? 음성 AI의 엔드투엔드 아키텍처를 이해하려면
00:03:25언어학이라는 근본적인 프레임워크를 떠올려 볼 수 있습니다.
00:03:35우리 모두 이미 알고 있듯이, 인간의 소통은 상호 협력적인 활동입니다.
00:03:41지금 우리가 하고 있는 것처럼 말이죠. 제가 소리와 단어를 전달하면 여러분이
00:03:48이를 듣고, 대화라면 여러분도 저에게 소리와
00:03:53단어를 돌려주며 상호작용을 통해 주고받게 됩니다.
00:04:02그리고 이 과정에서 우리는 지속적으로 멘탈 모델을 처리하고 업데이트합니다.
00:04:09이것이 인간 소통의 공동 활동이며, 음성 AI와
00:04:18인간의 소통 역시 이와 같은 공동 활동이어야 한다고 말씀드리고 싶습니다.
00:04:25왜냐하면 그것이 우리가 인간의 소통 방식에 대해 아는 유일한 형태이기 때문입니다. 인간으로서
00:04:30우리는 수천 년 동안 전달자로서 진화해 왔고, 이것이 우리가 아는 방식입니다.
00:04:35따라서 봇에게도 동일한 것을 기대하게 되죠. 이 프레임워크를 바탕으로
00:04:45음성 에이전트와의 통화 실패 장면을 다시 살펴보겠습니다. 보시다시피 각 주체에는
00:04:53'듣기'와 '말하기'가 존재합니다. 제가 이름 철자를 부르기 시작했을 때,
00:05:04봇은 M과 N의 차이를 제대로 듣지 못했습니다. 듣기 단계에서의 STT 오류였죠. 그리고 TTS는 제 이름에
00:05:14영어 중심의 발음 규칙만 적용했습니다. 미국 영어 버전에서는 M-I-D-A-M을 '미담'으로 읽게 됩니다.
00:05:22그래서 당황스러웠지만, 사람끼리도 흔히 일어나는 일이라
00:05:29그때는 관대하게 넘어갔습니다. 괜찮았죠. 하지만 봇이 계좌 번호를
00:05:36꺼냈을 때, 뭔지 몰라 다시 혼란스러웠지만 전 적응력이 있으니 찾아볼 수 있었습니다.
00:05:44번호를 찾아 읽기 시작했지만 STT가 단어 단위를 제대로 인식하지 못해
00:05:52제 말을 끊었고, 결국 제 말 위로 덮어 말하기까지 했습니다. 정말 짜증이 났죠.
00:06:06그리고 동일한 정보의 재확인을 요구했을 때, 이 봇이
00:06:14나와 멘탈 모델을 공유 및 추적하지 못하고 있음이 명확해졌습니다. 그리고 대단히 무례하게도
00:06:22인간이 흔히 쓰는 상호작용적 명확화 전략조차 시도하지 않았습니다. 그래서 더 이상 대화하고 싶지 않아
00:06:28상담원 연결을 요청한 것이죠. 프레임워크를 다시 살펴봅시다. 이것들은
00:06:38사람 간의 대화에서 기대되고 잘 유지되는 언어학적 요소들입니다.
00:06:47듣기 채널과 말하기 채널이 존재하며, 그 안에는
00:06:52소리, 단어, 상호작용, 멘탈 모델 같은 다양한 요소가 있습니다. 첫 번째 요소는 '봇이 사용자의
00:06:59음성을 잘 인식하는가?'입니다. 모든 기술 전문 용어가 여기에 속하죠. 그리고
00:07:09듣기 채널의 단어 측면인 두 번째 요소, 즉 '봇이 사용자의 단어를 이해하는가?'가 있습니다.
00:07:17세 번째는 '봇이 자신의 차례가 올 때까지 알맞은 타이밍을 기다리는가?'로, 듣기 채널의 상호작용에 관한 것입니다.
00:07:28마지막 부분은 멘탈 모델로, 듣기 영역에서 '봇이 사용자의 의도를 이해하는가?'입니다.
00:07:38이제 말하기 채널로 넘어가면, 소리 부문에서는 발음에 관한 것이 될 것이고,
00:07:43또한 '봇이 사용자가 이해할 수 있는 단어를 선택하여 말하는가?'를 다룹니다.
00:07:53상호작용 부문에서는 '봇이 적절한 타이밍에 말하는가?' 그리고 마지막으로 '봇이 사용자에게
00:08:01실제로 필요한 정보를 제공하는가?'를 다룹니다.
00:08:05여기에는 수많은 공학적, 언어학적, 인지과학적 용어들이 나열되어 있습니다.
00:08:13이제 이 모든 개념이 이 언어학적 프레임워크 내에서 제자리를 찾아 들어가는 것을 보실 수 있습니다.
00:08:23중요한 점은 이 요소들이 서로 분리되거나 독립적인 것이 아니라 상호의존적이라는 사실입니다.
00:08:30상호의존적이며 정렬되어 있죠. 따라서 소리 측면을 잘 다루고 싶다면
00:08:36단어 수준을 고려해야 하고, 이 소리와 단어를 제대로 구현하고자 할 때에는
00:08:43상호작용, 즉 턴 체인지나 턴 감지 기능도 고려해야 합니다.
00:08:50그리고 최종적으로 멘탈 모델 레이어의 목표인 성공적인 작업 완료를 이루려면 이 모든 요소를 갖춰야 합니다.
00:09:02이 구성 요소 중 단 하나라도 빠지면 음성 에이전트는 실패하게 됩니다.
00:09:09그리고 마지막으로, 이 모든 요소가 정교하게 정렬되어 있어야 합니다.
00:09:17아울러 이 모든 과정이 시간의 흐름 속에서 일어난다는 점을 명심해야 합니다.
00:09:26무슨 뜻이냐면, 텍스트로 주고받은 대화 기록이 눈에 보이는 채팅과 달리
00:09:34음성 에이전트 경험에서는 내가 말을 하고 봇이 응답하며 주고받을 때,
00:09:45공기의 진동으로 전달되었던 모든 음성 파형은 사라져버립니다.
00:09:53오직 사용자의 멘탈 모델만이 남아 유효한 영향력을 미치게 되죠.
00:10:00소리, 단어, 상호작용은 발화되는 순간 사라집니다.
00:10:04하지만 멘탈 모델은 시간의 흐름에 따라 계속 유지되고 확장됩니다.
00:10:09따라서 사용자 만족도를 높이려면
00:10:12이 부분을 공략해야 합니다.
00:10:16그그렇다면 봇이 사용자의 기준을 충족하기 위해
00:10:19우리는 무엇을 할 수 있을까요?
00:10:25우리가 할 수 있는 일은 우수한 ASR 모델과 설정을 선택하고 후처리를 수행하는 것,
00:10:34적절한 TTS 모델, 설정 선택 및 전처리를 진행하는 것,
00:10:38그리고 봇과 사용자가 공유할 수 있는 어휘를 정교하게 선별하는 것입니다.
00:10:46또한 턴 간의 감지 지연 시간과 발화 순서 교대를 원활하게 처리해야 합니다.
00:10:52매우 중요한 점은 감정 감지 및 대응을 잘 해내는 것이죠.
00:10:59그리고 맥락을 유지해야 합니다. 여기서 맥락이란 이 모든 요소에 대한 맥락을 의미합니다.
00:11:07중요한 것은 통화 진행 과정에서 상황이 항상 바뀌므로 동적이어야 한다는 점입니다.
00:11:16따라서 시간에 따라 이 관리를 동적으로 수행해야 합니다.
00:11:21다양한 유형의 사람들을 위해서 말이죠.
00:11:24아이들이나 다양한 사용자층은 각기 다른 기대치를 갖고 있으며, 이를 충족시켜야 합니다.
00:11:32기분이 좋을 때뿐만 아니라 그렇지 않을 때도 마찬가지입니다.
00:11:36그래야만 동적이고 진정으로 확장 가능한 음성 AI 오케스트레이션을 추구할 수 있습니다.
00:11:42따라서 매우 까다로운 작업입니다.
00:11:48우리는 늘 음성이 가장 자연스러운 소통 방식이라고 말하지만, 사실 쉬운 일이 아닙니다.
00:11:54보이지 않는 곳에서 작동하는 이러한 언어학적 오케스트레이션 덕분이죠.
00:11:59봇이 이 역할을 제대로 못 하면 끔찍한 실패로 이어집니다.
00:12:07따라서 이 언어학적 프레임워크에 주의를 기울이는 것은 비즈니스적으로 큰 의미가 있습니다.
00:12:17사용자의 좌절, 작업 실패, 상담원 전환, 통화 이탈, 침묵의 실패 등을 모두 줄일 수 있기 때문이죠.
00:12:28ServiceNow에서는 EVA Bench라는 우수한 엔드투엔드 벤치마크를 만들었습니다. 음성 에이전트의 상태를 진단하는 데 활용해 보실 수 있습니다.
00:12:43핵심 요약
00:12:45음성 AI는 단순히 연결된 파이프라인이 아니라
00:12:49봇과 사용자 간의 공동 활동입니다.
00:12:54그리고 실시간으로 다층적인 요구를 충족해야 합니다.
00:12:59제가 오늘 완벽한 정답을 제시해 드린 것은 아닙니다. 단번에 해결해 주는 해법이란 존재하지 않으니까요.
00:13:04해결책은 여러분 자신과 여러분의 시스템 내부에 있습니다.
00:13:10다만 제가 오늘 전해드린 것은, 시스템을 진단하고
00:13:16구축하는 데 활용할 수 있는 언어학적 프레임워크입니다.
00:13:21EVA를 시도해 볼 수도 있고, 언어학을 배우거나 언어학자를 고용할 수도 있습니다.
00:13:28상기시켜 드리고 싶은 또 한 가지는
00:13:31비즈니스적 시사점이 곧 언어학적 시사점이며, 그 반대도 마찬가지라는 점입니다.
00:13:35음성 AI 분야에서는
00:13:37음성이 근본적으로 언어학적이자 매우 인간적이고 인지적인 경험이기 때문입니다.
00:13:45장기적인 질문을 하나 드리고 싶습니다.
00:13:50화자는 적응합니다. 오늘 여러분과의 발표를 통해
00:13:59여러분은 저에 대해, 제 말하기 방식이나 억양,
00:14:05어떤 단어를 사용하는지에 대해 어느 정도 파악하셨을 겁니다. 그래서 다음에 직접 만났을 때
00:14:12저와 대화하는 것이 훨씬 편하게 느껴지실 겁니다. 제게 주의를 기울이셨기 때문이죠, 맞죠? 이처럼 화자는 늘 적응합니다. 사용자 역시
00:14:18통화 내내 음성 에이전트에 적응하게 됩니다. 그렇다면 여러분의 시스템은 사용자가
00:14:27다음번에 음성 에이전트를 더 잘 활용할 수 있도록 준비되어 있나요?
00:14:31언어는 항상 변화합니다. 여러분의 음성 에이전트는 1년 후, 혹은 단 6개월 후의 언어 변화에 대비되어 있습니까?
00:14:44여러분의 음성 에이전트는 다음번에 더 나아질 준비가 되어 있습니까? 감사합니다.
00:14:57감사합니다.
00:14:57감사합니다.
00:14:57감사합니다.
00:15:04감사합니다.

핵심 요약

음성 AI 실패를 줄이고 성공적인 과업을 완수하려면 소리, 단어, 턴 체인지, 멘탈 모델이 실시간으로 정렬되는 언어학적 프레임워크를 시스템에 구축해야 한다.

하이라이트

  • 음성 AI와의 소통은 단순한 파이프라인 처리가 아니라 상호 협력적인 공동 활동이며 멘탈 모델을 공유하는 과정이다.

  • 음성 파형은 발화 즉시 사라지지만 사용자의 멘탈 모델은 시간의 흐름에 따라 계속 유지되고 확장된다.

  • 듣기와 말하기 채널 내의 소리, 단어, 상호작용, 멘탈 모델은 서로 독립적이지 않고 상호의존적으로 정렬되어야 한다.

  • 음성 AI 시스템의 진단을 위해 엔드투엔드 벤치마크인 EVA Bench를 활용할 수 있다.

타임라인

음성 AI 통화 실패 사례와 문제점

  • 음성 AI 시장의 성장에서 불구하고 사용자는 사람 상담원 연결을 더 선호한다.
  • 음성 AI는 이름 철자 인식 오류나 맥락에 맞지 않는 계좌 번호 요구 등으로 사용자에게 스트레스를 유발한다.
  • 입력 지연 시 말을 끊거나 이전 맥락을 공유하지 못할 때 대화 이탈이 발생한다.

이름의 'M'과 'N'을 구분하지 못하는 STT 오류와 한국어 이름에 영어식 발음 규칙을 적용하는 TTS 한계가 대화 흐름을 방해한다. 생소한 숫자를 천천히 읽는 과정에서 말을 끊고 동일한 정보를 반복 요청하는 행동은 사용자의 대화 포기와 상담원 전환으로 이어진다.

언어학적 소통 프레임워크와 상호작용 구조

  • 인간의 소통은 소리와 단어를 주고받으며 멘탈 모델을 지속적으로 업데이트하는 공동 활동이다.
  • 듣기와 말하기 채널은 소리, 단어, 상호작용, 멘탈 모델이라는 4가지 층위로 구성된다.
  • 프레임워크의 모든 요소는 상호의존적이며 하나라도 결여되면 대화가 실패한다.

사람은 수천 년간 상호 협력적 소통 방식을 통해 진화했기 때문에 봇에게도 동일한 대화 규칙을 기대한다. 음성 인식(ASR)과 합성(TTS)의 소리 영역부터 단어 선택, 턴 감지 timing, 의도 파악 및 정보 제공까지 모든 단계가 정교하게 정렬되어야 작업 완수가 가능하다.

음성 파형의 휘발성과 동적 맥락 관리

  • 음성 파형은 발화 직후 사라지므로 사용자에게 유효하게 남는 것은 멘탈 모델뿐이다.
  • 다양한 사용자층과 감정 상태에 대응하기 위해 맥락을 동적으로 유지해야 한다.
  • 언어학적 오케스트레이션은 이탈률과 침묵의 실패를 줄여 비즈니스 가치를 창출한다.

텍스트 기반 채팅과 달리 음성 소통은 물리적 파형이 즉시 소멸하기 때문에 시간에 따른 멘탈 모델 관리가 필수적이다. ASR/TTS 설정, 어휘 선별, 감정 감지, 턴 지연 시간 관리를 실시간으로 수행해야 하며, ServiceNow의 EVA Bench 같은 벤치마크를 통해 시스템 상태를 진단할 수 있다.

언어 변화와 시스템 적응성

  • 음성 AI 구축은 단일 해법이 아닌 시스템 내부의 언어학적 프레임워크 적용에 달려 있다.
  • 화자는 대화 상대에게 적응하므로 시스템 역시 사용자의 변화에 맞춰 적응해야 한다.
  • 시간의 흐름에 따른 언어 변화에 대비하는 동적 시스템 설계가 필요하다.

비즈니스적 시사점과 언어학적 시사점은 서로 밀접하게 연결되어 있다. 사용자가 대화 과정에서 봇에 적응하는 만큼, 음성 에이전트 역시 6개월 또는 1년 후의 언어 변화와 사용자 특성에 맞춰 지속적으로 개선될 수 있는 구조를 갖추어야 한다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기