"내 이름은... 내 이름은...": 음성 에이전트를 위한 언어 지도 — 미담 김, ServiceNow
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00안녕하세요, 여러분. 저는 ServiceNow의 ML 엔지니어 김미담입니다. 오늘
00:00:25음성 AI를 위한 언어학적 프레임워크에 대해 말씀드리려 합니다. 제 배경을 간단히 소개하자면,
00:00:37말씀드렸듯이 ServiceNow의 ML 엔지니어이자,
00:00:42실제 환경에서의 음성 소통을 평생 연구해 온 연구자이기도 합니다. 제
00:00:48좌우명은 언어학을 실천하는 것이며, 오늘 여러분께
00:00:54언어학이라는 시각을 전해드리고자 합니다. 혹시 음성 AI 오류를 경험해 보신 적 있으신가요? 아마
00:01:05다들 있으실 겁니다. 제가 직접 경험했던 사례를 하나 소개해 드리겠습니다.
00:01:15봇이 제게 “이름의 철자를 말씀해 주시겠어요?”라고 물었고, 저는 천천히 철자를 부르기 시작했습니다.
00:01:22“네, M-I-D-A-M입니다.” 그러자 봇이 “확인해 드리겠습니다. M-I-D-A-N이 맞나요?”라고 하더군요. 그래서 “아니요, M-I-D-A-M입니다”라고 했습니다.
00:01:40제 이름은 M-I-D-A-N이 아니라 M-I-D-A-M인데 말이죠. 약간 짜증이 나기 시작했습니다. 그러더니 봇이 “이제 계좌 번호가 어떻게 되나요?”라고 묻더군요. 순간 당황스러웠습니다. 계좌 번호라니 그게 무슨 소릴까 싶어 관련 정보를 찾아보려고 애썼죠.
00:02:09어떤 건지 찾다가, 아마 맞겠지 싶어 계좌 번호 철자를 천천히 부르기 시작했습니다. “A-X-4-5-1...” 생소한 숫자를 읽느라 시간이 좀 걸렸는데, 봇이 제 말을 중간에 끊어버렸습니다. 그러더니 “기록을 찾을 수 없습니다”라고 하더군요. 제대로
00:02:14시도조차 하지 않고 다시 말해 달라고 요청했습니다. “다시 한번 말씀해 주시겠어요?” 스트레스가 쌓이기 시작했죠. 그러고는 “기록을 찾을 수 없습니다”라고 반복했습니다. 그러더니
00:02:21“A, X, 4, 5, 1”을 불러주는데, 생소한 숫자를 읽느라 시간이 걸렸더니
00:02:30봇이 말을 말을 끊고는 기록을 찾을 수 없다며
00:02:36제대로 알아보지도 않고 다시 말씀해 달라고 하더군요.
00:02:42“다시 말해 주시겠어요?”라는 말에 너무 화가 나서 “상담원 연결해 주세요,
00:02:46더 이상 대화하고 싶지 않네요”라고 말해버렸죠. 안타깝게도 현시점
00:02:51음성 AI에서 매우 전형적으로 나타나는 패턴입니다.
00:02:57그래서 언어학을 통해 이 문제를 어떻게 해결할 수 있을지 짚어보고자 합니다. 음성 AI 시장은
00:03:06급성장하고 있지만, 사용자들은 여전히 음성 에이전트보다 사람 상담원을 선호하곤 합니다.
00:03:11이 문제를 어떻게 완화할 수 있을까요? 하지만 그전에, 근본적인
00:03:19실제 문제는 무엇일까요? 음성 AI의 엔드투엔드 아키텍처를 이해하려면
00:03:25언어학이라는 근본적인 프레임워크를 떠올려 볼 수 있습니다.
00:03:35우리 모두 이미 알고 있듯이, 인간의 소통은 상호 협력적인 활동입니다.
00:03:41지금 우리가 하고 있는 것처럼 말이죠. 제가 소리와 단어를 전달하면 여러분이
00:03:48이를 듣고, 대화라면 여러분도 저에게 소리와
00:03:53단어를 돌려주며 상호작용을 통해 주고받게 됩니다.
00:04:02그리고 이 과정에서 우리는 지속적으로 멘탈 모델을 처리하고 업데이트합니다.
00:04:09이것이 인간 소통의 공동 활동이며, 음성 AI와
00:04:18인간의 소통 역시 이와 같은 공동 활동이어야 한다고 말씀드리고 싶습니다.
00:04:25왜냐하면 그것이 우리가 인간의 소통 방식에 대해 아는 유일한 형태이기 때문입니다. 인간으로서
00:04:30우리는 수천 년 동안 전달자로서 진화해 왔고, 이것이 우리가 아는 방식입니다.
00:04:35따라서 봇에게도 동일한 것을 기대하게 되죠. 이 프레임워크를 바탕으로
00:04:45음성 에이전트와의 통화 실패 장면을 다시 살펴보겠습니다. 보시다시피 각 주체에는
00:04:53'듣기'와 '말하기'가 존재합니다. 제가 이름 철자를 부르기 시작했을 때,
00:05:04봇은 M과 N의 차이를 제대로 듣지 못했습니다. 듣기 단계에서의 STT 오류였죠. 그리고 TTS는 제 이름에
00:05:14영어 중심의 발음 규칙만 적용했습니다. 미국 영어 버전에서는 M-I-D-A-M을 '미담'으로 읽게 됩니다.
00:05:22그래서 당황스러웠지만, 사람끼리도 흔히 일어나는 일이라
00:05:29그때는 관대하게 넘어갔습니다. 괜찮았죠. 하지만 봇이 계좌 번호를
00:05:36꺼냈을 때, 뭔지 몰라 다시 혼란스러웠지만 전 적응력이 있으니 찾아볼 수 있었습니다.
00:05:44번호를 찾아 읽기 시작했지만 STT가 단어 단위를 제대로 인식하지 못해
00:05:52제 말을 끊었고, 결국 제 말 위로 덮어 말하기까지 했습니다. 정말 짜증이 났죠.
00:06:06그리고 동일한 정보의 재확인을 요구했을 때, 이 봇이
00:06:14나와 멘탈 모델을 공유 및 추적하지 못하고 있음이 명확해졌습니다. 그리고 대단히 무례하게도
00:06:22인간이 흔히 쓰는 상호작용적 명확화 전략조차 시도하지 않았습니다. 그래서 더 이상 대화하고 싶지 않아
00:06:28상담원 연결을 요청한 것이죠. 프레임워크를 다시 살펴봅시다. 이것들은
00:06:38사람 간의 대화에서 기대되고 잘 유지되는 언어학적 요소들입니다.
00:06:47듣기 채널과 말하기 채널이 존재하며, 그 안에는
00:06:52소리, 단어, 상호작용, 멘탈 모델 같은 다양한 요소가 있습니다. 첫 번째 요소는 '봇이 사용자의
00:06:59음성을 잘 인식하는가?'입니다. 모든 기술 전문 용어가 여기에 속하죠. 그리고
00:07:09듣기 채널의 단어 측면인 두 번째 요소, 즉 '봇이 사용자의 단어를 이해하는가?'가 있습니다.
00:07:17세 번째는 '봇이 자신의 차례가 올 때까지 알맞은 타이밍을 기다리는가?'로, 듣기 채널의 상호작용에 관한 것입니다.
00:07:28마지막 부분은 멘탈 모델로, 듣기 영역에서 '봇이 사용자의 의도를 이해하는가?'입니다.
00:07:38이제 말하기 채널로 넘어가면, 소리 부문에서는 발음에 관한 것이 될 것이고,
00:07:43또한 '봇이 사용자가 이해할 수 있는 단어를 선택하여 말하는가?'를 다룹니다.
00:07:53상호작용 부문에서는 '봇이 적절한 타이밍에 말하는가?' 그리고 마지막으로 '봇이 사용자에게
00:08:01실제로 필요한 정보를 제공하는가?'를 다룹니다.
00:08:05여기에는 수많은 공학적, 언어학적, 인지과학적 용어들이 나열되어 있습니다.
00:08:13이제 이 모든 개념이 이 언어학적 프레임워크 내에서 제자리를 찾아 들어가는 것을 보실 수 있습니다.
00:08:23중요한 점은 이 요소들이 서로 분리되거나 독립적인 것이 아니라 상호의존적이라는 사실입니다.
00:08:30상호의존적이며 정렬되어 있죠. 따라서 소리 측면을 잘 다루고 싶다면
00:08:36단어 수준을 고려해야 하고, 이 소리와 단어를 제대로 구현하고자 할 때에는
00:08:43상호작용, 즉 턴 체인지나 턴 감지 기능도 고려해야 합니다.
00:08:50그리고 최종적으로 멘탈 모델 레이어의 목표인 성공적인 작업 완료를 이루려면 이 모든 요소를 갖춰야 합니다.
00:09:02이 구성 요소 중 단 하나라도 빠지면 음성 에이전트는 실패하게 됩니다.
00:09:09그리고 마지막으로, 이 모든 요소가 정교하게 정렬되어 있어야 합니다.
00:09:17아울러 이 모든 과정이 시간의 흐름 속에서 일어난다는 점을 명심해야 합니다.
00:09:26무슨 뜻이냐면, 텍스트로 주고받은 대화 기록이 눈에 보이는 채팅과 달리
00:09:34음성 에이전트 경험에서는 내가 말을 하고 봇이 응답하며 주고받을 때,
00:09:45공기의 진동으로 전달되었던 모든 음성 파형은 사라져버립니다.
00:09:53오직 사용자의 멘탈 모델만이 남아 유효한 영향력을 미치게 되죠.
00:10:00소리, 단어, 상호작용은 발화되는 순간 사라집니다.
00:10:04하지만 멘탈 모델은 시간의 흐름에 따라 계속 유지되고 확장됩니다.
00:10:09따라서 사용자 만족도를 높이려면
00:10:12이 부분을 공략해야 합니다.
00:10:16그그렇다면 봇이 사용자의 기준을 충족하기 위해
00:10:19우리는 무엇을 할 수 있을까요?
00:10:25우리가 할 수 있는 일은 우수한 ASR 모델과 설정을 선택하고 후처리를 수행하는 것,
00:10:34적절한 TTS 모델, 설정 선택 및 전처리를 진행하는 것,
00:10:38그리고 봇과 사용자가 공유할 수 있는 어휘를 정교하게 선별하는 것입니다.
00:10:46또한 턴 간의 감지 지연 시간과 발화 순서 교대를 원활하게 처리해야 합니다.
00:10:52매우 중요한 점은 감정 감지 및 대응을 잘 해내는 것이죠.
00:10:59그리고 맥락을 유지해야 합니다. 여기서 맥락이란 이 모든 요소에 대한 맥락을 의미합니다.
00:11:07중요한 것은 통화 진행 과정에서 상황이 항상 바뀌므로 동적이어야 한다는 점입니다.
00:11:16따라서 시간에 따라 이 관리를 동적으로 수행해야 합니다.
00:11:21다양한 유형의 사람들을 위해서 말이죠.
00:11:24아이들이나 다양한 사용자층은 각기 다른 기대치를 갖고 있으며, 이를 충족시켜야 합니다.
00:11:32기분이 좋을 때뿐만 아니라 그렇지 않을 때도 마찬가지입니다.
00:11:36그래야만 동적이고 진정으로 확장 가능한 음성 AI 오케스트레이션을 추구할 수 있습니다.
00:11:42따라서 매우 까다로운 작업입니다.
00:11:48우리는 늘 음성이 가장 자연스러운 소통 방식이라고 말하지만, 사실 쉬운 일이 아닙니다.
00:11:54보이지 않는 곳에서 작동하는 이러한 언어학적 오케스트레이션 덕분이죠.
00:11:59봇이 이 역할을 제대로 못 하면 끔찍한 실패로 이어집니다.
00:12:07따라서 이 언어학적 프레임워크에 주의를 기울이는 것은 비즈니스적으로 큰 의미가 있습니다.
00:12:17사용자의 좌절, 작업 실패, 상담원 전환, 통화 이탈, 침묵의 실패 등을 모두 줄일 수 있기 때문이죠.
00:12:28ServiceNow에서는 EVA Bench라는 우수한 엔드투엔드 벤치마크를 만들었습니다. 음성 에이전트의 상태를 진단하는 데 활용해 보실 수 있습니다.
00:12:43핵심 요약
00:12:45음성 AI는 단순히 연결된 파이프라인이 아니라
00:12:49봇과 사용자 간의 공동 활동입니다.
00:12:54그리고 실시간으로 다층적인 요구를 충족해야 합니다.
00:12:59제가 오늘 완벽한 정답을 제시해 드린 것은 아닙니다. 단번에 해결해 주는 해법이란 존재하지 않으니까요.
00:13:04해결책은 여러분 자신과 여러분의 시스템 내부에 있습니다.
00:13:10다만 제가 오늘 전해드린 것은, 시스템을 진단하고
00:13:16구축하는 데 활용할 수 있는 언어학적 프레임워크입니다.
00:13:21EVA를 시도해 볼 수도 있고, 언어학을 배우거나 언어학자를 고용할 수도 있습니다.
00:13:28상기시켜 드리고 싶은 또 한 가지는
00:13:31비즈니스적 시사점이 곧 언어학적 시사점이며, 그 반대도 마찬가지라는 점입니다.
00:13:35음성 AI 분야에서는
00:13:37음성이 근본적으로 언어학적이자 매우 인간적이고 인지적인 경험이기 때문입니다.
00:13:45장기적인 질문을 하나 드리고 싶습니다.
00:13:50화자는 적응합니다. 오늘 여러분과의 발표를 통해
00:13:59여러분은 저에 대해, 제 말하기 방식이나 억양,
00:14:05어떤 단어를 사용하는지에 대해 어느 정도 파악하셨을 겁니다. 그래서 다음에 직접 만났을 때
00:14:12저와 대화하는 것이 훨씬 편하게 느껴지실 겁니다. 제게 주의를 기울이셨기 때문이죠, 맞죠? 이처럼 화자는 늘 적응합니다. 사용자 역시
00:14:18통화 내내 음성 에이전트에 적응하게 됩니다. 그렇다면 여러분의 시스템은 사용자가
00:14:27다음번에 음성 에이전트를 더 잘 활용할 수 있도록 준비되어 있나요?
00:14:31언어는 항상 변화합니다. 여러분의 음성 에이전트는 1년 후, 혹은 단 6개월 후의 언어 변화에 대비되어 있습니까?
00:14:44여러분의 음성 에이전트는 다음번에 더 나아질 준비가 되어 있습니까? 감사합니다.
00:14:57감사합니다.
00:14:57감사합니다.
00:14:57감사합니다.
00:15:04감사합니다.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video