Google DeepMind의 음성 대 음성(Speech-to-Speech) 모델 연구 — 발레리아 우 퐁 & 톰 오양, Google DeepMind
AAI Engineer
컴퓨터/소프트웨어가전제품/카메라
스크립트
00:00:00소음 없이 격리된 환경이 아니라, 이동 중이거나 기차 안에서, 산책을 하면서
00:00:04음성 대화 모델을 통해 구현하고자 하는 경험들이 바로 이런 것들입니다.
00:00:08마지막으로 정말 기대하고 있는 또 다른 부분은 음성 출력뿐만 아니라 멀티모달 출력입니다.
00:00:15진정한 AGI 대화의 최전선에는 시각적인 존재감 역시 필요할 것이라고 믿습니다.
00:00:20그래서 다음 클라우드(Cloud Next)에서 시티(Citi)와 함께 첫 번째 파일럿 데모를 선보이게 되었습니다.
00:00:26맞춤형 실시간 아바타를 지원하며, 극사실적인 인간부터 만화 같은 외형까지 원하는 대로 개인화할 수 있습니다.
00:00:33그 사이의 모든 모습도 가능하며, 앞서 보여드렸던 것과 동일한 음성 대화 모델로 구동됩니다.
00:00:38이를 통해 저지연 다국어 립싱크가 가능하며,
00:00:43시각적 존재감을 갖춘 자연스럽고 유연한 대화가 이어지는 것을 보실 수 있습니다. 그럼 하나 보여드리겠습니다.
00:00:48이 데모는 우리의 벤다이어그램을 하나로 모아주며, 우리가 이 모든 것에 열광하는 이유를 보여줍니다.
00:00:54딸아이 대학 등록금 기금이 생각나네요. 목표에 맞춰 잘 모이고 있나요?
00:01:00잘 준비되고 있습니다, 잭슨. 더 빨리 목표를 달성할 수 있는 새로운 기회도 찾아냈어요.
00:01:06아, 리사도 들어왔네요. 안녕하세요, 리사! 대학 합격 소식에 정말 기뻐하겠어요.
00:01:12축하해요. 저축 목표가 현실이 되는 걸 보니 정말 기쁩니다.
00:01:16훌륭합니다, 좋은 소식이네요. 스페인어를 사용하는 사용자의 오디오가 모델의 응답 음성보다 안 좋다고 늘 농담하곤 하지만요.
00:01:34이것은 멀티모달 입출력을 결합한 우리의 벤다이어그램이 어떻게 구현되는지 보여드리기 위한 것입니다.
00:01:40툴 콜링을 통해 사용자의 관련 예시를 불러오고,
00:01:45대화의 유연성도 함께 이러한 유형의 데모에서 서서히 하나로 어우러지고 있습니다.
00:01:50이러한 한계를 계속해서 넓혀나갈 수 있게 되어 기쁘며, 마지막으로 전하고 싶은 생각은 이렇습니다.
00:01:57우리는 AGI가 타이핑되는 것이 아니라 음성으로 이루어질 것이라고 믿습니다.
00:02:01음성 중심이 되기 위해서는 하나의 프롬프트로 다루기 다재다능한 모델 안에서 많은 기능이 함께 작동해야 합니다.
00:02:06사용자가 번역, 실행, 브레인스토밍, 잡담 등 온갖 종류의 대화 모드 사이를 매끄럽게 전환할 수 있어야 하죠.
00:02:12우리는 이러한 음성 대화 모델의 힘을 통해 원활한 전환을 이룰 수 있다고 굳게 믿고 있습니다.
00:02:17이러한 원활한 전환을 실현하는 음성 모델의 힘을 믿기에,
00:02:22계속해서 이 분야의 한계를 넓혀가고자 합니다. 관심이 있으시거나 더 알고 싶으시다면
00:02:26저희에게 와서 이야기 나누어 주세요. 참석해 주셔서 대단히 감사합니다.
00:02:46여러분
00:02:56감사합니다.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기