Google DeepMind의 음성 대 음성(Speech-to-Speech) 모델 연구 — 발레리아 우 퐁 & 톰 오양, Google DeepMind

AAI Engineer
Computing/SoftwareConsumer Electronics

Transcript

00:00:00소음 없이 격리된 환경이 아니라, 이동 중이거나 기차 안에서, 산책을 하면서
00:00:04음성 대화 모델을 통해 구현하고자 하는 경험들이 바로 이런 것들입니다.
00:00:08마지막으로 정말 기대하고 있는 또 다른 부분은 음성 출력뿐만 아니라 멀티모달 출력입니다.
00:00:15진정한 AGI 대화의 최전선에는 시각적인 존재감 역시 필요할 것이라고 믿습니다.
00:00:20그래서 다음 클라우드(Cloud Next)에서 시티(Citi)와 함께 첫 번째 파일럿 데모를 선보이게 되었습니다.
00:00:26맞춤형 실시간 아바타를 지원하며, 극사실적인 인간부터 만화 같은 외형까지 원하는 대로 개인화할 수 있습니다.
00:00:33그 사이의 모든 모습도 가능하며, 앞서 보여드렸던 것과 동일한 음성 대화 모델로 구동됩니다.
00:00:38이를 통해 저지연 다국어 립싱크가 가능하며,
00:00:43시각적 존재감을 갖춘 자연스럽고 유연한 대화가 이어지는 것을 보실 수 있습니다. 그럼 하나 보여드리겠습니다.
00:00:48이 데모는 우리의 벤다이어그램을 하나로 모아주며, 우리가 이 모든 것에 열광하는 이유를 보여줍니다.
00:00:54딸아이 대학 등록금 기금이 생각나네요. 목표에 맞춰 잘 모이고 있나요?
00:01:00잘 준비되고 있습니다, 잭슨. 더 빨리 목표를 달성할 수 있는 새로운 기회도 찾아냈어요.
00:01:06아, 리사도 들어왔네요. 안녕하세요, 리사! 대학 합격 소식에 정말 기뻐하겠어요.
00:01:12축하해요. 저축 목표가 현실이 되는 걸 보니 정말 기쁩니다.
00:01:16훌륭합니다, 좋은 소식이네요. 스페인어를 사용하는 사용자의 오디오가 모델의 응답 음성보다 안 좋다고 늘 농담하곤 하지만요.
00:01:34이것은 멀티모달 입출력을 결합한 우리의 벤다이어그램이 어떻게 구현되는지 보여드리기 위한 것입니다.
00:01:40툴 콜링을 통해 사용자의 관련 예시를 불러오고,
00:01:45대화의 유연성도 함께 이러한 유형의 데모에서 서서히 하나로 어우러지고 있습니다.
00:01:50이러한 한계를 계속해서 넓혀나갈 수 있게 되어 기쁘며, 마지막으로 전하고 싶은 생각은 이렇습니다.
00:01:57우리는 AGI가 타이핑되는 것이 아니라 음성으로 이루어질 것이라고 믿습니다.
00:02:01음성 중심이 되기 위해서는 하나의 프롬프트로 다루기 다재다능한 모델 안에서 많은 기능이 함께 작동해야 합니다.
00:02:06사용자가 번역, 실행, 브레인스토밍, 잡담 등 온갖 종류의 대화 모드 사이를 매끄럽게 전환할 수 있어야 하죠.
00:02:12우리는 이러한 음성 대화 모델의 힘을 통해 원활한 전환을 이룰 수 있다고 굳게 믿고 있습니다.
00:02:17이러한 원활한 전환을 실현하는 음성 모델의 힘을 믿기에,
00:02:22계속해서 이 분야의 한계를 넓혀가고자 합니다. 관심이 있으시거나 더 알고 싶으시다면
00:02:26저희에게 와서 이야기 나누어 주세요. 참석해 주셔서 대단히 감사합니다.
00:02:46여러분
00:02:56감사합니다.

Key Takeaway

구글 DeepMind는 음성 대화 모델과 시각적 아바타, 툴 콜링을 결합한 멀티모달 음성 대화 기술의 최전선과 실시간 데모를 선보였다.

Highlights

  • 구글 클라우드 넥스트(Cloud Next)에서 시티(Citi)와 함께 맞춤형 실시간 아바타를 지원하는 첫 번째 파일럿 데모를 선보였다.

  • 극사실적인 인간부터 만화 같은 외형까지 원하는 대로 아바타를 개인화할 수 있다.

  • 저지연 다국어 립싱크를 지원하여 시각적 존재감을 갖춘 자연스럽고 유연한 대화가 가능하다.

  • 툴 콜링을 통해 사용자의 관련 예시를 불러오고 대화 모드 사이를 매끄럽게 전환한다.

  • AGI는 타이핑이 아니라 음성을 중심으로 이루어질 것이다.

Timeline

멀티모달 음성 대화 모델과 실시간 아바타 데모

  • 이동 중이나 산책 중에도 소음 격리 환경 없이 음성 대화 모델을 경험할 수 있다.
  • 음성 출력뿐만 아니라 멀티모달 출력을 통해 진정한 AGI 대화의 시각적 존재감을 구현한다.
  • 구글 클라우드 넥스트에서 시티와 함께 극사실적 인간부터 만화 외형까지 개인화 가능한 실시간 아바타 데모를 공개했다.
  • 저지연 다국어 립싱크를 바탕으로 시각적 존재감을 갖춘 자연스러운 대화가 이어진다.

음성 대화 기술은 조용한 환경을 벗어나 일상적인 상황에서 활용되는 것을 목표로 한다. 여기에 시각적 존재감이 더해져 구글 클라우드 넥스트 행사에서 시티와의 파일럿 데모로 공개되었다. 사용자는 극사실적 외형부터 만화 스타일까지 아바타를 원하는 대로 개인화할 수 있으며, 저지연 다국어 립싱크 기술이 적용되어 유연한 상호작용이 가능하다.

툴 콜링과 음성 중심의 AGI 비전

  • 멀티모달 입출력을 결합하여 툴 콜링으로 사용자의 관련 예시를 불러온다.
  • 번역, 실행, 브레인스토밍, 잡담 등 온갖 대화 모드 사이를 매끄럽게 전환한다.
  • AGI는 타이핑이 아니라 음성을 통해 이루어질 것이다.

멀티모달 입력과 출력이 결합된 시스템은 툴 콜링 기능을 활용해 사용자의 구체적인 데이터와 예시를 대화 속에 실시간으로 연동한다. 하나의 다재다능한 모델 안에서 번역과 브레인스토밍 같은 다양한 모드가 원활하게 전환되며, 향후 AGI의 중심은 타이핑이 아니라 음성 인터페이스가 될 것이라는 비전을 제시한다.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video