Google DeepMindにおける音声対音声モデルの研究 — Valeria Wu Fon & Tom Ouyang(Google DeepMind)

AAI Engineer
컴퓨터/소프트웨어가전제품/카메라

스크립트

00:00:00雑音のほとんどない密閉された環境ではなく、移動中や電車内、
00:00:04散歩中などでも利用できます。それこそが、音声対話
00:00:08モデルで実現したい体験です。最後に、もうひとつ非常に楽しみしているのが、音声出力だけでなくマルチモーダル
00:00:15出力です。真のAGIによる会話のフロンティアには、
00:00:20視覚的な存在感も不可欠であると考えています。そのため、Cloud NextでCitiと共同で
00:00:26初のパイロットデモを発表できることを嬉しく思います。これはカスタマイズ可能なリアルタイムアバターをサポートしており、
00:00:33超現実的な人間からアニメ風の見た目まで、あらゆるものを好みに合わせてパーソナライズできます。
00:00:38同じ音声対話モデルを搭載しており、ご覧のとおり低遅延で多言語のリップシンクが可能で、
00:00:43視覚的な存在感を伴ったスムーズで自然な会話を続けることができます。それでは
00:00:48デモをお見せしましょう。これまでの要素をすべて組み合わせ、私たちが何に期待しているのかをお伝えします。
00:00:54娘の大学進学資金のことを思い出したんだけど、進捗はどうなっているかな?
00:01:00順調に進んでいますよ、ジャクソン。さらに早く目標を達成できそうな新しい機会も見つかりました。
00:01:06おや、ちょうどリサも参加したようですね。こんにちは、リサ。大学合格が決まってとても喜んでいることでしょう。
00:01:12おめでとうございます。貯蓄の目標が形になっていくのを見るのは素晴らしいですね。
00:01:16素晴らしい、良いニュースですね。いつも冗談で言うのですが、スペイン語でのユーザーの音声は、モデルの音声よりも聞き取りにくいのですが、
00:01:34これは、マルチモーダルな入出力を組み合わせた私たちの取り組みを示すためのものです。
00:01:40例えば、ツール呼び出しを使ってユーザーの関連する事例を引き出したり、
00:01:45会話の流暢さを組み合わせたりすることが、このようなデモで徐々に形になりつつあります。
00:01:50私たちはこのフロンティアを押し広げ続けていきたいと考えています。最後に、私たちからお伝えしたい
00:01:57最後の考えは、AGIはタイピングによってではなく、
00:02:01音声によって実現されるということです。音声対話を実現するためには、単一の
00:02:06プロンプト可能で多様性に優れたモデルの中で多くの要素が連携し、ユーザーがあらゆる会話モードを
00:02:12シームレスに切り替えられるようにする必要があります。翻訳から、アクションの実行、ブレインストーミング、雑談まで、
00:02:17このようなシームレスな切り替えを実現する音声対話モデルの力を私たちは心から信じています。
00:02:22この分野の限界をさらに押し広げていくことを楽しみにしています。もしご興味があれば、
00:02:26ぜひお気軽にお声がけください。本日はご参加いただき誠にありがとうございました。
00:02:56ありがとうございました。

핵심 요약

音声対話モデルは、低遅延で多言語のリップシンクやリアルタイムアバターによる視覚的な存在感を伴い、移動中などの多様な環境でのシームレスな会話を可能にする。

하이라이트

  • 移動中や電車内、散歩中などの環境でも音声対話モデルを利用できる。

  • Cloud NextにおいてCitiと共同でリアルタイムアバターをサポートする初のパイロットデモを発表した。

  • アバターは超現実的な人間からアニメ風の見た目まで好みに合わせてパーソナライズできる。

  • 低遅延で多言語のリップシンクが可能であり、視覚的な存在感を伴った自然な会話を継続できる。

  • AGIはタイピングによってではなく音声によって実現される。

타임라인

音声対話モデルの利用環境とマルチモーダル出力

  • 雑音の少ない環境だけでなく移動中や電車内でも利用できる。
  • 音声出力だけでなくマルチモーダル出力として視覚的な存在感を取り入れている。
  • Cloud NextでCitiと共同の初パイロットデモを発表した。

音声対話モデルは静かな空間に限らず、移動中や散歩中といった日常の様々な場面で利用される。真のAGIによる会話のフロンティアには視覚的な存在感が不可欠であるため、Cloud NextにおいてCitiと共同で初のパイロットデモを発表した。このデモでは超現実的な人間からアニメ風の見た目までパーソナライズ可能なリアルタイムアバターをサポートしている。

リアルタイムアバターによるデモと会話の実現

  • 低遅延で多言語のリップシンクが可能である。
  • 娘の大学進学資金に関する実際の会話デモを実施した。
  • ツール呼び出しや流暢な会話の組み合わせが徐々に形になっている。

デモでは低遅延で多言語のリップシンクを行いながら、視覚的な存在感を伴うスムーズで自然な会話の様子を示した。娘の大学進学資金に関する進捗確認やリサの参加を通じた貯蓄目標の確認など、具体的な場面でのやり取りが行われた。さらにツール呼び出しを活用してユーザーの関連事例を引き出す試みも進行している。

音声によるAGIの実現と今後の展望

  • AGIはタイピングではなく音声によって実現される。
  • 単一のモデルの中で多くの要素が連携して動作する。
  • 翻訳からアクションの実行、ブレインストーミング、雑談までシームレスに切り替える。

音声対話を実現するためには、単一のプロンプト可能で多様性に優れたモデルの中で多くの要素が連携する必要がある。ユーザーがあらゆる会話モードをシームレスに切り替えられるようにすることが目指されている。翻訳、アクションの実行、ブレインストーミング、雑談の間をシームレスに移動する音声対話モデルの力によって、この分野の限界がさらに押し広げられる。

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기