Google DeepMindにおける音声対音声モデルの研究 — Valeria Wu Fon & Tom Ouyang(Google DeepMind)
AAI Engineer
컴퓨터/소프트웨어가전제품/카메라
스크립트
00:00:00雑音のほとんどない密閉された環境ではなく、移動中や電車内、
00:00:04散歩中などでも利用できます。それこそが、音声対話
00:00:08モデルで実現したい体験です。最後に、もうひとつ非常に楽しみしているのが、音声出力だけでなくマルチモーダル
00:00:15出力です。真のAGIによる会話のフロンティアには、
00:00:20視覚的な存在感も不可欠であると考えています。そのため、Cloud NextでCitiと共同で
00:00:26初のパイロットデモを発表できることを嬉しく思います。これはカスタマイズ可能なリアルタイムアバターをサポートしており、
00:00:33超現実的な人間からアニメ風の見た目まで、あらゆるものを好みに合わせてパーソナライズできます。
00:00:38同じ音声対話モデルを搭載しており、ご覧のとおり低遅延で多言語のリップシンクが可能で、
00:00:43視覚的な存在感を伴ったスムーズで自然な会話を続けることができます。それでは
00:00:48デモをお見せしましょう。これまでの要素をすべて組み合わせ、私たちが何に期待しているのかをお伝えします。
00:00:54娘の大学進学資金のことを思い出したんだけど、進捗はどうなっているかな?
00:01:00順調に進んでいますよ、ジャクソン。さらに早く目標を達成できそうな新しい機会も見つかりました。
00:01:06おや、ちょうどリサも参加したようですね。こんにちは、リサ。大学合格が決まってとても喜んでいることでしょう。
00:01:12おめでとうございます。貯蓄の目標が形になっていくのを見るのは素晴らしいですね。
00:01:16素晴らしい、良いニュースですね。いつも冗談で言うのですが、スペイン語でのユーザーの音声は、モデルの音声よりも聞き取りにくいのですが、
00:01:34これは、マルチモーダルな入出力を組み合わせた私たちの取り組みを示すためのものです。
00:01:40例えば、ツール呼び出しを使ってユーザーの関連する事例を引き出したり、
00:01:45会話の流暢さを組み合わせたりすることが、このようなデモで徐々に形になりつつあります。
00:01:50私たちはこのフロンティアを押し広げ続けていきたいと考えています。最後に、私たちからお伝えしたい
00:01:57最後の考えは、AGIはタイピングによってではなく、
00:02:01音声によって実現されるということです。音声対話を実現するためには、単一の
00:02:06プロンプト可能で多様性に優れたモデルの中で多くの要素が連携し、ユーザーがあらゆる会話モードを
00:02:12シームレスに切り替えられるようにする必要があります。翻訳から、アクションの実行、ブレインストーミング、雑談まで、
00:02:17このようなシームレスな切り替えを実現する音声対話モデルの力を私たちは心から信じています。
00:02:22この分野の限界をさらに押し広げていくことを楽しみにしています。もしご興味があれば、
00:02:26ぜひお気軽にお声がけください。本日はご参加いただき誠にありがとうございました。
00:02:56ありがとうございました。
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기