Speech-to-Speech-Modellforschung bei Google DeepMind — Valeria Wu Fon & Tom Ouyang, Google DeepMind
AAI Engineer
컴퓨터/소프트웨어가전제품/카메라
스크립트
00:00:00ganz ohne Rauschen, wissen Sie, in einer abgeschlossenen Umgebung, die passieren unterwegs im Zug, während
00:00:04Sie spazieren gehen, und das ist die Art von Erfahrung, die wir mit dem Speech-to-Speech-
00:00:08Modell ermöglichen wollen. Schließlich ist ein weiterer Punkt, der uns sehr begeistert, nicht nur Voice-Out, sondern auch multimodaler
00:00:15Output. Wir glauben, dass die wahre AGI-Konversationsgrenze auch
00:00:20eine visuelle Präsenz erfordert. Deshalb freuen wir uns, unsere erste Art von Pilotdemo mit Citi im Cloud Next
00:00:26zu starten, das angepasste Echtzeit-Avatare unterstützt und bei dem man so ziemlich alles personalisieren kann, von einem
00:00:33hyperrealistischen Menschen bis hin zu einem Cartoon-Aussehen und allem dazwischen, angetrieben vom selben
00:00:38Speech-to-Speech-Modell, das wir gezeigt haben. Es ermöglicht eine geringe Latenz, mehrsprachiges Lippensynchronisieren
00:00:43und eine wirklich flüssige Unterhaltung, die eine visuelle Präsenz hat. Lassen Sie mich
00:00:48Ihnen also eine Demo zeigen, die auch unser Venn-Diagramm zusammenführt und warum uns all das so begeistert.
00:00:54Das erinnert mich an den College-Fonds meiner Tochter. Wie sieht es damit aus?
00:01:00Du bist auf einem guten Weg, Jackson. Ich habe auch eine neue Möglichkeit identifiziert, die dich vielleicht noch schneller ans Ziel bringt.
00:01:06Oh, und ich sehe, Lisa ist gerade dazugekommen. Hallo Lisa, sie muss sich riesig über ihre College-Zulassung freuen.
00:01:12Herzlichen Glückwunsch, es ist wunderbar zu sehen, wie sich deine Sparziele erfüllen.
00:01:16Ausgezeichnet, das sind gute Neuigkeiten. Ich scherze immer darüber, dass das Audio des Benutzers auf Spanisch schlechter ist als das Audio
00:01:34des sprechenden Modells, aber das soll im Grunde nur zeigen, wie unser Venn-Diagramm aus der Kombination von
00:01:40Multimodalität (In und Out), Tool-Aufrufen zum Abrufen relevanter Beispiele des Benutzers
00:01:45sowie konversationaler Fluidität langsam in diesen Arten von Demos
00:01:50zusammenfindet, und wir freuen uns darauf, die Grenzen weiter zu verschieben. Mit diesem abschließenden Gedanken – als letzter
00:01:57Gedanke, den wir für Sie haben: Wir glauben, dass AGI nicht getippt, sondern
00:02:01gesprochen werden wird. Und damit es gesprochen wird, müssen viele Dinge in einem einzigen,
00:02:06promptfähigen und vielseitigen Modell zusammenarbeiten, das es dem Benutzer erlaubt, zwischen allen möglichen Konversationsmodi
00:02:12zu wechseln, die wir betrachten – von Übersetzung über Handeln bis hin zu Brainstorming und Sinnieren – und wir
00:02:17glauben fest an die Kraft dieser Speech-to-Speech-Modelle, einen solchen nahtlosen Wechsel zu erreichen.
00:02:22Daher freuen wir uns, hier die Grenzen weiter zu verschieben. Wenn Sie also begeistert sind oder mehr erfahren möchten,
00:02:26sprechen Sie uns gerne an und vielen Dank fürs Kommen!
00:02:46Sie
00:02:56Danke.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기