Speech-to-Speech-Modellforschung bei Google DeepMind — Valeria Wu Fon & Tom Ouyang, Google DeepMind

AAI Engineer
Computing/SoftwareConsumer Electronics

Transcript

00:00:00ganz ohne Rauschen, wissen Sie, in einer abgeschlossenen Umgebung, die passieren unterwegs im Zug, während
00:00:04Sie spazieren gehen, und das ist die Art von Erfahrung, die wir mit dem Speech-to-Speech-
00:00:08Modell ermöglichen wollen. Schließlich ist ein weiterer Punkt, der uns sehr begeistert, nicht nur Voice-Out, sondern auch multimodaler
00:00:15Output. Wir glauben, dass die wahre AGI-Konversationsgrenze auch
00:00:20eine visuelle Präsenz erfordert. Deshalb freuen wir uns, unsere erste Art von Pilotdemo mit Citi im Cloud Next
00:00:26zu starten, das angepasste Echtzeit-Avatare unterstützt und bei dem man so ziemlich alles personalisieren kann, von einem
00:00:33hyperrealistischen Menschen bis hin zu einem Cartoon-Aussehen und allem dazwischen, angetrieben vom selben
00:00:38Speech-to-Speech-Modell, das wir gezeigt haben. Es ermöglicht eine geringe Latenz, mehrsprachiges Lippensynchronisieren
00:00:43und eine wirklich flüssige Unterhaltung, die eine visuelle Präsenz hat. Lassen Sie mich
00:00:48Ihnen also eine Demo zeigen, die auch unser Venn-Diagramm zusammenführt und warum uns all das so begeistert.
00:00:54Das erinnert mich an den College-Fonds meiner Tochter. Wie sieht es damit aus?
00:01:00Du bist auf einem guten Weg, Jackson. Ich habe auch eine neue Möglichkeit identifiziert, die dich vielleicht noch schneller ans Ziel bringt.
00:01:06Oh, und ich sehe, Lisa ist gerade dazugekommen. Hallo Lisa, sie muss sich riesig über ihre College-Zulassung freuen.
00:01:12Herzlichen Glückwunsch, es ist wunderbar zu sehen, wie sich deine Sparziele erfüllen.
00:01:16Ausgezeichnet, das sind gute Neuigkeiten. Ich scherze immer darüber, dass das Audio des Benutzers auf Spanisch schlechter ist als das Audio
00:01:34des sprechenden Modells, aber das soll im Grunde nur zeigen, wie unser Venn-Diagramm aus der Kombination von
00:01:40Multimodalität (In und Out), Tool-Aufrufen zum Abrufen relevanter Beispiele des Benutzers
00:01:45sowie konversationaler Fluidität langsam in diesen Arten von Demos
00:01:50zusammenfindet, und wir freuen uns darauf, die Grenzen weiter zu verschieben. Mit diesem abschließenden Gedanken – als letzter
00:01:57Gedanke, den wir für Sie haben: Wir glauben, dass AGI nicht getippt, sondern
00:02:01gesprochen werden wird. Und damit es gesprochen wird, müssen viele Dinge in einem einzigen,
00:02:06promptfähigen und vielseitigen Modell zusammenarbeiten, das es dem Benutzer erlaubt, zwischen allen möglichen Konversationsmodi
00:02:12zu wechseln, die wir betrachten – von Übersetzung über Handeln bis hin zu Brainstorming und Sinnieren – und wir
00:02:17glauben fest an die Kraft dieser Speech-to-Speech-Modelle, einen solchen nahtlosen Wechsel zu erreichen.
00:02:22Daher freuen wir uns, hier die Grenzen weiter zu verschieben. Wenn Sie also begeistert sind oder mehr erfahren möchten,
00:02:26sprechen Sie uns gerne an und vielen Dank fürs Kommen!
00:02:46Sie
00:02:56Danke.

Key Takeaway

Speech-to-Speech-Modelle ermöglichen durch die Kombination von Multimodalität und Echtzeit-Avataren nahtlose Übergänge zwischen verschiedenen Konversationsmodi wie Übersetzung und Handeln.

Highlights

  • Das Speech-to-Speech-Modell ermöglicht Unterhaltungen in realen Umgebungen wie Zügen oder während des Gehens ganz ohne störendes Rauschen.

  • Eine Pilotdemo mit Citi im Cloud Next unterstützt angepasste Echtzeit-Avatare von hyperrealistischen Menschen bis hin zu Cartoon-Designs.

  • Das Modell zeichnet sich durch geringe Latenz, mehrsprachiges Lippensynchronisieren und eine flüssige Unterhaltung mit visueller Präsenz aus.

  • Die Kombination aus Multimodalität, Tool-Aufrufen zum Abrufen von Benutzerbeispielen und konversationaler Fluidität bildet die Grundlage des Systems.

  • Künstliche allgemeine Intelligenz wird zukünftig primär gesprochen statt getippt.

Timeline

Grundlagen und multimodale Avatare

  • Das Modell funktioniert in lauten Umgebungen wie Zügen oder beim Spazierengehen.
  • Eine multimodale Ausgabe erfordert eine visuelle Präsenz für eine echte Konversationsgrenze.
  • Die Pilotdemo mit Citi unterstützt personalisierbare Echtzeit-Avatare mit geringer Latenz.

Die Entwicklung zielt darauf ab, Sprachanwendungen unabhängig von Umgebungsgeräuschen im Alltag nutzbar zu machen. Um eine umfassende Konversationserfahrung zu schaffen, wird neben der Sprache auch eine visuelle Komponente integriert. Durch die Partnerschaft mit Citi bei Cloud Next werden hyperrealistische Menschen und Cartoon-Avatare über dasselbe Speech-to-Speech-Modell angetrieben.

Demonstration und praktische Anwendung

  • Finanzielle Themen wie College-Fonds lassen sich direkt im Gespräch adressieren.
  • Das System bindet zusätzliche Benutzer und neue Sparziele nahtlos in die Konversation ein.
  • Audio-Eingaben des Benutzers auf Spanisch zeigen die Robustheit des Systems.

Eine Live-Demonstration zeigt die praktische Anwendung des Modells im Finanzbereich, bei der Kontostände und Sparziele für Familienmitglieder besprochen werden. Trotz unterschiedlicher Sprachqualität der Benutzer bewältigt das Modell die Interaktion flüssig. Dies demonstriert das Zusammenwachsen von Multimodalität, externen Tool-Aufrufen und hoher Sprachfluidität.

Zukunftsperspektiven der Sprach-KI

  • Künstliche allgemeine Intelligenz basiert auf gesprochener Interaktion.
  • Ein einziges, promptfähiges Modell unterstützt Modi wie Übersetzung, Handeln und Brainstorming.
  • Speech-to-Speech-Modelle treiben den nahtlosen Moduswechsel voran.

Die zukünftige Entwicklung von Systemen setzt auf Sprache als primäre Schnittstelle anstelle von Texteingaben. Ein vielseitiges Modell integriert diverse Modi von der einfachen Übersetzung bis hin zu komplexen Handlungen und dem Sinnieren. Die kontinuierliche Verschiebung der technologischen Grenzen soll diese nahtlosen Übergänge ermöglichen.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video