Vorstellung des Stimmenverzerrers
- Veröffentlicht
AnhörenArtikel anhören
Stimmenverzerrer hieß ursprünglich Speech-to-Speech. Im Kontext von KI-Sprachagenten bezeichnet „Speech-to-Speech“ auch verschmolzene Architekturen, bei denen ein einzelnes Modell Audioeingabe und -ausgabe direkt verarbeitet. ElevenAgents nutzt für seine Plattform eine fortschrittliche kaskadierte Architektur. Mehr erfahren: Kaskadierte vs. verschmolzene Modelle.
Stimmenverzerrer
Wir haben Stimmenverzerrer zur Sprachsynthese hinzugefügt. Stimmenverzerrer ist ein Tool zur Stimmkonvertierung, das eine Aufnahme einer Stimme so umwandelt, dass sie klingt, als würde sie von einer anderen Stimme gesprochen – bei Erhalt der ursprünglichen Darbietung. Das bedeutet: Emotionen, Timing, Sprechtempo und Aussprache aus der Aufnahme werden auf die Ausgabestimme übertragen.
So erhalten Sie ein Maß an Kontrolle, das Text-to-Speech-Prompts allein nicht immer bieten können. Es gibt zwei grundlegende Einsatzmöglichkeiten.
Mehr Emotionen aus einer Stimme herausholen. Nicht alle Stimmen reagieren gleich gut auf emotionale Vorgaben per Text-to-Speech-Prompt. Mit Stimmenverzerrer können Sie sehr ausdrucksstarke Sprache aufnehmen oder hochladen und diese emotionale Bandbreite in einer anderen Stimme wiedergeben. Soll ein professioneller Sprecher wärmer klingen oder eine Figur aus einem Kinderbuch verspielter, können Sie die Darbietung selbst einsprechen und von Stimmenverzerrer auf die Zielstimme übertragen lassen.
Sprachliche Darbietung fein abstimmen. Unsere Text-to-Speech-Modelle erzeugen in der Regel sofort eine gute Intonation. Wenn Sie jedoch genau steuern müssen, wie eine bestimmte Formulierung gesprochen wird – wo die Betonung liegt, wie eine Pause wirkt, welchen Rhythmus sie hat –, können Sie dies mit Ihrer eigenen Stimme vormachen und die Darbietung anschließend auf jede beliebige Stimme übertragen. Das wird noch nützlicher, sobald wir Stimmenverzerrer direkt in Studio integrieren. Das Ziel bleibt aber gleich: präzise Kontrolle über Ihre Ausgabe.
Hier ist eine Anleitung von einem Mitglied unserer Community:
Forschung
Um Quellsprache in Zielsprache umzuwandeln, müssen wir den Inhalt der Quellsprache mit den Eigenschaften der Zielsprache ausdrücken. Eine hilfreiche Analogie ist Face-Swapping: Apps, die zwei Gesichter aufnehmen und miteinander verschmelzen, indem sie die Merkmale einer Person innerhalb der abgebildeten Struktur einer anderen darstellen.
Dafür nimmt man das Bild eines Gesichts und ordnet seine Attribute zu. Die Markierungen im folgenden Beispiel tun genau das – sie begrenzen den Bereich, in dem das andere Gesicht dargestellt würde.
Bei der Stimmkonvertierung besteht der Trick darin, den Inhalt der Quellsprache mit den Phonemen der Zielsprache wiederzugeben. Dabei gibt es jedoch einen Zielkonflikt, ähnlich wie beim Face-Swapping: Je mehr Markierungen Sie verwenden, um die Attribute eines Gesichts abzubilden, desto mehr Einschränkungen legen Sie dem Gesicht auf, das Sie darin abbilden. Weniger Markierungen bedeuten weniger Einschränkungen.
Dasselbe gilt für die Stimmkonvertierung. Je stärker wir die Zielsprache gewichten, desto größer ist das Risiko, dass sie nicht mehr mit der Quellsprache übereinstimmt. Gewichten wir sie aber nicht stark genug, riskieren wir, viel von dem zu verlieren, was diese Sprache charakteristisch macht. Wenn wir etwa die Aufnahme einer Person, die wütend schreit, mit einer hauchenden Stimme wiedergeben würden, entstünde ein Problem. Geben wir den Emotionen der Quellsprache zu viel Gewicht, verlieren wir den Eindruck, dass eine hauchende Stimme spricht. Betonen wir das hauchende Sprachmuster zu stark, verlieren wir die emotionale Wirkung der Quellsprache.
Produkt und aktuelle Updates
Änderungen bei vorgefertigten Stimmen
Wir ändern die standardmäßig in der Sprachsynthese verfügbaren Stimmen. Einige Stimmen werden eingestellt und durch neue ersetzt. In den kommenden Wochen sind über 20 neue Stimmen geplant.
Außerdem zeigen wir in der Benutzeroberfläche an, wie lange jede Stimme voraussichtlich verfügbar bleibt. Im Laufe des Dezembers überarbeiten wir Funktionen für das Teilen von Stimmen und die Vergütung ihrer Nutzung, um die Stimmenvielfalt zu verbessern. Weitere Details folgen.
Eleven Turbo v2 & uLaw-Format mit 8 kHz
Turbo v2 ist das Ergebnis monatelanger Forschung unseres Teams. Es wurde für Echtzeitinteraktionen entwickelt, eignet sich jedoch für jeden Anwendungsfall. Außerdem unterstützt es das Standardformat (m)uLaw mit 8 kHz für IVR-Systeme.
Normalisierung und Metadaten mit Studio
Studio unterstützt jetzt branchenübliche Richtlinien für die Einreichung von Hörbüchern, einschließlich Pegelanpassung und dynamischer Kompression. Sie können Metadaten wie ISBN, Autor und Titel auch direkt in Ihr Studio-Projekt einbetten.
Aussprachewörterbuch
Dies war eine unserer meistgewünschten Funktionen. Im vergangenen Monat haben wir unsere englischen Modelle um die Unterstützung von SSML-Tags ergänzt, mit denen sich die Aussprache über IPA- und CMU-Wörterbücher festlegen lässt. Nun haben wir die Unterstützung für Aussprachewörterbücher in der Studio-Benutzeroberfläche veröffentlicht. Damit können Sie eine Datei hochladen, die die Aussprache über IPA, CMU oder Wortersetzungen (Aliasse) festlegt. Wörterbuchdateien verwenden das offene, branchenübliche .PLS-Lexikon-Dateiformat.
IPA und CMU werden derzeit von Turbo v2 English unterstützt. Wortersetzungen werden von allen Modellen und Sprachen unterstützt. Die vollständige Dokumentation finden Sie hier.
Bei Feedback erreichen Sie uns jederzeit auf Discord.
Stimmenverzerrer ausprobieren
Sprechen Sie es so ein, wie Sie möchten, und hören Sie es mit vollständiger Kontrolle über die Darbietung in einer völlig anderen Stimme. Erfassen Sie Flüstern, Lachen, Akzente und subtile emotionale Nuancen.
Sagen Sie, was Sie möchten, und hören Sie es in einer völlig anderen Stimme – mit voller Kontrolle über die Performance. Erfassen Sie Flüstern, Lachen, Akzente und feine emotionale Nuancen.




