Vorstellung des Stimmenverzerrers
- Veröffentlicht
AnhörenArtikel anhören
Stimmenverzerrer hieß ursprünglich Speech-to-Speech. Im Kontext von KI-Sprachagenten bezeichnet „Speech-to-Speech“ auch verschmolzene Architekturen, bei denen ein einzelnes Modell Audioeingabe und -ausgabe direkt verarbeitet. ElevenAgents nutzt für seine Plattform eine fortschrittliche kaskadierte Architektur. Mehr erfahren: Kaskadierte vs. verschmolzene Modelle.
Stimmenverzerrer
Wir haben Stimmenverzerrer zu Speech Synthesis hinzugefügt. Stimmenverzerrer ist ein Tool zur Stimmkonvertierung, das eine Aufnahme einer Stimme so verändert, dass sie klingt, als würde sie von einer anderen Stimme gesprochen – bei Erhalt der ursprünglichen Darbietung. Das bedeutet: Die Emotionen, das Timing, das Tempo und die Aussprache Ihrer Aufnahme werden auf die Ausgabestimme übertragen.
Damit erhalten Sie ein Maß an Kontrolle, das Text-to-Speech-Prompts allein nicht immer bieten können. Es gibt zwei zentrale Einsatzmöglichkeiten.
Mehr Emotionen aus einer Stimme herausholen. Nicht alle Stimmen reagieren gleich gut auf emotionale Vorgaben durch Text-to-Speech-Prompts. Mit Stimmenverzerrer können Sie besonders ausdrucksstarke Sprache aufnehmen oder hochladen und diese emotionale Bandbreite in einer anderen Stimme nachbilden. Wenn ein professioneller Sprecher wärmer oder eine Figur aus einem Kinderbuch verspielter klingen soll, können Sie die Darbietung selbst einsprechen und Stimmenverzerrer auf die Zielstimme übertragen lassen.
Sprachwiedergabe fein abstimmen. Unsere Text-to-Speech-Modelle beherrschen Intonation in der Regel ohne weitere Anpassung gut. Wenn Sie jedoch präzise steuern müssen, wie eine bestimmte Formulierung gesprochen wird – wo die Betonung liegt, wie eine Pause wirkt, welchen Rhythmus sie hat –, können Sie dies mit Ihrer eigenen Stimme vorgeben und diese Darbietung dann auf jede gewünschte Stimme anwenden. Das wird noch nützlicher, sobald wir Stimmenverzerrer direkt in Studio integrieren. Das Ziel bleibt gleich: präzise Kontrolle über Ihre Ausgabe.
Hier ist eine Anleitung von einem Mitglied unserer Community:
Forschung
Um Quellsprache in Zielsprache umzuwandeln, müssen wir den Inhalt der Quellsprache mit den Eigenschaften der Zielsprache ausdrücken. Eine hilfreiche Analogie ist Face-Swapping: Apps, die zwei Gesichter kombinieren und die Merkmale einer Person innerhalb der abgebildeten Struktur einer anderen darstellen.
Dazu wird das Bild eines Gesichts genommen und seine Attribute werden abgebildet. Die Markierungen im folgenden Beispiel tun genau das – sie definieren die Grenzen, innerhalb derer das andere Gesicht dargestellt würde.
Bei der Stimmkonvertierung besteht der Kniff darin, den Inhalt der Quellsprache mit den Phonemen der Zielsprache wiederzugeben. Dabei gibt es jedoch einen Zielkonflikt, ähnlich wie beim Face-Swapping: Je mehr Markierungen Sie verwenden, um die Attribute eines Gesichts abzubilden, desto mehr Einschränkungen legen Sie dem Gesicht auf, das Sie darin abbilden. Weniger Markierungen bedeuten weniger Einschränkungen.
Dasselbe gilt für die Stimmkonvertierung. Je stärker wir die Zielsprache priorisieren, desto größer ist das Risiko, dass sie nicht mehr mit der Quellsprache übereinstimmt. Priorisieren wir sie jedoch nicht genug, riskieren wir, vieles zu verlieren, was diese Sprache auszeichnet. Würden wir beispielsweise die Aufnahme einer wütend schreienden Person mit einer hauchigen Stimme wiedergeben, entstünde ein Problem. Geben wir den Emotionen der Quellsprache zu viel Gewicht, verlieren wir den Eindruck einer hauchigen Stimme. Betonen wir das hauchige Sprachmuster zu stark, verlieren wir die emotionale Intensität der Quellsprache.
Produkt und aktuelle Updates
Änderungen an vorgefertigten Stimmen
Wir nehmen Änderungen an den Standardstimmen in Speech Synthesis vor. Einige Stimmen werden eingestellt und durch neue ersetzt. In den kommenden Wochen sind mehr als 20 Ergänzungen geplant.
Wir werden in der Benutzeroberfläche auch Informationen dazu bereitstellen, wie lange eine Stimme voraussichtlich verfügbar bleibt. Im Laufe des Dezembers überarbeiten wir unsere Funktionen für das Teilen von Stimmen und die Vergütung ihrer Nutzung, um die Stimmenvielfalt zu erhöhen. Weitere Details folgen.
Eleven Turbo v2 und uLaw-Format mit 8 kHz
Turbo v2 ist das Ergebnis monatelanger Forschung unseres Teams. Es wurde für Echtzeitinteraktionen entwickelt, eignet sich aber für jeden Anwendungsfall. Es unterstützt auch das Standardformat (m)uLaw mit 8 kHz für IVR-Systeme.
Normalisierung und Metadaten mit Studio
Studio unterstützt jetzt branchenübliche Richtlinien für die Einreichung von Hörbüchern, einschließlich Pegelanpassung und dynamischer Kompression. Sie können Metadaten wie ISBN, Autor und Titel auch direkt in Ihr Studio-Projekt einbetten.
Aussprachewörterbuch
Dies war eine unserer meistgefragten Funktionen. Letzten Monat haben wir für unsere englischen Modelle SSML-Tag-Unterstützung hinzugefügt, um die Aussprache mit IPA- und CMU-Wörterbüchern festzulegen. Jetzt ist die Unterstützung für Aussprachewörterbücher in der Studio-Benutzeroberfläche verfügbar. Sie können eine Datei hochladen, die die Aussprache mithilfe von IPA, CMU oder Wortersetzungen (Aliasnamen) festlegt. Wörterbuchdateien verwenden das branchenübliche offene .PLS-Lexikondateiformat.
IPA und CMU werden derzeit von Turbo v2 English unterstützt. Wortersetzungen werden von allen Modellen und Sprachen unterstützt. Die vollständige Dokumentation finden Sie hier.
Wenn Sie Feedback haben, kontaktieren Sie uns gerne auf Discord.
Stimmenverzerrer ausprobieren
Sprechen Sie es so ein, wie Sie möchten, und hören Sie es in einer völlig anderen Stimme – mit voller Kontrolle über die Darbietung. Erfassen Sie Flüstern, Lachen, Akzente und subtile emotionale Nuancen.
Sagen Sie, was Sie möchten, und hören Sie es in einer völlig anderen Stimme – mit voller Kontrolle über die Performance. Erfassen Sie Flüstern, Lachen, Akzente und feine emotionale Nuancen.




