Wir stellen Eleven v4 vorLernen Sie Eleven v4 kennen, unser bisher ausdrucksstärkstes Modell. Mit 3× Credits im Creator+-Tarif bis zum 12. Oktober

Zum Inhalt springen

Aussprachewörterbuch: Jedes Wort in TTS mit Eleven v4 korrigieren

Verfasst von
Jack Limebear
Veröffentlicht

AnhörenArtikel anhören

Eleven v4 setzt neue Maßstäbe bei der Aussprache von Text to Speech-Modellen und verarbeitet Abkürzungen, Fachbegriffe, Namen und mehrsprachige Texte präziser als jedes Modell zuvor. Dennoch hat jede Marke ihren eigenen Wortschatz – von einzigartigen Produktnamen bis zu branchenspezifischem Jargon. Deshalb möchten Sie genau steuern, wie diese Wörter klingen.

Eleven v4 bietet verschiedene Möglichkeiten zur Korrektur der Aussprache und gibt Ihnen präzise Kontrolle darüber, wie das Modell spricht. Sie können ein umfassendes Aussprachewörterbuch erstellen, das für jedes Skript in der TTS-App gilt. Oder Sie schreiben IPA direkt in Ihren Text, um eine einmalige Korrektur vorzunehmen. 

Hier ist ein kurzes Beispiel für Eleven v4 mit einem Skript voller anspruchsvoller Begriffe:

At 2:47 A.M., Siobhan Lester's phone lit up. The search service on the Kubernetes cluster was timing out. She read the pod logs and found the cause in Tuesday's release. A new fuzzy matching feature compared every query against the entire product catalog using Levenshtein distance, so each search took 1,400 milliseconds, well past the one-second limit. Her lead, a purist who quotes Dijkstra and Euler in code reviews, wanted to rewrite the matcher from scratch. Instead, she rolled back to Monday's build, and by 3:30 A.M., the rollback was live and response times were back under 50 milliseconds. The proper fix, an index that narrows each search to close matches, shipped in Thursday's release.
0:00

Dieser Leitfaden zeigt, wie Sie ein TTS-Aussprachewörterbuch erstellen und verwenden – sowie weitere Strategien, mit denen Ihr Audio möglichst genau Ihren Vorstellungen entspricht. 

Zusammenfassung

  • Ein Aussprachewörterbuch ist eine Sammlung von Regeln, mit denen Sie einem Text to Speech-Modell vorgeben, wie bestimmte Wörter oder Phrasen ausgesprochen werden sollen.
  • TTS-Aussprache-Regeln sind entweder aliasbasiert, wobei anderer Text eingesetzt wird, oder phonembasiert, wobei eine phonetische Schreibweise verwendet wird.
  • Eleven v4 unterstützt Phonemregeln und Inline-IPA (Internationales Phonetisches Alphabet).
  • SSML-Phonem- und Break-Tags funktionieren in Eleven v4 nicht. Sie können aber ein Aussprachewörterbuch oder Audio Tags als natürlichsprachliche Alternative verwenden.
  • Sie können über ElevenAPI bis zu drei Aussprachewörterbücher pro Anfrage anwenden.

Was ist ein Aussprachewörterbuch?

Ein Aussprachewörterbuch ist ein Tool, mit dem Sie genau festlegen können, wie ein Text to Speech-Modell bestimmte Wörter ausspricht. Indem Sie bestimmte Wörter oder Phrasen hinzufügen, bestimmen Sie, wie sie klingen, wenn sie in einem TTS-Skript vorkommen. 

Aussprachewörterbücher werden typischerweise verwendet für:

  • Markennamen: Markennamen sind ein häufiger Eintrag in Aussprachewörterbüchern, besonders bei einzigartigen oder ungewöhnlichen Schreibweisen.
  • Akronyme: Bestimmte Akronyme haben eine festgelegte Aussprache. AEO sollte zum Beispiel wie /ˌeɪ.iːˈoʊ/ („A-E-O“) und nicht wie /eɪˈjoʊ/ („ay-yo“) klingen. Eine verbindliche Wörterbuchregel stellt sicher, dass das Modell es jedes Mal richtig ausspricht.
  • Ortsnamen und andere Eigennamen: Manche Ortsnamen klingen ganz anders, als Sie beim Lesen vermuten würden. Worcestershire ist ein bekanntes Beispiel, bei dem ein Ausspracheleitfaden Probleme vermeiden kann.
  • Branchenbegriffe: Branchenjargon oder Fachbegriffe etwa aus Medizin oder Recht können von einem Aussprachewörterbuch profitieren, wenn das Modell nicht gezielt mit Daten aus diesen Bereichen trainiert wurde. 

Außerhalb von Text to Speech sind Aussprachewörterbücher meist per Crowdsourcing erstellte Sammlungen von Audioclips mit Muttersprachlern. Lernende nutzen sie, um zu hören, wie bestimmte Wörter ausgesprochen werden.

Different uses of pronunciation dictionaries in TTS apps

So steuern Sie die TTS-Aussprache in Eleven v4

Eleven v4 wird von Artificial Analysis' Provider Voice Arena als Text to Speech-Modell mit der höchsten Qualität bewertet.1 Eleven v4 ist unter anderem deshalb Marktführer, weil das Modell komplexe Texte verarbeiten kann und die Ausgabe dabei natürlich klingt. 

Für die bestmögliche Erfahrung mit Eleven v4 bietet das Modell verschiedene Möglichkeiten, die Aussprache anzupassen. So entspricht jede Ausgabe Ihren Anforderungen an Genauigkeit. 

So können Sie die Aussprache mit Eleven v4 steuern:

  • Inline-IPA: Sie können IPA zwischen Schrägstrichen in Ihre Skripte schreiben, um die Aussprache ohne Aussprachewörterbuch festzulegen. Wie das geht, erläutern wir gleich.
  • Phonemregeln in Wörterbüchern: Schreiben Sie phonetische Regeln in Ihre Aussprachewörterbücher, um den Klang wiederkehrender Wörter zu steuern.
  • Flüssige Aussprache in allen Sprachen: Eleven v4 kann natürlich klingende Sprache in über 90 Sprachen erzeugen. Behalten Sie die muttersprachliche Aussprache jeder Sprache bei und verwenden Sie dieselbe Stimme für ein einheitliches akustisches Branding.

So schneiden die verschiedenen ElevenLabs-TTS-Modelle bei der Aussprachekontrolle ab:

Modell

Alias-Regeln (Wörterbuch)

Phonemregeln (Wörterbuch)

Inline-IPA (/.../)

SSML-Phonem-Tags (<phoneme>)

Eleven v4

Ja

Ja

Ja

Nein

Eleven v4 Turbo

Ja

Ja

Ja

Nein

Eleven v3

Ja

Ja

Ja

Nein

Eleven Flash v2

Ja

Ja

Nein

Ja (nur Englisch)

Eleven Turbo v2

Ja

Nein

Nein

Ja (nur Englisch)

Eleven Multilingual v2

Ja

Nein

Nein

Nein

Pronunciation dictionary guide on ElevenLabs across different models

Was ist der Unterschied zwischen Alias- und Phonemregeln in einem Aussprachewörterbuch?

Alias-Aussprache-Regeln ersetzen einen Text durch einen anderen, bevor das Modell das Wort ausspricht. Dies geschieht im Hintergrund, wenn ein Modell Audio generiert: Der Klang eines Worts oder einer Phrase wird durch den Eintrag in Ihrem Aussprachewörterbuch ersetzt. 

Hier sind einige Beispiele für Alias-Aussprache-Regeln:

  • „SaaS“ wird zu „sass“
  • „UN“ wird zu „United Nations“
  • „OAuth“ wird zu „oh auth“

Phonemregeln hingegen geben dem Modell eine genaue phonetische Schreibweise vor. Sie sind schwieriger zu erstellen, da Sie die IPA-Transkription selbst schreiben oder generieren und in Ihr Wörterbuch eintragen müssen. Zum Beispiel wird „Kubernetes“ zu /ˌkuː.bərˈnɛt.iːz/.

So korrigieren Sie die Aussprache eines Markennamens in einem TTS-Modell

Markennamen gehören zu den häufigsten Einträgen in Aussprachewörterbüchern, da sie nicht immer echte Wörter sind. Wenn Ihr Unternehmen ein Wort oder eine einzigartige Schreibweise für Ihre Marke erfunden hat, können TTS-Modelle Schwierigkeiten mit der korrekten Aussprache haben. Denn es gibt nur wenige zugängliche Trainingsdaten mit genau dieser Aussprache.

So korrigieren Sie die Aussprache eines Markennamens in Eleven v4:

  1. Standardaussprache testen: Öffnen Sie die Text to Speech-App und schreiben Sie Ihren Markennamen. Generieren Sie einen Clip und hören Sie sich an, wie er klingt. Wenn die Aussprache falsch ist, fahren Sie mit dem nächsten Schritt fort. 
  2. Alias-Regel testen: Der einfachste Weg, einen Aussprachefehler bei einer Marke zu korrigieren, ist eine Alias-Regel. Sie sind schnell erstellt und intuitiv.
  3. Zu einer Phonemregel wechseln: Wenn Ihre Alias-Regel nicht ganz funktioniert, verwenden Sie IPA. Transkribieren Sie Ihren Markennamen mit IPA und erstellen Sie dann im Text to Speech-Aussprachewörterbuch eine Regel zur Korrektur der Aussprache.
  4. Alle Groß- und Kleinschreibungen abdecken: Geben Sie die IPA-Transkription sowohl für die kleingeschriebene als auch die großgeschriebene Version Ihres Markennamens an, falls Sie beide verwenden.
  5. Inline-IPA für einmalige Änderungen verwenden: Wenn Sie nur eine schnelle Korrektur für eine einmalige Generierung brauchen, können Sie die IPA direkt in Ihr Skript einfügen, statt einen Wörterbucheintrag zu konfigurieren.

Nachdem Sie eine Regel für einen Markennamen erstellt haben, ist sie künftig in jedem geteilten Projekt verfügbar – ob in Ihrem KI-Agenten oder über eine API.

So erstellen Sie ein Aussprachewörterbuch mit ElevenLabs

Sie können ein Aussprachewörterbuch erstellen, indem Sie Regeln in der Text to Speech-App hinzufügen, eine .pls-Datei hochladen oder ElevenAPI verwenden. In diesem Leitfaden behandeln wir die erste Option, die nur wenige Schritte benötigt.

Title slide: “How to create a pronunciation dictionary,” by ElevenLabs and ElevenCreative.

So erstellen Sie ein Aussprachewörterbuch:

  1. Bereich für Aussprachewörterbücher öffnen: Klicken Sie auf der Text to Speech-Seite auf die Suchleiste oben, geben Sie „Pronunciation dictionary“ ein und wählen Sie unter Actions die Option Pronunciation dictionaries.
  2. Wörterbuch erstellen oder auswählen: Klicken Sie auf New, um ein neues Wörterbuch zu erstellen, oder wählen Sie links ein vorhandenes aus der Liste aus. 
  3. Regel hinzufügen: Klicken Sie auf Add rule, um eine neue Zeile zu erstellen. Geben Sie das zu korrigierende Wort ein. Tragen Sie das Wort oder die Phrase genau so in das Feld Input ein, wie sie in Ihren Skripten vorkommt. Regeln unterscheiden zwischen Groß- und Kleinschreibung, verwenden Sie also die passende Schreibweise. 
  4. Regeltyp auswählen: Wählen Sie Alias, um anderen Text einzusetzen, oder Phoneme, um eine IPA- oder CMU-Schreibweise einzugeben. 
  5. Ersetzung eingeben: Geben Sie den Alias oder die phonetische Schreibweise in das Feld Output ein. Verwenden Sie die Sprachauswahl oben im Bereich, um die Regel mit der verwendeten Stimme anzuhören. 
  6. Änderungen speichern: Klicken Sie unten im Bereich auf Save changes.

Um einen Ausspracheleitfaden an einen Agenten anzuhängen oder über die API anzuwenden, lesen Sie unsere Dokumentation zu Aussprachewörterbüchern.

So verwenden Sie IPA in Text to Speech mit Eleven v4

Für kleine Änderungen oder seltene Wörter müssen Sie nicht unbedingt einen neuen Eintrag in Ihrem TTS-Aussprachewörterbuch erstellen, um einen Fehler zu korrigieren. Stattdessen können Sie mit Inline-IPA genau festlegen, wie das Modell ein Wort aussprechen soll.

In Eleven v4 aktivieren Sie Inline-IPA mit Schrägstrichen. Wie Audio Tags werden sie direkt in Ihr Skript geschrieben, damit es so einfach wie möglich bleibt. Hier sind einige IPA-Beispiele in Eleven v4:

  • Fachbegriffe: Der Begriff „/ˌbaɪoʊˈkemɪstri/“ bezeichnet die Untersuchung chemischer Prozesse. 
  • Medizinischer Wortschatz: „/ɡluːˈkoʊs/“ und „/ˈɪnsjəlɪn/“ werden häufig zur Behandlung von Erkrankungen wie „/ˌdaɪəˈbiːtiːz/“ verwendet. 
  • Marken- und Produktnamen: Unsere Server laufen auf „/ˌɛndʒɪnˈɛks/“, um Lastspitzen zu bewältigen.

Als Hinweis für alle ohne Abschluss in Linguistik: Ein IPA-Konverter hilft Ihnen, aus einer natürlichsprachlichen Eingabe die richtige IPA für Ihr Skript zu erhalten.

Warum SSML-Phonem-Tags in Eleven v4 nicht funktionieren

Eleven v4 unterstützt kein SSML. Stattdessen bietet es flexiblere Funktionen wie Audio Tags und Aussprachewörterbücher, die Ihnen mehr Kontrolle über die finale Audioproduktion geben. 

Jede SSML-Funktion hat in v4 einen direkten Ersatz:

SSML-Tag

Funktion

Ersatz in Eleven v4

<phoneme>

Legte eine phonetische Aussprache fest

Inline-IPA (/…/) oder eine Phonemregel im Wörterbuch

<sub alias>

Ersetzte Text vor der Ausgabe

Eine Alias-Regel im Wörterbuch

<break>

Fügte eine Pause hinzu

Audio Tags wie [pause], Auslassungspunkte oder Zeilenumbrüche

<prosody rate>

Änderte die Sprechgeschwindigkeit

Tempo-Audio-Tags wie [slowly] oder [rushed]

<emphasis>

Betonte ein Wort

Großbuchstaben oder ein Audio Tag für die Sprechweise

Starten Sie mit natürlich klingender Text to Speech-Aussprache in Eleven v4

Mit verschiedenen Tools zur Verbesserung der Aussprachegenauigkeit in Eleven v4 können Sie detaillierte Skripte schreiben und vom Modell genau so umsetzen lassen, wie Sie es sich vorgestellt haben.

Erstellen Sie Aussprachewörterbücher in der ElevenLabs Text to Speech-App und wenden Sie sie mit ElevenAPI im großen Maßstab an. 

Registrieren Sie sich, um zu starten, oder erfahren Sie mehr über Eleven v4 noch heute.

FAQ

  1. Artificial Analysis, Provider Voice Arena Preference Elo, 30. September 2026

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio