Aussprachewörterbücher verwenden

In diesem Leitfaden erfahren Sie, wie Sie Aussprachewörterbücher programmgesteuert verwalten.

Anleitung · Setzt voraus, dass Sie den ElevenAPI- Schnellstart abgeschlossen haben.

Überblick

Mit Aussprachewörterbüchern können Sie anpassen, wie Ihr KI-Agent bestimmte Wörter oder Ausdrücke ausspricht. Das ist besonders nützlich für:

  • Korrektur der Aussprache von Namen, Orten oder Fachbegriffen
  • Einheitliche Aussprache in allen Gesprächen
  • Anpassung regionaler Aussprachevarianten

ElevenLabs unterstützt sowohl das IPA- als auch das CMU-Alphabet.

Phonem-Tags in Aussprachewörterbüchern funktionieren nur mit den Modellen eleven_flash_v2 und eleven_v3.

Andere Modelle überspringen Phonem-Tags aus Wörterbüchern und verwenden die Standardaussprache. Verwenden Sie für andere Modelle stattdessen Alias-Tags, um Schreibweisen oder Ausdrücke zu ersetzen, die die gewünschte Aussprache erzeugen.

Wenn Sie IPA- und CMU-Aussprache in anderen Sprachen als Englisch verwenden möchten, müssen Sie zum Modell eleven_v3 wechseln.

Schnellstart

Dieser Leitfaden setzt voraus, dass Sie Ihren API-Schlüssel und Ihr SDK eingerichtet haben. Falls nicht, schließen Sie zuerst den Schnellstart ab.

1

Eine Aussprachewörterbuchdatei erstellen

In diesem Beispiel erstellen wir eine Aussprachewörterbuchdatei für das Wort tomato.

Diese Regel verwendet das Alphabet „IPA“ und aktualisiert die Aussprache von tomato und Tomato auf eine andere Aussprache. PLS-Dateien unterscheiden zwischen Groß- und Kleinschreibung. Deshalb fügen wir beide Varianten ein, mit und ohne großgeschriebenes „T“.

Sie können KI-Tools wie Claude oder ChatGPT verwenden, um IPA- oder CMU-Notationen für bestimmte Wörter zu erstellen.

dictionary.pls
<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="ipa" xml:lang="en-US">
<lexeme>
<grapheme>tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
<lexeme>
<grapheme>Tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
</lexicon>
2

Ein Aussprachewörterbuch aus einer Datei über das SDK erstellen

Erstellen Sie je nach bevorzugter Sprache eine neue Datei mit dem Namen example.py oder example.mts und fügen Sie den folgenden Code hinzu:

from elevenlabs import ElevenLabs, PronunciationDictionaryVersionLocator
from elevenlabs.play import play
elevenlabs = ElevenLabs()
with open("dictionary.pls", "rb") as f:
# this dictionary changes how tomato is pronounced
pronunciation_dictionary = elevenlabs.pronunciation_dictionaries.create_from_file(
file=f.read(), name="example"
)
audio_1 = elevenlabs.text_to_speech.convert(
text="Without the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
)
audio_2 = elevenlabs.text_to_speech.convert(
text="With the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
pronunciation_dictionary_locators=[
PronunciationDictionaryVersionLocator(
pronunciation_dictionary_id=pronunciation_dictionary.id,
version_id=pronunciation_dictionary.version_id,
)
],
)
# play the audio
play(audio_1)
play(audio_2)
3

Code ausführen

python example.py

Sie sollten zwei Audioversionen über Ihre Lautsprecher hören, eine mit und eine ohne Aussprachewörterbuch.

Nächste Schritte