Warum werden Zahlen, Daten, Symbole und Akronyme nicht richtig ausgesprochen oder in der richtigen Sprache gesprochen?

Zahlen, Daten, Symbole und Akronyme können für die KI schwierig sein, da sie oft auf mehrere korrekte Arten gesprochen werden können. Dies kann auch von der verwendeten Sprache abhängen. Beispielsweise kann „11“ als „Eleven“ gelesen werden, auf Spanisch aber auch „Once“ oder auf Deutsch „Elf“.

Es gibt mehrere Möglichkeiten, die korrekte Aussprache von Zahlen, Daten, Akronymen und Symbolen sicherzustellen.

Vollständig ausschreiben

Für die besten Ergebnisse empfehlen wir, Zahlen, Akronyme, Daten und Symbole vollständig in Worten auszuschreiben – so, wie die KI sie aussprechen soll. Dadurch erhält die KI den meisten Kontext und kann die richtige Ausgabe erzeugen. Bei „$100“ empfehlen wir beispielsweise, entweder „hundert Dollar“ oder „einhundert Dollar“ zu schreiben, damit Sie das gewünschte Ergebnis erhalten.

Verwendung eines LLM

Wenn Sie ein Large Language Model verwenden, um Ihre Texteingaben zu erstellen, etwa bei der Nutzung von ElevenAgents, können Sie das Modell anweisen, Zahlen, Daten, Symbole und Akronyme stets so in Worten auszuschreiben, wie die KI sie aussprechen soll.

Normalisierung

Wenn Sie über die API generieren, können Sie mit dem Parameter apply_text_normalization festlegen, ob eine Textnormalisierung angewendet werden soll. Die Textnormalisierung schreibt Zahlen und Daten aus, um die Aussprache zu verbessern. Diese Option erhöht die Latenz, da der Normalisierungsprozess zusätzliche Verarbeitungszeit benötigt.

Der Parameter apply_text_normalization hat drei Modi:

  • on: wird immer angewendet
  • off: wird nie angewendet
  • auto: Die KI entscheidet automatisch, wann die Textnormalisierung angewendet wird

Mit dem Parameter language_code können Sie auch die Sprache Ihrer Eingabe festlegen. Dies ist ein optionaler Parameter, der ISO-639-1-Sprachcodes akzeptiert. 

Das kann bei kurzen oder mehrdeutigen Eingaben nützlich sein, etwa wenn der Text nur Zahlen oder Symbole enthält. Durch die Angabe der Sprache wendet die Normalisierung die richtigen Regeln für diese Sprache an.

Weitere Informationen finden Sie in unserer API-Referenz.

Bei der Generierung mit Text to Speech über die Website ist die Normalisierung standardmäßig aktiviert.

In Studio wird die Normalisierung standardmäßig automatisch angewendet. Das bedeutet, dass die KI entscheidet, wann eine Textnormalisierung erforderlich ist. Sie können die Normalisierung auch dauerhaft aktivieren. Diese Option finden Sie unter Projekteinstellungen im Tab Erweitert.