Was ist Eleven v3?

Eleven v3 ist unser neuestes und ausdrucksstärkstes Text to Speech-Modell und bietet:

  • Menschlichere Generierungen mit insgesamt höherer Qualität
  • Unterstützung für Audiotags
    • Emotionen: [sad] [angry] [happily]
    • Anweisungen zur Sprechweise: [whispers] [shouts]
    • nonverbale Reaktionen: [laughs] [clears throat] [sighs]
  • Dialogmodus für natürlich klingendes Audio mit mehreren Sprechern
  • Unterstützung für über 70 Sprachen

Es kann beeindruckende Ergebnisse erzeugen, doch seine stärker schwankende Konsistenz und höhere Latenz machen es ungeeignet für Echtzeit- oder Gesprächsanwendungsfälle. Dafür empfehlen wir Flash v2 (Englisch) oder v2.5 (mehrsprachig). Wir arbeiten an einer Echtzeitversion von Eleven v3.

Sie können mit v3 über die API generieren, indem Sie unsere Endpunkte Create speech und Stream speech nutzen und die Modell-ID eleven_v3 angeben.

Sie können auch unsere Endpunkte Create dialogue und Stream dialogue verwenden, um einen natürlich klingenden Dialog mit mehreren Sprechern zu erstellen.

Weitere Informationen finden Sie in folgenden Ressourcen: