So wählen Sie das richtige Modell

Diese Anleitung zeigt Ihnen, wie Sie das passende ElevenLabs-Modell für Ihren Anwendungsfall auswählen.

ElevenLabs bietet eine Reihe von Modellen, die für unterschiedliche Anforderungen optimiert sind. Die richtige Wahl hängt von Ihrem Anwendungsfall, Ihren Latenzanforderungen und Ihren Qualitätserwartungen ab. Vollständige Spezifikationen finden Sie in der Modellreferenz.

Nach Anforderung

Qualität

Verwenden Sie eleven_v3

Das Flaggschiffmodell mit der höchsten Wiedergabetreue, dem reichsten emotionalen Ausdruck und der umfassendsten Sprachunterstützung.

Niedrige Latenz

Verwenden Sie Flash-Modelle (eleven_flash_v2_5 oder eleven_flash_v2)

Optimiert für Echtzeitanwendungen mit einer Latenz von etwa 75 ms.

Ausdrucksstark in Echtzeit

Verwenden Sie eleven_v3_conversational

Unser ausdrucksstärkstes Modell für Sprachsynthese in Echtzeit, mit etwa 280 ms Latenz und Audio-Tags zur detaillierten Steuerung.

Mehrsprachig

Verwenden Sie eleven_v3 oder eleven_v3_conversational

Beide unterstützen über 70 Sprachen.

Ausgewogen

Verwenden Sie eleven_flash_v2_5 oder eleven_v3_conversational

Hochwertige Ausgabe bei niedriger Latenz – die beste Allround-Wahl.

Nach Anwendungsfall

Content-Erstellung

Verwenden Sie eleven_v3

Ideal für professionelle Inhalte, Hörbücher und Videokommentare.

Konversationsagenten

Verwenden Sie für die ausdrucksstärkste Wiedergabe eleven_v3_conversational oder für die niedrigste Latenz eleven_flash_v2_5 und eleven_flash_v2.

Verwenden Sie für Sprachunterstützung außerhalb des Englischen das Modell 2.5.

Optimiert für Konversationsanwendungen in Echtzeit.

Transkription

Verwenden Sie scribe_v2 für Batch-Transkription, scribe_v2_medical für medizinisches und klinisches Audio oder scribe_v2_realtime für Transkription in Echtzeit.

Modernste Genauigkeit in über 90 Sprachen mit Sprecherdiarisierung und Zeitstempeln auf Wortebene.

Stimmenverzerrer

Verwenden Sie eleven_multilingual_sts_v2

Spezialisiert auf Speech-to-Speech-Konvertierung.

Nächste Schritte