Eleven v3 Audio Tags: Präzise Steuerung der KI-Sprachwiedergabe
- Verfasst von
- Ryan Morrison
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Gute Sprache hängt nicht nur davon ab, was gesagt wird — sondern wie. Mit Eleven v3 Audio Tags erhalten Sie präzise Kontrolle über Timing, Rhythmus und Betonung. So gestalten Sie das Tempo jeder Zeile genau nach Ihren Vorstellungen.
Mit Tags wie [pause], [rushed], [stammers] oder [drawn out] können Sie steuern, wie jeder Satz wirkt — nicht nur emotional, sondern auch rhythmisch. So wird aus einer flachen Sprechweise eine Performance.
Was ist die Steuerung der Sprechweise bei KI-Sprache?
Die Steuerung der Sprechweise ermöglicht es, den Sprachfluss zu lenken — wie schnell gesprochen wird, wo Pausen entstehen und wann etwas betont wird. Sie lässt eine Zeile dramatisch, beiläufig, angespannt oder komisch wirken.
Mit Eleven v3 ist die Sprechweise nicht an ein Standardtempo gebunden. Sie können für Spannung langsamer sprechen lassen, für Dringlichkeit das Tempo erhöhen oder für Humor Rhythmus hinzufügen — direkt im Skript.
Beispiel: „Also, ich habe endlich Level 42 von diesem Spiel geschafft, von dem ich vor ... einem Monat gesagt habe, ich höre auf. [laughs] Und dann war der letzte Boss ... einfach nur ... [giggle] ein kleines Kaninchen. [big laugh] Ich konnte es nicht. Es war zu süß.“
Diese Tags formen Tempo und Timing — und genau dadurch wirkt die Zeile.
Timing, Tempo und Präsenz steuern
Tags geben Ihnen Zugriff auf die subtilen Signale, mit denen Menschen Sprache natürlich gliedern:
- Pausen & Unterbrechungen: [pause], [breathes], [continues after a beat]
- Tempohinweise: [rushed], [slows down], [deliberate], [rapid-fire]
- Zögern & Rhythmus: [stammers], [drawn out], [repeats], [timidly]
- Betonung: [emphasized], [stress on next word], [understated]
Beispiel: „[drawn out] Alsoooo ... du sagst ... [suspicious tone] du hast das letzte Stück nicht gegessen?“
Diese Tags geben Ihnen vollständige Kontrolle darüber, wie eine Stimme wirkt , während sie spricht.
Tempo für Ton und Bedeutung
Die Art, wie eine Zeile gesprochen wird, verändert ihre Interpretation.
Vergleich:
- Mir geht's gut.
- [flatly] Mir geht's gut.
- [quietly, after a pause] Mir geht's ... gut.
- [angrily, fed up] MIR GEHT'S GUT!
- [questioning]Bist du [pause] sicher, dass es dir gut geht?
- Mir geht's gut. [pause] Wirklich!
Dieselben Worte. Andere Bedeutung. Mit der Steuerung der Sprechweise entsteht der Ton nicht durch die Wortwahl, sondern durch Timing und Absicht.
Tag-Kombinationen, die den Moment prägen
Sie können Tags für die Sprechweise mit emotionalen Hinweisen oder Charaktermerkmalen kombinieren, um ganze Szenen zu gestalten.
Beispiel: [hesitant][nervous] Ich ... ich weiß nicht, ob das funktionieren wird. [gulps] Aber versuchen wir es trotzdem.
Oder: [whispering][pause] Hast du das gehört? [rushed] Versteck dich! Jetzt!
Diese Mischung aus Rhythmus und Reaktion lässt Performances glaubwürdig wirken.
Tempo steuern, nicht nur Text
Eleven v3 verwandelt das Skript in eine Partitur — und die Steuerung der Sprechweise ist Ihr Dirigat. Ob Tutorials, Monologe oder Pointen: Audio Tags ermöglichen es Ihnen, die Sprechweise mit bildgenauer Präzision zu steuern.
Für Kreative bedeutet das vollständige Kontrolle darüber, wie sich eine Zeile entfaltet. Sie schreiben nicht nur, was passiert. Sie bestimmen ihr Tempo.
Die richtige Stimme auswählen
Professional Voice Clones (PVCs) sind derzeit nicht vollständig für Eleven v3 optimiert. Daher kann die Klonqualität im Vergleich zu früheren Modellen geringer sein. In dieser Forschungs-Vorschau empfehlen wir, ein Instant KI-Stimme klonen (IVC) oder eine für Ihr Projekt entwickelte Stimme zu wählen, wenn Sie v3-Funktionen nutzen möchten. Die PVC-Optimierung für v3 folgt in naher Zukunft.



