Presentiamo Eleven v4Scopri Eleven v4, il nostro modello più espressivo di sempre. Con 3 volte più crediti inclusi in Creator+ fino al 12 ottobre

Vai al contenuto

Text to Speech emotivo: come dirigere le performance delle voci IA con Eleven v4

Scritto da
Jack Limebear
Pubblicato
Ultimo aggiornamento

AscoltaAscolta questo articolo

Il text to speech emotivo (TTS) trasforma uno script in una performance. Invece di una lettura monotona, un modello TTS espressivo pronuncia ogni parola con sentimento, dando vita a una scena con rabbia, gioia, tristezza, frustrazione e molto altro.

Inserendo gli Audio Tags nel tuo script, puoi modellare la performance text to speech proprio come farebbe un regista. Aggiungi [furious] per aumentare l'intensità di una battuta, [sarcastic] per aggiungere un tocco di umorismo secco o qualsiasi altro tag per mostrare al modello come vuoi che venga interpretata una battuta. 

Con Eleven v4, hai un TTS emotivo che puoi dirigere battuta per battuta. Ecco come scrivere script che danno vita ai tuoi testi.

Cos'è il text to speech emotivo?

Il text to speech emotivo è parlato generato dall'IA che interpreta una battuta anziché limitarsi a leggerla. Esprime emozioni, comprende tempi e ritmo, enfatizza le parole giuste e aggiunge suoni non verbali come sospiri e risate.

Eleven v4 è un modello rivoluzionario che trasforma il testo in una vera performance. Con descrizioni in linea, la stessa frase può essere sussurrata, gridata o pronunciata tra le lacrime, a seconda di ciò che immagini.

Che tu stia scrivendo una campagna pubblicitaria per il tuo prossimo lancio o dando vita ai capitoli del tuo romanzo, Eleven v4 ti supporta con il Text to Speech della massima qualità.

Come Eleven v4 interpreta le indicazioni emotive

Eleven v4 coglie le indicazioni emotive dagli Audio Tags nel tuo script e le trasforma in una performance audio naturale.

Ecco alcuni modi per aggiungere indicazioni emotive a un testo con Eleven v4 e migliorare il risultato finale:

  • Audio Tags: Inserisci Audio Tags nelle tue istruzioni, come [whispers] o [cries], per inserire indicazioni direttamente nello script. Potrai creare scene ricche di profondità emotiva dirigendo v4 come faresti con un interprete teatrale.
  • Punteggiatura: Usa la punteggiatura per modellare ritmo e interpretazione insieme agli Audio Tags. I puntini di sospensione rallentano una battuta, i trattini interrompono un personaggio a metà frase e i punti esclamativi aumentano l'intensità, offrendoti un ulteriore livello di regia senza aggiungere un tag.
  • Continuità emotiva: Inizia una frase con un'emozione e Eleven v4 manterrà quel tono per tutta la battuta. Costruisci le scene in modo iterativo e crea script ricchi di contesto con gli Audio Tags su v4.

Per mostrare quanto gli Audio Tags siano efficaci nel dare vita al testo con v4, esploriamo la differenza tra audio con e senza tag.

In questo primo esempio usiamo semplicemente una frase predefinita. Come riferimento, per questi esempi usiamo Siren.

Paragrafo narrativo senza Audio Tags su Eleven v4

The night was quiet, almost unnaturally so. Until I heard the old gate creak open behind me.
I turned slowly and called out, "Is anyone there?"
No answer.
Then, from somewhere in the darkness came a low, quiet laugh.
I took a step back. "You really shouldn't have come here," a voice whispered.
And then the lights went out.
0:00

Questo secondo esempio contiene invece la stessa frase con gli Audio Tags aggiunti. Abbiamo indicazioni emotive, effetti sonori e perfino rumori oltre il testo, come una risata malvagia.

Paragrafo narrativo con Audio Tags su Eleven v4

[hesitant] The night was quiet, almost unnaturally so.
[nervous] Then I heard the old gate creak open behind me. [gate creaking] [scared] I turned slowly and called out, "Is anyone there?"
[tense, cautious] No answer.
[silence] [whispering, fearful] Then, from somewhere in the darkness, came a low, quiet laugh. [evil laugh] [alarmed] I took a step back. [footstep] [low, threatening] "You really shouldn't have come here." A voice whispered.
[whisper] [terrified] And then the lights went out. [light switch clicking]
0:00
Eleven v4 emotional text to speech uses audio tags, punctuation, and emotional continuity to direct emotion.

Cinque performance di text to speech emotivo con Eleven v4

Il modo migliore per mostrare tutta la gamma di Eleven v4 è provarlo di persona. Creando un account, potrai iniziare a usare Eleven v4 in pochi minuti.

Per darti una piccola dimostrazione di ciò che puoi fare con questo modello Text to Speech espressivo, ecco una battuta generata cinque volte. A ogni battuta viene assegnata un'indicazione scenica diversa, per mostrarti esattamente cosa puoi fare con il modello.

Tutte e cinque le schede seguenti usano come testo “I didn’t think you’d actually come back.”, modificato con un Audio Tag ricco di emozione. Come riferimento, questi esempi usano anche Siren.

Aggiungere [furious]

Le consonanti si induriscono e le plosive diventano più marcate. La battuta suona arrabbiata e risulta un'accusa.

[furious]

[furious] I didn't think you'd actually come back
0:00

Aggiungere [excited]

L'intonazione si alza e il ritmo accelera, trasformando la stessa frase in un allegro benvenuto.

[excited]

[excited] I didn't think you'd actually come back.
0:00

Aggiungere [sarcastic] 

L'intonazione si appiattisce e le vocali delle parole si allungano. Il sarcasmo è un ottimo uso degli Audio Tags, perché il tono delle parole pronunciate contraddice direttamente quello delle parole scritte.

[sarcastic]

[sarcastic] I didn't think you'd actually come back.
0:00

Aggiungere [crying]

Questa è davvero commovente. L'interpretazione rallenta e si spezza a metà frase. Noterai che qui la respirazione fa gran parte del lavoro.

[crying]

[crying] I didn't think you'd actually come back.
0:00

Aggiungere [worried]

Più sommesso e leggermente esitante, [worried] toglie sicurezza alla battuta.

[worried] I didn't think you'd actually come back.
0:00

Consigli per scrivere script che l'IA può interpretare

Abbiamo reso l'app Text to Speech di ElevenLabs il più intuitiva possibile. Vai alla pagina e inizia a scrivere, oppure aggiungi Audio Tags descrittivi per inserire suoni o emozioni specifici nella tua scena

Ecco altri consigli per ottenere i migliori risultati con il Text to Speech emotivo di Eleven v4:

  1. Perfeziona le indicazioni: Se una battuta non funziona, cambia il tag invece di riscrivere il testo. Prova [worried] al posto di [sad] o [sarcastic] al posto di [annoyed], quindi rigenera finché l'interpretazione non corrisponde a ciò che avevi in mente.
  2. Genera scene complete in una sola volta: Anche se le frasi isolate possono dare vita a un'interpretazione ricca di sfumature, come abbiamo mostrato sopra, Eleven v4 funziona al meglio con paragrafi o passaggi di testo. Fornire al modello abbastanza testo per stabilire il contesto di una scena aiuta a migliorare la performance dell'intero passaggio. Con Eleven v4, puoi scrivere fino a 10.000 caratteri per generazione nell'app TTS.
  3. Usa un'emozione per frase: Anche se puoi inserire diversi Audio Tags in una frase, è meglio usarne uno per ogni segmento per evitare confusione. Aggiungere emozioni contrastanti come indicazioni può portare a un output meno accurato. In alternativa, aggiungi un tag prima della proposizione esatta che vuoi modificare, poi un nuovo tag dopo quella proposizione se vuoi cambiare l'emozione a metà frase. 

Con questi consigli, trasformerai i tuoi testi in performance in pochissimo tempo.

Three tips for AI-ready scripts: iterate, generate full scenes, and use one emotion per phrase.

Inizia con Eleven v4 per il text to speech emotivo

Tutto ciò che hai visto in questo articolo è stato generato nell'app Text to Speech di ElevenLabs con uno script, una voce e una manciata di Audio Tags su Eleven v4.

Per creare le tue scene, seleziona una voce, incolla una battuta che hai scritto e dirigi la tua prima performance.

Scopri di più su Eleven v4 oppure registrati per iniziare con la tua prima generazione.

FAQ sul text to speech emotivo con IA

Articoli simili

Crea con l'audio IA della massima qualità