Cosa sono gli audio tag? Guida completa al TTS emozionale
- Scritto da
- Jack Limebear
- Pubblicato
- Ultimo aggiornamento
AscoltaAscolta questo articolo
Gli audio tag sono indicazioni in linguaggio naturale tra parentesi quadre, come [laughs], [gasps], [excited] e [worried], che Eleven v3 interpreta come indicazioni di performance anziché parole da pronunciare. Quando scrivi uno script per un modello Text to Speech, inserire questi audio tag ti offre un controllo preciso sulla resa emotiva del testo.
Eleven v3 è diventato disponibile al pubblico a marzo 2026. Prima di v3, ottenere una specifica interpretazione emotiva da un modello Text to Speech richiedeva di rigenerare i contenuti e sperare nel meglio. Gli audio tag eliminano questa incertezza e ti danno il pieno controllo di un'interpretazione emotiva di sintesi vocale.
Questa guida spiega cosa sono gli audio tag, come funzionano, tutte le categorie di tag disponibili e come si confrontano con SSML (Speech Synthesis Markup Language). Vedremo anche i casi d'uso più comuni, ciascuno con un link alla relativa guida dedicata.
In sintesi:
- Gli audio tag sono indicazioni tra parentesi quadre, come [shouts] o [excited], che in Eleven v3 guidano emozione, ritmo, interpretazione e tono del TTS.
- Eleven v3 non supporta SSML, ma lo sostituisce con gli audio tag per un'esperienza di scrittura più naturale.
- I tag comprendono diverse categorie, tra cui emozioni, interpretazione e ritmo, reazioni umane, accenti ed effetti sonori.
- La punteggiatura e le maiuscole nel testo ti permettono di modellare il ritmo dell'interpretazione di una voce IA.
- Puoi accedere agli audio tag su ElevenLabs tramite l'interfaccia utente o l'API.
Come funzionano gli audio tag?
Gli audio tag vengono inseriti direttamente nella trascrizione e racchiusi tra parentesi quadre. Ogni volta che vuoi modificare l'interpretazione, ad esempio da normale a [worried], ti basta aggiungere un audio tag.
Puoi anche usare più di un tag nella stessa frase e combinarli per un'interpretazione più articolata, ad esempio [tired] È stata una lunga giornata… [upset] Quanti altri giorni posso resistere?
L'architettura alla base di Eleven v3 consente al modello di leggere il contesto più a fondo rispetto ai modelli precedenti, seguendo indicazioni emotive, cambi di tono, passaggi tra parlanti e indizi contestuali senza richiedere un parametro o un'impostazione separata. Ti basta dire al modello cosa richiede il momento e interpreterà la battuta esattamente come l'hai immaginata.
Eleven v3 gestisce anche dialoghi con più parlanti che risultano spontanei, incluse interruzioni, cambi d'umore e il naturale scambio di una conversazione reale, tutto basandosi esclusivamente sui tag e sulla struttura dello script.
Audio tag e SSML a confronto
Se hai lavorato con altri sistemi TTS, probabilmente ti sei imbattuto in Speech Synthesis Markup Language. Piattaforme come Amazon Polly e Microsoft Azure Speech usano tag SSML come <break> o <emphasis> per aggiungere ulteriore contesto a uno script TTS.
Eleven v3 non supporta i tag break di SSML né il resto dei tag SSML. Al loro posto entrano in gioco gli audio tag, la punteggiatura e la struttura stessa del testo, offrendo al tempo stesso un controllo preciso dell'interpretazione.
Puoi usare la tabella qui sotto per associare i comuni tag SSML all'equivalente in Eleven v3.
Dal punto di vista di chi scrive, aggiungere [whispers] a una battuta richiede molto meno impegno che configurare una velocità di prosodia.
Le categorie di audio tag in v3: come dirigere l'interpretazione con gli audio tag
Puoi inserire gli audio tag in qualsiasi punto dello script per modellare l'interpretazione in tempo reale. Puoi anche combinare i tag all'interno di uno script o persino di una frase.
I tag rientrano nelle seguenti categorie principali.
Emozioni
Questi tag ti aiutano a definire il tono emotivo della voce, che sia cupo, intenso o allegro. Ad esempio, puoi usarne uno o combinare [sad], [angry], [happily] e [sorrowful].
Interpretazione e ritmo
Questi riguardano soprattutto il tono e l'interpretazione. Puoi usarli per regolare volume ed energia nelle scene che richiedono moderazione o intensità. Alcuni esempi sono [whispers], [shouts] e [softly].
Reazioni umane
Un parlato davvero naturale include reazioni. Puoi, ad esempio, aggiungere realismo inserendo nel parlato momenti naturali e non scritti. Tag come [laughs], [clears throat] e [sighs] contribuiscono a creare un modello TTS capace di esprimere emozioni umane.
Altri esempi di categorie di audio tag includono:
- Accenti e voci dei personaggi: I tag di accento trasformano la voce in una specifica variante regionale o personalità senza cambiare modello, come [French accent], [British accent] o [pirate voice]. Usali per trasformare una sola voce in un cast flessibile, anziché in un'unica interpretazione fissa.
- Effetti sonori: I tag degli effetti sonori aggiungono direttamente all'audio generato suoni non vocali, come [gunshot], [explosion] e [clapping]. Sono ideali per audio immersivi, giochi e narrazioni drammatizzate in cui la scena richiede più di una voce. In alternativa, usa il generatore di effetti sonori IA ElevenCreative.
Anche se i tag ti offrono un elevato livello di controllo, puoi usare la punteggiatura per modellare ritmo ed enfasi. Ad esempio, aggiungi dei puntini di sospensione per una pausa naturale oppure usa le virgole per creare schemi di respirazione naturali. Prova a scrivere una parola tutta in maiuscolo per aggiungere enfasi: “Lo voglio SUBITO.”
Cosa puoi fare con gli audio tag?
Gli audio tag rendono intuitiva la complessità emotiva degli script. Scrivi in modo naturale e aggiungi i tag man mano.
Ecco una rapida panoramica di alcuni casi d'uso del TTS emotivo con gli audio tag.
Consapevolezza situazionale nell'audio IA
Tag come [whisper] o [shouting] permettono a Eleven v3 di reagire al momento. Dall'attenuare un avvertimento al mantenere una pausa prolungata per creare suspense, puoi integrare nello script una consapevolezza situazionale dinamica.
Per un'analisi completa, consulta la nostra guida sulla consapevolezza situazionale nell'audio IA.
Dirigere l'interpretazione dei personaggi nel parlato
Quando crei uno script con più personaggi, vuoi mostrare chiaramente in cosa ogni voce è diversa. Dal modificarne la personalità con [sarcastically] al definire il modo in cui parlano con [British accent], con il nostro motore TTS puoi esprimere un'intera gamma di emozioni.
Scopri di più su come dirigere l'interpretazione dei personaggi nel parlato IA.
Esprimere il contesto emotivo nel parlato
Gli audio tag ti permettono di modellare l'interpretazione emotiva di una battuta mentre si sviluppa. Puoi costruire le emozioni nel corso di un discorso, raggiungendo il culmine nel momento in cui immagini il tuo personaggio al massimo del suo potenziale. Tag come [awe], [booming] e [big laugh] aiutano a integrare un'intera gamma emotiva nell'interpretazione della tua voce IA.
Scopri di più sull'uso del contesto emotivo nel parlato IA.
Dare vita ai dialoghi con più personaggi
Quando crei interpretazioni di dialoghi con più personaggi, puoi iniziare ogni battuta con un audio tag per costruire conversazioni ricche tra personaggi.
Prendi questo esempio: Tom: [coughing] [beginning to speak] scusa, oggi non mi sento molto bene— Emma: [interrupting] —Non stai bene? Sai quanto odio la tosse, Tom! Tom: [surprised] È solo un colpetto di tosse, non è niente di grave. Come ti sentiresti se— Emma: [overlapping] [annoyed] —Penso che tu debba andare a casa.
Scopri cos'altro puoi fare con i dialoghi con più personaggi in Eleven v3.
Controllo preciso dell'interpretazione nel parlato IA
Con Eleven v3 puoi controllare il ritmo del parlato tramite gli audio tag o la punteggiatura. Tag come [pause], [rushed] o [drawn out] ti permettono di modellare attivamente la battuta con precisione. In alternativa, aggiungi puntini di sospensione, punti fermi e punti esclamativi per integrare naturalmente l'emozione nella tua interpretazione TTS.
Abbiamo scritto una guida approfondita sul controllo preciso dell'interpretazione in Eleven v3.
Il TTS emotivo è disponibile tramite API
Gli audio tag funzionano allo stesso modo tramite l'API Text to Speech e nell'interfaccia utente di ElevenLabs. Scrivi il tag direttamente nel testo dello script e l'API restituirà nell'audio generato l'interpretazione indicata dai tag, dalle pipeline per audiolibri alle voci fuori campo pubblicitarie.
Scopri di più su Eleven v3 oppure contatta il reparto vendite per iniziare oggi.










