Presentiamo Eleven v4Scopri Eleven v4, il nostro modello più espressivo di sempre. Con 3 volte più crediti inclusi in Creator+ fino al 12 ottobre

Vai al contenuto

Guida al dizionario di pronuncia: correggi qualsiasi parola in TTS con Eleven v4

Scritto da
Jack Limebear
Pubblicato

AscoltaAscolta questo articolo

Eleven v4 stabilisce un nuovo standard per la pronuncia nei modelli Text to Speech e gestisce abbreviazioni, termini tecnici, nomi e testi multilingue con maggiore precisione rispetto a qualsiasi modello precedente. Tuttavia, ogni brand ha un proprio vocabolario, dai nomi di prodotti unici al gergo specifico del settore, quindi vorrai avere il pieno controllo di come suonano queste parole.

Eleven v4 offre vari modi per correggere la pronuncia, dandoti un controllo granulare su come parla il modello. Puoi creare un dizionario di pronuncia completo da applicare a ogni script che scrivi nell'app TTS. Oppure puoi scrivere l'IPA direttamente nel testo per una correzione una tantum.

Ecco un breve esempio di Eleven v4 alle prese con uno script ricco di termini difficili:

At 2:47 A.M., Siobhan Lester's phone lit up. The search service on the Kubernetes cluster was timing out. She read the pod logs and found the cause in Tuesday's release. A new fuzzy matching feature compared every query against the entire product catalog using Levenshtein distance, so each search took 1,400 milliseconds, well past the one-second limit. Her lead, a purist who quotes Dijkstra and Euler in code reviews, wanted to rewrite the matcher from scratch. Instead, she rolled back to Monday's build, and by 3:30 A.M., the rollback was live and response times were back under 50 milliseconds. The proper fix, an index that narrows each search to close matches, shipped in Thursday's release.
0:00

Questa guida spiega come creare e usare un dizionario di pronuncia TTS e tutte le strategie correlate che puoi adottare per far suonare il tuo audio il più vicino possibile a come lo avevi immaginato.

  • Un dizionario di pronuncia è un insieme di regole che scrivi per indicare a un modello Text to Speech come pronunciare parole o frasi specifiche.
  • Le regole di pronuncia TTS possono basarsi su alias, che sostituiscono il testo, oppure su fonemi, che usano la trascrizione fonetica.
  • Eleven v4 supporta le regole fonemiche e l'IPA inline (Alfabeto Fonetico Internazionale).
  • I tag SSML phoneme e break non funzionano su Eleven v4, ma puoi usare un dizionario di pronuncia o Audio Tags come alternativa in linguaggio naturale.
  • Puoi applicare fino a tre dizionari di pronuncia per richiesta tramite ElevenAPI.

Che cos'è un dizionario di pronuncia?

Un dizionario di pronuncia è uno strumento che ti permette di configurare con precisione come un modello Text to Speech pronuncia determinate parole. Aggiungendo parole o frasi a un dizionario di pronuncia, definisci come suoneranno ogni volta che compaiono in uno script TTS.

I dizionari di pronuncia vengono generalmente usati per:

  • Nomi di brand: I nomi dei brand sono una voce comune nei dizionari di pronuncia, soprattutto quando hanno grafie uniche o insolite.
  • Acronimi: Alcuni acronimi hanno una pronuncia specifica. Ad esempio, AEO dovrebbe suonare come /ˌeɪ.iːˈoʊ/ ("A-E-O"), non /eɪˈjoʊ/ ("ei-io"). Una regola rigida nel dizionario fa sì che il modello la pronunci correttamente ogni volta che la scrivi.
  • Nomi di luoghi e altri nomi propri: Alcuni nomi di luoghi possono suonare molto diversamente da come immagini che vengano pronunciati guardandoli. Worcestershire è un esempio famoso per cui una guida alla pronuncia può aiutare a evitare problemi.
  • Termini di settore: Il gergo del settore o termini specializzati, ad esempio in ambito medico o legale, possono trarre vantaggio da un dizionario di pronuncia se il modello non è stato addestrato esplicitamente su dati provenienti da tali settori.

Al di fuori del Text to Speech, i dizionari di pronuncia sono in genere raccolte collaborative di clip audio di madrelingua, che chi studia una lingua usa per ascoltare come vengono pronunciate determinate parole.

Different uses of pronunciation dictionaries in TTS apps

Come controllare la pronuncia TTS su Eleven v4

Eleven v4 è classificato come il modello Text to Speech di più alta qualità da Provider Voice Arena di Artificial Analysis.1 Parte di ciò che rende Eleven v4 un leader di mercato è la capacità del modello di gestire testi complessi mantenendo un output naturale.

Per offrire agli utenti la migliore esperienza possibile con Eleven v4, il modello propone vari modi per personalizzare la pronuncia, assicurando che ogni output rispetti i tuoi standard di accuratezza.

Ecco come puoi controllare la pronuncia con Eleven v4:

  • IPA inline: Puoi scrivere l'IPA nei tuoi script tra barre oblique per indicare la pronuncia senza usare il dizionario di pronuncia. Tra poco vedremo nel dettaglio come farlo.
  • Regole fonemiche nei dizionari: Scrivi regole basate sui fonemi nei tuoi dizionari di pronuncia per controllare il suono fonetico delle parole ricorrenti.
  • Pronuncia fluida tra le lingue: Eleven v4 può generare parlato naturale in oltre 90 lingue. Mantieni una pronuncia nativa in ogni lingua usando la stessa voce per un'esperienza di sonic branding coerente.

Ecco come si confrontano i diversi modelli TTS di ElevenLabs per il controllo della pronuncia:

Modello

Regole alias (dizionario)

Regole fonemiche (dizionario)

IPA inline (/.../)

Tag phoneme SSML (<phoneme>)

Eleven v4

Sì

Sì

Sì

No

Eleven v4 Turbo

Sì

Sì

Sì

No

Eleven v3

Sì

Sì

Sì

No

Eleven Flash v2

Sì

Sì

No

Sì (solo in inglese)

Eleven Turbo v2

Sì

No

No

Sì (solo in inglese)

Eleven Multilingual v2

Sì

No

No

No

Pronunciation dictionary guide on ElevenLabs across different models

Qual è la differenza tra le regole alias e fonemiche in un dizionario di pronuncia?

Le regole di pronuncia basate su alias sostituiscono un testo con un altro prima che il modello pronunci la parola. Questo avviene dietro le quinte ogni volta che un modello genera audio, sostituendo il suono di una parola o frase con ciò che hai incluso nel tuo dizionario di pronuncia.

Ecco alcuni esempi di regole di pronuncia basate su alias:

  • “SaaS” diventa “sass”
  • “UN” diventa “United Nations”
  • “OAuth” diventa “oh auth”

Le regole fonemiche, invece, forniscono al modello un'ortografia fonetica esatta da usare. Sono più difficili da creare, poiché dovrai scrivere o generare tu stesso la trascrizione IPA e inserirla nel dizionario. Ad esempio, "Kubernetes" diventa /ˌkuː.bərˈnɛt.iːz/.

Come correggere la pronuncia di un nome di brand in un modello TTS

I nomi di brand sono tra le voci più comuni nei dizionari di pronuncia, perché non sempre sono parole reali. Se la tua azienda ha inventato una parola o una grafia unica per il tuo brand, i modelli TTS potrebbero avere difficoltà a pronunciarla correttamente, poiché sono disponibili pochissimi dati di addestramento che includono quella pronuncia specifica.

Ecco come correggere la pronuncia di un nome di brand in Eleven v4:

  1. Prova il suono predefinito: Apri l'app Text to Speech e scrivi il nome del tuo brand. Genera una clip e ascolta come suona. Se c'è un errore di pronuncia, passa al passaggio successivo.
  2. Prova una regola alias: Il modo più semplice per correggere un errore di pronuncia di un brand è creare una regola alias. Sono rapide da scrivere e intuitive.
  3. Passa a una regola fonemica: Se la regola alias non funziona del tutto, usa l'IPA. Trascrivi il nome del tuo brand con l'IPA, quindi crea una regola nel dizionario di pronuncia Text to Speech per correggerne la pronuncia.
  4. Copri tutte le maiuscole e minuscole: Assicurati di includere la trascrizione IPA sia per la versione in minuscolo sia per quella in maiuscolo del nome del tuo brand, se usi entrambe.
  5. Usa l'IPA inline per modifiche una tantum: Se vuoi una correzione rapida per una generazione una tantum, puoi aggiungere l'IPA direttamente allo script invece di configurare una voce del dizionario.

Dopo aver definito una regola per il nome di un brand, sarà disponibile in tutti i progetti condivisi successivi, sia nel tuo agente IA sia tramite un'API.

Come creare un dizionario di pronuncia con ElevenLabs

Puoi creare un dizionario di pronuncia aggiungendo regole nell'app Text to Speech, caricando un file .pls oppure tramite ElevenAPI. In questa guida vedremo la prima opzione, che richiede pochi passaggi.

Title slide: “How to create a pronunciation dictionary,” by ElevenLabs and ElevenCreative.

Ecco i passaggi da seguire per creare un dizionario di pronuncia:

  1. Apri il pannello dei dizionari di pronuncia: Dalla pagina Text to Speech, fai clic sulla barra di ricerca in alto, digita "Pronunciation dictionary" e seleziona Pronunciation dictionaries in Actions.
  2. Crea o scegli un dizionario: Fai clic su New per iniziare un nuovo dizionario oppure selezionane uno esistente dall'elenco a sinistra.
  3. Aggiungi una regola: Fai clic su Add rule per creare una nuova riga. Inserisci la parola che vuoi correggere. Nel campo Input, digita la parola o la frase esattamente come appare nei tuoi script. Le regole distinguono tra maiuscole e minuscole, quindi usa le stesse maiuscole.
  4. Scegli il tipo di regola: Seleziona Alias per sostituire il testo oppure Phoneme per inserire una trascrizione IPA o CMU.
  5. Inserisci la sostituzione: Digita l'alias o l'ortografia fonetica nel campo Output. Usa il selettore di voce in alto nel pannello per ascoltare la regola con la voce che stai usando.
  6. Salva le modifiche: Fai clic su Save changes in fondo al pannello.

Per collegare una guida alla pronuncia a un agente o applicarne una tramite l'API, segui la nostra documentazione sui dizionari di pronuncia.

Come usare l'IPA nel Text to Speech su Eleven v4

Per piccole modifiche o parole poco comuni, non devi necessariamente creare una nuova voce nel tuo dizionario di pronuncia TTS per correggere un errore. Puoi invece usare l'IPA inline per indicare esattamente come il modello deve pronunciare una parola.

In Eleven v4, puoi attivare l'IPA inline usando le barre oblique. Come gli Audio Tags, vengono inseriti direttamente nello script per rendere tutto più semplice possibile. Ecco alcuni esempi di IPA in Eleven v4:

  • Termini tecnici: Il termine "/ˌbaɪoʊˈkemɪstri/" si riferisce allo studio dei processi chimici.
  • Vocabolario medico: "/ɡluːˈkoʊs/" e "/ˈɪnsjəlɪn/" sono comunemente usati per gestire condizioni come "/ˌdaɪəˈbiːtiːz/".
  • Nomi di brand e prodotti: I nostri server usano "/ˌɛndʒɪnˈɛks/" per gestire i picchi di traffico.

A margine, per chi non ha una laurea in linguistica, un convertitore IPA ti aiuterà a ottenere l'IPA corretto da incollare nello script a partire da un input in linguaggio naturale.

Perché i tag phoneme SSML non funzionano su Eleven v4

Eleven v4 non supporta SSML e offre invece funzionalità più flessibili, come Audio Tags e dizionari di pronuncia, che ti danno maggiore controllo sulla produzione audio finale.

Ogni funzionalità offerta da SSML ha un'alternativa diretta in v4:

Tag SSML

Cosa faceva

Alternativa in Eleven v4

<phoneme>

Impostava una pronuncia fonetica

IPA inline (/…/) o una regola fonemica del dizionario

<sub alias>

Sostituiva il testo prima della pronuncia

Una regola alias del dizionario

<break>

Aggiungeva una pausa

Audio Tags come [pause], puntini di sospensione o interruzioni di riga

<prosody rate>

Modificava la velocità del parlato

Audio Tags per il ritmo come [slowly] o [rushed]

<emphasis>

Enfatizzava una parola

Lettere maiuscole o un Audio Tag per l'intonazione

Inizia a usare una pronuncia Text to Speech naturale su Eleven v4

Con una gamma di strumenti che ti aiutano a migliorare l'accuratezza delle pronunce su Eleven v4, puoi scrivere script dettagliati e farli interpretare dal modello proprio come li avevi immaginati.

Crea dizionari di pronuncia nell'app Text to Speech di ElevenLabs e applicali su larga scala con ElevenAPI.

Registrati per iniziare o scopri di più su Eleven v4 oggi.

FAQ

  1. Artificial Analysis, Provider Voice Arena Preference Elo, 30 settembre 2026

Articoli simili

Crea con l'audio IA della massima qualità