Progettazione della voce
Panoramica
Voice Design aiuta i creator a colmare le lacune quando la voce esatta che cercano non è disponibile nella Voice Library. Se non trovi una voce adatta al tuo progetto, puoi crearne una. Voice Design è ideale per esplorare e iterare rapidamente e la qualità dell’output può variare in base al prompt e al caso d’uso. Se hai bisogno della qualità più coerente e pronta per la produzione, i Cloni Vocali Professionali (PVC) sono attualmente le voci di qualità più elevata sulla nostra piattaforma; quindi, se nella nostra libreria è disponibile un PVC adatto alle tue esigenze, ti consigliamo di usarlo.
Puoi trovare Voice Design andando su Voci -> Le mie voci -> Crea una voce -> Voice Design nell’app ElevenLabs o tramite l’API.
Quando fai clic su genera, creeremo per te tre opzioni vocali. L’unico costo per usare Voice Design è il numero di crediti necessario per generare il testo di anteprima, che viene addebitato una sola volta anche se generiamo tre campioni. Puoi vedere il numero di caratteri che verranno sottratti nella casella di testo “Testo da visualizzare in anteprima”.
Dopo la generazione, puoi selezionare e salvare una delle voci generate, che occuperà uno dei tuoi slot vocali.
Guida ai prompt
Il prompt è la base della tua voce. Indica al modello che tipo di voce vuoi creare: dall’accento e dal tipo di personaggio fino al genere e all’atmosfera della voce. Un prompt ben formulato può fare la differenza tra una voce generica e una che rispecchia davvero la tua idea. In generale, prompt più descrittivi e dettagliati tendono a produrre risultati più accurati e ricchi di sfumature. Più dettagli fornisci, tra cui età, genere, tono, accento, ritmo, emozione, stile e altro ancora, meglio il modello potrà interpretare e creare una voce intenzionale e su misura.
Tuttavia, anche prompt brevi e semplici possono funzionare, soprattutto se cerchi una voce più neutra o utilizzabile in molti contesti. Ad esempio, “Un narratore maschile calmo” potrebbe offrirti esattamente ciò di cui hai bisogno senza entrare nei dettagli, in particolare se non stai cercando di creare un personaggio o uno stile molto specifico. Il giusto livello di dettaglio dipende dal tuo caso d’uso. Stai creando un personaggio fantasy? Un assistente virtuale? Una newyorkese sessantenne stanca con un umorismo secco? Più lo definisci chiaramente nel prompt, più l’output sarà vicino a ciò che immagini.
Formato del prompt consigliato
Per risultati coerenti, struttura il prompt in questo formato:
Esempio:
Spagnolo madrelingua, spagnolo europeo (senza tratti dello spagnolo latinoamericano). Donna, 35-40 anni. Qualità discreta. Persona: operatrice dell’assistenza affidabile. Emozione: rassicurante, attenta, sicura di sé. Timbro morbido e naturale con intonazione delicata, prossimità ravvicinata e segnale privo di rumore. Fornisce aggiornamenti a un ritmo rilassato con chiara enfasi sulle informazioni utili, trasmettendo empatia e professionalità.
Errori comuni da evitare
- Non usare “accento” quando intendi l’intonazione — può causare variazioni dialettali indesiderate. Descrivi invece l’intonazione, l’enfasi o le modalità di espressione.
- Evita parole relative agli effetti — termini come “riverbero”, “eco”, “telefono” o “nastro” possono influire negativamente sulla qualità dell’output.
- Indica chiaramente lingua e dialetto — specifica sempre la lingua e la variante regionale nella prima frase per evitare variazioni indesiderate.
Qualità audio
La qualità audio si riferisce alla nitidezza, alla pulizia e alla fedeltà complessiva della voce generata. Per impostazione predefinita, ElevenLabs punta a produrre audio pulito e naturale, ma se il tuo progetto richiede un livello di qualità specifico, è meglio indicarlo esplicitamente nel prompt.
Per risultati di alta qualità, puoi aiutare il modello aggiungendo alla descrizione della voce una frase come “qualità audio perfetta” o “registrazione di qualità da studio”. Questo aiuta a garantire che la voce venga riprodotta con la massima nitidezza, distorsione minima e una finitura curata.
Puoi anche usare descrittori di qualità specifici che offrono risultati coerenti:
- Qualità discreta
- Buona qualità
- Ottima qualità
- Qualità eccellente
- Qualità da studio
- Qualità broadcast
Questi descrittori aiutano a ottenere la massima qualità audio se inclusi nel prompt.
Includere questo tipo di frasi può talvolta ridurre l’accuratezza generale del prompt se la voce è molto specifica o di nicchia.
Esistono anche casi creativi in cui una qualità audio inferiore è intenzionale, ad esempio quando simuli una telefonata, una vecchia trasmissione radiofonica o un filmato ritrovato. In queste situazioni, non includere affatto descrittori di qualità oppure aggiungi esplicitamente frasi come:
- “Audio a bassa fedeltà”
- “Qualità audio scarsa”
- “Suona come un messaggio in segreteria”
- “Ovattato e distante, come su un vecchio registratore a nastro”
La posizione di questa frase nel prompt è flessibile: può comparire all’inizio o alla fine, e abbiamo riscontrato che funziona bene in entrambi i casi.
Età, tono/timbro e genere
Queste tre caratteristiche sono alla base del voice design e definiscono l’identità complessiva e la risonanza emotiva della voce. Più dettagli fornisci, più sarà facile per l’IA produrre una voce in linea con la tua visione creativa, sia che tu stia creando un personaggio credibile, una voce narrante coinvolgente o un assistente virtuale.
Età
Descrivere l’età percepita della voce aiuta a definirne la maturità, la texture vocale e l’energia. Usa termini specifici per guidare l’IA verso la giusta qualità vocale.
Descrittori utili:
- “Adolescente maschio” / “adolescente femmina”
- “Giovane adulto” / “sui 20 anni” / “poco più che trentenne”
- “Uomo di mezza età” / “donna sui 40 anni”
- “Uomo anziano” / “donna anziana” / “uomo sugli 80 anni”
Tono/timbro
Si riferisce alla qualità fisica della voce, definita da altezza, risonanza e texture vocale. È distinta dall’espressività emotiva o dall’atteggiamento.
Descrittori comuni per tono/timbro:
- “Profondo” / “basso”
- “Morbido” / “ricco”
- “Ruvido” / “roco”
- “Nasale” / “stridulo”
- “Aereo” / “soffiato”
- “Possente” / “risonante”
- “Leggero” / “sottile”
- “Caldo” / “morbido”
- “Metallico” / “ferroso”
Genere
Il genere influenza spesso altezza, corposità vocale e presenza timbrica, ma puoi andare oltre le semplici categorie descrivendo il suono anziché l’identità.
Esempi:
- “Una voce femminile bassa e roca”
- “Una voce maschile profonda e risonante”
- “Un genere neutro — morbido e di tonalità media”
Accento
L’accento ha un ruolo fondamentale nel definire l’identità regionale, culturale ed emotiva di una voce. Se il tuo progetto richiede un suono autentico, realistico o stilizzato per un personaggio, è essenziale indicare con chiarezza e precisione l’accento desiderato.
La scelta delle parole conta: alcuni termini tendono a produrre risultati più coerenti. Ad esempio, “marcato” spesso dà risultati migliori di “forte” per descrivere quanto deve essere evidente un accento. Ci sono molti tentativi da fare e ti invitiamo a sperimentare con le formulazioni, cercando di essere il più creativo e descrittivo possibile.
Fai attenzione quando usi la parola “accento” — se intendi i modelli di intonazione o enfasi anziché un dialetto regionale, usa invece questi termini. Usare “accento” quando intendi l’intonazione può causare variazioni di dialetto indesiderate.
- Esempi di prompt chiari per l’accento:
- “Un uomo di mezza età con un marcato accento francese”
- “Una giovane donna con una lieve cadenza del Sud degli Stati Uniti”
- “Un anziano con un forte accento dell’Europa orientale”
- “Una donna allegra che parla con un nitido accento britannico”
- “Un giovane uomo con una lieve cadenza irlandese”
- “Una voce autorevole con un accento americano neutro”
- “Un uomo con un accento regionale australiano, rilassato e nasale”
Evita descrittori troppo vaghi come “straniero” o “esotico”: sono imprecisi e possono produrre risultati incoerenti.
Combina l’accento con altri tratti, come tono, età o ritmo, per avere un maggiore controllo. Ad esempio: “Un’anziana sarcastica con un marcato accento di New York, che parla lentamente.”
Per voci fantasy o di finzione, puoi usare accenti reali come fonte di ispirazione:
- “Un elfo con un autentico e marcato accento britannico. È regale e lirico.”
- “Un goblin con un roco accento dell’Europa orientale.”
Ritmo
Il ritmo si riferisce alla velocità e alla cadenza con cui una voce parla. È un elemento chiave per definire la personalità, il tono emotivo e la chiarezza della voce. Indicare esplicitamente il ritmo è essenziale, soprattutto quando progetti voci per casi d’uso specifici come storytelling, pubblicità, dialoghi di personaggi o contenuti didattici.
Usa un linguaggio chiaro per descrivere quanto velocemente o lentamente deve parlare la voce. Puoi anche descrivere come appare il ritmo: costante, irregolare, misurato o disinvolto. Se il ritmo cambia, assicurati di indicare dove e perché.
Esempi di descrittori del ritmo:
- “Parla velocemente” / “a ritmo sostenuto”
- “A ritmo normale” / “parla normalmente”
- “Parla lentamente” / “con un ritmo lento”
- “Ritmo deliberato e misurato”
- “Prolungato, come se assaporasse ogni parola”
- “Con una cadenza concitata, come se avesse fretta”
- “Ritmo rilassato e conversazionale”
- “Ritmo ritmico e musicale”
- “Ritmo irregolare, con pause e scatti improvvisi”
- “Ritmo uniforme, con intervalli costanti tra le parole”
- “Espressione staccata”
Testo per l’anteprima
Dopo aver scritto un prompt efficace per la voce, il testo che usi per visualizzarla in anteprima ha un ruolo fondamentale nel determinarne il suono effettivo. Il testo di anteprima funziona come un copione: definisce il tono, il ritmo e l’espressività emotiva che la voce cercherà di riprodurre.
Per ottenere i migliori risultati, il testo di anteprima deve essere coerente con la descrizione della voce, non contraddirla. Ad esempio, se il prompt descrive una “voce femminile giovane, calma e riflessiva, con un leggero accento giapponese”, usare una frase come “Ehi! Non sopporto cosa hai fatto a questo maledetto posto!!!” sarà in contrasto con quell’intento. Il modello proverà a conciliare questa discrepanza, portando spesso a risultati innaturali o incoerenti.
Usa invece un testo di esempio che rifletta la personalità e il tono emotivo previsti per la voce. Per l’esempio precedente, qualcosa come “Ultimamente è stato tutto tranquillo… Ho avuto tempo per riflettere e forse è proprio ciò di cui avevo più bisogno.” è coerente con il prompt e aiuta a generare una voce più naturale e omogenea.
Inoltre, abbiamo osservato che testi di anteprima più lunghi tendono a produrre risultati più stabili ed espressivi. Le frasi brevi possono talvolta suonare brusche o incoerenti, soprattutto quando testi qualità sottili come tono o ritmo. Fornire più contesto al modello, una frase completa o persino un breve paragrafo, gli consente di offrire una rappresentazione più fluida e accurata della voce.
Parametri
Volume
Controlla il volume della generazione Text to Preview e, in definitiva, della voce una volta salvata.
Scala di guida
Stabilisce quanto fedelmente viene seguito il prompt. Valori più alti rispettano il prompt più rigorosamente, ma potrebbero ridurre la qualità audio se il prompt è molto di nicchia; valori più bassi consentono invece al modello di essere più creativo a scapito dell’accuratezza del prompt. Usa un valore più basso se l’espressività e la qualità audio sono in generale più importanti della perfetta aderenza al prompt. I valori alti sono consigliati quando l’accuratezza di accento o tono è fondamentale.
Attributi ed esempi
Sperimenta con il modo in cui scrivi questi descrittori. Ad esempio, “Qualità audio perfetta” può anche essere scritto come “la qualità audio è perfetta”. A volte queste formulazioni possono produrre risultati diversi!