> This is a page from the ElevenLabs documentation. For a complete page index, fetch https://elevenlabs.io/docs/llms.txt. For the full documentation in a single file, fetch https://elevenlabs.io/docs/llms-full.txt.

# Clonazione vocale: come funziona

La clonazione vocale è il processo di acquisizione delle caratteristiche vocali di una persona, come timbro, cadenza, accento e pronuncia, e di applicazione a una nuova sintesi vocale. ElevenLabs offre due metodi di clonazione: la Clonazione Vocale Istantanea (IVC) e la Clonazione Vocale Professionale (PVC). Non sono semplicemente versioni veloci e lente della stessa tecnologia; funzionano in modo fondamentalmente diverso.

## Cosa fa e cosa non fa la clonazione vocale

La clonazione vocale acquisisce una *rappresentazione* di una voce, non una sua registrazione. Il sistema apprende dai campioni audio schemi quali frequenze formanti, tendenze prosodiche e caratteristiche spettrali, quindi li codifica in parametri che guidano la sintesi vocale.

Questo significa che le voci clonate possono dire cose che l'oratore originale non ha mai detto. Significa anche che la qualità del clone è limitata da ciò che il modello può apprendere dai campioni: registrazioni di scarsa qualità, campioni brevi o audio rumoroso peggiorano il clone.

La clonazione vocale non riproduce l'acustica esatta della registrazione originale. L'output passa attraverso il modello di sintesi, che ha caratteristiche proprie. Un clone suona come l'oratore, ma attraverso il filtro del codec vocale del modello.

## Clonazione Vocale Istantanea

La Clonazione Vocale Istantanea funziona tramite adattamento *few-shot*: al momento dell'inferenza, il modello usa il campione audio come segnale di condizionamento e adatta il proprio output alla voce di destinazione senza aggiornare i pesi del modello.

Questo comporta diverse implicazioni:

**È immediata.** Non è previsto alcun processo di addestramento. Carichi l'audio e il clone è subito disponibile.

**Il limite massimo di qualità è determinato dall'audio di riferimento.** Durante la generazione, il modello usa la registrazione come riferimento in tempo reale. Il rumore di fondo, gli artefatti di compressione o un ambiente di registrazione atipico influenzano tutti l'output.

**Funziona con campioni brevi.** Meno di due minuti di audio possono produrre un clone utilizzabile, anche se più campioni, con parlato vario in frasi, toni e cadenze diverse, migliorano in genere la coerenza.

**Generalizza meno bene tra diversi stili di parlato.** Poiché il condizionamento avviene al momento dell'inferenza anziché tramite fine-tuning, i cloni IVC possono essere meno coerenti quando devono produrre un parlato molto diverso dal materiale di riferimento. Una voce clonata da una narrazione calma potrebbe suonare diversamente se le viene richiesto di esprimere un'emozione intensa.

## Clonazione Vocale Professionale

La Clonazione Vocale Professionale adotta un approccio diverso: esegue il fine-tuning del modello sui campioni audio. Invece di usare l'audio come segnale di condizionamento al momento della generazione, PVC modifica effettivamente i parametri del modello per rappresentare meglio la voce di destinazione.

Questo comporta implicazioni significativamente diverse:

**La qualità è sensibilmente superiore.** Il fine-tuning consente al modello di acquisire più a fondo le caratteristiche della voce, incluse tendenze stilistiche che IVC non può riprodurre in modo affidabile. Le voci PVC sono più coerenti tra diversi tipi di parlato e gestiscono meglio la gamma emotiva.

**Richiede più dati.** Il processo di fine-tuning necessita di audio sufficiente a essere statisticamente informativo. ElevenLabs consiglia circa 30 minuti di audio di alta qualità. In genere, più audio è meglio; campioni brevi o poco vari non forniscono al modello un segnale sufficiente.

**La qualità dell'audio è ancora più importante.** Poiché il modello apprende dalle registrazioni anziché limitarsi a condizionarsi su di esse al momento dell'inferenza, la qualità della registrazione influisce sui pesi stessi del modello. Condizioni di registrazione professionali, con rumore di fondo minimo, posizionamento coerente del microfono e nessuna compressione, producono risultati sensibilmente migliori.

**Richiede tempo.** Il fine-tuning è un processo ad alta intensità di calcolo. La creazione di una PVC richiede minuti anziché secondi.

**Richiede l'idoneità del piano.** PVC richiede un piano Creator o superiore, a causa dell'investimento computazionale necessario.

## Il processo di verifica

Sia IVC sia PVC includono una fase di verifica vocale. Non è un requisito tecnico della sintesi: è una misura di sicurezza etica e legale.

Il processo di verifica usa una tecnologia voice-captcha per confermare che sei la persona che fornisce i campioni vocali e non stai usando registrazioni di qualcun altro senza il suo consenso.

Esistono limitazioni intrinseche: la verifica non può garantire che la registrazione fornita appartenga realmente al richiedente, ma soltanto che il richiedente fosse presente e partecipasse attivamente. I Termini di servizio e le politiche di sicurezza IA di ElevenLabs attribuiscono al creatore la responsabilità dell'uso autorizzato.

## Separazione degli oratori

Quando l'audio di origine contiene più oratori, è possibile applicare una fase di separazione degli oratori per isolare la voce di destinazione prima della clonazione. È utile quando le registrazioni provengono da riunioni, conversazioni o interviste.

La separazione degli oratori funziona meglio quando le voci sono chiaramente distinte e l'oratore di destinazione ha un tempo di parlato consistente e continuo. Diventa inaffidabile quando le voci si sovrappongono frequentemente, gli oratori hanno profili acustici simili oppure l'oratore di destinazione interviene per periodi molto brevi o frammentati.

La separazione degli oratori è un'approssimazione di elaborazione del segnale, non un isolamento perfetto. Rispetto a una registrazione pulita con un unico oratore, l'audio separato presenterà sottili artefatti. Quando questi artefatti diventano dati di addestramento in PVC, influenzano il clone risultante: un altro motivo per cui, quando disponibili, sono preferibili registrazioni di alta qualità con un solo oratore.

## Quando usare IVC o PVC

La decisione dipende da tre fattori: tempo di rilascio, disponibilità di audio e requisiti di qualità.

**Usa IVC quando**: hai bisogno rapidamente di un clone, disponi di poco audio di origine (meno di qualche minuto), stai creando un prototipo o facendo test, oppure la tua applicazione può tollerare una moderata coerenza vocale tra diversi stili di parlato.

**Usa PVC quando**: la qualità e la coerenza della voce sono prioritarie, hai accesso ad almeno 30 minuti di registrazioni di alta qualità, stai creando un'applicazione di produzione in cui la voce clonata rappresenta un brand o una persona reale e disponi di un piano Creator o superiore.

Per la maggior parte delle applicazioni di produzione con requisiti di qualità reali, PVC è la scelta migliore. IVC è un punto di partenza pratico per l'esplorazione, le funzionalità di personalizzazione o i casi in cui l'oratore non può fornire sessioni di registrazione prolungate.

## Correlati

#### [Guida alla Clonazione Vocale Istantanea](/docs/it/eleven-api/guides/how-to/voices/instant-voice-cloning)

Come creare una Clonazione Vocale Istantanea tramite l'API.

#### [Guida alla Clonazione Vocale Professionale](/docs/it/eleven-api/guides/how-to/voices/professional-voice-cloning)

Come creare una Clonazione Vocale Professionale tramite l'API.

#### [Riferimento delle voci](/docs/it/overview/capabilities/voices)

Tipi di voce, gestione e Voice Library.

#### [Guida al design vocale](/docs/it/eleven-api/guides/how-to/voices/voice-design)

Come generare una nuova voce da una descrizione testuale anziché clonarne una.