Vai al contenuto

Presentiamo Eleven Multilingual v1: il nostro nuovo modello di sintesi vocale

Pubblicato

AscoltaAscolta questo articolo

Oggi siamo felici di lanciare Eleven Multilingual v1, il nostro modello avanzato di sintesi vocale che supporta sette nuove lingue: francese, tedesco, hindi, italiano, polacco, portoghese e spagnolo. Basato sulla ricerca che ha dato vita a Eleven Monolingual v1, il nostro attuale approccio di deep learning sfrutta più dati, maggiore potenza di calcolo e tecniche innovative in un modello sempre più sofisticato, capace di comprendere le sfumature del testo e offrire una resa ricca di emozioni. Questo progresso amplia le possibilità creative per creator, sviluppatori di videogiochi ed editori, aprendo la strada all'uso dei media generativi per creare contenuti più localizzati, accessibili e creativi.

Il nuovo modello è disponibile in tutti i piani di abbonamento e puoi provarlo subito sulla nostra piattaforma Beta.

Per usarlo, selezionalo dal nuovo menu a discesa nel pannello Speech Synthesis.

Panoramica della ricerca

Come il suo predecessore, il nuovo modello si basa interamente sulla nostra ricerca interna. Mantiene tutti i punti di forza che hanno reso Eleven Monolingual v1 un eccellente strumento per lo storytelling, come la capacità di adattare l'interpretazione al contesto e di trasmettere intenzioni ed emozioni in modo iperrealistico. Queste funzionalità sono state ora estese alle nuove lingue supportate grazie all'addestramento su dati multilingue.

Una caratteristica interessante del modello è la sua capacità di identificare testo multilingue e pronunciarlo in modo appropriato. Ora puoi generare parlato in più lingue usando un unico prompt mantenendo le caratteristiche vocali uniche di ogni speaker. Per ottenere i risultati migliori, consigliamo di fornire un prompt in una sola lingua. Sebbene il modello funzioni già abbastanza bene con più lingue contemporaneamente, sono necessari ulteriori miglioramenti.

Il nuovo modello è compatibile con altre funzionalità di VoiceLab, ovvero Instant Clonazione Vocale IA e Voice Design. Tutte le voci create dovrebbero mantenere la maggior parte delle loro caratteristiche vocali originali in tutte le lingue, incluso l'accento originale.

Detto questo, il modello presenta limitazioni note: numeri, acronimi e parole straniere a volte vengono pronunciati in inglese quando il prompt è in un'altra lingua. Ad esempio, il numero "11" o la parola “radio”, inseriti in un prompt in spagnolo, potrebbero essere pronunciati come in inglese. Mentre lavoriamo a miglioramenti, consigliamo di scrivere per esteso acronimi e numeri nella lingua di destinazione.

Democratizzare la voce

ElevenLabs è nata con il sogno di rendere tutti i contenuti universalmente accessibili in qualsiasi lingua e con qualsiasi voce. I membri del nostro team provengono da tutta Europa, Asia e Stati Uniti. Man mano che il nostro team e il mondo diventano sempre più multilingue, siamo sempre più uniti dalla visione di rendere disponibili in ogni lingua voci IA di qualità umana.

L'ultima versione del nostro modello Text to Speech (TTS) è soltanto il primo passo verso la realizzazione di questa visione. Grazie all'arrivo di voci IA di qualità umana, utenti e aziende possono ora creare e personalizzare contenuti audio in base alle proprie esigenze, priorità e preferenze. Questo ha già dimostrato il potenziale di rendere più equo il panorama per creator, piccole imprese e artisti indipendenti. Con l'audio IA, gli utenti possono creare esperienze audio di alta qualità paragonabili a quelle prodotte da organizzazioni più grandi e con maggiori risorse.

Questi vantaggi si estendono ora alle applicazioni multilingue, multiculturali ed educative, consentendo a utenti, aziende e istituzioni di produrre audio autentico che raggiunge un pubblico più ampio. Offrendo un'ampia gamma di voci, accenti e lingue, l'IA aiuta a colmare le differenze culturali e favorisce la comprensione globale. In ElevenLabs, crediamo che questa nuova accessibilità promuova in definitiva maggiore creatività, innovazione e diversità.

I creator di contenuti che desiderano coinvolgere pubblici diversi hanno ora gli strumenti per colmare le differenze culturali e favorire l'inclusività.

Gli sviluppatori di videogiochi e gli editori possono creare esperienze coinvolgenti e localizzate per un pubblico internazionale, superando le barriere linguistiche e connettendosi con giocatori e ascoltatori per massimizzare coinvolgimento ed efficienza, senza compromettere qualità o accuratezza.

Le istituzioni educative dispongono ora dei mezzi per produrre contenuti audio per utenti diversi nelle loro lingue di destinazione, migliorando la comprensione linguistica e persino le capacità di pronuncia, oltre a rispondere a stili di insegnamento e necessità di apprendimento differenti.

Gli istituti per l'accessibilità possono ora supportare ulteriormente le persone con disabilità visive o difficoltà di apprendimento, offrendo loro strumenti per convertire facilmente risorse meno accessibili in un formato adatto alle loro esigenze, sia nei contenuti sia nella forma.

Non vediamo l'ora di vedere i nostri creator e sviluppatori, presenti e futuri, superare i limiti del possibile!

Articoli simili

Crea con l'audio IA della massima qualità