Questa voce non esiste - Voce generativa IA
- Pubblicato
AscoltaAscolta questo articolo
Di recente sembra che tutti parlino di IA generativa. I grandi modelli linguistici e di generazione da testo a immagine basati sul deep learning, come ChatGPT, Stable Diffusion, DALL-E e Midjourney, hanno suscitato grande scalpore nel mondo tech e non solo. Molti li annoverano tra gli sviluppi più importanti e recenti dell'IA. Che tu sia d'accordo o meno, il sentimento generale sembra essere che sia apparso qualcosa di estremamente potente. Nel 2023 sentiremo parlare di modelli che possono aiutarti a disegnare o creare video. Proprio come ci chiediamo quale sia l'ultimo smartphone più innovativo, presto ci chiederemo quale sia il foundation model più recente e avanzato. Eppure, nonostante tutto questo entusiasmo, riteniamo che ci sia un ambito dei media generativi ancora fortemente sottovalutato: le voci IA. È anche l'ambito in cui vogliamo diventare leader. In ElevenLabs, sfruttiamo ogni giorno il potenziale delle tecniche di deep learning per alimentare i nostri strumenti di Text to Speech e Clonazione Vocale IA realistici. E ora stiamo implementando anche il nostro modello generativo, che ti consente di progettare da zero voci sintetiche completamente nuove.
Generatore di voci: progetta una voce
Ogni giorno, i nostri utenti usano la piattaforma per dare vita ai propri personaggi, che sia per audiolibri, giochi o fan fiction. Ci siamo resi conto che il nostro attuale catalogo di speaker è troppo limitato perché tutti possano trovare le voci adatte alle esigenze dei propri contenuti, mantenendole al contempo esclusive per ogni utente. La nostra soluzione è stata permetterti di progettare voci sintetiche completamente nuove.
L'idea di come farlo è nata analizzando i metodi che usiamo attualmente per la sintesi vocale e la clonazione vocale. Entrambi i processi richiedono un modo per codificare le caratteristiche di una voce specifica. Gli speaker embedding trasportano questa identità: sono una rappresentazione vettoriale della voce di uno speaker. Ci siamo resi conto che, addestrando un modello dedicato, potevamo campionare dalla distribuzione degli speaker embedding e creare un numero infinito di nuove voci.
Poiché i nostri utenti cercano soprattutto caratteristiche vocali specifiche, dovevamo aggiungere un certo livello di controllo al processo. Abbiamo ampliato il nostro modello con il conditioning, per generare voci in base alle loro caratteristiche. Ora il modello ti consente di impostare alcuni parametri di base che definiscono l'identità essenziale della nuova voce: genere, età, accento, tono e stile di parlato. In altre parole, ogni volta che premi “genera”, anche se scegli gli stessi parametri di base, ottieni una voce completamente nuova che prima non esisteva.
Ecco alcuni esempi di voci che puoi progettare in questo modo:
“Progetta voce” sarà disponibile sulla nostra piattaforma a febbraio, come parte di Voice Lab.
A cosa serve?
I nostri strumenti sono già in grado di produrre parlato realistico quanto quello umano e prevediamo che le possibili applicazioni delle voci artificiali continueranno ad ampliarsi. Molte di queste nuove applicazioni, inclusa la registrazione di audio per testate giornalistiche o spot pubblicitari, richiederanno che una voce sia associata e limitata a un brand o a un caso d'uso specifico, senza essere utilizzata altrove. Altri casi d'uso, come lo storytelling e i videogiochi, danno priorità alla flessibilità e alla libertà di sperimentare sin dalle prime fasi di sviluppo. Perciò, anziché creare un gigantesco insieme di speaker virtuali, abbiamo scelto di lasciare agli utenti l'ultima parola sulle voci più adatte ai loro scopi.
Gli autori di libri ora non hanno soltanto la possibilità di convertire facilmente le proprie opere in audio, ma mantengono anche il controllo artistico sulla progettazione di una narrazione su misura. Questo offre al loro pubblico nuovi e interessanti modi di interagire con le pubblicazioni e aumenta notevolmente il numero di libri che potremo ascoltare.
Gli editori di notizie si sono avvicinati sempre più all'audio e scegliere voci distintive che rappresentino le loro pubblicazioni è un compito importante: molti ascoltatori apprezzano tanto la forma quanto il contenuto. Altrettanto importante, gli editori ora possono essere certi che una determinata voce rappresenti loro, e soltanto loro.
Gli sviluppatori di videogiochi ora possono dare voce a una moltitudine di NPC altrimenti silenziosi, con tutti gli strumenti necessari a portata di mano. Non solo possono ridurre i costi senza compromettere la qualità, ma possono anche progettare voci completamente uniche per i mondi virtuali che creano.
I creativi pubblicitari hanno bisogno di voci fuori campo adatte a campagne specifiche, quindi poter progettare fin dall'inizio dello sviluppo una narrazione efficace e pensata per uno scopo preciso rappresenta un vantaggio considerevole. Ora possono sperimentare istantaneamente con più voci e stili di interpretazione, senza coinvolgere risorse aggiuntive.
Dai creatori che producono contenuti audio e video di ogni tipo ai responsabili aziendali che desiderano dare voce alle comunicazioni dell'azienda, le possibilità di progettare audio coinvolgenti, unici e su misura per un caso d'uso specifico sono ormai infinite.
IA etica
Così come la clonazione vocale suscita timori sulle conseguenze di un suo possibile uso improprio, sempre più persone temono che la diffusione della tecnologia IA metta a rischio il sostentamento dei professionisti. In ElevenLabs, immaginiamo un futuro in cui i doppiatori possano concedere in licenza le proprie voci per addestrare modelli vocali destinati a usi specifici, ricevendo un compenso. Clienti e studi continueranno a includere con piacere talenti vocali professionisti nei loro progetti e l'uso dell'IA contribuirà semplicemente a ridurre i tempi di realizzazione e a offrire maggiore libertà di sperimentare e definire una direzione nelle prime fasi di sviluppo. La tecnologia cambierà il modo in cui l'audio parlato viene progettato e registrato, ma il fatto che i doppiatori non debbano più essere fisicamente presenti a ogni sessione offre loro la libertà di partecipare a più progetti contemporaneamente e di rendere davvero immortali le proprie voci.
Inoltre, siamo entusiasti perché molti libri, notizie, giochi indipendenti e altri contenuti i cui autori e sviluppatori altrimenti non potrebbero sostenere i costi di registrazione diventeranno ora accessibili attraverso un altro mezzo. Questo maggiore accesso offre l'opportunità di ampliare il pubblico in ogni caso.
In ElevenLabs ci impegniamo pienamente sia a rispettare i diritti di proprietà intellettuale sia a implementare misure di protezione contro il potenziale uso improprio della nostra tecnologia:
- Collaboriamo esclusivamente con clienti che rispettano i nostri Termini, i quali vietano l'uso dannoso della nostra tecnologia per qualsiasi scopo ritenuto illegale o nocivo;
- Stiamo inoltre lavorando per applicare watermark a tutto l'audio generato dal nostro modello, affinché sia possibile ricondurlo immediatamente a noi;
- Quando utilizziamo voci riconoscibili, lo facciamo a scopo dimostrativo e in contesti che non generano conflitti di interesse;
- Allo stesso tempo, cerchiamo di supportare i proprietari delle voci e i loro licenziatari nel far valere i propri diritti; tutte le violazioni note saranno esaminate e verranno adottate le misure necessarie.
Guardando al futuro: migliora la tua voce
In futuro prevediamo di combinare le capacità dei nostri modelli di generazione vocale e di Clonazione Vocale IA per consentirti di migliorare la tua voce. Potrai clonarla e poi modificarla per ottenere l'effetto che desideri. Se temi che il tuo stile di parlato naturale sia un po' monotono, potrai renderlo più vario. Se non ti piace essere registrato, potrai modificare l'output affinché suoni più naturale. Chiunque abbia bisogno di produrre audio con la propria voce, per qualsiasi scopo, che si tratti di una presentazione preregistrata o di un messaggio audio, potrà farlo con la nostra suite di strumenti, con un clic.
Felice anno nuovo
Con la fine del 2022, desideriamo ringraziare i nostri beta user per la partecipazione continua e per i loro feedback. Molte delle funzionalità che stiamo sviluppando nascono dai vostri suggerimenti e contributi. Non potremmo essere più felici di averti con noi e auguriamo a tutti un felice anno nuovo.
Beta di ElevenLabs
Vai qui per iscriverti alla nostra piattaforma beta e provarla. Apportiamo costantemente miglioramenti e, in questa fase iniziale, ogni feedback degli utenti è per noi molto prezioso.


.jpg&w=3840&q=80)

