Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Vai al contenuto

La prima IA in grado di ridere

Pubblicato

AscoltaAscolta questo articolo

Nel nostro ultimo articolo, abbiamo presentato alcuni esempi di contenuti lunghi generati dal nostro strumento di sintesi vocale e abbiamo illustrato brevemente come il design unico del nostro modello gli permetta di produrre un parlato dal ritmo naturale e non robotico. Oggi ti mostreremo che è anche più ricco di sfumature emotive e più consapevole del contesto di qualsiasi altro. Questo non solo lo rende molto coinvolgente da ascoltare, ma anche adatto ad applicazioni che spaziano dalla lettura di libri e videogiochi alla pubblicità.

Emozioni

Entrambi i punti di forza del nostro modello — fluidità e corretta intonazione — derivano dalla grande quantità di dati di addestramento che ha analizzato (oltre 500.000 ore!), ma il fattore centrale è il modo in cui apprende da questi dati, determinato dalla sua architettura. A livello più basilare, è progettato per comprendere le emozioni presenti nella scrittura e decidere se chi parla debba suonare felice, arrabbiato, triste o neutro. Considera alcuni esempi:

Tutte le differenze di intonazione e tono derivano esclusivamente dal testo: nessun altro elemento ha influenzato l'output. La punteggiatura e il significato delle parole svolgono un ruolo fondamentale nel decidere come pronunciare una determinata frase, ma nota anche come, quando chi parla è felice per una vittoria, il modello produca in modo convincente suoni che non fanno parte del parlato comune, come le risate (pubblicheremo presto una raccolta delle diverse risate che la nostra IA è in grado di riprodurre!). Allo stesso modo, enfatizza opportunamente la reazione quando chi parla è divertito da qualcosa di esilarante: è «trooooppo divertente».

Contesto

Ma conoscere il significato delle singole parole non basta. Il nostro modello è altrettanto sensibile al contesto più ampio che circonda ogni enunciato: valuta se qualcosa ha senso in base al legame con il testo precedente e successivo. Questa prospettiva più ampia gli consente di intonare correttamente passaggi più lunghi, applicando a un filo di pensiero che si estende su più frasi uno schema emotivo coerente, come mostrato nel nostro precedente articolo dedicato a contenuti più estesi. Lo aiuta anche a evitare errori logici. Per esempio, alcune parole si scrivono nello stesso modo ma hanno significati diversi, come «read» al presente e al passato o «minute», che può indicare un'unità di tempo o qualcosa di piccolo. Decidere quale sia appropriata dipende dal contesto:

Parola scritta e parlata

Poiché progettiamo la nostra piattaforma per rispondere alle esigenze dei contenuti lunghi, il nostro modello deve anche comprendere che simboli, abbreviazioni e alcune convenzioni comuni nella scrittura vadano pronunciati in un determinato modo o non letteralmente. Per esempio, il modello deve sapere che FBI, TNT e ATM si pronunciano diversamente da UNESCO o NASA. Allo stesso modo, $3tr va benissimo nello scritto, ma letto ad alta voce deve diventare «tre trilioni di dollari».

Intervento umano

Riconoscere queste sottili distinzioni è fondamentale, poiché il nostro obiettivo è ridurre al minimo la necessità di intervento umano nel processo di generazione. Dopotutto, non promuoviamo la capacità del nostro strumento di generare un audiolibro in pochi minuti per poi far ascoltare a qualcuno l'intero audio e riscrivere tutto il testo. Tuttavia, anche se aggiorniamo continuamente le regole di pronuncia del nostro modello, è sempre possibile che qualcosa lo confonda. Per questo stiamo sviluppando un sistema per segnalare le incertezze, che consentirà agli utenti di vedere subito quali parti del testo il modello ha considerato problematiche e di insegnargli come pronunciarle.

Innumerevoli applicazioni

Tutte le capacità che abbiamo mostrato sono passi verso un software che diventi lo strumento di doppiaggio con IA più versatile.

Gli editori di notizie hanno già scoperto che aumentare la propria presenza audio è un ottimo modo per fidelizzare gli abbonati. Il grande vantaggio di integrare ogni articolo con la relativa lettura audio è che le persone possono ascoltarlo mentre fanno altro. Gli editori che lo fanno ricorrono spesso a doppiatori e doppiatrici, con costi elevati, e non tutti gli articoli vengono coperti. Oppure fanno leggere le notizie ai propri giornalisti, un'attività che richiede tempo e quindi è costosa. Chi usa il parlato sintetico per dare voce ai propri contenuti risparmia, ma paga un altro prezzo compromettendo la qualità. Ora, con ElevenLabs, non devi più scendere a compromessi e puoi avere il meglio di entrambi i mondi.

Oppure immagina di generare audiolibri con voci fuori campo distinte e coinvolgenti sul piano emotivo per tutti i personaggi, in pochi minuti. Questo non solo offre nuovi modi di vivere i libri, ma facilita notevolmente l'accesso alle persone con difficoltà di apprendimento.

Pensa alle possibilità che ora si aprono agli sviluppatori di videogiochi che non devono più chiedersi se un determinato personaggio sia abbastanza importante da giustificare il notevole costo di doppiarlo con attori reali. Ora tutti gli NPC possono avere la propria voce e personalità.

Le agenzie pubblicitarie e i produttori possono ora sperimentare liberamente e adattare le voci fuori campo al tono di qualsiasi campagna, che sia per un canale TV sportivo o per un marchio di orologi di lusso. La voce di qualsiasi attore può essere concessa in licenza per la clonazione, così da applicare modifiche all'istante e senza la presenza fisica dell'attore. Se invece scelgono una voce completamente sintetica, gli inserzionisti non devono nemmeno preoccuparsi di pagare compensi per i diritti vocali.

Gli assistenti virtuali possono diventare più realistici sia perché la clonazione vocale consente loro di parlare con una voce familiare a un determinato utente, sia perché questa nuova ricchezza espressiva li rende più naturali con cui interagire.

Beta di ElevenLabs

Vai qui per registrarti alla nostra piattaforma beta e provarla di persona. Miglioriamo costantemente il prodotto e, in questa fase iniziale, ogni feedback degli utenti è molto prezioso per noi. Buon divertimento!

Articoli simili

Crea con l'audio IA della massima qualità