Presentiamo il Modificatore di Voce
- Pubblicato
AscoltaAscolta questo articolo
Voice Changer si chiamava originariamente speech-to-speech. Nel contesto degli agenti vocali IA, "speech-to-speech" si riferisce anche ad architetture fuse, in cui un unico modello gestisce direttamente l'input e l'output audio. ElevenAgents utilizza un'architettura a cascata avanzata per la sua piattaforma. Scopri di più: Modelli a cascata e modelli fusi.
Modificatore di Voce
Abbiamo aggiunto Modificatore di Voce alla Sintesi Vocale. Voice Changer è uno strumento di conversione vocale che prende la registrazione di una voce e la fa sembrare pronunciata da un'altra, preservando al tempo stesso l'interpretazione originale. Ciò significa che le emozioni, il timing, il ritmo e la pronuncia che inserisci nella registrazione vengono trasferiti alla voce di output.
Questo ti offre un livello di controllo che i prompt di text-to-speech da soli non sempre consentono di ottenere. Puoi usarlo in due modi principali.
Trasmetti più emozione con una voce. Non tutte le voci rispondono allo stesso modo alle indicazioni emotive fornite tramite prompt di text-to-speech. Voice Changer ti permette di registrare o caricare un parlato molto espressivo e riprodurne l'ampiezza emotiva con una voce diversa. Se vuoi che un narratore professionista abbia un tono più caldo o che un personaggio di un libro per bambini risulti più giocoso, puoi interpretare tu stesso la battuta e lasciare che Voice Changer la trasferisca alla voce di destinazione.
Perfeziona l'interpretazione del parlato. I nostri modelli di text-to-speech gestiscono in genere bene l'intonazione fin da subito. Ma quando hai bisogno di un controllo preciso su come viene pronunciata una frase specifica — dove cade l'enfasi, come si inserisce una pausa, quale ritmo assume — Voice Changer ti consente di mostrarlo con la tua voce e poi di applicare quell'interpretazione a qualsiasi voce tu scelga. Sarà ancora più utile quando integreremo Voice Changer direttamente in Studio, ma l'obiettivo resta lo stesso: darti un controllo preciso sul tuo output.
Ecco una guida di un membro della nostra community:
Ricerca
Per convertire il parlato di origine in parlato di destinazione, dobbiamo esprimere il contenuto del parlato di origine con le caratteristiche di quello di destinazione. Un'analogia utile è lo scambio di volti: app che prendono due volti e li fondono, rendendo i tratti di una persona nella struttura mappata dell'altra.
Per farlo, prendiamo l'immagine di un volto e ne mappiamo gli attributi. I marcatori nell'esempio qui sotto fanno proprio questo: delimitano l'area entro cui verrebbe reso l'altro volto.
Il segreto della conversione vocale è rendere il contenuto del parlato di origine usando i fonemi del parlato di destinazione. Ma c'è un compromesso, proprio come nell'esempio dello scambio di volti: più marcatori usi per mappare gli attributi di un volto, più vincoli imponi al volto che mappi al loro interno. Meno marcatori significa meno vincoli.
Lo stesso vale per la conversione vocale. Più priorità diamo al parlato di destinazione, maggiore è il rischio di perdere la sincronia con quello di origine. Ma se non gli diamo abbastanza priorità, rischiamo di perdere gran parte di ciò che rende caratteristico quel parlato. Per esempio, se dovessimo rendere la registrazione di qualcuno che urla con rabbia con una voce sussurrata, avremmo un problema. Se diamo troppa priorità alle emozioni del parlato di origine, il prezzo da pagare è perdere l'impressione che a parlare sia una voce sussurrata. Se invece diamo troppa enfasi al modello di parlato sussurrato, perdiamo la carica emotiva del parlato di origine.
Prodotto e aggiornamenti recenti
Modifiche alle voci predefinite
Stiamo modificando le voci predefinite disponibili nella Sintesi Vocale. Ritireremo alcune voci e le sostituiremo con nuove, con oltre 20 aggiunte previste nelle prossime settimane.
Inizieremo inoltre a fornire nell'interfaccia informazioni sul periodo di disponibilità previsto per ogni voce. Per tutto dicembre, rinnoveremo le funzionalità di condivisione delle voci e di compensazione per il loro utilizzo, per aumentare la varietà delle voci. Maggiori dettagli in arrivo.
Eleven Turbo v2 e formato uLaw 8 kHz
Turbo v2 è il risultato di mesi di ricerca del nostro team. È progettato per le interazioni in tempo reale, ma funziona per qualsiasi caso d'uso. Supporta inoltre il formato standard (m)uLaw a 8 kHz per i sistemi IVR.
Normalizzazione e metadati con Studio
Studio ora supporta le linee guida standard del settore per l'invio di audiolibri, inclusi la regolazione del guadagno e la compressione dinamica. Puoi anche incorporare metadati (ISBN, autore e titolo) direttamente nel tuo progetto Studio.
Dizionario di pronuncia
Questa è stata una delle funzionalità più richieste. Il mese scorso abbiamo aggiunto il supporto dei tag SSML per specificare la pronuncia usando i dizionari IPA e CMU con i nostri modelli in inglese. Abbiamo ora rilasciato il supporto dei dizionari di pronuncia nell'interfaccia di Studio, che ti consente di caricare un file per specificare la pronuncia tramite IPA, CMU o sostituzioni di parole (alias). I file del dizionario usano il formato aperto standard del settore .PLS per file lessicali.
IPA e CMU sono attualmente supportati da Turbo v2 English. Le sostituzioni di parole sono supportate da tutti i modelli e in tutte le lingue. La documentazione completa è disponibile qui.
Se hai commenti o suggerimenti, non esitare a contattarci su Discord!
Prova Voice Changer
Dillo come vuoi e ascoltalo pronunciato con una voce completamente diversa, mantenendo il pieno controllo dell'interpretazione. Cattura sussurri, risate, accenti e sottili sfumature emotive.
Dì quello che vuoi e ascoltalo in una voce completamente diversa, con il pieno controllo sull’interpretazione. Cattura sussurri, risate, accenti e sfumature emotive.




