Vai al contenuto

Come dare vita ai video Veo 2 con voiceover ed effetti sonori di ElevenLabs

Scritto da
Ryan Morrison
Pubblicato
Ultimo aggiornamento

AscoltaAscolta questo articolo

Veo 2 di Google rende più semplice che mai generare video fotorealistici — e ora è disponibile nell'app web Gemini. Video di otto secondi con prompt migliorati direttamente da Gemini, per apportare modifiche con facilità.

Le immagini da sole, però, non bastano. Il suono trasforma una sequenza silenziosa in un'esperienza completamente immersiva, ed è qui che entra in gioco ElevenLabs. Con ElevenLabs, generare una voce fuori campo IA dinamica in diverse lingue o aggiungere effetti sonori può trasformare un semplice video in una storia coinvolgente.

Ho provato a fare proprio questo quando ho usato Veo 2 del laboratorio DeepMind di Google per raccontare la storia di una città che non dorme mai. Ho generato 18 clip diverse, ciascuna lunga circa 5-8 secondi, concentrandomi su ambientazioni urbane. Le clip mostrano insegne al neon, pioggia, un treno e varie scene di strada. Per unire questi momenti frammentati, ho aggiunto una voce fuori campo e degli effetti sonori con ElevenLabs.

A person walking on a city street near a bus stop with a bus in the background.

Creare una voce fuori campo coinvolgente

Una voce fuori campo IA ben realizzata dà struttura e profondità emotiva al tuo video. Sebbene sia forse il miglior generatore di video in termini di realismo, le clip di Veo 2 spesso non mantengono coerenza tra scene o personaggi, rendendo la narrazione l'elemento perfetto per unirle.

Invece di lasciare allo spettatore il compito di interpretare immagini frammentate, una voce fuori campo progettata con cura offre chiarezza e lo guida nella storia. Puoi partire dal copione della voce fuori campo e poi creare clip corrispondenti, oppure iniziare dalle inquadrature, di solito tratte da uno storyboard, e poi scrivere in base a quelle. Per il video sulla città, ho creato prima i prompt.

ElevenLabs' text-to-speech technology ensures professional-grade narration without the need for expensive recording setups. The flexibility to control tone, pacing, and emotion means you can fine-tune your voiceover to fit the mood of your project effortlessly. There are also thousands of voices to choose from to get exactly the right character.

Pianificare la narrazione

Prima di generare una voce fuori campo, è importante pianificare come la narrazione completerà il tuo video. Se, come la mia, la tua sequenza Veo 2 è un montaggio urbano cinematografico, la voce fuori campo può definire l'ambientazione, aggiungere una riflessione poetica o rendere più intensa l'atmosfera.

Per esempio, nel mio video c'è una scena con strade illuminate al neon e insegne tremolanti. Ho quindi scritto: "La città non dorme mai — quasi non sbatte nemmeno le palpebre. Inspira gas di scarico ed espira luce al neon, una bestia di acciaio e vetro che pulsa al passo di un milione di anime insonni." Questo collega diverse inquadrature.

Scrivere il copione della voce fuori campo

Dopo aver delineato la narrazione, il passo successivo è scrivere il copione per l'intero video. Un copione ben scritto assicura che la voce fuori campo sia in linea con il ritmo delle clip. Poiché le scene di Veo 2 durano spesso da 5 a 8 secondi, la narrazione deve essere concisa e ben ritmata. Una clip di 5 secondi consente circa 12-15 parole, mentre una di 8 secondi ne contiene all'incirca 20-25.

Il tono della narrazione deve adattarsi al video — poetico per immagini suggestive, documentaristico per sequenze informative e cinematografico per una narrazione ad alta energia. Per esempio, un'inquadratura al rallentatore del vapore che sale da un tombino potrebbe essere accompagnata da: "La città espira, il vapore si avvolge nell'aria fredda della notte", mentre l'arrivo di un treno in stazione potrebbe richiedere: "Una raffica di vento. Lo stridio del metallo. Arriva un altro treno, proprio come le centinaia che lo hanno preceduto."

Generare la voce fuori campo con ElevenLabs

Screenshot of a text-to-speech software interface with a paragraph of text and various settings on the right side.

Quando il tuo copione è pronto, è il momento di generare la tua voce fuori campo IA con ElevenLabs. Vai alla pagina Text to Speech nell'app ElevenLabs. Qui puoi incollare il copione oppure scriverlo direttamente. Poi puoi selezionare una voce sulla destra e impostarne velocità, stabilità e altre caratteristiche. Mi piace aggiungere un'esagerazione dello stile del 10-20%, perché migliora la caratterizzazione.

Un tono profondo e cinematografico funziona bene per sequenze urbane drammatiche, mentre una voce morbida e riflessiva valorizza le narrazioni poetiche. Per immagini dal ritmo serrato, una resa energica mantiene il ritmo coinvolgente. Per il mio video, ho usato Lamar Lincoln, una voce premium che ha dato alla storia un tocco più naturale. Volevo che sembrasse qualcuno che riflette su qualcosa a cui tiene.

Dopo aver inserito il copione, regola con precisione velocità ed emozione della voce fuori campo in base alle immagini. Un ritmo più lento e ponderato si adatta ai momenti drammatici, mentre un tono più conversazionale completa un montaggio energico. Quando sei soddisfatto del risultato, scarica il file audio e preparati a sincronizzarlo con il video.

Preferisco usare una o due frasi per regolare con precisione la voce, poi generare l'audio in base al copione completo. In questo caso, però, il copione era di soli tre paragrafi, quindi usare l'intero testo non è stato un problema. Inoltre, ha funzionato bene fin dall'inizio.

Sincronizzare la voce fuori campo

Screenshot of a video editing timeline with clips, audio tracks, and visual effects on a blue background.

Sincronizzare la voce fuori campo IA con le clip di Veo 2 è semplice usando software di editing come Adobe Premiere Pro, DaVinci Resolve, Final Cut Pro o CapCut.

  • Importa le clip video, aggiungi la voce fuori campo alla timeline e regola i punti di inizio e fine per allinearla alle immagini.
  • Se necessario, usa dissolvenze incrociate o la dilatazione temporale per garantire una transizione fluida tra narrazione e movimento.

Migliorare con gli effetti sonori

A text box with a description of flickering fluorescent light and neon signs, and a button labeled "Generate Sound Effects."

Quando la voce fuori campo è al suo posto, è il momento di migliorare il tuo video con gli effetti sonori. Gli effetti sonori generati dall'IA completano l'esperienza uditiva aggiungendo realismo e consistenza. Una clip video da sola può sembrare reale quanto qualcosa ripreso con un telefono, ma senza suono precipita in quel divario di irrealtà che ti fa sentire che manca qualcosa.

Creare effetti sonori con ElevenLabs

Il generatore text-to-sfx di ElevenLabs ti consente di creare elementi audio personalizzati, dai rumori ambientali della città ai suoni più delicati dell'ambiente. Puoi descrivere un intero paesaggio sonoro con un prompt complesso oppure generare più file, ciascuno con un insieme specifico di suoni, da sovrapporre nel tuo editor video.

Per creare gli effetti sonori, vai al generatore SFX di ElevenLabs. Puoi esplorare un elenco di effetti sonori predefiniti nella nostra libreria oppure creare un suono personalizzato con il generatore text-to-sfx. Puoi anche semplificare il processo provando il nostro esperimento video-to-sound. Ti consente di caricare una singola clip e ti fornirà 4 effetti sonori da scaricare.

Se vuoi avere più controllo sui suoni, vai al generatore di effetti sonori. Qui inserisci un prompt e fai clic su Genera. Puoi anche personalizzare la durata della clip da 0,5 a 22 secondi facendo clic sul pulsante Impostazioni.

Per esplorare, ascoltare in anteprima e raccogliere più rapidamente audio già pronti, la Soundboard offre un'interfaccia interattiva in cui puoi provare e mixare gli effetti sonori al volo, senza dover scrivere prompt.

Scrivere prompt per gli effetti sonori

A majestic lion with a loud and grizzly roar

Crea effetti sonori personalizzati e audio ambientali con il nostro potente generatore di effetti sonori IA.

Puoi usare un prompt complesso con una descrizione dettagliata dell'intero paesaggio sonoro, ma ho scoperto che è meglio creare una serie di prompt e sovrapporli. Così puoi controllare il momento in cui vengono riprodotti i diversi suoni in base al contenuto del video.

Un effetto sonoro posizionato bene rende reale una scena — passi che riecheggiano in un vicolo, il clacson distante di un'auto o il ticchettio ritmico della pioggia sul marciapiede. Abbinare questi suoni alle immagini aumenta l'immersione e rende ogni fotogramma più incisivo.

Se il tuo video mostra un'insegna al neon tremolante, un lieve ronzio elettrico in sottofondo ne rafforza la presenza. Se un treno della metropolitana si ferma stridendo, aggiungere l'attrito del metallo contro metallo aumenta l'autenticità.

Esempi di prompt:

  • Prompt descrittivo: "Soffice ticchettio della lancetta dei secondi di un orologio, lieve fruscio della manica del cappotto che si sistema, rumori ambientali della città sullo sfondo — clacson attutiti, conversazioni lontane, sfarfallio occasionale di insegne al neon, leggero raschio metallico mentre il polso si gira."
  • Prompt sovrapposti:
    • "Soffice ticchettio della lancetta dei secondi di un orologio"
    • "Lieve fruscio della manica di un cappotto che si sistema"
    • "Rumori ambientali della città"

Puoi poi sovrapporli nel tuo editor video.

Dopo aver sovrapposto i suoni e impostato il volume di ogni clip per ottenere il risultato perfetto, esporta e condividi il video.

Che tu stia creando un montaggio cinematografico, una riflessione poetica sulla città o un cortometraggio in stile documentaristico, l'audio generato dall'IA dà vita alla tua visione. Prova ElevenLabs oggi e trasforma il tuo video Veo 2 in un'esperienza completamente immersiva grazie alla potenza della voce e del suono.

Articoli simili

Crea con l'audio IA della massima qualità