✔️✔️ Doppie Spunte Blu Cap. 13 · Creatività multimodale

Puntata 138

Puntata 138 — ElevenLabs e voci AI

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 13 · Creatività multimodale

Tre minuti di audio della tua voce. Cinque dollari al mese. Da quel momento, l’AI può leggere qualunque libro nel tuo timbro. I doppiatori non dormono benissimo.

una cabina di doppiaggio vuota; sul leggio un libro aperto, accanto un microfono di studio collegato a uno smartphone su cui scorre un’onda audio. Sullo sfondo, un doppiatore che si toglie le cuffie e legge un giornale sportivo

Il salto degli ultimi 24 mesi

Nel 2022 le voci AI suonavano palesemente sintetiche: il “robotic” che riconoscevi a un secondo.

Nel 2024-25 (ElevenLabs v2/v3, OpenAI TTS, Google) la quality ha fatto un salto dirompente:

  • Pronuncia corretta dell’italiano (incluse parole rare e nomi propri).
  • Intonazione emozionale (gioia, tristezza, ironia, sussurro).
  • Pause naturali, respirazione, “uhm”, “ah” plausibili.
  • Voice cloning da 3-30 secondi di sample audio.

Risultato 2026: in un test ABX (puntata 252) sentire una voce ElevenLabs Pro vs umano è difficile per la maggior parte degli ascoltatori. Su clip lunghe ancora qualche dettaglio “tradisce”, ma sempre meno.


I player principali nel 2026

ServizioPunto forteNote
ElevenLabsQualità + voice cloning + ricco multilinguaStandard de facto. Pro: $5–$330/mese
OpenAI TTS (gpt-4o-tts)Integrato con API, voci di default solide$15/1M caratteri
Google Cloud Text-to-SpeechVoci “Studio” qualità alta, integrato con GCPPricing enterprise
Microsoft Azure Neural VoiceCustom voice training enterprisePer grandi aziende
PlayHTBuon TTS commercialeAlternativa a ElevenLabs
Suno Bark (open source)TTS open, anche con effettiTecnico, da auto-hostare
Camb.aiDoppiaggio cross-lingue (voice + traduzione)Per video

Per uso quotidiano consumer → ElevenLabs vince per qualità e UX. Per uso programmatico → OpenAI TTS + ElevenLabs sono i due da valutare.


Le tre cose che fa ElevenLabs (oggi)

1. Text-to-Speech (TTS)

Scrivi un testo, scegli una voce (preset o tua clonata), generi audio. Output MP3/WAV.

Controlli:

  • Stability (0-1): più stabile = pronuncia più consistente ma meno espressiva.
  • Similarity (0-1): quanto la voce risultante deve aderire al sample originale.
  • Style (0-1): quanto enfatizzare l’intonazione del testo.
  • Speaker boost: maggior fedeltà al timbro originale, leggermente meno fluido.

2. Voice Cloning

  • Instant Voice Cloning: 30 secondi-1 minuto di sample. Voce “buona” pronta in 30 secondi.
  • Professional Voice Cloning (piano Creator+): 30+ minuti di sample. Voce eccellente pronta in 24-48 ore.

⚠️ ElevenLabs richiede conferma esplicita che hai il diritto di clonare la voce (la tua o di chi ha firmato un consenso). Vedi puntate 259 (voice scam) e 142 (diritti).

3. Dubbing

Carichi un video, ElevenLabs:

  1. Trascrive l’audio originale.
  2. Lo traduce nella lingua target.
  3. Genera audio nella voce dell’attore originale (o in una voce diversa).
  4. Sincronizza con i tagli del video.

Risultato: video doppiato in 30 lingue in pochi minuti. Quality 2026: ottima per parlato chiaro, ancora imperfetta per recitazione drammatica.


Il “voice clone” in pratica

Workflow per clonare la tua voce:

  1. Registra 2-3 minuti in ambiente silenzioso, con microfono decente (anche un AirPods Pro va bene).
  2. Leggi un testo vario (espressioni, emozioni, intonazioni).
  3. Upload su ElevenLabs → “Instant Voice Clone”.
  4. Generi qualunque testo nella tua voce in pochi secondi.

Risultati realistici:

  • ✅ Testi narrativi, audiolibri: ottimo.
  • ✅ Voci per video YouTube/Instagram: ottimo.
  • ⚠️ Recitazione drammatica intensa: spesso flat.
  • ⚠️ Pronuncia di parole rare in lingue diverse dal sample: occasionali errori.

I casi d’uso che funzionano davvero

Caso d’usoVerdict
Audiolibri indie⭐⭐⭐⭐⭐ — sostituisce i lettori freelance per molti
Voce per video YouTube/TikTok⭐⭐⭐⭐⭐ — perfetto, anche per chi odia parlare
Doppiaggio di corsi online⭐⭐⭐⭐ — qualità sufficiente, risparmio enorme
IVR aziendali (centralino)⭐⭐⭐⭐⭐ — meglio delle voci sintetiche storiche
Spot pubblicitari TV/radio⭐⭐⭐ — dipende dalla qualità desiderata
Doppiaggio cinema⭐⭐ — i grandi studi usano ancora attori, per ora
Audio messages personali⭐⭐ — etica delicata, usare con consenso

Costo reale (esempio)

Pacchetto ElevenLabs Creator ($22/mese, 100k caratteri):

  • ~3-4 ore di audiolibro generato.
  • ~200 video YouTube da 3 minuti.
  • ~50 podcast da 10 minuti.

Per uso medio: $5-$22/mese coprono tutto. Per produzioni intense: piano Pro ($99/mese, 500k caratteri).

Confronta con: doppiatore freelance Italia, ~€80-€200/ora di registrazione.


I rischi: scam vocali e deepfake

Il voice cloning ha un lato oscuro già diffuso:

  • Scam telefonici: “Mamma, ho perso il telefono, mandami soldi” con voce clonata. Vedi puntata 259 (livello Yoda) e 72 (livello Boomer).
  • Deepfake politici e CEO: audio falsi attribuiti a personaggi pubblici.
  • Frodi bancarie: alcune banche accettavano riconoscimento vocale come auth. Disastro.

Mitigazioni:

  • Le piattaforme leader (ElevenLabs, OpenAI) richiedono consenso prima del clone.
  • Tutti gli output ElevenLabs hanno watermark inaudibile rilevabile con strumenti dedicati.
  • Standard C2PA (vedi puntata 143) sta entrando nei tool di authoring.

Ma il software open source (XTTS, Coqui, RVC) non ha questi vincoli. La regola operativa: mai fidarsi della voce al telefono per decisioni finanziarie. Sempre verificare con secondo canale.


TEST pratico (15 minuti)

  1. Crea account gratis su elevenlabs.io (10 minuti gratis al mese inclusi).
  2. Genera un testo (es. l’incipit del tuo libro preferito) usando una voce italiana predefinita.
  3. Confronta stability alta vs bassa: la stessa frase con stability 0.3 (espressiva) vs 0.8 (stabile).
  4. Clona la tua voce: registra 1 minuto leggendo qualcosa di vario. Usa Instant Voice Clone. Genera quello stesso testo nella tua voce.
  5. Domanda di consapevolezza: ti riconosci? Quanto è plausibile? Se è abbastanza buono, immagina uno scammer che lo usa contro tua madre. Quel discorso telefonico avviene già nel 2026. Vedi puntata 72.

Glossario lampo

  • TTS (Text-to-Speech): tecnologia che converte testo in audio parlato.
  • Voice cloning: creare un modello che riproduce un timbro vocale specifico da sample audio.
  • Stability/Similarity: i due parametri chiave di ElevenLabs per controllare consistenza e fedeltà.
  • C2PA: standard di provenance dei contenuti (chi/cosa/quando creato). Vedi puntata 143.

Take-away in una riga

ElevenLabs ha reso il voice cloning una commodity da $5/mese. Per audiolibri e video è un acceleratore enorme; per scam telefonici è una piaga. Trattalo come un coltello: utile e pericoloso.

➡️ Prossima puntata: Suno e Udio — comporre musica dal nulla, e perché Spotify ha appena pubblicato un advisory sui modelli AI.