✔️✔️ Doppie Spunte Blu Cap. 13 · Creatività multimodale

Puntata 140

Puntata 140 — Whisper, trascrizione e sottotitoli

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 13 · Creatività multimodale

Mentre tutti guardavano ChatGPT, OpenAI rilasciava un altro modello open source che ha silenziosamente reso obsoleta un’industria intera: la trascrizione automatica.

due sedie a un tavolo. Su una, una stenografa storica con macchina meccanica e nastri colorati. Sull’altra, un microfono USB collegato a un laptop. La stenografa, sbalordita, guarda lo schermo che produce testo in tempo reale alla sua stessa velocità

Cos’è Whisper

Whisper è un modello di automatic speech recognition (ASR) rilasciato da OpenAI a settembre 2022, open source con licenza MIT. È diventato lo standard de facto della trascrizione automatica.

Capacità chiave:

  • Multilingua: 99 lingue (italiano nativo, ottimo).
  • Robusto al rumore: funziona anche con audio “sporco” (chiamate telefoniche, registrazioni in ambiente).
  • Identificazione lingua automatica.
  • Traduzione “embedded”: trascrive da qualunque lingua direttamente in inglese (senza passare per la trascrizione originale).
  • Timestamping: produce timestamp per ogni segmento (utile per sottotitoli).

Versioni 2026:

  • Whisper v3 / large-v3 (dicembre 2023): ancora il modello base per molti workflow.
  • gpt-4o-transcribe e gpt-4o-mini-transcribe (2025): evoluzione closed-source di OpenAI, qualità superiore ma a pagamento via API.
  • Whisper.cpp e ports: implementazioni ottimizzate che girano anche su CPU/laptop senza GPU.

La quality nel 2026 (Word Error Rate)

LinguaWhisper v3 largegpt-4o-transcribeUmano professionista
Inglese (audio pulito)~3-5%~2-3%~2-3%
Italiano (audio pulito)~4-6%~3-4%~3-4%
Inglese (rumore moderato)~10-15%~6-10%~5-8%
Italiano dialettale~15-25%~10-18%~7-12%

WER = Word Error Rate, percentuale di parole sbagliate. In condizioni normali (audio decente, italiano standard), Whisper è competitivo con un trascrittore umano professionista.


Come si usa (3 vie)

1. Online, gratuito

  • OpenAI Whisper API: $0.006/minuto. Per pochi euro trascivi ore di audio.
  • HuggingFace Spaces (gratis, lento, limiti di upload).
  • Goblin.tools / TurboScribe / Otter.ai: tool consumer-friendly che usano Whisper sotto.

2. Desktop, gratuito, locale

  • MacWhisper (macOS): app nativa, GUI bella, gratis per uso base.
  • Whisper Desktop (Windows/Linux): GUI open source.
  • WhisperX: include speaker diarization (chi parla quando).
  • whisper.cpp: a linea di comando, ultra-leggero.

Vantaggio: gratis, privacy totale, nessun upload. Svantaggio: setup leggermente tecnico, su CPU è lento (ma su Mac M1+ vola).

3. Integrato in tool esistenti

  • Adobe Premiere Pro: trascrizione automatica dei dialoghi nel video.
  • CapCut / DaVinci Resolve: sottotitoli automatici.
  • Microsoft Teams / Zoom / Meet: trascrizione meeting integrata.
  • Notion AI / Mem: trascrizione di audio note.
  • iOS 17+: trascrizione voicemail e audio messages nativa.

I casi d’uso (la lista lunga)

Caso d’usoVerdict
Sottotitoli per video YouTube/TikTok⭐⭐⭐⭐⭐ — gratis, veloce, qualità eccellente
Trascrizione interviste giornalistiche⭐⭐⭐⭐⭐ — 10× più veloce, ancora rilettura umana necessaria
Verbali di riunioni⭐⭐⭐⭐⭐ — combinato con LLM per summary
Trascrizione podcast⭐⭐⭐⭐⭐ — per SEO, accessibilità, archivio
Audionote → testo⭐⭐⭐⭐⭐ — game changer per chi pensa parlando
Trascrizioni legali / medicali⭐⭐⭐ — quality alta ma rilettura obbligatoria, settori delicati
Trascrizioni di lezioni universitarie⭐⭐⭐⭐⭐ — accessibilità, recap
Doppiaggio multilingua⭐⭐⭐⭐ — combinato con ElevenLabs e MT

Workflow: dal video al sottotitolo (3 minuti)

  1. Hai un video italiano (mp4, mov, qualunque).
  2. MacWhisper o TurboScribe: drag&drop del file.
  3. Selezione lingua: italiano (o auto).
  4. Output: .srt (sottotitoli), .vtt (web), .txt (testo puro), .json (timestampato).
  5. (Opzionale) rilettura veloce per nomi propri sbagliati.
  6. Importa .srt in Premiere/DaVinci/CapCut → sottotitoli applicati al video.

Tempo: 3-5 minuti per un video di 10 minuti. Costo: zero se in locale.


Speaker diarization: chi parla quando

Diarization = segmentare l’audio per chi parla. Whisper base non lo fa nativamente. Soluzioni:

  • WhisperX: estende Whisper con pyannote per diarization.
  • AssemblyAI: servizio commerciale che combina ASR + diarization eccellente.
  • Pyannote standalone su HuggingFace.

Risultato:

[00:00–00:15] Speaker 1: Buongiorno a tutti…
[00:15–00:32] Speaker 2: Grazie, vorrei aggiungere…
[00:32–00:48] Speaker 1: Esatto, ma il punto è…

Utile per interviste, podcast multi-host, verbali di assemblea.


Tricks pratici

1. Initial prompt

Whisper accetta un prompt iniziale che lo “orienta” sul dominio del discorso:

prompt = "Trascrizione di una riunione tecnica sulla cybersecurity. 
Parole frequenti: SOC, EDR, SIEM, threat hunting, IoC."

Riduce drasticamente errori su acronimi e gergo.

2. Audio cleaning pre-trascrizione

  • Adobe Podcast Enhance (gratis, web): pulisce voci da background noise. Pre-step ottimo prima di Whisper.
  • Audacity con noise reduction: classico open source.
  • RNNoise: lib open source per real-time noise suppression.

Audio pulito → trascrizione 30-50% più accurata.

3. Segmentazione lunga

Whisper ha context windows di 30 secondi. Audio molto lunghi: usa wrapper come pyannote o WhisperX che gestiscono la segmentazione automatica.

4. Hallucinations

Su audio molto silenzioso (es. 30 secondi di silenzio), Whisper può inventare testo plausibile (“grazie per aver guardato”, “iscriviti al canale”). Rilettura obbligatoria.


Privacy: il vantaggio del locale

Per audio sensibili (medico, legale, business confidential), la trascrizione locale con whisper.cpp / MacWhisper è non negoziabile:

  • Nessun upload a server terzi.
  • Nessuna copia archiviata altrove.
  • GDPR compliance immediata.
  • Funziona offline.

Costo aggiuntivo: zero (su Mac/Linux moderni Whisper large gira in tempo reale).


TEST pratico (10 minuti)

  1. Registra un audio memo di 2-3 minuti su qualsiasi argomento (telefono va bene).
  2. Vai su goblin.tools o turboscribe.ai (entrambi free tier).
  3. Upload del file. Trascrizione in ~30 secondi.
  4. Confronta con un servizio “umano” che eri abituato a usare prima (Cleerly, Rev, agenzie): quality e tempi.
  5. Bonus: scarica il file .srt e prova ad applicarlo come sottotitolo a un tuo video in CapCut o Premiere. È letteralmente questione di drag&drop.

Glossario lampo

  • ASR (Automatic Speech Recognition): riconoscimento vocale automatico, la categoria a cui appartiene Whisper.
  • WER (Word Error Rate): metrica di qualità ASR. Più basso meglio è.
  • Diarization: separare gli speaker in un audio multi-persona.
  • SRT/VTT: i due formati standard di sottotitolazione (Subtitle Resource Track / WebVTT).
  • Hallucination: nel contesto Whisper, testo inventato su segmenti silenziosi o ambigui.

Take-away in una riga

Whisper ha reso la trascrizione una commodity gratuita: sottotitoli in 3 minuti, verbali in 10. Per dati sensibili usalo in locale; per il resto, API a $0.006/minuto è acqua.

➡️ Prossima puntata: Avatar parlanti — HeyGen, Synthesia e i virtual influencer che nessuno sa essere AI.