Puntata 137
Puntata 137 — Video AI
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 13 · Creatività multimodale
Sora, Veo, Runway, Pika. Diciotto mesi fa eravamo al gattino che camminava male. Oggi siamo a spot pubblicitari da 30 secondi credibili.
I quattro grandi nel 2026
Lo stato dell’arte text-to-video è dominato da quattro famiglie:
| Modello | Chi lo fa | Distintivo 2026 |
|---|---|---|
| Sora 2 | OpenAI | Coerenza temporale e fisica, fino a 60 sec, integrato in ChatGPT Plus |
| Veo 3 | Google DeepMind | Audio sincronizzato generato insieme al video, qualità top |
| Runway Gen-4 | Runway | UI da editor video, controllo fine, integrato con tool montaggio |
| Pika 2.0 | Pika Labs | Veloce, social-friendly, effetti speciali (“Pikaffects”) |
A questi si aggiungono Kling (cinese, ottimo), Luma Dream Machine, Hailuo MiniMax, OpenAI Operator video (sperimentale 2025-26).
Tre modalità di generazione
1. Text-to-Video (T2V)
“Una nonna che impasta la pasta in cucina toscana, ora dorata” → 10 secondi di video.
Più semplice da usare. Risultato spesso “wow” ma meno controllo sulla composizione esatta.
2. Image-to-Video (I2V)
Carichi un’immagine (foto, generazione MJ/Flux). Aggiungi prompt opzionale per dire come vuoi che si muova. Il modello anima.
Più controllo. Workflow professionale tipico: genera l’immagine “perfetta” in MJ, poi animala in Runway/Sora.
3. Video-to-Video (V2V)
Carichi un video esistente. Il modello lo trasforma stilisticamente (es. video reale → animazione stile Studio Ghibli).
Più sperimentale. Risultati spesso instabili ma occasionalmente spettacolari.
Coerenza temporale: il problema centrale
Generare 1 immagine è risolto. Generare 240 immagini consecutive che rappresentano la stessa scena in modo coerente è il problema irrisolto fino al 2024.
Le sfide:
- Identità dei soggetti: il volto del personaggio cambia tra il frame 1 e il frame 100.
- Fisica: oggetti che “fluttuano”, liquidi che non rispettano la gravità, ombre incoerenti.
- Continuità: una porta aperta nel frame 50 deve essere aperta nel frame 60.
Sora 2 e Veo 3 hanno fatto passi enormi su tutti e tre i fronti nel 2025-26, ma non sono ancora perfetti. Aspettatevi qualche frame strano in clip lunghe.
Audio: la novità 2025
Fino al 2024, i video AI erano muti. L’utente doveva aggiungere audio in postproduzione (musica, voce, effetti).
Nel 2025 Veo 3 ha introdotto la generazione audio sincronizzata: il modello produce video + audio diegetico (passi, dialoghi semplici, ambient) insieme. Sora 2 ha seguito poco dopo.
Quality 2026:
- ✅ Audio ambient e sound effects: sorprendente.
- ✅ Voci semplici (“ciao”, “grazie”) sincronizzate al labiale: buone.
- ⚠️ Dialoghi lunghi sincronizzati: ancora limitati a 1-2 frasi.
- ✅ Musica generata: meglio combinarla con Suno (puntata 139) in postproduzione.
Costi (2026, prezzi indicativi)
| Servizio | Costo | Note |
|---|---|---|
| Sora 2 (ChatGPT Plus $20/mese) | Incluso, con quote | ~50 video/mese in Plus |
| Sora 2 Pro | $200/mese | Quote molto più alte, 60s clips |
| Veo 3 (Google AI Pro) | $20/mese | Incluso in Gemini Advanced |
| Runway | $15–$95/mese | Per professionisti video |
| Pika | $10–$70/mese | Più consumer-friendly |
| API (Replicate, Fal) | $0.10–$1 per video | Per dev e batch |
Per uso casual → Sora dentro ChatGPT Plus è il rapporto qualità/prezzo migliore. Per uso professionale → Runway o Sora Pro.
Lunghezza, risoluzione, frame rate (2026)
| Modello | Max durata | Risoluzione | FPS |
|---|---|---|---|
| Sora 2 | 60 sec | 1080p (4K Pro) | 24/30 |
| Veo 3 | 8 sec (esteso a 60) | 1080p | 24 |
| Runway Gen-4 | 16 sec (estendibile) | 1080p | 24 |
| Pika 2.0 | 10 sec | 1080p | 24 |
| Kling | 30 sec | 1080p | 24/30 |
Per clip lunghe (>1 minuto), nessun modello genera in un colpo. Workflow tipico: 4-6 clip da 10s ognuna, montate in editor.
Workflow professionale (caso reale: spot 30s)
- Storyboard (carta o Figma): 6 inquadrature, 5 secondi ciascuna.
- Generazione immagini chiave (MJ/Flux): una per inquadratura, prima dei video.
- Animazione (Sora I2V o Runway): da ciascuna immagine genera 5s di movimento.
- Aggiusta cuts e transitions in DaVinci Resolve / Premiere.
- Audio: voce con ElevenLabs (puntata 138), musica con Suno (puntata 139), effetti separati.
- Color grading finale per coerenza.
Tempo totale: 4-8 ore per uno spot di qualità decente (era 4-8 giorni 18 mesi fa).
Cosa NON funziona ancora bene (2026)
❌ Dialoghi lunghi con labiale sincronizzato preciso. ❌ Mani in primo piano che fanno gesti complessi. ❌ Testo leggibile che si mantiene coerente tra frame (la scritta sul cartello cambia ortografia ogni 10 frame). ❌ Scene con molte persone che interagiscono (oltre 4-5 personaggi: caos). ❌ Continuity in clip lunghe oltre 30 secondi (oggetti che cambiano posizione). ❌ Camera moves complessi e specifici (es. “dolly zoom” preciso).
Per questi casi → riprese tradizionali ancora vincono.
Avvertenza: l’evoluzione è settimanale
Il campo evolve così rapidamente che ciò che scrivo qui è vero al maggio 2026. Tra 6 mesi la tabella sarà obsoleta.
Buona pratica: ogni 2-3 mesi, fai un test con il prompt di riferimento (“test prompt” personale) sui 3 modelli che usi. Vedi chi è migliorato di più. Adatta.
TEST pratico (20 minuti)
- Sora dentro ChatGPT Plus (se hai abbonamento) o Pika gratis (~5 video gratis/giorno).
- Genera lo stesso prompt in 2 servizi diversi: “Un uomo che cammina sotto la pioggia in una via di Napoli, ora notturna, neon riflessi sull’asfalto, plain camera shot, 10 secondi, atmosfera cinematografica.”
- Confronta:
- Realismo del movimento (cammina o “fluttua”)?
- Coerenza temporale (lo stesso uomo per tutta la clip)?
- Fisica delle pozzanghere?
- Qualità dell’audio (se incluso)?
- Domanda di consapevolezza: hai notato gli artefatti tipici (texture pelle che cambia, mani che si fondono)? Sono il “filtro AI” del video. Riconoscerli aiuta a non farsi ingannare quando li vede su social.
Glossario lampo
- Frame rate (FPS): numero di immagini al secondo. 24 = cinema, 30 = TV, 60 = sport/videogiochi.
- Coerenza temporale: la qualità per cui gli oggetti rimangono “se stessi” da un frame all’altro.
- Diegetico: audio prodotto dentro la scena (passi, dialoghi degli attori), contrapposto a extra-diegetico (musica di sottofondo).
- Storyboard: schizzo sequenziale delle inquadrature di un video, fatto prima della produzione.
Take-away in una riga
Il video AI nel 2026 fa spot da 30s credibili in poche ore, ma su dialoghi sincronizzati, mani complesse e continuity oltre il minuto, le riprese tradizionali vincono ancora.
➡️ Prossima puntata: ElevenLabs e le voci AI — doppiare un audiolibro nel tuo timbro vocale in 3 minuti, e perché i doppiatori sono preoccupati.