✔️✔️ Doppie Spunte Blu Cap. 13 · Creatività multimodale

Puntata 137

Puntata 137 — Video AI

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 13 · Creatività multimodale

Sora, Veo, Runway, Pika. Diciotto mesi fa eravamo al gattino che camminava male. Oggi siamo a spot pubblicitari da 30 secondi credibili.

una pellicola cinematografica srotolata sul tavolo, con singoli frame che mostrano stati progressivi: prima frame sgranato e statico (2023), poi animato meglio (2024), poi cinematografico (2025), poi indistinguibile da un girato vero (2026). Una mano tiene una claqueta su cui c’è scritto “TAKE 1 — PROMPT”

I quattro grandi nel 2026

Lo stato dell’arte text-to-video è dominato da quattro famiglie:

ModelloChi lo faDistintivo 2026
Sora 2OpenAICoerenza temporale e fisica, fino a 60 sec, integrato in ChatGPT Plus
Veo 3Google DeepMindAudio sincronizzato generato insieme al video, qualità top
Runway Gen-4RunwayUI da editor video, controllo fine, integrato con tool montaggio
Pika 2.0Pika LabsVeloce, social-friendly, effetti speciali (“Pikaffects”)

A questi si aggiungono Kling (cinese, ottimo), Luma Dream Machine, Hailuo MiniMax, OpenAI Operator video (sperimentale 2025-26).


Tre modalità di generazione

1. Text-to-Video (T2V)

“Una nonna che impasta la pasta in cucina toscana, ora dorata” → 10 secondi di video.

Più semplice da usare. Risultato spesso “wow” ma meno controllo sulla composizione esatta.

2. Image-to-Video (I2V)

Carichi un’immagine (foto, generazione MJ/Flux). Aggiungi prompt opzionale per dire come vuoi che si muova. Il modello anima.

Più controllo. Workflow professionale tipico: genera l’immagine “perfetta” in MJ, poi animala in Runway/Sora.

3. Video-to-Video (V2V)

Carichi un video esistente. Il modello lo trasforma stilisticamente (es. video reale → animazione stile Studio Ghibli).

Più sperimentale. Risultati spesso instabili ma occasionalmente spettacolari.


Coerenza temporale: il problema centrale

Generare 1 immagine è risolto. Generare 240 immagini consecutive che rappresentano la stessa scena in modo coerente è il problema irrisolto fino al 2024.

Le sfide:

  • Identità dei soggetti: il volto del personaggio cambia tra il frame 1 e il frame 100.
  • Fisica: oggetti che “fluttuano”, liquidi che non rispettano la gravità, ombre incoerenti.
  • Continuità: una porta aperta nel frame 50 deve essere aperta nel frame 60.

Sora 2 e Veo 3 hanno fatto passi enormi su tutti e tre i fronti nel 2025-26, ma non sono ancora perfetti. Aspettatevi qualche frame strano in clip lunghe.


Audio: la novità 2025

Fino al 2024, i video AI erano muti. L’utente doveva aggiungere audio in postproduzione (musica, voce, effetti).

Nel 2025 Veo 3 ha introdotto la generazione audio sincronizzata: il modello produce video + audio diegetico (passi, dialoghi semplici, ambient) insieme. Sora 2 ha seguito poco dopo.

Quality 2026:

  • Audio ambient e sound effects: sorprendente.
  • Voci semplici (“ciao”, “grazie”) sincronizzate al labiale: buone.
  • ⚠️ Dialoghi lunghi sincronizzati: ancora limitati a 1-2 frasi.
  • Musica generata: meglio combinarla con Suno (puntata 139) in postproduzione.

Costi (2026, prezzi indicativi)

ServizioCostoNote
Sora 2 (ChatGPT Plus $20/mese)Incluso, con quote~50 video/mese in Plus
Sora 2 Pro$200/meseQuote molto più alte, 60s clips
Veo 3 (Google AI Pro)$20/meseIncluso in Gemini Advanced
Runway$15–$95/mesePer professionisti video
Pika$10–$70/mesePiù consumer-friendly
API (Replicate, Fal)$0.10–$1 per videoPer dev e batch

Per uso casual → Sora dentro ChatGPT Plus è il rapporto qualità/prezzo migliore. Per uso professionale → Runway o Sora Pro.


Lunghezza, risoluzione, frame rate (2026)

ModelloMax durataRisoluzioneFPS
Sora 260 sec1080p (4K Pro)24/30
Veo 38 sec (esteso a 60)1080p24
Runway Gen-416 sec (estendibile)1080p24
Pika 2.010 sec1080p24
Kling30 sec1080p24/30

Per clip lunghe (>1 minuto), nessun modello genera in un colpo. Workflow tipico: 4-6 clip da 10s ognuna, montate in editor.


Workflow professionale (caso reale: spot 30s)

  1. Storyboard (carta o Figma): 6 inquadrature, 5 secondi ciascuna.
  2. Generazione immagini chiave (MJ/Flux): una per inquadratura, prima dei video.
  3. Animazione (Sora I2V o Runway): da ciascuna immagine genera 5s di movimento.
  4. Aggiusta cuts e transitions in DaVinci Resolve / Premiere.
  5. Audio: voce con ElevenLabs (puntata 138), musica con Suno (puntata 139), effetti separati.
  6. Color grading finale per coerenza.

Tempo totale: 4-8 ore per uno spot di qualità decente (era 4-8 giorni 18 mesi fa).


Cosa NON funziona ancora bene (2026)

Dialoghi lunghi con labiale sincronizzato preciso. ❌ Mani in primo piano che fanno gesti complessi. ❌ Testo leggibile che si mantiene coerente tra frame (la scritta sul cartello cambia ortografia ogni 10 frame). ❌ Scene con molte persone che interagiscono (oltre 4-5 personaggi: caos). ❌ Continuity in clip lunghe oltre 30 secondi (oggetti che cambiano posizione). ❌ Camera moves complessi e specifici (es. “dolly zoom” preciso).

Per questi casi → riprese tradizionali ancora vincono.


Avvertenza: l’evoluzione è settimanale

Il campo evolve così rapidamente che ciò che scrivo qui è vero al maggio 2026. Tra 6 mesi la tabella sarà obsoleta.

Buona pratica: ogni 2-3 mesi, fai un test con il prompt di riferimento (“test prompt” personale) sui 3 modelli che usi. Vedi chi è migliorato di più. Adatta.


TEST pratico (20 minuti)

  1. Sora dentro ChatGPT Plus (se hai abbonamento) o Pika gratis (~5 video gratis/giorno).
  2. Genera lo stesso prompt in 2 servizi diversi: “Un uomo che cammina sotto la pioggia in una via di Napoli, ora notturna, neon riflessi sull’asfalto, plain camera shot, 10 secondi, atmosfera cinematografica.”
  3. Confronta:
    • Realismo del movimento (cammina o “fluttua”)?
    • Coerenza temporale (lo stesso uomo per tutta la clip)?
    • Fisica delle pozzanghere?
    • Qualità dell’audio (se incluso)?
  4. Domanda di consapevolezza: hai notato gli artefatti tipici (texture pelle che cambia, mani che si fondono)? Sono il “filtro AI” del video. Riconoscerli aiuta a non farsi ingannare quando li vede su social.

Glossario lampo

  • Frame rate (FPS): numero di immagini al secondo. 24 = cinema, 30 = TV, 60 = sport/videogiochi.
  • Coerenza temporale: la qualità per cui gli oggetti rimangono “se stessi” da un frame all’altro.
  • Diegetico: audio prodotto dentro la scena (passi, dialoghi degli attori), contrapposto a extra-diegetico (musica di sottofondo).
  • Storyboard: schizzo sequenziale delle inquadrature di un video, fatto prima della produzione.

Take-away in una riga

Il video AI nel 2026 fa spot da 30s credibili in poche ore, ma su dialoghi sincronizzati, mani complesse e continuity oltre il minuto, le riprese tradizionali vincono ancora.

➡️ Prossima puntata: ElevenLabs e le voci AI — doppiare un audiolibro nel tuo timbro vocale in 3 minuti, e perché i doppiatori sono preoccupati.