✔️✔️ Doppie Spunte Blu Cap. 13 · Creatività multimodale

Puntata 144

Puntata 144 — TEST: mini-spot AI end-to-end

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 13 · Creatività multimodale · 🎬 Progetto finale di capitolo

30 secondi di spot. Voce narrante, immagini, musica, sottotitoli, avatar parlante finale. Tutto AI, tutto tu, una sera. Esercizio definitivo del capitolo 13.

storyboard a fumetto in 6 vignette numerate (scena 1, scena 2, ecc.) con accanto annotazioni a margine: “MJ”, “Flux”, “Sora”, “ElevenLabs”, “Suno”. In fondo, una claqueta da cinema con scritto “AIPERBABBANI · TAKE 1 · SPOT FORNO TOSCANO”

Il brief

Devi produrre uno spot da 30 secondi per un cliente fittizio: “Forno di Maria”, un piccolo forno familiare in Toscana che vende pane e schiacciate online in tutta Italia.

Obiettivo: trasmettere autenticità, tradizione, qualità.

Tono: caldo, nostalgico, accessibile.

Output finale: file MP4 1080p, 30 secondi, con audio + sottotitoli.

Vincolo: tutto deve essere fatto con tool AI. Nessuna ripresa reale.


Storyboard (6 scene, 5 secondi ciascuna)

ScenaVisualVoiceover (~12 parole)
1Forno di paese all’alba, fumo dal camino”C’è ancora chi sveglia il forno alle quattro del mattino.”
2Maria che impasta a mano sul tavolo di marmo”Maria lo fa da quarant’anni. Stessa farina, stessa pazienza.”
3Pane appena uscito, crosta dorata”Pane di grano antico, lievito madre, niente fretta.”
4Mano che prende uno scatolone con il logo”Lo riceverai a casa tua. Caldo nella ricetta, fresco nel pacchetto.”
5Famiglia che apre lo scatolone in cucina”Non è una consegna. È un saluto da chi sa cosa fa.”
6Maria che sorride in camera, scritta finale”Forno di Maria. Da quarant’anni, sempre lo stesso.”

Stack tool consigliato

StepToolCosto orientativo
Storyboard immagini chiave (6×)Midjourney V7 o Flux Pro$0.50
Animazione clip (6 × 5 sec)Sora 2 (I2V) o Runway Gen-4$5–$15
Voiceover narranteElevenLabs (voce maschile italiana, stability 0.6)$2
Musica di sottofondoSuno (acoustic Italian folk, ~30s)$1 (1 credito)
SottotitoliWhisper (gratis) o CapCut autogratis
Montaggio finaleCapCut / DaVinci Resolve (gratis)gratis
Sound effects opzionaliFreesound.org o Suno SFXgratis

Costo totale: ~$10-$20. Tempo previsto: 4-6 ore se è la prima volta, 1-2 ore quando hai il workflow rodato.


Step 1 — Generare le 6 immagini chiave

Prompt template per Midjourney V7:

/imagine prompt: [SCENA SPECIFICA], italian rural Tuscany, 
golden hour soft light, editorial documentary photography, 
35mm f/1.8 medium shot, warm muted colors, film grain, 
nostalgic mood --ar 16:9 --s 200 --no text, watermark, signature

Sostituisci [SCENA SPECIFICA] per ciascuna scena:

  1. traditional stone bakery exterior at dawn, smoke from chimney, autumn leaves
  2. 60-year-old italian baker woman with apron kneading dough on marble counter, focused expression
  3. freshly baked bread loaves close-up, golden crust, rustic wooden tray
  4. hands placing fresh bread in cardboard box with handwritten label
  5. italian family opening a delivery box on kitchen table, warm lighting, surprised happy faces
  6. the same italian baker woman smiling warmly toward camera, soft natural light, simple background

Per scena 2, 5, 6 (volti) → genera almeno 4 varianti e scegli quelle con anatomia migliore. Usa --cref se vuoi che la stessa “Maria” appaia in più scene (puntata 131).


Step 2 — Animare le immagini

Carica ciascuna immagine in Sora 2 (image-to-video) o Runway Gen-4.

Prompt di movimento (Sora):

  • Scena 1: “slow camera push-in toward bakery, smoke rising gently”
  • Scena 2: “static camera, hands kneading dough in continuous slow motion”
  • Scena 3: “slow camera orbit around the bread, steam rising”
  • Scena 4: “hands gently placing bread, downward angle, slow motion”
  • Scena 5: “reverse shot, family discovering content, joyful reactions”
  • Scena 6: “medium shot of baker, slight smile, soft eye contact with camera”

Durata: 5 secondi ciascuna. Genera 2 varianti per scena, scegli la migliore.


Step 3 — Voiceover

Scrivi il copione completo (40-50 parole, ~25-30 secondi parlati). Esempio:

C'è ancora chi sveglia il forno alle quattro del mattino. 
Maria lo fa da quarant'anni — stessa farina, stessa pazienza. 
Pane di grano antico, lievito madre, niente fretta. 
Lo riceverai a casa tua: caldo nella ricetta, fresco nel pacchetto. 
Non è una consegna, è un saluto da chi sa cosa fa. 
Forno di Maria. Da quarant'anni, sempre lo stesso.

In ElevenLabs:

  • Voce: scegli una voce italiana maschile, media età, calda. Buone scelte stock: “Giovanni” o “Marco”.
  • Stability: 0.55 (espressivo ma stabile).
  • Similarity: 0.75.
  • Style: 0.30 (sobrio, non drammatico).

Genera. Riascolta. Se la pronuncia di una parola è sbagliata (es. nomi propri), correggi nel testo aggiungendo accenti o variazioni fonetiche (es. “Maria” → “Marìa” può aiutare).


Step 4 — Musica

In Suno:

Prompt: italian acoustic folk, warm, nostalgic, finger-picking 
guitar and light strings, 70 BPM, 30 seconds instrumental, soft, 
gentle build, emotional without being sad

Marca Instrumental only (niente lyrics). Genera 2 varianti, scegli quella che meglio si fonde con il tono visivo.

Esportazione: WAV se possibile (qualità migliore), altrimenti MP3.


Step 5 — Sottotitoli

Hai due opzioni:

A. Da copione: copia il testo del voiceover in un file .srt con timestamp manuali. Più preciso, richiede 10 minuti.

B. Automatico: in CapCut → Auto Captions (usa Whisper sotto). Carica il voiceover come audio sorgente, CapCut genera i sottotitoli automaticamente.

Stile sottotitoli: font sans-serif bold, dimensione media, posizione bassa-centro, colore bianco con leggera ombra. Niente fancy effects.


Step 6 — Montaggio finale

In CapCut (gratis, desktop o web):

  1. Importa le 6 clip video, in ordine.
  2. Importa il voiceover ElevenLabs come traccia audio.
  3. Importa la musica Suno come seconda traccia audio (volume ridotto al -15dB rispetto al voiceover).
  4. Allinea ciascuna clip al pezzo di voiceover corrispondente. Trim se necessario.
  5. Aggiungi dissolve incrociati (cross-dissolve) tra scene: 0.3 secondi ciascuno.
  6. Applica i sottotitoli alla traccia voce.
  7. Color grading globale: alza warmth (+10), abbassa saturation (-5) per look “cinematografico”.
  8. (Opzionale) Logo finale animato negli ultimi 2 secondi.

Esporta: 1080p, H.264, bitrate 8-12 Mbps.


Checklist di qualità (prima di mostrarlo)

  • Audio voce e musica bilanciati (voce sopra, musica sotto, mai si sovrasta).
  • Sottotitoli leggibili a 1m di distanza.
  • Tutte le 6 scene coerenti per palette colori (warmth simile).
  • Nessun frame “AI artifact” evidente (mani con 6 dita, testo geroglifico, ecc.).
  • Aspect ratio coerente (tutto 16:9 o tutto 9:16, mai mix).
  • Lunghezza finale: 28-32 secondi (non oltre 35).
  • File MP4 funziona su YouTube, Instagram Reels, TikTok (testa upload).

Variazioni dell’esercizio

Se hai tempo, esegui 2 varianti per imparare il workflow:

Variante A — Spot diverso, stesso brand

Forno di Maria — versione “natalizia” 30 secondi: panettone, atmosfera natale. Riusa la stessa Maria con --cref o avatar HeyGen custom.

Variante B — Stesso spot, livello superiore

Aggiungi:

  • Avatar parlante (HeyGen) per Maria nella scena 6 invece dell’immagine statica + voiceover.
  • Multilingua: la stessa pubblicità doppiata in inglese e tedesco con ElevenLabs Dubbing (puntata 138).

Cosa hai imparato (autovalutazione)

Riesci a rispondere “sì” a queste?

  • So generare immagini coerenti tra loro usando --cref e prompt strutturati.
  • So scegliere il modello giusto per il task (MJ vs Flux vs DALL-E).
  • So usare voce clonata o stock con il giusto bilanciamento di stability/style.
  • So generare musica adatta a un tono specifico in Suno.
  • So montare tutto in un tool free (CapCut o DaVinci).
  • Riconosco gli artifact AI tipici nelle mie produzioni e li mitigo.
  • So quali tool sono commercially safe per uso clienti.

Se hai 5+ “sì” → padroneggi il capitolo 13. Hai uno stack creativo AI completo.


Glossario lampo

  • Storyboard: schizzo sequenziale delle inquadrature, fatto prima di produrre.
  • I2V (Image-to-Video): generare video animando un’immagine sorgente.
  • Cross-dissolve: transizione morbida tra due clip, in cui una svanisce mentre l’altra appare.
  • Color grading: aggiustamento globale dei colori per coerenza estetica.
  • Bitrate: quanti dati per secondo nel video. Più alto = qualità migliore + file più pesante.

Take-away in una riga

In 4-6 ore e con $10-$20 hai prodotto uno spot completo di 30 secondi che 5 anni fa richiedeva uno studio. Non è “il futuro”: è il presente, e il capitolo 13 ti ha dato lo stack per farlo.

➡️ Prossima puntata: Capitolo 14 — AI al lavoro nei mestieri. Per chi scrive, vende, insegna: workflow concreti per professionisti.