Puntata 144
Puntata 144 — TEST: mini-spot AI end-to-end
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 13 · Creatività multimodale · 🎬 Progetto finale di capitolo
30 secondi di spot. Voce narrante, immagini, musica, sottotitoli, avatar parlante finale. Tutto AI, tutto tu, una sera. Esercizio definitivo del capitolo 13.
Il brief
Devi produrre uno spot da 30 secondi per un cliente fittizio: “Forno di Maria”, un piccolo forno familiare in Toscana che vende pane e schiacciate online in tutta Italia.
Obiettivo: trasmettere autenticità, tradizione, qualità.
Tono: caldo, nostalgico, accessibile.
Output finale: file MP4 1080p, 30 secondi, con audio + sottotitoli.
Vincolo: tutto deve essere fatto con tool AI. Nessuna ripresa reale.
Storyboard (6 scene, 5 secondi ciascuna)
| Scena | Visual | Voiceover (~12 parole) |
|---|---|---|
| 1 | Forno di paese all’alba, fumo dal camino | ”C’è ancora chi sveglia il forno alle quattro del mattino.” |
| 2 | Maria che impasta a mano sul tavolo di marmo | ”Maria lo fa da quarant’anni. Stessa farina, stessa pazienza.” |
| 3 | Pane appena uscito, crosta dorata | ”Pane di grano antico, lievito madre, niente fretta.” |
| 4 | Mano che prende uno scatolone con il logo | ”Lo riceverai a casa tua. Caldo nella ricetta, fresco nel pacchetto.” |
| 5 | Famiglia che apre lo scatolone in cucina | ”Non è una consegna. È un saluto da chi sa cosa fa.” |
| 6 | Maria che sorride in camera, scritta finale | ”Forno di Maria. Da quarant’anni, sempre lo stesso.” |
Stack tool consigliato
| Step | Tool | Costo orientativo |
|---|---|---|
| Storyboard immagini chiave (6×) | Midjourney V7 o Flux Pro | $0.50 |
| Animazione clip (6 × 5 sec) | Sora 2 (I2V) o Runway Gen-4 | $5–$15 |
| Voiceover narrante | ElevenLabs (voce maschile italiana, stability 0.6) | $2 |
| Musica di sottofondo | Suno (acoustic Italian folk, ~30s) | $1 (1 credito) |
| Sottotitoli | Whisper (gratis) o CapCut auto | gratis |
| Montaggio finale | CapCut / DaVinci Resolve (gratis) | gratis |
| Sound effects opzionali | Freesound.org o Suno SFX | gratis |
Costo totale: ~$10-$20. Tempo previsto: 4-6 ore se è la prima volta, 1-2 ore quando hai il workflow rodato.
Step 1 — Generare le 6 immagini chiave
Prompt template per Midjourney V7:
/imagine prompt: [SCENA SPECIFICA], italian rural Tuscany,
golden hour soft light, editorial documentary photography,
35mm f/1.8 medium shot, warm muted colors, film grain,
nostalgic mood --ar 16:9 --s 200 --no text, watermark, signature
Sostituisci [SCENA SPECIFICA] per ciascuna scena:
traditional stone bakery exterior at dawn, smoke from chimney, autumn leaves60-year-old italian baker woman with apron kneading dough on marble counter, focused expressionfreshly baked bread loaves close-up, golden crust, rustic wooden trayhands placing fresh bread in cardboard box with handwritten labelitalian family opening a delivery box on kitchen table, warm lighting, surprised happy facesthe same italian baker woman smiling warmly toward camera, soft natural light, simple background
Per scena 2, 5, 6 (volti) → genera almeno 4 varianti e scegli quelle con anatomia migliore. Usa --cref se vuoi che la stessa “Maria” appaia in più scene (puntata 131).
Step 2 — Animare le immagini
Carica ciascuna immagine in Sora 2 (image-to-video) o Runway Gen-4.
Prompt di movimento (Sora):
- Scena 1: “slow camera push-in toward bakery, smoke rising gently”
- Scena 2: “static camera, hands kneading dough in continuous slow motion”
- Scena 3: “slow camera orbit around the bread, steam rising”
- Scena 4: “hands gently placing bread, downward angle, slow motion”
- Scena 5: “reverse shot, family discovering content, joyful reactions”
- Scena 6: “medium shot of baker, slight smile, soft eye contact with camera”
Durata: 5 secondi ciascuna. Genera 2 varianti per scena, scegli la migliore.
Step 3 — Voiceover
Scrivi il copione completo (40-50 parole, ~25-30 secondi parlati). Esempio:
C'è ancora chi sveglia il forno alle quattro del mattino.
Maria lo fa da quarant'anni — stessa farina, stessa pazienza.
Pane di grano antico, lievito madre, niente fretta.
Lo riceverai a casa tua: caldo nella ricetta, fresco nel pacchetto.
Non è una consegna, è un saluto da chi sa cosa fa.
Forno di Maria. Da quarant'anni, sempre lo stesso.
In ElevenLabs:
- Voce: scegli una voce italiana maschile, media età, calda. Buone scelte stock: “Giovanni” o “Marco”.
- Stability: 0.55 (espressivo ma stabile).
- Similarity: 0.75.
- Style: 0.30 (sobrio, non drammatico).
Genera. Riascolta. Se la pronuncia di una parola è sbagliata (es. nomi propri), correggi nel testo aggiungendo accenti o variazioni fonetiche (es. “Maria” → “Marìa” può aiutare).
Step 4 — Musica
In Suno:
Prompt: italian acoustic folk, warm, nostalgic, finger-picking
guitar and light strings, 70 BPM, 30 seconds instrumental, soft,
gentle build, emotional without being sad
Marca Instrumental only (niente lyrics). Genera 2 varianti, scegli quella che meglio si fonde con il tono visivo.
Esportazione: WAV se possibile (qualità migliore), altrimenti MP3.
Step 5 — Sottotitoli
Hai due opzioni:
A. Da copione: copia il testo del voiceover in un file .srt con timestamp manuali. Più preciso, richiede 10 minuti.
B. Automatico: in CapCut → Auto Captions (usa Whisper sotto). Carica il voiceover come audio sorgente, CapCut genera i sottotitoli automaticamente.
Stile sottotitoli: font sans-serif bold, dimensione media, posizione bassa-centro, colore bianco con leggera ombra. Niente fancy effects.
Step 6 — Montaggio finale
In CapCut (gratis, desktop o web):
- Importa le 6 clip video, in ordine.
- Importa il voiceover ElevenLabs come traccia audio.
- Importa la musica Suno come seconda traccia audio (volume ridotto al -15dB rispetto al voiceover).
- Allinea ciascuna clip al pezzo di voiceover corrispondente. Trim se necessario.
- Aggiungi dissolve incrociati (cross-dissolve) tra scene: 0.3 secondi ciascuno.
- Applica i sottotitoli alla traccia voce.
- Color grading globale: alza warmth (+10), abbassa saturation (-5) per look “cinematografico”.
- (Opzionale) Logo finale animato negli ultimi 2 secondi.
Esporta: 1080p, H.264, bitrate 8-12 Mbps.
Checklist di qualità (prima di mostrarlo)
- Audio voce e musica bilanciati (voce sopra, musica sotto, mai si sovrasta).
- Sottotitoli leggibili a 1m di distanza.
- Tutte le 6 scene coerenti per palette colori (warmth simile).
- Nessun frame “AI artifact” evidente (mani con 6 dita, testo geroglifico, ecc.).
- Aspect ratio coerente (tutto 16:9 o tutto 9:16, mai mix).
- Lunghezza finale: 28-32 secondi (non oltre 35).
- File MP4 funziona su YouTube, Instagram Reels, TikTok (testa upload).
Variazioni dell’esercizio
Se hai tempo, esegui 2 varianti per imparare il workflow:
Variante A — Spot diverso, stesso brand
Forno di Maria — versione “natalizia” 30 secondi: panettone, atmosfera natale. Riusa la stessa Maria con --cref o avatar HeyGen custom.
Variante B — Stesso spot, livello superiore
Aggiungi:
- Avatar parlante (HeyGen) per Maria nella scena 6 invece dell’immagine statica + voiceover.
- Multilingua: la stessa pubblicità doppiata in inglese e tedesco con ElevenLabs Dubbing (puntata 138).
Cosa hai imparato (autovalutazione)
Riesci a rispondere “sì” a queste?
- So generare immagini coerenti tra loro usando
--crefe prompt strutturati. - So scegliere il modello giusto per il task (MJ vs Flux vs DALL-E).
- So usare voce clonata o stock con il giusto bilanciamento di stability/style.
- So generare musica adatta a un tono specifico in Suno.
- So montare tutto in un tool free (CapCut o DaVinci).
- Riconosco gli artifact AI tipici nelle mie produzioni e li mitigo.
- So quali tool sono commercially safe per uso clienti.
Se hai 5+ “sì” → padroneggi il capitolo 13. Hai uno stack creativo AI completo.
Glossario lampo
- Storyboard: schizzo sequenziale delle inquadrature, fatto prima di produrre.
- I2V (Image-to-Video): generare video animando un’immagine sorgente.
- Cross-dissolve: transizione morbida tra due clip, in cui una svanisce mentre l’altra appare.
- Color grading: aggiustamento globale dei colori per coerenza estetica.
- Bitrate: quanti dati per secondo nel video. Più alto = qualità migliore + file più pesante.
Take-away in una riga
In 4-6 ore e con $10-$20 hai prodotto uno spot completo di 30 secondi che 5 anni fa richiedeva uno studio. Non è “il futuro”: è il presente, e il capitolo 13 ti ha dato lo stack per farlo.
➡️ Prossima puntata: Capitolo 14 — AI al lavoro nei mestieri. Per chi scrive, vende, insegna: workflow concreti per professionisti.