✔️✔️ Doppie Spunte Blu Cap. 13 · Creatività multimodale

Puntata 132

Puntata 132 — DALL-E, Stable Diffusion, Flux

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 13 · Creatività multimodale

I tre fratelli rivali di Midjourney. Ognuno con il suo carattere: uno obbediente, uno smanettone, uno fotografo.

tre robottini in fila come band: il primo con cuffie e taccuino (DALL-E, ordinato), il secondo con cassetta degli attrezzi piena di cacciaviti (Stable Diffusion, modder), il terzo con macchina fotografica reflex appesa al collo (Flux, realista)

I tre archetipi

Nel 2026 il panorama dei generatori di immagini text-to-image, oltre a Midjourney (puntata 131), si organizza intorno a tre famiglie:

FamigliaChi lo faDistintivo
DALL-E 3OpenAIIntegrato in ChatGPT. Segue il prompt letteralmente. Conservativo sui contenuti.
Stable Diffusion / SDXL / SD3Stability AI (e community open)Open source. Massima personalizzazione tramite LoRA, ControlNet, fine-tuning.
Flux (.1, Pro, Schnell, Dev)Black Forest LabsRealismo fotografico e testo dentro le immagini ai livelli più alti del 2026.

Sotto il cofano sono tutti diffusion model (puntata 203 per i dettagli) ma con scelte progettuali, training e licenze diverse.


DALL-E 3 — l’ordinato

Dentro ChatGPT (gratis e Plus) o via API OpenAI.

Punti forti:

  • Obbedienza al prompt: se gli chiedi “tre gatti, uno arancione, uno nero, uno bianco, sullo stesso divano” → te ne dà tre, dei colori giusti, nello stesso luogo. MJ spesso ne mette quattro o cambia i colori.
  • Integrazione con il chat: glielo descrivi a parole, lui chiede chiarimenti, riformula, itera.
  • Testo dentro le immagini: discreto (sotto Flux ma sopra MJ V6).

Punti deboli:

  • Filtri molto restrittivi su volti reali, contenuti sensibili, IP (Topolino, loghi…).
  • Estetica più “neutra”, meno wow rispetto a MJ.
  • Niente API per generazione massiva a basso costo (~$0.04/immagine in HD).

Uso ideale: brainstorming, illustrazioni per articoli, mockup veloci, contenuti che richiedono alta aderenza al brief.


Stable Diffusion — lo smanettone

Open source dal 2022 (Stability AI). Le versioni rilevanti nel 2026:

  • SDXL (luglio 2023): ancora usatissimo, base ampia di modelli derivati.
  • SD3 / SD3.5 (2024-2025): più recenti, qualità superiore.
  • Stable Diffusion 4 (sperimentale 2026): in beta limitata.

Punti forti:

  • Gira sul tuo PC (anche su GPU consumer da 8-16 GB VRAM, vedi capitolo 21).
  • Ecosistema enorme: LoRA (style/character adapters), ControlNet (controllo strutturale tramite pose, depth map, edge), fine-tuning custom su dataset propri.
  • Zero censura (a parte la versione base): la community pubblica modelli per ogni stile, dominio, gusto.
  • Costo marginale: zero se hai la GPU.

Punti deboli:

  • Setup tecnico non banale (ComfyUI, Automatic1111, Forge — vedi puntata 228 per i runtime).
  • Qualità out-of-the-box inferiore a MJ/Flux per il neofita: serve sapere cosa fare.
  • Frammentazione: 1000 modelli sulla piattaforma Civitai, scegliere è un mestiere.

Uso ideale: chi vuole controllo totale (artisti digitali, studi che producono contenuti consistenti per un brand), workflow batch su GPU propria, sperimentazione.


Flux — il fotografo

Black Forest Labs (fondata 2024 da ex-Stability) ha rilasciato Flux.1 ad agosto 2024 con tre varianti:

  • Flux.1 [Schnell]: veloce, leggero, licenza Apache 2.0 (open weights). Gira su GPU consumer.
  • Flux.1 [Dev]: qualità superiore, licenza “non-commerciale per ricerca” (commercial license a pagamento).
  • Flux.1 [Pro]: top di gamma, solo via API (Replicate, Together, Fal).
  • Flux 1.1 Pro / Ultra (2025): incrementi qualitativi successivi.

Punti forti:

  • Realismo fotografico: pelle umana, mani, anatomia → migliori in classe nel 2026.
  • Testo dentro le immagini: scritte coerenti e leggibili (cartelli, magliette, copertine). Confrontabile con Ideogram.
  • Prezzi via API molto bassi: ~$0.003 (Schnell) – $0.04 (Pro Ultra) per immagine. Economico per workflow massivi.
  • Aperto (Schnell): puoi farlo girare sul tuo PC, gratis.

Punti deboli:

  • Estetica meno “wow” di MJ se vuoi qualcosa di artistico/pittorico.
  • Dev license non è proprio “open source” puro.

Uso ideale: foto realistiche, prodotti, ritratti, batch programmatico (generare 1000 immagini per un catalogo, vedi /btw precedente sull’argomento).


La tabella riassuntiva (2026)

MJ V7DALL-E 3SDXL/SD3Flux Pro
Qualità estetica5/54/53-5/5 (con modelli giusti)4-5/5
Realismo fotografico3/53/54/5 (con LoRA)5/5
Aderenza al prompt3/55/53/54/5
Testo nelle immagini3/53/52/55/5
Controllo tecnico3/51/55/53/5
Open / locale✅ (Schnell/Dev)
Costo per uso massivoMedioAltoBasso (proprio HW)Basso
Facilità per neofita5/55/52/54/5

Quale scegliere — la decisione in 30 secondi

  • Sono un neofita, voglio bellezza subito → Midjourney (puntata 131) o DALL-E in ChatGPT.
  • Mi serve aderenza al brief, lavoro testuale-visuale integrato → DALL-E 3 in ChatGPT.
  • Voglio personalizzare uno stile specifico (es. mascotte aziendale) → Stable Diffusion + LoRA custom.
  • Foto realistiche di prodotto, persone, scene → Flux.
  • Workflow batch per centinaia/migliaia di immagini → Flux Schnell via Replicate o SD locale.

Nessuno è “il migliore in assoluto”. I professionisti usano tutti e quattro a rotazione, scegliendo per task.


TEST pratico (10 minuti)

  1. Scrivi questo prompt identico nei 3-4 modelli a cui hai accesso: “Un cartello in legno appeso a un negozio italiano di paese, con scritto ‘PANE FRESCO OGGI’ a caratteri grandi, ora del tramonto, fotografia.”
  2. Confronta i risultati:
    • Chi ha scritto PANE FRESCO OGGI correttamente?
    • Chi ha fatto la scena più realistica?
    • Chi ha avuto più bei colori?
  3. Probabile vincitore sul testo: Flux o Ideogram. Sul realismo: Flux. Sull’estetica: MJ. Sull’aderenza al brief: DALL-E.

Riconoscere queste firme è ciò che separa chi sa cosa scegliere da chi usa sempre lo stesso strumento per tutto.


Glossario lampo

  • LoRA (Low-Rank Adaptation): mini-modello che modifica uno SD per imparare uno stile/personaggio specifico. Vedi puntata 218.
  • ControlNet: tecnica per controllare la composizione di un’immagine SD tramite un’immagine guida (pose, depth, edge).
  • Open weights: i pesi del modello sono scaricabili, ma la licenza può non essere “open source” pura. Vedi puntata 226.

Take-away in una riga

Quattro modelli, quattro caratteri: MJ artistico, DALL-E obbediente, SD personalizzabile, Flux fotografico. Il pro li usa tutti, scegliendo per task.

➡️ Prossima puntata: L’arte del prompt visuale — composizione, luce, lente, framing. Le parole che fanno la differenza.