Puntata 132
Puntata 132 — DALL-E, Stable Diffusion, Flux
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 13 · Creatività multimodale
I tre fratelli rivali di Midjourney. Ognuno con il suo carattere: uno obbediente, uno smanettone, uno fotografo.
I tre archetipi
Nel 2026 il panorama dei generatori di immagini text-to-image, oltre a Midjourney (puntata 131), si organizza intorno a tre famiglie:
| Famiglia | Chi lo fa | Distintivo |
|---|---|---|
| DALL-E 3 | OpenAI | Integrato in ChatGPT. Segue il prompt letteralmente. Conservativo sui contenuti. |
| Stable Diffusion / SDXL / SD3 | Stability AI (e community open) | Open source. Massima personalizzazione tramite LoRA, ControlNet, fine-tuning. |
| Flux (.1, Pro, Schnell, Dev) | Black Forest Labs | Realismo fotografico e testo dentro le immagini ai livelli più alti del 2026. |
Sotto il cofano sono tutti diffusion model (puntata 203 per i dettagli) ma con scelte progettuali, training e licenze diverse.
DALL-E 3 — l’ordinato
Dentro ChatGPT (gratis e Plus) o via API OpenAI.
✅ Punti forti:
- Obbedienza al prompt: se gli chiedi “tre gatti, uno arancione, uno nero, uno bianco, sullo stesso divano” → te ne dà tre, dei colori giusti, nello stesso luogo. MJ spesso ne mette quattro o cambia i colori.
- Integrazione con il chat: glielo descrivi a parole, lui chiede chiarimenti, riformula, itera.
- Testo dentro le immagini: discreto (sotto Flux ma sopra MJ V6).
❌ Punti deboli:
- Filtri molto restrittivi su volti reali, contenuti sensibili, IP (Topolino, loghi…).
- Estetica più “neutra”, meno wow rispetto a MJ.
- Niente API per generazione massiva a basso costo (~$0.04/immagine in HD).
Uso ideale: brainstorming, illustrazioni per articoli, mockup veloci, contenuti che richiedono alta aderenza al brief.
Stable Diffusion — lo smanettone
Open source dal 2022 (Stability AI). Le versioni rilevanti nel 2026:
- SDXL (luglio 2023): ancora usatissimo, base ampia di modelli derivati.
- SD3 / SD3.5 (2024-2025): più recenti, qualità superiore.
- Stable Diffusion 4 (sperimentale 2026): in beta limitata.
✅ Punti forti:
- Gira sul tuo PC (anche su GPU consumer da 8-16 GB VRAM, vedi capitolo 21).
- Ecosistema enorme: LoRA (style/character adapters), ControlNet (controllo strutturale tramite pose, depth map, edge), fine-tuning custom su dataset propri.
- Zero censura (a parte la versione base): la community pubblica modelli per ogni stile, dominio, gusto.
- Costo marginale: zero se hai la GPU.
❌ Punti deboli:
- Setup tecnico non banale (ComfyUI, Automatic1111, Forge — vedi puntata 228 per i runtime).
- Qualità out-of-the-box inferiore a MJ/Flux per il neofita: serve sapere cosa fare.
- Frammentazione: 1000 modelli sulla piattaforma Civitai, scegliere è un mestiere.
Uso ideale: chi vuole controllo totale (artisti digitali, studi che producono contenuti consistenti per un brand), workflow batch su GPU propria, sperimentazione.
Flux — il fotografo
Black Forest Labs (fondata 2024 da ex-Stability) ha rilasciato Flux.1 ad agosto 2024 con tre varianti:
- Flux.1 [Schnell]: veloce, leggero, licenza Apache 2.0 (open weights). Gira su GPU consumer.
- Flux.1 [Dev]: qualità superiore, licenza “non-commerciale per ricerca” (commercial license a pagamento).
- Flux.1 [Pro]: top di gamma, solo via API (Replicate, Together, Fal).
- Flux 1.1 Pro / Ultra (2025): incrementi qualitativi successivi.
✅ Punti forti:
- Realismo fotografico: pelle umana, mani, anatomia → migliori in classe nel 2026.
- Testo dentro le immagini: scritte coerenti e leggibili (cartelli, magliette, copertine). Confrontabile con Ideogram.
- Prezzi via API molto bassi: ~$0.003 (Schnell) – $0.04 (Pro Ultra) per immagine. Economico per workflow massivi.
- Aperto (Schnell): puoi farlo girare sul tuo PC, gratis.
❌ Punti deboli:
- Estetica meno “wow” di MJ se vuoi qualcosa di artistico/pittorico.
- Dev license non è proprio “open source” puro.
Uso ideale: foto realistiche, prodotti, ritratti, batch programmatico (generare 1000 immagini per un catalogo, vedi /btw precedente sull’argomento).
La tabella riassuntiva (2026)
| MJ V7 | DALL-E 3 | SDXL/SD3 | Flux Pro | |
|---|---|---|---|---|
| Qualità estetica | 5/5 | 4/5 | 3-5/5 (con modelli giusti) | 4-5/5 |
| Realismo fotografico | 3/5 | 3/5 | 4/5 (con LoRA) | 5/5 |
| Aderenza al prompt | 3/5 | 5/5 | 3/5 | 4/5 |
| Testo nelle immagini | 3/5 | 3/5 | 2/5 | 5/5 |
| Controllo tecnico | 3/5 | 1/5 | 5/5 | 3/5 |
| Open / locale | ❌ | ❌ | ✅ | ✅ (Schnell/Dev) |
| Costo per uso massivo | Medio | Alto | Basso (proprio HW) | Basso |
| Facilità per neofita | 5/5 | 5/5 | 2/5 | 4/5 |
Quale scegliere — la decisione in 30 secondi
- Sono un neofita, voglio bellezza subito → Midjourney (puntata 131) o DALL-E in ChatGPT.
- Mi serve aderenza al brief, lavoro testuale-visuale integrato → DALL-E 3 in ChatGPT.
- Voglio personalizzare uno stile specifico (es. mascotte aziendale) → Stable Diffusion + LoRA custom.
- Foto realistiche di prodotto, persone, scene → Flux.
- Workflow batch per centinaia/migliaia di immagini → Flux Schnell via Replicate o SD locale.
Nessuno è “il migliore in assoluto”. I professionisti usano tutti e quattro a rotazione, scegliendo per task.
TEST pratico (10 minuti)
- Scrivi questo prompt identico nei 3-4 modelli a cui hai accesso: “Un cartello in legno appeso a un negozio italiano di paese, con scritto ‘PANE FRESCO OGGI’ a caratteri grandi, ora del tramonto, fotografia.”
- Confronta i risultati:
- Chi ha scritto PANE FRESCO OGGI correttamente?
- Chi ha fatto la scena più realistica?
- Chi ha avuto più bei colori?
- Probabile vincitore sul testo: Flux o Ideogram. Sul realismo: Flux. Sull’estetica: MJ. Sull’aderenza al brief: DALL-E.
Riconoscere queste firme è ciò che separa chi sa cosa scegliere da chi usa sempre lo stesso strumento per tutto.
Glossario lampo
- LoRA (Low-Rank Adaptation): mini-modello che modifica uno SD per imparare uno stile/personaggio specifico. Vedi puntata 218.
- ControlNet: tecnica per controllare la composizione di un’immagine SD tramite un’immagine guida (pose, depth, edge).
- Open weights: i pesi del modello sono scaricabili, ma la licenza può non essere “open source” pura. Vedi puntata 226.
Take-away in una riga
Quattro modelli, quattro caratteri: MJ artistico, DALL-E obbediente, SD personalizzabile, Flux fotografico. Il pro li usa tutti, scegliendo per task.
➡️ Prossima puntata: L’arte del prompt visuale — composizione, luce, lente, framing. Le parole che fanno la differenza.