Puntata 130
Puntata 130 — TEST: scegli il modello per 10 use case
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli · 🎯 Matching exercise di fine capitolo
Dieci scenari reali. Per ognuno, scegli il modello giusto motivando. Alla fine del test, sai progettare un’app multi-model che spende il giusto e risolve il giusto.
Come funziona
10 scenari realistici. Per ognuno:
- Leggi lo scenario e i vincoli.
- Scegli il modello (o la combinazione) più appropriato/a.
- Apri lo spoiler per la risposta consigliata + motivazione.
Non c’è quasi mai una sola risposta giusta: ci sono scelte sensate e scelte poco sensate. Il test verifica che tu ragioni con le dimensioni giuste: qualità, costo, latency, privacy, multimodalità, geo-compliance, volume.
Pronto? Iniziamo.
Scenario 1 — Customer support bot di un e-commerce
Vincoli:
- 100k conversazioni/giorno.
- Domande ripetitive (90%): tracking ordini, reso, faq pagamenti.
- 10% richieste complesse che richiedono escalation a umano.
- Italiano e inglese.
- Costo critico.
Quale modello/architettura?
👀 Spoiler: scelta consigliata
Architettura cascading:
- Tier 1 (90% volume): GPT-5 mini o Claude Haiku o Gemini Flash + few-shot + RAG su KB aziendale.
- Tier 2 (8% volume): GPT-5 o Claude Sonnet per domande non gestite dal tier 1.
- Tier 3 (2% volume): escalation a operatore umano.
Motivo:
- 90% del volume su modelli mini = costo ~$200/giorno invece di ~$5000/giorno.
- Multilingua basic (italiano + inglese) è coperto da tutti i fast models.
- RAG sulla KB evita allucinazioni su politiche aziendali.
- Reasoning/Opus = sovradimensionati, costo non giustificabile.
- On-device = ovviamente no, è un server-side bot.
Scenario 2 — Studente liceale che usa l’AI per imparare matematica
Vincoli:
- Problemi di analisi, geometria, fisica per maturità.
- Studente deve capire i passaggi, non solo avere la risposta.
- Accesso gratis o piano economico.
- Lingua italiana.
Quale modello?
👀 Spoiler: scelta consigliata
Combinazione:
- Modello reasoning gratuito: DeepSeek-R1 (chat.deepseek.com, gratis) — mostra il thinking interamente. Lo studente vede come il modello ragiona.
- In alternativa: Gemini 2.5 Flash con thinking (gratis con account Google).
- Backup: ChatGPT con o4-mini se hai accesso.
Motivo:
- Reasoning model = passaggi corretti, non solo risposta.
- DeepSeek mostra il thinking — pedagogicamente ottimo (lo studente impara guardando “come” il modello pensa).
- Gratuito = sostenibile per uno studente.
- Italiano = tutti supportano bene.
❌ Non scegliere: GPT-5 fast senza CoT (rischio errore in matematica), modello on-device (troppo piccolo per logica difficile).
Scenario 3 — Avvocato che deve analizzare contratti di 200+ pagine
Vincoli:
- Documenti PDF lunghissimi (200-500 pagine).
- Privacy critica (contratti confidenziali).
- Studio legale italiano.
- Budget medio-alto.
Quale modello?
👀 Spoiler: scelta consigliata
Due opzioni dipendenti dal livello di privacy:
Opzione A — Cloud con vincoli stringenti
- Gemini 2.5 Pro via Vertex AI con deployment EU + dati non usati per training.
- O Claude 4.7 Sonnet via AWS Bedrock EU region.
- Pro: 1M+ token context, analisi profonda.
Opzione B — On-prem se la confidenzialità è massima
- Llama 3.1 70B o Qwen 3 self-hosted con quantizzazione, RAG sui contratti.
- Pro: dati mai fuori dallo studio.
- Contra: ops overhead, qualità sotto i frontier per analisi sottile.
Motivo:
- Long context = Gemini campione.
- Privacy / GDPR = deployment EU + opt-out training.
- Per studi legali grandi: spesso si va su Bedrock/Vertex con compliance audit.
❌ Non scegliere: ChatGPT consumer (rischio compliance), Grok (trust enterprise basso).
Scenario 4 — Pubblicità “personalizzata” via WhatsApp Business
Vincoli:
- Volume: 500k messaggi/giorno.
- Generazione messaggi marketing personalizzati su segmenti.
- Latency: <500ms ideale (l’utente attende).
- Italiano.
Quale modello?
👀 Spoiler: scelta consigliata
Architettura:
- Modello principale: GPT-5 nano o Gemini Flash-Lite o Claude Haiku + heavy prompt caching del system prompt aziendale.
- Hosted su provider veloce: Groq per Llama 3.1 8B se servono custom fine-tuning.
Motivo:
- Volume + latency → modello fast e leggero, ovviamente.
- Prompt caching → costo molto basso.
- Messaggi marketing = task semplice (template + personalizzazione), il nano basta.
Avvertenze:
- ⚠️ Conformità: messaggi marketing automatici richiedono consenso esplicito. Verifica GDPR + AI Act art. 50 (trasparenza AI).
- ⚠️ Anti-spam: WhatsApp Business ha rate limits e regole specifiche.
❌ Non scegliere: GPT-5 frontier (sovradimensionato, costo enorme su volumi), reasoning (latency troppo alta).
Scenario 5 — Sviluppatore solo che vuole un agente coding “vero”
Vincoli:
- Lavora su progetti medi (10k-100k righe codice).
- Vuole “delegare” feature complete: spec → codice testato → PR.
- Budget personale: 50-100 €/mese accettabili.
- Linguaggi: Python, TypeScript principalmente.
Quale modello?
👀 Spoiler: scelta consigliata
Default consigliato:
- Claude Code (CLI Anthropic) con Claude 4.7 Sonnet + opzionale Claude 4.7 Sonnet extended thinking per task architetturali.
- Plan Anthropic Max: ~$100/mese, traffico abbondante.
Alternative valide:
- Cursor IDE con backend Claude 4.7 o GPT-5 (più visual, integrato in IDE).
- GitHub Copilot Workspace se vuoi ecosistema Microsoft.
- OpenAI Codex se preferisci ecosistema OpenAI.
Motivo:
- Coding agentico → Claude è oggi il leader (vedi puntata 122).
- Sonnet + extended = sweet spot qualità/costo.
- Claude Code può modificare interi progetti, run test, autocorreggersi.
❌ Non scegliere: GPT-5 mini (qualità coding sotto), reasoning heavy (troppo lento per loop di feedback), modello on-device (troppo limitato per progetti seri).
Scenario 6 — Anziana 75 anni che vuole un’AI per compagnia leggera + uso pratico
Vincoli:
- Usa iPhone.
- Vuole privacy massima.
- Niente tecnicismi.
- Uso: chiacchierare, riassumi mail, traduci cartelli, ricorda farmaci.
Quale modello?
👀 Spoiler: scelta consigliata
Stack consigliato:
- Apple Intelligence (iOS 18+) per task on-device: smart reply, riassunti mail, suggerimenti scrittura.
- ChatGPT app (gratis o Plus $20) per chat, traduzione, domande generali. Modalità “no training” attiva.
- Be My AI per descrizione immagini (puntata 59).
Motivo:
- Apple Intelligence = privacy by default, già integrato nelle app che usa (Mail, Notes, Messages).
- ChatGPT per task più complessi: interfaccia semplice, voice mode amico.
- Per compagnia leggera “vera”: il piano gratis di ChatGPT basta.
Avvertenze:
- Non spingerla a usare 10 app diverse. Una o due, ben padroneggiate.
- Spiega che le foto private NON vanno mandate (puntata 74).
- Per truffe: bookmark la cartolina della puntata 81.
❌ Non scegliere: stack complicato (Claude + Perplexity + Gemini + ecc.) — troppo per il target.
Scenario 7 — Giornalista che fa fact-checking su politica locale italiana
Vincoli:
- Verificare affermazioni di politici regionali (es. dichiarazioni delle ultime 24h).
- Trovare fonti vere, cliccabili.
- Tempo critico: l’articolo va in pubblicazione in poche ore.
Quale modello?
👀 Spoiler: scelta consigliata
Stack consigliato:
- Primario: Perplexity Pro con Pro Search (puntata 126) — risposte con fonti italiane affidabili (Ansa, Repubblica, Corriere, Sole 24 Ore).
- Cross-check: ChatGPT con search o Gemini con grounding.
- Per dati istituzionali: siti ufficiali (camera.it, senato.it, governo.it, regioni).
- Per verifica fact-check professionale: Facta.news, Pagella Politica.
Motivo:
- Recency + fonti = answer engine, non LLM puro.
- Verifica incrociata su 2-3 fonti diverse è deontologica, non opzionale.
❌ Non scegliere: ChatGPT senza search (cutoff knowledge = rischio fatti vecchi), Grok (controverso editorialmente per uso giornalistico in Italia).
Scenario 8 — Startup che lancia un chatbot in 8 lingue europee
Vincoli:
- Lingue: italiano, francese, tedesco, spagnolo, portoghese, polacco, olandese, greco.
- Qualità linguistica importante (non traduzioni automatiche scarse).
- Budget startup-friendly.
- Compliance UE (AI Act).
Quale modello?
👀 Spoiler: scelta consigliata
Opzioni in ordine di preferenza:
- Mistral Large 2 o Mixtral 8x22B via Mistral API (deployment EU, GDPR friendly, ottime lingue europee).
- GPT-5 mini via OpenAI con regione EU (buona qualità multilingua europeo, ecosistema maturo).
- Gemini 2.5 Flash via Vertex AI EU.
Motivo:
- Mistral = made-in-EU, lingue europee curate.
- Compliance AI Act facilitata da provider europeo.
- Pricing competitivo.
❌ Non scegliere: Qwen/DeepSeek (lingue europee meno raffinate, considerazioni geopolitiche), modelli on-device (qualità insufficiente per chat consumer multilingua).
Scenario 9 — Ricercatore universitario che analizza paper scientifici
Vincoli:
- Lettura/sintesi di paper su arXiv, Nature, riviste scientifiche.
- Citazioni precise (no allucinazioni!).
- Capire formule, ragionamenti tecnici.
- Università italiana, budget contenuto.
Quale modello?
👀 Spoiler: scelta consigliata
Stack consigliato:
- Per sintesi e ragionamento: Claude 4.7 Sonnet o Gemini 2.5 Pro (long context per paper interi).
- Per ricerca + citazioni: Perplexity Academic Search o Elicit / SciSpace / Consensus (motori dedicati a paper scientifici).
- Per matematica/derivazioni: DeepSeek-R1 (reasoning gratuito, mostra il thinking) o o4-mini.
Workflow tipico:
- Cerca paper con Elicit/Perplexity Academic → fonti vere.
- Carica PDF su Claude/Gemini per analisi profonda.
- Per math difficile: reasoning model.
- Verifica sempre citazioni e formule manualmente.
Motivo:
- Citation hallucination è grave in accademia (puntata 108).
- Long context per paper lunghi.
- Reasoning per derivazioni.
- Mai un solo modello, sempre verifica incrociata.
Scenario 10 — Manifattura che vuole AI on-prem per controllo qualità con vision
Vincoli:
- Riconoscere difetti su prodotti in linea (foto da camera in fabbrica).
- Latency critica (<200ms per pezzo).
- Privacy assoluta (segreti industriali).
- Hardware: server con 2x GPU enterprise (Nvidia H100).
Quale modello?
👀 Spoiler: scelta consigliata
Stack consigliato:
- Modello base: Qwen 3-VL o Llama 3.2 Vision 11B fine-tunati sui difetti specifici dell’azienda.
- Inference server: vLLM o TensorRT-LLM ottimizzato per H100.
- Quantizzazione INT8 o FP8 per latency sotto 200ms.
- MLOps: monitoring deriva, ritraining periodico.
Motivo:
- On-prem obbligatorio per privacy.
- Vision model open-weight = fine-tunabile sul dominio specifico.
- H100 + vLLM = latency garantita.
- Qwen 3-VL / Llama Vision = top open vision oggi.
Avvertenze:
- Serve team MLOps competente.
- Considera vendor specializzati (Cogniteam, Sereact, Cognex AI) se non hai expertise interno.
❌ Non scegliere: cloud API (privacy, latency), modello closed-source senza fine-tuning (qualità sotto su difetti specifici).
Auto-valutazione
Per ogni scenario, quanto hai capito prima dello spoiler?
| Scenari indovinati (sia il modello, sia il motivo) | Verdetto |
|---|---|
| 9-10/10 | 🏆 Architetto AI di livello — pronti per il Cap. 13 (creatività multimodale) |
| 6-8/10 | 🥈 Solida comprensione — qualche dettaglio da consolidare |
| 3-5/10 | 🥉 In costruzione — ripassa puntate 121-129 |
| 0-2/10 | 📚 Ricomincia dalla 121, prendi appunti |
I 5 principi che emergono dai 10 scenari
1. Multi-model è la norma, non l’eccezione
Quasi tutti gli scenari combinano 2-3 modelli per ruoli diversi.
2. “Il migliore” dipende dal task
Stesso modello (es. Claude) è top per coding e mediocre per voice realtime.
3. Cost + latency dominano in produzione
Per uso casual qualunque modello va bene. In produzione, la scelta è guidata dai numeri.
4. Privacy + compliance sono spesso decisivi
EU + sanità + finanza + PA = vincoli che escludono molti modelli.
5. Cascading + fallback batte single-shot
Architetture ibride (small → big quando serve) sono standard mature.
🎓 Hai finito il Capitolo 12
Adesso sai:
- GPT-5 e famiglia OpenAI (121).
- Claude di Anthropic (122).
- Gemini di Google (123).
- Llama di Meta (124).
- Mistral, Qwen, DeepSeek, Kimi (125).
- Perplexity, You.com (126).
- Grok di xAI (127).
- Reasoning vs rapidi (128).
- AI sul telefono (129).
- Come scegliere in casi reali (130).
Sei pronto per il Capitolo 13: Creatività multimodale (131-144). Midjourney, DALL-E, video AI, audio AI, voci sintetiche, diritti d’autore, watermark. Si esce dal testo e si entra in tutto il resto.
Take-away in una riga
Il prompt engineering ti dà la voce. La scelta del modello ti dà il microfono giusto. Insieme, fanno la differenza tra “usare l’AI” e “saper progettare con l’AI”.
➡️ Prossimo capitolo: Creatività multimodale — Midjourney, DALL-E, video, audio, voci, diritti.