✔️✔️ Doppie Spunte Blu Cap. 12 · Il bestiario dei modelli

Puntata 130

Puntata 130 — TEST: scegli il modello per 10 use case

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli · 🎯 Matching exercise di fine capitolo

Dieci scenari reali. Per ognuno, scegli il modello giusto motivando. Alla fine del test, sai progettare un’app multi-model che spende il giusto e risolve il giusto.

una tabella enorme su parete: 10 scenari numerati a sinistra, 10 modelli a destra (con icone), una matita che traccia linee di matching. Sullo sfondo, un robottino con cuffie tipo dispatch operator che dirige il traffico

Come funziona

10 scenari realistici. Per ognuno:

  1. Leggi lo scenario e i vincoli.
  2. Scegli il modello (o la combinazione) più appropriato/a.
  3. Apri lo spoiler per la risposta consigliata + motivazione.

Non c’è quasi mai una sola risposta giusta: ci sono scelte sensate e scelte poco sensate. Il test verifica che tu ragioni con le dimensioni giuste: qualità, costo, latency, privacy, multimodalità, geo-compliance, volume.

Pronto? Iniziamo.


Scenario 1 — Customer support bot di un e-commerce

Vincoli:

  • 100k conversazioni/giorno.
  • Domande ripetitive (90%): tracking ordini, reso, faq pagamenti.
  • 10% richieste complesse che richiedono escalation a umano.
  • Italiano e inglese.
  • Costo critico.

Quale modello/architettura?

👀 Spoiler: scelta consigliata

Architettura cascading:

  • Tier 1 (90% volume): GPT-5 mini o Claude Haiku o Gemini Flash + few-shot + RAG su KB aziendale.
  • Tier 2 (8% volume): GPT-5 o Claude Sonnet per domande non gestite dal tier 1.
  • Tier 3 (2% volume): escalation a operatore umano.

Motivo:

  • 90% del volume su modelli mini = costo ~$200/giorno invece di ~$5000/giorno.
  • Multilingua basic (italiano + inglese) è coperto da tutti i fast models.
  • RAG sulla KB evita allucinazioni su politiche aziendali.
  • Reasoning/Opus = sovradimensionati, costo non giustificabile.
  • On-device = ovviamente no, è un server-side bot.

Scenario 2 — Studente liceale che usa l’AI per imparare matematica

Vincoli:

  • Problemi di analisi, geometria, fisica per maturità.
  • Studente deve capire i passaggi, non solo avere la risposta.
  • Accesso gratis o piano economico.
  • Lingua italiana.

Quale modello?

👀 Spoiler: scelta consigliata

Combinazione:

  • Modello reasoning gratuito: DeepSeek-R1 (chat.deepseek.com, gratis) — mostra il thinking interamente. Lo studente vede come il modello ragiona.
  • In alternativa: Gemini 2.5 Flash con thinking (gratis con account Google).
  • Backup: ChatGPT con o4-mini se hai accesso.

Motivo:

  • Reasoning model = passaggi corretti, non solo risposta.
  • DeepSeek mostra il thinking — pedagogicamente ottimo (lo studente impara guardando “come” il modello pensa).
  • Gratuito = sostenibile per uno studente.
  • Italiano = tutti supportano bene.

❌ Non scegliere: GPT-5 fast senza CoT (rischio errore in matematica), modello on-device (troppo piccolo per logica difficile).


Scenario 3 — Avvocato che deve analizzare contratti di 200+ pagine

Vincoli:

  • Documenti PDF lunghissimi (200-500 pagine).
  • Privacy critica (contratti confidenziali).
  • Studio legale italiano.
  • Budget medio-alto.

Quale modello?

👀 Spoiler: scelta consigliata

Due opzioni dipendenti dal livello di privacy:

Opzione A — Cloud con vincoli stringenti

  • Gemini 2.5 Pro via Vertex AI con deployment EU + dati non usati per training.
  • O Claude 4.7 Sonnet via AWS Bedrock EU region.
  • Pro: 1M+ token context, analisi profonda.

Opzione B — On-prem se la confidenzialità è massima

  • Llama 3.1 70B o Qwen 3 self-hosted con quantizzazione, RAG sui contratti.
  • Pro: dati mai fuori dallo studio.
  • Contra: ops overhead, qualità sotto i frontier per analisi sottile.

Motivo:

  • Long context = Gemini campione.
  • Privacy / GDPR = deployment EU + opt-out training.
  • Per studi legali grandi: spesso si va su Bedrock/Vertex con compliance audit.

❌ Non scegliere: ChatGPT consumer (rischio compliance), Grok (trust enterprise basso).


Scenario 4 — Pubblicità “personalizzata” via WhatsApp Business

Vincoli:

  • Volume: 500k messaggi/giorno.
  • Generazione messaggi marketing personalizzati su segmenti.
  • Latency: <500ms ideale (l’utente attende).
  • Italiano.

Quale modello?

👀 Spoiler: scelta consigliata

Architettura:

  • Modello principale: GPT-5 nano o Gemini Flash-Lite o Claude Haiku + heavy prompt caching del system prompt aziendale.
  • Hosted su provider veloce: Groq per Llama 3.1 8B se servono custom fine-tuning.

Motivo:

  • Volume + latency → modello fast e leggero, ovviamente.
  • Prompt caching → costo molto basso.
  • Messaggi marketing = task semplice (template + personalizzazione), il nano basta.

Avvertenze:

  • ⚠️ Conformità: messaggi marketing automatici richiedono consenso esplicito. Verifica GDPR + AI Act art. 50 (trasparenza AI).
  • ⚠️ Anti-spam: WhatsApp Business ha rate limits e regole specifiche.

❌ Non scegliere: GPT-5 frontier (sovradimensionato, costo enorme su volumi), reasoning (latency troppo alta).


Scenario 5 — Sviluppatore solo che vuole un agente coding “vero”

Vincoli:

  • Lavora su progetti medi (10k-100k righe codice).
  • Vuole “delegare” feature complete: spec → codice testato → PR.
  • Budget personale: 50-100 €/mese accettabili.
  • Linguaggi: Python, TypeScript principalmente.

Quale modello?

👀 Spoiler: scelta consigliata

Default consigliato:

  • Claude Code (CLI Anthropic) con Claude 4.7 Sonnet + opzionale Claude 4.7 Sonnet extended thinking per task architetturali.
  • Plan Anthropic Max: ~$100/mese, traffico abbondante.

Alternative valide:

  • Cursor IDE con backend Claude 4.7 o GPT-5 (più visual, integrato in IDE).
  • GitHub Copilot Workspace se vuoi ecosistema Microsoft.
  • OpenAI Codex se preferisci ecosistema OpenAI.

Motivo:

  • Coding agentico → Claude è oggi il leader (vedi puntata 122).
  • Sonnet + extended = sweet spot qualità/costo.
  • Claude Code può modificare interi progetti, run test, autocorreggersi.

❌ Non scegliere: GPT-5 mini (qualità coding sotto), reasoning heavy (troppo lento per loop di feedback), modello on-device (troppo limitato per progetti seri).


Scenario 6 — Anziana 75 anni che vuole un’AI per compagnia leggera + uso pratico

Vincoli:

  • Usa iPhone.
  • Vuole privacy massima.
  • Niente tecnicismi.
  • Uso: chiacchierare, riassumi mail, traduci cartelli, ricorda farmaci.

Quale modello?

👀 Spoiler: scelta consigliata

Stack consigliato:

  • Apple Intelligence (iOS 18+) per task on-device: smart reply, riassunti mail, suggerimenti scrittura.
  • ChatGPT app (gratis o Plus $20) per chat, traduzione, domande generali. Modalità “no training” attiva.
  • Be My AI per descrizione immagini (puntata 59).

Motivo:

  • Apple Intelligence = privacy by default, già integrato nelle app che usa (Mail, Notes, Messages).
  • ChatGPT per task più complessi: interfaccia semplice, voice mode amico.
  • Per compagnia leggera “vera”: il piano gratis di ChatGPT basta.

Avvertenze:

  • Non spingerla a usare 10 app diverse. Una o due, ben padroneggiate.
  • Spiega che le foto private NON vanno mandate (puntata 74).
  • Per truffe: bookmark la cartolina della puntata 81.

❌ Non scegliere: stack complicato (Claude + Perplexity + Gemini + ecc.) — troppo per il target.


Scenario 7 — Giornalista che fa fact-checking su politica locale italiana

Vincoli:

  • Verificare affermazioni di politici regionali (es. dichiarazioni delle ultime 24h).
  • Trovare fonti vere, cliccabili.
  • Tempo critico: l’articolo va in pubblicazione in poche ore.

Quale modello?

👀 Spoiler: scelta consigliata

Stack consigliato:

  • Primario: Perplexity Pro con Pro Search (puntata 126) — risposte con fonti italiane affidabili (Ansa, Repubblica, Corriere, Sole 24 Ore).
  • Cross-check: ChatGPT con search o Gemini con grounding.
  • Per dati istituzionali: siti ufficiali (camera.it, senato.it, governo.it, regioni).
  • Per verifica fact-check professionale: Facta.news, Pagella Politica.

Motivo:

  • Recency + fonti = answer engine, non LLM puro.
  • Verifica incrociata su 2-3 fonti diverse è deontologica, non opzionale.

❌ Non scegliere: ChatGPT senza search (cutoff knowledge = rischio fatti vecchi), Grok (controverso editorialmente per uso giornalistico in Italia).


Scenario 8 — Startup che lancia un chatbot in 8 lingue europee

Vincoli:

  • Lingue: italiano, francese, tedesco, spagnolo, portoghese, polacco, olandese, greco.
  • Qualità linguistica importante (non traduzioni automatiche scarse).
  • Budget startup-friendly.
  • Compliance UE (AI Act).

Quale modello?

👀 Spoiler: scelta consigliata

Opzioni in ordine di preferenza:

  1. Mistral Large 2 o Mixtral 8x22B via Mistral API (deployment EU, GDPR friendly, ottime lingue europee).
  2. GPT-5 mini via OpenAI con regione EU (buona qualità multilingua europeo, ecosistema maturo).
  3. Gemini 2.5 Flash via Vertex AI EU.

Motivo:

  • Mistral = made-in-EU, lingue europee curate.
  • Compliance AI Act facilitata da provider europeo.
  • Pricing competitivo.

❌ Non scegliere: Qwen/DeepSeek (lingue europee meno raffinate, considerazioni geopolitiche), modelli on-device (qualità insufficiente per chat consumer multilingua).


Scenario 9 — Ricercatore universitario che analizza paper scientifici

Vincoli:

  • Lettura/sintesi di paper su arXiv, Nature, riviste scientifiche.
  • Citazioni precise (no allucinazioni!).
  • Capire formule, ragionamenti tecnici.
  • Università italiana, budget contenuto.

Quale modello?

👀 Spoiler: scelta consigliata

Stack consigliato:

  • Per sintesi e ragionamento: Claude 4.7 Sonnet o Gemini 2.5 Pro (long context per paper interi).
  • Per ricerca + citazioni: Perplexity Academic Search o Elicit / SciSpace / Consensus (motori dedicati a paper scientifici).
  • Per matematica/derivazioni: DeepSeek-R1 (reasoning gratuito, mostra il thinking) o o4-mini.

Workflow tipico:

  1. Cerca paper con Elicit/Perplexity Academic → fonti vere.
  2. Carica PDF su Claude/Gemini per analisi profonda.
  3. Per math difficile: reasoning model.
  4. Verifica sempre citazioni e formule manualmente.

Motivo:

  • Citation hallucination è grave in accademia (puntata 108).
  • Long context per paper lunghi.
  • Reasoning per derivazioni.
  • Mai un solo modello, sempre verifica incrociata.

Scenario 10 — Manifattura che vuole AI on-prem per controllo qualità con vision

Vincoli:

  • Riconoscere difetti su prodotti in linea (foto da camera in fabbrica).
  • Latency critica (<200ms per pezzo).
  • Privacy assoluta (segreti industriali).
  • Hardware: server con 2x GPU enterprise (Nvidia H100).

Quale modello?

👀 Spoiler: scelta consigliata

Stack consigliato:

  • Modello base: Qwen 3-VL o Llama 3.2 Vision 11B fine-tunati sui difetti specifici dell’azienda.
  • Inference server: vLLM o TensorRT-LLM ottimizzato per H100.
  • Quantizzazione INT8 o FP8 per latency sotto 200ms.
  • MLOps: monitoring deriva, ritraining periodico.

Motivo:

  • On-prem obbligatorio per privacy.
  • Vision model open-weight = fine-tunabile sul dominio specifico.
  • H100 + vLLM = latency garantita.
  • Qwen 3-VL / Llama Vision = top open vision oggi.

Avvertenze:

  • Serve team MLOps competente.
  • Considera vendor specializzati (Cogniteam, Sereact, Cognex AI) se non hai expertise interno.

❌ Non scegliere: cloud API (privacy, latency), modello closed-source senza fine-tuning (qualità sotto su difetti specifici).


Auto-valutazione

Per ogni scenario, quanto hai capito prima dello spoiler?

Scenari indovinati (sia il modello, sia il motivo)Verdetto
9-10/10🏆 Architetto AI di livello — pronti per il Cap. 13 (creatività multimodale)
6-8/10🥈 Solida comprensione — qualche dettaglio da consolidare
3-5/10🥉 In costruzione — ripassa puntate 121-129
0-2/10📚 Ricomincia dalla 121, prendi appunti

I 5 principi che emergono dai 10 scenari

1. Multi-model è la norma, non l’eccezione

Quasi tutti gli scenari combinano 2-3 modelli per ruoli diversi.

2. “Il migliore” dipende dal task

Stesso modello (es. Claude) è top per coding e mediocre per voice realtime.

3. Cost + latency dominano in produzione

Per uso casual qualunque modello va bene. In produzione, la scelta è guidata dai numeri.

4. Privacy + compliance sono spesso decisivi

EU + sanità + finanza + PA = vincoli che escludono molti modelli.

5. Cascading + fallback batte single-shot

Architetture ibride (small → big quando serve) sono standard mature.


🎓 Hai finito il Capitolo 12

Adesso sai:

  • GPT-5 e famiglia OpenAI (121).
  • Claude di Anthropic (122).
  • Gemini di Google (123).
  • Llama di Meta (124).
  • Mistral, Qwen, DeepSeek, Kimi (125).
  • Perplexity, You.com (126).
  • Grok di xAI (127).
  • Reasoning vs rapidi (128).
  • AI sul telefono (129).
  • Come scegliere in casi reali (130).

Sei pronto per il Capitolo 13: Creatività multimodale (131-144). Midjourney, DALL-E, video AI, audio AI, voci sintetiche, diritti d’autore, watermark. Si esce dal testo e si entra in tutto il resto.


Take-away in una riga

Il prompt engineering ti dà la voce. La scelta del modello ti dà il microfono giusto. Insieme, fanno la differenza tra “usare l’AI” e “saper progettare con l’AI”.

➡️ Prossimo capitolo: Creatività multimodale — Midjourney, DALL-E, video, audio, voci, diritti.