Puntata 109
Puntata 109 — GPT, Claude, Gemini sotto la pelle
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 10 · Sotto il cofano: cos’è davvero un LLM
Tutti transformer. Tutti next-token prediction. Eppure: tre laboratori diversi, tre tecniche di post-training diverse, tre “personalità” misurabili in benchmark. Sotto la pelle, le differenze contano.
Tutti dalla stessa famiglia
A livello architetturale, GPT-5, Claude 4.7 e Gemini 2.5 sono transformer decoder-only con next-token prediction (vedi puntate 101, 103, 203).
Le differenze stanno in:
- Filosofia di training (dati, RLHF vs Constitutional AI, scelte etiche).
- Architettura specifica (MoE vs dense, modifiche all’attention, multimodalità nativa).
- Ecosistema (integrazioni, prezzi, API, casi d’uso target).
- Personalità del post-training (tono, stile, comportamento di rifiuto).
Vediamo i tre principali, più i contendenti che contano.
OpenAI / GPT — la frontiera “general-purpose”
Cosa lo distingue:
- Pioniere del genere (GPT-1 → GPT-5).
- Massima penetrazione di mercato (ChatGPT è sinonimo di AI per la maggior parte degli utenti).
- Forte ecosistema: API, Custom GPTs, plugin storici, Operator (computer use), Atlas (browser AI).
- Modelli multipli per use case: GPT-5, GPT-5 mini, GPT-5 nano, o4-mini, o3 (reasoning).
Personalità:
- Tono eclettico, adatto al pubblico generalista.
- Forte su scrittura creativa, brainstorming, instruction following.
- Storica debolezza: sycophancy (puntata 174), riduce dal 2025.
Architettura (note pubbliche / stime):
- GPT-4 era ~1.7T parametri MoE (stima Trolley/Semianalysis 2023).
- GPT-5: non dichiarato, presumibilmente MoE multi-trilione.
- Pioniere del reasoning con la o-series (o1 dicembre 2024, o3 / o4-mini 2025).
Post-training:
- RLHF “classico” + DPO + tecniche proprietarie.
- Sycophancy ridotta via training mirato e nuove reward functions dal 2025.
Punti forti operativi:
- Tool use molto raffinato (function calling stabile, function streaming).
- Realtime API per voce con bassa latenza.
- Vision integrata (GPT-4o e successori).
Anthropic / Claude — il modello “responsabile e ragionato”
Cosa lo distingue:
- Fondata nel 2021 da ex-OpenAI con focus su AI safety.
- Constitutional AI (puntata 217) come paradigma di post-training: principi espliciti, autocorrezione.
- Reputazione: il modello più “ragionato” e meno sycophant.
- Forte su long context (200k stabile da Claude 3) e scrittura.
Personalità:
- Tono misurato, articolato, “intellettuale”.
- Risposte più lunghe e strutturate rispetto a GPT.
- Più cauto sui rifiuti — talvolta troppo (over-refusal storico, ridotto dal 2025).
Architettura (note pubbliche):
- Famiglia Claude 4.7: Opus (top), Sonnet (sweet spot), Haiku (fast/cheap).
- Parametri non dichiarati.
- Forte focus su extended thinking (modalità reasoning interna, dal 2025).
Punti forti operativi:
- Migliore per coding (Claude Code, l’IDE/CLI di Anthropic).
- Eccellente su scrittura tecnica e creative writing lunga.
- Long context più affidabile (meno “lost in the middle” rispetto a competitor).
- Privacy: di default non usa dati utenti per training.
Google / Gemini — il “nativamente multimodale”
Cosa lo distingue:
- DeepMind (acquisito da Google nel 2014) è la storica leadership scientifica AI (AlphaGo, AlphaFold, Gemini).
- Multimodalità nativa dal training: testo + immagine + audio + video addestrati insieme, non bolt-on.
- Long context champion: 1M-2M token standard, esperimenti a 10M.
- Integrato profondamente con ecosistema Google (Gmail, Drive, Docs, YouTube).
Personalità:
- Tono pragmatico, factual.
- Più orientato a “search & retrieval” che a creatività libera.
- Forte su ricerca con fonti (grounding nativo via Google Search).
Architettura:
- Gemini 2.5: famiglia Pro / Flash / Flash-Lite.
- MoE confermato in Gemini Pro.
- Modello frontier reasoning: Gemini 2.5 Deep Think (2025).
Punti forti operativi:
- Imbattibile su long context veri (analizzare PDF di 200 pagine, video di un’ora).
- Apertura ai dataset Google (Search, YouTube transcripts, Maps).
- Forte su codice (in particolare con Codey/AlphaCode integrazione).
- Disponibile gratis con quote generose (Gemini in AI Studio).
Gli altri che contano nel 2026
xAI / Grok
- Posizionamento: “less filtered, more truth-seeking”.
- Forte integrazione con X (Twitter) per real-time info.
- Personalità più “casual”, a volte controversa.
- Grok 3 (2025) competitivo sui benchmark, ma minor adozione enterprise.
DeepSeek (Cina)
- DeepSeek-V3 / R1: dimostrazione che open-source può competere con frontier USA.
- 671B parametri MoE (37B attivi). Costi training drasticamente ridotti (~5M$ vs centinaia per i USA, claim controversi).
- Forte su reasoning e matematica. R1 ha sconvolto i mercati nel gennaio 2025.
Meta / Llama
- Open-weight champion: Llama 3.1 (405B), Llama 4 (atteso).
- Standard de-facto per self-hosting e fine-tuning.
- Personalità “neutra” — base per molti fork community.
Mistral (Francia)
- Player europeo, focus su modelli efficienti.
- Mistral Large, Mixtral 8x22B (MoE), Codestral.
- Forte privacy/sovereign AI per UE.
Alibaba / Qwen
- Frontier cinese open-source: Qwen 2.5, Qwen 3 (2025).
- Eccellente su lingue asiatiche, multilingue, coding.
Vedi capitolo 12 (121-130) per il bestiario completo dei modelli.
Confronto su benchmark (snapshot 2026)
Ordini di grandezza tipici, varia per benchmark:
| Modello | MMLU | HumanEval (code) | MATH | Long context (NIAH 128k) |
|---|---|---|---|---|
| GPT-5 | 92-94 | 95+ | 95+ | 95-98% |
| Claude 4.7 Opus | 90-93 | 95+ | 92-95 | 95-99% |
| Gemini 2.5 Pro | 89-92 | 90-93 | 90-94 | 97-99% (a 1M+!) |
| DeepSeek-R1 | 88-91 | 90+ | 95+ | 90-95% |
| Grok 3 | 87-90 | 88-92 | 89-92 | 93-96% |
| Llama 4 (atteso) | 85-89 | 87-91 | 85-90 | 90-95% |
⚠️ I benchmark misurano una fetta del comportamento. Per il tuo use case specifico, fai sempre eval interno. Vedi puntate 221, 245.
Quale scegliere: la matrice operativa
| Task | Scelta consigliata 2026 |
|---|---|
| Scrittura creativa, brainstorm | GPT-5 o Claude 4.7 |
| Codice produzione, refactoring | Claude 4.7 (Sonnet/Opus) |
| Reasoning matematico, scientifico | DeepSeek-R1 o o4-mini |
| Long context (PDF, video) | Gemini 2.5 Pro |
| Search + fonti citate | Perplexity (sotto GPT/Claude/sonar) |
| On-device / privacy | Llama 3.x / Qwen 3 / Mistral self-hosted |
| Lingue asiatiche | Qwen, DeepSeek |
| Italiano e dialetti | GPT-5, Claude 4.7, Mixtral (decenti); apposito per regional → Minerva (Sapienza), Modello Italia |
| Voce naturale (parlare) | GPT-5 (Realtime API), Gemini Live |
| Tool use / agents | Claude 4.7 (eccellente function calling) |
“Quale è il migliore?”
Domanda mal posta. La risposta dipende da:
- Cosa devi fare (creativo, tecnico, lungo, multilingua, voice…).
- Quanto puoi spendere (mini vs frontier: 10-50× differenza).
- Privacy / dove vivono i dati (USA vs UE vs on-prem).
- Latenza (Flash/Haiku/mini ~1s, frontier ~5-15s con reasoning).
- Specifiche di compliance (settore regolato, AI Act).
Pratica matura: multi-model. Usa 2-3 modelli in produzione, routing intelligente per task type. Vedi anche puntata 99 (plan B per l’utente comune).
La “personalità” misurabile
Curiosità: benchmark recenti hanno provato a misurare la personalità dei modelli su scale tipo Big Five. Risultati indicativi:
- GPT: alta apertura, alta agreeableness, media coscienziosità.
- Claude: altissima coscienziosità, alta apertura, media agreeableness (più disposto a dissentire).
- Gemini: media in tutte le scale, leggermente più “fattuale-distaccato”.
Non è scienza esatta, ma il “carattere” emerge dal post-training e si misura.
TEST pratico (10 minuti)
- Prendi una richiesta complessa reale del tuo lavoro (es. “Scrivi un piano marketing per il lancio di X, considerando target Y, budget Z”).
- Lancia esattamente lo stesso prompt su:
- ChatGPT (chatgpt.com)
- Claude (claude.ai)
- Gemini (gemini.google.com)
- Confronta:
- Lunghezza della risposta
- Struttura (liste, paragrafi, formattazione)
- Specificità (concretezza vs genericità)
- Tono (energico, pacato, professionale)
- Veridicità verificabile (date, dati, fonti)
- Scegli quello che meglio si adatta al tuo stile / casi d’uso.
Lo farai una volta. Ti durerà mesi di scelta consapevole.
Take-away in una riga
Stesse fondamenta architetturali, tre filosofie diverse. La scelta non è “miglior modello in assoluto”, è “miglior matching tra modello e task / contesto / vincoli”.
➡️ Prossima puntata: TEST — traduci un prompt in token, con tool gratis.