✔️✔️ Doppie Spunte Blu Cap. 10 · Sotto il cofano: cos'è davvero un LLM

Puntata 109

Puntata 109 — GPT, Claude, Gemini sotto la pelle

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 10 · Sotto il cofano: cos’è davvero un LLM

Tutti transformer. Tutti next-token prediction. Eppure: tre laboratori diversi, tre tecniche di post-training diverse, tre “personalità” misurabili in benchmark. Sotto la pelle, le differenze contano.

tre robottini in fila, stessa struttura interna (cubo nero “transformer”) ma con vernici diverse: blu OpenAI, arancione Anthropic, multicolor Google. Sotto, una scheda comparativa con asticelle benchmark

Tutti dalla stessa famiglia

A livello architetturale, GPT-5, Claude 4.7 e Gemini 2.5 sono transformer decoder-only con next-token prediction (vedi puntate 101, 103, 203).

Le differenze stanno in:

  1. Filosofia di training (dati, RLHF vs Constitutional AI, scelte etiche).
  2. Architettura specifica (MoE vs dense, modifiche all’attention, multimodalità nativa).
  3. Ecosistema (integrazioni, prezzi, API, casi d’uso target).
  4. Personalità del post-training (tono, stile, comportamento di rifiuto).

Vediamo i tre principali, più i contendenti che contano.


OpenAI / GPT — la frontiera “general-purpose”

Cosa lo distingue:

  • Pioniere del genere (GPT-1 → GPT-5).
  • Massima penetrazione di mercato (ChatGPT è sinonimo di AI per la maggior parte degli utenti).
  • Forte ecosistema: API, Custom GPTs, plugin storici, Operator (computer use), Atlas (browser AI).
  • Modelli multipli per use case: GPT-5, GPT-5 mini, GPT-5 nano, o4-mini, o3 (reasoning).

Personalità:

  • Tono eclettico, adatto al pubblico generalista.
  • Forte su scrittura creativa, brainstorming, instruction following.
  • Storica debolezza: sycophancy (puntata 174), riduce dal 2025.

Architettura (note pubbliche / stime):

  • GPT-4 era ~1.7T parametri MoE (stima Trolley/Semianalysis 2023).
  • GPT-5: non dichiarato, presumibilmente MoE multi-trilione.
  • Pioniere del reasoning con la o-series (o1 dicembre 2024, o3 / o4-mini 2025).

Post-training:

  • RLHF “classico” + DPO + tecniche proprietarie.
  • Sycophancy ridotta via training mirato e nuove reward functions dal 2025.

Punti forti operativi:

  • Tool use molto raffinato (function calling stabile, function streaming).
  • Realtime API per voce con bassa latenza.
  • Vision integrata (GPT-4o e successori).

Anthropic / Claude — il modello “responsabile e ragionato”

Cosa lo distingue:

  • Fondata nel 2021 da ex-OpenAI con focus su AI safety.
  • Constitutional AI (puntata 217) come paradigma di post-training: principi espliciti, autocorrezione.
  • Reputazione: il modello più “ragionato” e meno sycophant.
  • Forte su long context (200k stabile da Claude 3) e scrittura.

Personalità:

  • Tono misurato, articolato, “intellettuale”.
  • Risposte più lunghe e strutturate rispetto a GPT.
  • Più cauto sui rifiuti — talvolta troppo (over-refusal storico, ridotto dal 2025).

Architettura (note pubbliche):

  • Famiglia Claude 4.7: Opus (top), Sonnet (sweet spot), Haiku (fast/cheap).
  • Parametri non dichiarati.
  • Forte focus su extended thinking (modalità reasoning interna, dal 2025).

Punti forti operativi:

  • Migliore per coding (Claude Code, l’IDE/CLI di Anthropic).
  • Eccellente su scrittura tecnica e creative writing lunga.
  • Long context più affidabile (meno “lost in the middle” rispetto a competitor).
  • Privacy: di default non usa dati utenti per training.

Google / Gemini — il “nativamente multimodale”

Cosa lo distingue:

  • DeepMind (acquisito da Google nel 2014) è la storica leadership scientifica AI (AlphaGo, AlphaFold, Gemini).
  • Multimodalità nativa dal training: testo + immagine + audio + video addestrati insieme, non bolt-on.
  • Long context champion: 1M-2M token standard, esperimenti a 10M.
  • Integrato profondamente con ecosistema Google (Gmail, Drive, Docs, YouTube).

Personalità:

  • Tono pragmatico, factual.
  • Più orientato a “search & retrieval” che a creatività libera.
  • Forte su ricerca con fonti (grounding nativo via Google Search).

Architettura:

  • Gemini 2.5: famiglia Pro / Flash / Flash-Lite.
  • MoE confermato in Gemini Pro.
  • Modello frontier reasoning: Gemini 2.5 Deep Think (2025).

Punti forti operativi:

  • Imbattibile su long context veri (analizzare PDF di 200 pagine, video di un’ora).
  • Apertura ai dataset Google (Search, YouTube transcripts, Maps).
  • Forte su codice (in particolare con Codey/AlphaCode integrazione).
  • Disponibile gratis con quote generose (Gemini in AI Studio).

Gli altri che contano nel 2026

xAI / Grok

  • Posizionamento: “less filtered, more truth-seeking”.
  • Forte integrazione con X (Twitter) per real-time info.
  • Personalità più “casual”, a volte controversa.
  • Grok 3 (2025) competitivo sui benchmark, ma minor adozione enterprise.

DeepSeek (Cina)

  • DeepSeek-V3 / R1: dimostrazione che open-source può competere con frontier USA.
  • 671B parametri MoE (37B attivi). Costi training drasticamente ridotti (~5M$ vs centinaia per i USA, claim controversi).
  • Forte su reasoning e matematica. R1 ha sconvolto i mercati nel gennaio 2025.

Meta / Llama

  • Open-weight champion: Llama 3.1 (405B), Llama 4 (atteso).
  • Standard de-facto per self-hosting e fine-tuning.
  • Personalità “neutra” — base per molti fork community.

Mistral (Francia)

  • Player europeo, focus su modelli efficienti.
  • Mistral Large, Mixtral 8x22B (MoE), Codestral.
  • Forte privacy/sovereign AI per UE.

Alibaba / Qwen

  • Frontier cinese open-source: Qwen 2.5, Qwen 3 (2025).
  • Eccellente su lingue asiatiche, multilingue, coding.

Vedi capitolo 12 (121-130) per il bestiario completo dei modelli.


Confronto su benchmark (snapshot 2026)

Ordini di grandezza tipici, varia per benchmark:

ModelloMMLUHumanEval (code)MATHLong context (NIAH 128k)
GPT-592-9495+95+95-98%
Claude 4.7 Opus90-9395+92-9595-99%
Gemini 2.5 Pro89-9290-9390-9497-99% (a 1M+!)
DeepSeek-R188-9190+95+90-95%
Grok 387-9088-9289-9293-96%
Llama 4 (atteso)85-8987-9185-9090-95%

⚠️ I benchmark misurano una fetta del comportamento. Per il tuo use case specifico, fai sempre eval interno. Vedi puntate 221, 245.


Quale scegliere: la matrice operativa

TaskScelta consigliata 2026
Scrittura creativa, brainstormGPT-5 o Claude 4.7
Codice produzione, refactoringClaude 4.7 (Sonnet/Opus)
Reasoning matematico, scientificoDeepSeek-R1 o o4-mini
Long context (PDF, video)Gemini 2.5 Pro
Search + fonti citatePerplexity (sotto GPT/Claude/sonar)
On-device / privacyLlama 3.x / Qwen 3 / Mistral self-hosted
Lingue asiaticheQwen, DeepSeek
Italiano e dialettiGPT-5, Claude 4.7, Mixtral (decenti); apposito per regional → Minerva (Sapienza), Modello Italia
Voce naturale (parlare)GPT-5 (Realtime API), Gemini Live
Tool use / agentsClaude 4.7 (eccellente function calling)

“Quale è il migliore?”

Domanda mal posta. La risposta dipende da:

  • Cosa devi fare (creativo, tecnico, lungo, multilingua, voice…).
  • Quanto puoi spendere (mini vs frontier: 10-50× differenza).
  • Privacy / dove vivono i dati (USA vs UE vs on-prem).
  • Latenza (Flash/Haiku/mini ~1s, frontier ~5-15s con reasoning).
  • Specifiche di compliance (settore regolato, AI Act).

Pratica matura: multi-model. Usa 2-3 modelli in produzione, routing intelligente per task type. Vedi anche puntata 99 (plan B per l’utente comune).


La “personalità” misurabile

Curiosità: benchmark recenti hanno provato a misurare la personalità dei modelli su scale tipo Big Five. Risultati indicativi:

  • GPT: alta apertura, alta agreeableness, media coscienziosità.
  • Claude: altissima coscienziosità, alta apertura, media agreeableness (più disposto a dissentire).
  • Gemini: media in tutte le scale, leggermente più “fattuale-distaccato”.

Non è scienza esatta, ma il “carattere” emerge dal post-training e si misura.


TEST pratico (10 minuti)

  1. Prendi una richiesta complessa reale del tuo lavoro (es. “Scrivi un piano marketing per il lancio di X, considerando target Y, budget Z”).
  2. Lancia esattamente lo stesso prompt su:
    • ChatGPT (chatgpt.com)
    • Claude (claude.ai)
    • Gemini (gemini.google.com)
  3. Confronta:
    • Lunghezza della risposta
    • Struttura (liste, paragrafi, formattazione)
    • Specificità (concretezza vs genericità)
    • Tono (energico, pacato, professionale)
    • Veridicità verificabile (date, dati, fonti)
  4. Scegli quello che meglio si adatta al tuo stile / casi d’uso.

Lo farai una volta. Ti durerà mesi di scelta consapevole.


Take-away in una riga

Stesse fondamenta architetturali, tre filosofie diverse. La scelta non è “miglior modello in assoluto”, è “miglior matching tra modello e task / contesto / vincoli”.

➡️ Prossima puntata: TEST — traduci un prompt in token, con tool gratis.