✔️✔️ Doppie Spunte Blu Cap. 10 · Sotto il cofano: cos'è davvero un LLM

Puntata 107

Puntata 107 — I miliardi di parametri

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 10 · Sotto il cofano: cos’è davvero un LLM

7B, 70B, 405B. Numeri che impressionano, ma raramente significano “più intelligente”. Vediamo cosa contano davvero, e perché un modello da 8B può battere uno da 70B nel 2026.

tre cassetti aperti — uno piccolo (7B), uno medio (70B), uno enorme (405B) — con dentro file ben organizzati di numeri. Sotto, una bilancia che pesa “qualità” e “costo”: il piccolo a volte è più alto

Cosa è un “parametro”

Un parametro è un singolo numero reale (di solito un float a 16 o 32 bit) dentro le matrici che compongono la rete neurale.

Quando dicono “GPT-3 ha 175 miliardi di parametri”, intendono: 175.000.000.000 numeri appresi durante il training, distribuiti in centinaia di matrici di pesi attraverso decine di layer.

Ogni parametro è il risultato di mesi di pretraining su trilioni di token. Insieme, formano la “conoscenza compressa” del modello.


La nomenclatura: 7B, 13B, 70B, 405B

  • B = miliardi (Billion in inglese)
  • M = milioni (Million)
  • T = mille miliardi (Trillion)

I valori più comuni nel 2026:

TagliaTipici modelliUso pratico
< 1BPhi-3-mini, TinyLlama, mobile modelsOn-device, edge
1B-3BPhi-3.5, Gemma 2B, Llama 3.2 3BSmartphone, browser
7B-9BLlama 3.1 8B, Mistral 7B, Qwen 7B, Gemma 9BSweet spot consumer/laptop
13B-30BMistral, Qwen 14B, modelli intermediServer piccolo
70B-72BLlama 3 70B, Qwen 72B, DeepSeek 67BCluster GPU, enterprise
400B+Llama 3.1 405B, DeepSeek-V3 (671B MoE)Frontier open-source
non dichiarati (centinaia di B-T)GPT-5, Claude 4.7, Gemini 2.5 ProFrontier closed-source

Quanto VRAM serve

Una regola pratica per calcolare la memoria GPU richiesta:

VRAM (GB) ≈ params (in B) × bytes_per_param × 1.2 (overhead)

Esempi (inference, batch=1):

ModelloFP16 (2 byte/param)INT8 (1 byte)INT4 (0.5 byte)
7B~16 GB~8 GB~4 GB
13B~30 GB~15 GB~8 GB
70B~160 GB~80 GB~40 GB
405B~900 GB~450 GB~230 GB

Per training: moltiplica per ~6-10 (gradienti, optimizer states, attivazioni).

Conseguenza: un 70B in FP16 non gira su una singola GPU consumer (RTX 4090 ha 24 GB). Servono multi-GPU o quantization aggressiva (puntata 227).


Più parametri = più intelligente? Sì, ma…

nel senso che, a parità di tutto il resto (dati, training, architettura), un modello più grande performa meglio sui benchmark. È la scaling law (Kaplan 2020, Chinchilla 2022 — vedi puntata 282).

Ma: il “tutto il resto” raramente è uguale. Variabili che contano almeno quanto i parametri:

1. Dati di training (quantità + qualità)

Un 8B addestrato su 15T token può battere un 70B addestrato su 1T. È la lezione di Llama 3 (Meta) e dell’effetto Chinchilla (DeepMind, 2022): la maggior parte dei modelli pre-2022 erano sotto-addestrati.

2. Post-training (SFT + RLHF + tool use)

Un 7B con RLHF eccellente + tool use + reasoning può risolvere problemi reali meglio di un 70B base. Vedi puntate 215-217.

3. Architettura

Mixture of Experts (MoE — puntata 204) ha cambiato le carte. DeepSeek-V3 ha 671B parametri totali ma ne attiva solo 37B per token: prestazioni da 200B+ dense, costo da 37B. Molti modelli frontier nel 2026 sono MoE.

4. Reasoning / inference-time compute

Un modello 30B con thinking mode esteso può battere un 200B base che risponde “di getto”. È il test-time scaling (puntata 267-268).

Conclusione: nel 2026, conta lo stack intero, non solo i parametri.


La fine dei “params race”?

Tra 2020 e 2024, il numero di parametri è stato il punto di vanto dei provider. Dal 2024-25, il vento è cambiato:

  • OpenAI non dichiara più i parametri (sospetto: GPT-4 ~1.7T MoE, GPT-5 stima ~3T-5T).
  • Anthropic non dichiara i parametri di Claude.
  • Google dichiara solo “dense vs MoE”, non i numeri.
  • xAI Grok 3: non specificato.

Perché?

  1. Strategia competitiva (non rivelare numeri al concorrente).
  2. Marketing: la metrica “parametri” non vende più, conta performance + prezzo.
  3. MoE complica il confronto: 671B totali con 37B attivi è più o meno potente di 300B dense?

I modelli open-source invece dichiarano sempre i parametri — è una loro nota di trasparenza (Llama, Mistral, Qwen, DeepSeek, Gemma…).


Il sweet spot del 2026

Per la maggior parte degli use case business (non R&D di frontiera):

  • Modelli “mini/flash/haiku” (~3B-8B equivalente): risolvono il 70% dei task con costo 10x più basso.
  • Modelli “standard” (~30B-70B): risolvono il 90% dei task con buon equilibrio.
  • Modelli “frontier” (200B+ o MoE 600B+): per problemi davvero difficili, ragionamento complesso, casi marginali.

Architettura tipica produzione: cascading — modello piccolo per task semplici, escalation a modello grosso solo per i casi che il piccolo “non sa”. Risparmio massivo, qualità invariata. Vedi puntata 296.


I modelli “mini” del 2026 sono potentissimi

Un dato che fa riflettere:

ModelloAnnoMMLU
GPT-3 175B202043.9
GPT-4 base ~1.7T202386.4
Phi-3-mini 3.8B202468.8
Llama 3.1 8B202473.0
GPT-5 mini2025~85
GPT-52025~92

Un modello da 3.8B nel 2024 batte un 175B del 2020. Più di 40x meno parametri, qualità superiore. Distillation, dati migliori, architetture migliori, training tricks.

Lezione: non scegliere il modello dai parametri. Guarda benchmark, prezzo, latenza, qualità sul tuo task specifico.


Quantization: dimezzare i parametri (quasi gratis)

I parametri sono numeri float — spesso a 16 bit (FP16) o 32 bit (FP32). Quantizzare = ridurre la precisione:

PrecisioneBit/paramVRAM relativaQualità persa
FP3232100%0 (baseline)
FP16 / BF161650%~0%
FP8825%trascurabile
INT8825%~1-3%
INT4 (GPTQ, AWQ, GGUF)412.5%~5-15% (variabile)

Quindi un Llama 3 70B a INT4 sta in ~35-40 GB → gira su una RTX 3090 (24 GB) con offload, o due GPU consumer. Vedi puntata 227.


TEST pratico (5 minuti)

  1. Apri ollama.com (gratis, open-source). Scarica un modello piccolo: ollama pull llama3.2:3b (3B, ~2 GB su disco).
  2. Fa una domanda complessa: “Spiega in 5 righe la differenza tra capitalismo e socialismo, con un esempio storico per ognuno.”
  3. Confronta la risposta con GPT-5 o Claude 4.7 sullo stesso prompt.
  4. Domande:
    • Il 3B locale fa il task? Sì o no?
    • Quanto è peggio in qualità?
    • Se 80% del task è fatto in locale (gratis, privato), vale la pena ottimizzare invece di pagare cloud?

Per molti business reali, la risposta è “sì”.


Take-away in una riga

I parametri sono il “peso” del modello, non il suo QI. Nel 2026 conta lo stack intero: dati, post-training, architettura, inference-time compute. Un 8B ben fatto batte un 70B mediocre.

➡️ Prossima puntata: Perché allucina — la causa profonda.