Puntata 107
Puntata 107 — I miliardi di parametri
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 10 · Sotto il cofano: cos’è davvero un LLM
7B, 70B, 405B. Numeri che impressionano, ma raramente significano “più intelligente”. Vediamo cosa contano davvero, e perché un modello da 8B può battere uno da 70B nel 2026.
Cosa è un “parametro”
Un parametro è un singolo numero reale (di solito un float a 16 o 32 bit) dentro le matrici che compongono la rete neurale.
Quando dicono “GPT-3 ha 175 miliardi di parametri”, intendono: 175.000.000.000 numeri appresi durante il training, distribuiti in centinaia di matrici di pesi attraverso decine di layer.
Ogni parametro è il risultato di mesi di pretraining su trilioni di token. Insieme, formano la “conoscenza compressa” del modello.
La nomenclatura: 7B, 13B, 70B, 405B
- B = miliardi (Billion in inglese)
- M = milioni (Million)
- T = mille miliardi (Trillion)
I valori più comuni nel 2026:
| Taglia | Tipici modelli | Uso pratico |
|---|---|---|
| < 1B | Phi-3-mini, TinyLlama, mobile models | On-device, edge |
| 1B-3B | Phi-3.5, Gemma 2B, Llama 3.2 3B | Smartphone, browser |
| 7B-9B | Llama 3.1 8B, Mistral 7B, Qwen 7B, Gemma 9B | Sweet spot consumer/laptop |
| 13B-30B | Mistral, Qwen 14B, modelli intermedi | Server piccolo |
| 70B-72B | Llama 3 70B, Qwen 72B, DeepSeek 67B | Cluster GPU, enterprise |
| 400B+ | Llama 3.1 405B, DeepSeek-V3 (671B MoE) | Frontier open-source |
| non dichiarati (centinaia di B-T) | GPT-5, Claude 4.7, Gemini 2.5 Pro | Frontier closed-source |
Quanto VRAM serve
Una regola pratica per calcolare la memoria GPU richiesta:
VRAM (GB) ≈ params (in B) × bytes_per_param × 1.2 (overhead)
Esempi (inference, batch=1):
| Modello | FP16 (2 byte/param) | INT8 (1 byte) | INT4 (0.5 byte) |
|---|---|---|---|
| 7B | ~16 GB | ~8 GB | ~4 GB |
| 13B | ~30 GB | ~15 GB | ~8 GB |
| 70B | ~160 GB | ~80 GB | ~40 GB |
| 405B | ~900 GB | ~450 GB | ~230 GB |
Per training: moltiplica per ~6-10 (gradienti, optimizer states, attivazioni).
Conseguenza: un 70B in FP16 non gira su una singola GPU consumer (RTX 4090 ha 24 GB). Servono multi-GPU o quantization aggressiva (puntata 227).
Più parametri = più intelligente? Sì, ma…
Sì nel senso che, a parità di tutto il resto (dati, training, architettura), un modello più grande performa meglio sui benchmark. È la scaling law (Kaplan 2020, Chinchilla 2022 — vedi puntata 282).
Ma: il “tutto il resto” raramente è uguale. Variabili che contano almeno quanto i parametri:
1. Dati di training (quantità + qualità)
Un 8B addestrato su 15T token può battere un 70B addestrato su 1T. È la lezione di Llama 3 (Meta) e dell’effetto Chinchilla (DeepMind, 2022): la maggior parte dei modelli pre-2022 erano sotto-addestrati.
2. Post-training (SFT + RLHF + tool use)
Un 7B con RLHF eccellente + tool use + reasoning può risolvere problemi reali meglio di un 70B base. Vedi puntate 215-217.
3. Architettura
Mixture of Experts (MoE — puntata 204) ha cambiato le carte. DeepSeek-V3 ha 671B parametri totali ma ne attiva solo 37B per token: prestazioni da 200B+ dense, costo da 37B. Molti modelli frontier nel 2026 sono MoE.
4. Reasoning / inference-time compute
Un modello 30B con thinking mode esteso può battere un 200B base che risponde “di getto”. È il test-time scaling (puntata 267-268).
Conclusione: nel 2026, conta lo stack intero, non solo i parametri.
La fine dei “params race”?
Tra 2020 e 2024, il numero di parametri è stato il punto di vanto dei provider. Dal 2024-25, il vento è cambiato:
- OpenAI non dichiara più i parametri (sospetto: GPT-4 ~1.7T MoE, GPT-5 stima ~3T-5T).
- Anthropic non dichiara i parametri di Claude.
- Google dichiara solo “dense vs MoE”, non i numeri.
- xAI Grok 3: non specificato.
Perché?
- Strategia competitiva (non rivelare numeri al concorrente).
- Marketing: la metrica “parametri” non vende più, conta performance + prezzo.
- MoE complica il confronto: 671B totali con 37B attivi è più o meno potente di 300B dense?
I modelli open-source invece dichiarano sempre i parametri — è una loro nota di trasparenza (Llama, Mistral, Qwen, DeepSeek, Gemma…).
Il sweet spot del 2026
Per la maggior parte degli use case business (non R&D di frontiera):
- Modelli “mini/flash/haiku” (~3B-8B equivalente): risolvono il 70% dei task con costo 10x più basso.
- Modelli “standard” (~30B-70B): risolvono il 90% dei task con buon equilibrio.
- Modelli “frontier” (200B+ o MoE 600B+): per problemi davvero difficili, ragionamento complesso, casi marginali.
Architettura tipica produzione: cascading — modello piccolo per task semplici, escalation a modello grosso solo per i casi che il piccolo “non sa”. Risparmio massivo, qualità invariata. Vedi puntata 296.
I modelli “mini” del 2026 sono potentissimi
Un dato che fa riflettere:
| Modello | Anno | MMLU |
|---|---|---|
| GPT-3 175B | 2020 | 43.9 |
| GPT-4 base ~1.7T | 2023 | 86.4 |
| Phi-3-mini 3.8B | 2024 | 68.8 |
| Llama 3.1 8B | 2024 | 73.0 |
| GPT-5 mini | 2025 | ~85 |
| GPT-5 | 2025 | ~92 |
Un modello da 3.8B nel 2024 batte un 175B del 2020. Più di 40x meno parametri, qualità superiore. Distillation, dati migliori, architetture migliori, training tricks.
Lezione: non scegliere il modello dai parametri. Guarda benchmark, prezzo, latenza, qualità sul tuo task specifico.
Quantization: dimezzare i parametri (quasi gratis)
I parametri sono numeri float — spesso a 16 bit (FP16) o 32 bit (FP32). Quantizzare = ridurre la precisione:
| Precisione | Bit/param | VRAM relativa | Qualità persa |
|---|---|---|---|
| FP32 | 32 | 100% | 0 (baseline) |
| FP16 / BF16 | 16 | 50% | ~0% |
| FP8 | 8 | 25% | trascurabile |
| INT8 | 8 | 25% | ~1-3% |
| INT4 (GPTQ, AWQ, GGUF) | 4 | 12.5% | ~5-15% (variabile) |
Quindi un Llama 3 70B a INT4 sta in ~35-40 GB → gira su una RTX 3090 (24 GB) con offload, o due GPU consumer. Vedi puntata 227.
TEST pratico (5 minuti)
- Apri ollama.com (gratis, open-source). Scarica un modello piccolo:
ollama pull llama3.2:3b(3B, ~2 GB su disco). - Fa una domanda complessa: “Spiega in 5 righe la differenza tra capitalismo e socialismo, con un esempio storico per ognuno.”
- Confronta la risposta con GPT-5 o Claude 4.7 sullo stesso prompt.
- Domande:
- Il 3B locale fa il task? Sì o no?
- Quanto è peggio in qualità?
- Se 80% del task è fatto in locale (gratis, privato), vale la pena ottimizzare invece di pagare cloud?
Per molti business reali, la risposta è “sì”.
Take-away in una riga
I parametri sono il “peso” del modello, non il suo QI. Nel 2026 conta lo stack intero: dati, post-training, architettura, inference-time compute. Un 8B ben fatto batte un 70B mediocre.
➡️ Prossima puntata: Perché allucina — la causa profonda.