Puntata 221
Puntata 221 — Evaluation
Livello: 🧙 Maestro Yoda · Capitolo 20 · Training, fine-tuning, allineamento
“Quale modello è meglio?” sembra una domanda da bar. È invece una scienza fragile, piena di benchmark scaduti, classifiche manipolabili, e la realtà secondo cui anche i ricercatori spesso non sanno bene cosa stanno misurando.
Perché valutare un LLM è un casino
Tre difficoltà strutturali:
- Output free-form: non puoi fare accuracy semplice come in image classification. “Quanto è buona questa frase?” non è una domanda chiusa.
- Benchmark contamination: i benchmark sono pubblici → finiscono nel training data → i modelli “ricordano” invece di “ragionare”.
- Multidimensional capability: un modello può essere ottimo in coding e scarso in scrittura creativa. Quale metrica “totale” usare?
Risultato: nel 2026 esistono centinaia di benchmark, classifiche che si contraddicono, e tanta confusione su “qual è il modello migliore”. Spoiler: dipende.
I benchmark storici (la base)
MMLU (Massive Multitask Language Understanding, Hendrycks et al., 2020)
57 task multiple-choice di conoscenza/reasoning: STEM, humanities, social sciences, law, medicine, ecc. ~15k domande.
Per anni il “benchmark di riferimento” per knowledge LLM. Modelli che vanno >85% sono al livello expert.
Stato 2026: MMLU è ormai saturated. Tutti i modelli frontier sono >87%. Limitato uso, mantenuto per continuità storica.
MMLU-Pro
Versione più difficile (Wang et al., 2024). 10 opzioni invece di 4, domande più articolate. ~12k domande. Differenzia ancora meglio i modelli di frontiera (oggi i top stanno al 75-85%).
GSM8K
Grade School Math: ~8k problemi di matematica scolastica. Era un benchmark stand-out nel 2022. Saturated dal 2024 (modelli reasoning >95%).
HumanEval, MBPP
Programmazione Python. ~164 e ~970 problemi rispettivamente. Storici, saturated. Sostituiti da SWE-bench, LiveCodeBench.
TruthfulQA
~800 domande progettate per indurre confabulation. Misura honesty / no-hallucination.
BIG-Bench, BBH
Suite con centinaia di task. Hard subset (BBH) usato come hard benchmark.
HellaSwag, ARC, WinoGrande, BoolQ
Reasoning di senso comune. Saturated. Storici.
Benchmark moderni (2024-26)
Tutto quello che è saturato è stato sostituito. Stato dell’arte di valutazione:
Per reasoning
- AIME 2024/2025 (American Invitational Mathematics Examination): ~30 problemi/anno. Hard. AIME 2024: i top model arrivano a 80-90%.
- MATH (Hendrycks et al.): competizione math, ancora hard.
- GPQA (Graduate Physics Q&A, Rein et al., 2023): “Google-proof” questions, PhD-level. Stato dell’arte ~75-85% per top model.
- HumanityLastExam (2025): ~3k domande create da esperti su 100+ campi. Designed to be unsolvable now.
Per coding
- SWE-bench (Jimenez et al., 2024): GitHub issues reali, fixed PR come ground truth. Hard agentic task. Top model: ~70-80% nel 2026.
- LiveCodeBench: problemi LeetCode aggiornati frequentemente per evitare contamination.
- BigCodeBench: 1140 problemi cross-language.
Per long context
- RULER (Hsieh et al., 2024): 13 task di long-context con difficoltà variabile.
- NIAH (Needle In A Haystack): trova “ago” in context da 1k a 1M token. Saturated per top model.
- LongBench, ZeroSCROLLS: suite per long-doc tasks.
Per agentic
- WebArena (Carnegie Mellon, 2023): naviga il web e completa task.
- SWE-Bench-Verified: subset SWE-bench con verifica umana.
- AgentBench, OSWorld: computer use, multi-step.
Per chat e creatività
- MT-Bench: 80 prompt multi-turn, judged da GPT-4. Storico, criticato.
- Arena-Hard (LMSYS): selected from arena, harder than MT-Bench.
- AlpacaEval 2.0: LLM-as-judge automated.
Chatbot Arena: il giudice popolare
LMSYS Chatbot Arena (chat.lmsys.org, ora lmarena.ai).
Pattern: un utente fa una domanda, vede risposte di due modelli random anonimi, vota quella che preferisce. Dopo milioni di battle, si calcola un Elo rating per ogni modello.
Pros:
- Riflette preferenze utente reali.
- Difficile da gameare (gli utenti generano i prompt).
- Aggiornato continuamente.
Cons:
- Bias verso modelli chatty, lunghi, formattati.
- Gli utenti sono ricercatori AI, non popolazione generale: bias di pubblico.
- Non testa le capability hard: ottimo per “quale chat suona meglio”, scarso per “quale risolve math”.
Nel 2026 è considerato una metrica chiave, ma non l’unica. Modelli che vincono Arena ma flop su benchmark hard vengono guardati con sospetto.
LLM-as-Judge
Pattern: usi un LLM forte (es. GPT-4) per giudicare le risposte di altri modelli. Dato un prompt e due risposte, scegli la migliore o assegna un punteggio.
Pros:
- Scalabile, automatico.
- Buona correlazione con giudizio umano (>80% in molti benchmark).
Cons:
- Bias verso il proprio output: GPT-4 tende a preferire risposte simili al proprio style.
- Position bias: tende a preferire la prima risposta vista. Si mitiga randomizzando l’ordine.
- Length bias: preferisce risposte più lunghe.
- Costo: $$ per migliaia di giudizi.
Soluzioni:
- Judge ensemble: usa più LLM judges, media.
- Calibration sets: confronta judge contro gold human labels prima di usarlo.
- Auto-J, PandaLM, Prometheus: judge specifici addestrati per giudizio.
Il problema della contamination
Quasi tutti i benchmark sono pubblici. Quasi tutti i lab dichiarano di “decontaminare” il training data (rimuovere paragrafi che appaiono nei benchmark). Quasi nessuno lo fa in modo perfetto.
Risultato: molti modelli “ricordano” parti dei benchmark, e i risultati sono inflated.
Soluzioni:
- Benchmark live (aggiornati frequentemente): LiveBench, LiveCodeBench. Devono essere ri-pubblicati ogni mese per restare freschi.
- Hidden test sets: i benchmark veri non sono pubblici, solo i metric calcolati dal team. Costoso.
- Statistical tests of memorization: studi che misurano memorization vs reasoning (es. variando wording di domande GSM8K).
Stato 2026: la contamination è stato di fatto e la community accetta una certa fragility delle metriche pubbliche.
LiveBench
Lanciato da Yann LeCun e team (2024). Idea: benchmark che cambia ogni mese.
- 18 task: math, reasoning, coding, language, instruction following, data analysis.
- Domande riformulate o sostituite mensilmente per evitare contamination.
- Public leaderboard.
Considerato dal 2024-26 una delle valutazioni più honest e contamination-resistant. Sito: livebench.ai.
Holistic evaluation: oltre il singolo numero
Tendenza moderna: invece di un singolo score, profilo multidimensionale.
Suite popolari:
- HELM (Stanford CRFM): 30+ metric su 16+ scenari.
- OpenLLM Leaderboard v2 (HuggingFace): 6 benchmark hard (MMLU-Pro, GPQA, MUSR, MATH, IFEval, BBH).
- Open LMM Leaderboard: per multimodali.
Pro: evita di “ottimizzare per un solo numero”. Contro: difficile da comunicare a non-tecnici.
Benchmark in italiano (e in altre lingue minori)
Sottovalutati e poco curati. Inizativa interessante:
- ItaEval (paper italiano 2024): suite di benchmark italiani.
- MMLU translated: versioni MMLU in italiano (CALAMITA, ItaCSV).
- Belebele: lettura su 122 lingue, incluse italiano.
- Squad-it, NewsQA-it: classici NLP italiani.
Per modelli destinati al mercato italiano: testa anche su questi, non solo su inglese. La performance può scendere del 10-20% in italiano vs inglese su molti modelli.
Quale metrica usare in pratica
A seconda dello scenario:
Stai facendo ricerca su un nuovo modello base: MMLU-Pro, GPQA, MATH, HumanEval, IFEval, LiveBench. Pubblica tutto. Trasparenza.
Stai scegliendo un modello per un’app: testalo sul tuo task specifico. Crea 50-100 esempi rappresentativi, usa LLM-as-judge (calibrato contro tua preferenza) o annotation umana. I benchmark pubblici sono una guida iniziale, non il verdetto finale.
Stai fine-tunando per un task: confronta il tuo modello custom contro il base e contro la baseline (es. GPT-4) su un test set tuo, decontaminato dal tuo training set.
Stai esplorando “quale modello suona meglio”: Chatbot Arena ha la sua utilità come segnale generale, ma testa anche tu.
Glossario lampo
- Saturation — quando tutti i modelli top sono >90%, il benchmark non distingue più.
- Contamination — paragrafi del benchmark presenti nel training data del modello.
- LLM-as-Judge — uso di un LLM per giudicare output di altri LLM.
- Elo rating — sistema dagli scacchi per ranking basato su confronti pair-wise.
- Holistic eval — valutazione multi-metrica invece di un singolo score.
TEST hands-on
- Vai su
lmarena.aie fai 20 battle. Quanto le tue preferenze coincidono con il top del leaderboard? - Apri Open LLM Leaderboard (HuggingFace). Scegli 3 modelli con MMLU simile ma ranks diversi. Apri i loro score component-by-component. Vedi su quali benchmark divergono.
- Crea un mini-benchmark tuo: 30 prompt rappresentativi del tuo use case + risposte ideali (annotate da te). Misura 4-5 modelli candidati. Aspetta divergence rispetto ai benchmark pubblici.
- Bonus: scegli un modello, prova un benchmark “live” (LiveBench, Aider Polyglot, SWE-bench Verified). Verifica che lo score corrisponda al claimed in leaderboard.
Take-away
Nessun benchmark misura “l’intelligenza” di un LLM. Ogni metrica cattura un aspetto, ogni leaderboard riflette un’opinione metodologica, ogni “vincitore” è vincitore in qualcosa di specifico. La regola del 2026: fidati del tuo test set, costruisci una valutazione che assomigli al tuo problema, e usa i benchmark pubblici come segnale, non come verdetto.
➡️ Prossima puntata: TEST — LoRA fine-tuning su Colab gratis. Hands-on completo.