🧙 Maestro Yoda Cap. 20 · Training, fine-tuning, allineamento

Puntata 221

Puntata 221 — Evaluation

Livello: 🧙 Maestro Yoda · Capitolo 20 · Training, fine-tuning, allineamento

“Quale modello è meglio?” sembra una domanda da bar. È invece una scienza fragile, piena di benchmark scaduti, classifiche manipolabili, e la realtà secondo cui anche i ricercatori spesso non sanno bene cosa stanno misurando.

una pista di atletica con 10 corsie. In ogni corsia un modello diverso, ognuno con un cartello che dice il suo benchmark vincente: “io campione di MMLU”, “io di HumanEval”, “io di Chatbot Arena”. Sotto: “lo stadio dei vincitori particolari”

Perché valutare un LLM è un casino

Tre difficoltà strutturali:

  1. Output free-form: non puoi fare accuracy semplice come in image classification. “Quanto è buona questa frase?” non è una domanda chiusa.
  2. Benchmark contamination: i benchmark sono pubblici → finiscono nel training data → i modelli “ricordano” invece di “ragionare”.
  3. Multidimensional capability: un modello può essere ottimo in coding e scarso in scrittura creativa. Quale metrica “totale” usare?

Risultato: nel 2026 esistono centinaia di benchmark, classifiche che si contraddicono, e tanta confusione su “qual è il modello migliore”. Spoiler: dipende.


I benchmark storici (la base)

MMLU (Massive Multitask Language Understanding, Hendrycks et al., 2020)

57 task multiple-choice di conoscenza/reasoning: STEM, humanities, social sciences, law, medicine, ecc. ~15k domande.

Per anni il “benchmark di riferimento” per knowledge LLM. Modelli che vanno >85% sono al livello expert.

Stato 2026: MMLU è ormai saturated. Tutti i modelli frontier sono >87%. Limitato uso, mantenuto per continuità storica.

MMLU-Pro

Versione più difficile (Wang et al., 2024). 10 opzioni invece di 4, domande più articolate. ~12k domande. Differenzia ancora meglio i modelli di frontiera (oggi i top stanno al 75-85%).

GSM8K

Grade School Math: ~8k problemi di matematica scolastica. Era un benchmark stand-out nel 2022. Saturated dal 2024 (modelli reasoning >95%).

HumanEval, MBPP

Programmazione Python. ~164 e ~970 problemi rispettivamente. Storici, saturated. Sostituiti da SWE-bench, LiveCodeBench.

TruthfulQA

~800 domande progettate per indurre confabulation. Misura honesty / no-hallucination.

BIG-Bench, BBH

Suite con centinaia di task. Hard subset (BBH) usato come hard benchmark.

HellaSwag, ARC, WinoGrande, BoolQ

Reasoning di senso comune. Saturated. Storici.


Benchmark moderni (2024-26)

Tutto quello che è saturato è stato sostituito. Stato dell’arte di valutazione:

Per reasoning

  • AIME 2024/2025 (American Invitational Mathematics Examination): ~30 problemi/anno. Hard. AIME 2024: i top model arrivano a 80-90%.
  • MATH (Hendrycks et al.): competizione math, ancora hard.
  • GPQA (Graduate Physics Q&A, Rein et al., 2023): “Google-proof” questions, PhD-level. Stato dell’arte ~75-85% per top model.
  • HumanityLastExam (2025): ~3k domande create da esperti su 100+ campi. Designed to be unsolvable now.

Per coding

  • SWE-bench (Jimenez et al., 2024): GitHub issues reali, fixed PR come ground truth. Hard agentic task. Top model: ~70-80% nel 2026.
  • LiveCodeBench: problemi LeetCode aggiornati frequentemente per evitare contamination.
  • BigCodeBench: 1140 problemi cross-language.

Per long context

  • RULER (Hsieh et al., 2024): 13 task di long-context con difficoltà variabile.
  • NIAH (Needle In A Haystack): trova “ago” in context da 1k a 1M token. Saturated per top model.
  • LongBench, ZeroSCROLLS: suite per long-doc tasks.

Per agentic

  • WebArena (Carnegie Mellon, 2023): naviga il web e completa task.
  • SWE-Bench-Verified: subset SWE-bench con verifica umana.
  • AgentBench, OSWorld: computer use, multi-step.

Per chat e creatività

  • MT-Bench: 80 prompt multi-turn, judged da GPT-4. Storico, criticato.
  • Arena-Hard (LMSYS): selected from arena, harder than MT-Bench.
  • AlpacaEval 2.0: LLM-as-judge automated.

Chatbot Arena: il giudice popolare

LMSYS Chatbot Arena (chat.lmsys.org, ora lmarena.ai).

Pattern: un utente fa una domanda, vede risposte di due modelli random anonimi, vota quella che preferisce. Dopo milioni di battle, si calcola un Elo rating per ogni modello.

Pros:

  • Riflette preferenze utente reali.
  • Difficile da gameare (gli utenti generano i prompt).
  • Aggiornato continuamente.

Cons:

  • Bias verso modelli chatty, lunghi, formattati.
  • Gli utenti sono ricercatori AI, non popolazione generale: bias di pubblico.
  • Non testa le capability hard: ottimo per “quale chat suona meglio”, scarso per “quale risolve math”.

Nel 2026 è considerato una metrica chiave, ma non l’unica. Modelli che vincono Arena ma flop su benchmark hard vengono guardati con sospetto.


LLM-as-Judge

Pattern: usi un LLM forte (es. GPT-4) per giudicare le risposte di altri modelli. Dato un prompt e due risposte, scegli la migliore o assegna un punteggio.

Pros:

  • Scalabile, automatico.
  • Buona correlazione con giudizio umano (>80% in molti benchmark).

Cons:

  • Bias verso il proprio output: GPT-4 tende a preferire risposte simili al proprio style.
  • Position bias: tende a preferire la prima risposta vista. Si mitiga randomizzando l’ordine.
  • Length bias: preferisce risposte più lunghe.
  • Costo: $$ per migliaia di giudizi.

Soluzioni:

  • Judge ensemble: usa più LLM judges, media.
  • Calibration sets: confronta judge contro gold human labels prima di usarlo.
  • Auto-J, PandaLM, Prometheus: judge specifici addestrati per giudizio.

Il problema della contamination

Quasi tutti i benchmark sono pubblici. Quasi tutti i lab dichiarano di “decontaminare” il training data (rimuovere paragrafi che appaiono nei benchmark). Quasi nessuno lo fa in modo perfetto.

Risultato: molti modelli “ricordano” parti dei benchmark, e i risultati sono inflated.

Soluzioni:

  1. Benchmark live (aggiornati frequentemente): LiveBench, LiveCodeBench. Devono essere ri-pubblicati ogni mese per restare freschi.
  2. Hidden test sets: i benchmark veri non sono pubblici, solo i metric calcolati dal team. Costoso.
  3. Statistical tests of memorization: studi che misurano memorization vs reasoning (es. variando wording di domande GSM8K).

Stato 2026: la contamination è stato di fatto e la community accetta una certa fragility delle metriche pubbliche.


LiveBench

Lanciato da Yann LeCun e team (2024). Idea: benchmark che cambia ogni mese.

  • 18 task: math, reasoning, coding, language, instruction following, data analysis.
  • Domande riformulate o sostituite mensilmente per evitare contamination.
  • Public leaderboard.

Considerato dal 2024-26 una delle valutazioni più honest e contamination-resistant. Sito: livebench.ai.


Holistic evaluation: oltre il singolo numero

Tendenza moderna: invece di un singolo score, profilo multidimensionale.

Suite popolari:

  • HELM (Stanford CRFM): 30+ metric su 16+ scenari.
  • OpenLLM Leaderboard v2 (HuggingFace): 6 benchmark hard (MMLU-Pro, GPQA, MUSR, MATH, IFEval, BBH).
  • Open LMM Leaderboard: per multimodali.

Pro: evita di “ottimizzare per un solo numero”. Contro: difficile da comunicare a non-tecnici.


Benchmark in italiano (e in altre lingue minori)

Sottovalutati e poco curati. Inizativa interessante:

  • ItaEval (paper italiano 2024): suite di benchmark italiani.
  • MMLU translated: versioni MMLU in italiano (CALAMITA, ItaCSV).
  • Belebele: lettura su 122 lingue, incluse italiano.
  • Squad-it, NewsQA-it: classici NLP italiani.

Per modelli destinati al mercato italiano: testa anche su questi, non solo su inglese. La performance può scendere del 10-20% in italiano vs inglese su molti modelli.


Quale metrica usare in pratica

A seconda dello scenario:

Stai facendo ricerca su un nuovo modello base: MMLU-Pro, GPQA, MATH, HumanEval, IFEval, LiveBench. Pubblica tutto. Trasparenza.

Stai scegliendo un modello per un’app: testalo sul tuo task specifico. Crea 50-100 esempi rappresentativi, usa LLM-as-judge (calibrato contro tua preferenza) o annotation umana. I benchmark pubblici sono una guida iniziale, non il verdetto finale.

Stai fine-tunando per un task: confronta il tuo modello custom contro il base e contro la baseline (es. GPT-4) su un test set tuo, decontaminato dal tuo training set.

Stai esplorando “quale modello suona meglio”: Chatbot Arena ha la sua utilità come segnale generale, ma testa anche tu.


Glossario lampo

  • Saturation — quando tutti i modelli top sono >90%, il benchmark non distingue più.
  • Contamination — paragrafi del benchmark presenti nel training data del modello.
  • LLM-as-Judge — uso di un LLM per giudicare output di altri LLM.
  • Elo rating — sistema dagli scacchi per ranking basato su confronti pair-wise.
  • Holistic eval — valutazione multi-metrica invece di un singolo score.

TEST hands-on

  1. Vai su lmarena.ai e fai 20 battle. Quanto le tue preferenze coincidono con il top del leaderboard?
  2. Apri Open LLM Leaderboard (HuggingFace). Scegli 3 modelli con MMLU simile ma ranks diversi. Apri i loro score component-by-component. Vedi su quali benchmark divergono.
  3. Crea un mini-benchmark tuo: 30 prompt rappresentativi del tuo use case + risposte ideali (annotate da te). Misura 4-5 modelli candidati. Aspetta divergence rispetto ai benchmark pubblici.
  4. Bonus: scegli un modello, prova un benchmark “live” (LiveBench, Aider Polyglot, SWE-bench Verified). Verifica che lo score corrisponda al claimed in leaderboard.

Take-away

Nessun benchmark misura “l’intelligenza” di un LLM. Ogni metrica cattura un aspetto, ogni leaderboard riflette un’opinione metodologica, ogni “vincitore” è vincitore in qualcosa di specifico. La regola del 2026: fidati del tuo test set, costruisci una valutazione che assomigli al tuo problema, e usa i benchmark pubblici come segnale, non come verdetto.


➡️ Prossima puntata: TEST — LoRA fine-tuning su Colab gratis. Hands-on completo.