🧙 Maestro Yoda Cap. 20 · Training, fine-tuning, allineamento

Puntata 219

Puntata 219 — Distillation

Livello: 🧙 Maestro Yoda · Capitolo 20 · Training, fine-tuning, allineamento

“Modello grande sa, modello piccolo impara dal modello grande”. Sembra una catena gerarchica medievale. È esattamente quello che succede.

un professore (modello grande) che spiega a uno studente (modello piccolo). Il professore non gli da la risposta esatta, ma una distribuzione di probabilità su tutte le possibili risposte. Lo studente prende appunti meticolosamente. Tag: “soft labels: la differenza fra ricordare e capire”

Il problema: i modelli buoni sono troppo grandi

Hai un GPT-4 che risolve i tuoi problemi. Ma:

  • Costa $$$ per query.
  • Latenza alta (TTFT diversi secondi).
  • Non puoi eseguirlo on-device o on-premise.
  • Volume in scala (100k+ query/min) ti rovina.

Vorresti un modello da 1-7B che faccia “abbastanza bene” il task specifico, e ti costi 50-100× meno.

Knowledge distillation: addestrare un modello “studente” piccolo a imitare un modello “teacher” grande.


Le tre forme di distillazione

1. Soft-label distillation (Hinton et al., 2015)

La forma “classica”. Il teacher non solo dà la risposta corretta, ma una distribuzione di probabilità su tutte le possibili risposte. Lo studente impara su questa distribuzione, più ricca di una hard label.

Per LLM con classificazione token-by-token:

L_distill = KL( softmax(z_student/T) || softmax(z_teacher/T) )

T (temperatura) è iperparametro: alto → distribuzione più smooth, più info trasferita.

Spesso si mescola con la loss “vera” sui label di pretraining:

L_total = α · L_distill + (1-α) · L_pretraining

Vantaggio: lo studente “vede” perché il teacher ha scelto quel token vs altri. Le “soft labels” rivelano la geometria della distribuzione.

Costoso in pratica: serve far girare il teacher su tutti gli esempi di training del student. Per modelli grandi diventa proibitivo.

2. Black-box / Response distillation

Forma più pragmatica e dominante nel 2024-2026.

  • Genera con il teacher (es. GPT-4, Claude Opus) un dataset di risposte su un set di prompt.
  • Addestra lo studente con SFT standard su questo dataset.

Niente accesso ai logit interni del teacher. Solo l’output testuale. Pragmatico, economico (se il teacher è API-accessible), funziona benissimo.

È il pattern dietro Alpaca, Vicuna, WizardLM, Orca, e infinite famiglie di “GPT-4-distilled models”.

Limite: chi distilla da un modello commerciale viola spesso i ToS. OpenAI dichiara esplicitamente che non puoi distillare GPT-4 per produrre modelli competitivi. Anthropic idem. In pratica, la community open lo fa lo stesso.

3. Token-level distillation con teacher accessible

Se hai accesso al modello teacher (open weight), puoi fare distillation on-the-fly durante il training: per ogni token nel batch, calcoli teacher logits e applichi KL loss.

Esempi:

  • MiniLLM (Gu et al., 2023): variante di KL ottimizzata per inverse KL (encourage modes, non spread).
  • DistilBERT (storico, 2019): primo esempio celebre di distillation, BERT-base → DistilBERT (40% più piccolo, 97% performance).

Per modelli open di pari famiglia (es. Llama-3-70B → Llama-3-1B), è la tecnica con migliore rapporto qualità/costo.


Casi celebri di distillation (2024-2026)

StudenteTeacherMetodoNote
Alpaca 7BGPT-3.5ResponseStorico, primo esempio open
Vicuna 13BChatGPTResponse su ShareGPTStorico
Orca (Microsoft)GPT-4Response + reasoning tracesHa mostrato che “spiegazioni del teacher” aiutano molto
Phi-3 / Phi-4 (Microsoft)GPT-4 (in parte)Synthetic data + distillationModelli piccoli campioni di benchmark
DeepSeek-R1-Distill-DeepSeek-R1Response su reasoning tracesFamiglia di modelli reasoning piccoli (1.5B, 7B, 14B, 32B)
Gemma-2 / Gemma-3 (Google)Gemini (interno)Token-levelEsplicitamente “distilled from larger model”
Llama-3.2 1B / 3B (Meta)Llama-3 405B/70BToken-level + pruningMostrato in paper

DeepSeek-R1-Distill-Qwen-7B è particolarmente interessante: addestrato con response distillation dai reasoning traces di R1 (un modello da 671B!), ha portato reasoning capability decente in 7B di parametri.


Distillation per reasoning: una novità del 2025

DeepSeek-R1 ha rivelato un effetto sorprendente: i reasoning traces di un modello forte sono dati di addestramento eccezionali per modelli piccoli.

Procedura:

  1. Generi con R1 (o o1, Claude thinking) 100k-1M problemi con full thinking trace e risposta.
  2. SFT-tune un modello base (es. Qwen-7B) su queste traces.
  3. Il modello base impara a generare CoT lunghe simili al teacher.

Risultato: Qwen-7B post-distill (1.5B in alcuni casi) raggiunge performance reasoning incredibilmente vicine al teacher su molti benchmark.

Limite osservato (Hugging Face’s Open R1 reproduction, 2025): la distillation eredita lo stile del teacher (a volte verboso). Tutti questi “R1-distilled” hanno traces che sembrano un po’ tutte uguali.


Effetti collaterali della distillation

Mode collapse

Distillare la risposta del teacher porta a uno studente che produce risposte tutte uguali, simili a quelle del teacher. Diversità ridotta.

Inheritance dei bias

Lo studente eredita TUTTI i bias del teacher: politici, culturali, di style. Distillare da GPT-4 produce modelli che “suonano” come GPT-4, refusal e tutto.

Capability ceiling

Lo studente non può superare il teacher su task generic. Distillation è un trasferimento, non una creazione. Se il teacher sbaglia certi problemi, lo studente li sbaglia uguale (o peggio).

Eccezione interessante: a volte lo studente specializzato batte il teacher generalista sul task specifico della distillation. Esempi: DistilBERT batte BERT-base su task specifici dopo task-specific distillation. Phi-4 batte modelli più grandi in benchmark per cui è stato curato.

Hallucination amplificate

Se il teacher allucina (e tutti i LLM lo fanno), quelle allucinazioni vengono incise come “verità” nel dataset di training dello studente. Lo studente le ripete con confidence anche maggiore.


Distillation vs. quantization vs. pruning

Tre strategie distinte per modelli piccoli/veloci:

TecnicaModificaEffetto principaleStato 2026
Quantization (vedi 227)Bit-width dei pesiRiduce memoria e acceleraStandard, molto usato
PruningStruttura del modelloRiduce parametri rimuovendo connessioni “morte”Meno usato per LLM
DistillationModello completamente nuovo, più piccoloTrasferisce capacità da un teacherStandard per task-specific

Spesso combinati: distill prima, quantizza dopo. Esempio: Llama-3.2-1B-Instruct distillato + Q4_K_M giri su una RaspBerry Pi 5.


Distillation in pratica: il workflow

Scenario tipico: hai GPT-4 che risolve il tuo task ma costa troppo.

  1. Identifica il task: customer service per dominio specifico, traduzione, classificazione, ecc.
  2. Genera dataset: 10k-100k prompt × GPT-4 response. Costo iniziale: $1k-$10k. Una tantum.
  3. Filtra: rimuovi risposte chiaramente sbagliate. Importante.
  4. Scegli base model: Llama-3.2-3B, Qwen-2.5-7B, Phi-4-mini. Open weights ovviamente.
  5. SFT (puntata 215) o LoRA (puntata 218) sul dataset. 1-2 epoche.
  6. Valuta: confronta con GPT-4 su un test set. Aspettati 80-95% accuracy del teacher su un task ristretto.
  7. Deploy: il tuo modello distill costa 50-100× meno e gira on-prem.

Questo workflow è il business model di moltissime startup (Predibase, Modal, Together, Replicate) e una parte enorme dell’attività AI in azienda nel 2026.


Glossario lampo

  • Soft labels — distribuzione di probabilità completa, vs label one-hot.
  • Temperature — iperparametro che smussa la distribuzione (alto = più smooth).
  • Response distillation — usare l’output testuale del teacher come target.
  • Token-level distillation — usare le distribuzioni di probabilità interne del teacher.
  • Capability ceiling — il limite intrinseco a quello che lo studente può imparare dal teacher.

TEST hands-on

  1. Genera un dataset di distillation: 1000 prompt + risposte da Claude 3.5 Haiku via API (~$5-10 di costo). Tema: “spiega questo concetto a livello universitario”.
  2. Fine-tune meta-llama/Llama-3.2-1B-Instruct (1.2B params, gratis e gira su RTX 3060) con LoRA su quel dataset.
  3. Confronta su 50 nuovi prompt: GPT-4 vs Claude vs Llama distilled. Manualmente o con LLM-as-judge.
  4. Misura latenza e costo per 1000 query. Aspettati ~100× riduzione costi.
  5. Bonus: prova deepseek-ai/DeepSeek-R1-Distill-Qwen-7B. Lancialo localmente. Confrontalo con DeepSeek-R1 vero (671B) via API su 5 problemi di matematica. Quanta capacità reasoning è sopravvissuta?

Take-away

Distillation è il modo industriale di estrarre valore da modelli enormi. La frontiera produce GPT-5; il mercato produce migliaia di Llama-3-distilled che fanno il 90% del lavoro al 1% del costo. È un meccanismo silente ma fondamentale: senza, gli LLM resterebbero giocattoli da datacenter. Con, diventano backbone di prodotti reali a prezzi sostenibili.


➡️ Prossima puntata: Synthetic data — l’AI che allena l’AI: trend e rischi.