Puntata 219
Puntata 219 — Distillation
Livello: 🧙 Maestro Yoda · Capitolo 20 · Training, fine-tuning, allineamento
“Modello grande sa, modello piccolo impara dal modello grande”. Sembra una catena gerarchica medievale. È esattamente quello che succede.
Il problema: i modelli buoni sono troppo grandi
Hai un GPT-4 che risolve i tuoi problemi. Ma:
- Costa $$$ per query.
- Latenza alta (TTFT diversi secondi).
- Non puoi eseguirlo on-device o on-premise.
- Volume in scala (100k+ query/min) ti rovina.
Vorresti un modello da 1-7B che faccia “abbastanza bene” il task specifico, e ti costi 50-100× meno.
Knowledge distillation: addestrare un modello “studente” piccolo a imitare un modello “teacher” grande.
Le tre forme di distillazione
1. Soft-label distillation (Hinton et al., 2015)
La forma “classica”. Il teacher non solo dà la risposta corretta, ma una distribuzione di probabilità su tutte le possibili risposte. Lo studente impara su questa distribuzione, più ricca di una hard label.
Per LLM con classificazione token-by-token:
L_distill = KL( softmax(z_student/T) || softmax(z_teacher/T) )
T (temperatura) è iperparametro: alto → distribuzione più smooth, più info trasferita.
Spesso si mescola con la loss “vera” sui label di pretraining:
L_total = α · L_distill + (1-α) · L_pretraining
Vantaggio: lo studente “vede” perché il teacher ha scelto quel token vs altri. Le “soft labels” rivelano la geometria della distribuzione.
Costoso in pratica: serve far girare il teacher su tutti gli esempi di training del student. Per modelli grandi diventa proibitivo.
2. Black-box / Response distillation
Forma più pragmatica e dominante nel 2024-2026.
- Genera con il teacher (es. GPT-4, Claude Opus) un dataset di risposte su un set di prompt.
- Addestra lo studente con SFT standard su questo dataset.
Niente accesso ai logit interni del teacher. Solo l’output testuale. Pragmatico, economico (se il teacher è API-accessible), funziona benissimo.
È il pattern dietro Alpaca, Vicuna, WizardLM, Orca, e infinite famiglie di “GPT-4-distilled models”.
Limite: chi distilla da un modello commerciale viola spesso i ToS. OpenAI dichiara esplicitamente che non puoi distillare GPT-4 per produrre modelli competitivi. Anthropic idem. In pratica, la community open lo fa lo stesso.
3. Token-level distillation con teacher accessible
Se hai accesso al modello teacher (open weight), puoi fare distillation on-the-fly durante il training: per ogni token nel batch, calcoli teacher logits e applichi KL loss.
Esempi:
- MiniLLM (Gu et al., 2023): variante di KL ottimizzata per inverse KL (encourage modes, non spread).
- DistilBERT (storico, 2019): primo esempio celebre di distillation, BERT-base → DistilBERT (40% più piccolo, 97% performance).
Per modelli open di pari famiglia (es. Llama-3-70B → Llama-3-1B), è la tecnica con migliore rapporto qualità/costo.
Casi celebri di distillation (2024-2026)
| Studente | Teacher | Metodo | Note |
|---|---|---|---|
| Alpaca 7B | GPT-3.5 | Response | Storico, primo esempio open |
| Vicuna 13B | ChatGPT | Response su ShareGPT | Storico |
| Orca (Microsoft) | GPT-4 | Response + reasoning traces | Ha mostrato che “spiegazioni del teacher” aiutano molto |
| Phi-3 / Phi-4 (Microsoft) | GPT-4 (in parte) | Synthetic data + distillation | Modelli piccoli campioni di benchmark |
| DeepSeek-R1-Distill- | DeepSeek-R1 | Response su reasoning traces | Famiglia di modelli reasoning piccoli (1.5B, 7B, 14B, 32B) |
| Gemma-2 / Gemma-3 (Google) | Gemini (interno) | Token-level | Esplicitamente “distilled from larger model” |
| Llama-3.2 1B / 3B (Meta) | Llama-3 405B/70B | Token-level + pruning | Mostrato in paper |
DeepSeek-R1-Distill-Qwen-7B è particolarmente interessante: addestrato con response distillation dai reasoning traces di R1 (un modello da 671B!), ha portato reasoning capability decente in 7B di parametri.
Distillation per reasoning: una novità del 2025
DeepSeek-R1 ha rivelato un effetto sorprendente: i reasoning traces di un modello forte sono dati di addestramento eccezionali per modelli piccoli.
Procedura:
- Generi con R1 (o o1, Claude thinking) 100k-1M problemi con full thinking trace e risposta.
- SFT-tune un modello base (es. Qwen-7B) su queste traces.
- Il modello base impara a generare CoT lunghe simili al teacher.
Risultato: Qwen-7B post-distill (1.5B in alcuni casi) raggiunge performance reasoning incredibilmente vicine al teacher su molti benchmark.
Limite osservato (Hugging Face’s Open R1 reproduction, 2025): la distillation eredita lo stile del teacher (a volte verboso). Tutti questi “R1-distilled” hanno traces che sembrano un po’ tutte uguali.
Effetti collaterali della distillation
Mode collapse
Distillare la risposta del teacher porta a uno studente che produce risposte tutte uguali, simili a quelle del teacher. Diversità ridotta.
Inheritance dei bias
Lo studente eredita TUTTI i bias del teacher: politici, culturali, di style. Distillare da GPT-4 produce modelli che “suonano” come GPT-4, refusal e tutto.
Capability ceiling
Lo studente non può superare il teacher su task generic. Distillation è un trasferimento, non una creazione. Se il teacher sbaglia certi problemi, lo studente li sbaglia uguale (o peggio).
Eccezione interessante: a volte lo studente specializzato batte il teacher generalista sul task specifico della distillation. Esempi: DistilBERT batte BERT-base su task specifici dopo task-specific distillation. Phi-4 batte modelli più grandi in benchmark per cui è stato curato.
Hallucination amplificate
Se il teacher allucina (e tutti i LLM lo fanno), quelle allucinazioni vengono incise come “verità” nel dataset di training dello studente. Lo studente le ripete con confidence anche maggiore.
Distillation vs. quantization vs. pruning
Tre strategie distinte per modelli piccoli/veloci:
| Tecnica | Modifica | Effetto principale | Stato 2026 |
|---|---|---|---|
| Quantization (vedi 227) | Bit-width dei pesi | Riduce memoria e accelera | Standard, molto usato |
| Pruning | Struttura del modello | Riduce parametri rimuovendo connessioni “morte” | Meno usato per LLM |
| Distillation | Modello completamente nuovo, più piccolo | Trasferisce capacità da un teacher | Standard per task-specific |
Spesso combinati: distill prima, quantizza dopo. Esempio: Llama-3.2-1B-Instruct distillato + Q4_K_M giri su una RaspBerry Pi 5.
Distillation in pratica: il workflow
Scenario tipico: hai GPT-4 che risolve il tuo task ma costa troppo.
- Identifica il task: customer service per dominio specifico, traduzione, classificazione, ecc.
- Genera dataset: 10k-100k prompt × GPT-4 response. Costo iniziale: $1k-$10k. Una tantum.
- Filtra: rimuovi risposte chiaramente sbagliate. Importante.
- Scegli base model: Llama-3.2-3B, Qwen-2.5-7B, Phi-4-mini. Open weights ovviamente.
- SFT (puntata 215) o LoRA (puntata 218) sul dataset. 1-2 epoche.
- Valuta: confronta con GPT-4 su un test set. Aspettati 80-95% accuracy del teacher su un task ristretto.
- Deploy: il tuo modello distill costa 50-100× meno e gira on-prem.
Questo workflow è il business model di moltissime startup (Predibase, Modal, Together, Replicate) e una parte enorme dell’attività AI in azienda nel 2026.
Glossario lampo
- Soft labels — distribuzione di probabilità completa, vs label one-hot.
- Temperature — iperparametro che smussa la distribuzione (alto = più smooth).
- Response distillation — usare l’output testuale del teacher come target.
- Token-level distillation — usare le distribuzioni di probabilità interne del teacher.
- Capability ceiling — il limite intrinseco a quello che lo studente può imparare dal teacher.
TEST hands-on
- Genera un dataset di distillation: 1000 prompt + risposte da Claude 3.5 Haiku via API (~$5-10 di costo). Tema: “spiega questo concetto a livello universitario”.
- Fine-tune
meta-llama/Llama-3.2-1B-Instruct(1.2B params, gratis e gira su RTX 3060) con LoRA su quel dataset. - Confronta su 50 nuovi prompt: GPT-4 vs Claude vs Llama distilled. Manualmente o con LLM-as-judge.
- Misura latenza e costo per 1000 query. Aspettati ~100× riduzione costi.
- Bonus: prova
deepseek-ai/DeepSeek-R1-Distill-Qwen-7B. Lancialo localmente. Confrontalo con DeepSeek-R1 vero (671B) via API su 5 problemi di matematica. Quanta capacità reasoning è sopravvissuta?
Take-away
Distillation è il modo industriale di estrarre valore da modelli enormi. La frontiera produce GPT-5; il mercato produce migliaia di Llama-3-distilled che fanno il 90% del lavoro al 1% del costo. È un meccanismo silente ma fondamentale: senza, gli LLM resterebbero giocattoli da datacenter. Con, diventano backbone di prodotti reali a prezzi sostenibili.
➡️ Prossima puntata: Synthetic data — l’AI che allena l’AI: trend e rischi.