Puntata 212
Puntata 212 — TEST: leggi e annota un paper di 6 pagine
Livello: 🧙 Maestro Yoda · Capitolo 19 · Architetture
Hai letto 11 puntate. Adesso prendi un paper vero e dimostra che sai pronunciare quello che hai imparato.
Perché un test “leggi un paper” e non un quiz
Saper rispondere a domande chiuse sul transformer non è la stessa cosa che essere in grado di digerire un paper nuovo quando esce — la skill vera, quella che separa un consumatore di hype da uno che capisce davvero cosa cambia.
Il paper non è un articolo divulgativo: è una compressed-form di 6-10 pagine pensata per altri ricercatori. Imparare a decomprimerlo è skill, non talento.
Il paper consigliato
Scegli uno dei seguenti. Sono tutti rilevanti per il Capitolo 19, tutti leggibili in 60-90 minuti, tutti hanno cambiato un pezzetto del campo.
Livello: introduttivo
- “Attention Is All You Need” (Vaswani et al., 2017) — arXiv:1706.03762. Lo conosci di seconda mano, ora leggilo davvero. Particolare attenzione a Sez. 3 e 4.
- “LLM.int8(): 8-bit Matrix Multiplication” (Dettmers et al., 2022) — arXiv:2208.07339. Quantization spiegata bene, 6 pagine effettive.
Livello: intermedio
- “Mamba: Linear-Time Sequence Modeling with Selective State Spaces” (Gu & Dao, 2023) — arXiv:2312.00752. Il paper dell’SSM moderno (vedi puntata 205).
- “FlashAttention: Fast and Memory-Efficient Exact Attention” (Dao et al., 2022) — arXiv:2205.14135. Capolavoro di ingegneria, breve, leggibile.
- “GQA: Training Generalized Multi-Query Transformer Models” (Ainslie et al., 2023) — arXiv:2305.13245. 8 pagine, esempio perfetto di paper “applicato”.
Livello: avanzato
- “DeepSeek-V3 Technical Report” (DeepSeek, 2024) — arXiv:2412.19437. Tecnico denso ma comprensibile, MLA + MoE + RL pipeline insieme.
- “DeepSeek-R1: Incentivizing Reasoning Capability via RL” (DeepSeek, 2025) — arXiv:2501.12948. La pietra miliare sull’RL reasoning.
- “YaRN: Efficient Context Window Extension” (Peng et al., 2023) — arXiv:2309.00071. Tecnico ma centrale per il context extension (puntata 207, 210).
Scegli uno diverso dal tema che già padroneggi. Se sai già RoPE, prendi MoE o R1. Se sai già R1, prendi FlashAttention.
La routine di lettura in 6 fasi
Tempo target totale: 60-90 minuti per la prima passata, +60 per la seconda.
Fase 1 — Skim (10 min)
Senza leggere. Solo scrolla:
- Titolo, autori, affiliazione, data.
- Abstract: leggi 2 volte.
- Figure 1, 2, 3 con didascalie.
- Conclusion.
- Diagramma di architettura (se c’è).
Obiettivo: una frase che riassuma cosa fa il paper. Scrivila su un foglio.
Fase 2 — Introduction + Related Work (15 min)
Capisci:
- Quale problema risolve?
- Quali sono i metodi precedenti che critica?
- Qual è il “delta” che propone?
Sottolinea i nomi di altri paper / metodi citati. Mettine in nota 2-3 da leggere dopo.
Fase 3 — Sezione tecnica principale (25 min)
È la sezione “Method” o “Approach”. Vai con calma. Per ogni formula:
- Cosa rappresentano i simboli?
- Quali sono le shape dei tensori?
- Cosa è nuovo rispetto al baseline?
Quando trovi un’equazione “magica”, fermati e prova a scriverla con parole tue. Se non ci riesci, hai trovato un punto da rileggere.
Fase 4 — Experiments + Ablations (15 min)
- Quali benchmark usano?
- Quali baseline confrontano?
- Quali ablations fanno? (Tabelle che disattivano un pezzo del metodo per misurare quanto contribuisce).
L’ablation table è spesso più interessante del risultato finale: ti dice quale ingrediente conta.
Fase 5 — Limitations + Conclusion (5 min)
- Cosa il paper non ha risolto?
- Quali esperimenti suggeriscono come future work?
Spesso il vero “stato dell’arte” è proprio in queste righe nascoste.
Fase 6 — Decomprimere (15 min)
Chiudi il paper. Su un foglio bianco rispondi:
- In una frase: cosa fa questo paper?
- In 3 punti: quali sono i 3 trick chiave?
- In 1 figura disegnata a mano: come è l’architettura/processo?
- In 1 numero: qual è il risultato principale (es. “+8% MMLU vs baseline”)?
- In 1 critica: cosa NON ti convince o cosa manca?
Se non riesci a rispondere a tutte e 5, torna indietro.
La tua deliverable
Scegli un paper. Esegui la routine. Produci un file Markdown di 1 pagina (300-500 parole) strutturato così:
# [Titolo del paper] — Riassunto in 1 pagina
**Autori**: [...]
**Data**: [...]
**arXiv**: [...]
**Letto il**: [data]
## In una frase
[1 frase]
## Il problema
[3-5 righe]
## L'idea chiave
[3-5 righe, eventualmente con formula]
## Architettura/Algoritmo
[mini-schema o pseudocodice, 5-10 righe]
## Risultati principali
- [benchmark 1]: X% vs Y% baseline
- [benchmark 2]: ...
## Cosa NON mi convince
[2-3 righe]
## Da leggere dopo
- [paper citato 1]
- [paper citato 2]
Conservalo. In 6 mesi lo rileggerai e capirai meglio cosa avevi capito e cosa no.
Trucchi del mestiere
- Stampa il paper, non leggerlo a schermo. Penna in mano, margini per annotare. Funziona meglio per il 90% delle persone.
- Una sessione, un paper. Non saltare fra paper diversi. Fa effetto opposto.
- Quando trovi un termine sconosciuto, scrivilo su un foglio separato. Non interrompere la lettura per googlare ogni cosa: rovini il flow. Fai la ricerca dopo.
- Se ti perdi nella matematica, salta avanti. La matematica del paper non è il messaggio: è la formalizzazione. Capire il messaggio prima, formalizzarlo dopo.
- Leggi anche i paper citati che non capisci. Se lo stesso paper è citato in 3 paper diversi che stai leggendo, è un must-read per il tuo background.
- Iscriviti a 2-3 newsletter: alphaXiv (raccomandazioni paper), Lilian Weng’s blog, Sebastian Raschka’s Ahead of AI, Simon Willison. Selezionano il rumore.
Cosa ti aspetta
Il primo paper letto bene impiega 2 ore. Dopo 10 paper letti, impieghi 45 minuti. Dopo 50 paper, 20-30 minuti per i paper “normali” e 1 ora per quelli densi.
È una skill che si automatizza. E che ti rende indipendente dal Twitter degli AI influencer.
Capitoli prossimi: cosa ti servirà
Nel Capitolo 20 (Training, fine-tuning, allineamento) leggerai paper su:
- Dataset (Common Crawl, RedPajama, FineWeb)
- RLHF (InstructGPT, ChatGPT paper)
- DPO (Rafailov et al.)
- LoRA/QLoRA
Avrai bisogno di questa skill al passo. Se hai fatto bene questo TEST, sei pronto.
Glossario lampo
- arXiv — il repository open dei paper di research. Quasi tutto quello che leggerai è qui.
- Ablation study — esperimento in cui si toglie una parte del metodo per misurare il suo contributo.
- Baseline — il metodo “esistente” contro cui ci si confronta.
- Benchmark — task standard su cui si misurano i modelli.
- Limitations — sezione conclusiva dove i ricercatori (a volte) dichiarano cosa non sanno fare.
Take-away
Saper leggere un paper è la skill più resiliente del campo AI. Le architetture cambiano, gli SDK invecchiano, le API si rinominano. La capacità di guardare un PDF di 8 pagine e in 60 minuti uscirne con un’opinione informata resta. Tutto il resto è derivativo.
➡️ Prossima puntata: Pretraining — il “leggere internet” su scala (apre Capitolo 20).