🧙 Maestro Yoda Cap. 19 · Architetture

Puntata 212

Puntata 212 — TEST: leggi e annota un paper di 6 pagine

Livello: 🧙 Maestro Yoda · Capitolo 19 · Architetture

Hai letto 11 puntate. Adesso prendi un paper vero e dimostra che sai pronunciare quello che hai imparato.

un paper stampato con bordi annotati a penna rossa, post-it gialli sui punti chiave, una freccia che indica la sezione “Ablation”. Sotto: caffè, calcolatrice, fogli di carta a quadretti

Perché un test “leggi un paper” e non un quiz

Saper rispondere a domande chiuse sul transformer non è la stessa cosa che essere in grado di digerire un paper nuovo quando esce — la skill vera, quella che separa un consumatore di hype da uno che capisce davvero cosa cambia.

Il paper non è un articolo divulgativo: è una compressed-form di 6-10 pagine pensata per altri ricercatori. Imparare a decomprimerlo è skill, non talento.


Il paper consigliato

Scegli uno dei seguenti. Sono tutti rilevanti per il Capitolo 19, tutti leggibili in 60-90 minuti, tutti hanno cambiato un pezzetto del campo.

Livello: introduttivo

  • “Attention Is All You Need” (Vaswani et al., 2017) — arXiv:1706.03762. Lo conosci di seconda mano, ora leggilo davvero. Particolare attenzione a Sez. 3 e 4.
  • “LLM.int8(): 8-bit Matrix Multiplication” (Dettmers et al., 2022) — arXiv:2208.07339. Quantization spiegata bene, 6 pagine effettive.

Livello: intermedio

  • “Mamba: Linear-Time Sequence Modeling with Selective State Spaces” (Gu & Dao, 2023) — arXiv:2312.00752. Il paper dell’SSM moderno (vedi puntata 205).
  • “FlashAttention: Fast and Memory-Efficient Exact Attention” (Dao et al., 2022) — arXiv:2205.14135. Capolavoro di ingegneria, breve, leggibile.
  • “GQA: Training Generalized Multi-Query Transformer Models” (Ainslie et al., 2023) — arXiv:2305.13245. 8 pagine, esempio perfetto di paper “applicato”.

Livello: avanzato

  • “DeepSeek-V3 Technical Report” (DeepSeek, 2024) — arXiv:2412.19437. Tecnico denso ma comprensibile, MLA + MoE + RL pipeline insieme.
  • “DeepSeek-R1: Incentivizing Reasoning Capability via RL” (DeepSeek, 2025) — arXiv:2501.12948. La pietra miliare sull’RL reasoning.
  • “YaRN: Efficient Context Window Extension” (Peng et al., 2023) — arXiv:2309.00071. Tecnico ma centrale per il context extension (puntata 207, 210).

Scegli uno diverso dal tema che già padroneggi. Se sai già RoPE, prendi MoE o R1. Se sai già R1, prendi FlashAttention.


La routine di lettura in 6 fasi

Tempo target totale: 60-90 minuti per la prima passata, +60 per la seconda.

Fase 1 — Skim (10 min)

Senza leggere. Solo scrolla:

  • Titolo, autori, affiliazione, data.
  • Abstract: leggi 2 volte.
  • Figure 1, 2, 3 con didascalie.
  • Conclusion.
  • Diagramma di architettura (se c’è).

Obiettivo: una frase che riassuma cosa fa il paper. Scrivila su un foglio.

Capisci:

  • Quale problema risolve?
  • Quali sono i metodi precedenti che critica?
  • Qual è il “delta” che propone?

Sottolinea i nomi di altri paper / metodi citati. Mettine in nota 2-3 da leggere dopo.

Fase 3 — Sezione tecnica principale (25 min)

È la sezione “Method” o “Approach”. Vai con calma. Per ogni formula:

  • Cosa rappresentano i simboli?
  • Quali sono le shape dei tensori?
  • Cosa è nuovo rispetto al baseline?

Quando trovi un’equazione “magica”, fermati e prova a scriverla con parole tue. Se non ci riesci, hai trovato un punto da rileggere.

Fase 4 — Experiments + Ablations (15 min)

  • Quali benchmark usano?
  • Quali baseline confrontano?
  • Quali ablations fanno? (Tabelle che disattivano un pezzo del metodo per misurare quanto contribuisce).

L’ablation table è spesso più interessante del risultato finale: ti dice quale ingrediente conta.

Fase 5 — Limitations + Conclusion (5 min)

  • Cosa il paper non ha risolto?
  • Quali esperimenti suggeriscono come future work?

Spesso il vero “stato dell’arte” è proprio in queste righe nascoste.

Fase 6 — Decomprimere (15 min)

Chiudi il paper. Su un foglio bianco rispondi:

  1. In una frase: cosa fa questo paper?
  2. In 3 punti: quali sono i 3 trick chiave?
  3. In 1 figura disegnata a mano: come è l’architettura/processo?
  4. In 1 numero: qual è il risultato principale (es. “+8% MMLU vs baseline”)?
  5. In 1 critica: cosa NON ti convince o cosa manca?

Se non riesci a rispondere a tutte e 5, torna indietro.


La tua deliverable

Scegli un paper. Esegui la routine. Produci un file Markdown di 1 pagina (300-500 parole) strutturato così:

# [Titolo del paper] — Riassunto in 1 pagina

**Autori**: [...]
**Data**: [...]
**arXiv**: [...]
**Letto il**: [data]

## In una frase
[1 frase]

## Il problema
[3-5 righe]

## L'idea chiave
[3-5 righe, eventualmente con formula]

## Architettura/Algoritmo
[mini-schema o pseudocodice, 5-10 righe]

## Risultati principali
- [benchmark 1]: X% vs Y% baseline
- [benchmark 2]: ...

## Cosa NON mi convince
[2-3 righe]

## Da leggere dopo
- [paper citato 1]
- [paper citato 2]

Conservalo. In 6 mesi lo rileggerai e capirai meglio cosa avevi capito e cosa no.


Trucchi del mestiere

  1. Stampa il paper, non leggerlo a schermo. Penna in mano, margini per annotare. Funziona meglio per il 90% delle persone.
  2. Una sessione, un paper. Non saltare fra paper diversi. Fa effetto opposto.
  3. Quando trovi un termine sconosciuto, scrivilo su un foglio separato. Non interrompere la lettura per googlare ogni cosa: rovini il flow. Fai la ricerca dopo.
  4. Se ti perdi nella matematica, salta avanti. La matematica del paper non è il messaggio: è la formalizzazione. Capire il messaggio prima, formalizzarlo dopo.
  5. Leggi anche i paper citati che non capisci. Se lo stesso paper è citato in 3 paper diversi che stai leggendo, è un must-read per il tuo background.
  6. Iscriviti a 2-3 newsletter: alphaXiv (raccomandazioni paper), Lilian Weng’s blog, Sebastian Raschka’s Ahead of AI, Simon Willison. Selezionano il rumore.

Cosa ti aspetta

Il primo paper letto bene impiega 2 ore. Dopo 10 paper letti, impieghi 45 minuti. Dopo 50 paper, 20-30 minuti per i paper “normali” e 1 ora per quelli densi.

È una skill che si automatizza. E che ti rende indipendente dal Twitter degli AI influencer.


Capitoli prossimi: cosa ti servirà

Nel Capitolo 20 (Training, fine-tuning, allineamento) leggerai paper su:

  • Dataset (Common Crawl, RedPajama, FineWeb)
  • RLHF (InstructGPT, ChatGPT paper)
  • DPO (Rafailov et al.)
  • LoRA/QLoRA

Avrai bisogno di questa skill al passo. Se hai fatto bene questo TEST, sei pronto.


Glossario lampo

  • arXiv — il repository open dei paper di research. Quasi tutto quello che leggerai è qui.
  • Ablation study — esperimento in cui si toglie una parte del metodo per misurare il suo contributo.
  • Baseline — il metodo “esistente” contro cui ci si confronta.
  • Benchmark — task standard su cui si misurano i modelli.
  • Limitations — sezione conclusiva dove i ricercatori (a volte) dichiarano cosa non sanno fare.

Take-away

Saper leggere un paper è la skill più resiliente del campo AI. Le architetture cambiano, gli SDK invecchiano, le API si rinominano. La capacità di guardare un PDF di 8 pagine e in 60 minuti uscirne con un’opinione informata resta. Tutto il resto è derivativo.


➡️ Prossima puntata: Pretraining — il “leggere internet” su scala (apre Capitolo 20).