Puntata 105
Puntata 105 — Temperatura: il termostato della creatività
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 10 · Sotto il cofano: cos’è davvero un LLM
Un numero da 0 a 2 che decide se l’AI è uno stenografo zelante o un poeta ubriaco.
Il fenomeno
Hai mai chiesto la stessa cosa due volte a ChatGPT e ricevuto due risposte diverse?
Non è un bug, non è la luna piena. È un parametro che si chiama temperature.
Cosa fa, davvero
Ogni volta che il modello sceglie il prossimo token, sotto il cofano calcola una distribuzione di probabilità su tutto il vocabolario:
"Il gatto si è arrampicato sull'..."
→ albero 62%
→ armadio 18%
→ alberello 5%
→ tavolo 3%
→ astronauta 0.0003%
Il sampling sceglie una di queste opzioni. Temperature decide quanto puntiamo solo sui primi, e quanto diamo una chance anche alle code.
Matematicamente: si dividono i logit per T prima del softmax.
- T = 0 → greedy. Scegli sempre il top. Output (quasi) deterministico.
- T = 1 → distribuzione “originale” del modello.
- T = 2 → distribuzione appiattita: anche “astronauta” può uscire.
Stesso prompt, due temperature
Prompt: “Scrivi l’inizio di una favola con un drago.”
T = 0.2
“C’era una volta un drago che viveva in una montagna lontana e custodiva un grande tesoro…”
T = 1.5
“C’era una volta un drago con la passione per i sudoku, che viveva accanto a un panificio gestito da una talpa miope con il vizio del bridge…”
Stesso modello. Stesso prompt. Diverso rischio nel sampling.
I cugini: top-p e top-k
Temperature non lavora mai da sola. I sampler moderni la combinano con:
- top-k: considera solo i
ktoken più probabili. (k=50taglia il rumore.) - top-p (nucleus sampling): considera i token la cui probabilità cumulata copre il
p%. Più adattivo di top-k.
Default tipici nel 2026: T ≈ 0.7, top_p ≈ 0.9. Quasi tutti i provider partono da qui.
Quando usare cosa
| Scopo | Temperature |
|---|---|
| Estrazione strutturata, JSON, classificazione | 0 – 0.2 |
| Codice | 0.1 – 0.4 |
| Risposte fattuali, RAG, customer service | 0.2 – 0.5 |
| Tono colloquiale, contenuti generici | 0.7 – 1.0 |
| Brainstorming, idee laterali | 1.0 – 1.3 |
| Poesia surrealista, scherzi, naming | 1.2 – 1.8 |
⚠️ Oltre T = 1.5 il testo degenera in incoerenza. Non è “più creativa”: è più rumorosa. Sono cose diverse.
L’inganno semantico
Chiamarla “creatività” è un abuso di linguaggio. Temperature non aumenta la fantasia del modello: aumenta l’entropia del sampling.
Un modello piccolo a T = 2 non diventa Calvino: diventa un generatore di non-sequitur. Se il talento non c’è nei pesi, la temperatura non lo fa apparire.
I modelli reasoning e la temperature
Sui modelli con thinking esplicito (o-series di OpenAI, Claude in extended thinking, DeepSeek-R) temperature ha effetto ridotto o nullo sul ragionamento — perché il modello “pensa” in modo strutturato prima di scegliere.
Verifica sempre la doc dell’API: alcuni provider la ignorano del tutto in thinking mode, altri la applicano solo all’output finale.
TEST pratico (5 minuti)
- Apri il playground OpenAI o Anthropic.
- Prompt: “Trova 5 nomi per un caffè letterario.”
- Lancia 3 volte a
T = 0. → Ti dà sempre la stessa lista? - Lancia 3 volte a
T = 1.2. → Vedi che i nomi si fanno più strani e variegati? - Lancia 3 volte a
T = 1.8. → Stanno ancora in piedi o iniziano ad essere assurdi?
Plotta sulla parete mentale la curva: varianza in salita, qualità che dopo un certo punto crolla.
Take-away in una riga
Temperature è un termostato, non un cervello. Sposta la varianza, non l’intelligenza.
➡️ Prossima puntata: Embedding — come l’AI “capisce” il significato.