✔️✔️ Doppie Spunte Blu Cap. 10 · Sotto il cofano: cos'è davvero un LLM

Puntata 105

Puntata 105 — Temperatura: il termostato della creatività

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 10 · Sotto il cofano: cos’è davvero un LLM

Un numero da 0 a 2 che decide se l’AI è uno stenografo zelante o un poeta ubriaco.

vecchio termostato analogico con manopola da 0 a 2; accanto due output dello stesso prompt — uno asciutto, l’altro deliziosamente fuori controllo

Il fenomeno

Hai mai chiesto la stessa cosa due volte a ChatGPT e ricevuto due risposte diverse?

Non è un bug, non è la luna piena. È un parametro che si chiama temperature.


Cosa fa, davvero

Ogni volta che il modello sceglie il prossimo token, sotto il cofano calcola una distribuzione di probabilità su tutto il vocabolario:

"Il gatto si è arrampicato sull'..."
→ albero       62%
→ armadio      18%
→ alberello     5%
→ tavolo        3%
→ astronauta   0.0003%

Il sampling sceglie una di queste opzioni. Temperature decide quanto puntiamo solo sui primi, e quanto diamo una chance anche alle code.

Matematicamente: si dividono i logit per T prima del softmax.

  • T = 0greedy. Scegli sempre il top. Output (quasi) deterministico.
  • T = 1 → distribuzione “originale” del modello.
  • T = 2 → distribuzione appiattita: anche “astronauta” può uscire.

Stesso prompt, due temperature

Prompt: “Scrivi l’inizio di una favola con un drago.”

T = 0.2

“C’era una volta un drago che viveva in una montagna lontana e custodiva un grande tesoro…”

T = 1.5

“C’era una volta un drago con la passione per i sudoku, che viveva accanto a un panificio gestito da una talpa miope con il vizio del bridge…”

Stesso modello. Stesso prompt. Diverso rischio nel sampling.


I cugini: top-p e top-k

Temperature non lavora mai da sola. I sampler moderni la combinano con:

  • top-k: considera solo i k token più probabili. (k=50 taglia il rumore.)
  • top-p (nucleus sampling): considera i token la cui probabilità cumulata copre il p%. Più adattivo di top-k.

Default tipici nel 2026: T ≈ 0.7, top_p ≈ 0.9. Quasi tutti i provider partono da qui.


Quando usare cosa

ScopoTemperature
Estrazione strutturata, JSON, classificazione0 – 0.2
Codice0.1 – 0.4
Risposte fattuali, RAG, customer service0.2 – 0.5
Tono colloquiale, contenuti generici0.7 – 1.0
Brainstorming, idee laterali1.0 – 1.3
Poesia surrealista, scherzi, naming1.2 – 1.8

⚠️ Oltre T = 1.5 il testo degenera in incoerenza. Non è “più creativa”: è più rumorosa. Sono cose diverse.


L’inganno semantico

Chiamarla “creatività” è un abuso di linguaggio. Temperature non aumenta la fantasia del modello: aumenta l’entropia del sampling.

Un modello piccolo a T = 2 non diventa Calvino: diventa un generatore di non-sequitur. Se il talento non c’è nei pesi, la temperatura non lo fa apparire.


I modelli reasoning e la temperature

Sui modelli con thinking esplicito (o-series di OpenAI, Claude in extended thinking, DeepSeek-R) temperature ha effetto ridotto o nullo sul ragionamento — perché il modello “pensa” in modo strutturato prima di scegliere.

Verifica sempre la doc dell’API: alcuni provider la ignorano del tutto in thinking mode, altri la applicano solo all’output finale.


TEST pratico (5 minuti)

  1. Apri il playground OpenAI o Anthropic.
  2. Prompt: “Trova 5 nomi per un caffè letterario.”
  3. Lancia 3 volte a T = 0. → Ti dà sempre la stessa lista?
  4. Lancia 3 volte a T = 1.2. → Vedi che i nomi si fanno più strani e variegati?
  5. Lancia 3 volte a T = 1.8. → Stanno ancora in piedi o iniziano ad essere assurdi?

Plotta sulla parete mentale la curva: varianza in salita, qualità che dopo un certo punto crolla.


Take-away in una riga

Temperature è un termostato, non un cervello. Sposta la varianza, non l’intelligenza.


➡️ Prossima puntata: Embedding — come l’AI “capisce” il significato.