Puntata 128
Puntata 128 — Reasoning vs rapidi
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli
Due famiglie, due filosofie. “Reasoning” pensa a lungo e risponde meglio sui problemi duri. “Fast” risponde subito ed è meglio per chat e produzione ad alto volume. Scegli quale serve, non quale è “il più potente”.
La biforcazione del 2024-25
Fino al 2023, i modelli avevano un solo asse di scelta: taglia (mini, medium, large). Stessa pipeline: prompt → forward pass → risposta in 1-2 secondi.
Da settembre 2024 (OpenAI o1), poi DeepSeek-R1, Claude extended thinking, Gemini Deep Think — è emersa una seconda famiglia:
| Famiglia | Filosofia |
|---|---|
| Fast / Standard | Forward pass classico, risposta immediata |
| Reasoning / Thinking | Test-time compute esteso: pensa migliaia di token prima di rispondere |
Capire la differenza non è ottimizzazione di nicchia — è la scelta principale del prompt engineering del 2026.
Cosa fanno i reasoning models
Quando mandi un prompt a un modello reasoning (o3, Claude 4.7 thinking, DeepSeek-R1, Gemini 2.5 Deep Think):
- Input arriva (es. “Risolvi questa equazione…”).
- Il modello produce un lungo blocco di “thinking” (centinaia/migliaia di token).
- Esplora ipotesi, fa calcoli, prova approcci, si auto-corregge.
- Tu (a volte) non vedi questi token — sono “interni”.
- Risposta finale prodotta dopo il thinking, basata sul ragionamento svolto.
In termini tecnici: scambiano compute al test-time per accuratezza. È un’idea vecchia (AlphaGo lo faceva in modo diverso), ma per LLM è stata maturata nel 2024.
Quando i reasoning vincono
I reasoning brillano su task con risposta verificabile e passaggi multipli:
✅ Matematica
- AIME, IMO, MATH benchmark.
- Word problems con più step.
- Geometria, combinatoria, algebra avanzata.
✅ Coding architetturale
- Refactoring complesso.
- Debug di bug sottili.
- Algoritmi non triviali.
- Test design.
✅ Logica e ragionamento simbolico
- Puzzle, deduzioni, planning.
- Estrazione di regole da esempi.
- Constraint satisfaction.
✅ Scienza
- GPQA (Graduate-level QA in fisica, chimica, biologia).
- Spiegazione di fenomeni con catene causali.
- Verifica di ipotesi date evidenze.
✅ Eval / debug di sistemi AI
- Capire perché un altro modello ha sbagliato.
- Validare output di pipeline.
Benchmark indicativo: DeepSeek-R1 sul MATH benchmark = 90%+, vs GPT-4o non-thinking ~75%. Stesso modello base, 5x più token, +15% accuracy.
Quando i reasoning perdono
I reasoning sono sovradimensionati o controproducenti su:
❌ Chat consumer “veloce”
Un “come va?” con thinking da 8 secondi è bizarro.
❌ Scrittura creativa
Il thinking non aiuta poesia, narrativa, brainstorm libero. Anzi, può rendere il modello più “rigido”.
❌ Risposte fattuali brevi
“Capitale del Madagascar?” — non serve pensare a lungo.
❌ Task ad alto volume
Pagare 5-10× per ogni query non scala economicamente per call center, classificazione bulk, ecc.
❌ Latenza-critical
Voice assistant real-time: thinking di 15 secondi rovina l’esperienza.
La matrice di scelta
| Task | Modello consigliato |
|---|---|
| Chat consumer generale | Fast (GPT-5, Claude Sonnet, Gemini Flash) |
| Customer support, scrittura mail | Fast |
| Riassunti, traduzioni | Fast |
| Classificazione, estrazione dati | Fast (con few-shot) |
| Brainstorm, scrittura creativa | Fast |
| Matematica avanzata | Reasoning (o3, R1, Gemini Deep) |
| Coding architetturale | Reasoning (Claude 4.7 extended, o3) |
| Debugging sottile | Reasoning |
| Decisioni multi-step con vincoli | Reasoning |
| Eval di altre AI | Reasoning |
| Voice realtime | Fast (Realtime API, mai reasoning) |
| Edge / mobile | Fast small (nano, Haiku, Flash-Lite) |
Cost e latency, tipici
Snapshot 2026 (varia per provider, per modello specifico):
| Modello | Latency (1k token output) | Costo per query “tipica” |
|---|---|---|
| GPT-5 nano | <500ms | <$0.001 |
| GPT-5 mini | ~1s | ~$0.003 |
| GPT-5 | ~2s | ~$0.015 |
| o4-mini (thinking) | ~10-30s | ~$0.05 |
| o3 (thinking heavy) | ~30-120s | ~$0.30 |
| Claude 4.7 Sonnet | ~2s | ~$0.015 |
| Claude 4.7 Opus | ~3s | ~$0.075 |
| Claude 4.7 thinking | ~15-60s | ~$0.05 |
| DeepSeek-R1 | ~10-30s | ~$0.01 |
Latency reasoning = 5-50× più lento. Costo = 3-15× più alto. Compute = 5-20× più alto in compute consumato (anche se quantizzato).
”Posso simulare reasoning su un fast model?”
Sì, parzialmente. È la chain-of-thought classica (puntata 114):
“Risolvi il problema. Ragiona passo per passo prima di dare la risposta finale.”
Risultato: il fast model produce token “intermedi” di ragionamento. Miglioramento parziale dell’accuratezza.
⚠️ Però: i modelli reasoning veri sono trainati per il thinking (RL su tracks di pensiero), non solo “promptati”. Quindi il loro reasoning è strutturalmente migliore di un fast model “convinto” a ragionare via prompt. Su problemi semplici-medi, CoT su fast è competitivo. Su problemi davvero duri (AIME, top coding), reasoning trainati vincono.
Hybrid e routing
In produzione: spesso non scegli uno. Costruisci un router:
Input utente
↓
Classifier (fast, piccolo): "Questo task è semplice o complesso?"
↓
Semplice → Fast model risponde
Complesso → Reasoning model risponde
Configurazione tipica:
- 80% dei task → Fast (GPT-5 mini o Claude Haiku).
- 15% → Fast premium (GPT-5 o Claude Sonnet).
- 5% → Reasoning (o3 o R1 o thinking mode).
Risparmio del 70-90% sui costi totali, stessa qualità percepita dall’utente finale.
”Adaptive reasoning” — verso il futuro
Da fine 2025, alcuni provider hanno iniziato a integrare il routing dentro il modello stesso:
- Il modello “decide” se serve thinking, e quanto.
- L’utente non sceglie più “fast vs reasoning” — c’è un solo endpoint che decide.
- Es: GPT-5 con auto-thinking, Claude 4.7 hybrid.
Pro: più semplice per developer, più efficienza media. Contro: meno controllo, latency variabile, harder debug.
Trend 2026-27: probabile convergenza su questo modello “modello unico, thinking adattivo”.
Comportamento sul prompt engineering
I reasoning hanno regole leggermente diverse:
✅ Cosa funziona
- Istruzioni chiare e specifiche.
- Vincoli espliciti (massimo “thinking tokens”).
- Output format ben definito.
⚠️ Cosa NON aggiunge valore
- “Ragiona passo per passo” — già lo fa.
- Few-shot estesi — possono confondere il thinking proprio del modello.
- Chain-of-thought esplicita nel prompt — ridondante.
⚠️ Cosa può rallentare
- Prompt molto lunghi — il modello “pensa” anche sul prompt.
- Vincoli contraddittori — il modello passa più tempo a riconciliare.
Modalità “thinking budget”
Alcuni provider permettono di controllare quanto pensare:
| Provider | Parametro |
|---|---|
| OpenAI o-series | reasoning_effort: low / medium / high |
| Claude extended | thinking_budget_tokens: int (es. 5000) |
| Gemini Deep Think | thinking_mode: standard / deep |
| DeepSeek-R1 | thinking visibile, soglie configurabili |
Use case:
- Effort basso per task semi-strutturati che beneficiano un po’ di thinking.
- Effort alto per problemi davvero duri.
In produzione, spesso si calibra il budget sul task type.
I rischi del reasoning
⚠️ Faithfulness: il modello non sempre segue davvero il proprio ragionamento. A volte il “thinking” è coerente ma la risposta finale arriva da altro (puntata 114).
⚠️ Hallucination strutturate: un modello che pensa “molto” può costruire bugie complesse e coerenti invece di errori semplici riconoscibili. Più difficile da debuggare.
⚠️ Echo chamber del thinking: se il modello inizia su un percorso sbagliato, il thinking esteso può rafforzare l’errore invece di correggerlo.
⚠️ Cost runaway: se non controlli il budget, una query reasoning può costare 100× più del previsto. Sempre con max_tokens configurato.
TEST pratico (10 minuti)
Prendi un problema che richiede ragionamento (matematica con passi multipli, logica, debugging codice).
- Mandalo a GPT-5 mini (fast).
- Stesso prompt + “ragiona passo per passo” a GPT-5 mini (CoT su fast).
- Mandalo a o4-mini (reasoning).
- Stesso prompt a Claude 4.7 Sonnet (fast standard).
- Stesso prompt a Claude 4.7 Sonnet con extended thinking.
Misura per ognuno:
- Risposta corretta? Sì/No.
- Latency: secondi.
- Token totali consumati (input + output, e per reasoning anche thinking).
- Costo stimato.
Spesso scoprirai:
- Per problemi facili: fast + CoT è competitivo con reasoning.
- Per problemi medi: reasoning leggero (o4-mini, Sonnet extended) è il sweet spot.
- Per problemi duri: reasoning heavy (o3, Deep Think) è necessario.
Take-away in una riga
Reasoning vs Fast non è “potente vs debole”, è “thinking vs no-thinking”. Scegli per il task: thinking dove la verifica conta, fast dove la velocità conta. Il 90% delle query reali è fast.
➡️ Prossima puntata: AI sul telefono — Apple Intelligence, Gemini Nano: l’edge.