✔️✔️ Doppie Spunte Blu Cap. 12 · Il bestiario dei modelli

Puntata 128

Puntata 128 — Reasoning vs rapidi

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli

Due famiglie, due filosofie. “Reasoning” pensa a lungo e risponde meglio sui problemi duri. “Fast” risponde subito ed è meglio per chat e produzione ad alto volume. Scegli quale serve, non quale è “il più potente”.

una bilancia a piatti. Su uno una tartaruga con occhiali da studioso (“REASONING — alta accuratezza, alto costo, alta latenza”). Sull’altro una lepre con cronometro (“FAST — bassa latenza, basso costo, ottimo per volume”). In mezzo, una freccia che indica: “scegli per il task, non per il marchio”

La biforcazione del 2024-25

Fino al 2023, i modelli avevano un solo asse di scelta: taglia (mini, medium, large). Stessa pipeline: prompt → forward pass → risposta in 1-2 secondi.

Da settembre 2024 (OpenAI o1), poi DeepSeek-R1, Claude extended thinking, Gemini Deep Think — è emersa una seconda famiglia:

FamigliaFilosofia
Fast / StandardForward pass classico, risposta immediata
Reasoning / ThinkingTest-time compute esteso: pensa migliaia di token prima di rispondere

Capire la differenza non è ottimizzazione di nicchia — è la scelta principale del prompt engineering del 2026.


Cosa fanno i reasoning models

Quando mandi un prompt a un modello reasoning (o3, Claude 4.7 thinking, DeepSeek-R1, Gemini 2.5 Deep Think):

  1. Input arriva (es. “Risolvi questa equazione…”).
  2. Il modello produce un lungo blocco di “thinking” (centinaia/migliaia di token).
    • Esplora ipotesi, fa calcoli, prova approcci, si auto-corregge.
    • Tu (a volte) non vedi questi token — sono “interni”.
  3. Risposta finale prodotta dopo il thinking, basata sul ragionamento svolto.

In termini tecnici: scambiano compute al test-time per accuratezza. È un’idea vecchia (AlphaGo lo faceva in modo diverso), ma per LLM è stata maturata nel 2024.


Quando i reasoning vincono

I reasoning brillano su task con risposta verificabile e passaggi multipli:

✅ Matematica

  • AIME, IMO, MATH benchmark.
  • Word problems con più step.
  • Geometria, combinatoria, algebra avanzata.

✅ Coding architetturale

  • Refactoring complesso.
  • Debug di bug sottili.
  • Algoritmi non triviali.
  • Test design.

✅ Logica e ragionamento simbolico

  • Puzzle, deduzioni, planning.
  • Estrazione di regole da esempi.
  • Constraint satisfaction.

✅ Scienza

  • GPQA (Graduate-level QA in fisica, chimica, biologia).
  • Spiegazione di fenomeni con catene causali.
  • Verifica di ipotesi date evidenze.

✅ Eval / debug di sistemi AI

  • Capire perché un altro modello ha sbagliato.
  • Validare output di pipeline.

Benchmark indicativo: DeepSeek-R1 sul MATH benchmark = 90%+, vs GPT-4o non-thinking ~75%. Stesso modello base, 5x più token, +15% accuracy.


Quando i reasoning perdono

I reasoning sono sovradimensionati o controproducenti su:

❌ Chat consumer “veloce”

Un “come va?” con thinking da 8 secondi è bizarro.

❌ Scrittura creativa

Il thinking non aiuta poesia, narrativa, brainstorm libero. Anzi, può rendere il modello più “rigido”.

❌ Risposte fattuali brevi

“Capitale del Madagascar?” — non serve pensare a lungo.

❌ Task ad alto volume

Pagare 5-10× per ogni query non scala economicamente per call center, classificazione bulk, ecc.

❌ Latenza-critical

Voice assistant real-time: thinking di 15 secondi rovina l’esperienza.


La matrice di scelta

TaskModello consigliato
Chat consumer generaleFast (GPT-5, Claude Sonnet, Gemini Flash)
Customer support, scrittura mailFast
Riassunti, traduzioniFast
Classificazione, estrazione datiFast (con few-shot)
Brainstorm, scrittura creativaFast
Matematica avanzataReasoning (o3, R1, Gemini Deep)
Coding architetturaleReasoning (Claude 4.7 extended, o3)
Debugging sottileReasoning
Decisioni multi-step con vincoliReasoning
Eval di altre AIReasoning
Voice realtimeFast (Realtime API, mai reasoning)
Edge / mobileFast small (nano, Haiku, Flash-Lite)

Cost e latency, tipici

Snapshot 2026 (varia per provider, per modello specifico):

ModelloLatency (1k token output)Costo per query “tipica”
GPT-5 nano<500ms<$0.001
GPT-5 mini~1s~$0.003
GPT-5~2s~$0.015
o4-mini (thinking)~10-30s~$0.05
o3 (thinking heavy)~30-120s~$0.30
Claude 4.7 Sonnet~2s~$0.015
Claude 4.7 Opus~3s~$0.075
Claude 4.7 thinking~15-60s~$0.05
DeepSeek-R1~10-30s~$0.01

Latency reasoning = 5-50× più lento. Costo = 3-15× più alto. Compute = 5-20× più alto in compute consumato (anche se quantizzato).


”Posso simulare reasoning su un fast model?”

Sì, parzialmente. È la chain-of-thought classica (puntata 114):

“Risolvi il problema. Ragiona passo per passo prima di dare la risposta finale.”

Risultato: il fast model produce token “intermedi” di ragionamento. Miglioramento parziale dell’accuratezza.

⚠️ Però: i modelli reasoning veri sono trainati per il thinking (RL su tracks di pensiero), non solo “promptati”. Quindi il loro reasoning è strutturalmente migliore di un fast model “convinto” a ragionare via prompt. Su problemi semplici-medi, CoT su fast è competitivo. Su problemi davvero duri (AIME, top coding), reasoning trainati vincono.


Hybrid e routing

In produzione: spesso non scegli uno. Costruisci un router:

Input utente

Classifier (fast, piccolo): "Questo task è semplice o complesso?"

Semplice → Fast model risponde
Complesso → Reasoning model risponde

Configurazione tipica:

  • 80% dei task → Fast (GPT-5 mini o Claude Haiku).
  • 15% → Fast premium (GPT-5 o Claude Sonnet).
  • 5% → Reasoning (o3 o R1 o thinking mode).

Risparmio del 70-90% sui costi totali, stessa qualità percepita dall’utente finale.


”Adaptive reasoning” — verso il futuro

Da fine 2025, alcuni provider hanno iniziato a integrare il routing dentro il modello stesso:

  • Il modello “decide” se serve thinking, e quanto.
  • L’utente non sceglie più “fast vs reasoning” — c’è un solo endpoint che decide.
  • Es: GPT-5 con auto-thinking, Claude 4.7 hybrid.

Pro: più semplice per developer, più efficienza media. Contro: meno controllo, latency variabile, harder debug.

Trend 2026-27: probabile convergenza su questo modello “modello unico, thinking adattivo”.


Comportamento sul prompt engineering

I reasoning hanno regole leggermente diverse:

✅ Cosa funziona

  • Istruzioni chiare e specifiche.
  • Vincoli espliciti (massimo “thinking tokens”).
  • Output format ben definito.

⚠️ Cosa NON aggiunge valore

  • “Ragiona passo per passo” — già lo fa.
  • Few-shot estesi — possono confondere il thinking proprio del modello.
  • Chain-of-thought esplicita nel prompt — ridondante.

⚠️ Cosa può rallentare

  • Prompt molto lunghi — il modello “pensa” anche sul prompt.
  • Vincoli contraddittori — il modello passa più tempo a riconciliare.

Modalità “thinking budget”

Alcuni provider permettono di controllare quanto pensare:

ProviderParametro
OpenAI o-seriesreasoning_effort: low / medium / high
Claude extendedthinking_budget_tokens: int (es. 5000)
Gemini Deep Thinkthinking_mode: standard / deep
DeepSeek-R1thinking visibile, soglie configurabili

Use case:

  • Effort basso per task semi-strutturati che beneficiano un po’ di thinking.
  • Effort alto per problemi davvero duri.

In produzione, spesso si calibra il budget sul task type.


I rischi del reasoning

⚠️ Faithfulness: il modello non sempre segue davvero il proprio ragionamento. A volte il “thinking” è coerente ma la risposta finale arriva da altro (puntata 114).

⚠️ Hallucination strutturate: un modello che pensa “molto” può costruire bugie complesse e coerenti invece di errori semplici riconoscibili. Più difficile da debuggare.

⚠️ Echo chamber del thinking: se il modello inizia su un percorso sbagliato, il thinking esteso può rafforzare l’errore invece di correggerlo.

⚠️ Cost runaway: se non controlli il budget, una query reasoning può costare 100× più del previsto. Sempre con max_tokens configurato.


TEST pratico (10 minuti)

Prendi un problema che richiede ragionamento (matematica con passi multipli, logica, debugging codice).

  1. Mandalo a GPT-5 mini (fast).
  2. Stesso prompt + “ragiona passo per passo” a GPT-5 mini (CoT su fast).
  3. Mandalo a o4-mini (reasoning).
  4. Stesso prompt a Claude 4.7 Sonnet (fast standard).
  5. Stesso prompt a Claude 4.7 Sonnet con extended thinking.

Misura per ognuno:

  • Risposta corretta? Sì/No.
  • Latency: secondi.
  • Token totali consumati (input + output, e per reasoning anche thinking).
  • Costo stimato.

Spesso scoprirai:

  • Per problemi facili: fast + CoT è competitivo con reasoning.
  • Per problemi medi: reasoning leggero (o4-mini, Sonnet extended) è il sweet spot.
  • Per problemi duri: reasoning heavy (o3, Deep Think) è necessario.

Take-away in una riga

Reasoning vs Fast non è “potente vs debole”, è “thinking vs no-thinking”. Scegli per il task: thinking dove la verifica conta, fast dove la velocità conta. Il 90% delle query reali è fast.

➡️ Prossima puntata: AI sul telefono — Apple Intelligence, Gemini Nano: l’edge.