✔️✔️ Doppie Spunte Blu Cap. 12 · Il bestiario dei modelli

Puntata 121

Puntata 121 — GPT-5 e la famiglia OpenAI

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli

La famiglia più popolare del mondo. Non un solo modello: una matrice di varianti, dal nano on-device al frontier reasoning. Conoscerla è risparmio diretto in produzione.

un albero genealogico con foto in vetrina dei modelli OpenAI dal 2018 a oggi. Rami principali: serie GPT (3, 3.5, 4, 4o, 5), serie o-reasoning (o1, o3, o4-mini), serie mini/nano. In basso, anno per anno, i benchmark che salgono

La famiglia OpenAI nel 2026

OpenAI non ha un solo modello: ha una matrice di varianti organizzate per:

  • Capacità: GPT (general purpose) vs o-series (reasoning).
  • Taglia: full → mininano.
  • Modalità: text, multimodal (4o), realtime voice, image gen (DALL-E), TTS, transcription (Whisper).

Capire la matrice è la chiave per scegliere il modello giusto per ogni task. Sbagliare significa spendere 10× di più (o avere risposte inadeguate).


Lo schema generale (snapshot 2026)

Linea GPT — general purpose, “fast”

  • GPT-5 — frontier general, multimodale, default per chat e API.
  • GPT-5 mini — più economico, ottimo rapporto qualità/prezzo.
  • GPT-5 nano — ultra-leggero, per task semplici ad alto volume.

Linea o-series — reasoning, “thinking”

  • o3 — top reasoning, alto costo/latenza, top accuracy su STEM.
  • o4-mini — reasoning compatto, sweet spot per coding/matematica.

Linea multimodale dedicata

  • GPT-Realtime — voce naturale a bassa latenza (Voice Mode di ChatGPT).
  • DALL-E 3 / GPT-Image — generazione immagini integrata.
  • Whisper — speech-to-text multilingue (open source).
  • TTS — text-to-speech con voci configurabili.

Linea prodotto specializzato

  • Operator — agente browser/desktop (computer use).
  • Custom GPTs — istanze configurabili con tool e knowledge.

⚠️ Nomi e versioni cambiano spesso. La filosofia (matrice GPT vs o vs mini vs realtime) è più stabile delle release date.


GPT-5: il “general” del 2026

Lanciato nel 2025, GPT-5 è il modello-bandiera. Caratteristiche dichiarate/ricostruite:

  • Multimodale nativo: testo + immagini + audio in input.
  • Context window: 200k-1M token (a seconda del piano).
  • Parametri: non dichiarati (stimati nell’ordine di trilioni, MoE).
  • Output: tutti i formati standard + function calling stabile.
  • Velocità: tokens/sec elevata sui datacenter dedicati.

Sweet spot d’uso:

  • ✅ Scrittura creativa, brainstorm, copywriting.
  • ✅ Coding “medio-veloce” (per coding profondo, vedi Claude alla puntata 122).
  • ✅ Analisi documenti, riassunti, traduzioni.
  • ✅ Chat agentica con tool use.

Limiti:

  • ⚠️ Per matematica/logica difficili: spesso meglio o3/o4-mini.
  • ⚠️ Per long context >500k token: Gemini è migliore (puntata 123).
  • ⚠️ Per privacy stretta: usa modalità “no training” + chat temporanee.

GPT-5 mini e nano: dove paga il volume

I “mini” sono modelli distillati o ottimizzati per essere:

  • 5-10× più economici del full GPT-5.
  • 2-3× più veloci in latenza.
  • 80-90% della qualità sui task non frontier.

Esempi d’uso:

  • Mini: tutto il customer support, le classificazioni, le estrazioni di routine.
  • Nano: tagger, filtri, mini-router prima del modello grande.

Architettura “cascading”:

Input utente

GPT-5 nano (router): "Questo task è semplice o complesso?"

Semplice → GPT-5 mini risponde
Complesso → GPT-5 risponde

Risparmio in produzione: 80-95% del costo. Standard nell’AI enterprise del 2026.


La o-series: reasoning models

Lanciati da OpenAI con o1 (settembre 2024), evoluti con o3 e o4-mini.

Cosa li distingue:

  • Producono migliaia di token “thinking” prima della risposta finale (puntata 114, 267).
  • Eccellenti su matematica (AIME, IMO), coding (Codeforces), scienza (GPQA), logica complessa.
  • Tu vedi solo un riassunto del ragionamento, non il dettaglio (proprietà di design di OpenAI).

Trade-off:

  • ⚠️ Costo per query 5-20× rispetto a GPT-5 (più token = più $$).
  • ⚠️ Latenza alta (secondi/decine di secondi anziché < 1s).
  • ⚠️ Meno bravi in creatività libera, conversazione casual, scrittura “tonal”.

Quando usarli:

  • Problemi STEM con risposta verificabile.
  • Coding architetturale complesso.
  • Decisioni che richiedono analisi a passi multipli.
  • Eval / debug di pipeline LLM.

Realtime API: la voce naturale

Da fine 2024, GPT-Realtime permette conversazione vocale bidirezionale a bassa latenza (~300ms round-trip), con voci espressive.

Differenza con TTS+STT classico:

  • Old way: speech → STT → LLM → TTS → speech. ~1.5-3s di latenza, voce robotica.
  • Realtime: input audio diretto, output audio diretto. Conversazione vera.

Use case del 2026: voice assistants di nuova generazione (banche, retail), tutor di lingue (puntata 97), accessibilità (puntata 59).

⚠️ Costo: ~$0.06/min input + $0.24/min output al lancio. Caro per uso massivo. In calo.


Custom GPTs e Projects

ChatGPT consumer offre due strumenti per personalizzazione:

Custom GPTs (dal 2023)

  • System prompt persistente.
  • Knowledge files caricabili (max ~10 PDF).
  • Actions (tool API esterne).
  • Condivisibili nella GPT Store.

Buon per: agenti specializzati per task ricorrenti, demo, prototipi.

Projects (dal 2024)

  • Workspace dedicato con system prompt persistente.
  • File condivisi tra chat.
  • Memory limitata al project.

Buon per: lavoro su un progetto/cliente specifico nel tempo.

Per applicazioni serie: API + templating (puntata 119), non Custom GPT.


Operator e gli agenti

Dal 2025, OpenAI ha lanciato Operator: un agente browser/desktop che vede lo schermo, clicca, digita, naviga.

Modello sotto: CUA (Computer Use Agent), basato su GPT con training specifico per vision-action.

Use case 2026:

  • Prenotare voli/ristoranti.
  • Compilare moduli ripetitivi.
  • Web scraping intelligente.
  • Test automatici di UI.

Limiti reali:

  • Lento (10-60s per task).
  • Costoso (~$0.50-2/task complesso).
  • Fallisce su UI molto custom.
  • Pone serie domande di sicurezza (computer ti delega azioni).

Vedi puntata 244 sui browser/desktop agents.


Pricing tipico (snapshot 2026)

Prezzi indicativi per 1M token (in evoluzione costante):

ModelloInputOutputNote
GPT-5$2-5$15-30Frontier general
GPT-5 mini$0.25-0.50$1-2Sweet spot
GPT-5 nano$0.05-0.10$0.30-0.50Ultra-cheap
o3$15-30$60-120Premium reasoning
o4-mini$1-3$5-12Reasoning low-cost
Realtime audio$0.06/min in, $0.24/min outVoice

In OpenAI Platform: prezzi sempre aggiornati a openai.com/api/pricing.


Quale GPT scegliere

Tabella decisionale:

TaskModello consigliato
Chat consumer generalGPT-5
Customer support B2C ad alto volumeGPT-5 mini + few-shot
Classificazione, tagging, embed routingGPT-5 nano
Coding produzioneClaude 4.7 (vedi 122) > GPT-5 / o4-mini
Matematica, scienza, logicao3 o o4-mini
Long context (PDF di 300+ pagine)Gemini 2.5 Pro (vedi 123)
Voice agentGPT-Realtime
Computer use, automazione UIOperator (CUA)
Generazione immaginiGPT-Image / DALL-E 3

In molte produzioni, GPT-5 mini fa il 70%, GPT-5 il 20%, o4-mini il 10%. Calibrare sulla qualità richiesta e sul costo accettabile.


I limiti onesti della famiglia OpenAI

⚠️ Closed-source: pesi non disponibili, niente self-hosting.

⚠️ Dipendenza commerciale: prezzo e disponibilità decisi da OpenAI. Lock-in.

⚠️ Privacy: dati sui server US (con opzioni “no training”, ma sempre meno “tuoi” rispetto a self-host).

⚠️ Storia di sycophancy: GPT-4o aveva problemi noti di “yes-man” nel 2024-25, ridotti in GPT-5 ma non eliminati (puntata 174).

⚠️ Disponibilità in UE: l’AI Act (puntata 191) ha imposto alcune restrizioni sulle feature più recenti. Verifica disponibilità sulla tua regione.


TEST pratico (10 minuti)

Sul Playground OpenAI (platform.openai.com/playground):

  1. Prendi un task realistico del tuo lavoro.
  2. Lancialo su:
    • GPT-5
    • GPT-5 mini
    • o4-mini
  3. Misura per ognuno:
    • Costo stimato (mostrato nel playground).
    • Latenza (tempo di risposta).
    • Qualità soggettiva (1-10).
  4. Per il tuo task specifico, qual è il rapporto qualità/prezzo migliore?

Quasi sempre: il modello che vince non è il più grande. È il più appropriato al task.


Take-away in una riga

OpenAI non è “GPT-5”. È una matrice di varianti — saperle distinguere fa la differenza tra spreco e produzione efficiente.

➡️ Prossima puntata: Claude di Anthropic — long context, scrittura, code.