Puntata 121
Puntata 121 — GPT-5 e la famiglia OpenAI
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli
La famiglia più popolare del mondo. Non un solo modello: una matrice di varianti, dal nano on-device al frontier reasoning. Conoscerla è risparmio diretto in produzione.
La famiglia OpenAI nel 2026
OpenAI non ha un solo modello: ha una matrice di varianti organizzate per:
- Capacità: GPT (general purpose) vs o-series (reasoning).
- Taglia: full → mini → nano.
- Modalità: text, multimodal (4o), realtime voice, image gen (DALL-E), TTS, transcription (Whisper).
Capire la matrice è la chiave per scegliere il modello giusto per ogni task. Sbagliare significa spendere 10× di più (o avere risposte inadeguate).
Lo schema generale (snapshot 2026)
Linea GPT — general purpose, “fast”
- GPT-5 — frontier general, multimodale, default per chat e API.
- GPT-5 mini — più economico, ottimo rapporto qualità/prezzo.
- GPT-5 nano — ultra-leggero, per task semplici ad alto volume.
Linea o-series — reasoning, “thinking”
- o3 — top reasoning, alto costo/latenza, top accuracy su STEM.
- o4-mini — reasoning compatto, sweet spot per coding/matematica.
Linea multimodale dedicata
- GPT-Realtime — voce naturale a bassa latenza (Voice Mode di ChatGPT).
- DALL-E 3 / GPT-Image — generazione immagini integrata.
- Whisper — speech-to-text multilingue (open source).
- TTS — text-to-speech con voci configurabili.
Linea prodotto specializzato
- Operator — agente browser/desktop (computer use).
- Custom GPTs — istanze configurabili con tool e knowledge.
⚠️ Nomi e versioni cambiano spesso. La filosofia (matrice GPT vs o vs mini vs realtime) è più stabile delle release date.
GPT-5: il “general” del 2026
Lanciato nel 2025, GPT-5 è il modello-bandiera. Caratteristiche dichiarate/ricostruite:
- Multimodale nativo: testo + immagini + audio in input.
- Context window: 200k-1M token (a seconda del piano).
- Parametri: non dichiarati (stimati nell’ordine di trilioni, MoE).
- Output: tutti i formati standard + function calling stabile.
- Velocità: tokens/sec elevata sui datacenter dedicati.
Sweet spot d’uso:
- ✅ Scrittura creativa, brainstorm, copywriting.
- ✅ Coding “medio-veloce” (per coding profondo, vedi Claude alla puntata 122).
- ✅ Analisi documenti, riassunti, traduzioni.
- ✅ Chat agentica con tool use.
Limiti:
- ⚠️ Per matematica/logica difficili: spesso meglio o3/o4-mini.
- ⚠️ Per long context >500k token: Gemini è migliore (puntata 123).
- ⚠️ Per privacy stretta: usa modalità “no training” + chat temporanee.
GPT-5 mini e nano: dove paga il volume
I “mini” sono modelli distillati o ottimizzati per essere:
- 5-10× più economici del full GPT-5.
- 2-3× più veloci in latenza.
- 80-90% della qualità sui task non frontier.
Esempi d’uso:
- Mini: tutto il customer support, le classificazioni, le estrazioni di routine.
- Nano: tagger, filtri, mini-router prima del modello grande.
Architettura “cascading”:
Input utente
↓
GPT-5 nano (router): "Questo task è semplice o complesso?"
↓
Semplice → GPT-5 mini risponde
Complesso → GPT-5 risponde
Risparmio in produzione: 80-95% del costo. Standard nell’AI enterprise del 2026.
La o-series: reasoning models
Lanciati da OpenAI con o1 (settembre 2024), evoluti con o3 e o4-mini.
Cosa li distingue:
- Producono migliaia di token “thinking” prima della risposta finale (puntata 114, 267).
- Eccellenti su matematica (AIME, IMO), coding (Codeforces), scienza (GPQA), logica complessa.
- Tu vedi solo un riassunto del ragionamento, non il dettaglio (proprietà di design di OpenAI).
Trade-off:
- ⚠️ Costo per query 5-20× rispetto a GPT-5 (più token = più $$).
- ⚠️ Latenza alta (secondi/decine di secondi anziché < 1s).
- ⚠️ Meno bravi in creatività libera, conversazione casual, scrittura “tonal”.
Quando usarli:
- Problemi STEM con risposta verificabile.
- Coding architetturale complesso.
- Decisioni che richiedono analisi a passi multipli.
- Eval / debug di pipeline LLM.
Realtime API: la voce naturale
Da fine 2024, GPT-Realtime permette conversazione vocale bidirezionale a bassa latenza (~300ms round-trip), con voci espressive.
Differenza con TTS+STT classico:
- Old way: speech → STT → LLM → TTS → speech. ~1.5-3s di latenza, voce robotica.
- Realtime: input audio diretto, output audio diretto. Conversazione vera.
Use case del 2026: voice assistants di nuova generazione (banche, retail), tutor di lingue (puntata 97), accessibilità (puntata 59).
⚠️ Costo: ~$0.06/min input + $0.24/min output al lancio. Caro per uso massivo. In calo.
Custom GPTs e Projects
ChatGPT consumer offre due strumenti per personalizzazione:
Custom GPTs (dal 2023)
- System prompt persistente.
- Knowledge files caricabili (max ~10 PDF).
- Actions (tool API esterne).
- Condivisibili nella GPT Store.
Buon per: agenti specializzati per task ricorrenti, demo, prototipi.
Projects (dal 2024)
- Workspace dedicato con system prompt persistente.
- File condivisi tra chat.
- Memory limitata al project.
Buon per: lavoro su un progetto/cliente specifico nel tempo.
Per applicazioni serie: API + templating (puntata 119), non Custom GPT.
Operator e gli agenti
Dal 2025, OpenAI ha lanciato Operator: un agente browser/desktop che vede lo schermo, clicca, digita, naviga.
Modello sotto: CUA (Computer Use Agent), basato su GPT con training specifico per vision-action.
Use case 2026:
- Prenotare voli/ristoranti.
- Compilare moduli ripetitivi.
- Web scraping intelligente.
- Test automatici di UI.
Limiti reali:
- Lento (10-60s per task).
- Costoso (~$0.50-2/task complesso).
- Fallisce su UI molto custom.
- Pone serie domande di sicurezza (computer ti delega azioni).
Vedi puntata 244 sui browser/desktop agents.
Pricing tipico (snapshot 2026)
Prezzi indicativi per 1M token (in evoluzione costante):
| Modello | Input | Output | Note |
|---|---|---|---|
| GPT-5 | $2-5 | $15-30 | Frontier general |
| GPT-5 mini | $0.25-0.50 | $1-2 | Sweet spot |
| GPT-5 nano | $0.05-0.10 | $0.30-0.50 | Ultra-cheap |
| o3 | $15-30 | $60-120 | Premium reasoning |
| o4-mini | $1-3 | $5-12 | Reasoning low-cost |
| Realtime audio | $0.06/min in, $0.24/min out | Voice |
In OpenAI Platform: prezzi sempre aggiornati a openai.com/api/pricing.
Quale GPT scegliere
Tabella decisionale:
| Task | Modello consigliato |
|---|---|
| Chat consumer general | GPT-5 |
| Customer support B2C ad alto volume | GPT-5 mini + few-shot |
| Classificazione, tagging, embed routing | GPT-5 nano |
| Coding produzione | Claude 4.7 (vedi 122) > GPT-5 / o4-mini |
| Matematica, scienza, logica | o3 o o4-mini |
| Long context (PDF di 300+ pagine) | Gemini 2.5 Pro (vedi 123) |
| Voice agent | GPT-Realtime |
| Computer use, automazione UI | Operator (CUA) |
| Generazione immagini | GPT-Image / DALL-E 3 |
In molte produzioni, GPT-5 mini fa il 70%, GPT-5 il 20%, o4-mini il 10%. Calibrare sulla qualità richiesta e sul costo accettabile.
I limiti onesti della famiglia OpenAI
⚠️ Closed-source: pesi non disponibili, niente self-hosting.
⚠️ Dipendenza commerciale: prezzo e disponibilità decisi da OpenAI. Lock-in.
⚠️ Privacy: dati sui server US (con opzioni “no training”, ma sempre meno “tuoi” rispetto a self-host).
⚠️ Storia di sycophancy: GPT-4o aveva problemi noti di “yes-man” nel 2024-25, ridotti in GPT-5 ma non eliminati (puntata 174).
⚠️ Disponibilità in UE: l’AI Act (puntata 191) ha imposto alcune restrizioni sulle feature più recenti. Verifica disponibilità sulla tua regione.
TEST pratico (10 minuti)
Sul Playground OpenAI (platform.openai.com/playground):
- Prendi un task realistico del tuo lavoro.
- Lancialo su:
- GPT-5
- GPT-5 mini
- o4-mini
- Misura per ognuno:
- Costo stimato (mostrato nel playground).
- Latenza (tempo di risposta).
- Qualità soggettiva (1-10).
- Per il tuo task specifico, qual è il rapporto qualità/prezzo migliore?
Quasi sempre: il modello che vince non è il più grande. È il più appropriato al task.
Take-away in una riga
OpenAI non è “GPT-5”. È una matrice di varianti — saperle distinguere fa la differenza tra spreco e produzione efficiente.
➡️ Prossima puntata: Claude di Anthropic — long context, scrittura, code.