Puntata 125
Puntata 125 — Mistral, Qwen, DeepSeek, Kimi
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli
Quattro famiglie open weights non-Meta. Una europea (Mistral), tre cinesi (Qwen, DeepSeek, Kimi). Insieme stanno chiudendo il gap con i frontier USA, a costi una frazione.
Perché parlarne separatamente da Llama
Llama (puntata 124) è il padre dell’open-weight, ma non l’unico player. Nel 2024-26 sono emersi competitor open seri che in alcuni benchmark battono Llama:
- Mistral (Francia, fondata da ex-Meta/Google) — il portabandiera europeo.
- Qwen (Alibaba, Cina) — leader cinese closed e open.
- DeepSeek (Cina) — il “disrupter” del 2024-25 con prezzi-shock.
- Kimi / Moonshot (Cina) — pioniere del long context cinese.
Insieme cambiano la geopolitica dell’AI.
Mistral (Francia)
Chi
Fondata nel 2023 a Parigi. Valutata ~6B$ nel 2024. Carta dello stato francese ed europeo per la sovereign AI.
Famiglia di modelli
- Mistral 7B (sett. 2023) — pioniere del piccolo-ma-buono.
- Mixtral 8x7B / 8x22B — MoE open, qualità competitiva con costo inferiore.
- Mistral Large 2 — closed flagship.
- Codestral — modello dedicato al coding.
- Pixtral — multimodale (testo + immagini).
- Ministral 3B / 8B — edge models.
- Mistral Saba — focus lingue arabe e sud-asiatiche.
Distintivi
- ✅ Forte focus europeo: data center in EU, GDPR-friendly, certificazioni.
- ✅ Mix open + closed: alcuni modelli aperti (Apache 2.0 vero), altri closed.
- ✅ Buona qualità multilingua europeo: francese, tedesco, italiano, spagnolo trattati meglio della media.
- ✅ Mixtral MoE = qualità di un grande modello, costo di uno più piccolo.
Quando sceglierlo
- Aziende EU con vincoli di sovereignty.
- Use case multilingua europeo.
- Open-source con licenza Apache 2.0 vera (non Community come Llama).
- Coding (Codestral è specialista).
Limiti
- Frontier-class non al pari di GPT-5/Claude 4.7/Gemini 2.5.
- Adoption mondiale minore di Llama/Qwen.
Qwen (Alibaba)
Chi
Famiglia di Alibaba Cloud (gruppo Tongyi Lab). Cina. Forte adozione enterprise sia in Cina sia globalmente.
Famiglia di modelli (2026)
- Qwen 3 (rolling release) — taglie da 0.5B a 235B+ MoE.
- Qwen 3 Coder — flagship coding open-weight, top globale per molti benchmark coding.
- Qwen 3-VL — vision-language top.
- Qwen 3 Omni — multimodale completo (testo + voce + immagine + video).
- Qwen 2.5 Math — specialist math.
Distintivi
- ✅ Eccellente nelle lingue asiatiche (cinese, giapponese, coreano, vietnamita).
- ✅ Forte su coding, spesso sopra Claude in benchmark open-weight.
- ✅ Licenza permissiva (Apache 2.0 per la maggior parte).
- ✅ Famiglia ricca: copre tutte le taglie e i casi d’uso.
- ✅ Buona qualità anche in lingue occidentali (italiano incluso).
Quando sceglierlo
- Coding open-weight di alto livello.
- Lingue asiatiche.
- Quando vuoi MoE potente con licenza pulita.
- Self-hosting in geografie dove i modelli US sono limitati.
Limiti / cautele
- Origine cinese → alcuni governi (USA, UK, India) hanno restrizioni o monitoring su uso enterprise.
- Per topic politicamente sensibili in Cina, ha filtri specifici non sempre trasparenti.
- Reputazione enterprise USA/EU ancora in costruzione.
DeepSeek (Cina)
Chi
Lab di Hangzhou (Cina), fondato 2023. Diventato fenomeno globale nel gennaio 2025 con il lancio di DeepSeek-R1.
Famiglia di modelli
- DeepSeek-V3 — base model, MoE 671B (37B attivi per token). Quasi alla pari con GPT-4o.
- DeepSeek-R1 — modello reasoning, comparabile a o1 e gemini deep-think, a frazione del costo.
- DeepSeek-Coder — coding specialist.
- DeepSeek-VL — vision-language.
Cosa lo rende straordinario
- ✅ Costo training claim: ~5M$ (vs centinaia di milioni per i top USA). Controverso ma rivoluzionario se vero.
- ✅ Open-weight totale (MIT-like license per V3 e R1).
- ✅ Reasoning visibile: a differenza di o-series OpenAI (nasconde il thinking), DeepSeek-R1 mostra tutto il chain-of-thought. Trasparenza eccellente.
- ✅ Pricing API: ~10× più economico delle alternative US.
L’impatto del gennaio 2025
La pubblicazione di DeepSeek-R1 ha:
- Fatto crollare Nvidia in borsa (-17% in un giorno).
- Costretto OpenAI/Anthropic/Google a rivedere le pricing strategies.
- Mostrato che l’efficienza algoritmica può sostituire massa di GPU.
- Riaperto il dibattito sull’export controls USA (puntata 193).
Quando sceglierlo
- Reasoning open con thinking visibile (debugging, ricerca).
- Matematica/coding ad alto livello.
- Quando il costo conta molto.
- Sperimentazione algoritmica.
Limiti / cautele
- Stesse considerazioni di Qwen su geopolitica.
- Filtri su topic politici cinesi (Tienanmen, Tibet, Taiwan).
- Affidabilità infrastrutturale del provider hosted (occasionali downtime nel 2025).
Kimi (Moonshot)
Chi
Startup cinese di Pechino, fondata 2023. Lab Moonshot AI. Famosa per essere stata pioniere del long context in Cina.
Famiglia di modelli
- Kimi-K2 — flagship general.
- Kimi-K1.5 — versione precedente, ancora utile.
- Kimi reasoning — variante con thinking esteso.
Distintivi
- ✅ Long context fino a 200k-2M token (focus storico).
- ✅ Forte in cinese (di gran lunga).
- ✅ App consumer popolare in Cina — Kimi è un brand mainstream lì.
- ✅ Open-weight su alcuni modelli (Kimi-K2 base aperta nel 2025).
Quando sceglierlo
- Use case su long context in cinese.
- Sperimentazione open su modelli MoE potenti.
- Per chi vuole un’alternativa cinese diversa da Qwen/DeepSeek.
Limiti
- Adoption fuori dalla Cina ancora marginale.
- Performance in italiano/lingue europee inferiore a Qwen/Mistral.
Bestiario aggiuntivo (open-weight 2026)
Altri modelli open che vale la pena conoscere:
| Modello | Origine | Punto di forza |
|---|---|---|
| Gemma 3 | Open weights di Google, ottime taglie piccole-medie | |
| Phi-4 | Microsoft | Modelli “piccoli ma bravi”, focus su reasoning data sintetico |
| Falcon | UAE (TII) | Storico open, meno rilevante 2026 |
| Yi | 01.AI (Cina, Kai-Fu Lee) | Buono multilingua |
| Command R+ | Cohere (Canada) | RAG e tool use specialisti |
| Granite | IBM | Enterprise-focused, open weights |
| Nemotron | Nvidia | Modelli ottimizzati per HW Nvidia |
L’ecosistema è vivissimo. Vale la pena seguire HuggingFace Hub leaderboards + Artificial Analysis per ranking aggiornati.
La geopolitica open weights 2026
USA frontier closed-source: GPT, Claude, Gemini. USA open-weight: Llama, Gemma, Phi. Cina open-weight: Qwen, DeepSeek, Kimi, Yi. Europa: Mistral (principalmente), modelli sovrani in vari paesi. Resto del mondo: Falcon (UAE), modelli giapponesi/indiani in crescita.
Tema centrale: chi controlla il modello controlla il futuro economico. I governi (UE con AI Act, USA con CHIPS Act, Cina con piani quinquennali) stanno investendo massivamente.
Vedi puntate 189-200 (geopolitica e regole).
La matrice di scelta per il developer italiano
Se sei un developer italiano nel 2026:
| Scenario | Scelta consigliata |
|---|---|
| Migliore qualità coding open | Qwen 3 Coder o DeepSeek-Coder |
| Self-host, lingua italiana | Mistral Large 2 o Llama 3.1 fine-tunato Minerva |
| Sovereignty UE | Mistral (deployment EU) |
| Reasoning trasparente | DeepSeek-R1 |
| Long context massimo open | Qwen 3 235B-VL o Kimi-K2 |
| Edge/mobile | Phi-4, Gemma 3 small, Ministral 3B |
| Bilanciato general-purpose | Mixtral 8x22B o Qwen 3 32B |
In molti casi, ensemble di 2-3 modelli specializzati batte un singolo modello generalista.
Pricing tipico hosted (2026)
Indicativi $/1M token, da provider come Together AI, Fireworks, Groq:
| Modello | Input | Output |
|---|---|---|
| Mistral Large 2 | $2 | $6 |
| Mixtral 8x22B | $1.20 | $1.20 |
| Qwen 3 32B | $0.30 | $0.50 |
| Qwen 3 Coder 32B | $0.40 | $0.80 |
| DeepSeek-V3 | $0.27 | $1.10 |
| DeepSeek-R1 | $0.55 | $2.20 |
| Llama 3.1 405B | $3 | $3 |
| Llama 3 70B | $0.60 | $0.80 |
Prezzi 5-20× più bassi dei frontier closed-source. Il calcolo cambia ovviamente in self-host.
I limiti onesti dell’open-weight
⚠️ Lavoro operativo aumenta: self-host = ops, monitoring, scaling, security. Non gratis come “API call”.
⚠️ Frontier gap esiste ancora: per il top dei task complessi (matematica AIME, frontier coding architetturale), closed-source US sono ancora avanti — anche se il gap si chiude.
⚠️ Aggiornamenti continui: il bestiario cambia ogni 3 mesi. Mantenere “il modello giusto” è un costo continuo di valutazione.
⚠️ Compliance: ogni modello open ha sua licenza, sue restrizioni d’uso, sue policy. Legal review necessario per uso commerciale serio.
TEST pratico (15 minuti)
Su Hugging Face Spaces o OpenRouter (gratis o quasi):
- Prendi una task realistica.
- Lanciala su 4 modelli diversi:
- Llama 3.1 70B (US, baseline open).
- Mistral Large 2 o Mixtral 8x22B (EU).
- Qwen 3 (Cina).
- DeepSeek-V3 o R1 (Cina, reasoning).
- Confronta qualità e tono. Quale ti suona più appropriato per il tuo dominio?
Sorpresa frequente: per task italiani, Mistral o Qwen spesso meglio di Llama nei dettagli linguistici. DeepSeek-R1 vince su reasoning. Mixtral ottimo rapporto qualità/prezzo.
Multi-provider routing è il futuro.
Take-away in una riga
Open-weight 2026 = 4 famiglie principali fuori da Meta + dozzine di derivati. Il gap con i frontier closed si chiude rapidamente, i prezzi crollano, le opzioni esplodono. Saperle distinguere è competenza decisiva.
➡️ Prossima puntata: Perplexity, You.com — la ricerca AI.