🧙 Maestro Yoda Cap. 21 · Open source e HuggingFace

Puntata 225

Puntata 225 — La famiglia open: Llama, Mistral, Qwen, DeepSeek, Gemma, Kimi

Livello: 🧙 Maestro Yoda · Capitolo 21 · Open source e HuggingFace

Nel 2026 i “modelli open” non sono più “il fratello povero di GPT-4”. Sono una famiglia con i suoi capofamiglia, le sue cugine americane, i parenti cinesi e gli zii francesi. E si litigano la leaderboard a colpi di paper.

foto di famiglia in salotto stile anni ‘70, ma i parenti sono mascotte aziendali: il lama di Meta, la mistral francese, il dragoncino cinese di Qwen, la balena di DeepSeek, la gemma di Google, la luna di Kimi. In mezzo, lo zio scapestrato (Mistral) che fuma. Sotto: “il pranzo della domenica dei pesi aperti”

Una mappa rapida del 2026

Dividere per lab di provenienza:

FamigliaLabPaeseLicense tipicaForza
LlamaMeta🇺🇸Llama CommunityForza brutale, ecosistema
MistralMistral AI🇫🇷Apache 2.0 (parte) + customEfficienza, multilingua EU
QwenAlibaba🇨🇳Apache 2.0 / Qwen LicenseRange vasto, multilingua
DeepSeekDeepSeek (HF)🇨🇳MIT / DeepSeek LicenseReasoning + costo
GemmaGoogle🇺🇸Gemma LicenseOn-device, sicurezza
KimiMoonshot AI🇨🇳Modified MITContext lungo

Altri rilevanti: Yi (01.AI), Phi (Microsoft), OLMo (AI2, full open), SmolLM (HuggingFace), GLM (ZhipuAI), Falcon (TII Emirati), Aya (Cohere), StableLM (Stability AI). Ne tratteremo dettagli più avanti.


Llama (Meta)

La famiglia che ha aperto il mercato. Cronologia chiave:

  • LLaMA 1 (Feb 2023, “research only”, leakato su 4chan in 1 settimana).
  • Llama 2 (Lug 2023, Apache-like ma con caveat: aziende >700M utenti devono chiedere license a parte).
  • Llama 3 (Apr 2024) — 8B, 70B; reset di qualità.
  • Llama 3.1 (Lug 2024) — 405B, primo open frontier-class.
  • Llama 3.2 (Set 2024) — 1B, 3B (per edge) + 11B, 90B (vision).
  • Llama 3.3 70B (Dic 2024) — pari qualità del 405B a 1/6 dei parametri.
  • Llama 4 (2025) — famiglia MoE multimodale nativa (Scout, Maverick, Behemoth-research).

Tutti scaricabili da HF (gated). Stack transformers first-class. Lo standard de facto su cui si misura “quanto vale un open”.

Note critiche:

  • License Llama Community non è OSI-approved (vedi puntata 226).
  • Dati di pretraining non pubblicati.
  • Bias linguistico: ottimo in inglese, decente in italiano, mediocre nelle lingue minoritarie.

Mistral (Mistral AI)

Lab francese fondato nel 2023 da ex-DeepMind/Meta (Mensch, Lample, Lacroix). Religione: “compute-efficiency con architetture moderne”.

Modelli rilevanti:

  • Mistral 7B (Set 2023) — sliding window attention, GQA. Apache 2.0. Bench: piegava Llama 2 13B con metà dei parametri.
  • Mixtral 8x7B (Dic 2023) — primo MoE open di rilievo (vedi puntata 204).
  • Mixtral 8x22B (Apr 2024).
  • Mistral Large 2 (Lug 2024) — 123B dense, Mistral Research License (non Apache).
  • Mistral Small / Pixtral / Codestral — versioni specializzate per task verticali.

La svolta del 2024: i modelli flagship sono passati a license proprietaria (research only). Solo i modelli “smaller” restano Apache 2.0. È un trade-off commerciale comprensibile ma deludente per la community.

Punto forte: ottima qualità multilingua europea (francese, italiano, spagnolo, tedesco). Per progetti EU spesso preferito su Llama.


Qwen (Alibaba)

Famiglia cinese più “completa” del mondo open nel 2026.

Highlights:

  • Qwen 2.5 (Set 2024): dalla 0.5B alla 72B, con varianti Math/Coder/VL/Audio. Tutte Apache 2.0 fino a 14B, Qwen License sopra.
  • Qwen 3 (2025): MoE + reasoning toggle (thinking_mode).
  • Qwen-Audio e Qwen-VL — multimodali integrati, non add-on.
  • Token vocabulary include 150k+ token, ottimo per cinese, decente per italiano.

In Cina è di fatto lo standard nazionale, ma anche in Europa molti benchmark indipendenti danno Qwen tra i migliori in classe a parità di parametri. Su HuggingFace è da mesi tra i top-10 più scaricati al mondo.


DeepSeek

Spinoff della società di trading quantistico High-Flyer. Operazione che ha squassato il 2025.

Cronologia:

  • DeepSeek-V2 (Mag 2024) — MoE, MLA (multi-head latent attention, vedi puntata 208).
  • DeepSeek-V3 (Dic 2024) — 671B totali / 37B attivi, training a $5.5M dichiarati. Causa “panico di valutazione” sui big tech USA.
  • DeepSeek-R1 (Gen 2025) — primo modello open reasoning di frontiera; pari a OpenAI o1 su molti bench; rilasciato MIT con tutto: pesi, codice, paper, traces RL.
  • R1-Distill — versione distillata su Qwen 7B/14B/32B e Llama 8B/70B: reasoning solido anche su modelli piccoli.

Il rilascio R1 ha cambiato il sentiment sui modelli reasoning open: prima erano “anni indietro a o1”, dopo R1 sono “settimane indietro al frontier closed”.


Gemma (Google)

Versione open di Google, derivata dal training stack di Gemini.

  • Gemma 1 (Feb 2024) — 2B, 7B.
  • Gemma 2 (Giu 2024) — 2B, 9B, 27B. Sliding window + global attention alternato.
  • Gemma 3 (2025) — 1B, 4B, 12B, 27B, multimodale (testo+immagine), context 128k.
  • CodeGemma, RecurrentGemma, PaliGemma, MedGemma, ShieldGemma — specializzazioni verticali.

Forza: on-device (1B–4B girano su laptop e smartphone moderni), tooling sicurezza maturo (ShieldGemma per content moderation), license meno restrittiva di Llama in alcuni casi d’uso.

Limite: la Gemma License ha restrizioni d’uso (no prohibited use) che non sono OSI-approved.


Kimi (Moonshot AI)

Startup cinese specializzata in long context.

  • Kimi-K1.5 (Gen 2025) — reasoning model.
  • Kimi-K2 (2025) — 1T parameter MoE (32B attivi), forte su coding/agentic. Modified MIT.
  • Punto distintivo: assistant Kimi (kimi.ai) gestiva già nel 2024 context da 2 milioni di token. Sul lato open, K2 ha rilasciato pesi + tooling che molti integratori hanno apprezzato per task agentici.

Chi escludere (e perché)

Vale la pena nominare ma non approfondire ora:

  • Falcon (TII Emirati) — pionieristico nel 2023, oggi un po’ fuori dal mainstream.
  • Yi (01.AI) — buona qualità, ecosistema più piccolo.
  • Phi (Microsoft) — vedi puntate 219-220 (textbook approach), license MIT, fortissimo a parità di size.
  • OLMo (AI2) — la “true open” radicale (dataset + log + checkpoint pubblici), ma non frontier.
  • SmolLM (HuggingFace) — 135M/360M/1.7B, didattica e edge.
  • GLM (ZhipuAI), Hunyuan (Tencent), Yi-Lightning: altri cinesi attivi.

Come scegliere nel 2026

Tre criteri pratici:

  1. License compatibile col tuo uso? (Vedi puntata 232 sui pitfall.)
  2. Range parametrico giusto? Edge (1-3B), laptop GPU (7-13B), workstation (30-70B), datacenter (>100B).
  3. Lingua e dominio target? Italiano: Mistral / Qwen / Llama 3.x; reasoning: DeepSeek-R1; on-device: Gemma / Llama 3.2 / Phi; coding: Qwen-Coder / DeepSeek-Coder / Codestral.

Regola operativa: per un primo prototipo italiano scegli Qwen 2.5 7B o Llama 3.2 3B, scaricati subito da HF, fai 20 prompt rappresentativi, confronta. Cambia se non ti convince.


Glossario lampo

  • MoE (Mixture of Experts) — architettura con N esperti, solo k attivi per token (vedi puntata 204). Comune in V3, K2, Mixtral, Llama 4.
  • MLA (Multi-head Latent Attention) — tecnica DeepSeek che comprime KV-cache, ~6× memoria in meno (vedi puntata 208).
  • R1-Distill — modelli più piccoli (Qwen/Llama) addestrati sulle reasoning traces di DeepSeek-R1.
  • Gated model — su HF richiede l’accettazione license + token per il download.

Take-away

L’AI open nel 2026 non ha un re. Ha una famiglia allargata, multiculturale e litigiosa, in cui ogni mese cambia il leader della leaderboard. La conseguenza pratica: chi sviluppa sa che fra 6 mesi userà probabilmente un modello diverso da quello che usa oggi. La fluidità della scelta è il vero vantaggio competitivo dell’open.


➡️ Prossima puntata: “open weight” vs “open source” — la distinzione critica che cambia la legalità del tuo prodotto.