✔️✔️ Doppie Spunte Blu Cap. 12 · Il bestiario dei modelli

Puntata 124

Puntata 124 — Llama: la famiglia open di casa Meta

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli

L’open-weight più scaricato del mondo. Non il “migliore in assoluto”, ma quello su cui puoi mettere le mani: girare offline, fine-tunare, ispezionare, deploy on-prem.

una scatola aperta etichettata “Llama” con dentro pezzi smontabili e istruzioni di montaggio (i pesi del modello). Accanto, varie versioni dei pezzi: 1B, 8B, 70B, 405B, ognuna come “kit” diverso. Un developer assembla il suo modello custom

Open ≠ Open Source: la distinzione critica

Meta chiama Llama “open source”, ma è più preciso definirlo open-weight:

  • ✅ I pesi (i numeri del modello addestrato) sono scaricabili gratis.
  • ✅ Puoi farci inferenza offline, gratuita, senza vincoli pratici per uso “normale”.
  • ✅ Puoi fine-tunare su dati tuoi.
  • ⚠️ La licenza è “Llama Community License” — permissiva ma con clausole (es. divieto per aziende >700M utenti senza accordo separato).
  • Niente codice del training, niente dataset di training, niente dettagli sui dati di RLHF.

È molto più aperto di GPT/Claude/Gemini (zero accesso), ma meno aperto di Apache 2.0 / MIT puro. Vedi puntata 226 per la distinzione completa.


La famiglia Llama nel 2026

Meta rilascia versioni nuove ~ ogni 6-12 mesi. Stato 2026:

Llama 3 (luglio 2024)

  • Llama 3 8B — sweet spot per laptop/server piccoli.
  • Llama 3 70B — top dense general purpose.
  • Llama 3.1 405B — frontier-class (genuinely competitive con GPT/Claude su molti benchmark).

Llama 3.2 (settembre 2024) — multimodalità

  • Llama 3.2 1B / 3B — modelli on-device per mobile.
  • Llama 3.2 11B / 90B Vision — primi Llama multimodali (vedono immagini).

Llama 4 (atteso/in rolling release 2025-26)

  • Famiglia MoE su scala maggiore.
  • Multimodalità nativa migliorata.
  • Specific reasoning models.

⚠️ Le release di Meta sono frequenti. Versioni e nomi evolvono.


Perché Llama conta tanto

1. Base di tantissimi modelli derivati

Migliaia di modelli fine-tunati su Llama sono in giro:

  • Italian-tuned: Minerva, LLaMAntino (su Llama 3).
  • Coding-tuned: CodeLlama, OpenCodeInterpreter.
  • Medical-tuned: Med-Llama, BioMistral (basato su Mistral, parente stretto).
  • Chat-tuned: WizardLM, Vicuna (storici), Hermes Llama 3.

Senza Llama (open-weight), la community open di specializzazioni di dominio non esisterebbe.

2. Standard di benchmarking

Llama 3 8B / 70B sono i baseline contro cui ogni nuovo modello open viene confrontato. “Batte Llama 3 70B su X?” è la domanda standard.

3. Disponibilità on-prem / edge

Per aziende con vincoli di compliance (sanità, banche, PA), avere il modello on-prem è non-negoziabile. Llama è la scelta principale per:

  • Server interni.
  • Datacenter privati.
  • Edge devices.

4. Costo: solo elettricità

Una volta scaricato il modello, l’inferenza costa solo GPU + elettricità. Per use case ad alto volume con privacy o budget stretti, vantaggio enorme.


VRAM e taglia: stime pratiche

Quanta GPU ti serve per girare Llama? Stime semplici per inferenza FP16:

ModelloVRAM FP16INT8INT4 (GGUF/GPTQ)
Llama 3.2 1B~3 GB~2 GB~1 GB
Llama 3.2 3B~7 GB~4 GB~2 GB
Llama 3 8B~18 GB~9 GB~5 GB
Llama 3 70B~140 GB~70 GB~35-40 GB
Llama 3.1 405B~810 GB~410 GB~210 GB

GPU consumer di riferimento:

  • RTX 4090 (24 GB): Llama 8B FP16, 70B INT4 con offload.
  • RTX 5090 (32 GB): 70B INT4 stabile.
  • M-series MacBook Pro (96 GB unified): 70B FP16, 405B INT4.
  • Cluster H100/B200: 405B FP16.

Vedi puntata 227 (quantization) e 228 (Ollama/LM Studio/vLLM).


Come scaricare e girare Llama (in pratica)

Tre canali principali:

1. Ollama (più semplice, consigliato per provare)

ollama pull llama3.1:8b
ollama run llama3.1:8b

Funziona su Mac/Windows/Linux. UI cli + API HTTP.

2. LM Studio (con GUI)

App desktop user-friendly. Scarica modelli da HuggingFace, chat in app, server API integrato.

3. vLLM / TGI / SGLang (produzione)

Server inference ottimizzati per GPU dedicate. Throughput alto, batching, streaming. Standard per deployment serio.

4. HuggingFace Hub (download diretto)

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct")

Sull’Hub trovi sempre i modelli quantizzati (GGUF, GPTQ, AWQ) della community. Per Llama, “TheBloke” è storica community che pubblica versioni quantizzate.


Cloud-hosted Llama

Se non vuoi self-host, Llama è disponibile su:

  • Together AI, Replicate, Fireworks, Groq, Perplexity API: API standardizzata, pricing competitivo.
  • AWS Bedrock, GCP Vertex, Azure: integrazione enterprise.
  • Meta AI (consumer): chat su meta.ai (gratis, account Facebook/Instagram).

In molti casi: Llama 70B su Groq è ~10× più veloce di GPT-5 (per via di hardware specializzato LPU) a costi bassissimi.


Use case dove Llama vince

✅ Privacy stretta

Sanità, banche, PA: il modello gira sui tuoi server, dati mai fuori.

✅ Alto volume con budget rigido

Costa solo hardware + elettricità.

✅ Fine-tuning su dominio

Llama 8B fine-tunato sul tuo dominio specifico spesso batte GPT-5 generico sul tuo task.

✅ Sperimentazione/ricerca

Puoi vedere/modificare i pesi, fare ablation studies, interpretability.

✅ Sovereign AI

Per aziende UE che vogliono non dipendere da provider US, Llama (anche se di Meta US) è almeno deployabile in casa.


Use case dove Llama perde

❌ Frontier reasoning / matematica top

Per problemi STEM al massimo livello, o3/Claude 4.7 thinking vincono.

❌ Latenza ultra-bassa per chat real-time

A meno di hardware specialistico (Groq), Llama self-hosted è più lento di Cloud frontier.

❌ Multimodalità ricca (audio realtime, generazione video)

Meno avanzato dei top closed-source.

❌ Quando vuoi semplicemente “una buona AI senza pensieri”

Self-host = overhead operativo. Per uso casual: meglio API.


Llama-derivati italiani

Per chi vuole modelli con forte focus sull’italiano:

  • Minerva (Sapienza, gruppo di Roberto Navigli) — basato su Mistral originariamente, poi Llama. Open. Focus su qualità italiana.
  • LLaMAntino (Università di Bari) — fine-tuning di Llama su corpus italiano.
  • Modello Italia (iniziativa CNR + iGenius, parzialmente open) — annunciato 2024, sviluppo in corso.
  • Italia GPT (vari progetti accademici).

Vedi puntata 194 (modelli sovrani europei).


La licenza: cosa puoi e non puoi

Llama Community License consente:

  • ✅ Uso commerciale (per la maggior parte delle aziende).
  • ✅ Fine-tuning.
  • ✅ Distribuzione del modello fine-tunato (con attribuzioni).

Vincoli:

  • ⚠️ Aziende con >700M utenti mensili devono ottenere licenza separata da Meta (target: Google, Microsoft, ByteDance…).
  • ⚠️ Banner di attribuzione richiesto in app commerciali (“Built with Llama”).
  • ⚠️ Use policy (no malware, no spam, no abuse).

Per startup/PMI: niente problemi pratici. Per Big Tech: verifica.


Il dibattito “open AI safety”

Posizione di Meta (e Yann LeCun): rilasciare i pesi è positivo per:

  • Sicurezza (più occhi = più audit).
  • Innovazione (community costruisce sopra).
  • Indipendenza geopolitica (non dipendere da poche aziende US).

Posizione di Anthropic/OpenAI (in parte): rilasciare modelli molto capaci potrebbe abilitare uso malevolo (bioweapons, cybercrime, disinformazione massiva).

Dibattito acceso e legittimo. Llama 3.1 405B è stato il primo modello frontier-class rilasciato open. La community ha “tenuto” finora — niente disastri evidenti, molti benefici. Vedi puntata 197 (open vs closed).


TEST pratico (15 minuti)

Installa Ollama (gratis, ollama.com) e:

  1. Scarica ollama pull llama3.1:8b (~5 GB).
  2. Lancia ollama run llama3.1:8b.
  3. Fai 3 task:
    • Una traduzione italiano → inglese.
    • Una classificazione di sentiment di un commento.
    • Una mini-funzione Python.
  4. Confronta qualità con GPT-5 / Claude 4.7 sullo stesso prompt.

Sorpresa: per molti task “medi”, Llama 8B locale è già molto buono. E costa zero. Stai facendo girare un modello “GPT-4 livello 2023” sul tuo laptop, gratis, offline, privato.


Take-away in una riga

Llama non è il “miglior modello”. È il miglior modello su cui puoi mettere le mani. Per privacy, fine-tuning, sovereignty, è la scelta default. Il futuro dell’AI ha più Llama, non meno.

➡️ Prossima puntata: Mistral, Qwen, DeepSeek, Kimi — open weights mondiali.