Puntata 124
Puntata 124 — Llama: la famiglia open di casa Meta
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli
L’open-weight più scaricato del mondo. Non il “migliore in assoluto”, ma quello su cui puoi mettere le mani: girare offline, fine-tunare, ispezionare, deploy on-prem.
Open ≠ Open Source: la distinzione critica
Meta chiama Llama “open source”, ma è più preciso definirlo open-weight:
- ✅ I pesi (i numeri del modello addestrato) sono scaricabili gratis.
- ✅ Puoi farci inferenza offline, gratuita, senza vincoli pratici per uso “normale”.
- ✅ Puoi fine-tunare su dati tuoi.
- ⚠️ La licenza è “Llama Community License” — permissiva ma con clausole (es. divieto per aziende >700M utenti senza accordo separato).
- ❌ Niente codice del training, niente dataset di training, niente dettagli sui dati di RLHF.
È molto più aperto di GPT/Claude/Gemini (zero accesso), ma meno aperto di Apache 2.0 / MIT puro. Vedi puntata 226 per la distinzione completa.
La famiglia Llama nel 2026
Meta rilascia versioni nuove ~ ogni 6-12 mesi. Stato 2026:
Llama 3 (luglio 2024)
- Llama 3 8B — sweet spot per laptop/server piccoli.
- Llama 3 70B — top dense general purpose.
- Llama 3.1 405B — frontier-class (genuinely competitive con GPT/Claude su molti benchmark).
Llama 3.2 (settembre 2024) — multimodalità
- Llama 3.2 1B / 3B — modelli on-device per mobile.
- Llama 3.2 11B / 90B Vision — primi Llama multimodali (vedono immagini).
Llama 4 (atteso/in rolling release 2025-26)
- Famiglia MoE su scala maggiore.
- Multimodalità nativa migliorata.
- Specific reasoning models.
⚠️ Le release di Meta sono frequenti. Versioni e nomi evolvono.
Perché Llama conta tanto
1. Base di tantissimi modelli derivati
Migliaia di modelli fine-tunati su Llama sono in giro:
- Italian-tuned: Minerva, LLaMAntino (su Llama 3).
- Coding-tuned: CodeLlama, OpenCodeInterpreter.
- Medical-tuned: Med-Llama, BioMistral (basato su Mistral, parente stretto).
- Chat-tuned: WizardLM, Vicuna (storici), Hermes Llama 3.
Senza Llama (open-weight), la community open di specializzazioni di dominio non esisterebbe.
2. Standard di benchmarking
Llama 3 8B / 70B sono i baseline contro cui ogni nuovo modello open viene confrontato. “Batte Llama 3 70B su X?” è la domanda standard.
3. Disponibilità on-prem / edge
Per aziende con vincoli di compliance (sanità, banche, PA), avere il modello on-prem è non-negoziabile. Llama è la scelta principale per:
- Server interni.
- Datacenter privati.
- Edge devices.
4. Costo: solo elettricità
Una volta scaricato il modello, l’inferenza costa solo GPU + elettricità. Per use case ad alto volume con privacy o budget stretti, vantaggio enorme.
VRAM e taglia: stime pratiche
Quanta GPU ti serve per girare Llama? Stime semplici per inferenza FP16:
| Modello | VRAM FP16 | INT8 | INT4 (GGUF/GPTQ) |
|---|---|---|---|
| Llama 3.2 1B | ~3 GB | ~2 GB | ~1 GB |
| Llama 3.2 3B | ~7 GB | ~4 GB | ~2 GB |
| Llama 3 8B | ~18 GB | ~9 GB | ~5 GB |
| Llama 3 70B | ~140 GB | ~70 GB | ~35-40 GB |
| Llama 3.1 405B | ~810 GB | ~410 GB | ~210 GB |
GPU consumer di riferimento:
- RTX 4090 (24 GB): Llama 8B FP16, 70B INT4 con offload.
- RTX 5090 (32 GB): 70B INT4 stabile.
- M-series MacBook Pro (96 GB unified): 70B FP16, 405B INT4.
- Cluster H100/B200: 405B FP16.
Vedi puntata 227 (quantization) e 228 (Ollama/LM Studio/vLLM).
Come scaricare e girare Llama (in pratica)
Tre canali principali:
1. Ollama (più semplice, consigliato per provare)
ollama pull llama3.1:8b
ollama run llama3.1:8b
Funziona su Mac/Windows/Linux. UI cli + API HTTP.
2. LM Studio (con GUI)
App desktop user-friendly. Scarica modelli da HuggingFace, chat in app, server API integrato.
3. vLLM / TGI / SGLang (produzione)
Server inference ottimizzati per GPU dedicate. Throughput alto, batching, streaming. Standard per deployment serio.
4. HuggingFace Hub (download diretto)
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct")
Sull’Hub trovi sempre i modelli quantizzati (GGUF, GPTQ, AWQ) della community. Per Llama, “TheBloke” è storica community che pubblica versioni quantizzate.
Cloud-hosted Llama
Se non vuoi self-host, Llama è disponibile su:
- Together AI, Replicate, Fireworks, Groq, Perplexity API: API standardizzata, pricing competitivo.
- AWS Bedrock, GCP Vertex, Azure: integrazione enterprise.
- Meta AI (consumer): chat su
meta.ai(gratis, account Facebook/Instagram).
In molti casi: Llama 70B su Groq è ~10× più veloce di GPT-5 (per via di hardware specializzato LPU) a costi bassissimi.
Use case dove Llama vince
✅ Privacy stretta
Sanità, banche, PA: il modello gira sui tuoi server, dati mai fuori.
✅ Alto volume con budget rigido
Costa solo hardware + elettricità.
✅ Fine-tuning su dominio
Llama 8B fine-tunato sul tuo dominio specifico spesso batte GPT-5 generico sul tuo task.
✅ Sperimentazione/ricerca
Puoi vedere/modificare i pesi, fare ablation studies, interpretability.
✅ Sovereign AI
Per aziende UE che vogliono non dipendere da provider US, Llama (anche se di Meta US) è almeno deployabile in casa.
Use case dove Llama perde
❌ Frontier reasoning / matematica top
Per problemi STEM al massimo livello, o3/Claude 4.7 thinking vincono.
❌ Latenza ultra-bassa per chat real-time
A meno di hardware specialistico (Groq), Llama self-hosted è più lento di Cloud frontier.
❌ Multimodalità ricca (audio realtime, generazione video)
Meno avanzato dei top closed-source.
❌ Quando vuoi semplicemente “una buona AI senza pensieri”
Self-host = overhead operativo. Per uso casual: meglio API.
Llama-derivati italiani
Per chi vuole modelli con forte focus sull’italiano:
- Minerva (Sapienza, gruppo di Roberto Navigli) — basato su Mistral originariamente, poi Llama. Open. Focus su qualità italiana.
- LLaMAntino (Università di Bari) — fine-tuning di Llama su corpus italiano.
- Modello Italia (iniziativa CNR + iGenius, parzialmente open) — annunciato 2024, sviluppo in corso.
- Italia GPT (vari progetti accademici).
Vedi puntata 194 (modelli sovrani europei).
La licenza: cosa puoi e non puoi
Llama Community License consente:
- ✅ Uso commerciale (per la maggior parte delle aziende).
- ✅ Fine-tuning.
- ✅ Distribuzione del modello fine-tunato (con attribuzioni).
Vincoli:
- ⚠️ Aziende con >700M utenti mensili devono ottenere licenza separata da Meta (target: Google, Microsoft, ByteDance…).
- ⚠️ Banner di attribuzione richiesto in app commerciali (“Built with Llama”).
- ⚠️ Use policy (no malware, no spam, no abuse).
Per startup/PMI: niente problemi pratici. Per Big Tech: verifica.
Il dibattito “open AI safety”
Posizione di Meta (e Yann LeCun): rilasciare i pesi è positivo per:
- Sicurezza (più occhi = più audit).
- Innovazione (community costruisce sopra).
- Indipendenza geopolitica (non dipendere da poche aziende US).
Posizione di Anthropic/OpenAI (in parte): rilasciare modelli molto capaci potrebbe abilitare uso malevolo (bioweapons, cybercrime, disinformazione massiva).
Dibattito acceso e legittimo. Llama 3.1 405B è stato il primo modello frontier-class rilasciato open. La community ha “tenuto” finora — niente disastri evidenti, molti benefici. Vedi puntata 197 (open vs closed).
TEST pratico (15 minuti)
Installa Ollama (gratis, ollama.com) e:
- Scarica
ollama pull llama3.1:8b(~5 GB). - Lancia
ollama run llama3.1:8b. - Fai 3 task:
- Una traduzione italiano → inglese.
- Una classificazione di sentiment di un commento.
- Una mini-funzione Python.
- Confronta qualità con GPT-5 / Claude 4.7 sullo stesso prompt.
Sorpresa: per molti task “medi”, Llama 8B locale è già molto buono. E costa zero. Stai facendo girare un modello “GPT-4 livello 2023” sul tuo laptop, gratis, offline, privato.
Take-away in una riga
Llama non è il “miglior modello”. È il miglior modello su cui puoi mettere le mani. Per privacy, fine-tuning, sovereignty, è la scelta default. Il futuro dell’AI ha più Llama, non meno.
➡️ Prossima puntata: Mistral, Qwen, DeepSeek, Kimi — open weights mondiali.