Puntata 123
Puntata 123 — Gemini di Google
Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli
Il “modello cresciuto in casa Google”: multimodale dai geni, long context da record, integrato nativo con Gmail/Drive/Docs. L’AI per chi vive nell’ecosistema Workspace.
Il vantaggio “nato Google”
Google DeepMind è l’unico player AI con accesso nativo a:
- Tutti i dati pubblici (l’indice di Google Search).
- Trascrizioni di tutto YouTube (per training video/audio).
- Mappa del mondo (Google Maps).
- Codice del mondo (Google Search + Codey).
- Workspace di mezzo pianeta (Gmail, Drive, Docs — con consenso).
Quando Google ha lanciato Gemini nel dicembre 2023, l’obiettivo era convertire questo vantaggio strutturale in un modello competitivo. Dopo un avvio difficile (Bard, Gemini 1.0), è diventato un top-3 globale dal 2024 con Gemini 1.5 Pro e Gemini 2.0/2.5.
La famiglia Gemini 2.5 (2025-26)
| Variante | Posizionamento |
|---|---|
| Gemini 2.5 Pro | Frontier general-purpose |
| Gemini 2.5 Flash | Sweet spot fast/cheap |
| Gemini 2.5 Flash-Lite | Ultra-cheap per alto volume |
| Gemini 2.5 Deep Think | Reasoning extended |
| Gemini Nano | On-device (Pixel, Android, Chrome) |
Plus:
- Imagen 4 — image generation (puntata 132).
- Veo 3 — video generation.
- Gemini Live — voice realtime.
- Project Astra — agente multimodale “vede e ragiona” in tempo reale.
Le 4 caratteristiche distintive
1. Multimodalità nativa “da training”
A differenza di OpenAI (che ha aggiunto vision a GPT-4 post-hoc), Gemini è addestrato dall’inizio su testo + immagini + audio + video insieme.
Conseguenza:
- ✅ Capisce video lunghi (un’ora+) con audio e contenuto visivo coordinati.
- ✅ Estrae info da PDF complessi (tabelle, grafici, immagini incorporate) in un colpo.
- ✅ Fa “video Q&A”: “in che minuto del video appare X?” — funziona.
2. Long context champion
Gemini 1.5 Pro nel 2024 ha rotto la barriera del 1 milione di token. Nel 2026, Gemini 2.5 Pro stabile a 2M token, con esperimenti a 10M.
Benchmark needle-in-haystack a 1M: ~98-99%. Per ora il leader incontrastato.
Use case unici:
- Analisi di interi libri (~500k token).
- Q&A su codebase di centinaia di migliaia di righe.
- Riassunto di archivi storici.
3. Integrazione Workspace nativa
Dal 2024, Gemini è integrato in:
- Gmail (“Help me write”, riassumi thread, replies suggerite).
- Drive (riassumi documenti, ricerca semantica).
- Docs/Sheets/Slides (“Help me organize”, “Help me create”).
- Meet (riassunti riunioni, traduzioni live, transcription).
- Chrome (sidebar Gemini).
- Android (Pixel features, Live Translate, Magic Editor).
Per chi è già in ecosistema Google: integrazione zero-effort. Nessun copia-incolla.
4. Grounding con Google Search
Gemini API offre grounding nativo con Google Search:
- L’AI cerca in tempo reale, cita le fonti.
- Risposte più aggiornate, hallucination ridotte.
- Le fonti sono link cliccabili verificabili.
Sweet spot: domande factual, news del giorno, dati recenti. Vedi anche Perplexity (puntata 126).
Project Astra — la visione del 2025
Annunciato a Google I/O 2024 e maturato nel 2025-26, Project Astra è la visione di Google per un agente AI multimodale onnipresente:
- “Vede” attraverso la fotocamera del telefono.
- Sente l’audio ambientale.
- Mantiene memoria persistente di sessioni precedenti.
- Risponde in tempo reale a voce con bassa latenza.
Use case dimostrati:
- “Cosa ho lasciato sulla scrivania ieri?” (memoria visiva).
- “Traducimi quel cartello mentre cammino” (vision + traduzione live).
- “Spiegami come funziona quel meccanismo che sto guardando”.
Stato 2026: integrato in smart glasses (Meta Ray-Ban competitor, Android XR), Pixel 9+, alcune feature in Workspace.
Vedi puntata 277 (smart glasses + AI, livello Yoda).
Gemini Nano: l’AI on-device
Da Pixel 8 (2023) e ora standard su Android, Gemini Nano è la versione che gira direttamente sul telefono, senza chiamare server.
Use case:
- Live Caption (sottotitoli in tempo reale, anche offline).
- Recorder app (transcription + summary).
- Smart Reply nelle app messaging.
- Image generation locale (Pixel Studio).
Vantaggi:
- ✅ Privacy: dati non escono dal device.
- ✅ Offline: funziona senza connessione.
- ✅ Bassa latenza: niente round-trip a server.
Limiti:
- ⚠️ Qualità inferiore ai modelli cloud.
- ⚠️ Solo task semplici (riassunti brevi, classificazioni, suggerimenti).
Vedi puntata 129 sull’AI sul telefono.
Pricing tipico (snapshot 2026)
| Modello | Input ($ /1M token) | Output ($ /1M token) |
|---|---|---|
| Gemini 2.5 Pro | $1.25 | $10 |
| Gemini 2.5 Flash | $0.30 | $2.50 |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 |
| Gemini Nano | gratis (on-device) | gratis |
Bonus: piano free di Gemini API generoso (rate-limit ma molti token gratis). Vantaggio competitivo per prototipi e startup.
In più, Gemini su AI Studio (aistudio.google.com): playground gratis con accesso ai modelli più recenti, anche sperimentali.
Quando scegliere Gemini
✅ Long context (PDF, video, codebase grandi)
Imbattibile sui 1M+ token reali.
✅ Multimodalità ricca (video lungo, audio)
Migliore comprensione di video di un’ora rispetto ai concorrenti.
✅ Integrazione Workspace
Se la tua azienda usa Gmail/Drive/Docs, Gemini è il default ovvio.
✅ Grounding con search
Domande factual con fonti.
✅ On-device (Android, Chrome)
Gemini Nano è il principale player on-device 2026.
✅ Pricing aggressivo
Gemini Flash è uno dei migliori rapporti qualità/prezzo sul mercato.
⚠️ Coding produzione
Buono ma non al livello di Claude.
⚠️ Personalità “calda”
Tono più factual/distaccato. Per chat consumer “amichevole”, GPT spesso più gradito.
Personalità di Gemini
- Tono: pragmatico, factual, less expressive.
- Lunghezza: ben dimensionata, meno verbose di Claude.
- Stile: più “consulente che risponde” che “assistente che chiacchiera”.
- Forza: integrare informazioni da fonti multiple.
- Debolezza: meno bravo in scrittura creativa “tonal”.
Gemini Live — la voce realtime di Google
Risposta di Google a OpenAI Realtime API. Disponibile in:
- App Gemini (Android e iOS).
- API Gemini (in beta/ga progressiva).
Caratteristiche: voce realtime con interruzioni, multilingua, integrato con Maps/Drive/Calendar.
Use case: assistente vocale conversazionale per cucina, guida, gestione agenda, lingua (tutor).
I limiti onesti
⚠️ Storia di lancio difficile: Bard (2023) e Gemini 1.0 erano deboli. Reputazione recuperata da 1.5 in poi, ma alcuni clienti ancora scettici.
⚠️ Personalità “neutra” può sembrare distaccata. Per chat consumer, GPT spesso più “calda”.
⚠️ Privacy ambivalente: ottima se on-device (Nano), ma in cloud Google usa i dati gratis-tier per training (con opzioni opt-out). Verifica i termini.
⚠️ Dipendenza ecosistema Google: per uso enterprise, lock-in se costruisci tutto su Workspace + Vertex AI.
Vertex AI: il canale enterprise
Per aziende, Google offre Vertex AI Studio + Vertex AI Platform (su GCP):
- Gemini via API enterprise.
- Modelli open (Llama, Mistral, Gemma) ospitati.
- Tools per RAG, fine-tuning, MLOps.
- Compliance regional (EU, US, Asia).
Standard per le grandi aziende già in cloud GCP.
TEST pratico (10 minuti)
In aistudio.google.com (gratis, account Google):
- Carica un PDF di 50+ pagine (es. un manuale, un libro, una tesi).
- Fai 3 domande progressivamente difficili:
- Fatto specifico (a metà del documento).
- Sintesi globale.
- Connessione tra inizio e fine.
- Misura: quante risposte sono accurate? Quante volte “trova” davvero il contenuto?
Confronta con un’altra AI (GPT-5, Claude 4.7) sullo stesso documento. Quasi sempre Gemini vince su documenti molto lunghi.
Take-away in una riga
Gemini è l’AI di chi vive in ecosistema Google e di chi ha documenti/video molto lunghi. Long context champion + multimodalità nativa = casa di vantaggio per use case specifici.
➡️ Prossima puntata: Llama — la famiglia open di casa Meta.