✔️✔️ Doppie Spunte Blu Cap. 12 · Il bestiario dei modelli

Puntata 123

Puntata 123 — Gemini di Google

Livello: ✔️✔️ Doppie Spunte Blu · Capitolo 12 · Il bestiario dei modelli

Il “modello cresciuto in casa Google”: multimodale dai geni, long context da record, integrato nativo con Gmail/Drive/Docs. L’AI per chi vive nell’ecosistema Workspace.

un robottino con 4 occhi: uno guarda testo, uno immagine, uno video, uno audio. Tutti collegati allo stesso cervello centrale. Sullo sfondo le icone di Gmail, Drive, Docs, Search, YouTube — tutte connesse al robottino con piccole frecce

Il vantaggio “nato Google”

Google DeepMind è l’unico player AI con accesso nativo a:

  • Tutti i dati pubblici (l’indice di Google Search).
  • Trascrizioni di tutto YouTube (per training video/audio).
  • Mappa del mondo (Google Maps).
  • Codice del mondo (Google Search + Codey).
  • Workspace di mezzo pianeta (Gmail, Drive, Docs — con consenso).

Quando Google ha lanciato Gemini nel dicembre 2023, l’obiettivo era convertire questo vantaggio strutturale in un modello competitivo. Dopo un avvio difficile (Bard, Gemini 1.0), è diventato un top-3 globale dal 2024 con Gemini 1.5 Pro e Gemini 2.0/2.5.


La famiglia Gemini 2.5 (2025-26)

VariantePosizionamento
Gemini 2.5 ProFrontier general-purpose
Gemini 2.5 FlashSweet spot fast/cheap
Gemini 2.5 Flash-LiteUltra-cheap per alto volume
Gemini 2.5 Deep ThinkReasoning extended
Gemini NanoOn-device (Pixel, Android, Chrome)

Plus:

  • Imagen 4 — image generation (puntata 132).
  • Veo 3 — video generation.
  • Gemini Live — voice realtime.
  • Project Astra — agente multimodale “vede e ragiona” in tempo reale.

Le 4 caratteristiche distintive

1. Multimodalità nativa “da training”

A differenza di OpenAI (che ha aggiunto vision a GPT-4 post-hoc), Gemini è addestrato dall’inizio su testo + immagini + audio + video insieme.

Conseguenza:

  • ✅ Capisce video lunghi (un’ora+) con audio e contenuto visivo coordinati.
  • ✅ Estrae info da PDF complessi (tabelle, grafici, immagini incorporate) in un colpo.
  • ✅ Fa “video Q&A”: “in che minuto del video appare X?” — funziona.

2. Long context champion

Gemini 1.5 Pro nel 2024 ha rotto la barriera del 1 milione di token. Nel 2026, Gemini 2.5 Pro stabile a 2M token, con esperimenti a 10M.

Benchmark needle-in-haystack a 1M: ~98-99%. Per ora il leader incontrastato.

Use case unici:

  • Analisi di interi libri (~500k token).
  • Q&A su codebase di centinaia di migliaia di righe.
  • Riassunto di archivi storici.

3. Integrazione Workspace nativa

Dal 2024, Gemini è integrato in:

  • Gmail (“Help me write”, riassumi thread, replies suggerite).
  • Drive (riassumi documenti, ricerca semantica).
  • Docs/Sheets/Slides (“Help me organize”, “Help me create”).
  • Meet (riassunti riunioni, traduzioni live, transcription).
  • Chrome (sidebar Gemini).
  • Android (Pixel features, Live Translate, Magic Editor).

Per chi è già in ecosistema Google: integrazione zero-effort. Nessun copia-incolla.

Gemini API offre grounding nativo con Google Search:

  • L’AI cerca in tempo reale, cita le fonti.
  • Risposte più aggiornate, hallucination ridotte.
  • Le fonti sono link cliccabili verificabili.

Sweet spot: domande factual, news del giorno, dati recenti. Vedi anche Perplexity (puntata 126).


Project Astra — la visione del 2025

Annunciato a Google I/O 2024 e maturato nel 2025-26, Project Astra è la visione di Google per un agente AI multimodale onnipresente:

  • “Vede” attraverso la fotocamera del telefono.
  • Sente l’audio ambientale.
  • Mantiene memoria persistente di sessioni precedenti.
  • Risponde in tempo reale a voce con bassa latenza.

Use case dimostrati:

  • “Cosa ho lasciato sulla scrivania ieri?” (memoria visiva).
  • “Traducimi quel cartello mentre cammino” (vision + traduzione live).
  • “Spiegami come funziona quel meccanismo che sto guardando”.

Stato 2026: integrato in smart glasses (Meta Ray-Ban competitor, Android XR), Pixel 9+, alcune feature in Workspace.

Vedi puntata 277 (smart glasses + AI, livello Yoda).


Gemini Nano: l’AI on-device

Da Pixel 8 (2023) e ora standard su Android, Gemini Nano è la versione che gira direttamente sul telefono, senza chiamare server.

Use case:

  • Live Caption (sottotitoli in tempo reale, anche offline).
  • Recorder app (transcription + summary).
  • Smart Reply nelle app messaging.
  • Image generation locale (Pixel Studio).

Vantaggi:

  • Privacy: dati non escono dal device.
  • Offline: funziona senza connessione.
  • Bassa latenza: niente round-trip a server.

Limiti:

  • ⚠️ Qualità inferiore ai modelli cloud.
  • ⚠️ Solo task semplici (riassunti brevi, classificazioni, suggerimenti).

Vedi puntata 129 sull’AI sul telefono.


Pricing tipico (snapshot 2026)

ModelloInput ($ /1M token)Output ($ /1M token)
Gemini 2.5 Pro$1.25$10
Gemini 2.5 Flash$0.30$2.50
Gemini 2.5 Flash-Lite$0.10$0.40
Gemini Nanogratis (on-device)gratis

Bonus: piano free di Gemini API generoso (rate-limit ma molti token gratis). Vantaggio competitivo per prototipi e startup.

In più, Gemini su AI Studio (aistudio.google.com): playground gratis con accesso ai modelli più recenti, anche sperimentali.


Quando scegliere Gemini

✅ Long context (PDF, video, codebase grandi)

Imbattibile sui 1M+ token reali.

✅ Multimodalità ricca (video lungo, audio)

Migliore comprensione di video di un’ora rispetto ai concorrenti.

✅ Integrazione Workspace

Se la tua azienda usa Gmail/Drive/Docs, Gemini è il default ovvio.

Domande factual con fonti.

✅ On-device (Android, Chrome)

Gemini Nano è il principale player on-device 2026.

✅ Pricing aggressivo

Gemini Flash è uno dei migliori rapporti qualità/prezzo sul mercato.

⚠️ Coding produzione

Buono ma non al livello di Claude.

⚠️ Personalità “calda”

Tono più factual/distaccato. Per chat consumer “amichevole”, GPT spesso più gradito.


Personalità di Gemini

  • Tono: pragmatico, factual, less expressive.
  • Lunghezza: ben dimensionata, meno verbose di Claude.
  • Stile: più “consulente che risponde” che “assistente che chiacchiera”.
  • Forza: integrare informazioni da fonti multiple.
  • Debolezza: meno bravo in scrittura creativa “tonal”.

Gemini Live — la voce realtime di Google

Risposta di Google a OpenAI Realtime API. Disponibile in:

  • App Gemini (Android e iOS).
  • API Gemini (in beta/ga progressiva).

Caratteristiche: voce realtime con interruzioni, multilingua, integrato con Maps/Drive/Calendar.

Use case: assistente vocale conversazionale per cucina, guida, gestione agenda, lingua (tutor).


I limiti onesti

⚠️ Storia di lancio difficile: Bard (2023) e Gemini 1.0 erano deboli. Reputazione recuperata da 1.5 in poi, ma alcuni clienti ancora scettici.

⚠️ Personalità “neutra” può sembrare distaccata. Per chat consumer, GPT spesso più “calda”.

⚠️ Privacy ambivalente: ottima se on-device (Nano), ma in cloud Google usa i dati gratis-tier per training (con opzioni opt-out). Verifica i termini.

⚠️ Dipendenza ecosistema Google: per uso enterprise, lock-in se costruisci tutto su Workspace + Vertex AI.


Vertex AI: il canale enterprise

Per aziende, Google offre Vertex AI Studio + Vertex AI Platform (su GCP):

  • Gemini via API enterprise.
  • Modelli open (Llama, Mistral, Gemma) ospitati.
  • Tools per RAG, fine-tuning, MLOps.
  • Compliance regional (EU, US, Asia).

Standard per le grandi aziende già in cloud GCP.


TEST pratico (10 minuti)

In aistudio.google.com (gratis, account Google):

  1. Carica un PDF di 50+ pagine (es. un manuale, un libro, una tesi).
  2. Fai 3 domande progressivamente difficili:
    • Fatto specifico (a metà del documento).
    • Sintesi globale.
    • Connessione tra inizio e fine.
  3. Misura: quante risposte sono accurate? Quante volte “trova” davvero il contenuto?

Confronta con un’altra AI (GPT-5, Claude 4.7) sullo stesso documento. Quasi sempre Gemini vince su documenti molto lunghi.


Take-away in una riga

Gemini è l’AI di chi vive in ecosistema Google e di chi ha documenti/video molto lunghi. Long context champion + multimodalità nativa = casa di vantaggio per use case specifici.

➡️ Prossima puntata: Llama — la famiglia open di casa Meta.