Google annuncia Gemini 3.1 Flash Lite (Preview)

$0.25 input $1.50 output ..

Google annuncia Gemini 3.1 Flash Lite (Preview)
Condividi:

Google ha annunciato Gemini 3.1 Flash-Lite, identificato nell'anteprima come gemini-3.1-flash-lite-preview. Il modello è orientato a richieste ad alto volume, bassa latenza e costi contenuti, con supporto multimodale.

Al momento della stesura, la disponibilità generale della famiglia Gemini 3 non era ancora completa e alcune funzioni risultavano in preview. Stato e prezzi possono cambiare con il rilascio definitivo.

Architettura, efficienza e latenza

La caratteristica principale di questa fascia "Lite" è il compromesso tra velocità e costo. A differenza dei modelli più grandi, pensati per ragionamenti complessi, Flash-Lite è descritto come adatto all'elaborazione ad alto throughput.

Google indica un Time to First Token fino a 2,5 volte più veloce rispetto a Gemini 2.5 Flash e un incremento del 45% nella velocità di output. Il modello dichiara inoltre una finestra di contesto fino a 1.000.000 di token; l'effettiva latenza e la qualità dipendono dal tipo e dalla dimensione dell'input.

Le capacità multimodali di Flash-Lite

Il modello è rivolto a richieste frequenti e a scenari in cui latenza e costo hanno un peso rilevante. Le capacità dichiarate includono:

  • Testo e documenti: fino a 3.000 file per prompt o 1.000 pagine per file, secondo i limiti dichiarati. I casi d'uso includono sintesi, estrazione di dati e classificazione.
  • Audio e video: può elaborare video lunghi fino a 45 minuti, con audio, e file audio singoli fino a 8,4 ore, secondo i limiti dichiarati.
  • Sviluppo UI e task agentici: può essere usato per generare interfacce, moderare contenuti e fare da router in pipeline multi-agente; l'output massimo dichiarato è di 64.000 token.

Ragionamento dinamico

Una delle funzioni descritte per Gemini 3.1 Flash-Lite è il Dynamic Thinking. Gli sviluppatori possono scegliere tra quattro livelli di intensità: minimal, low, medium e high, in modo da gestire il compromesso tra qualità, latenza e costo.

La scelta del livello consente di bilanciare qualità, velocità e costo in base al caso d'uso; non garantisce però lo stesso risultato su task diversi.

La disponibilità di questa funzione sugli altri modelli della serie 3 dipende dalla versione e dal prodotto utilizzato.

Benchmark comparativi

Il nome "Lite" indica un posizionamento orientato all'efficienza. Nei benchmark riportati, il modello mostra risultati competitivi rispetto a Gemini 2.5 Flash, con differenze che dipendono dal test e dal livello di thinking.

I risultati riportati con thinking high sono:

  • Velocità di output: 363 token/s nella configurazione del test; la latenza applicativa dipende anche da rete, prompt e runtime.
  • Humanity's Last Exam: 16.0%. Risultato atteso data la complessità del test (ragionamento accademico estremo senza tool esterni) per un modello di fascia "Lite".
  • GPQA Diamond: 86.9%. Misura la risposta a domande scientifiche nella configurazione del benchmark.
  • MMMU-Pro: 76.8%. Solide capacità di comprensione e ragionamento su input visivi e testuali combinati.
  • CharXiv Reasoning: 73.2%. Valuta lettura, sintesi e interpretazione di grafici nella configurazione del test.
  • Video-MMMU: 84.8%. Elevata competenza nell'estrazione di informazioni e conoscenza direttamente da flussi video.
  • SimpleQA Verified: 43.3%. Punteggio moderato sulla conoscenza parametrica pura (nozioni apprese a memoria durante il training).
  • FACTS Benchmark Suite: 40.6%. Precisione fattuale media; si consiglia l'abbinamento a sistemi RAG per l'uso su dati critici e specifici.
  • MMMLU: 88.9%. Misura comprensione e risposta in più lingue.
  • LiveCodeBench: 72.0%. Competenze solide nella generazione di codice recente e interfacce utente.
  • MRCR v2 (8-needle, 128k): 60.1%. Discreta efficienza nel recupero di informazioni specifiche all'interno di un contesto lungo fino a 128.000 token.
  • MRCR v2 (8-needle, 1M): 12.3%. Il punteggio scende nel recupero puntuale (pointwise) quando il test usa una finestra di 1 milione di token.

Costi e compromessi

I prezzi riportati per Gemini 3.1 Flash-Lite sono pensati per applicazioni ad alto volume:

  • $0.25 per 1 milione di token in input.
  • $1.50 per 1 milione di token in output.
  • $0.50 per 1 milione di token audio in input.

I prezzi delle versioni precedenti possono essere utili per un confronto, ma vanno verificati sul listino aggiornato. Nell'articolo sono riportati i valori di Gemini 2.0 Flash (0,10ininpute0,10 in input e 0,40 in output) e della variante Flash-Lite (0,075ininpute0,075 in input e 0,30 in output).

Il confronto economico va fatto considerando anche limiti, modalità di caching, latenza e costi di migrazione. Prezzi e condizioni possono cambiare durante il passaggio dalla preview alla disponibilità generale.

Esempi di utilizzo per Gemini 3.1 Flash Lite

Puoi installare la libreria ufficiale con pip o uv: uv add google-genai

1. Generazione di testo semplice

from google import genai

# Inizializza il client (pesca in automatico GEMINI_API_KEY dalle variabili d'ambiente)
client = genai.Client()

response = client.models.generate_content(
    model='gemini-3.1-flash-lite-preview',
    contents='Spiega i vantaggi dell\'intelligenza artificiale per l\'ottimizzazione dei costi aziendali in tre brevi punti.'
)

print(response.text)

2. Analisi multimodale con contesto lungo

from google import genai

client = genai.Client()

# 1. Carica un file lungo, per esempio un PDF o un file audio
documento = client.files.upload(file='report_finanziario_annuale.pdf')

# 2. Passa il file e il prompt al modello
response = client.models.generate_content(
    model='gemini-3.1-flash-lite-preview',
    contents=[
        documento,
        'Analizza questo documento e crea un riassunto esecutivo evidenziando solo le metriche di spesa del Q3.'
    ]
)

print(response.text)

3. Configurazione avanzata (Personalizzare l'output e System Instructions)

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model='gemini-3.1-flash-lite-preview',
    contents='Estrai tutti i nomi di aziende e i relativi fatturati dal seguente testo...',
    config=types.GenerateContentConfig(
        # Regola la creatività: 0.1 per output deterministici (es. estrazione dati)
        temperature=0.1, 
        max_output_tokens=2048,
        # Definisci il comportamento "di base" del modello
        system_instruction='Sei un assistente specializzato nell\'estrazione di dati finanziari. Rispondi solo in formato JSON.',
        
        # --- Configurazione del Dynamic Thinking ---
        thinking_config=types.ThinkingConfig(
            # Livelli supportati: MINIMAL, LOW, MEDIUM, HIGH
            # Per task di estrazione netti, un livello LOW o MINIMAL abbatte la latenza.
            # Per task più ragionati, puoi salire a MEDIUM o HIGH.
            thinking_level=types.ThinkingLevel.LOW,
            
            # (Opzionale) Imposta a True se desideri ispezionare 
            # i passaggi logici intermedi del modello prima dell'output finale
            include_thoughts=False 
        )
    )
)

print(response.text)

Disponibilità e deployment

Secondo le informazioni riportate nell'articolo, Gemini 3.1 Flash-Lite è disponibile in preview globale. Stato, limiti e aree abilitate possono cambiare durante la fase di anteprima.

Gli sviluppatori possono provarlo tramite la Gemini API in Google AI Studio. L'accesso su Vertex AI e il passaggio alla General Availability (GA) dipendono dalla roadmap di Google e dalla regione.

Mauro Sciancalepore - Notizie AI, Deep Learning e Ricerca

Resta aggiornato sulle ultime notizie di Intelligenza Artificiale e Deep Learning. Approfondimenti completi sulla ricerca e stato dell'arte.

© 2026 mauroscia.it
Tutti i diritti riservati.