Google annuncia Gemini 3.1 Flash Lite (Preview)
$0.25 input $1.50 output ..

Google ha annunciato Gemini 3.1 Flash-Lite, identificato nell'anteprima come gemini-3.1-flash-lite-preview. Il modello è orientato a richieste ad alto volume, bassa latenza e costi contenuti, con supporto multimodale.
Al momento della stesura, la disponibilità generale della famiglia Gemini 3 non era ancora completa e alcune funzioni risultavano in preview. Stato e prezzi possono cambiare con il rilascio definitivo.
Architettura, efficienza e latenza
La caratteristica principale di questa fascia "Lite" è il compromesso tra velocità e costo. A differenza dei modelli più grandi, pensati per ragionamenti complessi, Flash-Lite è descritto come adatto all'elaborazione ad alto throughput.
Google indica un Time to First Token fino a 2,5 volte più veloce rispetto a Gemini 2.5 Flash e un incremento del 45% nella velocità di output. Il modello dichiara inoltre una finestra di contesto fino a 1.000.000 di token; l'effettiva latenza e la qualità dipendono dal tipo e dalla dimensione dell'input.
Le capacità multimodali di Flash-Lite
Il modello è rivolto a richieste frequenti e a scenari in cui latenza e costo hanno un peso rilevante. Le capacità dichiarate includono:
- Testo e documenti: fino a 3.000 file per prompt o 1.000 pagine per file, secondo i limiti dichiarati. I casi d'uso includono sintesi, estrazione di dati e classificazione.
- Audio e video: può elaborare video lunghi fino a 45 minuti, con audio, e file audio singoli fino a 8,4 ore, secondo i limiti dichiarati.
- Sviluppo UI e task agentici: può essere usato per generare interfacce, moderare contenuti e fare da router in pipeline multi-agente; l'output massimo dichiarato è di 64.000 token.
Ragionamento dinamico
Una delle funzioni descritte per Gemini 3.1 Flash-Lite è il Dynamic Thinking. Gli sviluppatori possono scegliere tra quattro livelli di intensità: minimal, low, medium e high, in modo da gestire il compromesso tra qualità, latenza e costo.
La scelta del livello consente di bilanciare qualità, velocità e costo in base al caso d'uso; non garantisce però lo stesso risultato su task diversi.
La disponibilità di questa funzione sugli altri modelli della serie 3 dipende dalla versione e dal prodotto utilizzato.
Benchmark comparativi
Il nome "Lite" indica un posizionamento orientato all'efficienza. Nei benchmark riportati, il modello mostra risultati competitivi rispetto a Gemini 2.5 Flash, con differenze che dipendono dal test e dal livello di thinking.
I risultati riportati con thinking high sono:
- Velocità di output: 363 token/s nella configurazione del test; la latenza applicativa dipende anche da rete, prompt e runtime.
- Humanity's Last Exam: 16.0%. Risultato atteso data la complessità del test (ragionamento accademico estremo senza tool esterni) per un modello di fascia "Lite".
- GPQA Diamond: 86.9%. Misura la risposta a domande scientifiche nella configurazione del benchmark.
- MMMU-Pro: 76.8%. Solide capacità di comprensione e ragionamento su input visivi e testuali combinati.
- CharXiv Reasoning: 73.2%. Valuta lettura, sintesi e interpretazione di grafici nella configurazione del test.
- Video-MMMU: 84.8%. Elevata competenza nell'estrazione di informazioni e conoscenza direttamente da flussi video.
- SimpleQA Verified: 43.3%. Punteggio moderato sulla conoscenza parametrica pura (nozioni apprese a memoria durante il training).
- FACTS Benchmark Suite: 40.6%. Precisione fattuale media; si consiglia l'abbinamento a sistemi RAG per l'uso su dati critici e specifici.
- MMMLU: 88.9%. Misura comprensione e risposta in più lingue.
- LiveCodeBench: 72.0%. Competenze solide nella generazione di codice recente e interfacce utente.
- MRCR v2 (8-needle, 128k): 60.1%. Discreta efficienza nel recupero di informazioni specifiche all'interno di un contesto lungo fino a 128.000 token.
- MRCR v2 (8-needle, 1M): 12.3%. Il punteggio scende nel recupero puntuale (pointwise) quando il test usa una finestra di 1 milione di token.
Costi e compromessi
I prezzi riportati per Gemini 3.1 Flash-Lite sono pensati per applicazioni ad alto volume:
- $0.25 per 1 milione di token in input.
- $1.50 per 1 milione di token in output.
- $0.50 per 1 milione di token audio in input.
I prezzi delle versioni precedenti possono essere utili per un confronto, ma vanno verificati sul listino aggiornato. Nell'articolo sono riportati i valori di Gemini 2.0 Flash (0,40 in output) e della variante Flash-Lite (0,30 in output).
Il confronto economico va fatto considerando anche limiti, modalità di caching, latenza e costi di migrazione. Prezzi e condizioni possono cambiare durante il passaggio dalla preview alla disponibilità generale.
Esempi di utilizzo per Gemini 3.1 Flash Lite
Puoi installare la libreria ufficiale con pip o uv: uv add google-genai
1. Generazione di testo semplice
from google import genai
# Inizializza il client (pesca in automatico GEMINI_API_KEY dalle variabili d'ambiente)
client = genai.Client()
response = client.models.generate_content(
model='gemini-3.1-flash-lite-preview',
contents='Spiega i vantaggi dell\'intelligenza artificiale per l\'ottimizzazione dei costi aziendali in tre brevi punti.'
)
print(response.text)
2. Analisi multimodale con contesto lungo
from google import genai
client = genai.Client()
# 1. Carica un file lungo, per esempio un PDF o un file audio
documento = client.files.upload(file='report_finanziario_annuale.pdf')
# 2. Passa il file e il prompt al modello
response = client.models.generate_content(
model='gemini-3.1-flash-lite-preview',
contents=[
documento,
'Analizza questo documento e crea un riassunto esecutivo evidenziando solo le metriche di spesa del Q3.'
]
)
print(response.text)
3. Configurazione avanzata (Personalizzare l'output e System Instructions)
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model='gemini-3.1-flash-lite-preview',
contents='Estrai tutti i nomi di aziende e i relativi fatturati dal seguente testo...',
config=types.GenerateContentConfig(
# Regola la creatività: 0.1 per output deterministici (es. estrazione dati)
temperature=0.1,
max_output_tokens=2048,
# Definisci il comportamento "di base" del modello
system_instruction='Sei un assistente specializzato nell\'estrazione di dati finanziari. Rispondi solo in formato JSON.',
# --- Configurazione del Dynamic Thinking ---
thinking_config=types.ThinkingConfig(
# Livelli supportati: MINIMAL, LOW, MEDIUM, HIGH
# Per task di estrazione netti, un livello LOW o MINIMAL abbatte la latenza.
# Per task più ragionati, puoi salire a MEDIUM o HIGH.
thinking_level=types.ThinkingLevel.LOW,
# (Opzionale) Imposta a True se desideri ispezionare
# i passaggi logici intermedi del modello prima dell'output finale
include_thoughts=False
)
)
)
print(response.text)
Disponibilità e deployment
Secondo le informazioni riportate nell'articolo, Gemini 3.1 Flash-Lite è disponibile in preview globale. Stato, limiti e aree abilitate possono cambiare durante la fase di anteprima.
Gli sviluppatori possono provarlo tramite la Gemini API in Google AI Studio. L'accesso su Vertex AI e il passaggio alla General Availability (GA) dipendono dalla roadmap di Google e dalla regione.