Alibaba lancia la serie Qwen 3.5 Medium: 35B-A3B, Qwen 3.5-Flash e Qwen 27B

gpt 5.1 mini, open source

Alibaba lancia la serie Qwen 3.5 Medium: 35B-A3B, Qwen 3.5-Flash e Qwen 27B
Condividi:

Il team Qwen di Alibaba ha annunciato la serie Qwen 3.5 Medium, una famiglia di modelli multimodali orientata a uso agentico, efficienza locale e contesti lunghi. Il tratto distintivo è l'uso di un'architettura MoE, che separa il numero totale di parametri da quelli attivati per ogni token.

Rispetto a un modello denso di dimensioni simili, questa impostazione può ridurre il calcolo per token. La serie dichiara inoltre finestre di contesto fino a 1 milione di token, da valutare in base all'implementazione e al caso d'uso.

Un'architettura ibrida per l'efficienza

La differenza principale è nell'architettura. Il modello di punta, Qwen3.5-35B-A3B, ha 35 miliardi di parametri totali ma ne attiva solo 3 miliardi (A3B) per ogni token generato.

L'architettura combina reti Gated Delta Networks, blocchi Gated Attention e una gestione Sparse Mixture-of-Experts (MoE) con 256 esperti. Il post-training include tecniche di Reinforcement Learning (RL) applicate a compiti di ragionamento e uso di strumenti. I confronti con modelli più grandi vanno letti attraverso benchmark specifici, non come una superiorità generale.

La famiglia Qwen 3.5 Medium

La famiglia comprende diverse varianti open-weight, disponibili su Hugging Face e rivolte a esigenze di calcolo differenti:

  • Qwen3.5-35B-A3B: il modello di riferimento per efficienza e uso locale. Attiva 3B di parametri per token e supporta input visivi; le prestazioni dipendono dal benchmark e dalla configurazione.
  • Qwen3.5-Flash: la versione ottimizzata per il deployment, basata sul modello 35B-A3B. È disponibile su Alibaba Cloud Model Studio con supporto dichiarato per contesti lunghi e strumenti integrati.
  • Qwen3.5-122B-A10B: Il fratello maggiore che assottiglia ulteriormente il divario con i modelli di frontiera top di gamma, attivando solo 10B di parametri per token su un totale di 122 miliardi.
  • Qwen3.5-27B: una variante densa pensata per contesti linguistici lunghi, con un compromesso diverso tra memoria e capacità rispetto ai modelli MoE.

Efficienza e deployment

Qwen3.5-35B-A3B combina un numero ridotto di parametri attivi con un consumo di memoria potenzialmente inferiore a quello di un modello denso della stessa dimensione. L'esecuzione su una singola GPU da 24 GB o su un Mac Apple Silicon dipende dalla quantizzazione, dalla finestra di contesto e dal backend.

L'attivazione selettiva dell'architettura MoE può ridurre il calcolo necessario per ogni token. Il valore dichiarato di 100–180 token/s dipende da hardware, quantizzazione, backend, batch e lunghezza del contesto.

La serie è compatibile con diversi framework di inferenza e fine-tuning:

  • Unsloth (per quantizzazioni dinamiche e finetuning ultrarapido)
  • llama.cpp / Ollama (per inferenza locale su GPU e CPU)
  • vLLM e SgLang (per serving di produzione ad alto throughput)

Qwen3.5-35B-A3B: Unsloth e Ollama

Su Hugging Face e nella documentazione ufficiale sono disponibili file in formato GGUF; Unsloth documenta il supporto alle varianti compatibili.

Le versioni Dynamic 4-bit, che mantengono alcuni layer a 8 o 16 bit, occupano circa 22 GB nella configurazione indicata. Con Ollama il modello può essere avviato dal terminale con ollama run qwen3.5:35b-a3b, se il sistema dispone della memoria necessaria.

Agenti locali e modelli agentic

La serie mostra perché il numero totale di parametri non sia l'unico fattore da considerare: contano anche parametri attivi, memoria, backend e qualità del post-training. Per gli sviluppatori può essere un'opzione per agenti locali, ma il risultato dipende dall'hardware e dal carico di lavoro.

Licenza Apache 2.0

Alibaba ha rilasciato i pesi della serie Qwen 3.5, incluso Qwen3.5-35B-A3B, sotto la licenza Apache 2.0.

La licenza Apache 2.0 consente in generale uso, modifica e distribuzione, nel rispetto dei suoi obblighi e delle eventuali licenze di componenti o servizi associati. Prima di integrare i pesi in un prodotto commerciale è comunque necessario verificare il testo della licenza, gli avvisi inclusi nel repository e le condizioni del servizio cloud.

Mauro Sciancalepore - Notizie AI, Deep Learning e Ricerca

Resta aggiornato sulle ultime notizie di Intelligenza Artificiale e Deep Learning. Approfondimenti completi sulla ricerca e stato dell'arte.

© 2026 mauroscia.it
Tutti i diritti riservati.