// TOM'S HARDWARE ITALIA — LINUX & OPEN SOURCE
Alibaba QWEN batte quasi tutti con soli 7 miliardi di parametri. Il trucco è nella licenza
Alibaba ha aperto i pesi di Qwen-Image-2.1, un modello che genera e modifica immagini in un solo sistema, con appena 7 miliardi di parametri nel motore visivo, un terzo di quelli del predecessore. Il team Qwen sostiene che il modello superi la maggior parte dei sistemi chiusi sul proprio confronto interno, anche se resta settimo su 29 modelli testati. La combinazione di cache KV e attenzione mista riduce a meno di due secondi la modifica con dieci immagini di riferimento, e il modello gira su una singola scheda consumer come una RTX 3090.
Sul punteggio complessivo del confronto, il modello segna 60,28 punti contro i 59,82 di Nano Banana 2.0, il modello Flash di Google, ma resta sei posizioni sotto GPT Image 2.5 Sunburst, primo a quota 67,01. Nessun laboratorio esterno ha ancora replicato il confronto, e i primi riscontri indipendenti circolati su Hacker News restano test informali su poche decine di prompt. La sorpresa arriva dalla licenza: le versioni precedenti di Qwen-Image uscivano con Apache 2.0, questa richiede un accordo commerciale separato con Alibaba, di prezzo ancora sconosciuto.
Il modello genera immagini con trasparenza nativa, cioè con canale alpha e sfondo trasparente, senza il passaggio successivo di rimozione dello sfondo che quasi tutti i concorrenti richiedono ancora. La stessa architettura combina fino a dieci immagini di riferimento in una sola generazione, mantenendo coerenti volti, oggetti e stili tra scatti diversi. La scheda tecnica di Hugging Face riporta le stesse specifiche indicate nel blog di lancio: 7 miliardi di parametri nel motore visivo, un terzo del predecessore.
Sul confronto restano sei modelli chiusi davanti a Qwen-Image-2.1, ma nessun altro modello open-weight si avvicina al punteggio. L'analisi indipendente di CellCog riporta la tabella completa dei 29 modelli testati, e colloca il salto rispetto al predecessore soprattutto sulla coerenza dei volti nelle modifiche multi-immagine, il punto debole della versione precedente. Sul thread di lancio su Hacker News, i primi test informali danno 7 risposte corrette su 15 contro le 4 su 15 del modello precedente, campione troppo piccolo per sostituire una verifica di laboratorio.
I modelli open-weight, gran parte dei quali sviluppati in Cina, stanno guadagnando terreno sui modelli chiusi americani proprio sul rapporto fra prestazioni e costo di gestione. Chi ospita il modello in locale evita i costi ricorrenti delle API a consumo, un vantaggio che pesa per chi elabora grandi volumi di immagini in produzione. Resta comunque la licenza a decidere il conto finale, più del risparmio sull'infrastruttura.
Il settore dei modelli di immagini sta vivendo la stessa transizione già vista nei modelli di linguaggio: dopo anni di corsa alla scala, conta l'efficienza per parametro, più della somma totale. Se un motore compatto tiene testa a sistemi chiusi enormemente più grandi, il vantaggio dei laboratori con più capitale si assottiglia, ed è proprio su questo terreno che Alibaba si sta facendo largo fra i laboratori americani.
Alibaba aveva già scalato la classifica dei test di coding con la stessa famiglia Qwen, e ha riunito modelli e prodotti sotto un solo sportello, il Token Hub, presentato come punto di accesso unico per sviluppatori e aziende. Il gruppo punta a diventare il riferimento open-weight in ogni categoria di modello, dal codice al testo alle immagini, competendo sia con i laboratori occidentali sia con gli altri gruppi cinesi che stanno rilasciando le proprie famiglie di modelli aperti nello stesso periodo.
Con Apache 2.0 chiunque poteva scaricare i pesi, modificarli e integrarli in un prodotto commerciale senza chiedere il permesso a nessuno. Il codice su GitHub riporta invece una licenza di sola ricerca, che consente di usare il modello per studio, confronti e prototipi, ma vieta l'uso in produzione senza un accordo separato. Il permesso di venderlo si compra a parte, e il prezzo resta segreto.
La licenza aggiunge una variabile nuova