Qwen-Image-2.0: un modello solo per dipingere, scrivere e ritoccare le immagini

Il Qwen Team presenta il nuovo modello per immagini: generazione ed editing nella stessa rete, prompt fino a mille token per disegnare slide e poster con il testo giusto, un autoencoder che comprime il doppio per lato per arrivare a 2K. Com'è costruito, che cosa dice la classifica di LMArena e che cosa il report non misura.

Nelle botteghe di una volta le insegne dei negozi le facevano due mani. Il pittore dipingeva la scena, il letterista tracciava le scritte: un mestiere a parte, con le sue regole di spaziatura e i suoi alfabeti. E se il cliente tornava a chiedere di cambiare un colore, si ricominciava da un terzo artigiano, quello dei ritocchi. Chi generava immagini con l’intelligenza artificiale fino a poco fa conosceva la stessa divisione del lavoro: un modello per le foto, uno che sbagliava le lettere un po’ meno degli altri, un altro ancora per modificare un’immagine esistente.

Qwen-Image-2.0 Technical Report, uscito su arXiv l’11 maggio 2026 (2605.10730) e in questi giorni fra i paper in tendenza su Papers with Code, è la scommessa del Qwen Team di tenere tutte e tre le mani in un modello solo. Generazione da testo ed editing guidato da istruzioni passano per la stessa rete, e il testo dentro l’immagine non è più un accessorio: il modello accetta prompt fino a mille token e promette slide, infografiche, poster e fumetti con le scritte al loro posto, in più lingue, fino alla risoluzione 2K.

Che cosa non funzionava

Il report elenca i colli di bottiglia che i modelli attuali mostrano quando escono dal laboratorio e finiscono in un flusso di lavoro vero. Il testo lungo si sfalda: più caratteri si chiedono, più compaiono glifi deformati, lettere saltate, impaginazioni che collassano. La tipografia multilingue è trascurata, perché quasi tutti i sistemi si addestrano su inglese e cinese. Dai 2K in su il fotorealismo cede, con texture ripetute e luci incoerenti. I prompt con molte entità e vincoli spaziali producono concetti dimenticati o inventati. E il costo di calcolo pesa su chi deve rispondere in fretta.

Ma il problema che gli autori mettono davanti agli altri è l’integrazione: i sistemi esistenti, scrivono, eccellono su un asse, fotorealismo oppure testo, generazione oppure editing, e raramente fanno tutto senza cambiare pipeline o pagare in qualità.

Com’è fatto

L’architettura ha tre pezzi. Il primo è Qwen3-VL, il modello multimodale della casa, usato congelato come encoder delle condizioni: legge il prompt dell’utente e le eventuali immagini di partenza e ne estrae la semantica. Il secondo è un autoencoder variazionale, che porta le immagini in uno spazio latente compatto e ne riporta fuori il risultato. Il terzo è un Multimodal Diffusion Transformer (MMDiT), in cui token di testo e token di immagine scorrono nella stessa sequenza e si guardano a vicenda mentre il rumore viene tolto passo dopo passo.

Qui si dà per noto perché si genera un’immagine togliendo rumore in uno spazio latente invece che sui pixel, e a che cosa serve l’autoencoder che sta ai due capi. La diffusione latente è costruita passo per passo nel libro.

Leggi «Stable Diffusion» nel libro →

La novità più concreta sta nell’autoencoder. Gli autoencoder aperti in circolazione riducono l’immagine di 8 volte per lato e la descrivono con 16 canali (la sigla è f8c16). Qwen-Image-2.0 riduce di 16 volte per lato e usa 64 canali, f16c64. Il conto torna:

$$\frac{H}{16}\cdot\frac{W}{16}\cdot 64 \;=\; \frac{H}{8}\cdot\frac{W}{8}\cdot 16 .$$

La quantità di numeri che descrive l’immagine resta la stessa, ma le posizioni della griglia su cui lavora il trasformatore sono un quarto. Per un’immagine di 1024 pixel di lato si passa da una griglia 128 × 128 a una 64 × 64, e il costo dell’attenzione cresce con il quadrato di quel numero: è questo che rende praticabile addestrare direttamente a 2048.

Qwen-Image-2.0: comprimere di più, per disegnare più grande Immagine 1024 × 1024 f8c16 griglia 128 × 128 16 canali f16c64 griglia 64 × 64 64 canali numeri totali: 262.144 in entrambi i casi posizioni della griglia: 16.384 → 4.096 stessa informazione, un quarto delle posizioni Un percorso per generare e modificare prompt (fino a 1K token) immagine di partenza Qwen3-VL congelato encoder f16c64 MMDiT testo e immagine nella stessa sequenza decoder → immagine fino a 2K senza immagine di partenza: generazione; con: editing

Comprimere tanto ha un prezzo, e il report lo dice: più canali latenti significano uno spazio più difficile da modellare per la diffusione. La cura è doppia. Un’architettura a scorciatoie residue, ripresa da lavori precedenti, per non perdere i dettagli fini; e una perdita di allineamento semantico, sul modello di VA-VAE, che tiene lo spazio latente vicino a rappresentazioni già ordinate per significato. Gli autori raccontano due osservazioni fatte strada facendo: l’allineamento va imposto forte all’inizio e allentato poi, e la perdita avversaria, la parte «GAN» che molti autoencoder si portano dietro, nel loro regime è in gran parte superflua. L’hanno tolta per rendere l’addestramento più stabile.

Nel trasformatore le modifiche sono di stabilità: normalizzazione RMSNorm su query e key, attivazione SwiGLU negli strati MLP per contenere attivazioni che l’addestramento congiunto testo-immagine gonfiava fino alla saturazione, e una modulazione puramente moltiplicativa, $h’ = \alpha h$ invece di $h’ = \alpha h + \beta$.

Dati, ricompense e un riscrittore di prompt

Buona parte del report è dedicata a come si arriva al modello più che al modello stesso. L’addestramento sale di risoluzione per gradi, da 256 a 512, poi 1024 e infine 2048 pixel, con filtri sempre più severi a ogni gradino. I numeri sono dichiarati: 700 mila passi di pre-addestramento a bassa risoluzione con nove esempi di generazione per uno di editing; 250 mila passi di pre-addestramento continuato fino a 2048 con il rapporto portato a 7 a 3; circa 10 mila passi di fine-tuning supervisionato. Le didascalie vengono scritte con quattro schemi diversi: generali, ricche di testo per slide e fumetti, arricchite di conoscenze di contesto, strutturate per diagrammi e grafi.

Poi c’è un «volano» dei dati che smista gli errori. Ogni caso andato male viene attribuito a una causa e mandato su uno di tre binari: se manca una conoscenza, si cercano e si aggiungono dati simili al pre-addestramento; se il problema è di allineamento, si ritoccano le ricompense del reinforcement learning; se il modello saprebbe fare ma ha frainteso la richiesta, si lavora sul riscrittore di prompt. L’unico passaggio manuale del volano è la revisione umana dei dati raccolti per il pre-addestramento.

Il riscrittore, il Prompt Enhancer, parte da Qwen3.5-9B e trasforma richieste vaghe in descrizioni dettagliate. Il modo in cui sono costruiti i dati è la parte più furba: si prendono annotazioni ricche e si degradano apposta, semplificando, rendendo colloquiale, togliendo dettagli come luci, texture, impaginazione e sfondi, così che il percorso inverso diventi la catena di ragionamento da insegnare. Dopo il fine-tuning, un giro di GRPO premia le riscritture che producono immagini migliori.

Anche il modello di immagini passa per un RLHF con GRPO e cinque ricompense separate: estetica, aderenza al prompt e qualità dei ritratti per la generazione; esecuzione dell’istruzione e coerenza delle parti non toccate per l’editing. Una scelta tecnica vale la pena di notarla: la classifier-free guidance si usa per campionare i candidati, perché siano buoni abbastanza da giudicarli, ma il ramo incondizionato resta fuori dall’ottimizzazione, risparmiando calcolo.

Infine la velocità. Con la Distribution Matching Distillation il modello da 40 passi viene distillato in uno studente da 4 valutazioni della rete. Il gradiente spinge lo studente a far coincidere la propria distribuzione con quella del maestro, confrontando due funzioni di score sullo stesso punto rumoroso:

$$\nabla_\theta \ell_{\text{DMD}} = \mathbb{E}\Big[\big(s_{\text{fake}}(x_t, t, c) – s_{\text{real}}(x_t, t, c)\big)\,\nabla_\theta x_\theta\Big].$$

La distillazione confronta funzioni di score lungo un percorso che va dal rumore all’immagine: che cosa sia lo score e perché si possa interpolare in linea retta fra dato e rumore lo spiega il capitolo sul flow matching.

Leggi «Flow matching» nel libro →

I numeri

Il numero forte del report è uno solo, e viene da fuori. Su LMArena, la classifica in cui gli utenti confrontano alla cieca immagini generate dallo stesso prompt, Qwen-Image-2.0 risultava al 22 aprile 2026 nono al mondo e primo fra i modelli cinesi, con un punteggio Elo di 1168 (±8, su circa 5 mila voti), sopra Nano Banana. Lo screenshot riportato nel report aiuta a pesare il dato: in classifica c’è una variante «pro» e proprietaria, il Nano Banana superato è Gemini 2.5 Flash Image, mentre Nano Banana Pro e GPT-Image-2 restano davanti; e dall’ottavo al decimo posto i punteggi (1170, 1168, 1166) stanno dentro i rispettivi margini d’errore. Il grafico in apertura, sulle categorie della stessa classifica, mostra Qwen-Image-2.0 sopra Qwen-Image e Qwen-Image-2512 in tutte e otto (1168 contro 1133 e 1057 nel complessivo), e la didascalia sottolinea fotorealismo e ritratti.

L’autoencoder è l’unico componente con una tabella. Su ImageNet a 256 pixel ottiene un PSNR di 33,42 e un SSIM di 0,9225; sul corpus interno ricco di testo, un PSNR di 32,81 e un SSIM di 0,9795. È meglio di tutti gli altri autoencoder a compressione 16 (HunyuanImage-3.0, Wan2.2, Stepvideo-T2V, che sul testo restano fra 28,19 e 29,62 di PSNR) e ha encoder e decoder più piccoli dei loro. Su ImageNet eguaglia in PSNR il vecchio autoencoder f8c16 di Qwen-Image.

Il resto sono confronti visivi: testo cinese lungo, ritratti, poesie classiche aggiunte a un dipinto, identità preservata in modifiche con una o due immagini. Qwen-Image-2.0 viene messo accanto a GPT-Image-2, Nano Banana Pro, Wan2.7 Pro, Seedream 5.0 Lite e ai predecessori, e nel commento degli autori è in ogni esempio l’unico a fare tutto giusto.

Che cosa il report non dice

Quasi niente è misurato. A parte LMArena e l’autoencoder, non c’è un benchmark quantitativo: nessuna cifra su prove standard di aderenza al prompt, di resa del testo lungo, di editing. I confronti sono esempi scelti dagli autori, e un esempio scelto da chi l’ha prodotto dimostra che il modello può riuscire, non quanto spesso riesca. Anche la tipografia multilingue è documentata da una pagina di immagini, senza un tasso d’errore per lingua.

Mancano le dimensioni. Il report non dà il numero di parametri del trasformatore, né tempi di generazione in secondi, né un costo: l’efficienza è rivendicata ma non quantificata. Della distillazione si vede solo una figura, e c’è perfino un’incongruenza: il testo indica come maestro il modello base, la didascalia il modello dopo RLHF.

L’autoencoder paga qualcosa sul testo. È il migliore a compressione 16, ma l’autoencoder f8c16 del primo Qwen-Image faceva 36,63 di PSNR sullo stesso corpus di testo, contro 32,81. Il guadagno in risoluzione si compra con un po’ di fedeltà proprio dove il modello dice di essere più forte.

Niente sui limiti e sulla distribuzione. Non c’è una sezione sui fallimenti né una sui rischi: l’unica misura di sicurezza citata è un filtro NSFW sui dati. Il report non dice nemmeno se e come i pesi verranno rilasciati, e nella classifica di LMArena il modello compare come proprietario.

Perché conta adesso

La direzione è chiara ed è condivisa da molti: usare come orecchio del generatore un modello linguistico multimodale vero, che capisce una richiesta di mille token, e smettere di tenere separati generazione e ritocco. Qwen-Image-2.0 la porta avanti con un’ingegneria credibile, dall’autoencoder più compresso al volano che smista gli errori, e con un piazzamento su LMArena che, a differenza dei confronti scelti a mano, lo hanno deciso utenti ignari. Per chi prepara materiali di lavoro, slide e poster con il testo giusto al primo colpo sono la differenza fra un giocattolo e uno strumento. Quanto spesso ci si arrivi, però, questo report non lo dice: per saperlo bisognerà che qualcuno lo misuri.

I commenti sono riservati agli iscritti.

Accedi per commentare