GenRouter: per ogni immagine chiesta, la strada che costa quanto serve

I sistemi agentici per generare immagini cercano sul web, ragionano, disegnano bozzetti e si correggono da soli, ma ciascuno applica la sua catena completa a ogni richiesta, anche a un gatto ad acquerello. Un gruppo della HKUST propone di smontarli in pezzi standard e di mettere davanti un instradatore che sceglie, prompt per prompt, il percorso che costa quanto serve. I numeri del paper, e che cosa misurano davvero.

In una clinica ben organizzata, chi arriva con un raffreddore non fa la risonanza magnetica. Un’infermiera al triage ascolta i sintomi, assegna un codice e manda ciascuno dove serve: il medico di turno, le analisi, lo specialista. La risonanza resta per chi ne ha bisogno, e la coda non si blocca. Una clinica che facesse tutti gli esami a tutti curerebbe benissimo, e fallirebbe in un mese.

È quello che succede oggi, secondo un paper depositato su arXiv il 17 agosto 2026 (2608.16721), ai sistemi agentici che generano immagini. Si intitola GenRouter: Unified Workflow Routing for Agentic Image Generation, lo firmano sette ricercatori della HKUST di Guangzhou e di Hong Kong, della SUSTech, della CUHK e di ZODA, con Harold Haodong Chen e Zhiyu Hou primi autori a pari merito e Ying-Cong Chen come autore di riferimento. Il codice è pubblico su GitHub.

Il problema: un esame completo per ogni raffreddore

Un generatore di immagini da testo, preso da solo, è un traduttore diretto: prompt in ingresso, pixel in uscita. Secondo gli autori la qualità dei pixel non è più il collo di bottiglia. Lo è la richiesta: un prompt che chiede il copricapo dei giudici britannici del Settecento pretende una conoscenza che il modello può non avere, uno che vuole una scritta esatta su un cartello pretende precisione tipografica, uno che dispone più oggetti in un’aula pretende un piano spaziale.

Qui si dà per noto come un modello di diffusione trasformi una frase in un’immagine, a partire dal rumore. Il meccanismo, dal processo di rumore al condizionamento sul testo, è costruito nel libro.

Leggi «Modelli di diffusione» nel libro →

La risposta della ricerca sono stati gli agenti: sistemi che mettono attorno al generatore un modello linguistico capace di cercare sul web (Mind-Brush, Gen-Searcher), di tradurre il layout in codice visivo (GenClaw), di scomporre la richiesta, verificare l’immagine e correggerla in un ciclo (GEMS, SCOPE). Funzionano, sui prompt difficili. Ma gli autori indicano due difetti. Il primo è la frammentazione: ogni sistema è un silo con la sua specialità, difficile da combinare con gli altri. Il secondo è quello che chiamano compute-mismatch: ogni sistema applica la sua catena completa a ogni richiesta, e un gatto su un divano paga lo stesso giro di ricerca, ragionamento e verifica di un’infografica.

Il ciclo dell’agente (ragionare, chiamare uno strumento, osservare, ripetere) e il ruolo della memoria sono nel capitolo del libro dedicato.

Leggi «Agenti» nel libro →

Prima si smonta: GenCanvas

La prima metà del lavoro non è l’instradatore ma il terreno su cui corre. GenCanvas scompone i sistemi esistenti in otto primitive: riscrivere il prompt, scomporlo, cercare, ragionare, applicare una skill, verificare, rifinire, fare un bozzetto (in SVG, HTML/CSS o Three.js, che il generatore usa poi come traccia di layout). Con queste primitive gli autori compongono nove modelli di workflow, ordinati in quattro livelli, dal più leggero al più completo: allineamento semantico (DirectGen, RewriteGen), ancoraggio esterno (SearchGen, RefGen), ragionamento strutturale (ReasonGen, SkillGen, SketchGen), raffinamento iterativo (VerifyGen, HybridGen). A ciascun modello la tabella del paper associa un sistema precedente: Gen-Searcher e Mind-Brush all’ancoraggio esterno, GenClaw al bozzetto, GEMS alle skill e alla verifica, SCOPE all’ibrido. Gli autori precisano che la corrispondenza è concettuale, non un’implementazione equivalente.

Un piano d’esecuzione è una coppia $p = (w, g)$: un workflow e il generatore che lo chiude. E il compito dell’instradatore, per ogni prompt $x$, è scegliere il piano che massimizza un’utilità che mette nello stesso conto qualità, costo e attesa:

$$p^* = \arg\max_{p \in \mathcal{P}} \; S(p \mid x) – \lambda_c\, C(p \mid x) – \lambda_l\, L(p \mid x)$$

In questa scrittura, osservano gli autori, i sistemi agentici esistenti sono il caso in cui lo spazio dei piani ha un solo elemento. Non scelgono: eseguono.

Poi si sceglie: triage, memoria, Pareto

GenRouter: dalla firma della richiesta alla strada Richiesta Firma (profilatore) Workflow di GenCanvas «Un gatto su un divano, stile acquerello» «Il copricapo arricciato dei giudici britannici del Settecento» «Un’aula: un aeroplanino in volo, un mappamondo in alto a sinistra, una pila di libri alta il doppio» I · Allineamento semantico DirectGen, RewriteGen II · Ancoraggio esterno SearchGen, RefGen III · Ragionamento strutturale ReasonGen, SkillGen, SketchGen IV · Raffinamento iterativo VerifyGen, HybridGen Assi della firma, da sinistra: semantica · fatti · riferimento visivo · logica · composizione · critica · disposizione. Tratteggio = soglia 3. Terracotta = asse sopra soglia. Livelli da I a IV: dal più leggero al più completo. Valori illustrativi. La firma pota (IV solo con due assi non semantici sopra soglia); fra i superstiti sceglie la memoria.

Il triage. Un modello piccolo e locale, Qwen3.5-4B, non decide la strada: legge il prompt e gli assegna un punteggio da 0 a 5 su sette assi (articolazione semantica, fatti, riferimenti visivi, logica, composizione, critica, disposizione nello spazio). Da 3 in su il bisogno è alto. Gli autori scartano sia il routing per somiglianza semantica, perché aggiungere «con la scritta esatta “ICLR 2027”» cambia poco l’embedding e molto il lavoro, sia il modello linguistico usato direttamente come instradatore, perché mal calibrato. La firma serve a potare: i workflow pesanti si accendono solo se la richiesta li giustifica. HybridGen, il più costoso, per esempio solo così:

$$\text{active}(w_{\text{HybridGen}}) = \mathbb{I}\Big[\sum_{k \in \mathcal{H}} \mathbb{I}(z_k \ge 3) \ge 2\Big]$$

dove $\mathcal{H}$ sono i sei assi diversi dalla semantica: servono almeno due bisogni alti insieme.

La memoria. Fra i piani sopravvissuti, GenRouter stima qualità, costo e attesa da quello che è già successo. Una memoria di traiettorie recupera i prompt passati più simili che hanno usato esattamente quel piano; una memoria di rotte distilla quei casi in statistiche per categorie grossolane di firma, utili quando i precedenti esatti mancano. Le due stime si fondono con un peso $\alpha_p$ che cresce con il numero di precedenti trovati: $\hat S_p = \alpha_p \hat S_{\text{traj}}(p) + (1-\alpha_p)\,\hat S_{\text{route}}(p)$. Senza memoria, all’avvio, si torna a soglie fisse sulla firma.

Il filtro. Prima di scegliere, si scartano i piani dominati: quelli per cui ne esiste un altro non peggiore su nessuna delle tre misure e migliore su almeno una. Poi si prende il massimo dell’utilità fra i superstiti. A rigore, con pesi positivi un piano dominato non può vincere la somma pesata; eppure l’ablazione senza filtro perde un punto (72,52 contro 73,52), e il paper non spiega da dove venga la differenza. Secondo gli autori serve a evitare che la somma pesata premi, per un artefatto dei pesi, un piano che è peggiore in tutto.

E il giro si chiude: ogni cinquanta esecuzioni le immagini vengono valutate, gli esiti entrano in memoria, le statistiche si aggiornano. È questo che gli autori chiamano auto-evoluzione.

I numeri

Tutti i sistemi confrontati usano lo stesso modello per ragionare e verificare, Kimi K2.5, così che la differenza stia nel percorso. I generatori sono Z-Image-Turbo e Qwen-Image-2512. Sulla media di cinque benchmark (WISE, DPG-Bench, GenEval2, OneIG in inglese e in cinese), con Qwen-Image, GenRouter fa meglio di GEMS, il sistema più pesante, a una frazione del costo e dell’attesa. È da qui che vengono il «95% di costo in meno» e il «65% di latenza in meno» dell’abstract.

Il test più eloquente è su un insieme misto di 500 prompt presi da nove benchmark, contro HybridGen eseguito sempre: stessa qualità, circa un quinto del costo.

Stessa qualità, costo diverso punteggio più alto è meglio · costo e attesa, più bassi
Sistema Punteggio Costo Attesa
Media di cinque benchmark, con Qwen-Image
GenRouter 71,3 2,97 dollari 4,68 ore
GEMS, il più pesante 68,7 59,70 dollari 13,62 ore
Insieme misto di 500 prompt
HybridGen, sempre 73,53 6,27 dollari 8,78 ore
GenRouter 73,52 1,37 dollari 1,76 ore

La distribuzione delle scelte ha senso: su DPG-Bench, orientato all’estetica, il 68,83% dei prompt va a RewriteGen; su OneIG in cinese il 28,48% va a ReasonGen.

Le ablazioni dicono quale pezzo pesa. Lasciare al router le otto primitive sciolte, senza i modelli di workflow, fa scendere il punteggio a 65,00 e salire il costo a 2,03 dollari: la libertà, spiegano gli autori, produce esecuzioni instabili e chiamate ridondanti. Svuotare la memoria porta il costo a 5,33 dollari e l’attesa a 7,13 ore. Accumulando esperienza da tre benchmark, sull’insieme misto la qualità sale da 73,5 a 75,2, con costo e attesa giù dell’8,7% e del 7,9%.

Che cosa i numeri non dicono

Il costo misurato non è tutto il costo. Per scelta dichiarata, costo e latenza contano solo l’orchestrazione (chiamate ai modelli linguistici, ricerche) e non l’inferenza del generatore di immagini, per non penalizzare i generatori più capaci. È una scelta difendibile per confrontare percorsi, ma un ciclo di verifica che rigenera più volte l’immagine costa più di quanto la tabella mostri, e il risparmio rispetto a GEMS, sui conti di chi paga la GPU, sarà diverso.

L’esperienza è valutata con il metro dell’esame. L’avvio a freddo, tenuto separato dalla valutazione, esegue tutti i piani validi su dieci prompt presi dal benchmark bersaglio, e la memoria si aggiorna usando i valutatori ufficiali dei benchmark. In un servizio reale quel valutatore non c’è: qualcuno, o qualcosa, dovrà dare il voto alle immagini, e il paper non dice quanto costi né quanto sia affidabile un sostituto. Non solo: l’insieme misto su cui si misura l’auto-evoluzione, che il paper considera mai visto, contiene cinquanta prompt per ciascuno dei tre benchmark da cui l’esperienza viene accumulata.

I margini non sono uniformi. Con Z-Image la media di GenRouter, 68,1, resta sotto quella di GEMS, 68,5, pur a meno di un decimo del costo. Su DPG-Bench con Qwen-Image passa da 87,21 del generatore nudo a 87,39: lì l’agente serve poco a chiunque. E il paper parla di costo «dimezzato» nel trasferimento da WISE a DPG-Bench, ma il confronto con un instradatore basato su un modello linguistico è 1,51 contro 2,40 dollari: poco più di un terzo in meno.

Il perimetro è fisso. Nove modelli di workflow scritti a mano, due generatori, un solo modello di ragionamento. I pesi dell’utilità, $\lambda_c = 5{,}0$ e $\lambda_l = 0{,}0006$, sono scelti con un’analisi di sensibilità sullo stesso insieme misto su cui si riportano i risultati, e con $\lambda_c = 10$ la qualità scende già di mezzo punto (73,00).

Perché conta adesso

La discussione sugli agenti si è concentrata a lungo su che cosa sanno fare in più. GenRouter porta nei sistemi agentici per immagini una domanda che nei modelli linguistici circola da tempo: quanto costa farlo sempre. Il contributo più durevole potrebbe non essere l’instradatore, ma GenCanvas, un vocabolario comune che rende confrontabili pipeline finora separate, e che conta token e secondi allo stesso modo per tutte. Il resto è il buon senso del triage, reso misurabile: la risonanza a chi serve, e al raffreddore un’aspirina.

I commenti sono riservati agli iscritti.

Accedi per commentare