Al bancone del bar il barista porge la tazzina e nessuno la afferra a piena mano. La si prende per il manico, pollice e indice, con il medio sotto a fare da appoggio. Stringerla con tutte e cinque le dita sarebbe più stabile, ma la tazzina scotta, e il caffè si deve poter bere. La presa giusta non è la più salda, è quella che serve a quello che si vuole fare dopo.
È la distinzione da cui parte CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning, uscito su arXiv il 20 agosto 2026 (2608.19776). Lo firmano Julien Mérand, Boris Meden e Mathieu Grossard del CEA List (Università Paris-Saclay) e Liming Chen dell’École Centrale di Lione. Il codice è annunciato sulla pagina del progetto; tra i finanziatori c’è il progetto europeo JARVIS (Horizon Europe).
Il pugno come scorciatoia
Una mano robotica «abile» (dexterous, in inglese), cioè a più dita e con molti gradi di libertà come la Shadow Hand o la Allegro Hand, può in teoria fare quasi tutto quello che fa una mano umana: pizzicare una chiave, reggere una penna, far ruotare un oggetto tra le dita. I pianificatori di presa basati sui dati, però, sono addestrati a rispondere a una domanda sola: questo oggetto si può afferrare? Imparano da grandi archivi sintetici generati ottimizzando la stabilità, e la stabilità ha una risposta preferita: avvolgere l’oggetto con il palmo e tutte le dita.
Il risultato, scrivono gli autori, è una forma di collasso: i modelli sanno generare prese solide ma quasi tutte uguali, e se un compito richiede una presa di precisione bisogna generarne e scartarne una quantità impraticabile prima di trovarne una adatta. Le alternative che condizionano la presa su un tipo preciso esistono (la più vicina è Dexonomy, presentata a RSS 2025), ma dipendono da dataset in cui ogni tipo di presa è stato calcolato e annotato su oggetti specifici. Costruirli costa molto, e quando un oggetto nuovo non si presta allo schema articolare rigido precalcolato l’ottimizzazione fallisce o scivola in un tipo di presa diverso da quello richiesto.
Descrivere la presa dal lato della mano
La prima scelta di CoToGrasp è il vocabolario. Invece della tassonomia classica di Feix usa quella di Gonzalez, Gosselin e Bachta (2014), che classifica le prese solo in base a quali zone della mano toccano, non alla forma dell’oggetto: 21 topologie di contatto, costruite su 22 zone anatomiche delle dita e del palmo. Gli autori le raggruppano in tre famiglie: prese di forza, prese di precisione e prese specifiche per un oggetto, cioè le configurazioni molto vincolate che servono per usare un attrezzo. Ogni topologia diventa una maschera sui punti della superficie della mano robotica: questi punti devono toccare, gli altri no.
La seconda scelta è un rovesciamento. Il contatto è una relazione simmetrica: se un punto della mano tocca l’oggetto, un punto dell’oggetto tocca la mano. Alcuni metodi precedenti chiedevano «dove posso toccare l’oggetto?», e l’oggetto è un dominio senza confini, con forme infinite. CoToGrasp rovescia la domanda: «quali zone della mia mano vengono attivate da questo oggetto?». La mano ha una forma fissa e uno spazio di configurazioni articolari limitato, e il problema diventa più piccolo.
Per rendere possibile il rovesciamento, gli autori introducono uno spazio di lavoro canonico: un insieme fisso di punti nello spazio, ancorato al sistema di riferimento della mano, con il palmo sempre nell’origine. Qualunque geometria entri nel modello, una codifica locale (una rete DGCNN) ne estrae le caratteristiche punto per punto, che vengono poi proiettate su quei punti fissi mediando sui $k$ vicini più prossimi, con un peso che penalizza le superfici orientate male:
$$\mathcal{F}_{\mathcal{W}_j} = \frac{1}{k} \sum_{i \in \mathcal{N}_j} \mathbf{f}_i \, e^{-\mathcal{D}_{\text{aligned}}(\mathbf{p}_i, w_j)}$$
La distanza $\mathcal{D}_{\text{aligned}}$ combina la distanza euclidea con l’allineamento della normale alla superficie. Il trucco sta in cosa entra nel modello nei due momenti. In addestramento entra soltanto la mano, in una delle sue configurazioni. In uso entra l’oggetto, portato nel riferimento della mano e con le normali invertite, così che la sua superficie diventi un calco in negativo della mano che dovrebbe accoglierlo. Lo spazio di lavoro è lo stesso nei due casi. Il divario fra i due domini si riduce senza sparire: in appendice la somiglianza fra punti corrispondenti di mano e oggetto sale da 0,35 a 0,61 dopo la proiezione.
Sui punti dello spazio di lavoro, trattati come token, lavora un encoder Transformer che riceve anche l’indicazione della topologia richiesta: è l’attenzione a imparare quali zone tendono ad attivarsi insieme in ciascun tipo di presa. Un Set Transformer ne comprime il risultato e un autoencoder variazionale condizionale restituisce, per ogni punto, la zona della mano che dovrebbe trovarsi lì, oppure «nessun contatto». La parte generativa serve alla variabilità dentro la stessa topologia: due pinze pollice-indice non sono mai identiche.
Qui si dà per noto che cosa faccia un autoencoder variazionale: comprimere in uno spazio latente, campionare da una gaussiana, ricostruire. La costruzione, con l’ELBO e il trucco della riparametrizzazione, è nel capitolo del libro sui modelli latenti.
Leggi «Modelli latenti e inferenza variazionale» nel libro →
I dati di addestramento stanno in poche cifre: 10.000 configurazioni articolari della mano campionate a caso, ognuna abbinata alle 21 maschere, per 210.000 esempi. Nessuna mesh di oggetti, nessuna simulazione fisica. L’addestramento ha richiesto circa 35 ore su quattro GPU A100.
Al momento dell’uso la maschera prevista passa per due filtri prima di diventare una presa. Il primo confronta le zone previste con quelle richieste e accetta al massimo una zona mancante o di troppo: se l’oggetto non offre la geometria per quel tipo di presa, la si scarta subito. Il secondo stima in modo approssimato la force-closure, cioè se i contatti previsti potrebbero trattenere l’oggetto; se no, si ricampiona dal latente, fino a venti volte. Solo allora un’ottimizzazione cerca la configurazione delle dita che allinea la mano alle zone previste, evitando compenetrazioni, e aggiunge un termine repulsivo che tiene le dita e le zone del palmo inutilizzate ad almeno 5 millimetri dall’oggetto. La posa della mano nello spazio, invece, non la decide il modello: arriva da fuori, da un pianificatore o da un operatore, e negli esperimenti da un’euristica.
I numeri, e il prezzo pagato
Per misurare il collasso gli autori propongono una metrica di varietà: l’entropia normalizzata della distribuzione delle prese generate sulle 21 topologie,
$$H = \frac{-\sum_{m=1}^{M} \tilde f_m \ln \tilde f_m}{\ln M},$$
che vale 1 quando tutte le topologie sono rappresentate alla pari e tende a 0 quando il modello fa sempre la stessa cosa. Nella variante semantica, $\tilde f_m$ è il tasso di rispetto della topologia $m$, normalizzato sulla somma di tutte.
Il primo confronto, con la Shadow Hand su un sottoinsieme di dieci oggetti di MultiDex, è contro quattro pianificatori che non ricevono nessuna indicazione sul tipo di presa. CoToGrasp raggiunge l’entropia semantica più alta, 0,83, contro valori tra 0,60 e 0,74 degli altri, ed è il più rapido: 0,11 secondi a presa contro 0,20 di GOAG (il lavoro precedente degli stessi autori), 1,72 di DRO-Grasp e oltre mezz’ora di DFC. Il prezzo è scritto nella stessa tabella: il tasso di successo in simulazione, cioè le prese che reggono l’oggetto sotto spinte lungo i tre assi in Isaac Gym, è del 36,94% contro il 63–78% dei concorrenti. Gli autori lo spiegano così: il loro metodo è obbligato a tentare anche le pinze di precisione su oggetti che si prenderebbero a pugno, gli altri scelgono la presa più facile. È un argomento sensato, ma resta un tasso di successo inferiore alla metà di quello del migliore.
Il confronto che conta è quello con Dexonomy, l’unico concorrente disponibile che accetta un tipo di presa in ingresso, sui 1.126 oggetti del test set di DexGraspNet. Qui CoToGrasp vince su tutte le colonne, e lo scarto più netto è sulle prese di precisione.
| Misura | CoToGrasp | Dexonomy |
|---|---|---|
| Successo medio per topologia | 26,72% | 21,13% |
| Rispetto della topologia richiesta | 17,18% | 14,28% |
| Entropia semantica | 0,84 | 0,77 |
| Dove lo scarto è più netto | ||
| Successo sulle prese di precisione | 22,71% | 12,36% |
| Successo sulla pinza di tipo M2 | 30,3% | 10,5% |
Togliendo entrambi i filtri il rispetto della topologia scende a 14,72%, praticamente al livello di Dexonomy: la verifica prima dell’ottimizzazione fa buona parte del lavoro. Dei 110 millisecondi per presa la rete ne usa 0,3, i due controlli circa 57, l’ottimizzazione circa 51, la posa iniziale il resto.
Che cosa resta da vedere
I valori assoluti sono bassi. Circa una presa su sei rispetta la topologia richiesta, misurata dopo la simulazione. Gli autori la attribuiscono alla severità della metrica, che punisce i contatti in più più di quelli mancanti: una falange che resta appoggiata all’oggetto per i limiti cinematici della mano, o un dito che scivola in simulazione, bastano a riclassificare una pinza come un’altra presa. Ma prima della simulazione il rispetto della topologia è del 21,92%: il grosso della distanza c’è già all’uscita dell’ottimizzazione. Le medie, poi, escludono le coppie oggetto-topologia in cui nessun tentativo è riuscito, circa un oggetto su cinque per topologia, per entrambi i metodi. E la metrica, la sua soglia e la mappatura da Feix a Gonzalez usata per il confronto con Dexonomy sono scelte degli autori.
Il concorrente è uno solo. Gli autori lo motivano: gli altri metodi con controllo semantico partono da dimostrazioni umane o non sono pubblici, e anche il giudizio su alcuni punteggi alti di Dexonomy (60,5% su una presa specifica, che secondo loro nasconde prese a pugno non verificate) è una loro lettura di un’analisi qualitativa.
Il robot vero è una dimostrazione, non una misura. Su un braccio UR10 con una Allegro Hand, che ha quattro dita e quindi non può eseguire una delle topologie, le prese sugli oggetti YCB vengono formate, sollevate di 15 centimetri e tenute per tre secondi. Il paper ne mostra una galleria ma non un tasso di successo. E nell’appendice gli autori sono espliciti sul problema: con il controllo in posizione le dita arrivano sull’oggetto in momenti diversi, la prima lo sposta prima che le altre lo chiudano, e i punti di contatto reali scivolano via da quelli previsti. Servirà un controllo che senta la forza, o il tatto.
Perché conta adesso
La spinta dichiarata del paper sono i robot umanoidi guidati da modelli linguistici, che ricevono istruzioni come «passami il cacciavite» e devono tradurle in un gesto. Tra l’intenzione e le dita manca un anello: un vocabolario di prese che un pianificatore di alto livello possa chiedere per nome, e un modulo che sappia eseguirlo su oggetti che non ha mai visto. CoToGrasp propone quell’anello con un’idea economica: imparare le capacità della mano invece delle forme degli oggetti. I numeri dicono che il vocabolario funziona meglio dell’unica alternativa confrontata e che il pugno non è più l’unica parola; dicono anche che, tra chiedere la presa giusta e ottenerla su un tavolo vero, la distanza è ancora grande.

I commenti sono riservati agli iscritti.
Accedi per commentare