Chi ha mai dovuto verbalizzare una riunione conosce la domanda che nessuno fa ad alta voce. Il collega ha detto «allora, io io… ehm, cioè, la la proposta è questa». Nel verbale si scrive «la proposta è questa», perché il verbale serve a sapere che cosa è stato deciso. Ma se quel verbale finisse sulla scrivania di una logopedista, le due ripetizioni e l’«ehm» sarebbero proprio l’informazione che le serve. Nessuna delle due versioni è sbagliata: sono due politiche diverse, e chi scrive deve sapere quale gli viene chiesta.
I riconoscitori vocali, invece, non lo sanno. È la tesi di Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing, uscito su arXiv il 21 luglio 2026 (2607.18934) e in tendenza su Papers with Code. Lo firmano Laurin Wagner, Mario Zusag e Bernhard Thallinger di nyra labs, in Austria, e modelli, dati e codice di valutazione stanno nel repository pubblico di CrisperWhisper, un lavoro precedente dello stesso gruppo.
Due stili mescolati senza etichetta
Le due politiche hanno un nome. La trascrizione verbatim conserva tutto quello che si sente: riempitivi come «uh» e «um», ripetizioni, parole tagliate a metà, autocorrezioni, e anche risate, colpi di tosse, respiri. Quella intended, cioè «come si intendeva dirlo», tiene solo il contenuto fluente. La seconda è più comoda da leggere; la prima serve dove le disfluenze sono il dato: diagnosi di disturbi neurologici e del linguaggio, sintesi vocale espressiva, persone che balbettano e che i trascrittori attuali sbagliano sistematicamente.
Whisper è stato addestrato su 680.000 ore di audio annotato da mani diverse con convenzioni diverse, senza che nulla dicesse al modello quale convenzione valesse per quale esempio. Il risultato, sostengono gli autori, è che lo stile di trascrizione diventa una variabile nascosta: la stessa esitazione a volte viene scritta, a volte omessa, a volte resa come «uuumm», a seconda del contesto acustico.
Come funziona un riconoscitore encoder-decoder alla Whisper, e come si calcola il word error rate, lo spiega il libro.
I danni misurati sono tre. Il primo è l’instabilità: facendo produrre a Whisper dieci ipotesi di beam search sugli stessi spezzoni disfluenti del corpus di riunioni AMI, la divergenza mediana fra le ipotesi più lontane è del 15,1% a livello di caratteri, e Canary-1B di NVIDIA resta appena sotto (14,6%). Su parlato letto e pulito, LibriSpeech, la divergenza di Whisper è praticamente zero. Il modello esita proprio dove le due politiche si separano.
Il secondo è la valutazione. Gli autori scompongono il word error rate in una parte di contenuto, il content loss rate (la quota di parole del riferimento pulito che mancano nella trascrizione), e in una parte di stile, la differenza fra le due. Il riferimento verbatim e quello intended dello stesso audio, che per costruzione hanno le stesse parole di contenuto, distano fra loro il 3,7% di WER su TED-LIUM e il 12,1% su AMI, due benchmark dell’Open ASR Leaderboard. Il WER di Whisper su TED-LIUM passa dal 5,7 al 7,3% a seconda del riferimento scelto, con la stessa perdita di contenuto (3,8%). Su AMI circa il 60% del WER riportato è stile, non errore.
Il terzo è il tempo. Se il modello non ha deciso se scrivere quella ripetizione, chiedere a che millisecondo comincia la parola successiva è una domanda mal posta. L’attenzione incrociata di Whisper, usata per stimare i confini delle parole, sbaglia in media di 203 millisecondi sul parlato letto di TIMIT e di 568 sul parlato disfluente di FluencyBank.
Un interruttore in testa al decodificatore
La tesi centrale è che il problema non sia insegnare al modello una capacità nuova, ma attivarne una che ha già. Lo strumento sono dei token di modo, anteposti al prompt del decodificatore: cinque per la modalità intended e cinque per quella verbatim, dove questi ultimi si dividono in tre per le disfluenze e due per i suoni. Al vocabolario di Whisper-medium si aggiungono anche «uh» e «um», dodici eventi sonori (risata, tosse, sospiro…) e due delimitatori.
Durante l’addestramento ogni clip ha entrambe le trascrizioni, e ogni volta se ne sceglie a caso una, con i suoi token. Il codificatore stabilisce che cosa c’è nell’audio, i token di modo che cosa scrivere. Le trascrizioni pulite dei corpora verbatim (ICSI, AMI, CORAAL e un sottoinsieme di 40 ore del National Speech Corpus di Singapore) sono state generate da GPT-4o, togliendo riempitivi e suoni e riducendo ripetizioni e false partenze alla loro correzione.
Il dettaglio meno ovvio è la ripartizione per copertura. Alcuni corpora annotano le disfluenze ma non i suoni; altri, costruiti dagli autori iniettando da uno a due eventi sonori nelle pause oltre i 200 millisecondi di 30.000 clip pulite, annotano i suoni ma non le disfluenze. Con un unico gruppo di token verbatim uguale per tutti, il modello verrebbe punito per aver scritto una tosse in un esempio e per averla omessa in un altro, solo perché le annotazioni sono incomplete. Dando a ogni esempio solo i token che corrispondono a ciò che è stato davvero annotato, il modello può attribuire le assenze ai dati e non all’audio.
L’addestramento è a due fasi, su una sola A100. Nella prima tutto Whisper è congelato e si addestrano soltanto gli embedding dei token nuovi, per un’epoca; nella seconda si scongela il decodificatore, con un tasso di apprendimento più basso, per tre epoche.
I numeri: attivare, non imparare
Sul set DisfluencySpeech inglese e su un set tedesco di 202 frasi registrato dagli autori, la F1 sugli eventi di disfluenza cresce in due tappe. La sola prima fase, con i pesi del modello intatti, basta già a un salto netto; la seconda aggiunge il resto, senza nessun dato verbatim tedesco.
| Modello | Inglese | Tedesco |
|---|---|---|
| Whisper così com’è | 12,0% | 10,3% |
| Dopo la prima fase, pesi intatti | 53,0% | 78,9% |
| Dopo la seconda fase | 90,7% | 93,8% |
Lo stesso modello interrogato senza token di modo si ferma al 60,1% in tedesco: 34 punti persi soltanto per non avergli detto che cosa si voleva.
L’esperimento di diluizione lo conferma. Variando dallo 0 al 100% la quota di esempi verbatim nell’addestramento, il modello senza token si comporta in modo incoerente in tutta la fascia fra il 15 e l’85%; con il 10% di dati verbatim raggiunge appena il 2% di F1. Con i token resta intorno all’80% a ogni miscela.
Il WER verbatim in inglese scende al 4,0%, contro il 4,9% di AssemblyAI Universal-3-Pro e il 5,2% di Reverb. In tedesco scende al 5,1%, contro il 24,7% di Whisper. E la modalità pulita non ne soffre, anzi: il WER intended inglese passa da 14,2 a 9,4%, perché cala la quota di disfluenze che trapelano nel testo pulito. La divergenza fra le ipotesi di beam su AMI scende dal 15,1 all’8,1% in modalità verbatim e all’11,2% in quella intended.
I tempi parola per parola
Con l’uscita stabilizzata, gli autori addestrano direttamente l’attenzione incrociata a fare da allineatore. Scelgono le dieci teste le cui mappe di attenzione, senza addestramento, somigliano di più agli allineamenti veri di TIMIT; per ogni token $t$ costruiscono un bersaglio binario $g_t$ che vale uno sui fotogrammi da 20 millisecondi occupati dalla parola a cui il token appartiene, e minimizzano la distanza coseno fra quel bersaglio e l’attenzione media $\bar a_t$ delle dieci teste:
$$\mathcal{L}_{\text{timing}} = \frac{1}{T}\sum_{t=1}^{T}\left(1 – \frac{\bar a_t \cdot g_t}{\lVert \bar a_t\rVert\,\lVert g_t\rVert}\right).$$
La perdita pesa 0,2 rispetto all’entropia incrociata, e i bersagli vengono dal Montreal Forced Aligner su 500 ore. All’inferenza l’attenzione viene resa più netta elevandola alla potenza $\tau = 3$, un modello basato sull’energia del segnale assorbe le pause, e un allineamento di Viterbi assegna le parole ai fotogrammi. Calcolare la perdita sulla media delle teste, e non testa per testa, conta: 36 contro 45 millisecondi di errore su TIMIT.
Sul parlato disfluente di FluencyBank l’errore medio sui confini è il più basso del confronto: è il punto in cui gli autori rivendicano, per la prima volta con un metodo solo ad attenzione, di battere l’allineamento forzato.
| Metodo | Errore |
|---|---|
| Attenzione addestrata a fare da allineatore | 102 |
| CrisperWhisper, con la stessa attenzione resa più netta all’inferenza | 122 |
| Montreal Forced Aligner | 142 |
| WhisperX | 200 |
Sul parlato letto di TIMIT, però, il Montreal Forced Aligner resta nettamente davanti, 19 millisecondi contro 36. Il vantaggio sta dove le parole si ripetono e si spezzano.
Verbatimize: arricchire i corpora che già esistono
Il terzo meccanismo è un compito nuovo. Le trascrizioni pulite di buona qualità abbondano, quelle verbatim coerenti sono rare e care. Verbatimize prende l’audio e una trascrizione pulita, la mette fra due delimitatori dopo i token verbatim, e chiede al modello di ricopiarla inserendo le disfluenze che sente, al loro posto. Per costringerlo a leggere davvero il prompt, in addestramento da una a tre parole di contenuto vengono scritte in maiuscolo sia nel prompt sia nel bersaglio.
La prova è su 1.342 clip di ICSI che contengono 1.843 occorrenze di parole rare, gergo tecnico e nomi propri, scelte perché difficili da ricavare dal solo suono, verificate a mano e assenti dal resto dei dati di addestramento. Trascrivendo dal solo audio il modello ne recupera il 6,8%; con verbatimize il 94,1%, e con il trucco delle maiuscole il 96,1%, mentre la perdita di contenuto scende dal 9,4 all’1,3%.
Che cosa resta da verificare
Il salto linguistico è breve. Il trasferimento è provato soltanto dall’inglese al tedesco, due lingue vicine, e lo dicono gli autori per primi. Per l’italiano la domanda resta aperta.
Il set tedesco è piccolo e recitato. Sono 202 frasi registrate dagli autori, che non sono parlanti addestrati: disfluenze prodotte apposta, che possono essere meno naturali di quelle vere. Il modello finale aggiunge poi 10.000 esempi verbatim tedeschi da un dataset interno non pubblico, anche se il guadagno sul tedesco è modesto (dal 93,8 a circa il 95%).
Parte della verità di riferimento è sintetica. Le trascrizioni pulite sono prodotte da GPT-4o, i tempi di addestramento dal Montreal Forced Aligner e non da confini segnati a mano: gli autori dichiarano il secondo punto, non il primo. E la scomposizione del WER, pur convincente, poggia sulla stessa idea di trascrizione canonica che il paper propone.
Perché conta adesso
Il messaggio più utile non riguarda le disfluenze. Quando un grande modello preaddestrato si comporta in modo incoerente, dice il paper, la cura giusta può essere un segnale di controllo e non altri dati: 27 vettori nuovi, con i 764 milioni di parametri di Whisper-medium lasciati come erano, portano la F1 tedesca dal 10 al 79%, perché la capacità, sostengono gli autori, c’era già. E per chi confronta trascrittori sulle classifiche pubbliche c’è un avvertimento concreto: una parte del WER riportato misura soltanto se chi ha scritto il riferimento e chi trascrive hanno deciso allo stesso modo se scrivere «ehm». Distinguere la parola sbagliata dallo stile diverso è la condizione minima per sapere quale modello sente meglio.

I commenti sono riservati agli iscritti.
Accedi per commentare