I moderni modelli ASR trattano lo stile di trascrizione (parola per parola vs. intenzione) come una variabile latente non controllata, causando instabilità...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief quotidiano sull’IA
I moderni modelli ASR trattano lo stile di trascrizione (parola per parola vs. intenzione) come una
variabile latente non controllata, causando instabilità nella decodifica, e fino al 60% del WER deriva dalla mancata corrispondenza dello stile. Addestrando il token di compito del decodificatore percettivo su coppie parallele di trascrizioni parola per parola/intenzionali, è possibile migliorare l'F1 non fluente del tedesco dal 10% in zero-shot al 79% usando solo l'inglese. Il fine-tuning supervisionato con attenzione incrociata sui timestamp a livello di parola supera per la prima volta il baseline di allineamento forzato per la voce non fluente; il nuovo compito "verbatimize" può aumentare il tasso di richiamo delle parole rare dal 6,8% al 96,1%.
Estratto dell’articolo originale
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
I moderni modelli ASR trattano lo stile di trascrizione (parola per parola vs. intenzione) come una variabile latente non controllata, causando instabilità...