Moderne ASR-modellen beschouwen transcriptiestijl (woord-voor-woord vs. intentie) als een niet- gecontroleerde latente variabele, wat leidt tot onstabiele...
论文研究HuggingFace Daily Papers(社区热门论文)
Dagelijkse AI-briefing
Moderne ASR-modellen beschouwen transcriptiestijl (woord-voor-woord vs. intentie) als een niet-
gecontroleerde latente variabele, wat leidt tot onstabiele decodering, en tot 60% van de WER komt voort uit stijlonverenigbaarheid. Door perceptie-gebaseerde decoder-taaktokens te trainen op parallelle woord-voor-woord/intentie-transcriptieparen, kan men zelfs met alleen Engels de F1-score van onvloeiend Duits van 10% in zero-shot verhogen naar 79%. Gecontroleerde cross-attentie fine-tuning levert voor het eerst op woordniveau tijdstempels bij onvloeiende spraak die de forced-alignment baseline overtreffen, en de nieuwe taak 'verbatimize' kan de recall van zeldzame woorden verhogen van 6,8% naar 96,1%.
Fragment uit het originele artikel
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Moderne ASR-modellen beschouwen transcriptiestijl (woord-voor-woord vs. intentie) als een niet- gecontroleerde latente variabele, wat leidt tot onstabiele...