Nowoczesne modele ASR traktują styl transkrypcji (dosłowny vs. intencyjny) jako niekontrolowaną zmienną ukrytą, co prowadzi do niestabilności dekodowania,...
论文研究HuggingFace Daily Papers(社区热门论文)
Dzisiejszy biuletyn AI
Nowoczesne modele ASR traktują styl transkrypcji (dosłowny vs. intencyjny) jako niekontrolowaną
zmienną ukrytą, co prowadzi do niestabilności dekodowania, a nawet 60% WER wynika z niedopasowania stylu. Poprzez trenowanie tokenu zadania dekodera wrażliwego na pokrycie na równoległych transkrypcjach dosłownych/intencyjnych, można osiągnąć poprawę płynności F1 w języku niemieckim od 10% przy próbie zero-shot do 79% wyłącznie przy trenowaniu na języku angielskim. Nadzorowane dostrajanie z krzyżową uwagą po raz pierwszy w przypadku niepłynnej mowy przewyższa bazę wymuszonego dopasowania pod względem znaczników czasowych na poziomie słów, a nowe zadanie verbatimize może zwiększyć wskaźnik odzyskiwania rzadkich słów z 6,8% do 96,1%.
Fragment oryginalnego artykułu
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Nowoczesne modele ASR traktują styl transkrypcji (dosłowny vs. intencyjny) jako niekontrolowaną zmienną ukrytą, co prowadzi do niestabilności dekodowania,...