Современные модели ASR рассматривают стиль транскрипции (дословно vs. по смыслу) как неконтролируемую скрытую переменную, что приводит к нестабильности дек...
论文研究HuggingFace Daily Papers(社区热门论文)
Ежедневный обзор ИИ
Современные модели ASR рассматривают стиль транскрипции (дословно vs. по смыслу) как
неконтролируемую скрытую переменную, что приводит к нестабильности декодирования, при этом до 60% WER приходится на несоответствие стиля. Обучив токен задачи декодера с учётом покрытия на параллельных дословных/по смыслу транскрипциях, можно только на английском повысить F1 неудобного немецкого с 10% для zero-shot до 79%. Супервизированная доработка с перекрёстным вниманием впервые превзошла базовую схему принудительного выравнивания по временным меткам на уровне слов для неудобной речи; новая задача verbatimize может повысить recall редких слов с 6,8% до 96,1%.
Фрагмент оригинальной статьи
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Современные модели ASR рассматривают стиль транскрипции (дословно vs. по смыслу) как неконтролируемую скрытую переменную, что приводит к нестабильности дек...