Stratégie de transcription en tant que variable latente : reconnaissance vocale automatique mot à mot contrôlable par activation temporelle au niveau du mot
Les modèles ASR modernes considèrent le style de transcription (mot à mot vs intention) comme une variable latente non contrôlée, ce qui entraîne une insta...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief IA du jour
Les modèles ASR modernes considèrent le style de transcription (mot à mot vs intention) comme une
variable latente non contrôlée, ce qui entraîne une instabilité du décodage, et jusqu'à 60 % du WER provient d'un décalage de style. En entraînant le token de tâche du décodeur perceptif sur des paires de transcriptions mot à mot/intention parallèles, l'entraînement uniquement en anglais peut améliorer le F1 irrégulier en allemand de 10 % en zéro échantillon à 79 %. Le réglage fin supervisé avec attention croisée sur la parole irrégulière permet pour la première fois de surpasser la base de référence d'alignement forcé aux horodatages au niveau des mots, et la nouvelle tâche verbatimize peut augmenter le rappel des mots rares de 6,8 % à 96,1 %.
Article et notes de source
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Les modèles ASR modernes considèrent le style de transcription (mot à mot vs intention) comme une variable latente non contrôlée, ce qui entraîne une insta...