現代のASRモデルは、文字ごとと意図ごとの転写スタイルを制御されない潜在変数として扱うため、デコーディングが不安定になり、最大60%のWERがスタイルの不一致から生じています。
平行する文字ごと/意図ごとの転写ペア上でタスクトークンを用いたカバレッジ感知デコーダーを訓練することで、英語のみの訓練でもドイツ語の流暢でないF1をゼロショット状態から79%に引き上げることができます。 教師付きクロスアテンション微調整により、流暢でない音声上での単語レベルタイムスタンプが初めて強制アライメントのベースラインを超えました。 新しいタスクverbatimizeは、稀な単語の再現率を6.8%から96.1%に向上させることができます。
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.

