현대 ASR 모델은 전사 스타일(단어 단위 vs. 의도)을 제어되지 않는 숨겨진 변수로 취급하여 디코딩이 불안정해지고, 최대 60%의 WER이 스타일 불일치에서 발생한다. 평행 단어/의도 전사 쌍에서 마스킹된 인식형 디코더 작업 토큰을 학습함으로써, 영어만 학습해도 독일어 불유...
论文研究HuggingFace Daily Papers(社区热门论文)
오늘의 AI 정보 요약
현대 ASR 모델은 전사 스타일(단어 단위 vs. 의도)을 제어되지 않는 숨겨진 변수로 취급하여 디코딩이 불안정해지고, 최대 60%의 WER이 스타일 불일치에서 발생한다. 평행
단어/의도 전사 쌍에서 마스킹된 인식형 디코더 작업 토큰을 학습함으로써, 영어만 학습해도 독일어 불유창 F1을 0-샘플에서 10%에서 79%로 향상시킬 수 있다. 감독식 교차 주의 미세조정은 불유창 음성에서 단어 수준의 타임스탬프가 강제 정렬 기준을 처음으로 넘어섰으며, 새로운 작업인 verbatimize는 희귀 단어 재현율을 6.8%에서 96.1%로 높일 수 있다.
본문 및 출처 설명
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
현대 ASR 모델은 전사 스타일(단어 단위 vs. 의도)을 제어되지 않는 숨겨진 변수로 취급하여 디코딩이 불안정해지고, 최대 60%의 WER이 스타일 불일치에서 발생한다. 평행 단어/의도 전사 쌍에서 마스킹된 인식형 디코더 작업 토큰을 학습함으로써, 영어만 학습해도 독일어 불유...