Modelos ASR modernos tratam o estilo de transcrição (palavra por palavra vs. intenção) como uma variável latente não controlada, resultando em decodificaçã...
论文研究HuggingFace Daily Papers(社区热门论文)
Resumo diário de inteligência em IA
Modelos ASR modernos tratam o estilo de transcrição (palavra por palavra vs. intenção) como uma
variável latente não controlada, resultando em decodificação instável, e até 60% do WER vem de incompatibilidade de estilo. Treinando o token de tarefa do decodificador sensível à cobertura em pares paralelos de transcrição palavra por palavra/intenção, apenas com treinamento em inglês, é possível aumentar o F1 desfluente do alemão de zero exemplos para 79%. O fine-tuning supervisionado com atenção cruzada atingiu timestamps de nível de palavra em fala desfluente pela primeira vez além da linha de base de alinhamento forçado, e a nova tarefa verbatimize pode aumentar o recall de palavras raras de 6,8% para 96,1%.
Trecho do artigo original
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Modelos ASR modernos tratam o estilo de transcrição (palavra por palavra vs. intenção) como uma variável latente não controlada, resultando em decodificaçã...