{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T07:21:26.498Z","headline":"转录策略作为隐变量：用词级时序激活可控逐字ASR","description":"现代ASR模型将转录风格（逐字vs.意图）作为不受控隐变量，导致解码不稳定，且高达60%的WER来自风格不匹配。通过覆盖感知解码器任务token在平行逐字/意图转录对上训练，仅用英语训练即可将德语不流畅F1从10%零样本提升至79%。监督式交叉注意力微调在不流畅语音上的词级时间戳首次超越强制对齐基线，新任务verbatimize可将罕见词召回率从6.8%提升至96.1%。","url":"https://www.aioga.com/news/cmrw2xmqj00ai1p88j8u19r85/","mainEntityOfPage":"https://www.aioga.com/news/cmrw2xmqj00ai1p88j8u19r85/","datePublished":"2026-07-21T00:00:00.000Z","dateModified":"2026-07-21T00:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://arxiv.org/abs/2607.18934","https://aihot.virxact.com/items/cmrw2xmqj00ai1p88j8u19r85"],"canonicalUrl":"https://www.aioga.com/news/cmrw2xmqj00ai1p88j8u19r85/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：现代ASR模型将转录风格（逐字vs.意图）作为不受控隐变量，导致解码不稳定，且高达60%的WER来自风格不匹配。 Aioga 将其归入「论文研究」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmrw2xmqj00ai1p88j8u19r85/","dateCreated":"2026-07-21T00:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"arXiv source article","url":"https://arxiv.org/abs/2607.18934","datePublished":"2026-07-21T00:00:00.000Z","provider":{"@type":"Organization","name":"arXiv","url":"https://arxiv.org/abs/2607.18934"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrw2xmqj00ai1p88j8u19r85","datePublished":"2026-07-21T00:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrw2xmqj00ai1p88j8u19r85"}}],"aggregationSource":"HuggingFace Daily Papers（社区热门论文）","originalPublisher":{"name":"arXiv","url":"https://arxiv.org/abs/2607.18934"},"article":{"id":"cmrw2xmqj00ai1p88j8u19r85","slug":"cmrw2xmqj00ai1p88j8u19r85","url":"https://www.aioga.com/news/cmrw2xmqj00ai1p88j8u19r85/","title":"转录策略作为隐变量：用词级时序激活可控逐字ASR","title_en":"Transcription Policy as a Latent Variable： Activating Controllable Verbatim ASR with Word-Level Timing","summary":"现代ASR模型将转录风格（逐字vs.意图）作为不受控隐变量，导致解码不稳定，且高达60%的WER来自风格不匹配。通过覆盖感知解码器任务token在平行逐字/意图转录对上训练，仅用英语训练即可将德语不流畅F1从10%零样本提升至79%。监督式交叉注意力微调在不流畅语音上的词级时间戳首次超越强制对齐基线，新任务verbatimize可将罕见词召回率从6.8%提升至96.1%。","source":"HuggingFace Daily Papers（社区热门论文）","sourceUrl":"https://arxiv.org/abs/2607.18934","aiHotUrl":"https://aihot.virxact.com/items/cmrw2xmqj00ai1p88j8u19r85","publishedAt":"2026-07-21T00:00:00.000Z","category":"论文研究","score":56,"selected":false,"articleBody":["arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.","Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs ：https://info.arxiv.org/labs/index.html."],"articleImages":[{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation.png","alt":"Simons Foundation","afterParagraph":1,"url":"/media/articles/cmrw2xmqj00ai1p88j8u19r85/e2d7f38d62f5ca91.png"},{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation-international.png","alt":"Simons Foundation International","afterParagraph":1,"url":"/media/articles/cmrw2xmqj00ai1p88j8u19r85/1d56e29c5557cbdc.png"}],"mediaStatus":"ok","articleBodyZh":["arXivLabs 是一个框架，允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。","有一个可以为 arXiv 社区增加价值的项目想法吗？了解更多关于 arXivLabs 的信息：https://info.arxiv.org/labs/index.html。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：现代ASR模型将转录风格（逐字vs.意图）作为不受控隐变量，导致解码不稳定，且高达60%的WER来自风格不匹配。 Aioga 将其归入「论文研究」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断，单项指标领先不等于已经形成稳定采用。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-07-23T07:30:40.512Z","sourceHash":"9348be7c32a74bf0","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["论文研究","HuggingFace Daily Papers（社区热门论文）"],"translations":{"zh-CN":{"title":"转录策略作为隐变量：用词级时序激活可控逐字ASR","summary":"现代ASR模型将转录风格（逐字vs.意图）作为不受控隐变量，导致解码不稳定，且高达60%的WER来自风格不匹配。通过覆盖感知解码器任务token在平行逐字/意图转录对上训练，仅用英语训练即可将德语不流畅F1从10%零样本提升至79%。监督式交叉注意力微调在不流畅语音上的词级时间戳首次超越强制对齐基线，新任务verbatimize可将罕见词召回率从6.8%提升至96.1%。","category":"论文研究","source":"arXiv","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"转录策略作为隐变量：用词级时序激活可控逐字ASR - Aioga AI资讯","description":"现代ASR模型将转录风格（逐字vs.意图）作为不受控隐变量，导致解码不稳定，且高达60%的WER来自风格不匹配。通过覆盖感知解码器任务token在平行逐字/意图转录对上训练，仅用英语训练即可将德语不流畅F1从10%零样本提升至79%。监督式交叉注意力微调在不流畅语音上的词级时间戳首次超越强制对齐基线，新任务verbatimize可将罕见词召回率从6.8%提升...","url":"https://www.aioga.com/news/cmrw2xmqj00ai1p88j8u19r85/"},"en":{"title":"Transcription Strategy as a Latent Variable: Controllable Token-Level Sequential Activation ASR","summary":"Modern ASR models treat transcription style (literal vs. intent) as an uncontrolled latent variable, leading to unstable decoding, with up to 60% of WER resulting from style mismatches. By training task tokens of a coverage-aware decoder on parallel literal/intent transcription pairs, training only in English can improve the F1 for disfluent German from 10% in zero-shot to 79%. Supervised cross-attention fine-tuning achieves word-level timestamps on disfluent speech that surpass forced alignment baselines for the first time, and the new task 'verbatimize' can improve rare word recall from 6.8% to 96.1%.","category":"Research","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Transcription Strategy as a Latent Variable: Controllable Token-Level Sequential Activation ASR - Aioga AI News","description":"Modern ASR models treat transcription style (literal vs. intent) as an uncontrolled latent variable, leading to unstable decoding, with up to 60% of WER resulting from style mismat...","url":"https://www.aioga.com/en/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:21:36.622Z"},"ja":{"title":"転写戦略を潜在変数として：単語レベルの時間的活性化で制御可能な逐次文字ASR","summary":"現代のASRモデルは、文字ごとと意図ごとの転写スタイルを制御されない潜在変数として扱うため、デコーディングが不安定になり、最大60%のWERがスタイルの不一致から生じています。平行する文字ごと/意図ごとの転写ペア上でタスクトークンを用いたカバレッジ感知デコーダーを訓練することで、英語のみの訓練でもドイツ語の流暢でないF1をゼロショット状態から79%に引き上げることができます。教師付きクロスアテンション微調整により、流暢でない音声上での単語レベルタイムスタンプが初めて強制アライメントのベースラインを超えました。新しいタスクverbatimizeは、稀な単語の再現率を6.8%から96.1%に向上させることができます。","category":"論文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"転写戦略を潜在変数として：単語レベルの時間的活性化で制御可能な逐次文字ASR - Aioga AIニュース","description":"現代のASRモデルは、文字ごとと意図ごとの転写スタイルを制御されない潜在変数として扱うため、デコーディングが不安定になり、最大60%のWERがスタイルの不一致から生じています。平行する文字ごと/意図ごとの転写ペア上でタスクトークンを用いたカバレッジ感知デコーダーを訓練することで、英語のみの訓練でもドイツ語の流暢でないF1をゼロショット状態から79%に引き上げ...","url":"https://www.aioga.com/ja/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:21:48.798Z"},"ko":{"title":"전사 전략을 잠재 변수로 사용: 단어 수준 시계열 활성화 제어 가능한 철자별 ASR","summary":"현대 ASR 모델은 전사 스타일(단어 단위 vs. 의도)을 제어되지 않는 숨겨진 변수로 취급하여 디코딩이 불안정해지고, 최대 60%의 WER이 스타일 불일치에서 발생한다. 평행 단어/의도 전사 쌍에서 마스킹된 인식형 디코더 작업 토큰을 학습함으로써, 영어만 학습해도 독일어 불유창 F1을 0-샘플에서 10%에서 79%로 향상시킬 수 있다. 감독식 교차 주의 미세조정은 불유창 음성에서 단어 수준의 타임스탬프가 강제 정렬 기준을 처음으로 넘어섰으며, 새로운 작업인 verbatimize는 희귀 단어 재현율을 6.8%에서 96.1%로 높일 수 있다.","category":"연구","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"전사 전략을 잠재 변수로 사용: 단어 수준 시계열 활성화 제어 가능한 철자별 ASR - Aioga AI 뉴스","description":"현대 ASR 모델은 전사 스타일(단어 단위 vs. 의도)을 제어되지 않는 숨겨진 변수로 취급하여 디코딩이 불안정해지고, 최대 60%의 WER이 스타일 불일치에서 발생한다. 평행 단어/의도 전사 쌍에서 마스킹된 인식형 디코더 작업 토큰을 학습함으로써, 영어만 학습해도 독일어 불유창 F1을 0-샘플에서 10%에서 79%로 향...","url":"https://www.aioga.com/ko/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:22:31.404Z"},"es":{"title":"Estrategia de transcripción como variable latente: ASR controlable palabra por palabra con activación temporal a nivel de palabra","summary":"Los modelos ASR modernos tratan el estilo de transcripción (literal vs. de intención) como una variable latente no controlada, lo que provoca una decodificación inestable, y hasta el 60% del WER proviene del desajuste de estilo. Mediante el entrenamiento del token de tarea del decodificador consciente de superposición en pares paralelos de transcripción literal/de intención, se puede aumentar la F1 de alemán no fluido de 10% sin ejemplos a 79% solo entrenando en inglés. La afinación supervisada de atención cruzada ha superado por primera vez la línea base de alineación forzada en las marcas de tiempo a nivel de palabra para el habla no fluida, y la nueva tarea \"verbatimize\" puede aumentar la tasa de recuperación de palabras poco frecuentes del 6,8% al 96,1%.","category":"Investigación","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Estrategia de transcripción como variable latente: ASR controlable palabra por palabra con activación temporal a nivel de palabra - Aioga Noticias de IA","description":"Los modelos ASR modernos tratan el estilo de transcripción (literal vs. de intención) como una variable latente no controlada, lo que provoca una decodificación inestable, y hasta...","url":"https://www.aioga.com/es/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:22:29.448Z"},"fr":{"title":"Stratégie de transcription en tant que variable latente : reconnaissance vocale automatique mot à mot contrôlable par activation temporelle au niveau du mot","summary":"Les modèles ASR modernes considèrent le style de transcription (mot à mot vs intention) comme une variable latente non contrôlée, ce qui entraîne une instabilité du décodage, et jusqu'à 60 % du WER provient d'un décalage de style. En entraînant le token de tâche du décodeur perceptif sur des paires de transcriptions mot à mot/intention parallèles, l'entraînement uniquement en anglais peut améliorer le F1 irrégulier en allemand de 10 % en zéro échantillon à 79 %. Le réglage fin supervisé avec attention croisée sur la parole irrégulière permet pour la première fois de surpasser la base de référence d'alignement forcé aux horodatages au niveau des mots, et la nouvelle tâche verbatimize peut augmenter le rappel des mots rares de 6,8 % à 96,1 %.","category":"Recherche","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Stratégie de transcription en tant que variable latente : reconnaissance vocale automatique mot à mot contrôlable par activation temporelle au niveau du mot - Aioga Actualités IA","description":"Les modèles ASR modernes considèrent le style de transcription (mot à mot vs intention) comme une variable latente non contrôlée, ce qui entraîne une instabilité du décodage, et ju...","url":"https://www.aioga.com/fr/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:23:12.835Z"},"de":{"title":"Transkriptionsstrategie als latente Variable: Wortebene zeitliche Aktivierung für kontrollierbares wortwörtliches ASR","summary":"Moderne ASR-Modelle behandeln den Transkriptionsstil (wortwörtlich vs. nach Intention) als unkontrollierte latente Variable, was zu instabiler Dekodierung führt, und bis zu 60 % der WER stammen aus Stilinkompatibilität. Durch das Training des überlagernden Wahrnehmungsdekoder-Aufgaben-Tokens auf parallelen wortwörtlichen/Intention-Transkriptionspaaren kann durch reines Training auf Englisch die flüssigkeitsarme F1 für Deutsch von 10 % im Zero-Shot auf 79 % gesteigert werden. Überwachte Cross-Attention-Feinabstimmung liefert bei flüssigkeitsarmer Sprache erstmals Wort-für-Wort-Zeitstempel, die über der Zwangsausrichtungs-Baseline liegen. Die neue Aufgabe 'verbatimize' kann die Wiedererkennungsrate seltener Wörter von 6,8 % auf 96,1 % erhöhen.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Transkriptionsstrategie als latente Variable: Wortebene zeitliche Aktivierung für kontrollierbares wortwörtliches ASR - Aioga KI-News","description":"Moderne ASR-Modelle behandeln den Transkriptionsstil (wortwörtlich vs. nach Intention) als unkontrollierte latente Variable, was zu instabiler Dekodierung führt, und bis zu 60 % de...","url":"https://www.aioga.com/de/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:23:12.323Z"},"pt-BR":{"title":"Estratégia de transcrição como variável latente: ASR controlável palavra a palavra com ativação temporal ao nível da palavra","summary":"Modelos ASR modernos tratam o estilo de transcrição (palavra por palavra vs. intenção) como uma variável latente não controlada, resultando em decodificação instável, e até 60% do WER vem de incompatibilidade de estilo. Treinando o token de tarefa do decodificador sensível à cobertura em pares paralelos de transcrição palavra por palavra/intenção, apenas com treinamento em inglês, é possível aumentar o F1 desfluente do alemão de zero exemplos para 79%. O fine-tuning supervisionado com atenção cruzada atingiu timestamps de nível de palavra em fala desfluente pela primeira vez além da linha de base de alinhamento forçado, e a nova tarefa verbatimize pode aumentar o recall de palavras raras de 6,8% para 96,1%.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Estratégia de transcrição como variável latente: ASR controlável palavra a palavra com ativação temporal ao nível da palavra - Aioga Notícias de IA","description":"Modelos ASR modernos tratam o estilo de transcrição (palavra por palavra vs. intenção) como uma variável latente não controlada, resultando em decodificação instável, e até 60% do...","url":"https://www.aioga.com/pt-BR/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:23:51.005Z"},"ru":{"title":"Стратегия транскрипции как скрытая переменная: управляемое покомпонентное распознавание речи с активацией на уровне слов","summary":"Современные модели ASR рассматривают стиль транскрипции (дословно vs. по смыслу) как неконтролируемую скрытую переменную, что приводит к нестабильности декодирования, при этом до 60% WER приходится на несоответствие стиля. Обучив токен задачи декодера с учётом покрытия на параллельных дословных/по смыслу транскрипциях, можно только на английском повысить F1 неудобного немецкого с 10% для zero-shot до 79%. Супервизированная доработка с перекрёстным вниманием впервые превзошла базовую схему принудительного выравнивания по временным меткам на уровне слов для неудобной речи; новая задача verbatimize может повысить recall редких слов с 6,8% до 96,1%.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Стратегия транскрипции как скрытая переменная: управляемое покомпонентное распознавание речи с активацией на уровне слов - Aioga Новости ИИ","description":"Современные модели ASR рассматривают стиль транскрипции (дословно vs. по смыслу) как неконтролируемую скрытую переменную, что приводит к нестабильности декодирования, при этом до 6...","url":"https://www.aioga.com/ru/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:23:52.400Z"},"ar":{"title":"استراتيجية النسخ كمتغير خفي: استخدام التنشيط الزمني على مستوى الكلمات للتحكم في التعرف التلقائي على الكلام حرفاً حرفاً","summary":"نماذج ASR الحديثة تعامل نمط النسخ (حرفيًا مقابل وفقًا للقصد) كمتغيرات خفية غير مضبوطة، مما يؤدي إلى عدم استقرار في فك الترميز، ويأتي ما يصل إلى 60٪ من معدل خطأ الكلمات من عدم تطابق النمط. من خلال تدريب رموز مهمة فك الترميز الواعي بالتغطية على أزواج النسخ الحرفية/وفقًا للقصد المتوازية، يمكن برمجة النموذج باللغة الإنجليزية فقط لرفع درجة F1 غير السلسة في الألمانية من 10٪ في الصفر عينة إلى 79٪. أول مرة يتجاوز ضبط الانتباه المتبادل الخاضع للإشراف على كلمة الزمن في الكلام غير السلس خط الأساس للتوافق القسري، ويمكن لمهمة verbatimize الجديدة رفع معدل استرجاع الكلمات النادرة من 6.8٪ إلى 96.1٪.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"استراتيجية النسخ كمتغير خفي: استخدام التنشيط الزمني على مستوى الكلمات للتحكم في التعرف التلقائي على الكلام حرفاً حرفاً - Aioga أخبار الذكاء الاصطناعي","description":"نماذج ASR الحديثة تعامل نمط النسخ (حرفيًا مقابل وفقًا للقصد) كمتغيرات خفية غير مضبوطة، مما يؤدي إلى عدم استقرار في فك الترميز، ويأتي ما يصل إلى 60٪ من معدل خطأ الكلمات من عدم تطابق...","url":"https://www.aioga.com/ar/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:24:30.677Z"},"hi":{"title":"ट्रांसक्रिप्शन रणनीति को छिपे हुए चर के रूप में: शब्द-स्तरीय क्रमिक सक्रियण के साथ नियंत्रित क्रमशः ASR","summary":"आधुनिक ASR मॉडल ट्रांसक्रिप्शन शैली (शब्दशः बनाम इरादा) को नियंत्रित न किए गए छुपे हुए चर के रूप में लेते हैं, जिससे डिकोडिंग अस्थिर हो जाती है, और अधिकतम 60% WER शैली असंगति से उत्पन्न होता है। समानांतर शब्दशः/इरादा ट्रांसक्रिप्शन पेयर पर टास्क टोकन के माध्यम से अभिप्रेत डिकोडर को प्रशिक्षण देकर, केवल अंग्रेजी में प्रशिक्षण देकर भी जर्मन की अशुद्ध F1 को 10% शून्य-शॉट से 79% तक बढ़ाया जा सकता है। अशुद्ध भाषण पर सुपरवाइज्ड क्रॉस-अटेंशन फाइन-ट्यूनिंग ने शब्द स्तर के टाइमस्टैम्प में पहली बार फोर्स्ड एलाइनमेंट बेसलाइन को पार कर दिया। नया टास्क 'verbatimize' दुर्लभ शब्दों के रिकॉल को 6.8% से बढ़ाकर 96.1% कर सकता है।","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"ट्रांसक्रिप्शन रणनीति को छिपे हुए चर के रूप में: शब्द-स्तरीय क्रमिक सक्रियण के साथ नियंत्रित क्रमशः ASR - Aioga AI समाचार","description":"आधुनिक ASR मॉडल ट्रांसक्रिप्शन शैली (शब्दशः बनाम इरादा) को नियंत्रित न किए गए छुपे हुए चर के रूप में लेते हैं, जिससे डिकोडिंग अस्थिर हो जाती है, और अधिकतम 60% WER शैली असंगति से उत...","url":"https://www.aioga.com/hi/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:24:36.105Z"},"it":{"title":"Strategia di trascrizione come variabile nascosta: ASR controllabile parola per parola tramite attivazione temporale a livello di parola","summary":"I moderni modelli ASR trattano lo stile di trascrizione (parola per parola vs. intenzione) come una variabile latente non controllata, causando instabilità nella decodifica, e fino al 60% del WER deriva dalla mancata corrispondenza dello stile. Addestrando il token di compito del decodificatore percettivo su coppie parallele di trascrizioni parola per parola/intenzionali, è possibile migliorare l'F1 non fluente del tedesco dal 10% in zero-shot al 79% usando solo l'inglese. Il fine-tuning supervisionato con attenzione incrociata sui timestamp a livello di parola supera per la prima volta il baseline di allineamento forzato per la voce non fluente; il nuovo compito \"verbatimize\" può aumentare il tasso di richiamo delle parole rare dal 6,8% al 96,1%.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Strategia di trascrizione come variabile nascosta: ASR controllabile parola per parola tramite attivazione temporale a livello di parola - Aioga Notizie IA","description":"I moderni modelli ASR trattano lo stile di trascrizione (parola per parola vs. intenzione) come una variabile latente non controllata, causando instabilità nella decodifica, e fino...","url":"https://www.aioga.com/it/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:25:16.703Z"},"nl":{"title":"Transcriptiestrategie als verborgen variabele: woordniveau temporele activatie voor controleerbare letterlijke ASR","summary":"Moderne ASR-modellen beschouwen transcriptiestijl (woord-voor-woord vs. intentie) als een niet- gecontroleerde latente variabele, wat leidt tot onstabiele decodering, en tot 60% van de WER komt voort uit stijlonverenigbaarheid. Door perceptie-gebaseerde decoder-taaktokens te trainen op parallelle woord-voor-woord/intentie-transcriptieparen, kan men zelfs met alleen Engels de F1-score van onvloeiend Duits van 10% in zero-shot verhogen naar 79%. Gecontroleerde cross-attentie fine-tuning levert voor het eerst op woordniveau tijdstempels bij onvloeiende spraak die de forced-alignment baseline overtreffen, en de nieuwe taak 'verbatimize' kan de recall van zeldzame woorden verhogen van 6,8% naar 96,1%.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Transcriptiestrategie als verborgen variabele: woordniveau temporele activatie voor controleerbare letterlijke ASR - Aioga AI-nieuws","description":"Moderne ASR-modellen beschouwen transcriptiestijl (woord-voor-woord vs. intentie) als een niet- gecontroleerde latente variabele, wat leidt tot onstabiele decodering, en tot 60% va...","url":"https://www.aioga.com/nl/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:25:12.144Z"},"tr":{"title":"Transkripsiyon stratejisi gizli değişken olarak: Kelime düzeyinde zaman sıralı aktivasyon ile kontrol edilebilir harf harf ASR","summary":"Modern ASR modelleri, transkripsiyon stilini (kelime kelime vs. niyet) kontrolsüz gizli değişken olarak alır, bu da kod çözmenin kararsız olmasına yol açar ve WER'in %60'a kadarı stil uyumsuzluğundan kaynaklanır. Paralel kelime kelime/niyet transkripsiyon çiftlerinde görev tokenlerini kapsayan algısal kod çözücü ile eğitilerek, yalnızca İngilizce ile eğitim yaparak Almanca akıcılık F1'i sıfır örnekten %10'dan %79'a yükseltilebilir. Denetimli çapraz dikkat ince ayarı, akıcı olmayan konuşmada kelime düzeyinde zaman damgalarını ilk kez zorunlu hizalama temelini geçerken, yeni görev 'verbatimize' nadir kelime geri çağırma oranını %6.8'den %96.1'e yükseltebilir.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Transkripsiyon stratejisi gizli değişken olarak: Kelime düzeyinde zaman sıralı aktivasyon ile kontrol edilebilir harf harf ASR - Aioga AI Haberleri","description":"Modern ASR modelleri, transkripsiyon stilini (kelime kelime vs. niyet) kontrolsüz gizli değişken olarak alır, bu da kod çözmenin kararsız olmasına yol açar ve WER'in %60'a kadarı s...","url":"https://www.aioga.com/tr/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:25:59.017Z"},"vi":{"title":"Chiến lược phiên âm như biến ẩn: Kích hoạt theo thứ tự từ có thể kiểm soát cho ASR từng chữ","summary":"Các mô hình ASR hiện đại coi phong cách phiên âm (từng từ so với theo ý định) là biến ẩn không kiểm soát được, dẫn đến giải mã không ổn định, và lên đến 60% WER đến từ sự không khớp phong cách. Bằng cách huấn luyện bộ giải mã nhận thức chồng chéo với token nhiệm vụ trên cặp phiên âm từng từ/ý định song song, chỉ cần huấn luyện bằng tiếng Anh cũng có thể nâng F1 không trôi chảy tiếng Đức từ 10% trong zero-shot lên 79%. Tinh chỉnh attention chéo có giám sát trên giọng nói không trôi chảy lần đầu tiên vượt qua baseline điều chỉnh bắt buộc trên các dấu thời gian cấp từ, nhiệm vụ mới verbatimize có thể nâng tỷ lệ hồi tưởng từ các từ hiếm từ 6,8% lên 96,1%.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Chiến lược phiên âm như biến ẩn: Kích hoạt theo thứ tự từ có thể kiểm soát cho ASR từng chữ - Tin tức AI Aioga","description":"Các mô hình ASR hiện đại coi phong cách phiên âm (từng từ so với theo ý định) là biến ẩn không kiểm soát được, dẫn đến giải mã không ổn định, và lên đến 60% WER đến từ sự không khớ...","url":"https://www.aioga.com/vi/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:25:59.778Z"},"id":{"title":"Strategi transkripsi sebagai variabel tersembunyi: ASR per kata yang dapat dikontrol dengan aktivasi urutan kata","summary":"Model ASR modern memperlakukan gaya transkripsi (kata demi kata vs. maksud) sebagai variabel laten yang tidak terkontrol, yang menyebabkan dekoding tidak stabil, dan hingga 60% WER berasal dari ketidakcocokan gaya. Dengan melatih token tugas dekoder berbasis persepsi pada pasangan transkripsi paralel kata demi kata/maksud, pelatihan hanya dengan bahasa Inggris dapat meningkatkan F1 bahasa Jerman yang tidak lancar dari 10% tanpa data ke 79%. Fine-tuning perhatian silang tersupervisi pada ucapan yang tidak lancar pertama kali melampaui baseline penyelarasan paksa pada stempel waktu tingkat kata, dan tugas baru verbatimize dapat meningkatkan recall kata yang jarang dari 6,8% menjadi 96,1%.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Strategi transkripsi sebagai variabel tersembunyi: ASR per kata yang dapat dikontrol dengan aktivasi urutan kata - Berita AI Aioga","description":"Model ASR modern memperlakukan gaya transkripsi (kata demi kata vs. maksud) sebagai variabel laten yang tidak terkontrol, yang menyebabkan dekoding tidak stabil, dan hingga 60% WER...","url":"https://www.aioga.com/id/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:26:36.770Z"},"th":{"title":"กลยุทธ์การถอดความในฐานะตัวแปรแฝง: การเปิดใช้งานตามลำดับระดับคำสำหรับ ASR ที่ควบคุมได้แบบตัวต่อคำ","summary":"โมเดล ASR สมัยใหม่ถือว่าสไตล์การถอดเสียง (แบบตัวต่อตัวกับแบบเจตนา) เป็นตัวแปรแฝงที่ไม่สามารถควบคุมได้ ทำให้การถอดรหัสไม่เสถียร และ WER สูงถึง 60% มาจากความไม่ตรงกันของสไตล์ ด้วยการฝึกตัวถอดรหัสแบบรับรู้การปกคลุม task token บนคู่การถอดเสียงแบบตัวต่อตัว/เจตนาที่ขนานกัน สามารถฝึกแค่ภาษาอังกฤษก็เพียงพอที่จะเพิ่มคะแนน F1 ไม่ราบรื่นของภาษาเยอรมันจาก 10% ในแบบ zero-shot เป็น 79% การปรับจูนด้วย cross-attention แบบมีการควบคุมบนคำที่ไม่ราบรื่นทำให้ timestamp ของคำในครั้งแรกที่เกิน baseline การจัดแนวแบบบังคับ งานใหม่ verbatimize สามารถเพิ่มอัตราการเรียกคืนคำหายากจาก 6.8% เป็น 96.1%","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"กลยุทธ์การถอดความในฐานะตัวแปรแฝง: การเปิดใช้งานตามลำดับระดับคำสำหรับ ASR ที่ควบคุมได้แบบตัวต่อคำ - ข่าว AI Aioga","description":"โมเดล ASR สมัยใหม่ถือว่าสไตล์การถอดเสียง (แบบตัวต่อตัวกับแบบเจตนา) เป็นตัวแปรแฝงที่ไม่สามารถควบคุมได้ ทำให้การถอดรหัสไม่เสถียร และ WER สูงถึง 60% มาจากความไม่ตรงกันของสไตล์ ด้วยการ...","url":"https://www.aioga.com/th/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:26:46.316Z"},"pl":{"title":"Strategia transkrypcji jako zmienna ukryta: Sterowalne, aktywowane w czasie na poziomie słów ASR","summary":"Nowoczesne modele ASR traktują styl transkrypcji (dosłowny vs. intencyjny) jako niekontrolowaną zmienną ukrytą, co prowadzi do niestabilności dekodowania, a nawet 60% WER wynika z niedopasowania stylu. Poprzez trenowanie tokenu zadania dekodera wrażliwego na pokrycie na równoległych transkrypcjach dosłownych/intencyjnych, można osiągnąć poprawę płynności F1 w języku niemieckim od 10% przy próbie zero-shot do 79% wyłącznie przy trenowaniu na języku angielskim. Nadzorowane dostrajanie z krzyżową uwagą po raz pierwszy w przypadku niepłynnej mowy przewyższa bazę wymuszonego dopasowania pod względem znaczników czasowych na poziomie słów, a nowe zadanie verbatimize może zwiększyć wskaźnik odzyskiwania rzadkich słów z 6,8% do 96,1%.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Strategia transkrypcji jako zmienna ukryta: Sterowalne, aktywowane w czasie na poziomie słów ASR - Aioga Wiadomości AI","description":"Nowoczesne modele ASR traktują styl transkrypcji (dosłowny vs. intencyjny) jako niekontrolowaną zmienną ukrytą, co prowadzi do niestabilności dekodowania, a nawet 60% WER wynika z...","url":"https://www.aioga.com/pl/news/cmrw2xmqj00ai1p88j8u19r85/","contentTranslated":true,"sourceHash":"a5fff1ef7e397220","translatedAt":"2026-07-23T01:27:31.882Z"}}}}