{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-08-11T09:21:12.743Z","headline":"驯服扩散 Transformer 中的离群 token：Dual-Stage Registers 干预","description":"研究发现扩散 Transformer（DiT）图像生成流程中，预训练 ViT 编码器和 DiT 去噪器均会产生离群 token，尤其在中间层，且简单掩蔽高范数 token 无法改善性能，问题与局部 patch 语义损坏相关。为此提出 Dual-Stage Registers（DSR）干预方法，在 ImageNet 和文生图任务上持续减少离群伪影并提升生成质量。","url":"https://www.aioga.com/news/cmsgonfuv0bparo5q6a2ng1pd/","mainEntityOfPage":"https://www.aioga.com/news/cmsgonfuv0bparo5q6a2ng1pd/","datePublished":"2026-08-05T00:00:00.000Z","dateModified":"2026-08-05T00:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://machinelearning.apple.com/research/taming-outlier-tokens","https://aihot.virxact.com/items/cmsgonfuv0bparo5q6a2ng1pd"],"canonicalUrl":"https://www.aioga.com/news/cmsgonfuv0bparo5q6a2ng1pd/","directAnswer":{"@type":"Answer","text":"研究聚焦扩散 Transformer 图像生成中的离群 token：预训练 ViT 编码器与 DiT 去噪器都会出现该现象，中间层尤为明显。论文提出 Dual-Stage Registers，并报告其在 ImageNet 和文生图任务上减少离群伪影、提升生成质量。","url":"https://www.aioga.com/news/cmsgonfuv0bparo5q6a2ng1pd/","dateCreated":"2026-08-05T00:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"machinelearning.apple.com source article","url":"https://machinelearning.apple.com/research/taming-outlier-tokens","datePublished":"2026-08-05T00:00:00.000Z","provider":{"@type":"Organization","name":"machinelearning.apple.com","url":"https://machinelearning.apple.com/research/taming-outlier-tokens"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmsgonfuv0bparo5q6a2ng1pd","datePublished":"2026-08-05T00:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmsgonfuv0bparo5q6a2ng1pd"}}],"aggregationSource":"Apple Machine Learning Research（RSS）","originalPublisher":{"name":"machinelearning.apple.com","url":"https://machinelearning.apple.com/research/taming-outlier-tokens"},"geoDeepAnswer":null,"article":{"id":"cmsgonfuv0bparo5q6a2ng1pd","slug":"cmsgonfuv0bparo5q6a2ng1pd","url":"https://www.aioga.com/news/cmsgonfuv0bparo5q6a2ng1pd/","title":"驯服扩散 Transformer 中的离群 token：Dual-Stage Registers 干预","title_en":"Taming Outlier Tokens in Diffusion Transformers","summary":"研究发现扩散 Transformer（DiT）图像生成流程中，预训练 ViT 编码器和 DiT 去噪器均会产生离群 token，尤其在中间层，且简单掩蔽高范数 token 无法改善性能，问题与局部 patch 语义损坏相关。为此提出 Dual-Stage Registers（DSR）干预方法，在 ImageNet 和文生图任务上持续减少离群伪影并提升生成质量。","source":"Apple Machine Learning Research（RSS）","sourceUrl":"https://machinelearning.apple.com/research/taming-outlier-tokens","aiHotUrl":"https://aihot.virxact.com/items/cmsgonfuv0bparo5q6a2ng1pd","publishedAt":"2026-08-05T00:00:00.000Z","category":"论文研究","score":56,"selected":false,"articleBody":["Taming Outlier Tokens in Diffusion Transformers","Authors Xiaoyu Wu†*, Yifei Wang†*, Tsu-Jui Fu, Liang-Chieh Chen, Zhe Gan, Chen Wei†","View publication：https://arxiv.org/abs/2605.05206","DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation","December 11, 2025 research area Computer Vision：/research/?domain=Computer%20Vision","In this work, we empirically study Diffusion Transformers (DiTs) for text-to-image generation, focusing on architectural choices, text-conditioning strategies, and training protocols. We evaluate a range of DiT-based architectures—including PixArt-style and MMDiT variants—and compare them with a standard DiT variant which directly processes concatenated text and noise inputs. Surprisingly, our findings reveal that the performance of standard…","On Inductive Biases That Enable Generalization of Diffusion Transformers","September 22, 2025 research area Computer Vision：/research/?domain=Computer%20Vision conference NeurIPS：/research/?event=NeurIPS","Recent work studying the generalization of diffusion models with UNet-based denoisers reveals inductive biases that can be expressed via geometry-adaptive harmonic bases. However, in practice, more recent denoising networks are often based on transformers, e.g., the diffusion transformer (DiT). This raises the question: do transformer-based denoising networks exhibit inductive biases that can also be expressed via geometry-adaptive harmonic…","Our research in machine learning breaks new ground every day."],"articleImages":[{"sourceUrl":"https://mlr.cdn-apple.com/media/Discover_1440x420_2x_9c465d585e.jpg","alt":"Bottom banner","afterParagraph":8,"url":"/media/articles/cmsgonfuv0bparo5q6a2ng1pd/64c2324784f2cf67.jpg"}],"mediaStatus":"ok","articleBodyZh":["在扩散变换器中驯服离群标记","作者：吴晓宇†*，王一飞†*，傅子睿，陈良杰，甘喆，魏晨†","查看出版物：https://arxiv.org/abs/2605.05206","DiT-Air：重新审视文本到图像生成中扩散模型架构设计的效率","2025年12月11日 研究领域：计算机视觉：/research/?domain=Computer%20Vision","在这项工作中，我们经验性地研究了用于文本到图像生成的扩散变换器（DiTs），重点关注架构选择、文本条件策略和训练协议。我们评估了一系列基于DiT的架构——包括PixArt风格和MMDiT变体——并将它们与直接处理串联文本和噪声输入的标准DiT变体进行比较。令人惊讶的是，我们的研究结果显示，标准…","关于能够使扩散变换器泛化的归纳偏差","2025年9月22日 研究领域 计算机视觉：/research/?domain=Computer%20Vision 会议 NeurIPS：/research/?event=NeurIPS","最近关于使用基于UNet的去噪器研究扩散模型泛化能力的工作揭示了可以通过几何自适应谐波基表达的归纳偏差。然而，在实践中，更近期的去噪网络通常基于变换器，例如扩散变换器（DiT）。这就引出了一个问题：基于变换器的去噪网络是否也具有可以通过几何自适应谐波表达的归纳偏差……","我们的机器学习研究每天都在开创新的领域。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"研究聚焦扩散 Transformer 图像生成中的离群 token：预训练 ViT 编码器与 DiT 去噪器都会出现该现象，中间层尤为明显。论文提出 Dual-Stage Registers，并报告其在 ImageNet 和文生图任务上减少离群伪影、提升生成质量。","background":"材料称，离群 token 与局部 patch 语义损坏有关，而简单掩蔽高范数 token 并不能改善性能。这表明高范数只是可观察特征之一，研究因此转向同时干预编码器与去噪器阶段的 Dual-Stage Registers 方法。","viewpoint":"Aioga 判断，这项工作的价值在于把离群 token 从单一去噪环节扩展为跨预训练编码器和 DiT 去噪器的问题，并用双阶段方法回应。值得关注的是，现有材料未提供具体指标，尚不能判断提升幅度与统计稳定性。","implications":"若论文结论在更多架构和数据设置中成立，可能促使图像生成研究重新审视中间层 token 异常、局部语义损坏与生成伪影之间的联系。Aioga 判断，DSR 更适合作为可验证的架构干预方向，而非已被证明普遍有效的方案。","nextStep":"下一步值得核对论文全文中的 DSR 结构、训练与推理开销、评价指标、消融实验及基线设置，并确认其在 ImageNet 与文生图任务中的具体结果。还应关注该方法能否迁移到不同 DiT 变体，以及效果是否依赖特定编码器。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-08-06T06:06:16.287Z","sourceHash":"b265b995a2f55a06","review":{"approved":true,"groundedness":94,"clarity":92,"duplicationRisk":18,"blockingIssues":[],"notes":["“可能促使图像生成研究重新审视……”属于条件性推论，已明确使用“若……成立”，不构成事实错误。","“Aioga 判断”已将价值判断与事实陈述区分开来。","summary、background 与 viewpoint 对离群 token 和 DSR 的概述存在少量信息重复，但不影响清晰度或审核通过。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["论文研究","Apple Machine Learning Research（RSS）"],"translations":{"zh-CN":{"title":"驯服扩散 Transformer 中的离群 token：Dual-Stage Registers 干预","summary":"研究发现扩散 Transformer（DiT）图像生成流程中，预训练 ViT 编码器和 DiT 去噪器均会产生离群 token，尤其在中间层，且简单掩蔽高范数 token 无法改善性能，问题与局部 patch 语义损坏相关。为此提出 Dual-Stage Registers（DSR）干预方法，在 ImageNet 和文生图任务上持续减少离群伪影并提升生成质量。","category":"论文研究","source":"machinelearning.apple.com","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"驯服扩散 Transformer 中的离群 token：Dual-Stage Registers 干预 - Aioga AI资讯","description":"研究发现扩散 Transformer（DiT）图像生成流程中，预训练 ViT 编码器和 DiT 去噪器均会产生离群 token，尤其在中间层，且简单掩蔽高范数 token 无法改善性能，问题与局部 patch 语义损坏相关。为此提出 Dual-Stage Registers（DSR）干预方法，在 ImageNet 和文生图任务上持续减少离群伪影并提升生成质量...","url":"https://www.aioga.com/news/cmsgonfuv0bparo5q6a2ng1pd/","articleBody":["在扩散变换器中驯服离群标记","作者：吴晓宇†*，王一飞†*，傅子睿，陈良杰，甘喆，魏晨†","查看出版物：https://arxiv.org/abs/2605.05206","DiT-Air：重新审视文本到图像生成中扩散模型架构设计的效率","2025年12月11日 研究领域：计算机视觉：/research/?domain=Computer%20Vision","在这项工作中，我们经验性地研究了用于文本到图像生成的扩散变换器（DiTs），重点关注架构选择、文本条件策略和训练协议。我们评估了一系列基于DiT的架构——包括PixArt风格和MMDiT变体——并将它们与直接处理串联文本和噪声输入的标准DiT变体进行比较。令人惊讶的是，我们的研究结果显示，标准…","关于能够使扩散变换器泛化的归纳偏差","2025年9月22日 研究领域 计算机视觉：/research/?domain=Computer%20Vision 会议 NeurIPS：/research/?event=NeurIPS","最近关于使用基于UNet的去噪器研究扩散模型泛化能力的工作揭示了可以通过几何自适应谐波基表达的归纳偏差。然而，在实践中，更近期的去噪网络通常基于变换器，例如扩散变换器（DiT）。这就引出了一个问题：基于变换器的去噪网络是否也具有可以通过几何自适应谐波表达的归纳偏差……","我们的机器学习研究每天都在开创新的领域。"]},"en":{"title":"Taming Outlier Tokens in Diffusion Transformers: Dual-Stage Registers Intervention","summary":"Research has found that in the Diffusion Transformer (DiT) image generation process, both the pre-trained ViT encoder and the DiT denoiser produce outlier tokens, especially in the intermediate layers, and simply masking high-norm tokens does not improve performance. The problem is related to the semantic damage of local patches. To address this, the Dual-Stage Registers (DSR) intervention method is proposed, which consistently reduces outlier artifacts and improves generation quality on ImageNet and text-to-image tasks.","category":"Research","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Taming Outlier Tokens in Diffusion Transformers: Dual-Stage Registers Intervention - Aioga AI News","description":"Research has found that in the Diffusion Transformer (DiT) image generation process, both the pre-trained ViT encoder and the DiT denoiser produce outlier tokens, especially in the...","url":"https://www.aioga.com/en/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:02:22.709Z"},"ja":{"title":"拡散トランスフォーマーにおける異常トークンの調整：デュアルステージレジスター介入","summary":"研究により、拡散型Transformer（DiT）の画像生成プロセスにおいて、事前学習されたViTエンコーダとDiTデノイザは共に異常なトークンを生成することが分かっており、特に中間層で顕著であることが明らかになった。また、単純に高ノルムトークンをマスクするだけでは性能は改善されず、この問題は局所パッチの意味情報の損失に関連していることが示された。そこで、Dual-Stage Registers（DSR）介入手法を提案し、ImageNetおよびテキストから画像への生成タスクで異常アーティファクトを継続的に減少させ、生成品質を向上させた。","category":"論文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"拡散トランスフォーマーにおける異常トークンの調整：デュアルステージレジスター介入 - Aioga AIニュース","description":"研究により、拡散型Transformer（DiT）の画像生成プロセスにおいて、事前学習されたViTエンコーダとDiTデノイザは共に異常なトークンを生成することが分かっており、特に中間層で顕著であることが明らかになった。また、単純に高ノルムトークンをマスクするだけでは性能は改善されず、この問題は局所パッチの意味情報の損失に関連していることが示された。そこで、D...","url":"https://www.aioga.com/ja/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:02:29.369Z"},"ko":{"title":"확산 Transformer에서 이상 토큰 길들이기: Dual-Stage Registers 개입","summary":"연구에 따르면 확산 Transformer(DiT) 이미지 생성 과정에서, 사전 학습된 ViT 인코더와 DiT 노이즈 제거기 모두 이상 토큰을 생성하며, 특히 중간 층에서 나타나고, 단순히 고-노름 토큰을 마스킹하는 것으로는 성능을 개선할 수 없으며, 문제는 국소 패치 의미 손상과 관련이 있다. 이에 Dual-Stage Registers(DSR) 개입 방법을 제안하였고, ImageNet과 텍스트-이미지 생성 작업에서 이상 아티팩트를 지속적으로 감소시키고 생성 품질을 향상시켰다.","category":"연구","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"확산 Transformer에서 이상 토큰 길들이기: Dual-Stage Registers 개입 - Aioga AI 뉴스","description":"연구에 따르면 확산 Transformer(DiT) 이미지 생성 과정에서, 사전 학습된 ViT 인코더와 DiT 노이즈 제거기 모두 이상 토큰을 생성하며, 특히 중간 층에서 나타나고, 단순히 고-노름 토큰을 마스킹하는 것으로는 성능을 개선할 수 없으며, 문제는 국소 패치 의미 손상과 관련이 있다. 이에 Dual-Stage R...","url":"https://www.aioga.com/ko/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:03:16.489Z"},"es":{"title":"Domando los tokens atípicos en el Transformer de difusión: intervención de registros de doble etapa","summary":"La investigación encontró que en el proceso de generación de imágenes del Transformer de difusión (DiT), tanto el codificador ViT preentrenado como el desruidor DiT generan tokens atípicos, especialmente en las capas intermedias, y que simplemente enmascarar los tokens de alta norma no mejora el rendimiento; el problema está relacionado con el daño semántico de los parches locales. Para ello, se propone el método de intervención Dual-Stage Registers (DSR), que reduce continuamente los artefactos atípicos y mejora la calidad de generación en las tareas de ImageNet y de generación de imágenes a partir de texto.","category":"Investigación","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Domando los tokens atípicos en el Transformer de difusión: intervención de registros de doble etapa - Aioga Noticias de IA","description":"La investigación encontró que en el proceso de generación de imágenes del Transformer de difusión (DiT), tanto el codificador ViT preentrenado como el desruidor DiT generan tokens...","url":"https://www.aioga.com/es/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:03:05.424Z"},"fr":{"title":"Maîtriser les tokens aberrants dans le Transformer diffusif : intervention des registres à double étape","summary":"La recherche a révélé que dans le processus de génération d'images du Transformer diffusif (DiT), le codeur ViT pré-entraîné et le débruiteur DiT produisent tous deux des tokens aberrants, en particulier dans les couches intermédiaires, et le simple masquage des tokens à forte norme ne peut pas améliorer les performances. Le problème est lié à la détérioration sémantique des patchs locaux. Pour y remédier, une méthode d'intervention Dual-Stage Registers (DSR) a été proposée, réduisant de manière continue les artefacts aberrants et améliorant la qualité de génération sur les tâches ImageNet et texte-vers-image.","category":"Recherche","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Maîtriser les tokens aberrants dans le Transformer diffusif : intervention des registres à double étape - Aioga Actualités IA","description":"La recherche a révélé que dans le processus de génération d'images du Transformer diffusif (DiT), le codeur ViT pré-entraîné et le débruiteur DiT produisent tous deux des tokens ab...","url":"https://www.aioga.com/fr/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:03:54.011Z"},"de":{"title":"Bändigung von Ausreißer-Tokens im Diffusion Transformer: Dual-Stage Registers Eingriff","summary":"Studien haben gezeigt, dass im Bildgenerierungsprozess des Diffusions-Transformers (DiT) sowohl der vortrainierte ViT-Encoder als auch der DiT-Denoiser Ausreißer-Token erzeugen, insbesondere in den Zwischenschichten, und dass das einfache Maskieren von Token mit hoher Norm die Leistung nicht verbessert. Das Problem hängt mit der Beschädigung lokaler Patch-Semantik zusammen. Daher wird die Dual-Stage Registers (DSR)-Interventionsmethode vorgeschlagen, die die Ausreißer-Artefakte auf den ImageNet- und Text-zu-Bild-Aufgaben kontinuierlich reduziert und die Generierungsqualität verbessert.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Bändigung von Ausreißer-Tokens im Diffusion Transformer: Dual-Stage Registers Eingriff - Aioga KI-News","description":"Studien haben gezeigt, dass im Bildgenerierungsprozess des Diffusions-Transformers (DiT) sowohl der vortrainierte ViT-Encoder als auch der DiT-Denoiser Ausreißer-Token erzeugen, in...","url":"https://www.aioga.com/de/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:03:53.779Z"},"pt-BR":{"title":"Domando tokens fora do padrão em Transformers de difusão: intervenção de registros de duplo estágio","summary":"Pesquisas descobriram que, no processo de geração de imagens do Transformer de Difusão (DiT), tanto o codificador ViT pré-treinado quanto o denoiser DiT produzem tokens discrepantes, especialmente nas camadas intermediárias, e que simplesmente mascarar tokens de alta norma não melhora o desempenho, sendo o problema relacionado à deterioração semântica local dos patches. Para isso, foi proposto o método de intervenção Dual-Stage Registers (DSR), que continuamente reduz os artefatos discrepantes e melhora a qualidade de geração nas tarefas do ImageNet e de texto para imagem.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Domando tokens fora do padrão em Transformers de difusão: intervenção de registros de duplo estágio - Aioga Notícias de IA","description":"Pesquisas descobriram que, no processo de geração de imagens do Transformer de Difusão (DiT), tanto o codificador ViT pré-treinado quanto o denoiser DiT produzem tokens discrepante...","url":"https://www.aioga.com/pt-BR/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:04:37.018Z"},"ru":{"title":"Укрощение выбивающихся токенов в диффузионных трансформерах: вмешательство с помощью двухэтапных регистров","summary":"Исследование показало, что в процессе генерации изображений с помощью Diffusion Transformer (DiT) как предварительно обученный кодировщик ViT, так и денойзер DiT создают выбивающиеся токены, особенно на промежуточных слоях, и простое маскирование токенов с высокой нормой не улучшает производительность, проблема связана с потерей локальной семантики патчей. Для этого был предложен метод вмешательства Dual-Stage Registers (DSR), который последовательно уменьшает выбивающиеся артефакты и улучшает качество генерации на задачах ImageNet и генерации изображений по тексту.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Укрощение выбивающихся токенов в диффузионных трансформерах: вмешательство с помощью двухэтапных регистров - Aioga Новости ИИ","description":"Исследование показало, что в процессе генерации изображений с помощью Diffusion Transformer (DiT) как предварительно обученный кодировщик ViT, так и денойзер DiT создают выбивающие...","url":"https://www.aioga.com/ru/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:04:46.377Z"},"ar":{"title":"ترويض الرموز الشاذة في Transformer الانتشاري: تدخل سجلات المراحل المزدوجة","summary":"أظهرت الأبحاث أنه في عملية توليد الصور بواسطة تحويل الانتشار (DiT)، كل من مشفر ViT المدرب مسبقًا وملمّع DiT ينتجان رموزًا شاذة، خصوصًا في الطبقات الوسطى، وأن إخفاء الرموز ذات المعايير العالية ببساطة لا يحسن الأداء، والمشكلة مرتبطة بتلف المعنى المحلي للبقع. ولهذا تم اقتراح طريقة التدخل Dual-Stage Registers (DSR)، والتي تقلل باستمرار من الشوائب الشاذة وتحسن جودة التوليد في مهام ImageNet وتوليد الصور من النص.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"ترويض الرموز الشاذة في Transformer الانتشاري: تدخل سجلات المراحل المزدوجة - Aioga أخبار الذكاء الاصطناعي","description":"أظهرت الأبحاث أنه في عملية توليد الصور بواسطة تحويل الانتشار (DiT)، كل من مشفر ViT المدرب مسبقًا وملمّع DiT ينتجان رموزًا شاذة، خصوصًا في الطبقات الوسطى، وأن إخفاء الرموز ذات المعا...","url":"https://www.aioga.com/ar/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:05:37.465Z"},"hi":{"title":"Transformer में फैले बाहरी token को अटूट करना: Dual-Stage Registers हस्तक्षेप","summary":"अध्ययन में पाया गया कि डिफ्यूज़न ट्रांसफॉर्मर (DiT) इमेज जेनरेशन प्रक्रिया में, प्री-ट्रेंड ViT एनकोडर और DiT नॉइज़ रिमूवर दोनों ही आउटलेयर टोकन उत्पन्न करते हैं, विशेष रूप से मध्य परतों में, और उच्च-मानक टोकन को साधारण रूप से मास्क करने से प्रदर्शन में सुधार नहीं होता है, यह समस्या स्थानीय पैच अर्थ को नुकसान पहुंचने से संबंधित है। इसके लिए, डुअल-स्टेज रजिस्टर्स (DSR) हस्तक्षेप विधि प्रस्तावित की गई, जो ImageNet और टेक्स्ट-टू-इमेज कार्यों में लगातार आउटलेयर आर्टिफैक्ट को कम करती है और जेनरेशन गुणवत्ता को बढ़ाती है।","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Transformer में फैले बाहरी token को अटूट करना: Dual-Stage Registers हस्तक्षेप - Aioga AI समाचार","description":"अध्ययन में पाया गया कि डिफ्यूज़न ट्रांसफॉर्मर (DiT) इमेज जेनरेशन प्रक्रिया में, प्री-ट्रेंड ViT एनकोडर और DiT नॉइज़ रिमूवर दोनों ही आउटलेयर टोकन उत्पन्न करते हैं, विशेष रूप से मध्य...","url":"https://www.aioga.com/hi/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:05:39.876Z"},"it":{"title":"Addomesticare i token anomali nel Trasformatore di Diffusione: intervento tramite Registri a Doppio Stadio","summary":"Lo studio ha scoperto che nel processo di generazione delle immagini con il Transformer diffusivo (DiT), sia l'encoder ViT pre-addestrato sia il denoiser DiT producono token anomali, soprattutto negli strati intermedi, e che la semplice mascheratura dei token ad alto norma non migliora le prestazioni, problema legato al danneggiamento semantico delle patch locali. Per affrontare ciò è stato proposto il metodo di intervento Dual-Stage Registers (DSR), che riduce costantemente gli artefatti anomali e migliora la qualità della generazione su ImageNet e nei task di testo-immagine.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Addomesticare i token anomali nel Trasformatore di Diffusione: intervento tramite Registri a Doppio Stadio - Aioga Notizie IA","description":"Lo studio ha scoperto che nel processo di generazione delle immagini con il Transformer diffusivo (DiT), sia l'encoder ViT pre-addestrato sia il denoiser DiT producono token anomal...","url":"https://www.aioga.com/it/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:06:30.124Z"},"nl":{"title":"Het temmen van outlier-tokens in Diffusion Transformer: Dual-Stage Registers interventie","summary":"Onderzoek heeft aangetoond dat in het afbeeldingsgeneratieproces van Diffusion Transformer (DiT) zowel de voorgetrainde ViT-encoder als de DiT-denoiser afwijkende tokens produceren, vooral in de middenlagen, en dat eenvoudig het maskeren van tokens met een hoge norm de prestaties niet kan verbeteren. Het probleem hangt samen met beschadigde lokale patch-semantiek. Daarom wordt de Dual-Stage Registers (DSR)-interventiemethode voorgesteld, die in zowel ImageNet- als tekst-naar-afbeelding-taken consequent afwijkende artefacten vermindert en de generatieve kwaliteit verbetert.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Het temmen van outlier-tokens in Diffusion Transformer: Dual-Stage Registers interventie - Aioga AI-nieuws","description":"Onderzoek heeft aangetoond dat in het afbeeldingsgeneratieproces van Diffusion Transformer (DiT) zowel de voorgetrainde ViT-encoder als de DiT-denoiser afwijkende tokens produceren...","url":"https://www.aioga.com/nl/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:06:23.710Z"},"tr":{"title":"Sapkın token'ları Yumuşatmak Transformers'ta Yayılımı Kontrol Etmek: Çift Aşamalı Kayıt Müdahalesi","summary":"Araştırmalar, Difüzyon Transformer (DiT) görüntü oluşturma sürecinde, önceden eğitilmiş ViT kodlayıcı ve DiT gürültü giderici ile aşırı uç tokenlerin oluştuğunu ortaya koymuştur; özellikle ara katmanlarda görülmekte ve yüksek normlu tokenlerin basitçe maskelenmesi performansı iyileştirmemektedir. Sorun, yerel yama anlamının bozulmasıyla ilgilidir. Bu nedenle, ImageNet ve metinden görüntüye görevlerinde aşırı uç yapay ögeleri sürekli olarak azaltan ve üretim kalitesini artıran Dual-Stage Registers (DSR) müdahale yöntemi önerilmiştir.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Sapkın token'ları Yumuşatmak Transformers'ta Yayılımı Kontrol Etmek: Çift Aşamalı Kayıt Müdahalesi - Aioga AI Haberleri","description":"Araştırmalar, Difüzyon Transformer (DiT) görüntü oluşturma sürecinde, önceden eğitilmiş ViT kodlayıcı ve DiT gürültü giderici ile aşırı uç tokenlerin oluştuğunu ortaya koymuştur; ö...","url":"https://www.aioga.com/tr/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:07:08.990Z"},"vi":{"title":"Điều khiển token ngoại lai trong Transformer lan tỏa: can thiệp bằng Dual-Stage Registers","summary":"Nghiên cứu phát hiện rằng trong quy trình tạo hình ảnh của Diffusion Transformer (DiT), cả bộ mã hóa ViT đã được tiền huấn luyện và bộ khử nhiễu DiT đều tạo ra các token ngoại lệ, đặc biệt là ở các lớp trung gian, và việc che đơn giản các token có chuẩn cao không thể cải thiện hiệu suất, vấn đề này liên quan đến việc hỏng ngữ nghĩa patch cục bộ. Vì vậy, phương pháp can thiệp Dual-Stage Registers (DSR) được đề xuất, liên tục giảm các hiện tượng ngoại lệ giả và nâng cao chất lượng tạo ra trên các nhiệm vụ ImageNet và text-to-image.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Điều khiển token ngoại lai trong Transformer lan tỏa: can thiệp bằng Dual-Stage Registers - Tin tức AI Aioga","description":"Nghiên cứu phát hiện rằng trong quy trình tạo hình ảnh của Diffusion Transformer (DiT), cả bộ mã hóa ViT đã được tiền huấn luyện và bộ khử nhiễu DiT đều tạo ra các token ngoại lệ,...","url":"https://www.aioga.com/vi/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:07:15.170Z"},"id":{"title":"Menjinakkan token outlier dalam Transformer difusi: Intervensi Dual-Stage Registers","summary":"Penelitian menemukan bahwa dalam proses generasi gambar Diffusion Transformer (DiT), baik encoder ViT yang telah dilatih sebelumnya maupun denoiser DiT menghasilkan token outlier, terutama di lapisan tengah, dan menutupi token dengan norma tinggi secara sederhana tidak dapat meningkatkan kinerja; masalah ini terkait dengan kerusakan semantik patch lokal. Untuk itu, diusulkan metode intervensi Dual-Stage Registers (DSR), yang secara berkelanjutan mengurangi artefak outlier dan meningkatkan kualitas generasi pada tugas ImageNet dan text-to-image.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Menjinakkan token outlier dalam Transformer difusi: Intervensi Dual-Stage Registers - Berita AI Aioga","description":"Penelitian menemukan bahwa dalam proses generasi gambar Diffusion Transformer (DiT), baik encoder ViT yang telah dilatih sebelumnya maupun denoiser DiT menghasilkan token outlier,...","url":"https://www.aioga.com/id/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:07:54.560Z"},"th":{"title":"ควบคุม token ที่เบี่ยงเบนใน Transformer การแพร่กระจาย: การแทรกแซง Dual-Stage Registers","summary":"งานวิจัยพบว่าในกระบวนการสร้างภาพของ Diffusion Transformer (DiT) ตัวเข้ารหัส ViT ที่ผ่านการฝึกล่วงหน้าและตัวลดเสียงรบกวน DiT ต่างก็สร้าง token ที่ผิดปกติออกมา โดยเฉพาะในชั้นกลาง และการปิดบัง token ที่มี norm สูงไม่สามารถปรับปรุงประสิทธิภาพได้ ปัญหานี้เกี่ยวข้องกับความเสียหายทางความหมายของ patch ท้องถิ่น เพื่อแก้ไขจึงมีการเสนอวิธีแทรกแซง Dual-Stage Registers (DSR) ซึ่งสามารถลด artefact ที่ผิดปกติและเพิ่มคุณภาพการสร้างได้อย่างต่อเนื่องทั้งใน ImageNet และงานสร้างภาพจากข้อความ","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"ควบคุม token ที่เบี่ยงเบนใน Transformer การแพร่กระจาย: การแทรกแซง Dual-Stage Registers - ข่าว AI Aioga","description":"งานวิจัยพบว่าในกระบวนการสร้างภาพของ Diffusion Transformer (DiT) ตัวเข้ารหัส ViT ที่ผ่านการฝึกล่วงหน้าและตัวลดเสียงรบกวน DiT ต่างก็สร้าง token ที่ผิดปกติออกมา โดยเฉพาะในชั้นกลาง และ...","url":"https://www.aioga.com/th/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:08:08.704Z"},"pl":{"title":"Ujarzmianie rozproszonego transformera dla odrębnych tokenów: Interwencja Dual-Stage Registers","summary":"Badania wykazały, że w procesie generowania obrazów za pomocą rozszerzonego Transformera (DiT), zarówno wstępnie wytrenowany enkoder ViT, jak i denoiser DiT generują nietypowe tokeny, zwłaszcza w warstwach pośrednich, a proste maskowanie tokenów o wysokiej normie nie poprawia wydajności; problem ten jest związany z uszkodzeniem lokalnej semantyki patchy. W związku z tym zaproponowano metodę interwencji Dual-Stage Registers (DSR), która na zadaniach ImageNet i generowania obrazów na podstawie tekstu konsekwentnie zmniejsza aberracje nietypowych tokenów i poprawia jakość generowanych obrazów.","category":"论文研究","source":"Apple Machine Learning Research（RSS）","aggregationSource":"Apple Machine Learning Research（RSS）","pageTitle":"Ujarzmianie rozproszonego transformera dla odrębnych tokenów: Interwencja Dual-Stage Registers - Aioga Wiadomości AI","description":"Badania wykazały, że w procesie generowania obrazów za pomocą rozszerzonego Transformera (DiT), zarówno wstępnie wytrenowany enkoder ViT, jak i denoiser DiT generują nietypowe toke...","url":"https://www.aioga.com/pl/news/cmsgonfuv0bparo5q6a2ng1pd/","contentTranslated":true,"sourceHash":"f58e818aa13d17b0","translatedAt":"2026-08-05T23:08:56.204Z"}}}}