Aioga
AI资讯 / 论文研究
返回 AI资讯

驯服扩散 Transformer 中的离群 token:Dual-Stage Registers 干预

Apple Machine Learning Research(RSS)Aioga 编辑团队2026-08-05T00:00:00.000Z热度 56

研究发现扩散 Transformer(DiT)图像生成流程中,预训练 ViT 编码器和 DiT 去噪器均会产生离群 token,尤其在中间层,且简单掩蔽高范数 token 无法...

论文研究Apple Machine Learning Research(RSS)

今日 AI 情报摘要

研究发现扩散 Transformer(DiT)图像生成流程中,预训练 ViT 编码器和 DiT 去噪器均会产生离群 token,尤其在中间层,且简单掩蔽高范数 token 无法改善性能,问题与局部

patch 语义损坏相关。 为此提出 Dual-Stage Registers(DSR)干预方法,在 ImageNet 和文生图任务上持续减少离群伪影并提升生成质量。

中文正文 · AI 翻译

在扩散变换器中驯服离群标记

作者:吴晓宇†*,王一飞†*,傅子睿,陈良杰,甘喆,魏晨†

查看出版物:https://arxiv.org/abs/2605.05206

DiT-Air:重新审视文本到图像生成中扩散模型架构设计的效率

2025年12月11日 研究领域:计算机视觉:/research/?domain=Computer%20Vision

在这项工作中,我们经验性地研究了用于文本到图像生成的扩散变换器(DiTs),重点关注架构选择、文本条件策略和训练协议。我们评估了一系列基于DiT的架构——包括PixArt风格和MMDiT变体——并将它们与直接处理串联文本和噪声输入的标准DiT变体进行比较。令人惊讶的是,我们的研究结果显示,标准…

关于能够使扩散变换器泛化的归纳偏差

2025年9月22日 研究领域 计算机视觉:/research/?domain=Computer%20Vision 会议 NeurIPS:/research/?event=NeurIPS

最近关于使用基于UNet的去噪器研究扩散模型泛化能力的工作揭示了可以通过几何自适应谐波基表达的归纳偏差。然而,在实践中,更近期的去噪网络通常基于变换器,例如扩散变换器(DiT)。这就引出了一个问题:基于变换器的去噪网络是否也具有可以通过几何自适应谐波表达的归纳偏差……

Bottom banner

我们的机器学习研究每天都在开创新的领域。

情报判断

Aioga 编辑摘要

研究聚焦扩散 Transformer 图像生成中的离群 token:预训练 ViT 编码器与 DiT 去噪器都会出现该现象,中间层尤为明显。论文提出 Dual-Stage Registers,并报告其在 ImageNet 和文生图任务上减少离群伪影、提升生成质量。

背景分析

材料称,离群 token 与局部 patch 语义损坏有关,而简单掩蔽高范数 token 并不能改善性能。这表明高范数只是可观察特征之一,研究因此转向同时干预编码器与去噪器阶段的 Dual-Stage Registers 方法。

Aioga 观点

Aioga 判断,这项工作的价值在于把离群 token 从单一去噪环节扩展为跨预训练编码器和 DiT 去噪器的问题,并用双阶段方法回应。值得关注的是,现有材料未提供具体指标,尚不能判断提升幅度与统计稳定性。

影响与后续

若论文结论在更多架构和数据设置中成立,可能促使图像生成研究重新审视中间层 token 异常、局部语义损坏与生成伪影之间的联系。Aioga 判断,DSR 更适合作为可验证的架构干预方向,而非已被证明普遍有效的方案。 下一步值得核对论文全文中的 DSR 结构、训练与推理开销、评价指标、消融实验及基线设置,并确认其在 ImageNet 与文生图任务中的具体结果。还应关注该方法能否迁移到不同 DiT 变体,以及效果是否依赖特定编码器。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: machinelearning.apple.com

来源: Apple Machine Learning Research(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-05T00:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

研究发现扩散 Transformer(DiT)图像生成流程中,预训练 ViT 编码器和 DiT 去噪器均会产生离群 token,尤其在中间层,且简单掩蔽高范数 token 无法...

Apple Machine Learning Research(RSS)2026-08-05T00:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。