Aioga
AI资讯 / 论文研究
返回 AI资讯

Sakana AI 的 Error Diffusion 训练符合 Dale 原则的双流网络,无需反向传播

MarkTechPost(RSS)Aioga 编辑团队2026-07-18T06:32:43.000Z热度 30

Sakana AI 提出 Error Diffusion (ED) 局部学习规则,训练符合 Dale 原则的双流网络,完全避免权重传输。该方法在 MNIST 上达 96.7%,...

论文研究MarkTechPost(RSS)

今日 AI 情报摘要

Sakana AI 提出 Error Diffusion (ED) 局部学习规则,训练符合 Dale 原则的双流网络,完全避免权重传输。

该方法在 MNIST 上达 96.7%,CIFAR-10 上达 61.7%,首次将 ED 扩展到卷积网络。

中文正文 · AI 翻译

反向传播主导了深度学习,但它使用的机制大脑可能无法实现。具体来说,反向传播需要前向权重矩阵的精确转置。这就是权重传输问题。Sakana AI 的新论文《Diffusing Blame》:https://arxiv.org/pdf/2606.31700,直接应对了这一限制。研究团队训练了遵循戴尔(Dale)原则的网络,同时完全避免了权重传输。

误差扩散(Error Diffusion, ED)是一种局部学习规则,最早由金子(Kaneko, 2000)提出。每次权重更新只依赖三种信号:前突触活动、后突触激活导数以及一个全局错误信号。因此,ED 从不传递前向权重的转置,也不使用随机反馈矩阵。这种局部性使 ED 与戴尔原则天然兼容。然而,以往的工作仅在二分类和 MNIST 上演示了 ED。

为了满足这一限制,研究团队将每一层分为两条通路。一条为兴奋性(p),另一条为抑制性(n)。前向传播为每条通路计算兴奋性减抑制性的预激活值:

在这里,所有四个权重矩阵的元素都保持非负。偏置 bp 和 bn 是例外,因为它们不必非负。此外,W_np 和 W_pn 前的取负符号是结构性的,而非通过学习得到的。因此,跨通路连接保持抑制性,而所有可学习的权重保持非负。这一设计每层需要四个权重子矩阵。因此,它使用的参数量大约是单通路网络的 4 倍。对于相同架构,约为 DFA 的 3200 万参数,而 DFA 为 800 万。

在该架构确定后,主要扩展是模运算误差路由(modulo error routing)。这使误差扩散(ED)超越了二分类问题。对于隐藏单元 i,研究团队定义路由 r(i) = i mod C,其中 C 是输出维度。该单元然后从路由的误差分量中学习。简言之,每个隐藏单元被分配一个固定的输出通道。与 DFA 的随机反馈矩阵不同,ED 使用这种结构化对应关系。

基于该路由,研究团队为多类分类添加了三个改进:

通过这三项创新,误差扩散(ED)在MNIST上的准确率达到96.7%,在CIFAR-10上达到61.7%。相比之下,没有这些创新的种子ED准确率降至50.4%和11.6%。DFA在两个任务上的得分都更高,但违反了Dale原则,使用了约2.84M个负权重。值得注意的是,这是ED首次训练卷积网络。此前,Fujita(2026)使用扁平化的MLP在CIFAR-10上仅达到约55.2%。即便如此,61.7%仍远低于标准梯度方法的水平。

有趣的是,这些创新的重要性在不同任务间发生了反转。在MNIST上,移除层特定宽度是灾难性的(−71.4个百分点),准确率接近随机水平。批量中心化几乎没有影响(−0.3个百分点)。然而在CIFAR-10上,顺序则相反。移除批量中心化误差造成最大下降(−47.9个百分点),使五个种子中的四个崩溃。这种反转揭示了单一基准评估无法看到的任务依赖性信用分配瓶颈。

除了分类任务,研究团队将ED与近端策略优化(PPO)相结合。他们将结果称为ED-PPO,并在Brax运动和Craftax上进行测试。在这里,策略输出误差按输出通道路由到隐藏单元。对于标量值网络,误差广播到所有单元。值得注意的是,ED-PPO完全去掉了三项分类创新。在五个种子上,ED-PPO在HalfCheetah上优于BP-PPO(5494 vs 3520;p < 0.001),并且与DFA-PPO持平。在Ant任务上,它与两种PPO变体表现相当。在Craftax上,DFA-PPO反而是最弱的方法(19.8 vs BP-PPO 27.0)。因此,对于分类足够的随机反馈,在开放式强化学习中可能失效。

三个设置使这一点具体化:

提出的方法与其他无反向传播且受生物启发的学习规则对比。“符合Dale”的意思是存在分开的兴奋性/抑制性群体且权重非负。方法名称链接到主要来源。

这些方程可转化为一个紧凑、具有示例性的更新循环:

需要与我们合作以推广您的GitHub仓库、Hugging Face页面、产品发布或网络研讨会等吗?请联系我们:https://forms.gle/wbash1wF6efRj8G58

Sakana AI 的 Error Diffusion 训练符合 Dale 原则的双流网络,无需反向传播

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一个有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会带来积极影响。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台以对机器学习和深度学习新闻的深入报道而著称,这些报道既技术上可靠,又易于广大受众理解。该平台每月浏览量超过 200 万次,显示了其在观众中的受欢迎程度。

Perplexity AI Releases WANDR
10 Open-Source No-Code Platforms for Building LLM Apps, RAG Systems, and AI Agents
Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2
Fine-Tuning Qwen3 with LoRA Using NVIDIA NeMo AutoModel
NVIDIA Released DeepStream 9.1

构建一个自主事件场地运营商 [完整代码]:https://pxllnk.co/twdn5

谢谢!我们的团队会尽快与您联系

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Sakana AI 提出 Error Diffusion (ED) 局部学习规则,训练符合 Dale 原则的双流网络,完全避免权重传输。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-18T06:32:43.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Sakana AI 提出 Error Diffusion (ED) 局部学习规则,训练符合 Dale 原则的双流网络,完全避免权重传输。该方法在 MNIST 上达 96.7%,...

MarkTechPost(RSS)2026-07-18T06:32:43.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。