Aioga
AI资讯 / 行业动态
返回 AI资讯

Microsoft 提出良率 imperative:让 AI 基础设施产出有用的智能

Microsoft:Official Blog(RSS)Aioga 编辑团队2026-09-02T06:00:02.000Z热度 58

Microsoft 官方博客由负责硬件与基础设施的 Rani Borkar 撰文提出良率(yield)理念,认为衡量 AI 进步的标准应是系统产出的可负担、有用的智能,而非仅仅...

行业动态Microsoft:Official Blog(RSS)

今日 AI 情报摘要

Microsoft 官方博客由负责硬件与基础设施的 Rani Borkar 撰文提出良率(yield)理念,认为衡量 AI 进步的标准应是系统产出的可负担、有用的智能,而非仅仅芯片和 token 数量。

中文正文 · AI 翻译

随着我们迈入下一个时代,我们进步的决定性衡量标准将是什么?

每个行业都有一个塑造其思维方式的词。对于飞行员来说,是安全。对于保险公司来说,是风险。

对于半导体行业来说,是良率。

良率不问解决方案有多优雅,花了多少年,或者路线图承诺了什么。它只问一个简单的问题:我们产生了多少有用的产出?

在过去60多年里,半导体行业一直在问这个问题,不懈地最大化从每片晶圆中生产出可用芯片的数量。一代又一代,晶圆又晶圆,正是这种严谨让晶体管从实验室的好奇心变成了现代生活的基础。

今天,我们需要将同样的原则应用到世界投入人工智能的前所未有的资源上:曾经只为国家准备的规模的资本、千兆瓦的电力、创纪录的制造厂和数据中心。

定义这个十年的问题仍然是这个行业一直在问的问题:实际产出了什么?不仅仅是芯片和代币,还包括可负担的智能、有意义的工作以及改善生活的成果。

点击这里加载媒体 人工智能数量的限制正以惊人的速度增加,其采用速度超过了互联网、个人电脑甚至智能手机。然而,全球渗透率仍仅占劳动人口的18%,且绝大多数使用仍基于聊天。随着系统从回答单个提示转向推理、规划、使用工具和执行更长的自主工作流程,基础设施的计算方式发生了显著变化。一个自主任务的代币使用量可能是典型聊天互动的3,400倍以上。

我们仅处于自主采纳的早期阶段,而基础设施已开始紧张。电力正在限制我们能建造什么以及何时建造。封装和机架变得更大、更密集。内存正成为更紧迫的约束。

多年来,行业对每项新需求的理性回应导致了更多:封装中的更多硅、旁边更多的内存、为其提供更多的电力以及连接它的更多光纤。每一代都带来了实质性的进步。但当每一次新的收益都需要比前一次更多的投入时,我们就在跑步机上。只有我们不断增加投入,它才会移动。

我相信我们需要追求两条前进道路。第一条是进化型:我们继续改进今天拥有的架构,在每一代中推动效率、利用率和经济性的渐进提升。第二条是变革型:通过在新架构、新材料以及系统和模型设计新方法上的创新,改变曲线本身。

我们行业的历史就是由这样的变革定义的。当提高 CPU 时钟速度遇到功耗壁垒时,我们转向了多核处理器。当平面 NAND 达到极限时,内存转向了垂直方向。

而现在,我们再次有机会挑战假设,重新思考基础问题。因为下一章的人工智能不会仅仅由我们构建了多少基础设施来定义,而是由我们能从中创造出多少智能来定义。

:https://blogs.microsoft.com/wp-content/uploads/2026/09/OMB-SEMICON-Image-C.jpg

几十年来,计算行业在制造环境中优化良率。今天,这一纪律必须延伸到各个层面,从数据中心和硅片到模型以及协调它们的智能代理工具。而这项工作在技术构建完成后不会停止。我们必须更快速地部署和扩展,同时开发新的工具和系统以最大化整个设备群的利用率。

从开发到执行,每一层都有其自身的良率,而损失和收益在各层之间会累积。任何一个层面的容量都只是起点。真正的衡量标准是这些层如何有效协作,从整个系统中产生有用的输出。

我们在微软的大规模构建和运行 AI 基础设施的经验强化了两个关键教训。首先,最大的限制很少在它们出现的层面上被解决。其次,当我们跨整个技术栈处理一个限制时,看似问题固有的权衡往往其实是架构的产物。

最大的进步通常来自于通过协同设计应用这些学习成果,跨层工作,将显而易见的限制转化为可解决的系统约束。在内存、网络和功耗方面的创新展示了这种方法在实践中的样子。

如今,内存被视为供应问题或组件问题。实际上,它是一个系统问题。

在 AI 推理中,内存现在正限制着系统性能。它必须容纳更大的模型,保持更长的上下文,并提供足够快的数据以维持计算。智能代理进一步提升了要求。生成、检索、工具使用和持久化内存在循环中同时运行,这些循环可能持续数分钟或数小时。结果是内存视野更长,更多信息保持在计算附近,并在不断扩展的对话序列中可用。在大规模下高效完成这一点将定义下一代 AI 基础设施。

我们构建 Azure Maia 平台的经验表明,内存瓶颈无法由单一层解决。

模型架构、数据科学和压缩可以减少存储模型生成期间工作上下文的 KV 缓存量。软件可以更有效地管理内存层次结构,硅片可以优化数据移动效率,编译器可以将数据更靠近计算位置。没有任何单一的改变可以消除限制。它们共同作用,增加系统从相同内存资源中可以提供的有用智能量。

这就是有用的产出:不仅仅是增加字节,而是从我们已有的每个字节中获取更多有用的智能。

当我们放大到集群级别时,我们会发现智能不是来自单一芯片。它来自数千个芯片作为一个系统协同工作。更快的连接很重要,但系统的生产力还取决于拥塞管理、故障恢复、工作负载分配、编程复杂性以及硅片、系统和软件之间的界限。所有这些因素共同决定了昂贵的计算资源是产生智能还是闲置。

在为Maia设计平台时,我们并没有从现有的网络设计开始。我们从希望实现的结果开始:在舰队规模上实现高效推理,同时在硅芯片、网络和系统软件方面进行设计。我们没有采用传统的纵向扩展和横向扩展网络,而是构建了两层纵向扩展网络,将NIC功能直接集成到芯片中,并开发了自定义传输层。

其结果是在密集推理集群中实现可扩展、一致的性能,统一的网络结构简化了编程,提高了工作负载的灵活性,并更好地利用可用容量。由于实现该性能所需的网络硬件减少,我们还降低了运营整个系统的成本。

我们的目标不仅仅是更快地传输数据,而是使更多的计算资源保持高效,并从每瓦电力和每美元中输出更多的代币。

从集群到电网,AI引入了与电力供应、分配和利用相关的新挑战。机架的功率从几十千瓦增加到数百千瓦,数据中心园区的运行规模可达吉瓦级。电力过去只是系统简单插入的资源。现在,我们从电网到芯片都需要围绕电力进行设计。

这就是为什么整个行业正在重新思考系统中的电力。固态变压器和800伏直流电供电可以在电力通过基础设施时降低分配损耗。电力和冷却不再是设计之后的下游问题,而是从一开始就成为产品定义的一部分。并且,这种协同设计越来越需要一直延伸到硅芯片层面。

Azure Cobalt 200,我们的基于Arm的服务器CPU,展示了这一过程的实际表现。我们设计Cobalt时,每个核心都有自己的电压和频率控制,并配合基于软件的、每台虚拟机的功率限制。这种更细粒度的控制使得有针对性地调整功率成为可能,同时保护关键工作负载的性能,使我们能够在同一功耗范围内运行更多服务器。

正如Cobalt所展示的,硬件与软件的协同设计使我们能够更有效地将每一兆瓦转化为客户价值。

我们在内存、网络和电力领域看到的模式贯穿整个系统:从有用的输出开始,然后优化整体而非单一层。这首先要求我们精确地判断我们要优化的输出,以及哪些设计约束是真正固定的。我们是在为峰值性能还是持续的系统吞吐量进行优化?工作负载会因大幅增加容量而获得更多且冗余略少而受益吗?什么创造了更多价值:更广泛的能力集,还是更早的客户部署?

当今系统中的每一个约束并非都遵循物理定律。有些限制是从系统其他地方的决策中继承下来的,只有当我们跨越传统边界工作时才会改变。进化源于每家公司在其领域内持续推动的进步,但转型则来自于我们共同挑战这些假设,重新设计整个系统。

未来的突破将来自跨生态系统的协作,涵盖超大规模企业和硅芯片供应商、设备制造商和材料创新者、公用事业和数据中心运营商、模型构建者和软件开发者。

但代币和智慧并不是终点。我们所产出的东西,成为他人工作的输入。

接下来重要的是,这些输入在经济整体上如何转化为生产力和人们生活中的价值,无论是帮助科学家加速发现、临床医生更早识别信号、帮助学生及时获得帮助,还是帮助小企业找到新的增长路径。

随着人工智能成为各行各业乃至全球日常工作的一部分,这一过程正在发生。人们在此基础上建设,新用途涌现,工具不断改进,价值也不断累积。

为了让这一循环扩展,人工智能必须广泛可访问。而在大规模上,可访问性取决于效率。这是部署足够智能的唯一途径,并且成本能够让它触及每一个人。

当每个人和每家公司都能获取智能,在此基础上进行构建并创造自己的价值时,那就是全面产出。

我们将继续建设能力,因为世界将需要它。但我们衡量进步的决定性标准必须是输出:不仅是芯片或令牌,而是转化为赋能、机遇和人类成就的有用智能。

这就是产出必需性。这也是我们整个行业必须共同承担的工作。

Rani Borkar 领导负责规划、架构、开发和部署微软领先云计算平台的核心组织——从硅芯片、系统到供应链。

了解更多关于微软从硅芯片到系统的 Azure 基础设施方法:https://azure.microsoft.com/en-us/explore/global-infrastructure/silicon-systems。

标签:Agentic AI:https://blogs.microsoft.com/blog/tag/agentic-ai/,AI:https://blogs.microsoft.com/blog/tag/ai/,AI 转型:https://blogs.microsoft.com/blog/tag/ai-transformation/,Azure:https://blogs.microsoft.com/blog/tag/azure/,Azure Cobalt 200:https://blogs.microsoft.com/blog/tag/azure-cobalt-200/,Azure Maia:https://blogs.microsoft.com/blog/tag/azure-maia/

2026年5月5日 | Jared Spataro:https://blogs.microsoft.com/blog/author/jaredspataro/

2026年1月26日 | Scott Guthrie:https://blogs.microsoft.com/blog/author/scottguthrie/

情报判断

Aioga 编辑摘要

Microsoft 官方博客提出“良率”理念,主张衡量 AI 进步时,应关注系统产出的可负担、有用智能,以及具有实际意义的工作和改善生活的结果,而不只是芯片与 token 数量。

背景分析

文章将半导体行业持续提高晶圆可用芯片产出的良率,作为类比,指出 AI 正获得大规模资本、电力、晶圆厂和数据中心资源。文中还称,AI 在全球工作人口中的渗透率为 18%,多数使用仍是聊天式交互。

Aioga 观点

Aioga 判断:这篇文章试图把 AI 基础设施的评价重点,从资源投入和数量指标引向可用产出与成本约束。随着系统从回答提示转向推理、规划、调用工具和执行更长流程,单项任务的资源消耗值得持续核验。

影响与后续

可能影响:AI 基础设施的讨论可能需要同时关注芯片、token、能源等投入与最终产出;但“有用智能”如何定义和衡量,材料尚未给出具体指标,不足以据此判断任何企业或技术的实际效率。 后续观察:应关注 Microsoft 是否进一步说明“良率”的量化方法、可负担智能的评价口径,以及更长代理式工作流对基础设施资源使用的实际影响。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: blogs.microsoft.com

来源: Microsoft:Official Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-02T06:00:02.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Microsoft 官方博客由负责硬件与基础设施的 Rani Borkar 撰文提出良率(yield)理念,认为衡量 AI 进步的标准应是系统产出的可负担、有用的智能,而非仅仅...

Microsoft:Official Blog(RSS)2026-09-02T06:00:02.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。