华为官宣昇腾 0 Day 支持蚂蚁百灵 Ling-3.0-flash 模型,全新算子编程框架 CANN PyPTO 首秀 这条更新来自 ithome.com,发布时间为 2026-08-06,Aioga 保留原文入口以便核验。

摘要:华为宣布昇腾完成蚂蚁百灵 Ling-3.0-flash 模型的 0 Day 适配,并首次引入 CANN PyPTO 算子编程框架,可缩短复杂融合算子交付周期。该适配兼容昇腾 A2、A3 系列产品,开发者可通过官方镜像快速拉起推理服务(A2 需 8 卡,A3 需 4 卡)。
背景:公开材料显示,Ling-3.0-flash 是蚂蚁百灵开源的原生混合推理模型。此次适配同步开放完整部署工程,并提供标准化部署方案;硬件要求分别为昇腾 A2 系列 8 卡、A3 系列 4 卡。
Aioga 观察:Aioga 判断,此次更新的关注点不只在模型上线速度,也在算子开发流程的变化。PyPTO 通过 Tensor 级 API 与自动化流程处理分片调度、数据搬运和代码生成,可能降低复杂融合算子的接入成本。

影响与后续:值得关注的是,CANNBot PyPTO Agent 将算子开发拆分为 7 个阶段,由多个子智能体和统一编排器协同推进。按华为披露,该流程覆盖生成、验证与调优,可能提升昇腾生态对新模型的适配效率。 后续可重点核验官方部署工程的可获取性、A2 与 A3 环境下的实际部署步骤,以及 PyPTO 在更多模型和算子上的适用范围。材料尚未提供具体性能数据,因此不宜据此判断推理速度或成本改善幅度。
IT之家:https://www.ithome.com/ 8 月 6 日消息,蚂蚁百灵昨日正式开源新一代原生混合推理模型 Ling-3.0-flash:https://www.ithome.com/0/981/382.htm,主打极致智能密度、全链路 Agent 闭环与低成本规模化落地。

华为官方今日宣布, 昇腾同步完成百灵 Ling-3.0-flash 模型 0 Day 适配 ,在适配的过程中,还首次引入 CANN PyPTO 算子编程框架,可缩短复杂融合算子交付周期,高效完成算子接入、推理框架性能调优,同步开放完整部署工程。
本次适配全面兼容昇腾 A2、A3 系列产品 ,配套官方标准化部署方案,开发者可通过官方镜像快速拉起推理服务(硬件要求为昇腾 A2 系列产品:8 卡;昇腾 A3 系列产品:4 卡)。
CANN PyPTO 编程框架基于 PTO ISA(虚拟指令集)构建 Tile 编程范式,开发者通过 Tensor 级 API 精准定义计算逻辑,由框架自动完成分片调度、数据搬运、代码生成全流程工作。

另外,CANNBot PyPTO Agent 构建了多智能体框架,将整个算子开发分解 7 个阶段(Stage)自动推进,每个阶段由职责分明的子智能体协同执行。所有调度由统一编排器 pypto-op-orchestrator 负责,子智能体间通过记忆机制与机器可读状态进行信息交换,确保上下文无缝传递。
整个流程从自然语言算子需求输入开始,历经自动化的生成、验证与调优,直至产出精度达标、性能优化完成的可上板算子,全程无需人工介入各阶段交接。这一工作流不仅完成了算子编程体验的全面跃升,更显著缩短了算子交付周期。IT之家附各阶段逻辑如下:

《蚂蚁集团发布百灵原生混合推理模型 Ling-3.0-flash:124B 总参数量,能力对标上一代旗舰 Ring-2.6-1T:https://www.ithome.com/0/981/382.htm》