蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。
该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。
蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Rin...
蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。
该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。
蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。
该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。
今天,我们正式发布百灵新一代 原生混合推理模型 Ling-3.0-flash。
相比上一代 1T 级旗舰思考模型 Ring-2.6-1T,Ling-3.0-flash 的总参数量为 124B (约为 Ring-2.6-1T 的 12.4%),激活参数量仅为 5.1B (约为 Ring-2.6-1T 的 8.1%),却实现了全方位的能力对标甚至超越。这不仅是一次参数量级的重构,更是一场 paradigm shift(范式转移)——模型获取智能的方式,不追求单纯的规模堆砌,而更关注于对每一寸算力与状态的高效压榨,追求” 智能密度 ”的极致提升。
Ling-3.0-flash 的能力跃迁并非来自参数规模扩张,而源于底层架构升级与 Agent 定向优化的双轮驱动:一方面,原生混合线性注意力、细粒度 KDA 状态记忆与 1/64 稀疏 MoE 协同提升了参数向实际能力的转化效率;另一方面,面向生产力场景的定向打磨强化了模型在复杂规划、多轮工具调用与长程任务交付中的核心战力。在两者的共同作用下,模型以极低体量展现出向更大体量模型对标甚至越级挑战的可能,让高性能与高性价比真正兼得。
具体而言,Ling-3.0-flash 的核心改进体现在如下几个方面:

Ling-3.0 系列模型在架构设计上实现系统性升级,深度融合长上下文计算、状态记忆与专家路由优化,以更低的单 Token 激活规模承载并转化更大容量的知识与能力。
不同于 Ling-2.6 依赖架构迁移进行预训练改造,Ling-3.0 从预训练伊始即采用 原生混合线性注意力架构 ,以 5:1 的比例交替堆叠 KDA 线性注意力层与 MLA 层(每 6 层包含 5 层 KDA 和 1 层 MLA)。该设计使全链路模型组件在整个训练周期内深度协同优化,在长上下文效率与模型能力之间实现更优平衡。
Ling-3.0 将上一代的 Lightning Attention 升级为 KDA(Kimi Delta Attention)。KDA 在 Delta Rule 的状态更新中引入细粒度对角门控,赋予不同特征通道独立的保留、衰减与写入控制能力。这一机制显著提升了有限状态记忆的控制精度,使模型在处理长文档、大型代码库和复杂资料包时,能够精准维护跨段落、跨步骤的关键信息,为长上下文检索、信息整合和持续推理奠定坚实的架构基础。
基于 Ling Scaling Law,更低的专家激活比例可带来更高的”效率杠杆”,即以更少的实际计算获得更高的等效模型能力。因此,Ling-3.0 将每个 Token 的专家激活比例由前代的 1/32 进一步降低至 1/64,以极低的计算消耗驱动模型能力的跃迁。
综上,原生混合线性注意力、KDA 与稀疏 MoE 三者深度协同,大幅提升了参数规模、计算开销与模型能力之间的转化效率,为 Ling-3.0-flash 在 124B(激活 5.1B)规模下的跨越式发展提供了坚实的架构支撑。

在上一代 flash 模型对智能密度与智效比极致探索的基础之上,Ling-3.0-flash 持续全面进化。我们不求单纯的”大而全”,而是专注于在”足够强”的前提下,把”快、省、可落地”做到极致,不断突破模型能力的上限与智能密度的绝对边界。面对更大尺寸的 SOTA 模型及上一代旗舰 Ring-2.6-1T,Ling-3.0-flash 在多项关键指标上展现出不逊色甚至更优的越级表现:
核心能力全面对标,性能实现越级。 Ling-3.0-flash 在传统推理、指令遵循与长文本交互上展现出向更大体量模型对比的底气,不仅全面覆盖数学、传统逻辑与代码等核心复杂场景,精准驾驭多约束及智能体环境下的严苛指令,更能从容支撑海量上下文处理,保障长周期、多轮次深度交互中复杂业务逻辑的持续推进。
多场景深度适配,Agent 扎实落地。 围绕当下最炙手可热的 Agent 场景,Ling-3.0-flash 展现出极高的场景契合度,做到”能力强、响应快、协同稳”。无论是深度覆盖代码生成、多文件重构与结果验证的 Coding Agent,具备出色任务规划、工具组合与动态调整能力的 General Agent,还是专注于多轮检索、跨源整合与证据闭环的 Deep Research Agent,模型均能扎实落地,以卓越的闭环执行力从容驾驭各类复杂生产力场景。
极致智能密度,兼顾高性能与高性价比。 在追求高性能的同时,Ling-3.0-flash 在智能密度与智效比的维度上追求极致。凭借极少的总参数与激活参数,模型在多项测评指标中达到或超过大尺寸 SOTA 与上一代旗舰 Ring-2.6-1T,更将推理开销压至极低。这种极致的智能密度转化为实际应用价值,意味着更短的生成时延、更快的首字响应(TTFT)与更低的 API 调用成本,全面赋能高频线上服务与真实 Agent 的落地。
激活参数决定单次推理计算量与服务吞吐:Ling-3.0-flash 仅需 5.1B 激活参数即可提供具有竞争力的智能分数。

值得一提的是,Ling-3.0-flash 还围绕真实生产力场景,对 Agent 能力、运行效率与协同架构进行了系统升级。面对复杂约束和长程任务,Ling-3.0-flash 能够持续规划、调用工具、响应环境反馈,并根据中间结果动态调整执行路径,最终完成可验证的任务交付。与此同时,我们通过分级缓存和 Multi-Agent 协同架构,进一步提升了长会话交互效率,以及复杂任务执行的能力上限与稳定性。
在训练方面,我们将 Coding Agent、General Agent 和 Deep Research Agent 的可交互训练环境扩展至 10,000 余个,并持续提升环境的质量、多样性和任务难度。针对长程 Agent 任务,我们在 RL 阶段引入完整执行轨迹复盘和步骤贡献评估机制,为任务执行过程生成更细粒度的步骤级训练信号,帮助模型更高效地从环境交互、失败反馈和自主纠错中学习。
由此,相比上一代旗舰 Ring-2.6-1T,Ling-3.0-flash 的 Agent 能力实现全面提升,在多项指标上对齐甚至超越体量达其 2~3 倍的开源 SOTA 及行业领先闭源模型,展现出面向真实生产力场景的任务执行与交付能力。这种能力也经受住了真实 APP 生成需求场景的检验,Ling-3.0-flash 在 MiniAppBench :https://miniappbench.github.io/ 上的通过率达到 25.3%,与总参数规模约为其两倍的开源 SOTA 模型达到同等水平。MiniAppBench 要求模型仅根据一句用户需求,生成完整可用的 APP,参与评测的 16 个主流模型平均通过率仅为 17%。

Agent 任务越复杂,对话轮次越多,上下文也越长。传统推理服务中,一旦本地缓存被新请求挤出,或同一会话被调度至其他计算节点,系统往往需要重新处理前面数万 Token 的上下文,导致首 Token 延迟(TTFT)快速上升。为此,Ling-3.0-flash 基于 SGLang HiCache 与 Mooncake 构建了集群级分层缓存体系,让已有上下文能够跨层级存储、跨节点共享和按需恢复,将缓存从”实例私有”升级为”集群共享”,最大限度减少长上下文的重复计算。实测显示,在长输入场景下,命中 L3 Cache 相比直接重新计算,可将 TTFT 降低 60%~80% 以上 。
从本地缓存到集群共享,从重复计算到分层复用,Ling-3.0-flash 显著提升了长会话的 Token Efficiency。对于 Coding Agent、长文档问答等需要持续携带完整历史的场景,这意味着更快的任务接续、更低的计算开销,以及更加流畅稳定的交互体验。
面对复杂 Agent 任务,传统的 Single-Agent 推理链路容易受到决策漂移、局部误判和容错能力不足等问题影响。为此,Ling-3.0-flash 升级了多智能体协同架构 “Ling Multi-Agent” 。我们在 SearchSwam :https://arxiv.org/abs/2606.09730 “委派智能(Delegation Intelligence)“范式的基础上,进一步研究了 Multi-Agent 架构的 Scaling 机制。不同 Agent 可以围绕任务进行多层级分工,并通过交叉验证、信息补充、协同纠错与竞争赛马,降低单一推理路径带来的偏差。
如下图,在 BrowseComp 和 BrowseComp_zh 上,通过”Ling Multi-Agent”架构可获得 log-linear 的性能提升。未来,我们将把这一范式拓展到更广泛的任务场景,持续探索更大规模智能体协同的能力边界。

Ling-3.0-flash 原生支持 256K 上下文,并可扩展至 1M;同时针对 Agent 场景进行了专项优化,使模型能力不止体现在评测指标上,也能更好地转化为真实系统中的任务执行能力。
Ling-3.0-flash 已经突破了平面代码的限制,可以直接介入 3D 设计世界,成为你随时可调用的虚拟三维建模助理。
在 Blender 使用场景中,Ling-3.0-flash 通过 Blender MCP 接口控制 3D 软件,自动编写 Python 脚本在一句话指令下搭建包含高架路网、摩天大楼与材质的城市场景,最后设置相机路径并渲染输出航拍视频。
在生成过程中,Ling-3.0-flash 体现出了复杂 3D 几何空间推理、Blender Python API 控制以及长程 MCP 工具调用等能力。
拿到一个课题不知从何下手?Ling-3.0-flash 可以扮演多重角色快速进行文献检索、数据质询,并生成论文,合成你需要的 PPT。
Ling-3.0-flash 搭建的自主多智能体科研大盘,支持跨角色(Scientist、Data Analyst、CrossValidator、Archivist、Writer)自主进行假说推演、文献检索、数据质询打回、黄区现场研讨与自动化成果论文及 Slide 报告合成。
如果你有一堆凌乱的立项草稿和预算数据需要梳理,不需要手动调格式和套公式,模型能像私人秘书一样帮你完成这些日常核算工作。
面向真实的办公场景,Ling-3.0-flash 能够基于 Office MCP 接口,由 AI 直接读取并排版 Word 提案(调整格式并生成目录),同时核算 Excel 财务数据(处理 SUMIF 公式与透视表汇总),最终输出规范文档与 PDF 滚动长图。
过程中表现出了 Ling-3.0-flash 对多模态文档解析、Office API 精细控制与自动化长程执行的稳定性。
大模型不仅是代码工具,更是设计大师。即使没有任何图片素材,Ling-3.0-flash 只凭代码,就能批量为你搭建出极具视觉冲击力的前卫艺术网页。
Ling-3.0-flash 批量生成了数个现代设计流派页面(含包豪斯、波西米亚、酸性设计等,包含 Easy 到 Hard 渐进难度),在不依赖外部图片的前提下,纯靠 CSS 渐变、SVG 路径和排版布局还原流派质感。
不同风格的页面生成展现出了 Ling-3.0-flash 对视觉流派设计的理解力、极高质量的前端代码批量生成与无图美学排版能力。
如果你需要一个多媒体应用来教学或了解,不需要买什么专业软件,可以让 Ling-3.0-flash 给你写一个。
Ling-3.0-flash 开发了一个网页版黑白钢琴电子琴,利用浏览器 Web Audio API 实现多种合成器波形选择与声音包络调校,并配合 Canvas 实时声波可视化动效。
过程中展现出了 Ling-3.0-flash 的代码开发、3D、多媒体生成等综合能力。
如何在已有信息里快速发现关键信息,并生成可对外发布的营销文案?如果你没有精力处理,Ling-3.0-flash 可以帮你针对不同平台的特征快速整理出合适的文案。
房地产销售给运营发邮件,通过接入 Ling-3.0-flash 结合上下文,并快速生成适合 Instagram、X/Twitter、Linkedin 的营销文案。
课程时间安排繁琐而复杂?在没有时间处理的情况下,Ling-3.0-flash 可以像一位私人秘书,帮你实现自动回复与更新课程安排。
Ling-3.0-flash 通过联合 OpenClaw,在收到课程时间询问时,自动查看日历中的课程安排,并自动回复自选的课程时段,同时向咨询者发送确认信息,对日历进行更新。
在追求极致智能效率与高性价比落地的同时,基于当前的架构设计与权衡取舍,Ling-3.0-flash 目前也客观存在以下 局限性 :受限于极致压缩的参数规模,模型的资源倾斜主要聚焦于智能体与核心推理能力,因此在广度知识储备上做了一定妥协。同时,多语言控制仍有提升空间,在长对话或高压交互场景下偶发会出现中英混杂现象。
面向未来,我们将聚焦以下方向持续迭代:通过精细化知识注入与多语言对齐策略进行定向优化,补齐短板;在此基础上,进一步拓宽并深化更复杂的智能体场景,攻克长链条、多步骤的长程任务执行难题,持续探索参数规模下的极致智能效率边界。
为方便更多开发者快速体验 Ling-3.0-flash ,我们将在 OpenRouter 与百灵官方平台同步开放限时免费 API 调用,免费期截至 8 月 3 日 23:00(北京时间)。
OpenRouter 体验地址: https://openrouter.ai/inclusionai/ling-3.0-flash:free :https://openrouter.ai/inclusionai/ling-3.0-flash:free
Ling-3.0-flash 模型权重将在免费期结束后正式开源,敬请关注。
蚂蚁智能(杭州)科技有限公司 | 浙ICP备14032978号-28:https://beian.miit.gov.cn
蚂蚁百灵发布原生混合推理模型 Ling-3.0-flash,总参数为 124B、激活参数为 5.1B。官方称其能力可全面对标甚至超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。
据开发者博客,Ling-3.0 从预训练开始采用原生混合线性注意力架构,以 5:1 比例交替堆叠 KDA 与 MLA 层,并将每个 Token 的专家激活比例由前代的 1/32 降至 1/64。
Aioga 判断,此次发布的核心叙事不是扩大参数规模,而是提高“智能密度”和计算转化效率。值得关注的是,能力对标及超越的结论目前来自厂商材料,仍需结合可复现评测审慎验证。
若官方所述能力在独立测试中得到验证,较低激活参数可能为高性能模型的部署效率与成本控制提供新思路。其对复杂规划、多轮工具调用和长程任务的优化,也可能增强生产力场景适用性。 后续应重点核对官方完整评测方法、基准项目、对比模型配置及推理成本,并关注第三方对长上下文检索、代码处理、复杂规划和多轮工具调用的复现结果,以判断“越级挑战”的实际边界。
本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。
抓取通道: 摘要聚合 · 原始域名: developer.ant-ling.com
来源: 蚂蚁百灵:Developer Blog(网页)
原文链接: 打开原始来源
Aioga 归档: 查看情报页
Content record: source-page · Updated: 2026-07-23T16:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。