Aioga
AI资讯 / 行业动态
返回 AI资讯

Perplexity 开源 Rust + Metal 推理引擎 Lily,专为 Apple 硅上的 Qwen3.6-35B-A3B 打造

MarkTechPost(RSS)Aioga 编辑团队2026-09-03T06:57:07.000Z热度 58

Perplexity 开源了支撑其 Hybrid Compute 的本地推理引擎 Lily,用 Rust 驱动生成循环、手写 Metal kernel 执行模型,不依赖 PyT...

行业动态MarkTechPost(RSS)

今日 AI 情报摘要

Perplexity 开源了支撑其 Hybrid Compute 的本地推理引擎 Lily,用 Rust 驱动生成循环、手写 Metal kernel 执行模型,不依赖 PyTorch 或

MLX,仅针对 Qwen3.6-35B-A3B 这一个模型。

中文正文 · AI 翻译

Perplexity 已开源 Lily:https://github.com/perplexityai/pplx-garden/tree/main/lily,这是 Perplexity Computer 中 Hybrid Compute 背后的本地推理引擎:https://www.perplexity.ai/hub/products/hybrid-compute。它是一个单进程运行时:Rust 层加载检查点并驱动生成循环,一个兼容 OpenAI 的聊天完成 API 流式传输令牌,手写的 Metal 内核执行模型。执行路径中没有 PyTorch 或 MLX。Lily 是有意设计得很窄,仅支持一个模型 Qwen3.6-35B-A3B:https://huggingface.co/Qwen/Qwen3.6-35B-A3B,在一个硬件家族上运行,这种窄化正是其性能优势所在。

它可以部署吗?可以。pplx-garden 仓库中有一个独立演示公开:https://github.com/perplexityai/pplx-garden/tree/main/lily。一个使用 Rust 和 Metal 的推理服务器,通过最小化的兼容 OpenAI 的 HTTP API 提供贪婪文本生成。4-bit 检查点大小为 19.4 GB,因此一台具有 32 GB 或更多统一内存的苹果硅 Mac 是实际的最低要求;Perplexity 的 Hybrid Compute 商用产品列出了 macOS 15+,最低 24 GB,最佳效果为 32 GB。

默认的 Mac 堆栈是 MLX:https://github.com/ml-explore/mlx 以及 MLX-LM:https://github.com/ml-explore/mlx-lm,它已经提供 Qwen 的实现:https://github.com/ml-explore/mlx-lm/blob/main/mlx_lm/models/qwen3_5.py,包含分组专家工作、融合的循环 Metal 内核,以及 GQA 感知注意力。但其操作必须在各架构间保持可复用。Lily 放弃了这一点,将模型结构、执行计划和内核选择集中在一个运行时中。

Qwen3.6-35B-A3B 存储 350 亿个参数,每个令牌激活约 30 亿个。一个路由器对 256 个专家进行评分并选择八个,同时还有一个共享专家处理每个令牌。它还混合了 10 层全注意力层,使用分组查询注意力:https://arxiv.org/pdf/2305.13245(16 个查询头,两个 KV 头)与 30 层门控 DeltaNet:https://arxiv.org/abs/2412.06464。这产生三种模式:不均衡的专家组、对增长的 KV 缓存的注意力,以及固定大小的循环。

检查点使用分组仿射4位量化,每组64个权重共享bfloat16的尺度和偏置,约70 GB的bfloat16权重压缩为19.4 GB。金属4张量运算会消耗bfloat16,因此权重必须先重建。Lily在分组后的GEMM中逐格进行,按住会进入线程组内存,累积到FP32,因此扩展后的数组永远不会到达统一内存。在Perplexity的消融中,该融合在512标记提示下提升了端到端预填充率77.4%。

将路由直方图、前缀扫描、散射和块状映射保持在单一 GPU 命令缓冲区内,通过移除每个 MoE 层的 CPU 同步,在 512 个令牌中增加了 89%。从 16 行瓦片到 32 行并配备四个 simdgroup 在 2K 时增加了 13.2%;寄存器驻留的门控 DeltaNet 扫描增加了 5.6%。专家 GEMM 大约占预填充时间的 90%。长提示以有界块形式运行,因此临时激活不会与权重和缓存争夺内存。

第一批译码几乎没有权重重复用,因此带宽限制了上限。一个记录的步骤启动了795个内核,形成了555个顺序阶段;Lily在并发的Metal通道中记录真实依赖,因此独立内核会重叠。所选令牌直接写入下一步的GPU驻留输入槽,省去每个令牌CPU的往返,四条内核链融合以保持寄存器中的中间节点。

合并缓存读取将密钥带宽从33.8提升至47.9 GB/s,价值带宽从42.0提升至61.8 GB/s。GQA打包、四个查询头共用一个线程组,使每行KV加载一次,在32K时解码提升了23.8%。在32K及以上采用固定块注意力布局,解码提升了7.7%,64K时提升了27.4%,128K时提升了40.2%。

在一台40核、128GB M5 Max的第1批次中,加载相同的4位检查点字节,匹配MLX-LM最快的直接生成路径,跨越10个长度,介于256至128K令牌,Lily平均预填充令牌为4,156个,对比3,388个(1.23x),译码令牌为170.0个,译码令牌为126.4个(1.35倍)。在4K提示和4K上下文下,它达到了5,749.9和186.6个令牌/秒,而4,737.5和140.9个,且在所有记录点(1.12–1.42x预填充,1.31–1.37x译码)都更快。教师强制检查了192个位置,结果发现莉莉的困惑度提高了0.04%,而同样排名第一的代币有96.35%的比例。

需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等吗?请联系我们:https://forms.gle/wbash1wF6efRj8G58

Perplexity 开源 Rust + Metal 推理引擎 Lily,专为 Apple 硅上的 Qwen3.6-35B-A3B 打造

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位富有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的工作是推出人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻而著称,既技术性强又易于广大读者理解。该平台每月访问量超过 200 万次,显示出其在观众中的受欢迎程度。

Qwen Developers Open-Sources zg (zvec-grep): A Local-First Search Layer Unifying ripgrep, BM25, and Vector Search

情报判断

Aioga 编辑摘要

Perplexity 开源了本地推理引擎 Lily。该单进程运行时由 Rust 负责加载检查点和生成循环,手写 Metal kernel 执行模型,不使用 PyTorch 或 MLX,仅面向 Apple silicon 上的 Qwen3.6-35B-A3B。

背景分析

Lily 的公开演示提供贪心文本生成和最小化 OpenAI 兼容 HTTP API。其 4-bit 检查点为 19.4 GB,材料称 32 GB 统一内存是较现实的起点;Hybrid Compute 产品列出 macOS 15+、24 GB 最低和 32 GB 最佳配置。

Aioga 观点

Aioga 判断:Lily 的主要取舍是缩小支持范围,把模型结构、执行计划与 kernel 选择集中在一个运行时中。材料中的优化围绕单一模型和 Apple silicon 展开,因此不宜据此推断其适用于其他模型或硬件平台。

影响与后续

可能影响:Lily 可能为本地推理的专用化优化提供参考,但其适用范围需要限定。来源列出的性能变化对应特定提示长度、上下文规模或消融实验,不代表所有 Apple silicon 设备和工作负载都能复现,也不足以证明普遍优势。 后续观察:建议核对公开演示的运行配置、检查点加载方式和测试条件,并关注不同统一内存配置下的实际表现。还需要观察项目后续是否继续维持单模型定位,以及公开实现能否在材料所述场景之外稳定运行。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-03T06:57:07.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Perplexity 开源了支撑其 Hybrid Compute 的本地推理引擎 Lily,用 Rust 驱动生成循环、手写 Metal kernel 执行模型,不依赖 PyT...

MarkTechPost(RSS)2026-09-03T06:57:07.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。