DeepGrove 发布轻量 AI 模型 Maple-Preview,在 iPhone 上运行速度达 127 tokens/s,约为 Bonsai 27B 的 13 倍。
该模型总参数量 202 亿,采用 MoE 架构,激活参数 14.9 亿,并提出"三值权重"方案降低内存占用。 目前处于预览阶段,处理 131,000 tokens 时内存占用仅 7.69GB。
苹果 iPhone 上最快本地 AI 模型:Maple-Preview-20B-A1B 登场,可达 127 tokens/s 这条更新来自 ithome.com,发布时间为 2026-08-06,Aioga 保留原文入口以便核验。
摘要:DeepGrove 发布轻量 AI 模型 Maple-Preview,在 iPhone 上运行速度达 127 tokens/s,约为 Bonsai 27B 的 13 倍。该模型总参数量 202 亿,采用 MoE 架构,激活参数 14.9 亿,并提出"三值权重"方案降低内存占用。目前处于预览阶段,处理 131,000 tokens 时内存占用仅 7.69GB。
背景:材料称,DeepGrove 认为端侧 AI 目前主要依赖量化技术,并指出这会影响模型性能和效率。Maple-Preview 使用三值权重方案,将权重约束并量化为 {-1,0,1},以降低内存占用和计算带宽需求。
Aioga 观察:Aioga 判断,Maple-Preview 的信息重点不只在单项速度,还在于以较低激活参数量和三值权重方案服务本地运行。其 127 tokens/s 的表述应结合未披露具体 iPhone 机型、仍处预览阶段等条件谨慎看待。

影响与后续:值得关注的是,材料给出的长上下文数据称,处理 131,000 tokens 时内存占用为 7.69GB。若后续测试能够覆盖更多设备与任务,本地模型在速度、内存控制和上下文长度之间的取舍或将更易比较。 下一步可关注 DeepGrove 对预览版本的后续改进,以及其是否披露具体 iPhone 测试机型、测试条件和更多实际任务表现。同时,可留意其关于模型随对话自动调整并面向单个用户优化的系统是否形成可验证成果。

IT之家:https://www.ithome.com/ 8 月 6 日消息,美国独立 AI 研究实验室 DeepGrove 昨日(8 月 5 日)发布博文,发布名为 Maple-Preview 的轻量 AI 模型, 在 iPhone:https://iphone.ithome.com/(原文并未明确具体机型)上运行可以达到 127 tokens/s,是 Bonsai 27B (9.6 tokens/s) 的约 13 倍:https://www.ithome.com/0/976/772.htm。
在模型规模方面,Maple-Preview 的总参数量为 202 亿个,采用混合专家(MoE)架构,激活参数量为 14.9 亿个。
DeepGrove 表示,目前 AI 行业针对本地端侧主要依赖量化技术,但这种方式存在根本性问题,严重影响模型的性能和效率。
DeepGrove 公司提出“三值权重”(ternary-weight)方案,将权重约束并量化为三值({-1, 0, 1})),大幅降低了内存占用与计算带宽需求,该模型包含 24 层、256 个专家(8 个活跃专家),并采用 3:1 SWA-512:GA 混合注意力机制。

在能力展示上,Maple-Preview 在 MacBook Pro(M5 Pro)上完成 IMO 2024 P1,结果为 7/7,运行速度 281.5 tokens/s。

在长上下文场景下,Maple-Preview 也强调内存控制能力。相关图表把 context length(上下文长度)与维持上下文所需的额外内存占用放在同一坐标系中。结果显示,即便处理 131,000 tokens,Maple-Preview 的内存占用仍只有 7.69GB。




DeepGrove 表示,Maple-Preview 目前仍处于 preview stage(预览阶段),后续还会继续改进。公司同时希望构建一套系统,让 AI 模型能根据对话内容自动调整,并针对单个用户做优化。