Aioga
AI资讯 / 行业动态
返回 AI资讯

Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face:Blog(RSSAioga 编辑团队2026-08-20T16:52:57.000Z热度 72

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高...

行业动态Hugging Face:Blog(RSS)

今日 AI 情报摘要

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。

草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b

中文正文 · AI 翻译

DSpark 如何工作:#how-does-dspark-work 训练与架构:#training-and-architecture 质量一致性:#quality-parity CPU 和 GPU 上的推理加速:#inference-speed-up-on-cpu-and-gpu 如何使用 LFM2.5-DSpark:#how-to-use-lfm25-dspark 快速开始:#get-started 引用:#citation 今天,我们发布了 LFM2.5 系列的三个模型的 DSpark 草稿模型检查点:LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。这些模型增加了一条推测解码路径,通过极小的内存增量换取巨大的解码加速,同时不改变输出质量:

Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍
Liquid AI's avatar

LLM 推理中的解码阶段传统上受到内存限制。大部分延迟来自将权重从 DRAM 流入 SRAM,而不是密集计算。推测解码通过使用轻量级草稿模型生成候选 token,然后让目标模型在单次前向传播中验证所有 token,从而将加载权重的成本分摊到所有验证的 token 上。

多年来,已提出多种推测方法,其中最著名的是 EAGLE-3:https://huggingface.co/papers/2503.01840、DFlash:https://huggingface.co/papers/2602.06036,最近的是 DSpark:https://huggingface.co/papers/2607.05147,它结合了三个组件:

:https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/QSig7XupRwDH70cDopwv2.png

我们遵循 DSpark 配方,使用覆盖 SFT、聊天、代码和函数调用数据的更大且更丰富的数据混合。根据我们的消融实验,草稿模型的初始版本为简化的仅注意力草稿模型,具有 5 层和 9 个块。对于每个草稿模型,我们在整个数据集上运行了 15 个 epoch,并选择具有最高接受率而不是最低损失的 epoch。

最终的草稿模型相对较小,每个模型约 ~300M 参数。

在贪婪解码下,只有当草稿 token 与目标模型的分布匹配时才会被接受。若被拒绝,则由目标模型自身的 token 替代。因此,生成的序列在构建上与基线贪婪解码完全相同,因此基准准确性(pass@1 或完全匹配)保持不变。

我们的 DSpark 草稿模型针对 LFM2.5 提供了开箱即用的 llama.cpp 支持(日一支持)(实现基于官方代码库:https://github.com/ggml-org/llama.cpp/pull/27383,我们使用实验性 Metal 内核运行:https://github.com/ggml-org/llama.cpp/pull/27441),以及 **SGLang**(实现基于 DSpark 官方 SGLang 实现:https://github.com/sgl-project/sglang/pull/31041)。

我们在 M4 Max MacBook Pro 上使用 FP16 GGUF 权重和最多 256 输出 token,用 llama.cpp 和 Metal 测量设备端吞吐量。我们在单个 H100 80 GB 上以 BF16 用 SGLang 测量 GPU 吞吐量。两种配置均使用 DSpark 块大小为 9,批量大小为 1,温度为 0。我们在五个基准数据集上进行评估。

三种草稿模型在大规模加速器(H100)和边缘部署(M4 Max MacBook)上均能显著提升吞吐量。

对于 LFM2.5-2.6B,MacBook 上的加速尤其明显,因为它将用户的交互体验水平远远超越大多数专有云模型所提供的吞吐量(约 ~140 tok/s,具体取决于数据集)。

在各种多工具场景下,DSpark 平均减少 LFM2.5-2.6B 的延迟 57%。

:https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/RTL-W6OBn97nMW7gkkT-e.png

对于 LFM2.5-1.2B-Instruct,我们观察到数据集接受率变化很大,因此加速效果根据底层文本分布可能变化高达 52%。

对于 LFM2.5-8B-A1B,与两个密集模型相比,接受率提高,但在设备端平均仅提升 18%。这一差距是由于 llama.cpp Metal 后端当前的 MoE 实现,以及验证 k 个 token 会激活更多专家,从而产生比单次解码步骤更多的权重流量。

使用 SGLang 运行 DSpark 草稿模型需要具有 LFM2 支持的 SGLang 构建(PR #31041:https://github.com/sgl-project/sglang/pull/31041)。启动目标时附上草稿:

然后在 http://localhost:30000/v1 查询兼容 OpenAI 的端点。块大小从草稿的 config.json 中读取;基线为不加三个 --speculative-* 标志的相同命令。

使用 llama.cpp 运行它们需要相应的 llama.cpp 构建(PR#27383:https://github.com/ggml-org/llama.cpp/pull/27383)。

块大小是从 sidecar 元数据中读取的(n-max 会被限制到该值)。推测性解码是精确的:目标会验证每个提议的令牌,因此贪婪输出仅等于目标;每次响应的时间报告 draft_n / draft_n_accepted。

DSpark 草稿模型检查点可在 Hugging Face 上以 Safetensors 和 GGUF 格式获取:

我们迫不及待想看看你们会构建什么。

引用时,请使用以下参考文献或 BibTeX:

Liquid AI,"LFM2.5-DSpark:从 H100 到 MacBook 推理速度提升高达 3.2 倍",Liquid AI 博客,2026 年 8 月。

情报判断

Aioga 编辑摘要

Hugging Face 发布面向 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型检查点。材料称其以约 300M 参数的草稿模型实现投机解码,GPU 吞吐最高提升 3.18 倍,端侧最高提升 2.87 倍。

背景分析

大模型解码阶段通常受内存带宽限制,主要延迟来自权重在 DRAM 与 SRAM 之间的传输。投机解码先由轻量草稿模型生成候选 token,再由目标模型在一次前向过程中统一验证,以分摊加载权重的成本。

Aioga 观点

Aioga 判断,此次发布的重点并非改变 LFM2.5 的生成能力,而是为既有模型增加可部署的加速路径。贪心解码下,候选 token 不匹配时由目标模型自身输出替代,因此材料将输出质量不变限定在这一机制与设置中。

影响与后续

对采用 LFM2.5 的开发者而言,DSpark 可能降低部分推理场景的解码延迟;其中,材料称 LFM2.5-2.6B 的函数调用延迟平均降低 57%。约 300M 参数的草稿模型会带来少量额外内存占用,实际收益仍可能随硬件与任务变化。 值得关注的是,开发者可通过已获首日支持的 llama.cpp 与 SGLang 验证部署效果,并分别测试 GPU、端侧及函数调用工作负载。评估时应对照基线贪心解码,记录吞吐、延迟、内存增量及候选 token 接受率。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-20T16:52:57.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高...

Hugging Face:Blog(RSS2026-08-20T16:52:57.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。