{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-08-20T21:21:00.605Z","headline":"Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型，推理速度最高提升 3.18 倍","description":"Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点，通过投机解码在不改变输出质量的前提下，GPU 吞吐最高提升 3.18 倍，端侧最高 2.87 倍。草稿模型约 300M 参数，LFM2.5-2.6B 函数调用延迟平均降低 57%，已开源支持 llama.cpp 和 SGLang。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","url":"https://www.aioga.com/news/cmt1rv5n8066iroovaxgoej1b/","mainEntityOfPage":"https://www.aioga.com/news/cmt1rv5n8066iroovaxgoej1b/","datePublished":"2026-08-20T16:52:57.000Z","dateModified":"2026-08-20T16:52:57.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://huggingface.co/blog/LiquidAI/lfm25-dspark","https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b"],"canonicalUrl":"https://www.aioga.com/news/cmt1rv5n8066iroovaxgoej1b/","directAnswer":{"@type":"Answer","text":"Hugging Face 发布面向 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型检查点。材料称其以约 300M 参数的草稿模型实现投机解码，GPU 吞吐最高提升 3.18 倍，端侧最高提升 2.87 倍。","url":"https://www.aioga.com/news/cmt1rv5n8066iroovaxgoej1b/","dateCreated":"2026-08-20T16:52:57.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"huggingface.co source article","url":"https://huggingface.co/blog/LiquidAI/lfm25-dspark","datePublished":"2026-08-20T16:52:57.000Z","provider":{"@type":"Organization","name":"huggingface.co","url":"https://huggingface.co/blog/LiquidAI/lfm25-dspark"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","datePublished":"2026-08-20T16:52:57.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b"}}],"aggregationSource":"Hugging Face：Blog（RSS","originalPublisher":{"name":"huggingface.co","url":"https://huggingface.co/blog/LiquidAI/lfm25-dspark"},"geoDeepAnswer":null,"article":{"id":"cmt1rv5n8066iroovaxgoej1b","slug":"cmt1rv5n8066iroovaxgoej1b","url":"https://www.aioga.com/news/cmt1rv5n8066iroovaxgoej1b/","title":"Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型，推理速度最高提升 3.18 倍","title_en":"","summary":"Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点，通过投机解码在不改变输出质量的前提下，GPU 吞吐最高提升 3.18 倍，端侧最高 2.87 倍。草稿模型约 300M 参数，LFM2.5-2.6B 函数调用延迟平均降低 57%，已开源支持 llama.cpp 和 SGLang。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","source":"Hugging Face：Blog（RSS","sourceUrl":"https://huggingface.co/blog/LiquidAI/lfm25-dspark","aiHotUrl":"https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","publishedAt":"2026-08-20T16:52:57.000Z","category":"行业动态","score":72,"selected":true,"articleBody":["How does DSpark work ：#how-does-dspark-work Training and Architecture ：#training-and-architecture Quality parity ：#quality-parity Inference Speed Up on CPU and GPU ：#inference-speed-up-on-cpu-and-gpu How to use LFM2.5-DSpark ：#how-to-use-lfm25-dspark Get Started ：#get-started Citation ：#citation Today, we release DSpark draft model checkpoints for three models from our LFM2.5 family: LFM2.5-1.2B-Instruct, LFM2.5-2.6B, and LFM2.5-8B-A1B. These add a speculative decoding path that trades a minimal memory increase for a large decoding speedup without changing output quality:","The decode phase in LLM inference is traditionally memory-bound. Most latency comes from streaming weights from DRAM into SRAM, not from intense computation. Speculative decoding addresses this by using a lightweight draft model to produce candidate tokens, then having the target model verify them all in a single forward pass, sharing the cost of loading the weights across all tokens we verify.","Over the years, multiple approaches of speculation have been proposed, with the most prominent being EAGLE-3：https://huggingface.co/papers/2503.01840, DFlash：https://huggingface.co/papers/2602.06036, and, most recently, DSpark：https://huggingface.co/papers/2607.05147, which combines three components:","：https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/QSig7XupRwDH70cDopwv2.png","We follow the DSpark recipe with a larger and more diverse data mix covering SFT, chat, code, and function-calling data. Based on our ablations, the first versions of the draft models are simplified attention-only draft models, with 5 layers and a block of 9. For each draft model, we ran 15 epochs on the entire dataset and selected the epoch with the highest acceptance rate rather than the lowest loss.","The resulting draft models are relatively small, with each around ~300M parameters.","Under greedy decoding, a draft token is only accepted if it matches the target model’s distribution. On rejection, the target model's own token takes its place. The emitted sequence is therefore identical to baseline greedy by construction, so benchmark accuracy (pass@1 or exact match) is unchanged.","Our DSpark draft models for LFM2.5 ship with day-one support for llama.cpp (implementation builds on top of the official codebase：https://github.com/ggml-org/llama.cpp/pull/27383, which we run with experimental metal kernels：https://github.com/ggml-org/llama.cpp/pull/27441) and **SGLang (**implementation builds on the official SGLang implementation of DSpark：https://github.com/sgl-project/sglang/pull/31041).","We measure on-device throughput with llama.cpp and Metal on an M4 Max MacBook Pro using FP16 GGUF weights and up to 256 output tokens. We measure GPU throughput with SGLang on a single H100 80 GB in BF16. Both configurations use a DSpark block size of 9, a batch size of 1, and a temperature of 0. We evaluate them on five benchmark datasets.","All three drafter models deliver noticeable throughput improvements on both the large-scale accelerator (H100) and the edge deployment (M4 Max MacBook).","For LFM2.5-2.6B, speedup on the MacBook is especially noticeable, as it pushes the interactivity level a user can enjoy far beyond the throughput offered by most proprietary cloud models (around ~140 tok/s, depending on the dataset).","Across various multi-tool scenarios, DSpark reduces the latency by 57% on average for LFM2.5-2.6B.","：https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/RTL-W6OBn97nMW7gkkT-e.png","For LFM2.5-1.2B-Instruct , we see much more variance in dataset acceptance rates, so speedup varies by as much as 52% depending on the underlying text distribution.","For LFM2.5-8B-A1B , the acceptance rate increases compared to two dense models, yet on-device we get only an 18% improvement on average. This gap is due to the current MoE implementation in llama.cpp's Metal backend, and to the fact that verifying k tokens activates more experts and thus more weight traffic than a single decode step.","Running the DSpark draft models with SGLang requires an SGLang build with DSpark support for LFM2 targets (PR #31041：https://github.com/sgl-project/sglang/pull/31041). Launch the target with the draft attached:","Then query the OpenAI-compatible endpoint at http://localhost:30000/v1 . The block size is read from the draft's config.json ; the baseline is the same command without the three --speculative-* flags.","Running them with llama.cpp requires the respective llama.cpp build (PR#27383：https://github.com/ggml-org/llama.cpp/pull/27383).","The block size is read from the sidecar metadata (n-max is clamped to it). Speculative decoding is exact : the target verifies every proposed token, so greedy output equals the target alone; per-response timings report draft_n / draft_n_accepted .","The DSpark draft model checkpoints are available on Hugging Face as Safetensors and in GGUF format:","We can’t wait to see what you build.","For citations, please use the following reference or BibTeX:","Liquid AI, \"LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook\", Liquid AI Blog, Aug 2026."],"articleImages":[{"sourceUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/646e57a5cb6ea6e6b6df1ad4/PlGhM2SUynFBUdYAylaZK.jpeg","alt":"","afterParagraph":0,"url":"/media/articles/cmt1rv5n8066iroovaxgoej1b/3329f33506ab6e53.webp"},{"sourceUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/61b8e2ba285851687028d395/EsTgVtnM2IqVRKgPdfqcB.png","alt":"Liquid AI's avatar","afterParagraph":0,"url":"/media/articles/cmt1rv5n8066iroovaxgoej1b/6ed93d9417396331.webp"}],"mediaStatus":"ok","articleBodyZh":["DSpark 如何工作：#how-does-dspark-work 训练与架构：#training-and-architecture 质量一致性：#quality-parity CPU 和 GPU 上的推理加速：#inference-speed-up-on-cpu-and-gpu 如何使用 LFM2.5-DSpark：#how-to-use-lfm25-dspark 快速开始：#get-started 引用：#citation 今天，我们发布了 LFM2.5 系列的三个模型的 DSpark 草稿模型检查点：LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。这些模型增加了一条推测解码路径，通过极小的内存增量换取巨大的解码加速，同时不改变输出质量：","LLM 推理中的解码阶段传统上受到内存限制。大部分延迟来自将权重从 DRAM 流入 SRAM，而不是密集计算。推测解码通过使用轻量级草稿模型生成候选 token，然后让目标模型在单次前向传播中验证所有 token，从而将加载权重的成本分摊到所有验证的 token 上。","多年来，已提出多种推测方法，其中最著名的是 EAGLE-3：https://huggingface.co/papers/2503.01840、DFlash：https://huggingface.co/papers/2602.06036，最近的是 DSpark：https://huggingface.co/papers/2607.05147，它结合了三个组件：","：https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/QSig7XupRwDH70cDopwv2.png","我们遵循 DSpark 配方，使用覆盖 SFT、聊天、代码和函数调用数据的更大且更丰富的数据混合。根据我们的消融实验，草稿模型的初始版本为简化的仅注意力草稿模型，具有 5 层和 9 个块。对于每个草稿模型，我们在整个数据集上运行了 15 个 epoch，并选择具有最高接受率而不是最低损失的 epoch。","最终的草稿模型相对较小，每个模型约 ~300M 参数。","在贪婪解码下，只有当草稿 token 与目标模型的分布匹配时才会被接受。若被拒绝，则由目标模型自身的 token 替代。因此，生成的序列在构建上与基线贪婪解码完全相同，因此基准准确性（pass@1 或完全匹配）保持不变。","我们的 DSpark 草稿模型针对 LFM2.5 提供了开箱即用的 llama.cpp 支持（日一支持）（实现基于官方代码库：https://github.com/ggml-org/llama.cpp/pull/27383，我们使用实验性 Metal 内核运行：https://github.com/ggml-org/llama.cpp/pull/27441），以及 **SGLang**（实现基于 DSpark 官方 SGLang 实现：https://github.com/sgl-project/sglang/pull/31041）。","我们在 M4 Max MacBook Pro 上使用 FP16 GGUF 权重和最多 256 输出 token，用 llama.cpp 和 Metal 测量设备端吞吐量。我们在单个 H100 80 GB 上以 BF16 用 SGLang 测量 GPU 吞吐量。两种配置均使用 DSpark 块大小为 9，批量大小为 1，温度为 0。我们在五个基准数据集上进行评估。","三种草稿模型在大规模加速器（H100）和边缘部署（M4 Max MacBook）上均能显著提升吞吐量。","对于 LFM2.5-2.6B，MacBook 上的加速尤其明显，因为它将用户的交互体验水平远远超越大多数专有云模型所提供的吞吐量（约 ~140 tok/s，具体取决于数据集）。","在各种多工具场景下，DSpark 平均减少 LFM2.5-2.6B 的延迟 57%。","：https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/RTL-W6OBn97nMW7gkkT-e.png","对于 LFM2.5-1.2B-Instruct，我们观察到数据集接受率变化很大，因此加速效果根据底层文本分布可能变化高达 52%。","对于 LFM2.5-8B-A1B，与两个密集模型相比，接受率提高，但在设备端平均仅提升 18%。这一差距是由于 llama.cpp Metal 后端当前的 MoE 实现，以及验证 k 个 token 会激活更多专家，从而产生比单次解码步骤更多的权重流量。","使用 SGLang 运行 DSpark 草稿模型需要具有 LFM2 支持的 SGLang 构建（PR #31041：https://github.com/sgl-project/sglang/pull/31041）。启动目标时附上草稿：","然后在 http://localhost:30000/v1 查询兼容 OpenAI 的端点。块大小从草稿的 config.json 中读取；基线为不加三个 --speculative-* 标志的相同命令。","使用 llama.cpp 运行它们需要相应的 llama.cpp 构建（PR#27383：https://github.com/ggml-org/llama.cpp/pull/27383）。","块大小是从 sidecar 元数据中读取的（n-max 会被限制到该值）。推测性解码是精确的：目标会验证每个提议的令牌，因此贪婪输出仅等于目标；每次响应的时间报告 draft_n / draft_n_accepted。","DSpark 草稿模型检查点可在 Hugging Face 上以 Safetensors 和 GGUF 格式获取：","我们迫不及待想看看你们会构建什么。","引用时，请使用以下参考文献或 BibTeX：","Liquid AI，\"LFM2.5-DSpark：从 H100 到 MacBook 推理速度提升高达 3.2 倍\"，Liquid AI 博客，2026 年 8 月。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Hugging Face 发布面向 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型检查点。材料称其以约 300M 参数的草稿模型实现投机解码，GPU 吞吐最高提升 3.18 倍，端侧最高提升 2.87 倍。","background":"大模型解码阶段通常受内存带宽限制，主要延迟来自权重在 DRAM 与 SRAM 之间的传输。投机解码先由轻量草稿模型生成候选 token，再由目标模型在一次前向过程中统一验证，以分摊加载权重的成本。","viewpoint":"Aioga 判断，此次发布的重点并非改变 LFM2.5 的生成能力，而是为既有模型增加可部署的加速路径。贪心解码下，候选 token 不匹配时由目标模型自身输出替代，因此材料将输出质量不变限定在这一机制与设置中。","implications":"对采用 LFM2.5 的开发者而言，DSpark 可能降低部分推理场景的解码延迟；其中，材料称 LFM2.5-2.6B 的函数调用延迟平均降低 57%。约 300M 参数的草稿模型会带来少量额外内存占用，实际收益仍可能随硬件与任务变化。","nextStep":"值得关注的是，开发者可通过已获首日支持的 llama.cpp 与 SGLang 验证部署效果，并分别测试 GPU、端侧及函数调用工作负载。评估时应对照基线贪心解码，记录吞吐、延迟、内存增量及候选 token 接受率。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-08-20T17:50:08.332Z","sourceHash":"d8976ffc6948ca26","review":{"approved":true,"groundedness":94,"clarity":93,"duplicationRisk":20,"blockingIssues":[],"notes":["“Aioga 判断”属于明确标注的编辑观点，未冒充来源事实。","“实际收益仍可能随硬件与任务变化”是有条件的合理推断，可保留；如需更严格，可改为“实际收益需结合硬件与任务进行验证”。","nextStep中的测试指标属于编辑建议，不是来源事实，表述清晰。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["行业动态","Hugging Face：Blog（RSS）"],"translations":{"zh-CN":{"title":"Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型，推理速度最高提升 3.18 倍","summary":"Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点，通过投机解码在不改变输出质量的前提下，GPU 吞吐最高提升 3.18 倍，端侧最高 2.87 倍。草稿模型约 300M 参数，LFM2.5-2.6B 函数调用延迟平均降低 57%，已开源支持 llama.cpp 和 SGLang。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"huggingface.co","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型，推理速度最高提升 3.18 倍 - Aioga AI资讯","description":"Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点，通过投机解码在不改变输出质量的前提下，GPU 吞吐最高提升 3.18 倍，端侧最高 2.87 倍。草稿模型约 300M 参数，LFM2.5-2.6B 函数调用延迟平均降低 57%，已开源支持 llama.cpp 和 SGLang。 🔗 阅读原文 via AIHOT ·...","url":"https://www.aioga.com/news/cmt1rv5n8066iroovaxgoej1b/","articleBody":["DSpark 如何工作：#how-does-dspark-work 训练与架构：#training-and-architecture 质量一致性：#quality-parity CPU 和 GPU 上的推理加速：#inference-speed-up-on-cpu-and-gpu 如何使用 LFM2.5-DSpark：#how-to-use-lfm25-dspark 快速开始：#get-started 引用：#citation 今天，我们发布了 LFM2.5 系列的三个模型的 DSpark 草稿模型检查点：LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。这些模型增加了一条推测解码路径，通过极小的内存增量换取巨大的解码加速，同时不改变输出质量：","LLM 推理中的解码阶段传统上受到内存限制。大部分延迟来自将权重从 DRAM 流入 SRAM，而不是密集计算。推测解码通过使用轻量级草稿模型生成候选 token，然后让目标模型在单次前向传播中验证所有 token，从而将加载权重的成本分摊到所有验证的 token 上。","多年来，已提出多种推测方法，其中最著名的是 EAGLE-3：https://huggingface.co/papers/2503.01840、DFlash：https://huggingface.co/papers/2602.06036，最近的是 DSpark：https://huggingface.co/papers/2607.05147，它结合了三个组件：","：https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/QSig7XupRwDH70cDopwv2.png","我们遵循 DSpark 配方，使用覆盖 SFT、聊天、代码和函数调用数据的更大且更丰富的数据混合。根据我们的消融实验，草稿模型的初始版本为简化的仅注意力草稿模型，具有 5 层和 9 个块。对于每个草稿模型，我们在整个数据集上运行了 15 个 epoch，并选择具有最高接受率而不是最低损失的 epoch。","最终的草稿模型相对较小，每个模型约 ~300M 参数。","在贪婪解码下，只有当草稿 token 与目标模型的分布匹配时才会被接受。若被拒绝，则由目标模型自身的 token 替代。因此，生成的序列在构建上与基线贪婪解码完全相同，因此基准准确性（pass@1 或完全匹配）保持不变。","我们的 DSpark 草稿模型针对 LFM2.5 提供了开箱即用的 llama.cpp 支持（日一支持）（实现基于官方代码库：https://github.com/ggml-org/llama.cpp/pull/27383，我们使用实验性 Metal 内核运行：https://github.com/ggml-org/llama.cpp/pull/27441），以及 **SGLang**（实现基于 DSpark 官方 SGLang 实现：https://github.com/sgl-project/sglang/pull/31041）。","我们在 M4 Max MacBook Pro 上使用 FP16 GGUF 权重和最多 256 输出 token，用 llama.cpp 和 Metal 测量设备端吞吐量。我们在单个 H100 80 GB 上以 BF16 用 SGLang 测量 GPU 吞吐量。两种配置均使用 DSpark 块大小为 9，批量大小为 1，温度为 0。我们在五个基准数据集上进行评估。","三种草稿模型在大规模加速器（H100）和边缘部署（M4 Max MacBook）上均能显著提升吞吐量。","对于 LFM2.5-2.6B，MacBook 上的加速尤其明显，因为它将用户的交互体验水平远远超越大多数专有云模型所提供的吞吐量（约 ~140 tok/s，具体取决于数据集）。","在各种多工具场景下，DSpark 平均减少 LFM2.5-2.6B 的延迟 57%。","：https://cdn-uploads.huggingface.co/production/uploads/644249b08443bce4c9890a0f/RTL-W6OBn97nMW7gkkT-e.png","对于 LFM2.5-1.2B-Instruct，我们观察到数据集接受率变化很大，因此加速效果根据底层文本分布可能变化高达 52%。","对于 LFM2.5-8B-A1B，与两个密集模型相比，接受率提高，但在设备端平均仅提升 18%。这一差距是由于 llama.cpp Metal 后端当前的 MoE 实现，以及验证 k 个 token 会激活更多专家，从而产生比单次解码步骤更多的权重流量。","使用 SGLang 运行 DSpark 草稿模型需要具有 LFM2 支持的 SGLang 构建（PR #31041：https://github.com/sgl-project/sglang/pull/31041）。启动目标时附上草稿：","然后在 http://localhost:30000/v1 查询兼容 OpenAI 的端点。块大小从草稿的 config.json 中读取；基线为不加三个 --speculative-* 标志的相同命令。","使用 llama.cpp 运行它们需要相应的 llama.cpp 构建（PR#27383：https://github.com/ggml-org/llama.cpp/pull/27383）。","块大小是从 sidecar 元数据中读取的（n-max 会被限制到该值）。推测性解码是精确的：目标会验证每个提议的令牌，因此贪婪输出仅等于目标；每次响应的时间报告 draft_n / draft_n_accepted。","DSpark 草稿模型检查点可在 Hugging Face 上以 Safetensors 和 GGUF 格式获取：","我们迫不及待想看看你们会构建什么。","引用时，请使用以下参考文献或 BibTeX：","Liquid AI，\"LFM2.5-DSpark：从 H100 到 MacBook 推理速度提升高达 3.2 倍\"，Liquid AI 博客，2026 年 8 月。"]},"en":{"title":"Hugging Face releases the LFM2.5 series DSpark draft model, with inference speed increased by up to 3.18 times","summary":"Hugging Face released DSpark draft model checkpoints for three models in the LFM2.5 series. Through speculative decoding, GPU throughput can be increased by up to 3.18 times and edge-side throughput by up to 2.87 times without changing output quality. The draft model has about 300M parameters, and LFM2.5-2.6B function call latency is reduced by an average of 57%. It has been open-sourced and supports llama.cpp and SGLang. 🔗 Read the full text via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"Industry","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face releases the LFM2.5 series DSpark draft model, with inference speed increased by up to 3.18 times - Aioga AI News","description":"Hugging Face released DSpark draft model checkpoints for three models in the LFM2.5 series. Through speculative decoding, GPU throughput can be increased by up to 3.18 times and ed...","url":"https://www.aioga.com/en/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:42:29.768Z"},"ja":{"title":"Hugging Face は LFM2.5 シリーズの DSpark 草稿モデルを公開し、推論速度が最大 3.18 倍向上","summary":"Hugging Face は LFM2.5 シリーズの 3 つのモデルの DSpark 草稿モデルチェックポイントを公開しました。投機的デコーディングにより、出力品質を変えずに GPU スループットは最大 3.18 倍、エッジ側は最大 2.87 倍向上しました。草稿モデルは約 300M パラメータで、LFM2.5-2.6B の関数呼び出し遅延は平均で 57% 減少し、すでに llama.cpp と SGLang をサポートする形でオープンソース化されています。 🔗 原文を読む via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"業界動向","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face は LFM2.5 シリーズの DSpark 草稿モデルを公開し、推論速度が最大 3.18 倍向上 - Aioga AIニュース","description":"Hugging Face は LFM2.5 シリーズの 3 つのモデルの DSpark 草稿モデルチェックポイントを公開しました。投機的デコーディングにより、出力品質を変えずに GPU スループットは最大 3.18 倍、エッジ側は最大 2.87 倍向上しました。草稿モデルは約 300M パラメータで、LFM2.5-2.6B の関数呼び出し遅延は平均で 57%...","url":"https://www.aioga.com/ja/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:42:41.424Z"},"ko":{"title":"Hugging Face는 LFM2.5 시리즈 DSpark 초안 모델을 발표했으며, 추론 속도가 최대 3.18배 향상되었습니다","summary":"Hugging Face는 LFM2.5 시리즈 세 가지 모델의 DSpark 초안 모델 체크포인트를 발표했으며, 투기적 디코딩을 통해 출력 품질을 변경하지 않고 GPU 처리량을 최대 3.18배, 엔드측에서 최대 2.87배 향상했습니다. 초안 모델은 약 300M 매개변수를 가지며, LFM2.5-2.6B 함수 호출 지연을 평균 57% 줄였으며, llama.cpp와 SGLang을 지원하도록 오픈소스로 공개되었습니다. 🔗 원문 읽기 via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"업계 동향","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face는 LFM2.5 시리즈 DSpark 초안 모델을 발표했으며, 추론 속도가 최대 3.18배 향상되었습니다 - Aioga AI 뉴스","description":"Hugging Face는 LFM2.5 시리즈 세 가지 모델의 DSpark 초안 모델 체크포인트를 발표했으며, 투기적 디코딩을 통해 출력 품질을 변경하지 않고 GPU 처리량을 최대 3.18배, 엔드측에서 최대 2.87배 향상했습니다. 초안 모델은 약 300M 매개변수를 가지며, LFM2.5-2.6B 함수 호출 지연을 평균...","url":"https://www.aioga.com/ko/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:43:28.619Z"},"es":{"title":"Hugging Face lanzó la serie de modelos borrador DSpark LFM2.5, con una velocidad de inferencia hasta 3,18 veces mayor","summary":"Hugging Face lanzó los puntos de control del modelo borrador DSpark de la serie LFM2.5 con tres modelos. A través de la decodificación especulativa, el rendimiento de GPU se mejora hasta 3,18 veces sin cambiar la calidad de salida, y el rendimiento en el extremo máximo hasta 2,87 veces. El modelo borrador tiene aproximadamente 300M de parámetros, la latencia de llamada de función de LFM2.5-2.6B se reduce en promedio un 57%, y ya está disponible de código abierto, compatible con llama.cpp y SGLang. 🔗 Leer el artículo completo vía AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"Industria","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face lanzó la serie de modelos borrador DSpark LFM2.5, con una velocidad de inferencia hasta 3,18 veces mayor - Aioga Noticias de IA","description":"Hugging Face lanzó los puntos de control del modelo borrador DSpark de la serie LFM2.5 con tres modelos. A través de la decodificación especulativa, el rendimiento de GPU se mejora...","url":"https://www.aioga.com/es/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:43:26.597Z"},"fr":{"title":"Hugging Face publie la série de modèles de brouillon DSpark LFM2.5, avec une vitesse d'inférence augmentée jusqu'à 3,18 fois","summary":"Hugging Face a publié les points de contrôle du modèle brouillon DSpark de la série LFM2.5 comprenant trois modèles. Grâce au décodage spéculatif, le débit GPU a été augmenté jusqu'à 3,18 fois sans modifier la qualité de sortie, et jusqu'à 2,87 fois côté terminal. Le modèle brouillon compte environ 300M de paramètres, la latence des appels de fonction de LFM2.5-2.6B a été réduite en moyenne de 57%, et il est open source avec support pour llama.cpp et SGLang. 🔗 Lire l'article original via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"Industrie","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face publie la série de modèles de brouillon DSpark LFM2.5, avec une vitesse d'inférence augmentée jusqu'à 3,18 fois - Aioga Actualités IA","description":"Hugging Face a publié les points de contrôle du modèle brouillon DSpark de la série LFM2.5 comprenant trois modèles. Grâce au décodage spéculatif, le débit GPU a été augmenté jusqu...","url":"https://www.aioga.com/fr/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:44:13.951Z"},"de":{"title":"Hugging Face veröffentlicht die LFM2.5-Serie DSpark-Entwurfsmodelle, wobei die Inferenzgeschwindigkeit um bis zu 3,18-fach erhöht wird","summary":"Hugging Face hat die DSpark-Entwurfsmodell-Checkpoints der LFM2.5-Serie mit drei Modellen veröffentlicht. Durch spekulatives Decoding kann die GPU-Durchsatzrate bei gleichbleibender Ausgabequalität um bis zu 3,18-fach und am Edge um bis zu 2,87-fach gesteigert werden. Das Entwurfsmodell hat etwa 300M Parameter, die durchschnittliche Funktionsaufrufverzögerung von LFM2.5-2.6B wurde um 57 % reduziert, und es wurde Open Source unterstützt für llama.cpp und SGLang. 🔗 Original lesen via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face veröffentlicht die LFM2.5-Serie DSpark-Entwurfsmodelle, wobei die Inferenzgeschwindigkeit um bis zu 3,18-fach erhöht wird - Aioga KI-News","description":"Hugging Face hat die DSpark-Entwurfsmodell-Checkpoints der LFM2.5-Serie mit drei Modellen veröffentlicht. Durch spekulatives Decoding kann die GPU-Durchsatzrate bei gleichbleibende...","url":"https://www.aioga.com/de/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:44:14.075Z"},"pt-BR":{"title":"Hugging Face lançou a série de modelos rascunho DSpark LFM2.5, com aumento de velocidade de inferência de até 3,18 vezes","summary":"Hugging Face lançou os pontos de verificação do modelo rascunho DSpark para três modelos da série LFM2.5. Através da decodificação especulativa, o throughput da GPU foi aumentado em até 3,18 vezes sem alterar a qualidade da saída, e na ponta, até 2,87 vezes. O modelo rascunho possui cerca de 300M de parâmetros; a latência de chamadas de função do LFM2.5-2.6B foi reduzida em média em 57%, e já está open source, suportando llama.cpp e SGLang. 🔗 Leia o artigo completo via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face lançou a série de modelos rascunho DSpark LFM2.5, com aumento de velocidade de inferência de até 3,18 vezes - Aioga Notícias de IA","description":"Hugging Face lançou os pontos de verificação do modelo rascunho DSpark para três modelos da série LFM2.5. Através da decodificação especulativa, o throughput da GPU foi aumentado e...","url":"https://www.aioga.com/pt-BR/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:44:54.939Z"},"ru":{"title":"Hugging Face выпустила серию черновых моделей DSpark LFM2.5, скорость вывода которых увеличена до 3,18 раза","summary":"Hugging Face выпустила контрольные точки черновой модели DSpark для трех моделей серии LFM2.5. С помощью спекулятивного декодирования, при сохранении качества вывода, максимальная пропускная способность на GPU увеличилась в 3,18 раза, на стороне устройства — до 2,87 раза. Черновая модель содержит около 300 млн параметров, средняя задержка вызова функций LFM2.5-2.6B снизилась на 57%, исходный код открыт и поддерживает llama.cpp и SGLang. 🔗 Прочитать оригинал через AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face выпустила серию черновых моделей DSpark LFM2.5, скорость вывода которых увеличена до 3,18 раза - Aioga Новости ИИ","description":"Hugging Face выпустила контрольные точки черновой модели DSpark для трех моделей серии LFM2.5. С помощью спекулятивного декодирования, при сохранении качества вывода, максимальная...","url":"https://www.aioga.com/ru/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:45:00.962Z"},"ar":{"title":"أصدرت Hugging Face سلسلة نماذج DSpark LFM2.5 الأولية، مع زيادة سرعة الاستدلال حتى 3.18 أضعاف","summary":"شركة Hugging Face أصدرت نقاط تفقد نموذج DSpark الأولية لسلسلة نماذج LFM2.5 الثلاث، ومن خلال فك الترميز المضارب، يمكن زيادة الإنتاجية على GPU حتى 3.18 مرة دون تغيير جودة المخرجات، وعلى الأجهزة الطرفية حتى 2.87 مرة. النموذج الأولي يحتوي على حوالي 300 مليون معلمة، ومتوسط تأخير استدعاء الدوال في LFM2.5-2.6B انخفض بنسبة 57٪، وقد تم إصدار الشيفرة المصدرية لدعم llama.cpp وSGLang. 🔗 اقرأ النص الأصلي عبر AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"أصدرت Hugging Face سلسلة نماذج DSpark LFM2.5 الأولية، مع زيادة سرعة الاستدلال حتى 3.18 أضعاف - Aioga أخبار الذكاء الاصطناعي","description":"شركة Hugging Face أصدرت نقاط تفقد نموذج DSpark الأولية لسلسلة نماذج LFM2.5 الثلاث، ومن خلال فك الترميز المضارب، يمكن زيادة الإنتاجية على GPU حتى 3.18 مرة دون تغيير جودة المخرجات، و...","url":"https://www.aioga.com/ar/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:45:47.797Z"},"hi":{"title":"Hugging Face ने LFM2.5 श्रृंखला के DSpark ड्राफ्ट मॉडल जारी किए, अनुमान गति में अधिकतम 3.18 गुना सुधार हुआ","summary":"Hugging Face ने LFM2.5 श्रृंखला के तीन मॉडलों के DSpark ड्राफ्ट मॉडल चेकपॉइंट जारी किए हैं, जिसमें सट्टा डिकोडिंग के माध्यम से बिना आउटपुट गुणवत्ता को बदले, GPU थ्रूपुट अधिकतम 3.18 गुना और एंड-साइड पर अधिकतम 2.87 गुना बढ़ा है। ड्राफ्ट मॉडल में लगभग 300M पैरामीटर हैं, LFM2.5-2.6B फ़ंक्शन कॉल लेटेंसी औसतन 57% कम हुई है, और यह llama.cpp और SGLang का समर्थन करते हुए ओपन-सोर्स किया गया है। 🔗 मूल लेख पढ़ें via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face ने LFM2.5 श्रृंखला के DSpark ड्राफ्ट मॉडल जारी किए, अनुमान गति में अधिकतम 3.18 गुना सुधार हुआ - Aioga AI समाचार","description":"Hugging Face ने LFM2.5 श्रृंखला के तीन मॉडलों के DSpark ड्राफ्ट मॉडल चेकपॉइंट जारी किए हैं, जिसमें सट्टा डिकोडिंग के माध्यम से बिना आउटपुट गुणवत्ता को बदले, GPU थ्रूपुट अधिकतम 3.18...","url":"https://www.aioga.com/hi/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:45:48.207Z"},"it":{"title":"Hugging Face ha rilasciato la serie di modelli DSpark LFM2.5 in bozza, con un aumento della velocità di inferenza fino a 3,18 volte","summary":"Hugging Face ha rilasciato i checkpoint dei modelli di bozza DSpark della serie LFM2.5, composti da tre modelli. Attraverso la decodifica speculativa, senza cambiare la qualità dell'output, il throughput GPU è aumentato fino a 3,18 volte, mentre quello su dispositivo terminale fino a 2,87 volte. Il modello di bozza ha circa 300M parametri, la latenza delle chiamate di funzione di LFM2.5-2.6B è diminuita in media del 57%, ed è già open source con supporto per llama.cpp e SGLang. 🔗 Leggi l'articolo originale via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face ha rilasciato la serie di modelli DSpark LFM2.5 in bozza, con un aumento della velocità di inferenza fino a 3,18 volte - Aioga Notizie IA","description":"Hugging Face ha rilasciato i checkpoint dei modelli di bozza DSpark della serie LFM2.5, composti da tre modelli. Attraverso la decodifica speculativa, senza cambiare la qualità del...","url":"https://www.aioga.com/it/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:46:34.272Z"},"nl":{"title":"Hugging Face heeft de LFM2.5-serie DSpark conceptmodellen uitgebracht, met een maximale verbetering van de inferentiesnelheid van 3,18 keer","summary":"Hugging Face heeft de DSpark conceptmodelcheckpoints van drie modellen uit de LFM2.5-serie uitgebracht. Door speculatieve decodering wordt de GPU-doorvoer maximaal met 3,18 keer verhoogd zonder de uitvoerkwaliteit te veranderen, en aan de zijde van het apparaat maximaal met 2,87 keer. Het conceptmodel heeft ongeveer 300M parameters, de gemiddelde functievertraging van LFM2.5-2.6B is met 57% verminderd, en het is open source beschikbaar met ondersteuning voor llama.cpp en SGLang. 🔗 Lees het origineel via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face heeft de LFM2.5-serie DSpark conceptmodellen uitgebracht, met een maximale verbetering van de inferentiesnelheid van 3,18 keer - Aioga AI-nieuws","description":"Hugging Face heeft de DSpark conceptmodelcheckpoints van drie modellen uit de LFM2.5-serie uitgebracht. Door speculatieve decodering wordt de GPU-doorvoer maximaal met 3,18 keer ve...","url":"https://www.aioga.com/nl/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:46:32.045Z"},"tr":{"title":"Hugging Face, LFM2.5 serisi DSpark taslak modellerini yayınladı, çıkarım hızı en fazla 3,18 kat arttı","summary":"Hugging Face, LFM2.5 serisinin üç modeli için DSpark taslak model kontrol noktalarını yayınladı. Tahminleme kod çözme ile çıktı kalitesi değişmeden GPU verimi en fazla 3,18 kat, uç tarafda ise en fazla 2,87 kat artırıldı. Taslak model yaklaşık 300M parametreye sahip, LFM2.5-2.6B fonksiyon çağrısı gecikmesi ortalama %57 azaldı ve llama.cpp ile SGLang desteği açık kaynak olarak sunuldu. 🔗 Orijinal makaleyi oku via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face, LFM2.5 serisi DSpark taslak modellerini yayınladı, çıkarım hızı en fazla 3,18 kat arttı - Aioga AI Haberleri","description":"Hugging Face, LFM2.5 serisinin üç modeli için DSpark taslak model kontrol noktalarını yayınladı. Tahminleme kod çözme ile çıktı kalitesi değişmeden GPU verimi en fazla 3,18 kat, uç...","url":"https://www.aioga.com/tr/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:47:15.001Z"},"vi":{"title":"Hugging Face phát hành loạt mô hình nháp DSpark LFM2.5, tốc độ suy luận tăng cao nhất 3,18 lần","summary":"Hugging Face phát hành ba điểm kiểm tra mô hình DSpark dự thảo của loạt LFM2.5, thông qua giải mã đầu cơ mà không làm thay đổi chất lượng đầu ra, băng thông GPU tăng tối đa 3,18 lần, ở thiết bị đầu cuối tăng tối đa 2,87 lần. Mô hình dự thảo khoảng 300M tham số, độ trễ gọi hàm của LFM2.5-2.6B trung bình giảm 57%, đã mở mã nguồn hỗ trợ llama.cpp và SGLang. 🔗 Đọc bản gốc via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face phát hành loạt mô hình nháp DSpark LFM2.5, tốc độ suy luận tăng cao nhất 3,18 lần - Tin tức AI Aioga","description":"Hugging Face phát hành ba điểm kiểm tra mô hình DSpark dự thảo của loạt LFM2.5, thông qua giải mã đầu cơ mà không làm thay đổi chất lượng đầu ra, băng thông GPU tăng tối đa 3,18 lầ...","url":"https://www.aioga.com/vi/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:47:29.425Z"},"id":{"title":"Hugging Face merilis model draft DSpark seri LFM2.5, kecepatan inferensi meningkat hingga 3,18 kali","summary":"Hugging Face merilis cek poin model draf DSpark untuk tiga model seri LFM2.5. Dengan decoding spekulatif, throughput GPU meningkat hingga 3,18 kali tanpa mengubah kualitas output, dan di sisi perangkat meningkat hingga 2,87 kali. Model draf memiliki sekitar 300 juta parameter, panggilan fungsi LFM2.5-2.6B rata-rata mengalami penurunan latensi sebesar 57%, dan telah open-source mendukung llama.cpp dan SGLang. 🔗 Baca artikel asli via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face merilis model draft DSpark seri LFM2.5, kecepatan inferensi meningkat hingga 3,18 kali - Berita AI Aioga","description":"Hugging Face merilis cek poin model draf DSpark untuk tiga model seri LFM2.5. Dengan decoding spekulatif, throughput GPU meningkat hingga 3,18 kali tanpa mengubah kualitas output,...","url":"https://www.aioga.com/id/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:48:11.862Z"},"th":{"title":"Hugging Face เปิดตัวโมเดลร่าง DSpark ซีรีส์ LFM2.5 ความเร็วในการอนุมานสูงสุดเพิ่มขึ้น 3.18 เท่า","summary":"Hugging Face เปิดตัวจุดตรวจโมเดลร่าง DSpark ของซีรีส์ LFM2.5 จำนวนสามรุ่น โดยการถอดรหัสแบบเก็งกำไรสามารถเพิ่มความเร็ว GPU สูงสุด 3.18 เท่า และฝั่งอุปกรณ์ปลายทางสูงสุด 2.87 เท่า โดยไม่กระทบต่อคุณภาพการออกแบบ โมเดลร่างมีพารามิเตอร์ประมาณ 300M การเรียกใช้ฟังก์ชันของ LFM2.5-2.6B เฉลี่ยลดความล่าช้า 57% และได้เปิดเผยซอร์สโค้ดรองรับ llama.cpp และ SGLang 🔗 อ่านบทความต้นฉบับผ่าน AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face เปิดตัวโมเดลร่าง DSpark ซีรีส์ LFM2.5 ความเร็วในการอนุมานสูงสุดเพิ่มขึ้น 3.18 เท่า - ข่าว AI Aioga","description":"Hugging Face เปิดตัวจุดตรวจโมเดลร่าง DSpark ของซีรีส์ LFM2.5 จำนวนสามรุ่น โดยการถอดรหัสแบบเก็งกำไรสามารถเพิ่มความเร็ว GPU สูงสุด 3.18 เท่า และฝั่งอุปกรณ์ปลายทางสูงสุด 2.87 เท่า โดย...","url":"https://www.aioga.com/th/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:48:22.040Z"},"pl":{"title":"Hugging Face opublikowało serię modeli roboczych LFM2.5 DSpark, przy czym prędkość wnioskowania wzrosła nawet 3,18 razy","summary":"Hugging Face opublikowało punkty kontrolne modelu roboczego DSpark dla trzech modeli z serii LFM2.5. Dzięki spekulatywnej dekodowaniu, przy niezmienionej jakości wyjścia, przepustowość GPU wzrosła maksymalnie o 3,18 razy, a na urządzeniach brzegowych maksymalnie o 2,87 razy. Model roboczy ma około 300 mln parametrów, średnie opóźnienie wywołań funkcji w LFM2.5-2.6B zmniejszyło się o 57%, jest już udostępniony w open source i obsługuje llama.cpp oraz SGLang. 🔗 Przeczytaj oryginał przez AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b","category":"行业动态","source":"Hugging Face：Blog（RSS","aggregationSource":"Hugging Face：Blog（RSS","pageTitle":"Hugging Face opublikowało serię modeli roboczych LFM2.5 DSpark, przy czym prędkość wnioskowania wzrosła nawet 3,18 razy - Aioga Wiadomości AI","description":"Hugging Face opublikowało punkty kontrolne modelu roboczego DSpark dla trzech modeli z serii LFM2.5. Dzięki spekulatywnej dekodowaniu, przy niezmienionej jakości wyjścia, przepusto...","url":"https://www.aioga.com/pl/news/cmt1rv5n8066iroovaxgoej1b/","contentTranslated":true,"sourceHash":"bfd2f854dab06698","translatedAt":"2026-08-20T17:49:15.962Z"}},"evidenceTier":"verified-news","reviewStatus":"editorial-selected","indexable":true,"editorialCover":""}}