Aioga
AI资讯 / 行业动态
返回 AI资讯

SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

LMSYS:Blog(Chatbot Arena 团队)Aioga 编辑团队2026-08-10T11:51:38.000Z热度 72

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128...

行业动态LMSYS:Blog(Chatbot Arena 团队)

今日 AI 情报摘要

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。

🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsn68brx03q2ron5vwp3pwta

中文正文 · AI 翻译

我们很高兴与Meta Superintelligence Labs合作,将Muse Glimmer:https://ai.meta.com/的Day-0支持带到SGLang,并针对本地硬件上高性能推断代理工作流进行专门优化。

Muse Glimmer 是一个 30B 型号,由一个 27.9B 密集文本解码器、一个 1.9B 的 ViT 和一个基于 GELU 的多模态投影仪组成。文本解码器有52个变换器层。每层包含分组查询注意力,包含32个查询头和两个键值头,随后是SwiGLU前馈网络。

解码器采用混合注意力模式,将三层2048个令牌的滑动窗口层与每四步一层全序列层交错交错,以提高效率。将局部窗口的RoPE与全注意力层的NoPE结合,使模型能够将上下文长度延长至训练极限之外。

Muse Glimmer 可以与 SGLang 一起部署在开发者常用的多种硬件上,用于本地构建和运行 AI 代理,包括苹果硅芯片设备(Mac mini 和 M 系列 MacBook Pro)、NVIDIA GeForce RTX 5090 GPU 以及 NVIDIA DGX Spark。在NVIDIA SM120平台上,SGLang利用其优化后的GEMM和FlashInfer后端实现高通量推断,而苹果硅芯片则使用原生MLX后端实现高性能本地服务。

为了实现低延迟推断,可以使用SGLang的DFlash实现:

Muse Glimmer 兼容 SGLang 的众多原生优化,包括低开销调度器、RadixAttention 前缀缓存和可破坏的 CUDA 图。我们还将包括前缀缓存在内的多项优化引入了SGLang MLX后台,使得在Apple Silicon上实现代理工作负载的竞争性能。

我们提供多种格式的Muse Glimmer检查点,以满足不同硬件、画质和系统性能需求的用户需求。

需要最大模型保真度的开发者可以在单个 H100 GPU 上运行原生 BF16 检查点。SM120路径包含一个~19.5 GB的混合NVFP4+MXFP8量化配方。18 GB NVFP4 检查点与 5 GB BF16 DFlash Speculator 可舒适地安装在单个 RTX 5090 上,支持在 NVIDIA GeForce RTX 5090 加速器和 DGX Spark 上的高性能部署。

我们还提供两个 GGUF 检查点。其中较小的一个是 Q4KM 格式,组大小为 128。此检查点允许更快的推理速度,并可在内存受限的硬件上部署。Q4K-Dynamic 提供更好的模型质量。对于在 Apple Silicon 设备上开发的开发者,我们提供前面提到的 GGUF 检查点的 MLX 格式。

我们在七个平台上使用 SGLang 测量了 Muse Glimmer,并测试了批量大小 1 到 8。下面报告的是批量为 1 的交互性(tok/s/user)和批量为 8 的整体输出吞吐量(tok/s)。

DFlash 将批量为 1 的交互性提高了 1.9–4.3 倍,具体取决于平台和精度:除 RTX 5090 的 GGUF 路径外,每种配置都达到了 3.0 倍或更高,RTX 5090 的 GGUF 路径获得了 1.9 倍提升。批量为 8 的增益较小且更具变化性,范围为 1.4 倍到 4.2 倍。MLX 后端不支持推测解码。

我们感谢 Meta 超智能实验室团队和 SGLang 社区在 Muse Glimmer 的 Day-0 支持方面的合作。

情报判断

Aioga 编辑摘要

SGLang 宣布与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,并针对本地硬件上的智能体工作流推理进行专门优化。材料称该模型具备 128k+ token 上下文窗口。

背景分析

正文称,Muse Glimmer 由 27.9B 稠密文本解码器、1.9B ViT 与基于 GELU 的多模态投影器构成;解码器有 52 层,并采用滑动窗口注意力与定期全序列注意力交错的混合模式。

Aioga 观点

Aioga 判断,此次支持的重点不只是新增模型适配,而是将推理优化与本地智能体部署场景绑定。值得关注的是,SGLang 同时覆盖 Apple Silicon、RTX 5090 与 DGX Spark,降低了不同本地硬件路线的部署分化。

影响与后续

材料列出的低开销调度器、RadixAttention 前缀缓存、可中断 CUDA Graph 与 DFlash,指向低延迟和高吞吐推理需求。可能的实际影响是,需重复上下文处理的本地智能体任务可从前缀缓存等能力中获益,但具体效果仍取决于硬件与模型格式。 开发者可根据自身硬件与精度要求核对可用检查点:材料称单张 H100 可运行原生 BF16,RTX 5090 可搭配 18 GB NVFP4 检查点和 5 GB BF16 DFlash speculator。下一步值得关注各平台的实测延迟、吞吐与输出质量。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: lmsys.org

来源: LMSYS:Blog(Chatbot Arena 团队)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-10T11:51:38.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128...

LMSYS:Blog(Chatbot Arena 团队)2026-08-10T11:51:38.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。