Aioga
AI资讯 / 行业动态
返回 AI资讯

在本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实际数据

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-08-29T07:00:22.003Z热度 75

Qwen3.8 27B(27.3B 参数,混合注意力架构,262,144 token 上下文窗口,Apache 2.0 开源)在 Mac Studio M3 Ultra 上经...

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Qwen3.8 27B(27.3B 参数,混合注意力架构,262,144 token 上下文窗口,Apache 2.0 开源)在 Mac Studio M3 Ultra 上经 Ollama 以

Q4_K_M 量化(17GB)生成速度约 14 tokens/s。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmte242e701jdrog2vz9p2cy4

中文正文 · AI 翻译

在过去的10天里,Qwen3.8 27B悄悄地在我的Mac Studio上作为后台助手运行。它会把我的RSS订阅整理成晨间摘要,将我扫描的PDF重命名并归档成可搜索的格式,并处理我交给它的各种总结任务。都是一些琐碎的事情。这就是它的吸引力所在:这是我第一次信任的本地模型,可以放心地让它处理琐碎的事务。

然后就在上周,这个模型突然在r/LocalLLaMA上无处不在,我的订阅里充满了基准测试图表,我意识到我手里拥有了那些主题帖大多数缺少的东西:一台可以真正运行它的机器,以及测量它的时间。

macmon on a Mac Studio M3 Ultra mid-generation: GPU pinned at 100 percent pulling 64W while the CPU draws 6W

于是我对它进行了基准测试。每个模型进行了五次计时运行,相同的提示语,相同的机器外加一次让我惊讶两次的1-bit实验。以下是我测量的所有内容,以及这些数据对你自己运行这款模型所需硬件的意义。

Qwen3.8-27B是一个拥有273亿参数的密集模型,采用混合注意力设计(GGUF中的架构标签是qwen35,这在后面会很重要)。它是多模态的,内置图像和视频理解功能,拥有262,144标记的原生上下文窗口,并在Apache 2.0下发布。官方模型卡:https://huggingface.co/Qwen/Qwen3.8-27B 声称在SWE-bench Pro中得分61.7,在GPQA Diamond中得分89.2,这些数字在一年前还属于前沿实验室的领域。

社区的反应直接跳过了那张基准表。引爆讨论的,是人们在模型的第一周里做的事情:一个团队把它接入到他们的编码管道,作为付费API模型的替代品,并报告说它表现稳定;OCR测试者则声称其质量超过了一些商业云服务。最受点赞的帖子的那句话让我印象深刻:“这是第一个感觉不只是玩具的本地模型。”

我的贡献是那些图表大多缺少的一个测量:这款模型在你今天可以买到的苹果硅芯片上的实际表现。

我每天使用的机器是一台Mac Studio M3 Ultra,配备256GB统一内存,就是我用于DeepSeek V4 Flash指南的那台机器:/run-deepseek-v4-flash-at-home/。我通过ollama run --verbose运行了每个模型五次计时生成,变化了技术提示语,生成约200-500字的答案,并对统计数据取平均值。两个模型都是默认的Ollama Q4_K_M量化版本,磁盘占用几乎都正好是17GB。

Side by side terminal panes comparing qwen3.6 27B at 28 tokens per second with qwen3.8 27B at 13 tokens per second

先说头条数字:新模型的生成速度是前代的一半。参数数量相同,量化大小相同,使用的机器也相同。混合注意力架构是新的,而 Ollama 中的 Metal 内核显然还没有跟上。我预计随着运行时的发展,这一差距会缩小;其他新型架构也是如此。

不过,这实际上并没有花我多少时间。Qwen3.8 用大约 1,000 个 token 回答了同样的提示,而 3.6 则在 2,000-3,300 个 token 之间絮絮叨叨。计算方式:2,058 个 token 以 28.6 tok/s 处理需要 72 秒,955 个 token 以 14.2 tok/s 处理需要 67 秒。每个 token 更慢,但每次回答更快。

生成时,CPU 几乎没有注意,因为在 Apple Silicon 上,推理通过 GPU 和 Metal 运行。这篇帖子的封面图片正是这一时刻,用 macmon 捕捉:https://github.com/vladkens/macmon 生成中:GPU 固定在 100%,功耗 63.95W,CPU 仅消耗 6W,整个过程持续流式输出回答。

Stats 菜单栏应用:https://github.com/exelban/stats 从 GUI 侧讲述了同样的故事:所有 60 个 GPU 核心 100% 运行,系统功耗达到 291W:

Stats app GPU panel showing Apple M3 Ultra with 60 cores at 100 percent utilization and 291W power draw during Qwen3.8 generation

本周单个最高赞的 Qwen3.8 讨论帖庆祝了 Unsloth 的 1 位量化:https://huggingface.co/unsloth/Qwen3.8-27B-GGUF,这是一个 6.7GB 的文件,贴主亲切地称为“脑损量化”。一个 27B 模型的内存占用只有 7B。我必须试试。

llama-bench results for the 1-bit Qwen3.8 27B quant showing 309 tokens per second prompt processing and 27 tokens per second generation

提示处理速度 309 tok/s,生成 27.2 tok/s。几乎是我的 Q4 速度的两倍,内存不足 8GB。

然后我问了一些问题。事实回忆确实很好:它知道堪培拉是澳大利亚首都,并正确解释了悉尼-墨尔本之间的妥协。但是当我要求一个简单的 bash 单行命令时,它生成了一个可用命令,却无法停止自我怀疑,浪费 400 个 token 在循环替代方案中,始终没有给出最终答案。

这与 Unsloth 自己的说法一致:他们的量化文档:https://unsloth.ai/docs/basics/dynamic-3.0-ggufs 直言 1 位量化不应用于具有自主决策或工具调用的任务,他们的发散测试表明在长任务中 1 位精度会崩溃,而一般知识仍然保留。他们规定工具调用的最低要求是 Q2_K_XL 量化,占用 9.8GB。

根据我的经验:1位量化是一种派对技巧,但它提供了一个真正的教训。量化不会均匀地减损模型。事实依旧存在,决定性消失。如果你的用例是“在低性能设备上快速回答冷知识”,它确实有效。如果涉及任何智能代理任务,请额外花3GB使用Q2。

Unsloth发布了完整的GGUF梯度,所以这里是实用版本。请预算文件大小加上几GB用于上下文和视觉投影器。

对于32GB级别,像GEEKOM A6搭载Ryzen 7 6800H和32GB内存:https://www.amazon.com/dp/B0H8YXYNPQ?tag=tdi7w27r-20&linkCode=osi&th=1&psc=1 或者GMKtec M6 Ultra带DDR5:https://www.amazon.com/dp/B0FLJQW1RD?tag=tdi7w27r-20&linkCode=osi&th=1&psc=1 可以运行Q4量化,就像我上面基准测试的那样,只是速度更慢:在CPU推理中每秒处理的token只有个位数,而不是14。这个速度适合像我这样的后台任务;在互动聊天中会考验你的耐心。

GEEKOM A6 mini PC with Ryzen 7 6800H and 32GB DDR5 RAM

:https://www.amazon.com/dp/B0H8YXYNPQ?tag=tdi7w27r-20&linkCode=osi&th=1&psc=1

如果你想在不买Apple的情况下以真实速度运行模型,社区共识的目标是AMD的Strix Halo平台。strix-halo-guide项目:https://github.com/hogeheer499-commits/strix-halo-guide 在Ryzen AI Max+ 395上测得官方Q4_K_M生成速度为20.4 tok/s,提示处理速度为292 tok/s,并提供了原始CSV支持。GMKtec EVO-X2 64GB:https://www.amazon.com/dp/B0F53QXNGH?tag=tdi7w27r-20&linkCode=osi&th=1&psc=1 是该平台的性价比入门选择,价格为$1,999,而128GB配置如BOSGAME M5:https://www.amazon.com/dp/B0H94TVN8G?tag=tdi7w27r-20&linkCode=osi&th=1&psc=1 可以开启Q8和BF16行,以及更大型模型。我在“用于本地LLM的最佳迷你PC”中全面介绍了该平台的选择:/best-mini-pc-for-local-llm-2026/。

GMKtec EVO-X2 mini PC with Ryzen AI Max+ 395 and 64GB unified memory

:https://www.amazon.com/dp/B0F53QXNGH?tag=tdi7w27r-20&linkCode=osi&th=1&psc=1

:https://www.amazon.com/dp/B0H94TVN8G?tag=tdi7w27r-20&linkCode=osi&th=1&psc=1

当前市场的一个警告:RAM 价格仍然偏高。一套 64GB DDR5 SODIMM:https://www.amazon.com/dp/B09S2QLBWC?tag=tdi7w27r-20&linkCode=osi&th=1&psc=1 目前售价为 750-870 美元。如果你购买迷你 PC 用于本地 LLM 工作,目前直接购买安装好 RAM 的版本,要比之后升级更便宜,这与我二十年来购买电脑的所有直觉相反。

:https://www.amazon.com/dp/B09S2QLBWC?tag=tdi7w27r-20&linkCode=osi&th=1&psc=1

GPU 用户的扩展方式不同:社区报告显示,双 RTX 3090 配置大约 60 tok/s,而 RTX 5090 则根据运行时间在 75-140 tok/s 之间,16GB 显卡运行 IQ4 quants 并使用量化 KV 缓存。

奥拉玛(Ollama)是最短的路径。模型页面为ollama.com/library/qwen3.8:https://ollama.com/library/qwen3.8:

使用 --verbose 运行时,每个答案都会以类似这样的统计块结尾:

你需要 Ollama 0.32.12 或更高版本;模型元数据声明这是最低要求。

对于 llama.cpp,需要注意这一点。我的 Homebrew 版本的 llama.cpp 是几周前的,它直接拒绝了该文件:

混合架构需要当前内核。运行 brew update && brew upgrade llama.cpp 解决了问题,对任何基于 llama.cpp 的前端(LM Studio、Jan、koboldcpp)同样适用:如果 Qwen3.8 无法加载,请先更新运行环境,再调试其他问题。

对我来说,基准数据不如模型自我下载以来所做的事情重要:那些过去不会发生或会泄露到云 API 的不显眼的后台工作。

早间信息摘要:一个 launchd 任务会在夜间收集我的 RSS 未读项,并让 qwen3.8 将它们压缩成一个摘要,我边喝咖啡边阅读。262k 上下文意味着一周的订阅内容可以放在一个提示中。

扫描归档:纸质邮件会被扫描,模型读取每个 PDF 的文本,并按照我的 YYYY-MM-供应商-内容 类型的命名规则重命名。视觉能力意味着它可以处理 OCR 损坏的扫描件。

当论坛帖子评论达到 400 条时,会将其粘贴进来并进行摘要,同时标注每个观点来源。这篇文章的研究生成了几个这样的摘要,感觉很令人愉快的循环。

这一切都不关心每秒令牌数量。要求是模型足够聪明,不会把保险信当成外卖菜单来归档,我已经拥有硬件,并且没有任何数据离开家。这就是2026年本地模型的实际卖点,也是我在自托管革命中提出的同样论点:/self-hosting-revolution-mini-pcs/:即使是小规模的云依赖,也值得被替换。

我可以在16GB内存上运行Qwen3.8 27B吗?可以,以1-bit或2-bit量化(6.7-9.8GB文件)。2-bit是Unsloth认为可用于工具调用的最小量化。Q4质量需要32GB。

它比Gemma 4好吗?形态不同。Gemma 4的26B-A4B是一个稀疏MoE,在相同硬件上生成速度更快(我的Gemma 4指南:/run-gemma-4-mini-pc-without-gpu/ 有这些数据)。Qwen3.8 27B是密集模型,每个令牌速度较慢,目前社区认为它在编码和代理任务上明显优于Gemma 4。作为后台助手,我会选择Qwen3.8;对于硬件有限的互动聊天,Gemma 4仍然合理。

为什么在我的机器上它也比qwen3.6慢?混合注意力架构是新的,运行时内核(Ollama Metal,llama.cpp Vulkan/CUDA)尚未完全优化。可以预期随着更新差距会缩小。部分安慰:它每个回答使用的令牌远少于qwen3.6,因此完成答案的延迟比每秒令牌差距显示的要接近。

视觉功能可以本地运行吗?可以。Ollama版本自带视觉投影器(约460M参数),图像输入开箱即可使用。本地运行时的视频理解支持仍不完善。

那Qwen3.8-Flash-Next呢?在我写这篇文章时它刚发布了权重:一个180B MoE,Q4约为110GB。完全不同的硬件级别:你需要128GB级别统一内存,现在意味着一台3500美元以上的Strix Halo或一台大型Mac。如果“意外地对本地友好”的架构声称成立,那就是未来的文章主题。

情报判断

Aioga 编辑摘要

文章记录了 Qwen3.8 27B 在 Mac Studio M3 Ultra 上的本地运行测试:采用 Ollama 的 Q4_K_M 量化后,模型文件约 17GB,摘要给出的生成速度约为每秒 14 tokens。

背景分析

材料称该模型拥有 273 亿参数、混合注意力架构、262144 token 原生上下文窗口,并以 Apache 2.0 发布。作者连续运行十天,将其用于 RSS 摘要、扫描 PDF 整理等日常任务。

Aioga 观点

Aioga 判断,这篇内容的价值主要在于提供了具体 Apple silicon 设备上的实测记录,而非只引用基准分数。混合架构与 Ollama Metal 内核的适配表现,仍可能影响最终速度。

影响与后续

对希望在本地部署模型的读者而言,17GB 量化体积和约 14 tokens/s 的摘要数据,可作为评估硬件与运行方式的参考;但该结果来自单台 Mac Studio,不能直接代表所有设备。 值得关注后续运行时对新架构的适配变化,并在相同提示、量化和硬件条件下复测速度与任务质量。若评估实际用途,也应分别验证摘要、文件整理等具体工作流。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: terminalbytes.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-29T07:00:22.003Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Qwen3.8 27B(27.3B 参数,混合注意力架构,262,144 token 上下文窗口,Apache 2.0 开源)在 Mac Studio M3 Ultra 上经...

Hacker News 热门(buzzing.cc 中文翻译)2026-08-29T07:00:22.003Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。