Aioga
AI资讯 / 行业动态
返回 AI资讯

Qwen3.8 27B 量化方案基准实测:Q4_K_M 表现稳定,1 位接近随机水平

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-08T18:10:01.000Z热度 58

作者实测 Qwen3.8 27B 各档 Unsloth 量化(GGUF)在 GPQA Diamond、IFBench 和 Terminal-Bench 2.1 上的表现。

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

作者实测 Qwen3.8 27B 各档 Unsloth 量化(GGUF)在 GPQA Diamond、IFBench 和 Terminal-Bench 2.1 上的表现。

中文正文 · AI 翻译

实际上运行 Qwen3.8 27B 而不牺牲质量需要多少 GPU 内存?

完整的 BF16 模型占用 55 GB,这超出了大多数消费者硬件的承受范围。然而,17 GB 的 Q4_K_M 在一个流行的代理编程基准测试 Terminal-Bench 2.1 上与完整模型表现相同。它可以放入 24 GB 的显卡如 RTX 4090,同时仍能容纳大约 64k 的上下文 token。

压缩最终会达到极限。在 1 bit 时,模型在 GPQA Diamond 上的表现接近随机机会,而更长的推理会使情况更糟。

Qwen3.8 27B GGUF quantizations available from Unsloth on Hugging Face

Qwen3.8 27B 的 GGUF 量化模型可从 Hugging Face 上的 Unsloth 获取。选择非常多!我将检查 8-bit Q8_0(29 GB)、4-bit Q4_K_M(17 GB)、2-bit UD-Q2_K_XL(10.7 GB)以及可能的最小模型 1-bit UD-IQ1_S(6.2 GB)。

此前,我研究了 Qwen3.6 27B 模型,即使在 12GB 下也能很好地生成 SVG 形式的鹈鹕图像:https://quesma.com/blog/qwen-quantization-quality/,且在 16GB 时保留了大部分知识:https://quesma.com/blog/quantization-hurts-knowledge/。同时,在 Reddit 讨论中,很多人抱怨所有量化模型,即使是 8-bit,也会产生更差的结果——有人问为什么本地 LLM 感觉比实际要笨:https://forum.level1techs.com/t/why-your-local-llm-feels-dumber-than-it-is/253917。这些抱怨有依据吗?

衡量 token 预测的差异(KL 散度、top-1 预测)很容易,但它并不能告诉我们模型在解决任务时是否变差。有些噪声对解决任务可能无关紧要,比如一个量化模型生成的答案质量完全相同,只是措辞稍有不同。在其他情况下,一个不同的 token 可能是逻辑错误,甚至会突然结束输出。

因此,我专注于直接在流行基准上测量结果——GPQA Diamond:https://artificialanalysis.ai/evaluations/gpqa-diamond,跟随指令的 IFBench:https://github.com/allenai/IFBench,编程 Terminal-Bench 2.1:https://www.tbench.ai/leaderboard/terminal-bench/2.1。首先,复现完整模型 BF16 的官方结果,然后观察量化对结果的影响。

我在 Modal:https://modal.com/ 的 GPU 上烧了大约 3,000 美元,当时我使用 llama.cpp:https://github.com/ggml-org/llama.cpp 运行模型,使用的是 2026 年 8 月 16 日的构建版本,因为早期的构建版本不适用于此模型:https://www.paulsprogrammingnotes.com/2026/08/running-qwen-3-8-27b-16gb.html。原则上我也可以在自己的笔记本电脑上运行,但(不像 pelican-generation)这些是耗时的基准测试。

请注意,无论模型量化如何,我都使用 F16 KV-cache,每 32k 个 token 大约占 2.3 GB。

我使用了 Unsloth 量化:https://huggingface.co/unsloth/Qwen3.8-27B-GGUF:v2 用于 2、4 和 8 位模型,v3:https://unsloth.ai/docs/basics/dynamic-3.0-ggufs 用于 1 位模型。Unsloth 于 2026 年 8 月 19 日替换了 v2 文件:https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/discussions/74,因此大多数测试中使用的确切文件不再可用。

总之,如果你选择 4 位量化 Q4_K_M(17GB),你在这些基准测试中不会注意到区别。同时,努力设置非常重要(注意默认值是 xhigh)——这是一个棘手的选择,因为它可能导致过度思考:https://simonwillison.net/2026/Aug/16/qwen-38-27b/。

最简单的是一次性测试:在这种情况下,是研究生级科学 GPQA Diamond 和指令执行 IFBench。我在三个推理努力等级下运行每个测试:low、medium 和默认的 xhigh。

首先,我很高兴我复制了官方结果。运行基准测试很难;有许多隐藏的设置或假设会极大地改变结果。在这里,第一次运行的结果与 Qwen 报告的一致。

其次,除了噪声(柱状图为 Wilson 95% 置信区间:https://en.wikipedia.org/wiki/Binomial_proportion_confidence_interval#Wilson_score_interval,对运行间噪声非常保守),即使量化到 4 位,差异也很小;只有 2 位的分数稍低一些。

同时,思考等级极大地改变了分数。对于 xhigh,最佳结果需要大约 8k 推理 token。

在这里,让我非常惊讶的是,即使是减到 2 位的不错模型,模型间也没有变化,其权重不到 11 GB。然而,上下文甚至更低,大约 4k token。

编程方面它是如何工作的?Terminal-Bench 2.1 是一个标准的智能代理基准,包含 89 个任务。在这里,我使用 3 小时超时,极高努力。保留了 98k 上下文。

不仅我对 BF16 的测量复现了声明的结果,令我惊讶的是,Q4_K_M 也复现了。我不小心跳过了运行 Q8_0;然而在这种情况下,我可以安全地在 4 位与完整模型的数值之间插值。运行它既昂贵又不必要(而且会超出非正式博客文章的预算)。只有在 2 位 UD-Q2_K_XL 时情况会有些崩溃。明显下降,但仍在 Opus 4.7 或 Gemini 3.1 Pro 的水平:https://www.tbench.ai/leaderboard/terminal-bench/2.1?lf=%7B%22agent_display%22:%7B%22kind%22:%22categorical%22,%22values%22:%5B%22Terminus+2%22%5D%7D%7D。再次说明,远未到前沿,但也——远非无用。

结果是一方面,但过程呢?较小的模型是否需要更多回合、更多 token 或更多时间来得到结果?

在相同已解决的任务上,UD-Q2_K_XL 所需回合与 BF16 相同,但生成的 token 数多出约四分之一。回合数大致保持不变。

质量在 1 位时骤降。与知识类似:https://quesma.com/blog/quantization-hurts-knowledge/,量化的损害是非线性的:起初没有可测量的变化,然后小幅下降,最终崩溃。

虽然 2 位量化在某种程度上有效,但即使是最好的 1 位模型,对这些基准测试也是无用的:

正如你所见,分数接近随机猜测水平,最小的模型甚至低于该阈值。更长的推理会使情况更糟:在极高设置下,分数低于低设置,因为模型更频繁地推理,直到 token 预算耗尽并返回空答案。当然,Unsloth 自豪地宣称:

我们也制作了一些较小的 UD-1bit 量化模型,其中 UD-IQ1_S 为 6.2GB(不含 MTP),在保持约 72% top-1% 准确率的同时,体积缩小了 89%。

但在这种情况下,这剩余的 28% 非常重要。这也符合另一位用户的经验,参见 Qwen3.8 27b 1bit 脑损量化 在 r/LocalLLaMA:https://www.reddit.com/r/LocalLLaMA/comments/1vtr3h0/ladies_and_gentlemen_i_present_to_you_qwen38_27b/.

运行这些基准测试并不便宜。通过 API 运行基准测试成本很高,这一点我从之前的基准测试中就知道:https://quesma.com/benchmarks/。在租用的 GPU 上运行成本更高。

我使用了 Modal,因为它很容易从 CLI 运行,包括通过代理运行。其他设置可能有不同的定价。显然,如果你有自己的设备,这个计算会有所不同。

找到运行模型的最佳方式需要一些测试。通常,我不是使用适用于单流的多令牌预测(MTP),而是使用几个并行流。关键限制是 GPU 是否有足够的内存容纳模型和所需的 KV 缓存。

我使用了 NVIDIA L40S(与 RTX 4090 相同的 Ada Lovelace 芯片,但内存翻倍:48 GB)、H100(80 GB)和 H200(141 GB)。我想分享成本信息,给你一个大致的估计,如果你想自己运行基准测试的话。

相比之下,DeepSeek V4 Flash 0731:https://openrouter.ai/deepseek/deepseek-v4-flash-0731#providers,一款 284B 模型,最便宜的 OpenRouter 提供商输出成本约为 $0.1/Mtok。我不确定这些差异中有多少来自于大规模运行模型的效率、定价策略或受欢迎程度。

如果你在本地运行实验,通常选择最适合 GPU 内存并包含所需上下文的最佳模型。对于大多数任务,Unsloth 的 Q4_K_M 应该足够好,没有明显差异;对于一些简单任务,UD-Q2_K_XL 完全可以胜任。由于有人报告 KV 缓存更容易受到量化影响,我可能也会测试这一点。

但总体而言,我认为量化应该被接受,而不是害怕。

那么你的经验如何?加入讨论:r/LocalLLaMA:https://www.reddit.com/r/LocalLLaMA/comments/1vz3ieu/benchmarking_qwen38_27b_quantizations_4bit_holds/,Hacker News:https://news.ycombinator.com/item?id=49611128,或 LinkedIn:https://www.linkedin.com/feed/update/urn:li:activity:7498431004932743168/。

Gemini 3.7 Flash, Grok 4.6, GLM-5.3 and DeepSeek V4 Pro joined the frontier

2026 年 8 月,在 Baba Is Bench 上:Gemini 3.7 Flash、Grok 4.6 和 DeepSeek V4 Pro 0813 均击败了其前辈,同时成本降低 3-20 倍。对于开源权重的 GLM-5.3 和 Qwen3.8,进展相对缓慢。

OpenAI Codex pricing: the $270 PR a $200/month sub covers daily

个人、团队和企业购买 OpenAI Codex 的指南。包含与 Claude Code 的比较。

Do Qwen3.6 27B quantizations break the pelican?

我们在 Hugging Face 上测试了 Unsloth 对 Qwen3.6 27B 的量化,使用了骑自行车的鹈鹕、齿轮、Terminal-Bench 2.1 和 AIME-120。

了解你的编码代理实际在做什么。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:作者实测 Qwen3.8 27B 各档 Unsloth 量化(GGUF)在 GPQA Diamond、IFBench 和 Terminal-Bench 2.1 上的表现。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:公司与行业类动态需要放在竞争格局、商业化路径、资本信号和监管环境中观察,单条公告不能代表最终结果。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文件、合作落地、收入或用户信号、竞品动作和监管后续。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: quesma.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-08T18:10:01.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

作者实测 Qwen3.8 27B 各档 Unsloth 量化(GGUF)在 GPQA Diamond、IFBench 和 Terminal-Bench 2.1 上的表现。

Hacker News 热门(buzzing.cc 中文翻译)2026-09-08T18:10:01.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。