Aioga
AI资讯 / 行业动态
返回 AI资讯

ByteByteGo 图解如何压缩大语言模型而不明显损失智能

ByteByteGo(RSS)Aioga 编辑团队2026-09-01T15:30:41.000Z热度 58

ByteByteGo 发布长文,讲解如何在大语言模型不明显变笨的前提下缩小模型体积。文章以 70B 参数模型约 140 GB、消费级显卡仅 24-48 GB 显存的矛盾为切入点...

行业动态ByteByteGo(RSS)

今日 AI 情报摘要

ByteByteGo 发布长文,讲解如何在大语言模型不明显变笨的前提下缩小模型体积。

文章以 70B 参数模型约 140 GB、消费级显卡仅 24-48 GB 显存的矛盾为切入点。

中文正文 · AI 翻译

Datadog 的免费指南展示了如何将 AI 支出、基础设施和模型性能连接到一个视图中,这样您就可以在云账单上显示之前,将成本增加与导致这些变化的架构更改关联起来。

按令牌、模型、供应商和团队分解 AI 成本

一旦推理量激增或 API 支出超过预算,即刻收到提醒

将成本增加直接与架构更改关联,这样根本原因分析只需几分钟

获取指南:https://go.bytebytego.com/Datadog_090126

一个拥有 700 亿参数的模型可能占用多达 140 GB 的空间。一块好的显卡有 24 GB,非常好的可能有 48 GB。

如您所见,差距相当显著。硬盘空间相对便宜,但快速内存稀缺且昂贵。此外,模型在几年内大约增长了 100 倍,而消费者显存大约翻了一番。这不仅仅是压缩以适应的问题。

最简单的选择是购买能够运行该模型的硬件。但这成本高昂,而且不适合消费者硬件。

另一种选择是缩小模型。但我们不希望以牺牲模型智能为代价。在这里,某些技术可以帮助我们在不降低输出质量的前提下使模型更小。

是什么让语言模型变得智能?

缩小模型的三种技术

如何通过压缩细节来缩小模型?

如何通过剪掉未使用的路径来缩小模型?

如何通过模拟行为来缩小模型?

缩小会损害模型的智能吗?

免责声明:本文基于来自各种来源的公开信息。参考文献在文末。如果您发现任何不准确之处,请评论。

像 ChatGPT 这样的大型语言模型与普通软件程序有很大不同。它们不依赖典型的 if-else 语句来决定下一步操作。

大型语言模型本质上是由称为参数或权重的数字组成的一大堆数字。这些权重是语言模型智能的基础。举例来说,一个拥有700亿参数的模型意味着有700亿个数字或权重。每个权重通常以16位存储,也就是两个字节。两个字节乘以700亿等于140GB,这基本上被认为就是模型的大小。

这些权重被排列成矩阵。单个权重矩阵是一个网格,通常是类似4096乘以4096的大小。这样一个矩阵大约有1670万个数字。一个拥有700亿参数的模型在大约80层中堆叠了数百个这样的矩阵。

当然,权重本身并不是模型能力的全部。多个组件协同工作使模型具有智能。例如,模型需要像Transformer这样的架构来引导数据并执行注意力机制。它还需要一个上下文窗口来保存提示以及对话过程中生成的所有内容。

然而,架构由几百行代码组成。提示可能只有几千字节。相比之下,权重构成了语言模型的主要部分。没有适当的权重,语言模型无法按预期工作。权重执行许多任务:

它们存储模式,例如语法、事实和推理捷径。

训练完成后,权重会冻结为不可变的数字值网络。

权重决定了一个模拟神经元对下一个神经元的影响强度。

运行模型意味着将输入通过这些权重矩阵传递,直到下一个词从另一端输出。

在这里需要记住的一点是,没有单个权重本身是有意义的。如果你打开一个模型文件并查看编号为 N 的权重,你可能会看到类似 0.0293 这样的数字。在这个数字的两侧可能还有其他数字,例如 -0.0117、0.004、-0.0862。单独看,每一个数字几乎没有意义。模型的能力隐藏在各个权重之间的关系中。可以把它想象成一张照片,每个像素共同呈现出可识别的图像。即使我们稍微调整每个像素的亮度,我们仍然可以辨认出图片中的内容。这是因为信息并不集中在单一的位置。

根据上述信息,很容易理解,要缩小一个模型,我们必须以某种方式处理这些权重。而这正是各种技术派上用场的地方。不过,有几点可以帮助我们更好地理解缩小模型的技术:

首先,并非所有权重都同等重要。大多数权重值接近零,对最终输出几乎没有影响。然而,有少数权重较大,会产生较大的影响。

其次,我们只能根据模型的行为来判断模型,而不能凭其内部结构。

将代理投入生产是容易的部分。保持它们的可靠性、可管理性,并随着时间改进,才是大多数企业 AI 项目停滞的地方。

顶尖团队是如何做到的?他们使用了代理式操作模型(Agentic Operating Model,简称 AOM),这是一个逐步框架,用于在企业代理扩展时对人、流程和技术进行对齐,从而提升代理性能。

在浪链最新指南中,您将了解到:

为何 AI 代理不像传统软件那样容易崩溃

覆盖整个代理生命周期的工程技术栈

从“构建和部署”转向“运营和持续改进”

了解更多:https://go.bytebytego.com/LangChain_090126

缩小模型的技术主要围绕使用更少的位数来存储权重,或者使用更少的权重值。主要有三种技术:

以较低精度存储每个权重(量化):在这种方法中,我们保留所有权重,但以不那么精确的方式描述每一个。例如,两字节变为半字节。

移除无关权重(剪枝):这种方法涉及找到没有任何贡献的权重并将其删除。

建立较小的模型以模仿较大的模型(知识蒸馏):在这种方法中,我们不接触原始模型,而是训练一个新的、更小的模型,使其表现得与原模型相似。

回到我们的照片例子,我们可以将量化看作是用一台分辨率稍低的廉价相机拍照。剪枝更像是剪掉照片中可能没有任何价值的空白边缘。蒸馏可以被看作是请一位熟练的画家将照片缩小到原图的四分之一来重新绘制。

这些技术的一个优点是它们可以叠加。例如,一个模型可以由制造它的实验室进行蒸馏。它可以由研究团队进行剪枝。最后,在加载到特定机器之前,用户可以对其进行量化。换句话说,叠加这些技术可以使高端大语言模型在普通消费硬件上运行成为可能。

现在让我们更详细地看看这些技术中的每一种。

缩小模型的第一种技术是减少每个权重存储的细节。这种技术称为量化。

假设某个权重可能被存储为0.02934517。这样占用很多空间,但在一个拥有700亿参数的模型中,这只不过是单个权重而已。无论它存储为0.02934517还是0.029,对模型的输出几乎没有差别。换句话说,很多存储空间都用在了可能并不重要的精度上。

量化是一种降低这种精度的技术。

量化的第一个步骤甚至发生在模型发布之前。在训练过程中,模型权重通常以32位(4字节)浮点数存储。这也被称为FP32格式。由于训练涉及对每个权重进行数百万次微小调整,因此需要高精度。但当模型被分发时,精度通常会降低到16位浮点格式,也称为FP16或BF16。

然而,我们可以将精度降低得更低。要理解如何降低,我们首先需要清楚地了解浮点值是如何构建的。

浮点数将位划分为三个部分:符号、指数和尾数。FP32 为符号分配 1 位,为指数分配 8 位,为尾数分配 23 位。而 BF16 则保留所有指数位,并将尾数减至 7 位。这在基本范围上与 FP32 相同,但细节较少。为了清楚起见,BF16 与 FP16 略有不同,后者指数只有 5 位,但为尾数保留更多位。实际使用中,BF16 已大致取代 FP16。

整数的差异更大。8 位整数是从 -128 到 127 的整数。4 位整数是从 -8 到 7 的整数。没有指数,也没有比例。换句话说,将浮点数转换为整数不仅会导致精度损失,还会去掉每个权重的尺度。

现在让我们来看量化的完整过程:

第一步,我们找出数据集的最小值和最大值,并将总跨度划分为固定步数。

需要明确的是,“数据集”不是整个模型。它只是相邻权重的小组。我们可以称之为一个块,理想情况下应该相当小。

例如,考虑这八个权重:0.021、-0.017、0.004、-0.048、0.011、0.033、-0.006、0.070。它们的跨度从 -0.048 到 0.070。无论哪个方向的最大值都是 0.070。以 4 位作为目标精度,我们可以表示从 -7 到 7 的整数。换句话说,每个方向有七个步长。因此,一个步长可以计算为 0.070/7,即 0.010。

不是保留长小数,而是将每个原始数字四舍五入到最接近的可用步长。为此,我们将每个权重除以步长并四舍五入到最接近的整数。

下表显示了新的权重:

如表中所示,右侧列的值最终会进入模型权重文件。此处每条记录都是介于 -7 到 7 之间的整数。

原始权重是浮点数。由于浮点数自带尺度,将其四舍五入会去掉每个权重的精度和尺度。这个尺度必须存储在某处。

我们需要跟踪缩放因子,以便在模型需要读取它们时,压缩后的数字可以大致重建原始值。

在我们的示例中,缩放因子是步长(0.010)。它为整个块存储一次。要恢复权重,我们可以将存储的整数乘以缩放因子。

情报判断

Aioga 编辑摘要

ByteByteGo 发布文章,讨论如何在不明显损失语言模型智能的前提下缩小模型体积。文章以大模型存储空间与消费级显卡显存之间的差距为切入点,介绍相关压缩思路。

背景分析

文中称,70B 参数模型最多可能占用约 140 GB 空间,而较好的显卡通常有 24 GB 显存,更高规格显卡可能有 48 GB。文章还指出,快速显存稀缺且成本较高。

Aioga 观点

Aioga 判断:材料明确呈现的是模型规模增长与消费级显存容量之间的容量矛盾,但正文摘录未展开具体压缩方法及其效果,因此不宜据此判断某种方案已经解决部署问题。

影响与后续

可能影响:模型部署需要同时考虑模型体积、快速显存与硬件成本;缩小模型可能有助于适配有限显存,但现有材料不足以证明具体方法对性能、成本或部署范围的实际影响。 后续观察:需进一步核对原文对压缩方法、智能损失、运行条件和硬件适配范围的具体说明,再评估其对消费级设备部署的参考价值。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: blog.bytebytego.com

来源: ByteByteGo(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T15:30:41.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

ByteByteGo 发布长文,讲解如何在大语言模型不明显变笨的前提下缩小模型体积。文章以 70B 参数模型约 140 GB、消费级显卡仅 24-48 GB 显存的矛盾为切入点...

ByteByteGo(RSS)2026-09-01T15:30:41.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。