Aioga
AI资讯 / 行业动态
返回 AI资讯

Dwarkesh Patel 研究:预训练进步主要来自数据改进

Dwarkesh Patel:Podcast & Blog(RSS)Aioga 编辑团队2026-09-08T16:10:16.000Z热度 72

Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0...

行业动态Dwarkesh Patel:Podcast & Blog(RSS)

今日 AI 情报摘要

Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x

算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。

中文正文 · AI 翻译

在过去几年里,我们看到的人工智能快速进展(:https://epoch.ai/gradient-updates/the-least-understood-driver-of-ai-progress )中,有多少来自数据的改进,有多少来自模型的改进?答案对前沿实验室的经济学以及未来进展的速度有重大影响。

我们在相对较小的规模上,特别是针对预训练,从2019年到2025年调查了这个问题。在每一年,都会发布一个新的公开模型配方,总结了当年公开已知的算法调整(例如,架构、优化器、初始化、学习率调度、超参数等的改进)。在这些年份,每年也都有新的公开数据集(通过更广泛的抓取以及新的策划/提取/过滤技术生成)。

我们在不同的训练计算规模(最多达1e19 FLOPs)下训练这些年份代表性的模型配方和数据集的组合。2:#footnote-2

显然,我们不能通过交叉熵损失在固定数据集上比较这些不同模型,因为我们正在改变它们训练的数据集。因此,我们改为通过OLMES衡量模型的最终能力(https://github.com/allenai/olmes eval)(该评估汇总了10个不同的较简单基准,大多为多项选择问答)。不幸的是,评估最终能力而不是预训练损失会给我们的结果带来一些噪声,正如您在下面的图表中看到的,尽管我们尝试通过运行多个随机种子来获得更清晰的界限。

我们发现,从2019年到2025年,在1e19 FLOPs的计算预算下,数据改进带来的计算效率提升比模型改进高3.24倍(数据提升12.0倍,模型提升3.7倍)。3:#footnote-3

这里有一个表格显示了我们训练的模型在我们测试的最终能力上,相对于2019年的数据+架构基线,在3.16e18 FLOPs下表现得有多好。4:#footnote-4

我们发现,数据和模型改进带来的提升大多是独立的,并且不互相影响(即,实现某些模型改进的收益并不需要特定的训练数据集,反之亦然)。使用线性模型,88%的OLMES分数方差可以由模型和数据改进的加性效应解释。

为了提供背景,让我们简要总结一下从2019年到2025年,数据端和模型端发生的变化。

在模型方面,我们从 GPT-2:http://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf 发展到 OLMo-2:https://arxiv.org/abs/2501.00656,包括优化器、位置编码、归一化、激活函数、初始化等方面的关键创新 5:#footnote-5。

在数据方面,我们从 2019 年的 OpenWebText 开始:http://huggingface.co/datasets/Skylion007/openwebtext,其中只包含来自 Reddit 并获得足够点赞的网页,然后进行了去重和过滤,因此总共大约有~90 亿个标记(这大部分就是 GPT-2 的训练数据)。到 2025 年,像 UltraFineWeb 的开源数据语料库:http://huggingface.co/datasets/openbmb/Ultra-FineWeb 不仅规模大得多(通过抓取整个互联网的数据),而且使用了更复杂的过滤方法(例如,通过训练分类器预测哪些数据在实践中会提高模型性能)。

对我们结果的一种天真的解读是,从2019到2024年(预训练时代)的AI大部分进步只是更好的数据工程(提取、整理等),而在此期间的模型工作则不那么重要。

但这种看法可能是错误的。模型改进的主要贡献不一定是计算效率——即用更少的FLOPs实现相同性能。而是首先使更大量的计算变得可用。随着参数数量、上下文长度、运行时间和集群规模的增加,各种问题很容易出现(梯度爆炸或消失、内存和带宽不足、训练变得不可行地缓慢)。大量模型研究的内容就是消除或推迟这些扩展的约束:https://www.beren.io/2026-08-23-Architecture-Research-as-Addressing-Constraints-to-Scaling/。许多最重要的创新,如MoEs、稀疏注意力变体、稳定性创新(归一化位置、初始化等)以及系统/内核级优化,如FlashAttention:https://arxiv.org/abs/2205.14135,都属于这一类别。

我们在这里研究的数据改进对于更大的模型可能影响不大。小型模型(比如我们训练的那些)从数据质量的提升中获得显著收益,因为它们的容量有限,因此你必须非常小心地选择输入内容。而大型模型有如此多的多余容量,以至于你可能只想尽可能多地输入数据,即使大部分是垃圾,通过随机梯度下降的魔力也能从噪声中分离出信号。如果你选择进行严格筛选,你将不得不进行几十轮训练,这在经验上会比拥有平均质量较低但数据集更大的情况表现更差:https://arxiv.org/pdf/2605.19407。事实上,一旦考虑到前沿模型在训练中相对于Chinchilla最优模型被过度训练了多达100倍,以最小化RL和部署时的推理计算,过度的数据策划甚至更有害。

一个类比可能是帆船和货轮的区别——货轮不一定跑得更快,但它可以运载成千上万吨的货物(类似于数百万亿的预训练数据token),并且不会被波涛汹涌的海面推翻(类似于在成千上万GPU上稳定训练)。

现在我们有了更大容量、更坚固的货轮,我们不必担心到底装什么——我们可以把所有哪怕是稍微可能有用的东西都装上去。而对于2019年的那些娇小脆弱的帆船,你必须非常谨慎,只携带最有价值的货物。

但在预训练进展的本质仅仅是向这艘船装载更多货物的程度上,我们是否快要没有货物可装了?这是关于数据壁垒的问题,也是关于合成数据在帮助我们跨越这一壁垒方面的效果问题。显然,各实验室正在广泛使用合成数据,而我们完全没有研究过它是否能够在不影响模型性能的前提下有效扩展数据语料库。如果增益有限,那么预训练进展的主要驱动力将停滞,因为我们无法生成更多的互联网数据,而且你对固定数据集合的整理能力也是有限的。需要明确的是,我们没有实际理由认为会这样。但考虑到数据在推动预训练进展中似乎非常重要,这似乎是一个至关重要的问题,值得研究。

Ryan Greenblatt 指出:https://www.dwarkesh.com/p/ryan-greenblatt 历史上预训练数据语料库的许多改进看起来就像自动化研究者通过实证测试就能完成的进展——例如,运行不同数据训练的消融实验,看看模型表现如何。因此,我们的结果完全兼容这样的观点,即自2019年以来推动预训练的数据进展如果在人工智能研发自动化时,可能会加速很多。

我们想澄清的是,单独预训练进展的加速或减慢并不是总体人工智能进展中最重要的问题,因为过去两年的许多突破都来自强化学习(RL)。

以下是我们认为非常有趣且值得回答的一些未来研究方向:

你可以在更大规模上进行这个实验,以观察数据改进或模型改进对规模的依赖性(因此在前沿领域影响更大)

对于预训练和后训练来说,高质量新数据的边际价值是多少,以最终能力为衡量标准?

我们想大致了解合成数据的效果有多好。一个具体的研究问题是:如果你拥有一个小型高质量数据语料库,通过合成数据生成来放大它相比于仅对它训练多个周期效果有多大:https://arxiv.org/pdf/2605.19407 ?

你可以通过实验室在数据经纪人、环境生成者等方面的支出,相对于他们在计算资源和研究人员上的支出来推测数据的隐含价值。

我们想要研究数据在推动人工智能进步中所起的作用。还有很多其他方法可以探究这个问题,有些方法可能比我们的方法更巧妙、更有信息量。即使我们的实验是在极小规模下进行的,我们也认为我们可能漏掉了一些东西——我们很想听听别人会如何研究这个问题,并理想情况下也希望看到他们的结果!

特别感谢 Charlie O’Neill:https://x.com/oneill_c?lang=en 提供了许多有益的讨论。

我们从零开始在这些不同的数据语料库上预训练这些模型配方,在不同的计算预算下,使用多组独立的随机种子6:#footnote-6。我们的计算预算是:1e17、3.16e17、1e18、3.16e18 和 1e19 FLOPs。计算核算的惯例是使用名义计算 C = 6ND(N = 非嵌入参数数,D = 数据的 token 数)。

在每个计算预算下,我们改变参数数量(从而改变训练的 token 数量),以确定每个训练配方 × 语料组合的计算最优比例。我们使用语料库上的保留损失来确定这个计算最优点。然后我们可以获得每个组合的下游性能的计算扩展曲线,从中最终提取我们的计算乘数。

我们在每次运行中都强制使用统一的分词器和上下文长度:GPT-2 BPE(tiktoken,词汇量 50,257)和 T=2048,批量 = 262,144 tokens。

我们的训练运行的最终能力高度依赖于超参数。显然,不可能扫描所有可能的超参数组合(超参数调优确实是一门精细的艺术)!我们尽量控制这个因素,并认为峰值学习率是最重要的超参数。

一些算法版本确实提供了峰值学习率的调优规格(作为其他相关变量的函数,例如模型大小、数据预算、批量大小等)。这些作为我们认为的最优学习率的良好先验。

我们首先在5个锚点上扫描学习率——3种不同的模型规模和2种不同的D/N比。我们确定这些锚点的最佳学习率,并拟合一个最佳学习率的参数形式。

对于除OLMo-2之外的所有模型配方,我们拟合一个通用的指数a和b,以及一个特定模型的lr₀。对于OLMo-2,我们根据模型配方使用规定的最佳学习率。我们之所以对OLMo-2这样做,是因为Ai2发布了小型模型梯度作为配方的一部分,这些梯度在我们正在研究的规模上指定了最佳超参数。我们还在3.16e18 FLOPs的计算最优点验证,发现我们的生产学习率在最佳范围内或接近最佳。

解释我们图表中的一些异常情况

正如预期的那样,我们观察到模型和数据轴上的计算效率总体上随时间增加。我们观察到的一些异常值:

NeoX在1e19时的表现比GPT-2差(尽管在1e17到3.16e18范围内它表现更好)。这可能源于OLMES评估中的噪声。我们还注意到,在FineWeb-Edu语料库的保留预训练损失上,NeoX表现优于GPT-2。

Pile的表现似乎比OpenWebText差得多。这并不令人意外,因为Pile的主要改进在于数据语料库的多样性,而非过滤。它包含一个由22个来源精心策划的混合,包括PubMed和arXiv论文、GitHub代码、法律意见、专利和议会记录。对于这些许多标记而言,转移到OLMES(即英文网页散文MCQ)的跨领域效果可能很小,因此导致计算效率较低。我们注意到,由于其规模较大,我们预计Pile在更大规模下最终应会比(真正小的)OpenWebText表现更好。

还值得注意的是,NeoX和Pile的计算乘数是通过外推获得的,这引入了进一步的潜在误差。

计算乘数以及它们的误差范围的方法

计算缩放曲线上的每个点都是基于多个独立初始化训练运行得出的。图上的误差范围是这些初始化的OLMES评估的标准差。

考虑某个参考模型或数据语料库在某个计算水平下的一定参考性能水平。

然后,我们通过找到候选模型或语料库的计算缩放曲线中首次达到该参考性能水平的最左端点,来计算计算倍增器。参考所需的计算量与候选所需计算量的比率就是候选的计算倍增器。

计算倍增器的误差条是通过对整个估计流程进行参数自助法(parametric bootstrap)得到的,表示的是1个标准差区间。

我们确实想强调的是,我们预计模型方案的计算倍增器的实际不确定性要高于误差条所显示的。这是因为我们超参数调优的范围有限所引入的额外不确定性,以及最终的能力或保留损失可能对峰值学习率、批量大小等具体选择非常敏感。

同样重要的是要注意,存在许多原因说明我们的消融实验未必完全捕捉到计算效率增益的全部范围。事实上,从2019年到2025年,我们观察到模型端的年均计算效率增益(CEG)为1.24x [1.19, 1.29],数据端为1.51x [1.45, 1.57]。联合测量时,我们观察到1.57x的年均CEG [1.49, 1.65] 7:#footnote-7。这确实远低于Anson Ho等人的平均估计值3x年均CEG:https://arxiv.org/abs/2403.05812,原因如下:

许多收益可能依赖于规模:https://arxiv.org/pdf/2511.21622,或者在较长的上下文中尤其重要,而我们目前操作的规模太小,无法实现许多收益。

例如,OLMo-2的层和QK范数,NeoX中的并行注意力+MLP模块

推理效率优化(例如 LLama-3 的 GQA:https://arxiv.org/abs/2305.13245,这是一个 KV 缓存优化)在我们的研究中并未显示为计算倍增器。我们也没有研究分词器的改进。

我们得到的计算倍增器对每年的模型方案或数据语料库的选择非常敏感。我们选择了我们认为具有代表性的模型方案或数据语料库。但我们绝不意味着穷尽地得出这些就是每年的最佳选择。

我们正在观察相对于OLMES基准(该基准结合了10种不同的相对简单的任务类型)的计算乘数,而不是在达到某个困惑度指标时的计算乘数。如果我们观察其他基准(比如专门针对编码或问题解决的基准),这些数字也会完全不同,这可能会奖励非常不同的数据工程方法。

我们还想指出,我们没有研究其他数据方面的改进,例如从新来源收集更多高质量数据、人工专家生成的数据、合成数据生成方法等。我们调查的大多数语料库都是对同一Common Crawl的整理(子集),而不是扩展可用的数据集。这显然是对有限库存的消耗——我们能够推动这一杠杆的空间是有限的。

增益独立于模型配方和数据语料

以下是我们为了确定增益与模型配方和数据语料的独立性而进行的调查。我们查看了3.16e18 FLOPs下OLMES得分的网格。对 OLMES得分=均值+模型效应+数据效应 进行线性回归得到的R平方为0.88,这意味着OLMES得分的88%方差可以通过模型和数据改进的加性效应来解释,只有约12%的方差归因于交互或高阶项及评估噪声。这表明复杂的模型-数据交互(即利用某些模型改进依赖于特定数据工程,反之亦然)相对较小。

Anson Ho等人:https://arxiv.org/abs/2403.05812 估计软件效率(在预训练中)每年提高3倍(95%置信区间:1.5倍至64倍)。正如Ho在这篇博客中提到的:https://epochai.substack.com/p/the-least-understood-driver-of-ai,“大多数软件进展实际上可能归因于数据质量的提升”以及“仅从少量与规模相关的算法变化的扩展中实现”。

我们使用C = 6ND名义惯例来计算计算量。

2019年的模型配方是GPT-2,2025年的模型配方是OLMo-2。2019年的数据语料是OpenWebText,2025年的数据语料是UltraFineWeb。

我们实现的GPT-3在Pile数据集上遇到了一些训练不稳定问题(梯度峰值)。

这些包括:优化器改进、预热 + 衰减调度、RoPE 替代学习绝对位置、RMSNorm + SwiGLU 门控 MLP、规范重排序、QK-规范、Z-loss 正则化以及更干净的初始化。

对于计算扩展图,我们每种情况至少使用 3 个随机种子。对于预算为 3.16e18 的模型配方和数据语料组合的 7x7 网格,我们每种情况只使用 1 个随机种子。

1.57 倍的同比乘数是使用从 2019 年模型和语料到 2025 年模型和语料的联合改进计算得出的,而不是 1.24 倍的模型端改进与 1.51 倍的数据端改进的乘积。

比较的指标本应是生成困惑度或类似指标,这也是比较预训练模型的常用方法。

情报判断

Aioga 编辑摘要

研究称,在最高1e19 FLOPs算力预算下,2019至2025年代表性模型配方与数据语料的组合实验显示,数据改进带来12.0倍算力效率提升,模型改进为3.7倍。

背景分析

研究按年度选取公开模型配方和数据语料,在不同训练算力规模下组合训练,并用OLMES评估终端能力;作者指出该指标含有噪声,并通过多次随机种子尝试获得更稳定的界限。

Aioga 观点

Aioga 判断:材料支持将数据改进视为该实验范围内更大的效率增益来源,但这项结论针对预训练和所测OLMES能力,不能直接外推到所有AI进展。

影响与后续

可能影响:若相关结果在更大规模或其他评测中保持,前沿实验室的算力投入与数据工程优先级可能需要重新权衡;但现有材料不足以证明数据改进将持续占优。 后续观察:需要关注更大算力预算、不同任务和评测下的复现结果,以及数据与模型改进是否仍主要呈独立贡献;当前材料仅报告至1e19 FLOPs的预训练实验。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: dwarkesh.com

来源: Dwarkesh Patel:Podcast & Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-08T16:10:16.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0...

Dwarkesh Patel:Podcast & Blog(RSS)2026-09-08T16:10:16.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。