蒸馏预训练:数据、上下文学习与 Test-Time Scaling 的现代视角!
简介
蒸馏预训练显著提升大模型的Test-Time Scaling能力和生成多样性,但会损害上下文学习能力,特别是归纳头建模能力。研究表明,这种权衡源于蒸馏对不同熵任务的不同影响机制。研究提出了token routing等改进策略,并建议选择性能更强的教师模型(如RL微调模型)。在数据受限场景下,蒸馏预训练提供了一种高效利用现有数据的途径,但需在多样性与上下文学习能力间做出权衡。
- 论文题目:Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling
- arXiv:2509.01649
- 单位:FAIR at Meta & CMU

论文速读
- 研究背景:在过去一年,蒸馏在 LLM 预训练阶段重新受到重视,比如 Llama-3.2 和 Gemma 系列模型。尽管蒸馏已被证明能够提升统计建模效果,但其对现代 LLM 的关键新范式(如 Test-Time Scaling 和上下文学习)的影响仍缺乏深入研究。
- 研究方法:本工作做出了 3 个主要贡献:
- 首先,我们表明,采用蒸馏进行预训练所得到的模型在 Test-Time Scaling 方面表现出显著更优的性能。
- 其次,我们发现这种优势伴随着一个权衡:蒸馏会损害上下文学习能力,尤其是通过归纳头建模的上下文学习。
- 第三,为揭示这些现象的本质,我们在一个二元语法模型的 sandbox 环境中研究了蒸馏预训练,这有助于我们隔离出观察结果背后的共同主因。
最后,基于这些洞见,我们对预训练的各种设计选择提供了启示,有望帮助从业者在未来的工作中做出更优决策。
Background
近年来,蒸馏在 LLM 领域重新兴起,不仅应用于后训练阶段,更在预训练阶段也得到广泛应用。尽管其作用日益重要,现代 LLM 预训练中使用 soft label 的蒸馏科学仍未被深入探索。
Gemma-3 和 Llama-3.2 模型在标准基准上展现出明显的实证优势,这些优势源于蒸馏预训练。然而,这些模型通常采用远超学生模型数据量的教师模型进行训练。这引发了一个根本性问题:蒸馏带来的提升究竟是额外教师数据的结果,还是反映了超越单纯数据暴露的独特优势?当面临数据瓶颈时,蒸馏是否仍能持续带来益处?
这篇论文揭示了蒸馏预训练(Distill Pre-Training,DPT)相关的关键权衡。本文贡献如下:
- Test-Time Scaling:我们表明,蒸馏预训练生成的模型在测试时缩放能力显著更强,通常在数据量达到两倍时仍能与标准预训练相媲美。
- 上下文学习的权衡:我们发现,这些收益是有代价的,因为蒸馏会损害上下文学习,特别是会削弱归纳头。
- 二元语法分析:我们分离出驱动 Test-Time Scaling 改进的共同机制,该机制同时也会损害上下文学习。
- 实践要点:我们将这些 insights 转化为改进蒸馏预训练的具体设计选择,包括针对蒸馏的数据监管、教师模型选择等。
一直在更新,更多的大模型学习和面试资料已经上传带到CSDN的官方了,有需要的朋友可以扫描下方二维码免费领取【保证100%免费】👇👇

什么是「蒸馏预训练」
对于一个文本序列 ,交叉熵损失函数为 ℓ,LLM 的 next token prediction 表示为 σ,有两种 label:
- :要预测的下一个 token
- :来自 teacher model 的预测概率分布,也就是 soft label
预训练蒸馏的目标函数是:

其中 。
无需额外数据:蒸馏是否仍能提升性能?
现在预训练的语言模型,相较于从零开始训练,明显受益于蒸馏。但这些模型通常使用在远多于学生模型最终所用的数据量上训练的教师模型,这引发了一个未解答的问题:蒸馏带来的提升仅仅是由于教师模型拥有额外的数据吗?还是说蒸馏本身提供了超越单纯通过教师看到更多数据的独特优势?
本节通过一个“IsoData 蒸馏”来回答上述问题:首先在 1T token 上训练一个 8B 参数的 teacher model,然后在相同的 1T token 上训练 1B 参数的 student model,设计有蒸馏和无蒸馏的两种情况,以观察当两者看到相同数据时,蒸馏是否仍然有效。

我们发现,即使训练数据量与教师模型相同(1T 个 token),蒸馏依然普遍带来收益。
即使在数据受限的情况下,蒸馏预训练仍然普遍有益,即使学生模型所见数据量与教师模型相同。
从现代视角审视的蒸馏预训练:上下文学习和 Test-Time Scaling
生成多样化解决路径的能力对于诸如推理时的 Test-Time Scaling 和搜索等技能至关重要,但更重要的是,他还能通过 RLVR 实现更好的 post-training。同样,上下文学习(指 model 从推理时的 prompt 中学习和适应)也很重要。
本节考察「蒸馏预训练」如何塑造当前 LLM 前沿的两项关键能力:Test-Time Scaling 的多样性(以 pass@k 表示)和上下文学习(ICL)。通过一系列受控实验,我们分离了蒸馏的影响,并对这些维度进行了对比分析。
蒸馏会损害 ICL 能力
之前有工作开创性地将归纳头(induction heads)引入到当前 LLM 的上下文学习机制中,认为这是实现 ICL 的关键。归纳头可以帮助模型从前文中复制部分 tokens 到输出序列中,这种复制能力对于需要模型关注并重用上下文信息的任务至关重要。
为了评估模型从上下文中复制信息的能力——这是归纳头的核心特征,也是上下文学习的关键机制,作者设计了几个实验进行观察。

我们观察到一种一致的模式:随着训练 token 数量的增加,蒸馏相对于标准预训练模型的相对优势持续减弱。
为什么蒸馏会损害上下文学习?对于具有确定性输出的输入——例如“2+3=?”——一个完美教师的软标签会退化为与真实值中已存在的相同独热、低熵标签。此时并无额外的学习信号。更糟糕的是,真实教师并不完美:他们的预测常常会为干扰项分配非零概率,从而微妙地向本应清晰无歧义的目标注入噪声。
归纳任务基于低熵映射构建,要求模型从序列较早位置复制特定 token。对于这类情况,蒸馏无法提供帮助——最多只能匹配硬标签。更糟糕的是,蒸馏会通过弱化监督信号,反而阻碍此类复制任务的学习。
蒸馏有助于多样性
我们使用 Llama-3.1-8B 基础模型作为教师,在 1250 亿个 token 上训练 10 亿参数的模型,分别在有和无蒸馏的情况下进行训练。
我们在推理和编码基准上评估模型,通过 pass@k 指标来衡量他们在 Test-Time Scaling 时生成的多样性。

- 蒸馏预训练实现了更优的 Test-Time Scaling 效果。蒸馏预训练能够生成覆盖范围更广、生成多样性更高的模型。
- 更高的基础模型多样性 -> 后训练优势。
- 蒸馏如何促进多样性?当提示词允许存在多个合理延续时(例如“我在……工作”),真实值数据仅提供一个答案(如“医院”),而教师模型则会将概率质量分布在多个有效完成项上(如“医院”、“健身房”、“咖啡馆”)。蒸馏过程使学生模型接触到这种更丰富的信号,这直观地解释了为何它能提升模型在推理时生成内容的多样性。
实践指南
Token 路由:缓解上下文学习中的性能下降
前面的实验我们看到,与标准预训练模型相比,蒸馏在上下文学习(ICL)任务上的表现较差——尤其是当教师模型和学生模型使用相同数量的数据进行训练时。回想一下,这是因为归纳任务基于低熵映射,而蒸馏在此类任务中并无帮助。
为缓解此问题,我们提出一种简单而有效的策略:token 路由。在蒸馏预训练过程中,损失函数包含两项——一项是与真实值标签相关的损失,另一项是与教师模型标签相关的蒸馏损失项。与其对所有 token 均应用教师标签的蒸馏损失,我们根据教师模型输出的熵动态调整监督信号。具体而言,对于一个输入序列,我们首先计算教师模型对该序列的软标签。随后,我们舍弃教师标签中熵最低的 x% 个位置的蒸馏损失项——在此处退回到仅使用真实值标签的标准硬标签监督。

我们展示了对 x = 15% 个 token 进行路由的结果。在三个任务中的两个任务——Needle in a Haystack 和 Counterfactual Context-Based QA 中,token 路由相较于原始蒸馏预训练带来了显著的性能提升,部分缩小了与标准预训练之间的性能差距。而在基于上下文的 QA 任务中,并未预期有性能提升,因为原始蒸馏的表现优于标准预训练。
尽管尚属初步,但这表明了基于 token 的筛选能够使蒸馏更好地适应现代以大语言模型为中心的目标,例如上下文学习。我们希望我们的工作能激发未来研究,推动开发更精细的策略。
NTP 与 MTP 与蒸馏:哪种方法能产生更高的多样性?
之前的实验展示了,蒸馏能够生成特别适合 Test-Time Scaling 的模型——这主要归因于其更丰富的生成多样性。与此同时,近期关于多 token 预测(MTP)的研究也作为训练内在多样化模型的一种有前景的方法涌现出来。这自然引发了一个实践者的问题:在两者之间进行选择时,应投资于 MTP 还是蒸馏?
为回答这个问题,我们比较了 1B 模型的三种预训练策略:
- (1) 标准的下一个 token 预测预训练(NTP);
- (2) MTP;
- (3) 从一个在与学生模型相同语料库上训练了 1 万亿 token 的 80 亿参数教师模型中进行蒸馏。
我们绘制了三种预训练选择下 pass@1 与 pass@16 的关系曲线。我们观察到,蒸馏预训练的曲线位于 MTP 和 NTP 曲线之上。这表明,对于任何合理的 pass@1,蒸馏模型相较于多 token 预训练展现出更高的 pass@16(on GSM8k and MBPP) 或相近的 pass@16(on MATH)。

基础模型与强化学习模型:谁更能胜任教师角色?
我们在使用教师模型进行知识蒸馏时遇到的一个普遍问题是——应该使用教师模型的哪个版本:基础版本、指令微调版本,还是强化学习训练版本?
我们通过训练 1B 规模的学生模型来实证地解答这一谜题,这些学生模型分别从 3 个版本的 8B 教师模型中进行蒸馏:基础版 Llama-3.1-8B、其指令微调版本,以及针对推理优化的强化学习训练变体。

结果表明,指令微调版和强化学习训练版教师模型的表现全面优于其他版本。特别是,从强化学习训练教师模型蒸馏出的学生模型不仅在推理和编码基准上表现更优,还在 HellaSwag 和 TQA 等通用语言模型化任务上也表现出色。
Top-k 采样蒸馏
与其使用教师模型在整个词表上的软分布,一种常见做法 (Gemma et al., 2025) 是基于教师模型原始输出分布,为每个 token 采样 k 个 Logit,然后对采样的 Logit 权重进行重新归一化,得到稀疏标签(未采样的 Logit 设为 0)。这降低了蒸馏的开销。在本节中,我们试图回答此处 k 的选择是否(如果有的话)会对下游性能产生影响。值得注意的是,k = 1 的情况有趣地对应于使用教师模型生成的“token 级别合成数据”的标准预训练。

从结果中看到两个明显的趋势:
- 即使是 top-k = 1 也优于标准预训练,这可能是由于使用了合成 token 以及教师模型过滤掉了真实值中的异常值;
- 使用 k ∈ 128, 256, 1024, All 比使用 top-k = 1 表现更好,因为软标签分布的优势开始显现。
然而,没有一致的趋势表明除 k = 1 外的哪个k 表现最佳。
结论
蒸馏预训练在提升模型多样性和测试时扩展能力方面具有显著优势,但会以牺牲上下文学习能力为代价。这一现象源于蒸馏对高熵和低熵任务的不同影响机制。基于这些发现,研究提出了多项实践建议,包括动态调整蒸馏损失权重(token routing)和选择性能更强的教师模型(如 RL 微调模型)。这些发现为未来LLM预训练的设计提供了重要指导,尤其是在数据受限的场景下。
意义
随着 LLM 面临数据瓶颈,蒸馏预训练提供了一种高效利用现有数据的途径。同时,研究结果强调了在模型设计中需权衡多样性与上下文学习能力,为后续研究(如多令牌预测与蒸馏的结合)奠定了基础。
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
一直在更新,更多的大模型学习和面试资料已经上传带到CSDN的官方了,有需要的朋友可以扫描下方二维码免费领取【保证100%免费】👇👇

01.大模型风口已至:月薪30K+的AI岗正在批量诞生

2025年大模型应用呈现爆发式增长,根据工信部最新数据:
国内大模型相关岗位缺口达47万
初级工程师平均薪资28K(数据来源:BOSS直聘报告)
70%企业存在"能用模型不会调优"的痛点
真实案例:某二本机械专业学员,通过4个月系统学习,成功拿到某AI医疗公司大模型优化岗offer,薪资直接翻3倍!
02.大模型 AI 学习和面试资料
1️⃣ 提示词工程:把ChatGPT从玩具变成生产工具
2️⃣ RAG系统:让大模型精准输出行业知识
3️⃣ 智能体开发:用AutoGPT打造24小时数字员工
📦熬了三个大夜整理的《AI进化工具包》送你:
✔️ 大厂内部LLM落地手册(含58个真实案例)
✔️ 提示词设计模板库(覆盖12大应用场景)
✔️ 私藏学习路径图(0基础到项目实战仅需90天)






第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
- 硬件选型
- 带你了解全球大模型
- 使用国产大模型服务
- 搭建 OpenAI 代理
- 热身:基于阿里云 PAI 部署 Stable Diffusion
- 在本地计算机运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署大模型
- 案例:如何优雅地在阿里云私有部署开源大模型
- 部署一套开源 LLM 项目
- 内容安全
- 互联网信息服务算法备案
- …
学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。
如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐
所有评论(0)