收录微调场景下模型缩放、数据缩放、参数高效微调(LoRA / Prompt Tuning / rsLoRA)等核心论文的中文翻译,涵盖原始公式与推导
📄 5 篇核心论文 + 4 篇相关论文 | 数学推导 | 中文精译When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method
arXiv: 2402.17193 · 2024摘要
虽然大语言模型(LLM)通常通过微调来释放其在下游应用中的能力,但我们对不同微调方法的归纳偏置(尤其是缩放特性)的理解仍然有限。为填补这一空白,我们进行了系统的实验,研究不同缩放因子(包括 LLM 模型规模、预训练数据规模、新增微调参数规模和微调数据规模)是否以及如何影响微调性能。我们考虑两类微调——全模型微调(FMT) 与 参数高效微调(PET,包括 Prompt Tuning 和 LoRA),并在数据受限场景(LLM 模型规模远超微调数据规模)探索它们的缩放行为。
基于两套从 1B 到 16B 的预训练双语 LLM,以及在双语机器翻译和多语言摘要基准上的实验,我们发现:1) LLM 微调在微调数据规模与每个其它缩放因子之间遵循基于幂律的乘法联合缩放定律;2) LLM 微调从模型缩放中获益多于预训练数据缩放,而 PET 参数缩放普遍无效;3) 最优微调方法高度依赖任务与微调数据量。我们希望这些发现能为理解、选择和开发 LLM 微调方法提供启示。
原文摘要(英文参考)
While large language models (LLMs) often adopt finetuning to unlock their capabilities for downstream applications, our understanding on the inductive biases (especially the scaling properties) of different finetuning methods is still limited... we find that 1) LLM finetuning follows a power-based multiplicative joint scaling law between finetuning data size and each other scaling factor; 2) LLM finetuning benefits more from LLM model scaling than pretraining data scaling, and PET parameter scaling is generally ineffective; and 3) the optimal finetuning method is highly task- and finetuning data-dependent.
利用并迁移海量预训练模型中的知识用于下游应用,已成为近年来各领域成功背后的标准范式(Devlin et al. 2019; Lewis et al. 2020; Raffel et al. 2020)。先进的大语言模型(如 GPT-4、PaLM 2)常常展现出涌现能力,并支持在上文学习中仅用几个演示样本即可完成复杂的推理与生成任务(Wei et al. 2022)。尽管如此,LLM 微调仍然是解锁创造性任务、针对性下游应用新能力所必需的、并被广泛采用的步骤。
预训练缩放定律(Kaplan 2020, Chinchilla 2022)已得到充分研究,但微调阶段的缩放规律几乎没有被系统探索过。本研究聚焦于数据受限场景(data-limited regime)——微调数据量远小于 LLM 模型规模,这更符合当前 LLM 时代的实际情况。
其中:X 为任意缩放因子(模型规模、预训练数据量、PET 参数大小等);D_f 为微调数据量;A, α, β, E 为待拟合的任务特定参数;L̂ 为目标任务的损失。
该公式表达微调损失与模型因子 X 和微调数据量 D_f 之间的乘法联合关系——两者缺一不可、交互作用而非独立叠加。这与预训练缩放定律的加法形式(L(N,D) = L∞ + A/Nα + B/Dβ)形成鲜明对比,意味着在微调场景下模型能力与数据量是相互耦合的。
给定固定微调任务,微调损失可分解为:
当引入其它缩放因子 X 时,假设 X 的作用是在固定 D_f 的基础上乘性地降低不可约损失,即 f(X) ∝ X-α,从而得到联合乘法形式。
| 任务 | 语言对 | 训练数据 | 评估指标 |
|---|---|---|---|
| WMT14 英德翻译 | En → De | up to 20M | BLEU ↑ |
| WMT19 英中翻译 | En → Zh | up to 20M | BLEU ↑ |
| MLSum 摘要 | De/Es/Fr → Summary | up to 20M | ROUGE ↑ |
注:翻译任务用 BLEU、摘要任务用 ROUGE 是领域标准——BLEU 以精确率衡量译文流畅度,ROUGE 以召回率衡量摘要对关键信息的覆盖度,二者分别对应机器翻译与摘要的信息压缩本质。
对 En-De 翻译任务,拟合参数如下:
乘法联合公式在不同任务、不同微调数据量下均得到验证——不同 D_f 的曲线族遵循相同的幂律形状,在 log-log 坐标系下损失面呈现平坦平面。
本研究首次系统建立了微调场景的乘法联合缩放定律,为理解、选择与开发 LLM 微调方法提供了可预测的框架。未来方向包括:涌现能力在微调中的缩放、多任务联合缩放、MoE + 微调、在线微调、指令微调(RLHF/DPO)的缩放特性研究等。
Scaling Laws for Transfer
arXiv: 2102.01293 · 2021摘要
我们在无监督、微调设置下研究分布间迁移学习的经验缩放定律。当我们在固定大小的数据集上从头训练越来越大的神经网络时,它们最终会数据受限并停止提升性能(交叉熵损失)。当我们在大型语言数据集上预训练的模型上做同样的事时,性能增益的斜率只是减小而不会归零。
我们通过确定一个同尺寸的 Transformer 从头训练需要多少数据才能达到同样的损失,来计算从预训练"迁移"的有效数据。换言之,我们在保持其它一切固定的前提下关注数据单元。我们发现:在低数据区,有效迁移数据很好地遵循参数量与微调数据集大小的幂律。预训练实质上是倍增了微调数据集大小。迁移与整体性能一样,在参数、数据和计算方面都可预测地缩放。
原文摘要(英文参考)
We study empirical scaling laws for transfer learning between distributions in an unsupervised, fine-tuning setting... We calculate the effective data "transferred" from pre-training by determining how much data a transformer of the same size would have required to achieve the same loss when training from scratch... We find that pre-training effectively multiplies the fine-tuning dataset size.
这里 DT 是"等效从头训练数据",NC 为临界参数量,αN 为迁移幂律指数。
整体性能(损失)在参数、数据和计算上都遵循可预测的缩放规律。
本研究的补充工作分析了数据并行训练的效率。理想线性扩展假设 N 块 GPU 带来 N 倍加速;但实验发现当 batch size 超过临界值 Ncrit 后,大学习率导致的梯度噪声不足反而损害泛化能力,实际加速比低于线性。实测拟合:
关键洞察:更多 GPU(数据并行)≠ 更多数据。当 GPU 过多(batch size 太大)时收益急剧递减。幂律指数 -0.3 来自多组扩展实验的平均斜率。
迁移(transfer)与整体性能一样,在参数、数据、计算三方面都遵循可预测的缩放定律。预训练实际上"倍增"了微调数据集大小,为理解大模型为何能成为少样本学习者(few-shot learners)提供了理论依据。
LoRA: Low-Rank Adaptation of Large Language Models
arXiv: 2106.09685 · 2021摘要
自然语言处理的一个重要范式是:在通用领域数据上进行大规模预训练,再适配到特定任务或领域。随着我们预训练的模型越来越大,全量微调(重训所有模型参数)变得不再可行。以 GPT-3 175B 为例——为每个独立实例部署一份 175B 参数的微调模型,成本高得令人望而却步。
我们提出 LoRA(Low-Rank Adaptation,低秩自适应):冻结预训练模型权重,并在 Transformer 架构的每一层注入可训练的低秩分解矩阵,从而大幅减少下游任务的可训练参数。与使用 Adam 微调 GPT-3 175B 相比,LoRA 可将可训练参数减少 10000 倍、GPU 内存需求降低 3 倍。尽管参数更少、训练吞吐更高、且不像 adapter 那样引入额外推理延迟,LoRA 在 RoBERTa、DeBERTa、GPT-2 和 GPT-3 上的模型质量仍与微调持平甚至更好。我们还对语言模型适配中的秩缺陷进行了实证研究,揭示了 LoRA 的有效性。
原文摘要(英文参考)
We propose Low-Rank Adaptation, or LoRA, which freezes the pre-trained model weights and injects trainable rank decomposition matrices into each layer of the Transformer architecture, greatly reducing the number of trainable parameters for downstream tasks. Compared to GPT-3 175B fine-tuned with Adam, LoRA can reduce the number of trainable parameters by 10,000 times and the GPU memory requirement by 3 times.
许多 NLP 应用依赖将一个大型预训练语言模型适配到多个下游任务。这种适配通常通过微调完成——更新预训练模型的所有参数。微调的主要缺点是:新模型包含与原模型一样多的参数。随着模型快速增大,这在 GPT-2/RoBERTa 时只是"不便",到 GPT-3(1750 亿参数)时已变成关键部署挑战。
已有的缓解做法(只适配部分参数、学习外部模块等)虽然减少了存储,但常引入推理延迟(通过加深网络)或缩短可用序列长度(如 Prefix Tuning、Prompt Tuning),且往往无法匹配全量微调的效果,形成效率与质量之间的权衡。
受 Li et al. 2018a 和 Aghajanyan et al. 2020 启发(他们证明学习到的过参数化模型其实存在于低内在维度),我们假设模型适配过程中的权重变化也具有低"内在秩"。因此提出 LoRA:冻结预训练权重,只优化秩分解矩阵。
其中 W0 为冻结的预训练权重(Rd×k),B∈Rd×r 与 A∈Rr×k 为低秩矩阵,r ≪ min(d,k) 为秩。A 用高斯随机初始化,B 初始化为零(保证训练开始时 BA=0)。
以 GPT-3 175B 为例,即使全秩 d 高达 12288,极低的秩(r = 1 或 2)就足够,使 LoRA 既省存储又省算力。
给定预训练自回归语言模型 PΦ(y|x)(参数为 Φ),适配到下游任务,全量微调目标为最大化条件语言建模目标:
全量微调的缺点是每个下游任务学习不同的 ΔΦ,维度 |ΔΦ| 等于 |Φ0|。LoRA 采用参数高效方式,将增量编码为更小参数集 Θ(|Θ| ≪ |Φ0|),变为对 Θ 的优化:
当预训练模型是 GPT-3 175B 时,可训练参数 |Θ| 可低至 |Φ0| 的 0.01%。
二者都常无法匹配全量微调基线。LoRA 通过注入低秩矩阵(不加深网络、不占序列长度、可合并部署)克服了这些局限。
在 RoBERTa、DeBERTa、GPT-2、GPT-3 上,LoRA 以更少的可训练参数、更高的训练吞吐、无额外推理延迟,达到与全量微调持平甚至更好的模型质量。实证调查还发现模型适配存在秩缺陷——所需的内在秩远低于表面维度,这正是 LoRA 高效的原因。
The Power of Scale for Parameter-Efficient Prompt Tuning
arXiv: 2104.08691 · 2021摘要
本文探索 "Prompt Tuning(提示调优)"——一种简单而有效的机制,用于学习"软提示(soft prompts)"来调节冻结的语言模型,以执行特定下游任务。与 GPT-3 使用的离散文本提示不同,软提示通过反向传播学习,可调优以整合任意数量标注样本的信号。我们的端到端学习方法以更大优势超越 GPT-3 的少样本学习。
更值得注意的是,通过使用 T5 进行模型规模的消融实验,我们证明 Prompt Tuning 随规模增大而更有竞争力:当模型参数超过数十亿时,我们的方法"缩小差距",匹配了模型调优(调节所有权重)的强性能。这一发现尤其相关,因为大型模型成本高昂且难以共享与部署,而能复用一个冻结模型来完成多个下游任务可显著缓解这一负担。我们的方法可视为 Li & Liang 2021 最近提出的 "prefix tuning" 的简化。最后,我们证明用软提示调节冻结模型在领域迁移鲁棒性与高效"提示集成(prompt ensembling)"方面有益。
原文摘要(英文参考)
In this work, we explore "prompt tuning," a simple yet effective mechanism for learning "soft prompts" to condition frozen language models to perform specific downstream tasks... we show that prompt tuning becomes more competitive with scale: as models exceed billions of parameters, our method "closes the gap" and matches the strong performance of model tuning.
将可学习的软提示 P 与任务输入 embedding X 拼接,送入冻结的 LLM。整个预训练模型 W0 完全冻结,只训练软提示向量。
| 方法 | 软提示位置 | 参数位置 |
|---|---|---|
| Prompt Tuning | 仅输入层之前 | 仅输入 embedding 层 |
| Prefix Tuning(Li & Liang 2021) | 每层注意力之前都加 | 所有 Transformer 层 |
使用 T5 进行模型规模消融,发现 Prompt Tuning 的竞争力随模型规模增大而显著提升:
这正是"参数高效调优(PEFT)在大模型时代可行"的关键论据,也是后续 FLAN、LoRA 等研究的重要基础。
A Rank Stabilization Scaling Factor for Fine-Tuning with LoRA
arXiv: 2312.03732 · 2023摘要
随着大语言模型(LLM)日益计算与内存密集,参数高效微调(PEFT)已成为微调 LLM 的常用策略。流行的 PEFT 方法是 低秩适配器(LoRA),它在选定的层中添加可训练的低秩"适配器"。每个适配器由一个低秩矩阵乘积构成,并乘上一个依赖秩的缩放因子。
这个缩放因子(将适配器除以一个秩的因子)会导致高秩适配器的学习变慢、性能受阻。因此,实践中 LoRA 通常被限制在非常低的秩。本文研究缩放因子对学习过程的影响,并证明 LoRA 适配器应除以秩的平方根。我们将采用正确缩放因子的方法称为 秩稳定化 LoRA(rsLoRA),它轻松提供了微调的计算/性能权衡——用更大的秩在训练时换取更好的微调性能,且推理计算成本不变。
原文摘要(英文参考)
This scaling factor, which divides adapters by a factor of the rank, results in slowed learning and stunted performance for LoRA with higher-rank adapters... we study the impact of the scaling factor on the learning process and prove that LoRA adapters should be divided by a factor of the square root of the rank.
LoRA 将一个线性子模块的参数更新为低秩形式。给定预训练权重 W ∈ Rd2×d1,LoRA 注入两个低秩矩阵 A ∈ Rr×d1 与 B ∈ Rd2×r,并用依赖秩的缩放因子 γr 收缩:
其中 B 初始化为零(B=0d2×r),γr ∈ R+ 为缩放因子。
理论分析证明:LoRA 适配器应除以秩的平方根(√r),而不是秩(r)。原因在于 LoRA 训练中 ΔW 的谱范数与 √r 成正比,用 α/√r 可使缩放因子与秩解耦,让不同秩的 LoRA 有一致的有效学习率。
| 秩 r | α/r(标准 LoRA) | α/√r(rsLoRA) |
|---|---|---|
| 4 | 0.250α | 0.500α |
| 16 | 0.063α | 0.250α |
| 64 | 0.016α | 0.125α |
| 256 | 0.004α | 0.063α |
实验验证了 rsLoRA 相比标准 LoRA 在性能与学习稳定性上的优势。rsLoRA 使得更大的秩能够真正提升性能,从而提供了清晰的微调计算/性能权衡。因为适配器形式与标准 LoRA 完全一致,rsLoRA 对任何推理成本都没有额外影响。这解释了为何此前的 LoRA Scaling 规律(PLoRA(r) ∝ r0.2 趋于饱和)在 rsLoRA 下变为持续提升(∝ log r)。
这也与 Zhang et al. 2024 的观测一致:LoRA 的参数缩放存在上限,而 rsLoRA 修正后能持续提升。
Beyond the Imitation Game: Quantifying and Extracting Crucial Behavior in Language Models
arXiv: 2206.04615 · 2022BIG-Bench(Beyond the Imitation Game Benchmark) 是一个大规模、协作构建的多任务基准,用于评估大语言模型的"关键行为"——尤其是那些模仿游戏(imitation game)之外的、需要真正能力的行为。它由 100 多个机构的研究者共同提出,包含 200+ 个任务。
Wei et al. 2022 的涌现能力论文正是基于 BIG-Bench 来定义和测量"涌现"——他们在 BIG-Bench 任务上观察到,随模型规模增大,某些任务性能从随机水平突然跃升到显著高于随机,形成量变到质变的跳跃。这种在特定规模后"从无到有"的现象即为涌现能力。
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
arXiv: 2201.11903 · 2022链式思维(Chain-of-Thought, CoT) 最早由 Jason Wei 等人在本文提出。核心方法是:不给模型一个直接的问题→答案提示,而是让模型展示中间推理步骤,逐步推导出最终答案。
Finetuned Language Models Are Zero-Shot Learners
arXiv: 2109.01652 · 2021指令微调(Instruction Tuning) 是本文(FLAN)提出的核心方法:用"指令格式"的数据对预训练 LLM 进行微调,让模型学会理解自然语言指令。
| 数据格式 | 示例 |
|---|---|
| 预训练(无指令) | "今天天气很好,我想去散步。" |
| 指令微调(Instruction Tuning) | "请将以下句子翻译成法语:我爱学习。 → J'aime apprendre." |
PaLM: Scaling Language Modeling with Pathways
arXiv: 2204.02311 · 2022PaLM(Pathways Language Model) 是 Google 在 2022 年发布的巨型语言模型,最重要的贡献是首次展示了大模型 + 链式思维(CoT)提示的强大组合,并用 Pathways 系统实现了数千个 TPU 上的高效并行训练。
| 属性 | 数值 |
|---|---|
| 参数量 | 5400 亿(540B) |
| 训练数据 | 7800 亿 tokens(C4 + 社交媒体 + 网页 + Wikipedia + 书籍) |
| 架构 | 标准 Transformer,基于 Pathways 训练 |
| 推理 | CoT 提示下在数学、逻辑、多步推理任务大幅跃升 |
References Cited in the Emergent Abilities Paper on Emergence
来源:arXiv: 2206.07682Wei et al. 2022 在引言中追溯"涌现(emergence)"作为跨学科思想的历史。这些引用横跨物理学、生物学、计算机科学与经济学,共同支撑了对涌现的定义——当系统中的定量变化导致行为上的定性变化时,即为涌现。以下为逐篇译注。
译注
Philip W. Anderson《More Is Different: Broken Symmetry and the Nature of the Hierarchical Structure of Science》,《Science》177(4047): 393-396(1972)。Anderson 是 1977 年诺贝尔物理学奖得主。这是凝结态物理的奠基性短文,提出"More is different(多即不同)"——随系统规模变大,会涌现出小系统不存在的新行为与层级结构,无法仅通过缩减小系统的物理规律预测。这正是"涌现"定义的核心哲学根基(量变引发质变)。
获取:Science 期刊付费文章,非 arXiv 开放获取。
译注
Hwang, Iwasa, Kawasaki, Keimer, Nagaosa, Tokura《Emergent Phenomena at Oxide Interfaces》,《Nature Materials》11(2): 103-113(2012)。在材料科学中,氧化物界面会涌现出单一材料不具备的新电子性质(如超导、磁性、铁电)。引用它说明"涌现"在物理系统中是被广泛验证的真实现象。
获取:Nature 期刊付费文章,非 arXiv 开放获取。
译注
Stephanie Forrest《Emergent Computation: Self-Organizing, Collective, and Cooperative Phenomena...》,《Physica D》42: 1-11(1990)。这是"涌现计算(emergent computation)"的经典之作,研究了自组织、集体与协同现象如何从大量简单部件的局部相互作用中自发产生,为人工生命与集群智能奠定概念基础。
获取:Physica D 期刊付费文章,非 arXiv 开放获取。
译注
Antonella Corradini 与 Timothy O'Connor(主编)《Emergence in Science and Philosophy》(Routledge,卷6,2010)。跨学科文集,梳理了"涌现"在科学(物理、生物、心智)与哲学(本体论、因果性)中的多重含义与争论,包括强/弱涌现、随附性(supervenience)等议题。
获取:Routledge 学术书籍,付费。
译注
David A. Harper 与 Paul A. Lewis《New Perspectives on Emergence in Economics》(Routledge,2012)。讨论涌现在经济复杂系统(市场、制度、创新网络)中的应用——大量个体的微观局部行为如何自发涌现出宏观层面不可还原为个体的秩序结构。
获取:Routledge 学术书籍,付费。
译注
Jacob Steinhardt《On the Relationship between Emergence and Scale》(手稿/未发表,2022)。Wei et al. 2022 直接改编自本文的定义:当系统中的定量变化导致行为上的定性变化时,即为涌现,并将涌现与"规模(scale)"联系起来——这正是用训练计算量、模型参数量衡量模型规模涌现的理论出发点。
获取:未发表手稿,公开渠道不可获得。
译注
Scott Miller, Jethran Guinness, Alex Zamanian《Name Tagging with Word Clusters and Discriminative Training》,《NAACL 2004》。早期 NLP 工作,提出随模型/特征规模增大,命名实体识别等能力出现非线性质变提升。Wei et al. 2022 借此说明"涌现能力"思想可追溯到更早的 NLP 研究。
获取:✅ 已从 ACL Anthology 下载(83KB PDF)。