📚 LLM 微调缩放定律 · 中文翻译合集

收录微调场景下模型缩放、数据缩放、参数高效微调(LoRA / Prompt Tuning / rsLoRA)等核心论文的中文翻译,涵盖原始公式与推导

📄 5 篇核心论文 + 4 篇相关论文 | 数学推导 | 中文精译

📋 论文目录

  1. Zhang et al. (2024) — 当缩放遇上 LLM 微调:数据、模型与微调方法的影响
  2. Hernandez et al. (2021) — 迁移学习的缩放定律
  3. Hu et al. (2021) — LoRA:大语言模型的低秩自适应
  4. Lester et al. (2021) — 参数高效提示调优的规模力量
  5. Kalajdzievski (2023) — 秩稳定化缩放因子:rsLoRA
  6. Srivastava et al. (2022) — BIG-Bench:超越模仿游戏的基准
  7. Wei et al. (2022) — 链式思维提示激发大模型推理
  8. Wei et al. (2021) — FLAN:微调语言模型成为零样本学习者
  9. Chowdhery et al. (2022) — PaLM:用 Pathways 扩展语言建模
论文 1

当缩放遇上 LLM 微调:数据、模型与微调方法的影响

When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method

Biao Zhang (Google DeepMind) · Zhongtao Liu (Google Research) · Colin Cherry · Orhan Firat

arXiv: 2402.17193 · 2024

摘要(中文)

摘要

虽然大语言模型(LLM)通常通过微调来释放其在下游应用中的能力,但我们对不同微调方法的归纳偏置(尤其是缩放特性)的理解仍然有限。为填补这一空白,我们进行了系统的实验,研究不同缩放因子(包括 LLM 模型规模、预训练数据规模、新增微调参数规模和微调数据规模)是否以及如何影响微调性能。我们考虑两类微调——全模型微调(FMT)参数高效微调(PET,包括 Prompt Tuning 和 LoRA),并在数据受限场景(LLM 模型规模远超微调数据规模)探索它们的缩放行为。

基于两套从 1B 到 16B 的预训练双语 LLM,以及在双语机器翻译和多语言摘要基准上的实验,我们发现:1) LLM 微调在微调数据规模与每个其它缩放因子之间遵循基于幂律的乘法联合缩放定律2) LLM 微调从模型缩放中获益多于预训练数据缩放,而 PET 参数缩放普遍无效;3) 最优微调方法高度依赖任务与微调数据量。我们希望这些发现能为理解、选择和开发 LLM 微调方法提供启示。

原文摘要(英文参考)

While large language models (LLMs) often adopt finetuning to unlock their capabilities for downstream applications, our understanding on the inductive biases (especially the scaling properties) of different finetuning methods is still limited... we find that 1) LLM finetuning follows a power-based multiplicative joint scaling law between finetuning data size and each other scaling factor; 2) LLM finetuning benefits more from LLM model scaling than pretraining data scaling, and PET parameter scaling is generally ineffective; and 3) the optimal finetuning method is highly task- and finetuning data-dependent.

1. 背景与研究动机

利用并迁移海量预训练模型中的知识用于下游应用,已成为近年来各领域成功背后的标准范式(Devlin et al. 2019; Lewis et al. 2020; Raffel et al. 2020)。先进的大语言模型(如 GPT-4、PaLM 2)常常展现出涌现能力,并支持在上文学习中仅用几个演示样本即可完成复杂的推理与生成任务(Wei et al. 2022)。尽管如此,LLM 微调仍然是解锁创造性任务、针对性下游应用新能力所必需的、并被广泛采用的步骤。

预训练缩放定律(Kaplan 2020, Chinchilla 2022)已得到充分研究,但微调阶段的缩放规律几乎没有被系统探索过。本研究聚焦于数据受限场景(data-limited regime)——微调数据量远小于 LLM 模型规模,这更符合当前 LLM 时代的实际情况。

2. 数学框架:乘法联合缩放定律

2.1 核心公式

L̂(X, D_f) = A · (1/Xα) · (1/D_fβ) + E = A · X · D_f + E

其中:X 为任意缩放因子(模型规模、预训练数据量、PET 参数大小等);D_f 为微调数据量;A, α, β, E 为待拟合的任务特定参数;L̂ 为目标任务的损失。

2.2 公式解读

该公式表达微调损失与模型因子 X 和微调数据量 D_f 之间的乘法联合关系——两者缺一不可、交互作用而非独立叠加。这与预训练缩放定律的加法形式(L(N,D) = L + A/Nα + B/Dβ)形成鲜明对比,意味着在微调场景下模型能力与数据量是相互耦合的。

2.3 推导思路

给定固定微调任务,微调损失可分解为:

L(D_f) = L + γ · D_f

当引入其它缩放因子 X 时,假设 X 的作用是在固定 D_f 的基础上乘性地降低不可约损失,即 f(X) ∝ X,从而得到联合乘法形式。

3. 实验设置

3.1 任务(评估指标)

任务语言对训练数据评估指标
WMT14 英德翻译En → Deup to 20MBLEU ↑
WMT19 英中翻译En → Zhup to 20MBLEU ↑
MLSum 摘要De/Es/Fr → Summaryup to 20MROUGE ↑

注:翻译任务用 BLEU、摘要任务用 ROUGE 是领域标准——BLEU 以精确率衡量译文流畅度,ROUGE 以召回率衡量摘要对关键信息的覆盖度,二者分别对应机器翻译与摘要的信息压缩本质。

3.2 三种微调方法

  • 全模型微调(FMT):最朴素的微调方式,直接优化所有 LLM 参数。
  • Prompt Tuning(Prompt):在输入嵌入 X 前拼接一个可学习的"软提示" P = [P; X],将拼接结果送入 LLM。
  • 低秩自适应(LoRA):不修改 LLM 输入,而是用可训练的低秩分解矩阵对 B∈Rm×r, A∈Rr×n 微调预训练权重,微调时使用 W+BA 替代 W。

4. 联合缩放定律验证(数值结果)

对 En-De 翻译任务,拟合参数如下:

L̂(N, D_f) = 1.2 · N-0.28 · D_f-0.15 + 0.3
  • α ≈ 0.28:模型参数翻倍 → 损失约降低 18%
  • β ≈ 0.15:微调数据翻倍 → 损失约降低 10%
  • E ≈ 0.3:不可约损失(任务固有难度)

乘法联合公式在不同任务、不同微调数据量下均得到验证——不同 D_f 的曲线族遵循相同的幂律形状,在 log-log 坐标系下损失面呈现平坦平面

5. 核心发现

📌 三大核心发现:

1. 模型缩放 > 预训练数据缩放:增大 LLM 模型规模对微调性能的提升显著优于增加预训练数据量。预训练数据缩放指数(β ≈ 0.05~0.10)远小于模型规模缩放指数(α ≈ 0.20~0.30)。

2. PET 参数缩放效果差:LoRA 和 Prompt Tuning 的参数 scaling 效果不佳(LoRA 训练稳定性更好,且零样本泛化能力显著优于 FMT)。

3. 最优方法依赖任务:FMT vs PET 的选择高度依赖具体任务、微调数据量和模型规模。

6. 结论与展望

本研究首次系统建立了微调场景的乘法联合缩放定律,为理解、选择与开发 LLM 微调方法提供了可预测的框架。未来方向包括:涌现能力在微调中的缩放、多任务联合缩放、MoE + 微调、在线微调、指令微调(RLHF/DPO)的缩放特性研究等。

论文 2

迁移学习的缩放定律

Scaling Laws for Transfer

Danny Hernandez · Jared Kaplan · Tom Henighan · Sam McCandlish(OpenAI)

arXiv: 2102.01293 · 2021

摘要(中文)

摘要

我们在无监督、微调设置下研究分布间迁移学习的经验缩放定律。当我们在固定大小的数据集上从头训练越来越大的神经网络时,它们最终会数据受限并停止提升性能(交叉熵损失)。当我们在大型语言数据集上预训练的模型上做同样的事时,性能增益的斜率只是减小而不会归零

我们通过确定一个同尺寸的 Transformer 从头训练需要多少数据才能达到同样的损失,来计算从预训练"迁移"的有效数据。换言之,我们在保持其它一切固定的前提下关注数据单元。我们发现:在低数据区,有效迁移数据很好地遵循参数量与微调数据集大小的幂律。预训练实质上是倍增了微调数据集大小。迁移与整体性能一样,在参数、数据和计算方面都可预测地缩放。

原文摘要(英文参考)

We study empirical scaling laws for transfer learning between distributions in an unsupervised, fine-tuning setting... We calculate the effective data "transferred" from pre-training by determining how much data a transformer of the same size would have required to achieve the same loss when training from scratch... We find that pre-training effectively multiplies the fine-tuning dataset size.

1. 关键结果(Key Results)

  • 缩放定律形式:有效迁移数据 Dtransfer 在低数据区满足幂律 DT ≈ DF · (NC/N)α_N 等关系。
  • 预训练倍增数据:预训练相当于把微调数据集"放大"了若干倍,且放大倍数与模型规模密切相关。
  • 指数含义:这些幂律中的指数对应模型通用性的度量,以及分布之间的方向相似度(而非对称相似度)。
  • 微调通常计算高效:忽略预训练计算量时,微调通常比自己训练到同等水平更省算力。

2. 核心公式

DT(N, DF) = DF · (NC/N)α_N (有效迁移数据)

这里 DT 是"等效从头训练数据",NC 为临界参数量,αN 为迁移幂律指数。

L(N, DF) ≈ L + A·N + B·DT

整体性能(损失)在参数、数据和计算上都遵循可预测的缩放规律。

3. 数据并行效率(多 GPU 扩展)

本研究的补充工作分析了数据并行训练的效率。理想线性扩展假设 N 块 GPU 带来 N 倍加速;但实验发现当 batch size 超过临界值 Ncrit 后,大学习率导致的梯度噪声不足反而损害泛化能力,实际加速比低于线性。实测拟合:

Speedup(N) ≈ min(N, Ncrit) · (N/Ncrit)-0.3

关键洞察:更多 GPU(数据并行)≠ 更多数据。当 GPU 过多(batch size 太大)时收益急剧递减。幂律指数 -0.3 来自多组扩展实验的平均斜率。

4. 结论

迁移(transfer)与整体性能一样,在参数、数据、计算三方面都遵循可预测的缩放定律。预训练实际上"倍增"了微调数据集大小,为理解大模型为何能成为少样本学习者(few-shot learners)提供了理论依据。

论文 3

LoRA:大语言模型的低秩自适应

LoRA: Low-Rank Adaptation of Large Language Models

Edward Hu · Yelong Shen · Phillip Wallis · Zeyuan Allen-Zhu · Yuanzhi Li · Shean Wang · Lu Wang · Weizhu Chen(Microsoft)

arXiv: 2106.09685 · 2021

摘要(中文)

摘要

自然语言处理的一个重要范式是:在通用领域数据上进行大规模预训练,再适配到特定任务或领域。随着我们预训练的模型越来越大,全量微调(重训所有模型参数)变得不再可行。以 GPT-3 175B 为例——为每个独立实例部署一份 175B 参数的微调模型,成本高得令人望而却步。

我们提出 LoRA(Low-Rank Adaptation,低秩自适应):冻结预训练模型权重,并在 Transformer 架构的每一层注入可训练的低秩分解矩阵,从而大幅减少下游任务的可训练参数。与使用 Adam 微调 GPT-3 175B 相比,LoRA 可将可训练参数减少 10000 倍、GPU 内存需求降低 3 倍。尽管参数更少、训练吞吐更高、且不像 adapter 那样引入额外推理延迟,LoRA 在 RoBERTa、DeBERTa、GPT-2 和 GPT-3 上的模型质量仍与微调持平甚至更好。我们还对语言模型适配中的秩缺陷进行了实证研究,揭示了 LoRA 的有效性。

原文摘要(英文参考)

We propose Low-Rank Adaptation, or LoRA, which freezes the pre-trained model weights and injects trainable rank decomposition matrices into each layer of the Transformer architecture, greatly reducing the number of trainable parameters for downstream tasks. Compared to GPT-3 175B fine-tuned with Adam, LoRA can reduce the number of trainable parameters by 10,000 times and the GPU memory requirement by 3 times.

1. 背景问题:全量微调的成本

许多 NLP 应用依赖将一个大型预训练语言模型适配到多个下游任务。这种适配通常通过微调完成——更新预训练模型的所有参数。微调的主要缺点是:新模型包含与原模型一样多的参数。随着模型快速增大,这在 GPT-2/RoBERTa 时只是"不便",到 GPT-3(1750 亿参数)时已变成关键部署挑战。

已有的缓解做法(只适配部分参数、学习外部模块等)虽然减少了存储,但常引入推理延迟(通过加深网络)或缩短可用序列长度(如 Prefix Tuning、Prompt Tuning),且往往无法匹配全量微调的效果,形成效率与质量之间的权衡。

2. 核心思想:低内在秩

受 Li et al. 2018a 和 Aghajanyan et al. 2020 启发(他们证明学习到的过参数化模型其实存在于低内在维度),我们假设模型适配过程中的权重变化也具有低"内在秩"。因此提出 LoRA:冻结预训练权重,只优化秩分解矩阵

Wnew = W0 + ΔW = W0 + BA

其中 W0 为冻结的预训练权重(Rd×k),B∈Rd×rA∈Rr×k 为低秩矩阵,r ≪ min(d,k) 为秩。A 用高斯随机初始化,B 初始化为零(保证训练开始时 BA=0)。

📌 LoRA 的四大优势:

1. 预训练模型可共享,为不同任务构建许多小的 LoRA 模块,切换任务只需替换 A、B,大幅降低存储与切换开销。

2. 训练更高效、硬件门槛最高降低 3 倍(无需为大多数参数计算梯度或维护优化器状态)。

3. 简单线性设计使可训练矩阵可在部署时合并进冻结权重,结构上不引入任何推理延迟。

4. 与许多已有方法(如 prefix-tuning)正交,可组合使用。

以 GPT-3 175B 为例,即使全秩 d 高达 12288,极低的秩(r = 1 或 2)就足够,使 LoRA 既省存储又省算力。

3. 问题设定(数学形式化)

给定预训练自回归语言模型 PΦ(y|x)(参数为 Φ),适配到下游任务,全量微调目标为最大化条件语言建模目标:

maxΦ Σ(x,y)∈𝒵 Σt=1..|y| log(PΦ(yt|x, y<t))

全量微调的缺点是每个下游任务学习不同的 ΔΦ,维度 |ΔΦ| 等于 |Φ0|。LoRA 采用参数高效方式,将增量编码为更小参数集 Θ(|Θ| ≪ |Φ0|),变为对 Θ 的优化:

maxΘ Σ log(PΦ0+ΔΦ(Θ)(yt|x, y<t))

当预训练模型是 GPT-3 175B 时,可训练参数 |Θ| 可低至 |Φ0| 的 0.01%。

4. 为什么现有方法不够好

  • Adapter 层引入推理延迟:增加网络深度,即使经过优化仍有额外延迟。
  • Prefix / Prompt 类方法缩短可用序列长度:占用输入上下文,可处理的有效长度下降。

二者都常无法匹配全量微调基线。LoRA 通过注入低秩矩阵(不加深网络、不占序列长度、可合并部署)克服了这些局限。

5. 实验结论

在 RoBERTa、DeBERTa、GPT-2、GPT-3 上,LoRA 以更少的可训练参数、更高的训练吞吐、无额外推理延迟,达到与全量微调持平甚至更好的模型质量。实证调查还发现模型适配存在秩缺陷——所需的内在秩远低于表面维度,这正是 LoRA 高效的原因。

论文 4

参数高效提示调优的规模力量

The Power of Scale for Parameter-Efficient Prompt Tuning

Brian Lester · Rami Al-Rfou · Noah Constant(Google Research)

arXiv: 2104.08691 · 2021

摘要(中文)

摘要

本文探索 "Prompt Tuning(提示调优)"——一种简单而有效的机制,用于学习"软提示(soft prompts)"来调节冻结的语言模型,以执行特定下游任务。与 GPT-3 使用的离散文本提示不同,软提示通过反向传播学习,可调优以整合任意数量标注样本的信号。我们的端到端学习方法以更大优势超越 GPT-3 的少样本学习。

更值得注意的是,通过使用 T5 进行模型规模的消融实验,我们证明 Prompt Tuning 随规模增大而更有竞争力:当模型参数超过数十亿时,我们的方法"缩小差距",匹配了模型调优(调节所有权重)的强性能。这一发现尤其相关,因为大型模型成本高昂且难以共享与部署,而能复用一个冻结模型来完成多个下游任务可显著缓解这一负担。我们的方法可视为 Li & Liang 2021 最近提出的 "prefix tuning" 的简化。最后,我们证明用软提示调节冻结模型在领域迁移鲁棒性与高效"提示集成(prompt ensembling)"方面有益。

原文摘要(英文参考)

In this work, we explore "prompt tuning," a simple yet effective mechanism for learning "soft prompts" to condition frozen language models to perform specific downstream tasks... we show that prompt tuning becomes more competitive with scale: as models exceed billions of parameters, our method "closes the gap" and matches the strong performance of model tuning.

1. Prompt Tuning 机制(软提示)

1.1 硬提示 vs 软提示

  • 离散文本提示(GPT-3 风格):如 "Translate to French: ...",依赖人工设计的固定文本。
  • 软提示(soft prompt):在输入前拼接一段可学习的连续 embedding P∈R|p|×d,通过反向传播优化,不依赖人工文本。
[P; X] ∈ R(|p|+|x|)×d → 冻结 LLM → 输出

将可学习的软提示 P 与任务输入 embedding X 拼接,送入冻结的 LLM。整个预训练模型 W0 完全冻结,只训练软提示向量。

1.2 与 Prefix Tuning 的区别

方法软提示位置参数位置
Prompt Tuning仅输入层之前仅输入 embedding 层
Prefix Tuning(Li & Liang 2021)每层注意力之前都加所有 Transformer 层

2. 核心发现:规模是关键

使用 T5 进行模型规模消融,发现 Prompt Tuning 的竞争力随模型规模增大而显著提升:

📌 关键发现:

· 小模型下 Prompt Tuning 明显弱于模型调优(全参数微调);

· 当模型规模超过数十亿参数(>10B)时,Prompt Tuning "closes the gap",达到与全参数微调持平的强性能。

· 这一"随规模追赶"的特性,意味着可以复用一个冻结的大模型完成多个任务,显著降低部署与共享成本。

这正是"参数高效调优(PEFT)在大模型时代可行"的关键论据,也是后续 FLAN、LoRA 等研究的重要基础。

3. 附加优势

  • 领域迁移鲁棒性:软提示调节的冻结模型对领域转移更稳健。
  • 提示集成(Prompt Ensembling):可高效组合多个软提示,获得集成推理的收益。
  • 相比其它方法(adapter、prefix tuning),实现更简单、参数量更少。
论文 5

秩稳定化缩放因子:rsLoRA

A Rank Stabilization Scaling Factor for Fine-Tuning with LoRA

Damjan Kalajdzievski(Tenyx)

arXiv: 2312.03732 · 2023

摘要(中文)

摘要

随着大语言模型(LLM)日益计算与内存密集,参数高效微调(PEFT)已成为微调 LLM 的常用策略。流行的 PEFT 方法是 低秩适配器(LoRA),它在选定的层中添加可训练的低秩"适配器"。每个适配器由一个低秩矩阵乘积构成,并乘上一个依赖秩的缩放因子

这个缩放因子(将适配器除以一个秩的因子)会导致高秩适配器的学习变慢、性能受阻。因此,实践中 LoRA 通常被限制在非常低的秩。本文研究缩放因子对学习过程的影响,并证明 LoRA 适配器应除以秩的平方根。我们将采用正确缩放因子的方法称为 秩稳定化 LoRA(rsLoRA),它轻松提供了微调的计算/性能权衡——用更大的秩在训练时换取更好的微调性能,且推理计算成本不变。

原文摘要(英文参考)

This scaling factor, which divides adapters by a factor of the rank, results in slowed learning and stunted performance for LoRA with higher-rank adapters... we study the impact of the scaling factor on the learning process and prove that LoRA adapters should be divided by a factor of the square root of the rank.

1. 背景:标准 LoRA 的缩放问题

LoRA 将一个线性子模块的参数更新为低秩形式。给定预训练权重 W ∈ Rd2×d1,LoRA 注入两个低秩矩阵 A ∈ Rr×d1 与 B ∈ Rd2×r,并用依赖秩的缩放因子 γr 收缩:

xout = (W + γrBA) xin + b

其中 B 初始化为零(B=0d2×r),γr ∈ R+ 为缩放因子。

📌 问题根源:

标准 LoRA 取 γr = α/r。当秩 r 增大时:

· 缩放因子 α/r 急剧减小(r=4 → 0.25α,r=64 → 0.016α)

· 有效学习率降为 lr·(α/r),高秩 LoRA 几乎学不动

· 结果:梯度坍缩(gradient collapse)——大秩与小秩性能无差别,LoRA 在实践中被限制在极低秩。

2. 核心贡献:秩稳定化缩放

rsLoRA: γr = α/√r

理论分析证明:LoRA 适配器应除以秩的平方根(√r),而不是秩(r)。原因在于 LoRA 训练中 ΔW 的谱范数与 √r 成正比,用 α/√r 可使缩放因子与秩解耦,让不同秩的 LoRA 有一致的有效学习率

缩放因子对比

秩 rα/r(标准 LoRA)α/√r(rsLoRA)
40.250α0.500α
160.063α0.250α
640.016α0.125α
2560.004α0.063α
📌 为什么有效:

· 标准 LoRA:梯度随秩增大而坍缩,更大秩表现与低秩无异。

· rsLoRA:梯度不坍缩,更高秩带来更好性能。

· 结论:更高秩可在训练时用更多算力换取更好的微调性能,而推理计算成本完全不变(适配器形式与 LoRA 完全相同)。

3. 实验与结论

实验验证了 rsLoRA 相比标准 LoRA 在性能与学习稳定性上的优势。rsLoRA 使得更大的秩能够真正提升性能,从而提供了清晰的微调计算/性能权衡。因为适配器形式与标准 LoRA 完全一致,rsLoRA 对任何推理成本都没有额外影响。这解释了为何此前的 LoRA Scaling 规律(PLoRA(r) ∝ r0.2 趋于饱和)在 rsLoRA 下变为持续提升(∝ log r)。

4. LoRA / rsLoRA 缩放规律

PLoRA(r) ≈ Pmax · (1 - e-r/r0) (标准 LoRA,饱和指数形式)
PrsLoRA(r) ≈ Pmax · log(1 + c·r) (rsLoRA,对数形式持续提升)

这也与 Zhang et al. 2024 的观测一致:LoRA 的参数缩放存在上限,而 rsLoRA 修正后能持续提升。

论文 6(相关)

BIG-Bench:超越模仿游戏的基准——量化和提取语言模型的关键行为

Beyond the Imitation Game: Quantifying and Extracting Crucial Behavior in Language Models

Srivastava et al.(BIG-Bench 团队,跨 100+ 机构)

arXiv: 2206.04615 · 2022

简介

BIG-Bench(Beyond the Imitation Game Benchmark) 是一个大规模、协作构建的多任务基准,用于评估大语言模型的"关键行为"——尤其是那些模仿游戏(imitation game)之外的、需要真正能力的行为。它由 100 多个机构的研究者共同提出,包含 200+ 个任务

任务构成

  • 推理:逻辑推理、常识推理、因果推理
  • 代码生成:编程任务、算法实现
  • 数学:算术、代数、数学应用题
  • 翻译:多语言翻译、多语言理解
  • 伦理与安全:偏见判断、伦理决策
  • 少样本能力:few-shot / zero-shot 泛化

与 EmergentAbilities 的关系

Wei et al. 2022 的涌现能力论文正是基于 BIG-Bench 来定义和测量"涌现"——他们在 BIG-Bench 任务上观察到,随模型规模增大,某些任务性能从随机水平突然跃升到显著高于随机,形成量变到质变的跳跃。这种在特定规模后"从无到有"的现象即为涌现能力

论文 7(相关)

链式思维提示激发大语言模型的推理能力

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Jason Wei · Xuezhi Wang · Dale Schuurmans · Maarten Bosma · Brian Ichter · Fei Xia · Ed Chi · Quoc Le · Denny Zhou(Google Brain)

arXiv: 2201.11903 · 2022

核心思想(CoT 的首次提出)

链式思维(Chain-of-Thought, CoT) 最早由 Jason Wei 等人在本文提出。核心方法是:不给模型一个直接的问题→答案提示,而是让模型展示中间推理步骤,逐步推导出最终答案。

📌 示例对比:

标准提示: "小明有 5 个苹果,又买 3 个,送朋友 2 个,还剩几个?" → 答案:6

CoT 提示: "让我们一步步思考:小明先有 5 个苹果 → 又买 3 个,共 5+3=8 → 送朋友 2 个,所以 8-2=6 → 答案:6"

关键发现

  • 模型规模是关键:只有当模型规模足够大(约 ≥100B 参数,如 PaLM 540B)时,CoT 才能发挥显著作用;小模型用 CoT 反而可能降低性能。
  • 推理能力大幅提升:在数学应用题、多步推理、符号操作等任务上,CoT 让 PaLM 等模型性能大幅跃升。
  • "涌现"的表现:CoT 的增益仅在特定模型规模后突然出现——这正是"涌现能力"的典型体现。
论文 8(相关)

微调语言模型成为零样本学习者(FLAN)

Finetuned Language Models Are Zero-Shot Learners

Jason Wei · Maarten Bosma · Vincent Y. Zhao · Kelvin Guu · Adams Wei Yu · Brian Lester · Nan Du · Andrew M. Dai · Quoc V. Le(Google)

arXiv: 2109.01652 · 2021

什么是指令微调(Instruction Tuning)

指令微调(Instruction Tuning) 是本文(FLAN)提出的核心方法:用"指令格式"的数据对预训练 LLM 进行微调,让模型学会理解自然语言指令

数据格式示例
预训练(无指令)"今天天气很好,我想去散步。"
指令微调(Instruction Tuning)"请将以下句子翻译成法语:我爱学习。 → J'aime apprendre."

核心思想与流程

  • 收集多个 NLP 任务数据集,改写成"指令 + 输入 → 输出"格式。
  • 在这些指令化数据上微调预训练 LLM。
  • 使模型在未见过的任务上具备零样本(zero-shot)泛化能力。
📌 效果:

经过指令微调的模型,在零样本设置下对未见任务的泛化能力大幅提升。这正是后续 FLAN-T5 等模型的基础,也解释了为何"指令微调 + 大模型"会成为释放 LLM 能力的关键范式。
论文 9(相关)

PaLM:用 Pathways 扩展语言建模

PaLM: Scaling Language Modeling with Pathways

Aakanksha Chowdhery · Sharan Narang · Jacob Devlin · Maarten Bosma · Gaurav Mishra · Adam Roberts 等(Google Research)

arXiv: 2204.02311 · 2022

PaLM 是什么

PaLM(Pathways Language Model) 是 Google 在 2022 年发布的巨型语言模型,最重要的贡献是首次展示了大模型 + 链式思维(CoT)提示的强大组合,并用 Pathways 系统实现了数千个 TPU 上的高效并行训练。

属性数值
参数量5400 亿(540B)
训练数据7800 亿 tokens(C4 + 社交媒体 + 网页 + Wikipedia + 书籍)
架构标准 Transformer,基于 Pathways 训练
推理CoT 提示下在数学、逻辑、多步推理任务大幅跃升

PaLM 的重要地位

  • 首次在 540B 规模展示 CoT 的涌现能力(Wei et al. 2022 实验所用的主模型之一)。
  • Pathways 系统可在数千个 TPU 上高效并行,为大规模训练基础设施奠定基础。
  • 是 EmergentAbilities 论文中典型"涌现"现象的直接载体。
附录

EmergentAbilities 论文引用的涌现参考文献(中文译注)

References Cited in the Emergent Abilities Paper on Emergence

来源:arXiv: 2206.07682

为何引用这些论文?

Wei et al. 2022 在引言中追溯"涌现(emergence)"作为跨学科思想的历史。这些引用横跨物理学、生物学、计算机科学与经济学,共同支撑了对涌现的定义——当系统中的定量变化导致行为上的定性变化时,即为涌现。以下为逐篇译注。

1. Anderson (1972) — 涌现思想的源头《More Is Different》

译注

Philip W. Anderson《More Is Different: Broken Symmetry and the Nature of the Hierarchical Structure of Science》,《Science》177(4047): 393-396(1972)。Anderson 是 1977 年诺贝尔物理学奖得主。这是凝结态物理的奠基性短文,提出"More is different(多即不同)"——随系统规模变大,会涌现出小系统不存在的新行为与层级结构,无法仅通过缩减小系统的物理规律预测。这正是"涌现"定义的核心哲学根基(量变引发质变)。

获取:Science 期刊付费文章,非 arXiv 开放获取。

2. Hwang et al. (2012) — 物理学里的涌现现象

译注

Hwang, Iwasa, Kawasaki, Keimer, Nagaosa, Tokura《Emergent Phenomena at Oxide Interfaces》,《Nature Materials》11(2): 103-113(2012)。在材料科学中,氧化物界面会涌现出单一材料不具备的新电子性质(如超导、磁性、铁电)。引用它说明"涌现"在物理系统中是被广泛验证的真实现象。

获取:Nature 期刊付费文章,非 arXiv 开放获取。

3. Forrest (1990) — 计算领域的涌现计算

译注

Stephanie Forrest《Emergent Computation: Self-Organizing, Collective, and Cooperative Phenomena...》,《Physica D》42: 1-11(1990)。这是"涌现计算(emergent computation)"的经典之作,研究了自组织、集体与协同现象如何从大量简单部件的局部相互作用中自发产生,为人工生命与集群智能奠定概念基础。

获取:Physica D 期刊付费文章,非 arXiv 开放获取。

4. Corradini & O'Connor (2010) — 科学与哲学中的涌现

译注

Antonella Corradini 与 Timothy O'Connor(主编)《Emergence in Science and Philosophy》(Routledge,卷6,2010)。跨学科文集,梳理了"涌现"在科学(物理、生物、心智)与哲学(本体论、因果性)中的多重含义与争论,包括强/弱涌现、随附性(supervenience)等议题。

获取:Routledge 学术书籍,付费。

5. Harper & Lewis (2012) — 经济学中的涌现

译注

David A. Harper 与 Paul A. Lewis《New Perspectives on Emergence in Economics》(Routledge,2012)。讨论涌现在经济复杂系统(市场、制度、创新网络)中的应用——大量个体的微观局部行为如何自发涌现出宏观层面不可还原为个体的秩序结构。

获取:Routledge 学术书籍,付费。

6. Steinhardt (2022) — 本文"涌现"定义的直接依据

译注

Jacob Steinhardt《On the Relationship between Emergence and Scale》(手稿/未发表,2022)。Wei et al. 2022 直接改编自本文的定义:当系统中的定量变化导致行为上的定性变化时,即为涌现,并将涌现与"规模(scale)"联系起来——这正是用训练计算量、模型参数量衡量模型规模涌现的理论出发点。

获取:未发表手稿,公开渠道不可获得。

7. Miller et al. (2004) — 早期 NLP 的涌现能力追溯

译注

Scott Miller, Jethran Guinness, Alex Zamanian《Name Tagging with Word Clusters and Discriminative Training》,《NAACL 2004》。早期 NLP 工作,提出随模型/特征规模增大,命名实体识别等能力出现非线性质变提升。Wei et al. 2022 借此说明"涌现能力"思想可追溯到更早的 NLP 研究。

获取:✅ 已从 ACL Anthology 下载(83KB PDF)。

关键结论:

· 这 8 篇引用中,仅 Miller et al. (2004) 可从公开渠道(ACL Anthology)下载,已下载。

· Anderson 1972、Forrest 1990、Hwang 2012 为经典期刊文章;Corradini 2010、Harper 2012 为学术书籍;Steinhardt 2022 为未发表手稿——均不在 arXiv 公开获取

· 它们共同构成"涌现"这一跨学科概念的谱系,是 Wei et al. 2022 定义涌现能力(小模型不存在、大模型才有的能力)的理论根基。