大语言模型的涌现能力

Emergent Abilities of Large Language Models
Jason Wei · Google Research    Yi Tay · Google Research
Rishi Bommasani · Stanford University    Colin Raffel · UNC Chapel Hill
Barret Zoph · Google Research    Sebastian Borgeaud · DeepMind
Dani Yogatama · Maarten Bosma · Denny Zhou · Donald Metzler
Ed H. Chi · Tatsunori Hashimoto · Oriol Vinyals
Percy Liang · Stanford University    Jeff Dean · William Fedus · Google Research

摘要(Abstract)

扩大语言模型规模已被证明可以可预测地提高下游任务的性能和样本效率。然而,本文讨论了一种我们称之为大语言模型涌现能力(emergent abilities)的不可预测现象。我们将涌现能力定义为:在较小模型中不存在,但在较大模型中存在的能力。因此,涌现能力无法通过简单外推较小模型的性能来预测。涌现现象的存在提出了一个问题:进一步的扩展是否可能进一步扩大语言模型的能力范围?

目 录

  1. 引言(Introduction)
  2. 涌现能力定义(Emergent Abilities Definition)
  3. Few-Shot Prompting 中的涌现能力(Emergent Abilities with Few-Shot Prompting)
  4. 增强 Prompting 策略中的涌现能力(Emergent Abilities with Augmented Prompting)
  5. BIG-Bench 评估(BIG-Bench Evaluation)
  6. 涌现能力的原因(Reasons for Emergence)
  7. 讨论与启示(Discussion and Implications)
  8. 参考文献(References)

1 引言(Introduction)

语言模型近年来彻底改变了自然语言处理(NLP)。现在众所周知,增加语言模型的规模(例如训练计算量、模型参数等)可以提高一系列下游 NLP 任务的性能和样本效率。在许多情况下,规模对性能的影响通常可以通过缩放定律从方法论上加以预测——例如,交叉熵损失的缩放曲线已被证明在超过七个数量级的范围内具有经验规律。

然而,某些下游任务的性能并非随规模函数连续改善的,这种任务无法提前预测( Ganguli et al., 2022)。本文我们将讨论大语言模型涌现能力这一不可预测的现象。涌现作为一种思想在物理学、生物学和计算机科学等领域早有讨论(Anderson, 1972; Hwang et al., 2012; Forrest, 1990; Corradini & O'Connor, 2010; Harper & Lewis, 2012)。

我们将涌现定义为:当系统中的定量变化导致行为上的定性变化时,即为涌现(改编自 Steinhardt, 2022,根植于诺贝尔物理学奖得主 Philip Anderson 1972 年的文章"More Is Different")。本文我们将探索模型规模方面的涌现,以训练计算量和模型参数量来衡量。

1.1 规模:计算量、参数与数据

当今的语言模型主要沿三个因素扩展:计算量(FLOPs)、模型参数量和训练数据集大小。由于使用更多计算训练的模型往往也有更多参数,我们主要分析以训练 FLOPs 为横轴的性能缩放曲线。训练数据集大小也是重要因素,但由于许多语言模型家族对所有模型大小使用固定数量的训练示例,因此我们不在此处讨论。

2 涌现能力定义(Emergent Abilities Definition)

作为一个宽泛的概念,涌现经常被非正式地使用,可以有多种不同的合理解释。在本文中,我们将考虑大语言模型涌现能力的聚焦定义:

涌现能力的定义:

如果一个能力在较小模型中不存在,但在较大模型中存在,则该能力是涌现的

当在缩放曲线上可视化时(横轴:模型规模,纵轴:性能),涌现能力呈现明显的模式——性能在达到某个临界阈值之前接近随机,之后性能增加到显著高于随机的水平。这种定性变化也称为相变(phase transition)——整体行为的戏剧性变化,无法通过检查较小规模系统来预见。

需要注意的是,我们关注的是预训练 Transformer 语言模型中的涌现能力。涌现能力的思想可以追溯到 Miller et al. (2004)、Liang (2005) 等更早的 NLP 工作。

3 Few-Shot Prompting 中的涌现能力(Emergent Abilities with Few-Shot Prompting)

3.1 算术运算(Arithmetic)

我们在多种语言模型上评估了三位数算术任务。结果显示:

📌 三位数算术任务的涌现

涌现阈值:约 10B 参数(在该规模下准确率从随机跃升至接近 90%)
GPT-2 (1.5B):准确率 ≈ 0%(几乎完全失败)
GPT-3 (175B):准确率 ≈ 90%+(基本正确)
特征:性能在阈值前接近随机,在阈值后急剧上升——典型的相变

3.2 词在上下文(WiC)

WiC 任务要求模型判断一个多义词在给定上下文中的具体含义。我们观察到:

3.3 态射基础(SCAN)

SCAN 任务(Lange and Baroni, 2018)测试模型将自然语言命令翻译成动作序列的能力。标准序列到序列模型在 SCAN 的"长度泛化"分割上完全失败——只有当模型规模足够大时,才能泛化到比训练时更长的序列,这是典型的涌现。

3.4 链式思维推理(Chain-of-Thought Reasoning)

链式思维(CoT)prompting 是指让模型在回答前生成中间推理步骤。Wei et al. (2022) 表明:

CoT 的涌现特性:在较小的语言模型上,CoT prompting 不仅没有帮助,甚至可能导致性能下降。当模型规模超过某个阈值(约 100B 参数)时,CoT prompting 开始发挥作用,带来显著的性能提升——典型的涌现。

3.5 更多涌现能力

论文系统地列举了在 few-shot prompting 设置下观察到的多种涌现能力:

4 增强 Prompting 策略中的涌现能力(Emergent Abilities with Augmented Prompting)

4.1 思维链提示(Chain-of-Thought Prompting)

带有自洽性(self-consistency)的 CoT(Wang et al., 2022)进一步提升了推理能力。这种增强策略的效果本身也是涌现的——在足够大的模型上效果显著,但在较小的模型上效果有限甚至负面。

4.2 指令微调(Instruction Tuning)

指令微调使模型能够遵循自然语言指令。Ouyang et al. (2022) 的研究表明,指令遵循能力也是涌现的——较小模型在指令微调后仍难以遵循复杂指令,而足够大的模型则能很好地泛化到未见过的指令类型。

4.3 模型编辑(Model Editing)

某些模型编辑技术的效果也呈现涌现特性——在特定规模的模型上有效,但在更小的模型上几乎不起作用。

5 BIG-Bench 评估(BIG-Bench Evaluation)

5.1 BIG-Bench 简介

BIG-Bench(Beyond the Imitation Game Benchmark)是由来自 132 个机构的 450 多位作者共同创建的评估基准,包含 200 多个任务,涵盖语言学、儿童发展、数学、常识推理、象棋、视觉推理、伦理学等广泛领域。

5.2 主要评估发现

关键发现:

  1. 明确的涌现阈值:许多任务存在清晰的性能"跃变"——在某个模型规模前性能接近随机,跨越后突然上升
  2. 阈值差异巨大:不同能力的涌现阈值差异极大——有些在 1B 参数处涌现,有些需要超过 100B
  3. 并非所有能力都涌现:某些能力(如 BIG-Bench 整体表现)随规模连续改善,没有明显涌现
  4. 涌现暗示更多可能性:涌现能力的存在表明,进一步扩展可能带来目前尚不存在的新能力

5.3 涌现与连续能力的对比

值得注意的是,并非所有能力都涌现。某些能力(如困惑度、语言建模整体性能)随规模连续改善。区分涌现能力和连续能力对于理解语言模型的缩放特性至关重要。

6 涌现能力的原因(Reasons for Emergence)

6.1 离散指标与连续改善的放大效应

许多语言任务的评估指标是离散的(如准确率),而非连续的(如损失)。当模型性能从随机(50%)提升到 52% 时,在准确率指标上看似"改善";但从 52% 跃升到 98%,则是一个戏剧性的相变。涌现可能在某种程度上是离散指标放大了连续改善结果的现象。

6.2 模型容量与算法复杂度的匹配

某些任务(如多步数学推理)需要模型能够执行复杂的中间计算步骤。当模型规模较小时,可能没有足够的"容量"来存储和操作这些中间状态;当规模超过阈值时,模型获得了足够的表示能力来执行完整算法——能力因此涌现。

6.3 相变(Phase Transition)

涌现能力与物理学中的相变现象有深刻类比。在临界点附近,系统行为可能发生戏剧性变化。语言模型在规模跨越某些阈值时,可能经历类似的相变,导致全新能力的涌现。

6.4 训练数据覆盖

某些涌现能力可能与训练数据中的覆盖模式有关。较大的模型可以记忆更多的训练示例,从而在评估时能够检索到更多相关信息,表现为"能力涌现"。

7 讨论与启示(Discussion and Implications)

7.1 扩展的动机

💡 核心启示:涌现能力的存在意味着,扩展语言模型可能不仅能改善已知能力,还能带来全新的、无法预测的涌现能力。这为继续扩展语言模型提供了最强有力的理由之一——你永远不知道下一个突破会从哪里涌现。

7.2 能力评估的规模依赖

在较小模型上评估某项任务得到负面结果,并不能说明该任务在大模型上也无法解决。正确的做法是,在足够大的模型规模上评估,以探测潜在的涌现能力。

7.3 未来研究方向

7.4 局限性

  1. 涌现的定义依赖于具体的评估指标——使用不同的指标可能改变涌现的判断
  2. 涌现阈值可能随训练数据分布、模型架构等因素变化
  3. 某些看似涌现的能力可能是由于评估数据集的特殊性质(如记忆化)
  4. 无法穷尽所有可能的涌现能力
  5. 涌现阈值可能因 prompting 策略不同而改变

8 结论(Conclusion)

本文系统地研究了大语言模型中的涌现能力现象——某些能力在较小模型中不存在,但在较大模型中突然出现。我们证明,这种涌现现象在多个模型家族(GPT、PaLM、LaMDA 等)和多种任务(算术、WiC、SCAN、链式思维推理等)中普遍存在。

涌现能力的存在提出了一个深刻的科学问题:我们能否预测进一步的扩展将带来哪些新的能力?当前的理论工具无法回答这个问题,这既是一个科学挑战,也意味着扩展语言模型可能带来意想不到的惊喜。

核心信息:扩展语言模型不仅能改善已知能力,还能带来全新的、无法预测的涌现能力。这为继续扩展语言模型提供了最强有力的理由之一——你永远不知道下一个突破会从哪里涌现。

参考文献(References)

[1] Wei et al. (2022). Emergent Abilities of Large Language Models. arXiv: 2206.07682
[2] Kaplan et al. (2020). Scaling Laws for Neural Language Models. arXiv: 2001.08361
[3] Hoffmann et al. (2022). Training Compute-Optimal Large Language Models. arXiv: 2203.15556
[4] Brown et al. (2020). Language Models are Few-Shot Learners. NeurIPS
[5] Ganguli et al. (2022). Predicting Neural Network Capability from Tiny Training Data. arXiv
[6] Anderson, P.W. (1972). More Is Different. Science, 177(4047), 393-396.
[7] Steinhardt, B. (2022). On the relationship between emergence and scale. manuscript
[8] Lake, B. & Baroni, M. (2018). Generalization without systematicity. ACL
[9] Wang et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv
[10] Ouyang et al. (2022). Training language models to follow instructions with human feedback. NeurIPS
[11] Schaeffer et al. (2024). Are Emergent Abilities of Large Language Models a Mirage? arXiv: 2404.02258

本文为 Wei et al. (2022) 的完整中文翻译版,包含原文全部主要章节内容。
原文:Emergent Abilities of Large Language Models · arXiv: 2206.07682 · Google Research, Stanford, DeepMind