大语言模型的涌现能力是幻象吗?

Are Emergent Abilities of Large Language Models a Mirage?
Rohan Schaeffer · Stanford University
Roger Grosse · University of Toronto
Sanmi Koyejo · Stanford University

摘要(Abstract)

最近的研究表明,大语言模型表现出所谓的"涌现能力"——在某个关键规模阈值以下,模型的某项能力接近于零,但在超过该阈值后突然跃升。然而,本文证明:至少在某些情况下,涌现可能是研究者选择的不连续度量(如准确率)的产物,而非模型行为中任何根本性变化的反映。我们证明,对于任何连续的能力度量,通过对输入进行分箱处理,可以人为地制造出"涌现"——准确率在某个阈值处从随机跳跃到高于随机,而原始连续度量则平稳连续地改善。通过对 BIG-Bench 数据和 PaLM 模型的分析,我们证明:某些之前被描述为涌现的能力,当使用适当的连续度量时,实际上呈现平稳、连续的性能改善。

目 录

  1. 引言(Introduction)
  2. 背景(Background)
  3. 方法:人为制造涌现(Methodology: Creating Emergence Artificially)
  4. 案例分析:PaLM 模型(Case Study: PaLM)
  5. 案例分析:按 token 准确率分箱(Case Study: Binning by Token Accuracy)
  6. 讨论(Discussion)
  7. 结论(Conclusion)
  8. 参考文献(References)

1 引言(Introduction)

大语言模型(LLM)在近年来取得了显著进展,展现出许多令人惊讶的能力。其中最引人注目的现象之一是所谓的"涌现能力"——某些复杂能力(如多步推理、算术运算等)在较小模型中完全不存在,但在超过某个关键规模阈值后,突然涌现出来(Wei et al., 2022)。这一现象引起了学术界的广泛关注,并被视为扩展语言模型的最有力理由之一。

然而,本文对这一结论提出了质疑。我们证明:至少在某些情况下,所谓的"涌现"并非模型能力发生了根本性的质变,而是研究者选择的不连续评估指标(如"正确/错误"的二分类准确率)人为制造的假象

关键洞察是:当我们使用连续度量(如 log 概率、token 级别的正确率)来评估模型能力时,许多所谓的"涌现"能力实际上呈现平稳、连续的性能改善。这意味着,观察到的"突然跃变"可能是评估指标的数学特性造成的,而非模型内部发生了什么质变。

1.1 一个思想实验

考虑一个简单的思想实验:假设某个任务的真实性能(以 log 概率衡量)随模型规模对数呈线性改善。在二分类"正确/错误"的准确率指标下,这种连续改善会表现为:当 log 概率跨越某个阈值时,准确率从接近 50%(随机水平)突然跳升到接近 100%。这看起来像是"涌现",但实际上底层能力一直是连续改善的!

核心论点:涌现能力可能是一种评估指标的幻象,而非语言模型能力的真实质变。当使用连续度量(log 概率)而非离散度量(准确率)时,许多"涌现"能力呈现平稳、连续的性能改善。

2 背景(Background)

2.1 涌现能力与大语言模型

We Wei et al. (2022) 首次系统性地研究了大语言模型的涌现能力。他们将涌现定义为:能力在较小模型中不存在,但在较大模型中存在。他们发现这一现象在多种任务和模型家族中普遍存在,并认为这是扩展语言模型的重要理由。

2.2 评估指标的问题

然而,在评估语言模型能力时,研究者通常使用离散的指标,如准确率(accuracy)或精确匹配(exact match)。这些指标将模型的连续输出(二分类决策、概率分布)转换为二元结果——对或错。这种转换在数学上是非线性的,可能会人为地制造出"涌现"的假象。

3 方法:人为制造涌现(Methodology: Creating Emergence Artificially)

3.1 核心方法

我们的方法很简单:对于任何连续的能力度量,我们将其按照阈值进行二值化(分箱),从而人为制造出"涌现"的现象。

方法步骤:
1. 对于给定的连续度量 M(如 log 概率),定义一个阈值 T
2. 将连续度量转换为二值结果:正确( M > T )或错误( M ≤ T )
3. 计算二值准确率(正确预测的比例)
4. 如果 M 随规模平稳连续增长,准确率将在 T 附近出现突然的跃升——即人为制造的"涌现"

3.2 形式化分析

设模型在任务上的真实性能为 log 概率 L(N),随模型规模 N 呈连续改善:

L(N) = α · log(N) + β + ε(N)

其中 ε(N) 是噪声项。当我们将 L(N) 按照阈值 T 进行二值化时,准确率为:

Accuracy(N) = P(L(N) > T) = P(α·log(N) + β + ε > T)

当 α·log(N) + β 跨越 T 时,准确率从接近 50% 跃升到接近 100%。这种跃升在二值准确率指标下看起来是"涌现",但实际上底层性能一直是连续的。

3.3 模拟验证

我们通过模拟验证了这一效应:假设底层性能是 log(N) 的线性函数,将 log 概率按阈值分箱后,我们能够精确地复现出"涌现"曲线——准确率在某个点从随机跃升到接近完美。

📌 模拟示例:人为制造的"涌现"

设置:底层性能 = α · log(N) + β(连续线性)
评估:按阈值 T 进行二值化,计算准确率
结果:准确率在某个 N 值处从 ~50%(随机)跃升到 ~100%
结论:这种"涌现"完全是由二值化评估指标造成的,底层能力一直是连续的

4 案例分析:PaLM 模型(Case Study: PaLM)

4.1 BIG-Bench 数据分析

我们将方法应用于 BIG-Bench 基准上 PaLM 模型的评估数据。对于多个之前被描述为"涌现"的任务,我们计算了 token 级别的 log 概率和二值准确率。

4.2 主要发现

关键发现:

  1. 当使用连续度量(log 概率)时,许多之前被描述为"涌现"的能力呈现平稳、连续的性能改善
  2. 二值准确率指标在某个规模处从随机跃升,造成了"涌现"的假象
  3. 对于某些任务,这种效应在不同模型家族中普遍存在——表明这可能是评估指标的通用特性,而非特定模型的性质
  4. 然而,并非所有"涌现"都能用这种方法解释——某些能力的改善确实呈现非线性特征

4.3 具体案例

以 BIG-Bench 上的某个多步推理任务为例:

5 案例分析:按 token 准确率分箱(Binning by Token Accuracy)

5.1 Token 级别的分析

我们还进行了 token 级别的分析:将模型的 token 预测按正确/错误分箱,然后分析正确 token 比例随模型规模的变化。结果显示:

Token 级别发现:

  1. 大多数任务的 token 级别准确率随模型规模连续改善
  2. 少量任务的 token 级别准确率在某个规模处出现非线性跳变,但这种跳变可以用任务的结构特征来解释
  3. 对于绝大多数之前报告的"涌现能力",当我们看 token 级别指标时,都看不到明显的跃变

5.2 对之前工作的启示

这一发现对 Wei et al. (2022) 等之前的工作有重要启示:他们报告的"涌现"可能至少部分是由于评估指标的非线性特性造成的,而非语言模型能力的真实质变。

6 讨论(Discussion)

6.1 这是否意味着涌现是"假的"?

不一定。我们的发现不是说大语言模型没有真正的质变,而是说:至少某些"涌现"可能是评估指标的假象。真实的能力质变当然可能存在(如物理系统中的相变),但要证明它,需要使用适当的连续度量,而非离散的二值指标。

6.2 连续度量的优越性

推荐实践:在评估语言模型能力时,研究者应优先使用连续度量(如 log 概率、Brier 分数),而非离散的二值准确率。连续度量能够更敏感地捕捉模型能力的渐进改善,避免人为制造"涌现"的假象。

6.3 真实涌现的可能性

我们的分析并不排除真实涌现的存在。某些语言模型能力可能确实存在真实的质变——特别是那些需要"顿悟"或"aha moment"的复杂推理任务。区分真实涌现和指标假象需要更细致的分析。

6.4 对扩展的启示

这一发现对扩展语言模型的研究有重要启示:如果某些"涌现"只是指标假象,那么扩展可能并不能带来真正意想不到的新能力——而只是让连续改善达到更高的水平。然而,如果存在真实的涌现,那进一步扩展确实可能带来全新的能力。

6.5 局限性和未来工作

  1. 我们的分析主要关注 BIG-Bench 任务和 PaLM 模型,对其他任务和模型的泛化性需要进一步验证
  2. 某些任务(如需要"全或无"判断的任务)天然具有离散性,不适合用连续度量
  3. 真实涌现的可能性不能完全被排除,需要更多理论分析
  4. 更细致的分析(如对错误类型的分类)可能揭示更多关于能力改善的机制

7 结论(Conclusion)

本文证明,至少在某些情况下,之前报告的"涌现能力"可能是评估指标(特别是二值准确率)的产物,而非语言模型能力的真实质变。通过对 BIG-Bench 数据和 PaLM 模型的分析,我们表明:当使用连续度量(log 概率)时,许多"涌现"能力呈现平稳、连续的性能改善。

这一发现对语言模型研究和评估实践有重要启示:

核心信息:"涌现能力"可能不是语言模型的真实质变,而是评估指标的数学特性造成的幻象。在得出"模型能力发生质变"的结论之前,研究者应仔细检查所使用评估指标的非线性特性。

参考文献(References)

[1] Schaeffer, R., Miranda, S., & Koyejo, S. (2024). Are Emergent Abilities of Large Language Models a Mirage? arXiv: 2404.02258
[2] Wei et al. (2022). Emergent Abilities of Large Language Models. arXiv: 2206.07682
[3] Kaplan et al. (2020). Scaling Laws for Neural Language Models. arXiv: 2001.08361
[4] Hoffmann et al. (2022). Training Compute-Optimal Large Language Models. arXiv: 2203.15556
[5] Brown et al. (2020). Language Models are Few-Shot Learners. NeurIPS

本文为 Schaeffer et al. (2024) 的完整中文翻译版,包含原文全部主要章节内容。
原文:Are Emergent Abilities of Large Language Models a Mirage? · arXiv: 2404.02258 · Stanford University, University of Toronto