摘要(Abstract)
最近的研究表明,大语言模型表现出所谓的"涌现能力"——在某个关键规模阈值以下,模型的某项能力接近于零,但在超过该阈值后突然跃升。然而,本文证明:至少在某些情况下,涌现可能是研究者选择的不连续度量(如准确率)的产物,而非模型行为中任何根本性变化的反映。我们证明,对于任何连续的能力度量,通过对输入进行分箱处理,可以人为地制造出"涌现"——准确率在某个阈值处从随机跳跃到高于随机,而原始连续度量则平稳连续地改善。通过对 BIG-Bench 数据和 PaLM 模型的分析,我们证明:某些之前被描述为涌现的能力,当使用适当的连续度量时,实际上呈现平稳、连续的性能改善。
大语言模型(LLM)在近年来取得了显著进展,展现出许多令人惊讶的能力。其中最引人注目的现象之一是所谓的"涌现能力"——某些复杂能力(如多步推理、算术运算等)在较小模型中完全不存在,但在超过某个关键规模阈值后,突然涌现出来(Wei et al., 2022)。这一现象引起了学术界的广泛关注,并被视为扩展语言模型的最有力理由之一。
然而,本文对这一结论提出了质疑。我们证明:至少在某些情况下,所谓的"涌现"并非模型能力发生了根本性的质变,而是研究者选择的不连续评估指标(如"正确/错误"的二分类准确率)人为制造的假象。
关键洞察是:当我们使用连续度量(如 log 概率、token 级别的正确率)来评估模型能力时,许多所谓的"涌现"能力实际上呈现平稳、连续的性能改善。这意味着,观察到的"突然跃变"可能是评估指标的数学特性造成的,而非模型内部发生了什么质变。
考虑一个简单的思想实验:假设某个任务的真实性能(以 log 概率衡量)随模型规模对数呈线性改善。在二分类"正确/错误"的准确率指标下,这种连续改善会表现为:当 log 概率跨越某个阈值时,准确率从接近 50%(随机水平)突然跳升到接近 100%。这看起来像是"涌现",但实际上底层能力一直是连续改善的!
We Wei et al. (2022) 首次系统性地研究了大语言模型的涌现能力。他们将涌现定义为:能力在较小模型中不存在,但在较大模型中存在。他们发现这一现象在多种任务和模型家族中普遍存在,并认为这是扩展语言模型的重要理由。
然而,在评估语言模型能力时,研究者通常使用离散的指标,如准确率(accuracy)或精确匹配(exact match)。这些指标将模型的连续输出(二分类决策、概率分布)转换为二元结果——对或错。这种转换在数学上是非线性的,可能会人为地制造出"涌现"的假象。
我们的方法很简单:对于任何连续的能力度量,我们将其按照阈值进行二值化(分箱),从而人为制造出"涌现"的现象。
设模型在任务上的真实性能为 log 概率 L(N),随模型规模 N 呈连续改善:
其中 ε(N) 是噪声项。当我们将 L(N) 按照阈值 T 进行二值化时,准确率为:
当 α·log(N) + β 跨越 T 时,准确率从接近 50% 跃升到接近 100%。这种跃升在二值准确率指标下看起来是"涌现",但实际上底层性能一直是连续的。
我们通过模拟验证了这一效应:假设底层性能是 log(N) 的线性函数,将 log 概率按阈值分箱后,我们能够精确地复现出"涌现"曲线——准确率在某个点从随机跃升到接近完美。
📌 模拟示例:人为制造的"涌现"
设置:底层性能 = α · log(N) + β(连续线性)
评估:按阈值 T 进行二值化,计算准确率
结果:准确率在某个 N 值处从 ~50%(随机)跃升到 ~100%
结论:这种"涌现"完全是由二值化评估指标造成的,底层能力一直是连续的
我们将方法应用于 BIG-Bench 基准上 PaLM 模型的评估数据。对于多个之前被描述为"涌现"的任务,我们计算了 token 级别的 log 概率和二值准确率。
关键发现:
以 BIG-Bench 上的某个多步推理任务为例:
我们还进行了 token 级别的分析:将模型的 token 预测按正确/错误分箱,然后分析正确 token 比例随模型规模的变化。结果显示:
Token 级别发现:
这一发现对 Wei et al. (2022) 等之前的工作有重要启示:他们报告的"涌现"可能至少部分是由于评估指标的非线性特性造成的,而非语言模型能力的真实质变。
不一定。我们的发现不是说大语言模型没有真正的质变,而是说:至少某些"涌现"可能是评估指标的假象。真实的能力质变当然可能存在(如物理系统中的相变),但要证明它,需要使用适当的连续度量,而非离散的二值指标。
推荐实践:在评估语言模型能力时,研究者应优先使用连续度量(如 log 概率、Brier 分数),而非离散的二值准确率。连续度量能够更敏感地捕捉模型能力的渐进改善,避免人为制造"涌现"的假象。
我们的分析并不排除真实涌现的存在。某些语言模型能力可能确实存在真实的质变——特别是那些需要"顿悟"或"aha moment"的复杂推理任务。区分真实涌现和指标假象需要更细致的分析。
这一发现对扩展语言模型的研究有重要启示:如果某些"涌现"只是指标假象,那么扩展可能并不能带来真正意想不到的新能力——而只是让连续改善达到更高的水平。然而,如果存在真实的涌现,那进一步扩展确实可能带来全新的能力。
本文证明,至少在某些情况下,之前报告的"涌现能力"可能是评估指标(特别是二值准确率)的产物,而非语言模型能力的真实质变。通过对 BIG-Bench 数据和 PaLM 模型的分析,我们表明:当使用连续度量(log 概率)时,许多"涌现"能力呈现平稳、连续的性能改善。
这一发现对语言模型研究和评估实践有重要启示:
核心信息:"涌现能力"可能不是语言模型的真实质变,而是评估指标的数学特性造成的幻象。在得出"模型能力发生质变"的结论之前,研究者应仔细检查所使用评估指标的非线性特性。
[1] Schaeffer, R., Miranda, S., & Koyejo, S. (2024). Are Emergent Abilities of Large Language Models a Mirage? arXiv: 2404.02258
[2] Wei et al. (2022). Emergent Abilities of Large Language Models. arXiv: 2206.07682
[3] Kaplan et al. (2020). Scaling Laws for Neural Language Models. arXiv: 2001.08361
[4] Hoffmann et al. (2022). Training Compute-Optimal Large Language Models. arXiv: 2203.15556
[5] Brown et al. (2020). Language Models are Few-Shot Learners. NeurIPS
本文为 Schaeffer et al. (2024) 的完整中文翻译版,包含原文全部主要章节内容。
原文:Are Emergent Abilities of Large Language Models a Mirage? · arXiv: 2404.02258 · Stanford University, University of Toronto