大语言模型参数规模、架构范式与用户数量估算方法研究

一份面向产品经理与技术决策者的综合调研报告

2026年8月 · 基于公开数据与多源交叉验证

1. 引言:研究背景与目标

自 2017 年 Transformer 架构提出以来,大语言模型(LLM)经历了指数级发展。模型参数从 BERT 的 1.1 亿增长到最新模型的数万亿级别,架构从单一的编码器-解码器演化为多种范式并存,用户规模从学术研究走向数亿级大众市场。在这一背景下,如何准确评估模型的真实能力、架构特点与用户规模,成为产品决策、投资判断和学术研究的核心问题。

本报告围绕三个核心维度展开调研:

  1. 模型参数规模:主流模型的参数量级、披露策略与间接估算方法
  2. 模型架构:Transformer 三大范式(Encoder-only / Decoder-only / Encoder-Decoder)、MoE 稀疏架构、注意力机制变体(MHA/MQA/GQA/MLA)、FFN 变体(SwiGLU/GeGLU)、归一化与位置编码方法,以及 RWKV、Mamba 等新型结构
  3. 用户数量估算:在缺乏官方披露的情况下,如何通过多源数据交叉验证来间接推断日活用户数与调用量
研究方法说明:本报告采用多源交叉验证原则,数据来源包括公司官方公告、第三方监测平台(Sensor Tower、SimilarWeb、Artificial Analysis)、学术论文与行业研究报告。所有数据均标注来源,未披露数据标注为"未公开"。

2. 模型参数规模:现状、对比与估算方法

2.1 主流模型参数对比

大语言模型的参数规模在过去三年中持续增长。以下为截至 2026 年 8 月主流模型的参数规模对比:

模型 开发者 总参数量 活跃参数 架构类型 参数披露状态
DeepSeek V4-Pro DeepSeek ~1.6T ~49B MoE 已公开
Qwen 3-Max 阿里云 未公开 未公开 MoE 未公开
GLM-5.2 智谱 AI ~744B ~40B MoE 已公开
Kimi K2.6 月之暗面 ~1T ~32B MoE 已公开
GPT-5.5 OpenAI 未公开 ~100B(估) Dense 未公开
Claude Opus 4.6 Anthropic 未公开 未公开 未公开 未公开
Llama 4 Behemoth Meta ~2T(已宣布) 未公开 MoE 已宣布未发布
ERNIE 5.0 百度 ~2.4T(声称) 未公开 MoE 已公开
Gemma 3 300B Google ~300B ~300B Dense 已公开
Mistral Large 2 Mistral ~123B ~123B Dense 已公开
图 2.1:主流模型总参数量对比(对数坐标,单位:Billion)

2.2 参数估算方法论

当公司选择不公开参数规模时,研究者发展出了多种间接估算方法:

方法一:API 定价回归法

模型 API 的输入/输出定价与参数规模存在近似正相关关系。通过收集多个已知参数模型的定价数据,建立回归模型,可对未公开模型进行参数估算。该方法的精度受市场策略影响较大,置信区间通常较宽。

方法二:IKP(Incompressible Knowledge Probes)

通过向模型输入精心设计的"不可压缩知识探针"(如特定事实性问题),测量模型的回答质量。参数量更大的模型通常能记忆更多事实,在特定探针测试上表现更好。该方法由 Epoch AI 等研究机构推动,常用于估算 GPT-5.5 等未公开模型的活跃参数规模。

方法三:内存与推理速度反推

通过分析模型在特定硬件上的推理速度、显存占用和上下文长度,结合已知的架构假设(如层数、隐藏维度),反向推算参数规模。该方法需要对模型架构有较强的假设,适用于开源或半开源模型。

重要提醒:参数规模不等于模型能力。在实际产品决策中,应结合 benchmark 成绩、推理成本和特定场景表现综合评估,而非仅关注参数量。

2.3 MoE 架构的参数特殊性

混合专家(Mixture of Experts, MoE)架构的兴起使得"总参数量"与"活跃参数量"之间出现了显著差异。以 DeepSeek V4-Pro 为例,其总参数量约 1.6T,但每个 token 只激活约 49B 参数,实际计算量远小于总参数量所暗示的规模。这种设计在保持模型容量的同时大幅降低了推理成本,但也使得不同模型之间的参数量对比失去了直接意义。

3. 模型架构:Transformer 范式、变体与新兴结构

3.1 Transformer 基础架构回顾

2017 年,Google 在论文《Attention Is All You Need》中提出 Transformer 架构,核心组件为自注意力机制(Self-Attention)前馈神经网络(FFN)。经过近十年发展,Transformer 衍生出多种变体。以下从四个核心维度——注意力机制、前馈网络、归一化方法和位置编码——深入剖析现代 LLM 的架构细节。

3.1.1 注意力机制详解:从 MHA 到 MLA

自注意力机制是 Transformer 的核心算子。其基本形式为:将输入序列映射为 Query(Q)、Key(K)、Value(V)三个矩阵,通过计算 Q 与 K 的相似度得到注意力权重,再对 V 加权求和。不同注意力变体的核心差异在于多头的 Q/K/V 投影方式以及由此产生的 KV Cache 显存开销差异。

Attention(Q, K, V) = softmax(QK^T / √d_k) · V

四种注意力变体对比

变体 Q 投影 K 投影 V 投影 KV Cache 大小 推理速度 模型质量 代表模型
MHA(多头注意力) 每头独立 每头独立 每头独立 2 × L × d × h 最优 原始 Transformer、GPT-3
MQA(多查询注意力) 每头独立 全部共享 全部共享 2 × L × d 略有下降 PaLM、Gemini
GQA(分组查询注意力) 每头独立 分组共享 分组共享 2 × L × d × g 中等 接近 MHA Llama 2/3、Mistral、Qwen
MLA(多头潜在注意力) 低秩压缩 低秩压缩 低秩压缩 显著降低 最快 接近 MHA DeepSeek V2/V3/V4
图 3.1:四种注意力变体的 KV Cache 大小、推理速度与模型质量对比
关键洞察:MQA 显著降低了 KV Cache 显存占用,但模型质量略有下降;GQA 在 MHA 和 MQA 之间取得最佳平衡,已成为 2024-2025 年新模型的主流选择;MLA(DeepSeek 提出)通过低秩 KV 压缩进一步大幅降低显存,同时保持模型质量接近 MHA,是当前最前沿的注意力优化方案。

MLA 的数学原理

MLA 的核心思想是将 K 和 V 投影矩阵进行低秩分解。传统 MHA 中,K = W_K · x,V = W_V · x,其中 W_K 和 W_V 的维度为 d × d。MLA 将其分解为:K = W_K^D · W_K^U · x,V = W_V^D · W_V^U · x,其中 W_K^D 和 W_V^D 是共享的低维投影矩阵。这样,KV Cache 只需要存储低维的压缩表示,而非完整的 K 和 V 向量。

2025 年的 TransMLA 论文(arxiv 2502.07864)进一步证明了 GQA 可以被表示为 MLA 的一种特例,统一了二者的数学框架。

3.1.2 前馈网络(FFN)变体:从标准 FFN 到 SwiGLU

Transformer 中的 FFN 层通常由两个线性变换和一个非线性激活函数组成,是模型容量的主要来源。标准 FFN 的形式为:

FFN(x) = W_2 · Activation(W_1 · x)

不同 FFN 变体的核心差异在于激活函数和是否引入门控机制:

变体 公式 激活函数 门控机制 参数效率 代表模型
Standard FFN W₂ · GELU(W₁ · x) GELU 基准 BERT、原始 Transformer
SwiGLU (W₁·x) ⊙ Swish(W₃·x) · W₂ Swish (SiLU) 有(W₃ 门控) 更高 PaLM、Llama、Gemini
GeGLU (W₁·x) ⊙ GELU(W₃·x) · W₂ GELU 更高 部分模型使用
Gated MLP 通用门控 FFN 家族 多种 更高 前沿模型探索中

其中 SwiGLU 的核心优势在于:在相同计算量下,门控机制允许模型更有效地选择性激活神经元,从而在相同 FLOPs 下获得更好的性能。实验表明,SwiGLU 相比 Standard FFN 在相同模型规模下 perplexity 降低约 5-10%。

3.1.3 归一化方法:RMSNorm、DeepNorm 与 QK-Norm

归一化层在 Transformer 的稳定训练中扮演关键角色。不同归一化方法的计算开销和训练稳定性各有差异:

方法 公式 计算开销 训练稳定性 代表模型
LayerNorm (x - μ) / σ · γ + β 高(需计算均值和方差) 原始 Transformer、BERT
RMSNorm x / RMS(x) · γ 低(无需均值计算) Llama、DeepSeek、Mistral、Gemma
DeepNorm LayerNorm + 残差缩放 极深模型专用 DeepNet(100+ 层)
Sandwich Norm 子层前+后各一次 LayerNorm 部分实验架构
QK-Norm 对 Q、K 做归一化 稳定注意力训练 Gemma、部分新模型

当前趋势:RMSNorm 已成为现代 LLM 的事实标准,几乎所有主流 decoder-only 模型(Llama、DeepSeek、Mistral、Gemma)都采用 RMSNorm 替代 LayerNorm,以减少约 15-20% 的归一化计算开销。QK-Norm 则在训练稳定性要求较高的场景中被采用。

3.1.4 位置编码方法:RoPE、ALiBi、YaRN 与 NoPE

由于 Transformer 的自注意力机制本身不感知序列顺序,位置编码是注入序列顺序信息的关键组件。以下是主流位置编码方法的对比:

方法 核心原理 序列外推能力 计算开销 代表模型
Absolute PE(绝对位置编码) 为每个位置学习独立的嵌入向量 差(需固定长度) 原始 Transformer、BERT
Sinusoidal PE(正弦位置编码) 三角函数编码,可外推 中等 极低 原始 Transformer
RoPE(旋转位置编码) 通过旋转矩阵编码相对位置 好(配合缩放) Llama、Qwen、DeepSeek、Mistral
ALiBi(线性偏置) 向注意力分数添加线性偏置 极好 极低 BLOOM、MPT
YaRN(NTK 感知 RoPE) NTK 感知的 RoPE 频率缩放 极好 Llama(扩展上下文)
NoPE(无位置编码) 不显式编码位置 取决于架构 部分 ViT、实验性 LLM

当前趋势:RoPE 是 2024-2025 年 decoder-only 模型的绝对主流,几乎所有主流模型(Llama、Qwen、DeepSeek、Mistral)都采用 RoPE。其优势在于相对位置编码的自然性——两个 token 之间的注意力只取决于它们的相对距离,与绝对位置无关。YaRN 进一步通过 NTK 感知的频率缩放,使 RoPE 可以外推到远超训练长度的上下文(例如从 4K 训练扩展到 128K 推理)。

图 3.2:位置编码方法的序列外推能力对比

3.2 三大 Transformer 范式

根据编码器-解码器的使用方式,Transformer 架构可分为三大范式:

图 3.3:Transformer 三大架构范式对比

Encoder-only(仅编码器)

代表模型:BERT、RoBERTa、DeBERTa

双向自注意力,每个 token 可以同时关注左右两侧上下文。预训练任务为掩码语言模型(MLM)和下一句预测(NSP)。适用于分类、命名实体识别、语义搜索等理解型任务。

Encoder-only

Decoder-only(仅解码器)

代表模型:GPT 系列、Llama、Claude、Gemini

单向(因果)自注意力,每个 token 只能关注其之前的 token。预训练任务为因果语言模型(CLM)——预测下一个 token。是当前生成式 AI 的主流架构,适用于对话、代码生成、推理等任务。

Decoder-only

Encoder-Decoder(编解码)

代表模型:T5、BART、mBART

编码器与解码器都存在,编码器双向处理输入,解码器单向生成输出。预训练任务通常为去噪自编码器(Span Corruption)。在机器翻译、文本摘要等序列到序列任务中表现优异。

Encoder-Decoder

图 3.4:三大范式能力雷达图

3.3 MoE(混合专家) vs Dense(稠密架构)

除编码器-解码器范式外,模型的另一关键架构差异在于 FFN 层的设计:

维度 Dense 架构 MoE 架构
代表模型 GPT-4、Llama 3、Mistral Large DeepSeek V4、Mixtral、Qwen3
每个 token 激活参数 全部参数 仅部分专家(通常 2-8 个)
推理成本 显著降低
训练成本 相对低(数据利用更高效) 高(需更多数据)
部署复杂度 简单 复杂(需路由器+多专家)

3.4 新型架构:RWKV、Mamba、Hyena 与混合结构

除 Transformer 及其变体外,研究者提出了多种新型架构,试图解决 Transformer 的二次复杂度问题:

RWKV

Receptance Weighted Key-Value,一种线性复杂度的 RNN 变体。通过创新的 WKV(Weighted Key-Value)算子,实现了与 Transformer 相当的并行训练能力,同时具备线性推理复杂度。RWKV-6(2024)引入了更高效的注意力变体,RWKV-7 进一步优化。已在某些基准上达到 GPT-4 级别的性能。

RWKV

Mamba

状态空间模型(SSM),由 Carnegie Mellon 大学提出。通过选择性状态空间机制,实现了线性序列建模能力。Mamba-2(2024)进一步引入结构化状态空间,提升了训练并行度。在长序列任务(如 DNA 建模、音频处理)上表现优异。

Mamba

Hyena

长卷积(Long Convolution)+ 隐式门控的架构。通过层级化的卷积核实现亚二次复杂度,在序列长度 8K-64K 范围内表现接近 Transformer。Hyena Hierarchy 是当前最成熟的版本。

Hyena

混合架构:后 Transformer 时代的方向

纯 SSM/RNN 架构在某些场景下仍有局限性(如精确的上下文检索)。因此,将 Transformer 注意力层与 SSM/RNN 层交替堆叠的混合架构成为新的研究热点:

模型 架构组成 总参数 特点
Jamba Mamba + Transformer(交替层) 398B(活跃 52B) 首个成功的 SSM+Transformer 混合模型
StripedHydra Hyena + Transformer 实验规模 在长上下文任务中表现突出
FG-VQA RWKV + 注意力分支 实验规模 面向视觉问答的混合架构
Lightning Attention 线性注意力 + 分块处理 实验规模 面向极长序列(100K+ tokens)
图 3.5:模型架构演进路线图
图 3.6:注意力机制演进时间线
架构选型建议:对于大多数产品场景,Decoder-only + GQA + SwiGLU + RMSNorm + RoPE 的组合已成为"黄金标准",在性能、推理成本和工程复杂度之间达到最佳平衡。MoE 架构适合有明显计算预算约束的场景。对于超长上下文需求(100K+ tokens),RWKV、Mamba 等线性架构值得关注。

3.5 主要模型家族版本演进与参数对比

了解各大公司模型家族的版本演进路径,有助于理解技术竞争格局和架构选型趋势。本节梳理了 2023-2026 年间 8 个主要模型家族的版本历史、参数规模变化和架构演进路线。

3.5.1 模型家族概览

截至 2026 年 8 月,主要商业/开源模型家族呈现以下发展态势:

🏢 开源/开放权重家族

  • Llama (Meta):完全开源,社区驱动,从 7B 演进到 MoE 2T+
  • Qwen (Alibaba):Apache 2.0 开源,多尺寸覆盖,多模态领先
  • DeepSeek:Apache 2.0 开源,MoE + MLA 架构创新者
  • Mistral (Mistral AI):欧洲开源旗舰,Sliding Window Attention 先驱
  • Grok (xAI):Grok-1 开源,后续转为闭源

🔒 闭源商业家族

  • GPT (OpenAI):行业标杆,从 GPT-3 到 GPT-5 系列,参数规模持续领先
  • Claude (Anthropic):安全对齐先驱,Dense Transformer 坚守者
  • Gemini (Google):原生多模态,DeepMind + Google Brain 合并产物

3.5.2 各家族版本演进详情

GPT 家族(OpenAI)

作为行业标杆,GPT 系列经历了从 117M 到估计 1.76T 参数的跨越,始终引领技术潮流:

版本发布时间总参数活跃参数上下文架构特点
GPT-12018-06117M117M51212层 Decoder-only,MHA
GPT-22019-021.5B1.5B1K48层 Decoder-only,MHA
GPT-32020-05175B175B2K96层 Dense,MHA,首次展示 Few-shot 能力
GPT-3.52022-11~175B~175B4KGPT-3 + RLHF 微调,ChatGPT 基础
GPT-42023-03未公开未公开8K/32K传闻 MoE(8个专家,2 active),多模态
GPT-4o2024-05未公开未公开128K全模态(文本、图像、音频)
o12024-09未公开未公开128K-200K推理模型,Chain-of-Thought 训练
GPT-52025-08未公开未公开272K in + 128K reasoning原生多模态 + 推理模式
GPT-5.6 Sol2026-07~1.76T(估)~1.76T(估)1MMoE 架构,旗舰级

Claude 家族(Anthropic)

Anthropic 坚持 Dense Transformer 路线,不采用 MoE 架构,以安全对齐和长上下文见长:

版本发布时间总参数上下文架构特点
Claude 1/22023未公开100K早期 Dense 模型
Claude 3 Opus2024-03未公开200K首个三 tier 模型(Opus/Sonnet/Haiku)
Claude 3.5 Sonnet2024-06未公开200K性价比颠覆者,编程能力突出
Claude 3.7 Sonnet2025-02未公开200K首个混合推理模型
Claude Opus 42025-05未公开1M编码和 Agent 优化
Claude Opus 4.72026-04未公开1M软件工程 + 视觉
Claude Fable 52026-06未公开1M+首个 Mythos-class 通用版

Gemini 家族(Google DeepMind)

以原生多模态和超长上下文为核心竞争力,从 1.0 到 3.7 持续迭代:

版本发布时间总参数上下文架构特点
Gemini 1.02023-12未公开32K首个版本,原生多模态
Gemini 1.52024-02未公开1M-2M突破性长上下文
Gemini 2.02024-12未公开1MAgentic AI 时代开启
Gemini 2.52025-03未公开1MThinking 模型,可配置推理预算
Gemini 3 Pro2025-11未公开1M首个 3.0 旗舰,Sparse MoE
Gemini 3.7 Flash2026-08未公开1M+当前主力,750M+ MAU

Llama 家族(Meta)

从完全开源到引入 MoE 架构,Llama 系列是开源生态的基石:

版本发布时间总参数活跃参数上下文架构特点
Llama 12023-027B-65B7B-65B2KDecoder-only,RoPE,RMSNorm,SwiGLU
Llama 22023-077B-70B7B-70B4KGQA(大模型),RLHF Chat 版本
Llama 32024-048B/70B8B/70B8K128K vocab,GQA 全系,15T tokens
Llama 3.12024-078B-405B8B-405B128K405B 旗舰,RoPE scaling θ=500K
Llama 3.22024-091B-90B1B-90B128K视觉模型 + 边缘模型(1B/3B)
Llama 3.32024-1270B70B128K后训练优化,接近 405B 性能
Llama 4 Scout2025-04~109B17B10MMoE(16 experts),iRoPE,原生多模态
Llama 4 Maverick2025-04~400B17B1MMoE(128 experts),视频理解
Llama 4 Behemoth训练中~2T288B-16 experts,教师模型

Qwen 家族(Alibaba)

迭代最密集的开源家族,从文本到全模态,从 Dense 到 MoE 混合架构:

版本发布时间总参数活跃参数上下文架构特点
Qwen2023-097B/14B/72B7B/14B/72B4K-8KDecoder-only,超大 BPE 词表
Qwen 1.52024-020.5B-72B0.5B-72B4K-32K多尺寸覆盖,早期 MoE 实验
Qwen 22024-060.5B-72B0.5B-72B128KMoE + GQA,Apache 2.0
Qwen 2.52024-090.5B-72B0.5B-72B128K18T tokens,Coder/Math 专用分支
Qwen 2.5-Max2025-01MoE未公开1M首个大规模 MoE,API 专属
Qwen 32025-040.6B-235B0.6B-235B128K-1MHybrid Thinking,Apache 2.0 全系
Qwen 3.5-Plus2026-03MoE未公开1MEarly Fusion 多模态,Gated DeltaNet
Qwen 3.7-Max2026-05MoE未公开1M+当前旗舰,119 语言支持

DeepSeek 家族

以 MLA 注意力机制和极致性价比著称,开源 MoE 模型的标杆:

版本发布时间总参数活跃参数上下文架构特点
DeepSeek V22024-05236B21B128KMLA + MoE,首创多头隐式注意力
DeepSeek V2.52024-09236B21B64KV2 的后训练优化版
DeepSeek V32025-12671B37B128K64 experts,top-8 routing,FP8 训练
DeepSeek V3.12025-08671B37B128K升级版 V3,推理能力增强
DeepSeek V3.22025-12671B37B128KAgent 能力大幅提升
DeepSeek V4-Pro2026-04未公开未公开128K原生 Responses API,Agent 能力
DeepSeek V4-Flash2026-07未公开未公开128K轻量高效版,思考强度可控
DeepSeek-R12025-01671B37B128K推理专用,Chain-of-Thought 微调
DeepSeek Coder V22025-06236B21B128K代码专用,100+ 语言

Mistral 家族(Mistral AI)

欧洲 AI 独角兽,以架构创新著称——Sliding Window Attention 和 MoE 的早期采用者:

版本发布时间总参数活跃参数上下文架构特点
Mistral 7B2023-097B7B8KSliding Window Attention + GQA,Apache 2.0
Mixtral 8x7B2023-1246.7B12.9B32K首个 MoE 模型(8 experts,2 active)
Mixtral 8x22B2024-04141B39B65K更大规模 MoE,函数调用
Mistral Large 22024-07123B123B128K64层 Dense,GQA,Mistral V3 tokenizer
Codestral2024-0522B22B32K代码补全专用,Fill-in-the-Middle
Codestral Mamba2024-077B7B256KState Space Model,线性复杂度
Mistral Large 32025-12675B41B256KGranular MoE,Apache 2.0 开源
Mistral Medium 3.52026-04128B128B256KDense,统一指令/推理/编码/视觉
Mistral Small 42026-03119B6B256KMoE,统一多模态,Modified MIT

Grok 家族(xAI)

Elon Musk 入局 AI 的载体,以超大上下文和 X 平台深度整合为特色:

版本发布时间总参数活跃参数上下文架构特点
Grok-12023-11314B86B8KMoE(8 experts,2 active),Apache 2.0
Grok-1.52024-03未公开未公开128K推理和数学能力提升
Grok-22024-08~300B(估)未公开128K图像理解,政治内容过滤
Grok-32025-02~3T(估)未公开128KColossus 超算(10万 H100),10× 提升
Grok 4.12025-11~3T(估)未公开2MThinking Tokens,情感智能
Grok 4.32026-04未公开未公开1M多步推理 + Agent 行为优化
Grok 4.62026-08未公开未公开500Kxhigh 推理级别,Agent 优化

3.5.3 模型家族参数演进图表

图 3.7:主要模型家族参数规模演进(对数刻度)
图 3.8:各家族上下文窗口长度演进

3.5.4 关键洞察

📈 参数规模的"通货膨胀"

从 GPT-3 的 175B 到 Llama 4 Behemoth 的 ~2T,参数规模在 3 年内增长了 10 倍以上。然而,MoE 架构的普及使得"总参数"不再等于"推理成本"——活跃参数才是关键指标。

/context 窗口的竞赛

上下文窗口从 2K(GPT-3) expansion 到 10M(Llama 4 Scout),增长了 5000 倍。这得益于 RoPE 外推、Ring Attention、Infini-Attention 等技术的突破。

🏗️ 架构收敛趋势

2025-2026 年,Decoder-only + GQA + SwiGLU + RMSNorm + RoPE 成为"黄金配方",Meta、阿里、Mistral、DeepSeek 独立收敛到同一架构。

🔓 开源 vs 闭源的博弈

Llama 和 Qwen 证明开源模型可以达到闭源模型性能的 90-95%,而成本仅为 1/10-1/100。DeepSeek 更是以极端性价比颠覆了行业定价。

对产品经理的启示:选择模型时不应只看参数规模,而应关注 活跃参数(推理成本)、上下文窗口(能力边界)和 架构类型(MoE vs Dense)。开源模型(Llama、Qwen、DeepSeek)在 2026 年已能满足绝大多数业务场景的需求,且成本远低于闭源 API。

4. 用户数量估算:间接方法与数据源 Triangulation

4.1 核心问题:为什么需要间接估算?

大多数 AI 公司选择不公开其模型的准确日活用户数(DAU)或月活用户数(MAU),原因包括:商业竞争、监管敏感、以及用户定义的模糊性(如何定义"用户"?API 调用算吗?)。因此,行业研究者和产品经理需要掌握一套间接估算方法,通过多源数据交叉验证来推断真实用户规模。

4.2 主要间接估算方法

图 4.1:用户数量间接估算方法体系

4.3 各数据源详细分析

方法一:SimilarWeb / 网页流量监测

通过第三方网页流量监测平台(如 SimilarWeb、Alexa)获取模型的网页端访问量,结合行业平均的访问-to-DAU 转换率进行估算。例如,ChatGPT 网页端月访问量约 30 亿次,假设 30% 的访问来自独立用户且用户月均访问 10 次,可估算 DAU 约 3000 万。

优点:数据公开可获取,时间序列完整;局限:仅覆盖网页端,遗漏移动端和 API 用户,且第三方监测数据存在偏差。

方法二:Sensor Tower / 移动端数据

通过 Sensor Tower 等移动应用监测平台获取 App Store 和 Google Play 的下载量与活跃用户数据。例如,ChatGPT App 在 2025 年底的月下载量约 5000 万,结合用户留存曲线可估算 DAU。

优点:移动端数据相对准确;局限:仅覆盖移动端用户,且 Sensor Tower 数据为付费服务。

方法三:OpenRouter / API 平台数据

OpenRouter 是一个模型 API 聚合平台,其周处理 token 量(2025 年约 25T tokens/周)是衡量模型调用量的重要指标。通过分析各模型在 OpenRouter 上的市场份额变化,可以间接推断不同模型的相对用户规模和增长趋势。

优点:直接反映 API 调用量;局限:仅覆盖通过 OpenRouter 的调用,不包含直接调用。

方法四:GitHub 生态指标

对于开源模型,GitHub Stars、Forks、下载量是衡量开发者采用程度的直接指标。HuggingFace 的模型下载量也是重要参考。例如,DeepSeek 模型的 HuggingFace 月下载量在 2025 年 12 月达到 2000 万次。

优点:数据公开透明;局限:仅反映开发者社区规模,不直接等于终端用户数。

方法五:WAU-to-DAU 转换率模型

基于行业基准建立周活-to-日活转换模型。对于强粘性的生产力工具,WAU/DAU 比率通常在 2-4 之间;对于低频使用的工具,比率可能超过 10。通过获取月活或周活数据后,可结合产品类型估算日活规模。

方法六:云计算平台流量分析

通过 Cloudflare、Akamai 等 CDN/边缘计算平台的公开数据,或通过分析模型的 API 响应延迟和带宽使用,间接推断调用量。Amazon Bedrock、Google Vertex AI 等平台偶尔会发布使用量统计。

4.4 估算方法对比

方法 数据可获取性 覆盖范围 精度 适用场景
SimilarWeb 流量 部分免费 网页端用户 面向消费者的聊天机器人
Sensor Tower 付费 移动端用户 中高 有独立 App 的产品
OpenRouter token 量 公开 API 调用 中高 开发者工具和 API 产品
GitHub/HF 指标 公开 开发者 开源模型
WAU-to-DAU 转换 需先有 WAU 数据 全部用户 有部分公开数据的模型
云平台流量分析 难以获取 全部用户 部署在主流云平台的模型

4.5 综合估算框架

在实际操作中,单一数据源的估算结果往往存在较大偏差。行业最佳实践是采用三角验证法(Triangulation),即同时使用至少三种独立数据源进行交叉验证:

  1. 获取至少三个独立数据源的原始数据
  2. 分别建立估算模型,得出三个独立的用户数量区间
  3. 分析区间重叠部分,取其交集作为最可能的真实值范围
  4. 对不重叠的部分,分析各数据源的系统性偏差来源
案例估算:以 ChatGPT 为例,2025 年底 SimilarWeb 月访问量约 30 亿次,Sensor Tower 月下载量约 5000 万,OpenRouter 市场份额约 15%。三源交叉验证后,估算 ChatGPT 的 DAU 在 3000 万至 5000 万之间,MAU 在 1.5 亿至 2 亿之间。该估算区间与 OpenAI 官方披露的"每周 1 亿用户"数据基本一致。

5. 总结与展望

5.1 核心发现

5.2 对产品经理的启示

5.3 未来研究方向