大语言模型参数规模、架构范式与用户数量估算方法研究
一份面向产品经理与技术决策者的综合调研报告
1. 引言:研究背景与目标
自 2017 年 Transformer 架构提出以来,大语言模型(LLM)经历了指数级发展。模型参数从 BERT 的 1.1 亿增长到最新模型的数万亿级别,架构从单一的编码器-解码器演化为多种范式并存,用户规模从学术研究走向数亿级大众市场。在这一背景下,如何准确评估模型的真实能力、架构特点与用户规模,成为产品决策、投资判断和学术研究的核心问题。
本报告围绕三个核心维度展开调研:
- 模型参数规模:主流模型的参数量级、披露策略与间接估算方法
- 模型架构:Transformer 三大范式(Encoder-only / Decoder-only / Encoder-Decoder)、MoE 稀疏架构、注意力机制变体(MHA/MQA/GQA/MLA)、FFN 变体(SwiGLU/GeGLU)、归一化与位置编码方法,以及 RWKV、Mamba 等新型结构
- 用户数量估算:在缺乏官方披露的情况下,如何通过多源数据交叉验证来间接推断日活用户数与调用量
2. 模型参数规模:现状、对比与估算方法
2.1 主流模型参数对比
大语言模型的参数规模在过去三年中持续增长。以下为截至 2026 年 8 月主流模型的参数规模对比:
| 模型 | 开发者 | 总参数量 | 活跃参数 | 架构类型 | 参数披露状态 |
|---|---|---|---|---|---|
| DeepSeek V4-Pro | DeepSeek | ~1.6T | ~49B | MoE | 已公开 |
| Qwen 3-Max | 阿里云 | 未公开 | 未公开 | MoE | 未公开 |
| GLM-5.2 | 智谱 AI | ~744B | ~40B | MoE | 已公开 |
| Kimi K2.6 | 月之暗面 | ~1T | ~32B | MoE | 已公开 |
| GPT-5.5 | OpenAI | 未公开 | ~100B(估) | Dense | 未公开 |
| Claude Opus 4.6 | Anthropic | 未公开 | 未公开 | 未公开 | 未公开 |
| Llama 4 Behemoth | Meta | ~2T(已宣布) | 未公开 | MoE | 已宣布未发布 |
| ERNIE 5.0 | 百度 | ~2.4T(声称) | 未公开 | MoE | 已公开 |
| Gemma 3 300B | ~300B | ~300B | Dense | 已公开 | |
| Mistral Large 2 | Mistral | ~123B | ~123B | Dense | 已公开 |
2.2 参数估算方法论
当公司选择不公开参数规模时,研究者发展出了多种间接估算方法:
方法一:API 定价回归法
模型 API 的输入/输出定价与参数规模存在近似正相关关系。通过收集多个已知参数模型的定价数据,建立回归模型,可对未公开模型进行参数估算。该方法的精度受市场策略影响较大,置信区间通常较宽。
方法二:IKP(Incompressible Knowledge Probes)
通过向模型输入精心设计的"不可压缩知识探针"(如特定事实性问题),测量模型的回答质量。参数量更大的模型通常能记忆更多事实,在特定探针测试上表现更好。该方法由 Epoch AI 等研究机构推动,常用于估算 GPT-5.5 等未公开模型的活跃参数规模。
方法三:内存与推理速度反推
通过分析模型在特定硬件上的推理速度、显存占用和上下文长度,结合已知的架构假设(如层数、隐藏维度),反向推算参数规模。该方法需要对模型架构有较强的假设,适用于开源或半开源模型。
2.3 MoE 架构的参数特殊性
混合专家(Mixture of Experts, MoE)架构的兴起使得"总参数量"与"活跃参数量"之间出现了显著差异。以 DeepSeek V4-Pro 为例,其总参数量约 1.6T,但每个 token 只激活约 49B 参数,实际计算量远小于总参数量所暗示的规模。这种设计在保持模型容量的同时大幅降低了推理成本,但也使得不同模型之间的参数量对比失去了直接意义。
3. 模型架构:Transformer 范式、变体与新兴结构
3.1 Transformer 基础架构回顾
2017 年,Google 在论文《Attention Is All You Need》中提出 Transformer 架构,核心组件为自注意力机制(Self-Attention)与前馈神经网络(FFN)。经过近十年发展,Transformer 衍生出多种变体。以下从四个核心维度——注意力机制、前馈网络、归一化方法和位置编码——深入剖析现代 LLM 的架构细节。
3.1.1 注意力机制详解:从 MHA 到 MLA
自注意力机制是 Transformer 的核心算子。其基本形式为:将输入序列映射为 Query(Q)、Key(K)、Value(V)三个矩阵,通过计算 Q 与 K 的相似度得到注意力权重,再对 V 加权求和。不同注意力变体的核心差异在于多头的 Q/K/V 投影方式以及由此产生的 KV Cache 显存开销差异。
四种注意力变体对比
| 变体 | Q 投影 | K 投影 | V 投影 | KV Cache 大小 | 推理速度 | 模型质量 | 代表模型 |
|---|---|---|---|---|---|---|---|
| MHA(多头注意力) | 每头独立 | 每头独立 | 每头独立 | 2 × L × d × h | 慢 | 最优 | 原始 Transformer、GPT-3 |
| MQA(多查询注意力) | 每头独立 | 全部共享 | 全部共享 | 2 × L × d | 快 | 略有下降 | PaLM、Gemini |
| GQA(分组查询注意力) | 每头独立 | 分组共享 | 分组共享 | 2 × L × d × g | 中等 | 接近 MHA | Llama 2/3、Mistral、Qwen |
| MLA(多头潜在注意力) | 低秩压缩 | 低秩压缩 | 低秩压缩 | 显著降低 | 最快 | 接近 MHA | DeepSeek V2/V3/V4 |
MLA 的数学原理
MLA 的核心思想是将 K 和 V 投影矩阵进行低秩分解。传统 MHA 中,K = W_K · x,V = W_V · x,其中 W_K 和 W_V 的维度为 d × d。MLA 将其分解为:K = W_K^D · W_K^U · x,V = W_V^D · W_V^U · x,其中 W_K^D 和 W_V^D 是共享的低维投影矩阵。这样,KV Cache 只需要存储低维的压缩表示,而非完整的 K 和 V 向量。
2025 年的 TransMLA 论文(arxiv 2502.07864)进一步证明了 GQA 可以被表示为 MLA 的一种特例,统一了二者的数学框架。
3.1.2 前馈网络(FFN)变体:从标准 FFN 到 SwiGLU
Transformer 中的 FFN 层通常由两个线性变换和一个非线性激活函数组成,是模型容量的主要来源。标准 FFN 的形式为:
不同 FFN 变体的核心差异在于激活函数和是否引入门控机制:
| 变体 | 公式 | 激活函数 | 门控机制 | 参数效率 | 代表模型 |
|---|---|---|---|---|---|
| Standard FFN | W₂ · GELU(W₁ · x) | GELU | 无 | 基准 | BERT、原始 Transformer |
| SwiGLU | (W₁·x) ⊙ Swish(W₃·x) · W₂ | Swish (SiLU) | 有(W₃ 门控) | 更高 | PaLM、Llama、Gemini |
| GeGLU | (W₁·x) ⊙ GELU(W₃·x) · W₂ | GELU | 有 | 更高 | 部分模型使用 |
| Gated MLP | 通用门控 FFN 家族 | 多种 | 有 | 更高 | 前沿模型探索中 |
其中 SwiGLU 的核心优势在于:在相同计算量下,门控机制允许模型更有效地选择性激活神经元,从而在相同 FLOPs 下获得更好的性能。实验表明,SwiGLU 相比 Standard FFN 在相同模型规模下 perplexity 降低约 5-10%。
3.1.3 归一化方法:RMSNorm、DeepNorm 与 QK-Norm
归一化层在 Transformer 的稳定训练中扮演关键角色。不同归一化方法的计算开销和训练稳定性各有差异:
| 方法 | 公式 | 计算开销 | 训练稳定性 | 代表模型 |
|---|---|---|---|---|
| LayerNorm | (x - μ) / σ · γ + β | 高(需计算均值和方差) | 好 | 原始 Transformer、BERT |
| RMSNorm | x / RMS(x) · γ | 低(无需均值计算) | 好 | Llama、DeepSeek、Mistral、Gemma |
| DeepNorm | LayerNorm + 残差缩放 | 高 | 极深模型专用 | DeepNet(100+ 层) |
| Sandwich Norm | 子层前+后各一次 LayerNorm | 高 | 好 | 部分实验架构 |
| QK-Norm | 对 Q、K 做归一化 | 低 | 稳定注意力训练 | Gemma、部分新模型 |
当前趋势:RMSNorm 已成为现代 LLM 的事实标准,几乎所有主流 decoder-only 模型(Llama、DeepSeek、Mistral、Gemma)都采用 RMSNorm 替代 LayerNorm,以减少约 15-20% 的归一化计算开销。QK-Norm 则在训练稳定性要求较高的场景中被采用。
3.1.4 位置编码方法:RoPE、ALiBi、YaRN 与 NoPE
由于 Transformer 的自注意力机制本身不感知序列顺序,位置编码是注入序列顺序信息的关键组件。以下是主流位置编码方法的对比:
| 方法 | 核心原理 | 序列外推能力 | 计算开销 | 代表模型 |
|---|---|---|---|---|
| Absolute PE(绝对位置编码) | 为每个位置学习独立的嵌入向量 | 差(需固定长度) | 低 | 原始 Transformer、BERT |
| Sinusoidal PE(正弦位置编码) | 三角函数编码,可外推 | 中等 | 极低 | 原始 Transformer |
| RoPE(旋转位置编码) | 通过旋转矩阵编码相对位置 | 好(配合缩放) | 低 | Llama、Qwen、DeepSeek、Mistral |
| ALiBi(线性偏置) | 向注意力分数添加线性偏置 | 极好 | 极低 | BLOOM、MPT |
| YaRN(NTK 感知 RoPE) | NTK 感知的 RoPE 频率缩放 | 极好 | 低 | Llama(扩展上下文) |
| NoPE(无位置编码) | 不显式编码位置 | 取决于架构 | 零 | 部分 ViT、实验性 LLM |
当前趋势:RoPE 是 2024-2025 年 decoder-only 模型的绝对主流,几乎所有主流模型(Llama、Qwen、DeepSeek、Mistral)都采用 RoPE。其优势在于相对位置编码的自然性——两个 token 之间的注意力只取决于它们的相对距离,与绝对位置无关。YaRN 进一步通过 NTK 感知的频率缩放,使 RoPE 可以外推到远超训练长度的上下文(例如从 4K 训练扩展到 128K 推理)。
3.2 三大 Transformer 范式
根据编码器-解码器的使用方式,Transformer 架构可分为三大范式:
Encoder-only(仅编码器)
代表模型:BERT、RoBERTa、DeBERTa
双向自注意力,每个 token 可以同时关注左右两侧上下文。预训练任务为掩码语言模型(MLM)和下一句预测(NSP)。适用于分类、命名实体识别、语义搜索等理解型任务。
Encoder-only
Decoder-only(仅解码器)
代表模型:GPT 系列、Llama、Claude、Gemini
单向(因果)自注意力,每个 token 只能关注其之前的 token。预训练任务为因果语言模型(CLM)——预测下一个 token。是当前生成式 AI 的主流架构,适用于对话、代码生成、推理等任务。
Decoder-only
Encoder-Decoder(编解码)
代表模型:T5、BART、mBART
编码器与解码器都存在,编码器双向处理输入,解码器单向生成输出。预训练任务通常为去噪自编码器(Span Corruption)。在机器翻译、文本摘要等序列到序列任务中表现优异。
Encoder-Decoder
3.3 MoE(混合专家) vs Dense(稠密架构)
除编码器-解码器范式外,模型的另一关键架构差异在于 FFN 层的设计:
| 维度 | Dense 架构 | MoE 架构 |
|---|---|---|
| 代表模型 | GPT-4、Llama 3、Mistral Large | DeepSeek V4、Mixtral、Qwen3 |
| 每个 token 激活参数 | 全部参数 | 仅部分专家(通常 2-8 个) |
| 推理成本 | 高 | 显著降低 |
| 训练成本 | 相对低(数据利用更高效) | 高(需更多数据) |
| 部署复杂度 | 简单 | 复杂(需路由器+多专家) |
3.4 新型架构:RWKV、Mamba、Hyena 与混合结构
除 Transformer 及其变体外,研究者提出了多种新型架构,试图解决 Transformer 的二次复杂度问题:
RWKV
Receptance Weighted Key-Value,一种线性复杂度的 RNN 变体。通过创新的 WKV(Weighted Key-Value)算子,实现了与 Transformer 相当的并行训练能力,同时具备线性推理复杂度。RWKV-6(2024)引入了更高效的注意力变体,RWKV-7 进一步优化。已在某些基准上达到 GPT-4 级别的性能。
RWKV
Mamba
状态空间模型(SSM),由 Carnegie Mellon 大学提出。通过选择性状态空间机制,实现了线性序列建模能力。Mamba-2(2024)进一步引入结构化状态空间,提升了训练并行度。在长序列任务(如 DNA 建模、音频处理)上表现优异。
Mamba
Hyena
长卷积(Long Convolution)+ 隐式门控的架构。通过层级化的卷积核实现亚二次复杂度,在序列长度 8K-64K 范围内表现接近 Transformer。Hyena Hierarchy 是当前最成熟的版本。
Hyena
混合架构:后 Transformer 时代的方向
纯 SSM/RNN 架构在某些场景下仍有局限性(如精确的上下文检索)。因此,将 Transformer 注意力层与 SSM/RNN 层交替堆叠的混合架构成为新的研究热点:
| 模型 | 架构组成 | 总参数 | 特点 |
|---|---|---|---|
| Jamba | Mamba + Transformer(交替层) | 398B(活跃 52B) | 首个成功的 SSM+Transformer 混合模型 |
| StripedHydra | Hyena + Transformer | 实验规模 | 在长上下文任务中表现突出 |
| FG-VQA | RWKV + 注意力分支 | 实验规模 | 面向视觉问答的混合架构 |
| Lightning Attention | 线性注意力 + 分块处理 | 实验规模 | 面向极长序列(100K+ tokens) |
3.5 主要模型家族版本演进与参数对比
了解各大公司模型家族的版本演进路径,有助于理解技术竞争格局和架构选型趋势。本节梳理了 2023-2026 年间 8 个主要模型家族的版本历史、参数规模变化和架构演进路线。
3.5.1 模型家族概览
截至 2026 年 8 月,主要商业/开源模型家族呈现以下发展态势:
🏢 开源/开放权重家族
- Llama (Meta):完全开源,社区驱动,从 7B 演进到 MoE 2T+
- Qwen (Alibaba):Apache 2.0 开源,多尺寸覆盖,多模态领先
- DeepSeek:Apache 2.0 开源,MoE + MLA 架构创新者
- Mistral (Mistral AI):欧洲开源旗舰,Sliding Window Attention 先驱
- Grok (xAI):Grok-1 开源,后续转为闭源
🔒 闭源商业家族
- GPT (OpenAI):行业标杆,从 GPT-3 到 GPT-5 系列,参数规模持续领先
- Claude (Anthropic):安全对齐先驱,Dense Transformer 坚守者
- Gemini (Google):原生多模态,DeepMind + Google Brain 合并产物
3.5.2 各家族版本演进详情
GPT 家族(OpenAI)
作为行业标杆,GPT 系列经历了从 117M 到估计 1.76T 参数的跨越,始终引领技术潮流:
| 版本 | 发布时间 | 总参数 | 活跃参数 | 上下文 | 架构特点 |
|---|---|---|---|---|---|
| GPT-1 | 2018-06 | 117M | 117M | 512 | 12层 Decoder-only,MHA |
| GPT-2 | 2019-02 | 1.5B | 1.5B | 1K | 48层 Decoder-only,MHA |
| GPT-3 | 2020-05 | 175B | 175B | 2K | 96层 Dense,MHA,首次展示 Few-shot 能力 |
| GPT-3.5 | 2022-11 | ~175B | ~175B | 4K | GPT-3 + RLHF 微调,ChatGPT 基础 |
| GPT-4 | 2023-03 | 未公开 | 未公开 | 8K/32K | 传闻 MoE(8个专家,2 active),多模态 |
| GPT-4o | 2024-05 | 未公开 | 未公开 | 128K | 全模态(文本、图像、音频) |
| o1 | 2024-09 | 未公开 | 未公开 | 128K-200K | 推理模型,Chain-of-Thought 训练 |
| GPT-5 | 2025-08 | 未公开 | 未公开 | 272K in + 128K reasoning | 原生多模态 + 推理模式 |
| GPT-5.6 Sol | 2026-07 | ~1.76T(估) | ~1.76T(估) | 1M | MoE 架构,旗舰级 |
Claude 家族(Anthropic)
Anthropic 坚持 Dense Transformer 路线,不采用 MoE 架构,以安全对齐和长上下文见长:
| 版本 | 发布时间 | 总参数 | 上下文 | 架构特点 |
|---|---|---|---|---|
| Claude 1/2 | 2023 | 未公开 | 100K | 早期 Dense 模型 |
| Claude 3 Opus | 2024-03 | 未公开 | 200K | 首个三 tier 模型(Opus/Sonnet/Haiku) |
| Claude 3.5 Sonnet | 2024-06 | 未公开 | 200K | 性价比颠覆者,编程能力突出 |
| Claude 3.7 Sonnet | 2025-02 | 未公开 | 200K | 首个混合推理模型 |
| Claude Opus 4 | 2025-05 | 未公开 | 1M | 编码和 Agent 优化 |
| Claude Opus 4.7 | 2026-04 | 未公开 | 1M | 软件工程 + 视觉 |
| Claude Fable 5 | 2026-06 | 未公开 | 1M+ | 首个 Mythos-class 通用版 |
Gemini 家族(Google DeepMind)
以原生多模态和超长上下文为核心竞争力,从 1.0 到 3.7 持续迭代:
| 版本 | 发布时间 | 总参数 | 上下文 | 架构特点 |
|---|---|---|---|---|
| Gemini 1.0 | 2023-12 | 未公开 | 32K | 首个版本,原生多模态 |
| Gemini 1.5 | 2024-02 | 未公开 | 1M-2M | 突破性长上下文 |
| Gemini 2.0 | 2024-12 | 未公开 | 1M | Agentic AI 时代开启 |
| Gemini 2.5 | 2025-03 | 未公开 | 1M | Thinking 模型,可配置推理预算 |
| Gemini 3 Pro | 2025-11 | 未公开 | 1M | 首个 3.0 旗舰,Sparse MoE |
| Gemini 3.7 Flash | 2026-08 | 未公开 | 1M+ | 当前主力,750M+ MAU |
Llama 家族(Meta)
从完全开源到引入 MoE 架构,Llama 系列是开源生态的基石:
| 版本 | 发布时间 | 总参数 | 活跃参数 | 上下文 | 架构特点 |
|---|---|---|---|---|---|
| Llama 1 | 2023-02 | 7B-65B | 7B-65B | 2K | Decoder-only,RoPE,RMSNorm,SwiGLU |
| Llama 2 | 2023-07 | 7B-70B | 7B-70B | 4K | GQA(大模型),RLHF Chat 版本 |
| Llama 3 | 2024-04 | 8B/70B | 8B/70B | 8K | 128K vocab,GQA 全系,15T tokens |
| Llama 3.1 | 2024-07 | 8B-405B | 8B-405B | 128K | 405B 旗舰,RoPE scaling θ=500K |
| Llama 3.2 | 2024-09 | 1B-90B | 1B-90B | 128K | 视觉模型 + 边缘模型(1B/3B) |
| Llama 3.3 | 2024-12 | 70B | 70B | 128K | 后训练优化,接近 405B 性能 |
| Llama 4 Scout | 2025-04 | ~109B | 17B | 10M | MoE(16 experts),iRoPE,原生多模态 |
| Llama 4 Maverick | 2025-04 | ~400B | 17B | 1M | MoE(128 experts),视频理解 |
| Llama 4 Behemoth | 训练中 | ~2T | 288B | - | 16 experts,教师模型 |
Qwen 家族(Alibaba)
迭代最密集的开源家族,从文本到全模态,从 Dense 到 MoE 混合架构:
| 版本 | 发布时间 | 总参数 | 活跃参数 | 上下文 | 架构特点 |
|---|---|---|---|---|---|
| Qwen | 2023-09 | 7B/14B/72B | 7B/14B/72B | 4K-8K | Decoder-only,超大 BPE 词表 |
| Qwen 1.5 | 2024-02 | 0.5B-72B | 0.5B-72B | 4K-32K | 多尺寸覆盖,早期 MoE 实验 |
| Qwen 2 | 2024-06 | 0.5B-72B | 0.5B-72B | 128K | MoE + GQA,Apache 2.0 |
| Qwen 2.5 | 2024-09 | 0.5B-72B | 0.5B-72B | 128K | 18T tokens,Coder/Math 专用分支 |
| Qwen 2.5-Max | 2025-01 | MoE | 未公开 | 1M | 首个大规模 MoE,API 专属 |
| Qwen 3 | 2025-04 | 0.6B-235B | 0.6B-235B | 128K-1M | Hybrid Thinking,Apache 2.0 全系 |
| Qwen 3.5-Plus | 2026-03 | MoE | 未公开 | 1M | Early Fusion 多模态,Gated DeltaNet |
| Qwen 3.7-Max | 2026-05 | MoE | 未公开 | 1M+ | 当前旗舰,119 语言支持 |
DeepSeek 家族
以 MLA 注意力机制和极致性价比著称,开源 MoE 模型的标杆:
| 版本 | 发布时间 | 总参数 | 活跃参数 | 上下文 | 架构特点 |
|---|---|---|---|---|---|
| DeepSeek V2 | 2024-05 | 236B | 21B | 128K | MLA + MoE,首创多头隐式注意力 |
| DeepSeek V2.5 | 2024-09 | 236B | 21B | 64K | V2 的后训练优化版 |
| DeepSeek V3 | 2025-12 | 671B | 37B | 128K | 64 experts,top-8 routing,FP8 训练 |
| DeepSeek V3.1 | 2025-08 | 671B | 37B | 128K | 升级版 V3,推理能力增强 |
| DeepSeek V3.2 | 2025-12 | 671B | 37B | 128K | Agent 能力大幅提升 |
| DeepSeek V4-Pro | 2026-04 | 未公开 | 未公开 | 128K | 原生 Responses API,Agent 能力 |
| DeepSeek V4-Flash | 2026-07 | 未公开 | 未公开 | 128K | 轻量高效版,思考强度可控 |
| DeepSeek-R1 | 2025-01 | 671B | 37B | 128K | 推理专用,Chain-of-Thought 微调 |
| DeepSeek Coder V2 | 2025-06 | 236B | 21B | 128K | 代码专用,100+ 语言 |
Mistral 家族(Mistral AI)
欧洲 AI 独角兽,以架构创新著称——Sliding Window Attention 和 MoE 的早期采用者:
| 版本 | 发布时间 | 总参数 | 活跃参数 | 上下文 | 架构特点 |
|---|---|---|---|---|---|
| Mistral 7B | 2023-09 | 7B | 7B | 8K | Sliding Window Attention + GQA,Apache 2.0 |
| Mixtral 8x7B | 2023-12 | 46.7B | 12.9B | 32K | 首个 MoE 模型(8 experts,2 active) |
| Mixtral 8x22B | 2024-04 | 141B | 39B | 65K | 更大规模 MoE,函数调用 |
| Mistral Large 2 | 2024-07 | 123B | 123B | 128K | 64层 Dense,GQA,Mistral V3 tokenizer |
| Codestral | 2024-05 | 22B | 22B | 32K | 代码补全专用,Fill-in-the-Middle |
| Codestral Mamba | 2024-07 | 7B | 7B | 256K | State Space Model,线性复杂度 |
| Mistral Large 3 | 2025-12 | 675B | 41B | 256K | Granular MoE,Apache 2.0 开源 |
| Mistral Medium 3.5 | 2026-04 | 128B | 128B | 256K | Dense,统一指令/推理/编码/视觉 |
| Mistral Small 4 | 2026-03 | 119B | 6B | 256K | MoE,统一多模态,Modified MIT |
Grok 家族(xAI)
Elon Musk 入局 AI 的载体,以超大上下文和 X 平台深度整合为特色:
| 版本 | 发布时间 | 总参数 | 活跃参数 | 上下文 | 架构特点 |
|---|---|---|---|---|---|
| Grok-1 | 2023-11 | 314B | 86B | 8K | MoE(8 experts,2 active),Apache 2.0 |
| Grok-1.5 | 2024-03 | 未公开 | 未公开 | 128K | 推理和数学能力提升 |
| Grok-2 | 2024-08 | ~300B(估) | 未公开 | 128K | 图像理解,政治内容过滤 |
| Grok-3 | 2025-02 | ~3T(估) | 未公开 | 128K | Colossus 超算(10万 H100),10× 提升 |
| Grok 4.1 | 2025-11 | ~3T(估) | 未公开 | 2M | Thinking Tokens,情感智能 |
| Grok 4.3 | 2026-04 | 未公开 | 未公开 | 1M | 多步推理 + Agent 行为优化 |
| Grok 4.6 | 2026-08 | 未公开 | 未公开 | 500K | xhigh 推理级别,Agent 优化 |
3.5.3 模型家族参数演进图表
3.5.4 关键洞察
📈 参数规模的"通货膨胀"
从 GPT-3 的 175B 到 Llama 4 Behemoth 的 ~2T,参数规模在 3 年内增长了 10 倍以上。然而,MoE 架构的普及使得"总参数"不再等于"推理成本"——活跃参数才是关键指标。
/context 窗口的竞赛
上下文窗口从 2K(GPT-3) expansion 到 10M(Llama 4 Scout),增长了 5000 倍。这得益于 RoPE 外推、Ring Attention、Infini-Attention 等技术的突破。
🏗️ 架构收敛趋势
2025-2026 年,Decoder-only + GQA + SwiGLU + RMSNorm + RoPE 成为"黄金配方",Meta、阿里、Mistral、DeepSeek 独立收敛到同一架构。
🔓 开源 vs 闭源的博弈
Llama 和 Qwen 证明开源模型可以达到闭源模型性能的 90-95%,而成本仅为 1/10-1/100。DeepSeek 更是以极端性价比颠覆了行业定价。
4. 用户数量估算:间接方法与数据源 Triangulation
4.1 核心问题:为什么需要间接估算?
大多数 AI 公司选择不公开其模型的准确日活用户数(DAU)或月活用户数(MAU),原因包括:商业竞争、监管敏感、以及用户定义的模糊性(如何定义"用户"?API 调用算吗?)。因此,行业研究者和产品经理需要掌握一套间接估算方法,通过多源数据交叉验证来推断真实用户规模。
4.2 主要间接估算方法
4.3 各数据源详细分析
方法一:SimilarWeb / 网页流量监测
通过第三方网页流量监测平台(如 SimilarWeb、Alexa)获取模型的网页端访问量,结合行业平均的访问-to-DAU 转换率进行估算。例如,ChatGPT 网页端月访问量约 30 亿次,假设 30% 的访问来自独立用户且用户月均访问 10 次,可估算 DAU 约 3000 万。
优点:数据公开可获取,时间序列完整;局限:仅覆盖网页端,遗漏移动端和 API 用户,且第三方监测数据存在偏差。
方法二:Sensor Tower / 移动端数据
通过 Sensor Tower 等移动应用监测平台获取 App Store 和 Google Play 的下载量与活跃用户数据。例如,ChatGPT App 在 2025 年底的月下载量约 5000 万,结合用户留存曲线可估算 DAU。
优点:移动端数据相对准确;局限:仅覆盖移动端用户,且 Sensor Tower 数据为付费服务。
方法三:OpenRouter / API 平台数据
OpenRouter 是一个模型 API 聚合平台,其周处理 token 量(2025 年约 25T tokens/周)是衡量模型调用量的重要指标。通过分析各模型在 OpenRouter 上的市场份额变化,可以间接推断不同模型的相对用户规模和增长趋势。
优点:直接反映 API 调用量;局限:仅覆盖通过 OpenRouter 的调用,不包含直接调用。
方法四:GitHub 生态指标
对于开源模型,GitHub Stars、Forks、下载量是衡量开发者采用程度的直接指标。HuggingFace 的模型下载量也是重要参考。例如,DeepSeek 模型的 HuggingFace 月下载量在 2025 年 12 月达到 2000 万次。
优点:数据公开透明;局限:仅反映开发者社区规模,不直接等于终端用户数。
方法五:WAU-to-DAU 转换率模型
基于行业基准建立周活-to-日活转换模型。对于强粘性的生产力工具,WAU/DAU 比率通常在 2-4 之间;对于低频使用的工具,比率可能超过 10。通过获取月活或周活数据后,可结合产品类型估算日活规模。
方法六:云计算平台流量分析
通过 Cloudflare、Akamai 等 CDN/边缘计算平台的公开数据,或通过分析模型的 API 响应延迟和带宽使用,间接推断调用量。Amazon Bedrock、Google Vertex AI 等平台偶尔会发布使用量统计。
4.4 估算方法对比
| 方法 | 数据可获取性 | 覆盖范围 | 精度 | 适用场景 |
|---|---|---|---|---|
| SimilarWeb 流量 | 部分免费 | 网页端用户 | 中 | 面向消费者的聊天机器人 |
| Sensor Tower | 付费 | 移动端用户 | 中高 | 有独立 App 的产品 |
| OpenRouter token 量 | 公开 | API 调用 | 中高 | 开发者工具和 API 产品 |
| GitHub/HF 指标 | 公开 | 开发者 | 低 | 开源模型 |
| WAU-to-DAU 转换 | 需先有 WAU 数据 | 全部用户 | 中 | 有部分公开数据的模型 |
| 云平台流量分析 | 难以获取 | 全部用户 | 高 | 部署在主流云平台的模型 |
4.5 综合估算框架
在实际操作中,单一数据源的估算结果往往存在较大偏差。行业最佳实践是采用三角验证法(Triangulation),即同时使用至少三种独立数据源进行交叉验证:
- 获取至少三个独立数据源的原始数据
- 分别建立估算模型,得出三个独立的用户数量区间
- 分析区间重叠部分,取其交集作为最可能的真实值范围
- 对不重叠的部分,分析各数据源的系统性偏差来源
5. 总结与展望
5.1 核心发现
- 参数规模进入"万亿时代":主流模型总参数量已普遍达到数百亿至数万亿级别,但 MoE 架构使得实际计算量远小于总参数量,单一参数对比的意义下降。
- 注意力机制持续演化:从 MHA 到 MQA、GQA、MLA,KV Cache 优化是核心驱动力。GQA 是当前主流,MLA 是前沿方向。
- Decoder-only 架构占据主导:GPT 范式凭借简洁性和生成能力成为通用 AI 的主流选择,但 Encoder-only 和 Encoder-Decoder 在特定任务中仍具优势。
- 架构组件趋于标准化:SwiGLU + RMSNorm + RoPE 已成为现代 LLM 的"黄金组合"。
- 新型架构崭露头角:RWKV、Mamba 等线性复杂度架构正在挑战 Transformer 的统治地位,混合架构可能是未来的演进方向。
- 用户估算需要三角验证:单一数据源无法准确反映用户规模,多源交叉验证是当前最可靠的方法论。
5.2 对产品经理的启示
- 评估模型时不应仅关注参数量,应结合 benchmark、推理成本、API 稳定性等综合维度。
- 理解架构差异有助于技术选型:GQA vs MLA 影响推理成本,RoPE vs ALiBi 影响长文本能力,SwiGLU vs Standard FFN 影响模型效率。
- 在选择模型架构时,应根据业务场景(理解 vs 生成 vs 翻译)选择合适范式,而非盲目跟风 Decoder-only。
- 用户规模评估应建立多源数据监测体系,避免过度依赖单一指标。
5.3 未来研究方向
- 更精确的参数估算方法(如基于知识探针的在线测量)
- 后 Transformer 时代架构的系统性对比基准
- 注意力机制的进一步优化(如动态路由注意力、稀疏注意力)
- 用户估算的自动化数据管道建设