}

(文/汤普济 编辑/吕栋)

8月19日,智谱联合创始人、首席科学家唐杰在X平台谈及大模型的Scaling Law(尺度定律)时表示,行业过去一度将模型扩展等同于增加参数量,但现在这一思路正被修正。

参数规模固然重要,但大模型接下来如何继续Scaling,已经不能只看参数量。训练数据、后训练、推理计算以及模型上线后的运行成本,都需要被纳入算力分配的考量。

从今年6月下旬到现在,智谱股价已暴跌超60%,目前市值还有4700亿港元。

今年推出GLM-5时,智谱其实刚刚完成过一轮明显的参数扩张。GLM-4.5拥有355B总参数、32B激活参数,到GLM-5,总参数已经提高至744B,激活参数达到40B,预训练数据也从23万亿Token增加至28.5万亿Token。此后的GLM-5.1和GLM-5.2继续沿用智谱官方所称的744B-A40B规模。

到了GLM-5.3,智谱也没有继续增加参数,而是把训练资源放到了另外一个地方。按照唐杰的说法,GLM-5.3与GLM-5.2使用相同的基础模型、架构、总参数量和激活参数量,但智谱用了大约一个月扩大长程任务环境和强化学习训练。智谱在报告中写道,GLM-5.3在内部Z.ai Code Bench上的表现相比GLM-5.2提高约50%。

这背后其实对应着人工智能行业过去几年对Scaling Law的不断修正。唐杰认为,行业曾经集中追逐万亿参数模型,事后看是整个行业共同经历、又共同折返的一段弯路。

唐杰原文X

唐杰回顾称,2020年的研究一度让行业相信,随着计算资源增加,参数规模应该比训练数据增长得更快。此后GPT-3、Gopher和MT-NLG等模型纷纷向数千亿乃至万亿参数推进。

直到2022年,DeepMind发布Chinchilla研究,对约400个模型重新进行实验,发现在固定计算预算下,参数量和训练数据应该更加均衡地增长,而非一味扩大模型。70B参数的Chinchilla最终在多项指标上超过280B参数的Gopher,也让行业开始重新审视此前对“大参数”的追求。

业界对Scaling Law的探索并没有止步于Chinchilla,Chinchilla聚焦的是训练阶段的算力分配,但如今在模型上线投入大规模应用后,推理成本在模型生命周期中的占比越来越高。在部分高频使用场景下,与其继续扩大模型规模,不如用更多数据把较小模型训练得更加充分。唐杰认为,Llama 2 7B、Gemma 2 9B等模型此前都体现过类似思路。

MoE(混合专家)架构进一步改变了参数规模的含义,模型可以拥有数千亿甚至更高的总参数,但每个Token只激活其中一部分专家,因此总参数量和实际激活参数量已经不能等同看待。DeepSeek-V3就曾在报告中写道,V3的总参数达671B,但每个Token只激活37B参数。

唐杰将模型能力进一步拆成了“知识容量”和“推理能力”两个维度。在他看来,扩大总参数更有利于容纳知识和长尾信息,而复杂推理任务则更依赖实际激活的计算量、训练数据和推理深度,知识容量和推理能力未必需要沿着同一条Scaling路径提升。

唐杰写道,智谱此轮没有继续扩大GLM-5.3的参数规模,而是把更多资源投入长程任务环境和强化学习。他将模型Scaling比作调节多个“旋钮”:这一次智谱选择后训练这个旋钮,是因为该环节仍有更大的提升空间,并不意味着参数规模、预训练数据和单次前向计算已经不再重要。按照他的说法,智谱之后仍可能重新回到中期训练、预训练等“其他旋钮”中。

并非只有智谱一家在转动模型参数外的其他“旋钮”。今年2月,阿里发布Qwen3-Coder-Next时也表示,相比单纯扩大参数,该模型更侧重增加Agent任务和训练反馈。到了6月的Qwen-AgentWorld,阿里又进一步扩大模型训练所使用的交互环境。

学界也开始试图寻找规律。今年ICLR和ACL都出现了专门研究强化学习Scaling的工作,试图回答继续增加RL训练数据和算力后,模型能力能否像预训练一样按照一定规律增长。不过,目前得到的答案并不意味着参数已经失去作用。ACL的一项研究发现,更大的模型在RL训练中仍具有更高的数据和计算效率,同时强化学习本身也会出现收益逐渐饱和的趋势。

本文系观察者网独家稿件,未经授权,不得转载。