模型架构
激活参数
也称为 active parameters、activated parameters、激活参数量
先用大白话
激活参数是混合专家模型处理每个 token 时实际用到的权重,只占其庞大总规模的一小部分。
技术定义
激活参数是稀疏模型中参与计算单个 token 的那部分权重,包括共享层加上路由器选中的专家。
工程细节
一个混合专家模型可能拥有上万亿总参数,但每个 token 只经过几百亿。每 token 计算量随激活参数量增长,这是稀疏前沿模型运行成本可以接受的原因。内存则是另一回事:每个专家都必须驻留在 HBM 里随时待命,所以容量需求和并行方案跟随总参数量,尽管算术量跟随激活参数量。
为什么重要
总参数与激活参数之分解释了现代推理服务的大部分经济性:万亿参数模型因此可以部署,专家并行因此要跨多颗芯片,按总参数量比较模型也因此说明不了服务成本。
如何在 InferenceX 中解读
InferenceX 测试的 MoE 模型,包括 DeepSeek、Kimi、Qwen 和 MiniMax 家族,激活比都很低,其配置把专家分布到多个节点,正是因为总参数量决定了内存账单。