AI 推理术语表
模型架构

激活参数

也称为 active parameters、activated parameters、激活参数量

先用大白话

激活参数是混合专家模型处理每个 token 时实际用到的权重,只占其庞大总规模的一小部分。

技术定义

激活参数是稀疏模型中参与计算单个 token 的那部分权重,包括共享层加上路由器选中的专家。

工程细节

一个混合专家模型可能拥有上万亿总参数,但每个 token 只经过几百亿。每 token 计算量随激活参数量增长,这是稀疏前沿模型运行成本可以接受的原因。内存则是另一回事:每个专家都必须驻留在 HBM 里随时待命,所以容量需求和并行方案跟随总参数量,尽管算术量跟随激活参数量。

为什么重要

总参数与激活参数之分解释了现代推理服务的大部分经济性:万亿参数模型因此可以部署,专家并行因此要跨多颗芯片,按总参数量比较模型也因此说明不了服务成本。

如何在 InferenceX 中解读

InferenceX 测试的 MoE 模型,包括 DeepSeek、Kimi、Qwen 和 MiniMax 家族,激活比都很低,其配置把专家分布到多个节点,正是因为总参数量决定了内存账单。