模型架构
稠密模型
也称为 dense model、稠密 Transformer
先用大白话
稠密模型对处理的每个 token 都动用全部参数,不像稀疏模型那样把 token 路由给少数专家。
技术定义
稠密模型是所有权重都参与每次前向计算的神经网络,每 token 计算量与总参数量成正比。
工程细节
稠密 Transformer 是更简单的设计:每一层用全部权重处理每个 token。这让行为可预测、并行策略直接、单位参数的质量表现强,但服务成本随规模线性增长。混合专家模型打破了这一关联,每个 token 只激活一小部分权重,因此最大的前沿模型是稀疏的,而中小模型往往保持稠密。
为什么重要
稠密与稀疏之选驱动服务策略。稠密模型占用更少芯片、避开专家路由的复杂性;稀疏模型用大得多的内存占用和更重的跨芯片通信,换取单位算力更高的质量。
如何在 InferenceX 中解读
InferenceX 的覆盖以运营方实际部署的大型稀疏前沿模型为中心,Llama 级别的稠密基线则提供对照,展示没有专家路由时张量并行和内存压力的表现。
参考资料