AI 推理术语表
并行策略

序列并行

也称为 sequence parallelism、SP、sequence parallel

先用大白话

序列并行把一条长序列切分到多颗芯片上,让一个请求的 token 由多个加速器同时处理。

技术定义

序列并行是沿序列的 token 维度在设备间做切分的策略,为超长输入分摊激活内存和注意力计算。

工程细节

张量并行切分的是权重,序列并行切分的是序列本身:每颗芯片持有一段 token 及对应的激活和 KV 状态。注意力因此需要通信,一颗芯片上的查询必须与其他芯片上的键值相遇,ring 式注意力算法把这些通信与计算重叠。在推理中,密切相关的上下文并行正是几十万 token 上下文的 prefill 变得可行的原因。

为什么重要

当单个请求而非批次过大时,序列式切分就是答案:一次百万 token 的 prefill 可能超出任何单芯片的内存和时间预算。它把上下文长度从一堵硬墙变成一个可扩展维度,代价是互连流量。

如何在 InferenceX 中解读

InferenceX 记录每个配置的完整并行方案。长上下文智能体场景正是序列和上下文切分选择连同互连质量,把单芯片规格相近的系统明显区分开的地方。