技术指南 / AI 基础设施
读懂推理曲线背后的语言。
解释 InferenceX 使用的智能体推理、基准指标、服务技术、数值格式与分布式系统概念。 各条目以实测行为和已发布的基准测试方案为依据。
- 术语
- 118
- 类别
- 8
- 参考文章
- 31
118 个术语
基准指标
并发量
基准指标
并发量就是系统同一时间正在服务多少个人或请求。
测试配置
基准指标
一套测试配置就是产生某条曲线的全部选择:模型、引擎、镜像、精度、并行策略和工作负载。
等交互性
基准指标
等交互性就是让不同系统以相同速度向用户显示文字,再比较背后的硬件效率。
端到端归一化交互性
基准指标
这个指标衡量一整条回答到达得有多快,既算首 token 之前的等待,也算之后的流式速度。
访存受限与计算受限
基准指标
当运算单元是瓶颈时工作负载是计算受限,当等待数据搬运是瓶颈时则是访存受限。
非官方运行
基准指标
非官方运行是尚未入库到已发布数据集的基准运行,但仍可通过 URL 叠加绘制在图表上。
服务级目标
SLO基准指标
SLO 是一套部署必须兑现的性能承诺,例如十条请求中有九条要在一秒内返回首 token。
交互性
基准指标
交互性表示模型开始回答后,单个用户看到新文字出现得有多快。
接受长度
AL基准指标
接受长度是指每次验证中完整模型实际认可的草稿 token 数,它决定了投机解码是否划算。
每 token 能耗
J/token基准指标
每 token 能耗表示系统产出一个 token 要花多少电,是每 token 成本在电力侧的对应指标。
每百万 token 成本
基准指标
它估算 AI 读取和生成一百万个 token 需要支付多少基础设施成本。
每美元 token 数
tok/$基准指标
每美元 token 数表示按图表注明的成本口径,每投入 1 美元基础设施开支可以产出多少 token。
每美元性能
基准指标
每美元性能表示每投入一美元运行系统,能够获得多少有效 AI 输出。
每输出 token 时间
TPOT基准指标
TPOT 是流式回答每个新片段之间的间隔;间隔越短,回答看起来越快越顺畅。
每兆瓦 token 吞吐量
基准指标
该指标衡量数据中心在固定电力额度下能产出多少 AI token。
模型算力利用率
MFU基准指标
MFU 把模型实际完成的有效运算与芯片理论峰值运算量相除,得到一个效率百分比。
首 token 时间
TTFT基准指标
TTFT 就是发送提示词后,到看到答案第一个片段前的“思考中……”时间。
输入与输出序列长度
ISL / OSL基准指标
输入长度是模型要读多少内容,输出长度是模型要写多少内容;8K/1K 表示长提示词配较短回答。
算术强度
基准指标
算术强度表示每搬运一个字节能做多少次运算,它决定瓶颈落在计算单元还是显存上。
吞吐量
基准指标
吞吐量就是整个系统每秒一共能完成多少工作。
尾部延迟
基准指标
尾部延迟描述的是最慢的那部分请求,而不是典型请求,因为用户真正会注意到的正是这些。
延迟
基准指标
延迟就是需要等待多久;流式回答既有开始前的等待,也有后续文字之间的停顿。
总体拥有成本
TCO基准指标
TCO 包含硬件采购,以及后续供电、制冷、网络和运维成本。
Goodput
基准指标
Goodput 只统计满足延迟目标的那部分工作量,看起来很快但赶不上截止时间的系统拿不到任何分数。
GPU 利用率
基准指标
GPU 利用率衡量加速器有多忙,但监控工具里常见的百分比可能很高,而真实效率仍然很低。
Pareto 前沿
基准指标
Pareto 前沿是一条“最佳权衡线”:线上的每个点都值得考虑,因为改善一项指标就必须牺牲另一项。
Roofline 曲线
基准指标
在 InferenceX 上,roofline 是按硬件配置在其最优点上画出的外包络线,用来展示它达到过的边界。
Warmup
基准指标
性能采集开始前先做一轮预热,让系统进入稳态,而不是在缓存为空的状态下被打分。
推理服务
草稿模型
推理服务
草稿模型是投机解码中那个又小又快的模型,先猜出若干后续 token,交给大模型一次性验证。
多 token 预测
MTP推理服务
MTP 让模型一次猜测多个后续 token 并一起验证,从而减少缓慢的逐 token 步骤。
分块 prefill
推理服务
分块 prefill 把长提示词分片读取,而不是一次性读完,这样其他用户在此期间仍能持续收到 token。
分离式推理
PD disaggregation推理服务
分离式推理把“读提示词”和“写答案”交给两组芯片,让每组都能针对自己的任务优化。
解码
推理服务
解码就是模型读完提示词后,一个 token 接一个 token 地写出答案。
离线推理
推理服务
离线推理处理一大堆没有用户在等的请求,唯一目标是每美元最多 token,而不是延迟。
连续批处理
推理服务
连续批处理让新请求在旧请求完成的瞬间就加入正在运行的批次,而不是等整个批次全部结束。
批处理
推理服务
批处理就像让多名乘客坐同一辆巴士:芯片一次处理多个请求,让每趟计算完成更多有效工作。
前缀缓存
推理服务
前缀缓存会记住重复开头的处理结果,例如相同系统提示词,让模型下次可以跳过这部分工作。
前缀缓存命中率
推理服务
命中率是指提示词中有多少 token 直接来自缓存而无需重算,在长会话中这通常是绝大部分。
推测解码
推理服务
推测解码让一个便宜的助手先起草多个 token,再由完整模型一次性审核,省去部分逐个生成步骤。
推理引擎
推理服务
推理引擎就像 AI 服务背后的交通调度员:它安排请求流转,并让芯片在正确时间执行正确任务。
预填充
推理服务
预填充就是模型先阅读并理解提示词,然后才开始写答案。
AI 推理
推理服务
把提示词、图片或音频交给已经训练好的模型,它会利用学到的知识给出答案。
EAGLE
推理服务
EAGLE 是一种为主模型起草多个可能后续 token 的方法,可让答案流式输出得更快。
KV 感知路由
推理服务
KV 感知路由把请求发给已经持有该会话状态的 worker,而不是发给当前最空闲的那个。
KV 缓存
推理服务
KV 缓存是模型对当前对话的工作记忆,让它生成新 token 时不必每次从头重读。
KV cache offload
推理服务
把芯片放不下的注意力状态暂存到主机内存,长会话下一轮就能直接恢复,而不必整段重算。
PagedAttention
推理服务
PagedAttention 像虚拟内存分页一样,把 KV cache 存进固定大小的小块,避免缓存内存浪费在用不到的空间上。
RadixAttention
推理服务
RadixAttention 把完成请求的 KV cache 按 token 内容存进基数树,任何新请求都能复用最长匹配前缀。
智能体推理
闭环基准测试
智能体推理
在闭环基准测试中,每个模拟用户会等待当前步骤完成,再按照该会话的依赖关系发送下一步请求。
轨迹回放
智能体推理
轨迹回放重现已记录会话的请求大小、先后关系与时间间隔,让基准测试按照原始工作负载的节奏发送请求。
智能体编码工作负载
智能体推理
编码智能体读取代码仓库、修改代码并运行工具,随后继续请求模型,直到完成任务;这一连串请求就是智能体编码工作负载。
智能体推理
智能体推理
智能体会通过多次模型请求完成一项任务,期间可能调用工具、保留会话状态,也可能把部分工作交给 subagent。
子智能体
智能体推理
子智能体由主 agent 启动,负责同一任务中的较小部分,并可能与其他工作同时运行。
AgentX
智能体推理
AgentX 是 InferenceX 用来测试完整长上下文、多轮编码智能体会话的工作负载。
AIPerf
智能体推理
AIPerf 是发送基准流量的厂商中立客户端,负责重建录制的 agent 会话并记录每条请求的时序。
并行策略
宽专家并行
Wide EP并行策略
宽专家并行把模型专家铺到大量芯片上,让每张芯片需要保存和移动的专家数据更少。
流水线并行
PP并行策略
流水线并行让每颗芯片负责一部分层,沿链条传递激活值,而不是把每一层都切开。
上下文并行
CP并行策略
上下文并行把一条长提示词拆到多颗芯片上,让它们分担读取提示词和扫描注意力状态的工作。
数据并行
DP并行策略
数据并行复制多份相同模型并分摊请求,就像多开几条相同的收银通道。
数据并行注意力
DPA并行策略
DP attention 让每个 rank 处理各自的一批序列并持有自己的缓存,而不是每个 rank 都存同一份副本。
序列并行
并行策略
序列并行把一条长序列切分到多颗芯片上,让一个请求的 token 由多个加速器同时处理。
张量并行
TP并行策略
张量并行把一次大型计算拆给多张芯片,让它们共同完成。
专家并行
EP并行策略
专家并行把模型中的不同“专家”分配给不同芯片,再把每个 token 送到需要的专家。
All-gather
并行策略
All-gather 是一种群体通信操作,结束时每颗芯片都拿到最初分散在所有芯片上的完整数据。
All-reduce
并行策略
All-reduce 让每张芯片完成一部分计算,再合并结果并把完整答案发回所有芯片。
All-to-all
并行策略
All-to-all 是一次有组织的交换:每张芯片都向其他每张芯片发送不同的数据包。
Reduce-scatter
并行策略
Reduce-scatter 把每颗芯片上对应位置的数据求和,然后让每颗芯片只保留合并结果中属于自己的那一片。
Scale-up 与 scale-out 网络
并行策略
Scale-up 是同一套芯片系统内部的超高速网络,scale-out 则连接不同服务器或机架。
硬件
电源使用效率
PUE硬件
PUE 衡量数据中心每向内部计算设备输送一瓦电,总共要消耗多少瓦。
高带宽内存
HBM硬件
HBM 是紧挨芯片的一小池超高速内存,推理时模型权重和工作数据都要放在这里。
内存带宽
硬件
内存带宽就像向芯片计算单元供给数据的管道宽度;管道越宽,计算单元越不容易空等。
热设计功耗
TDP硬件
TDP 是芯片设计上可持续消耗并以热量形式散发的功率,是每份加速器规格表上的标题瓦数。
远程直接内存访问
RDMA硬件
RDMA 让一台机器直接通过网络读写另一台机器的内存,两边的 CPU 都不用参与数据拷贝。
InfiniBand
IB硬件
InfiniBand 是连接 AI 集群中各台服务器的高速低延迟网络,承担 NVLink 够不到的跨节点流量。
NVL72
硬件
NVL72 是一个机架,其中 72 个加速器共享同一张高速网络,因而更像一台大机器而不是一个集群。
NVLink
硬件
NVLink 是 NVIDIA 芯片之间的高速公路,让多张芯片的协作远快于普通服务器网络。
UALink
硬件
UALink 是机柜内加速器之间高速 scale-up 链路的开放行业标准,是生态对 NVLink 的回应。
数值精度
仅权重量化
数值精度
仅权重量化只把存储的模型权重压到低精度,运算本身仍在较高精度格式下进行。
块缩放
数值精度
块缩放给每一小组低精度数值配一个共享缩放因子,找回超小格式自身缺失的动态范围。
量化
数值精度
量化用更少 bit 保存模型数字,让模型更小、更容易搬运,通常会带来经过控制的精度损失。
BF16
数值精度
BF16 是多数模型训练所用的 16 位格式,用它做推理也是量化方案精度对照的基准。
FP4
数值精度
FP4 只用 4 bit 表示模型数字,能让推理更小更快,但可保留的数值细节也更少。
FP8
数值精度
FP8 用紧凑的 8 位格式保存和计算模型数字,可减少内存占用并经常加快推理。
INT4
数值精度
INT4 用 4 位整数存放权重,把模型压小,让缺少原生 4 位浮点支持的硬件每个 token 少搬很多数据。
INT8
数值精度
INT8 用 8 位整数加缩放因子存储数值,内存相比 16 位格式减半,支持的硬件上算力翻倍。
KV cache 量化
数值精度
把对话缓存用更小的格式存放,让芯片装下更多上下文,并在生成时更快地把它读回来。
MXFP4
数值精度
MXFP4 让每小组 4 位数字拥有自己的缩放值,使极紧凑的数字仍保留足够可用范围。
NVFP4
数值精度
NVFP4 是针对 NVIDIA Blackwell 优化的 4 位模型数学格式,目标是少搬数据并利用最快的低精度硬件。
模型架构
稠密模型
模型架构
稠密模型对处理的每个 token 都动用全部参数,不像稀疏模型那样把 token 路由给少数专家。
多头潜在注意力
MLA模型架构
MLA 会压缩模型对历史 token 的“笔记”,让长对话占用更少内存、继续生成的成本更低。
分组查询注意力
GQA模型架构
分组查询注意力让多个查询头共享一组键值头,在几乎不损失质量的情况下缩小 KV cache。
滑动窗口注意力
SWA模型架构
滑动窗口注意力让某些层只看最近一段 token,因此窗口填满之后它的缓存就不再继续增长。
混合注意力
模型架构
混合模型在不同层使用不同的注意力类型,因此它的缓存是几种不同状态,而不是一块统一的数据。
混合专家模型
MoE模型架构
混合专家模型像一支大型专家团队:每个 token 只调用最合适的少数专家,无需每次动用全员。
激活参数
模型架构
激活参数是混合专家模型处理每个 token 时实际用到的权重,只占其庞大总规模的一小部分。
上下文窗口
模型架构
上下文窗口是模型一次能处理的最大 token 数,涵盖输入和到目前为止生成的全部内容。
稀疏注意力
模型架构
稀疏注意力只回看长上下文中最有用的部分,无需重新检查每个历史 token。
线性注意力
模型架构
线性注意力保存一份固定大小的运行摘要,而不是全部历史 token,因此内存不会随对话增长。
Reasoning 模型
模型架构
Reasoning 模型在回答前生成很长的隐藏思维链,用额外的输出 token 换取困难问题上更好的结果。
Tokenization
模型架构
Tokenization 把文本切分成模型实际读写的子词单元,所有性能和价格数字都以它计价。
软件栈
AITER
软件栈
AITER 是 AMD 调优过的 kernel 库,决定注意力和矩阵运算在 Instinct 芯片上究竟能跑多快。
ATOM
软件栈
ATOM 是 AMD 自研的推理引擎,是它在厂商专用运行时这条路线上的答案,而非上游开源引擎。
CUDA
软件栈
CUDA 是让程序在 NVIDIA 芯片上运行的软件工具箱。
CUDA graph
软件栈
CUDA graph 把一整串芯片操作录制一次并整体回放,从而免去逐个启动它们的开销。
CUTLASS
软件栈
CUTLASS 是 NVIDIA 的模板库,提供搭建接近硬件峰值速度的矩阵乘法 kernel 所需的积木。
FlashAttention
软件栈
FlashAttention 在高速片上内存中分块计算精确注意力,避免生成那个让注意力又慢又耗内存的巨大中间矩阵。
FlashInfer
软件栈
FlashInfer 是一个注意力 kernel 库,服务引擎直接调用它,而不必自己实现注意力。
GEMM
GEMM软件栈
GEMM 即通用矩阵乘法,是训练和推理神经网络时占据绝大部分算术量的那一种计算。
Kernel 融合
软件栈
Kernel 融合把多个小的芯片操作合并成一个,中间数据留在快速内存里而不是反复经过 HBM。
KV cache 管理器
软件栈
KV cache 管理器负责把注意力状态存放在芯片之外,并决定哪些保留、哪些淘汰、什么时候取回。
NCCL
NCCL软件栈
NCCL 是 NVIDIA 的集合通信库,在集合操作中负责芯片之间的数据搬运,RCCL 是 AMD 的对应实现。
NVIDIA Dynamo
软件栈
NVIDIA Dynamo 协调大量芯片 worker,负责路由请求、移动模型记忆,并把读提示词和写答案分配给合适的资源池。
ROCm
软件栈
ROCm 是让 AI 和高性能程序在 AMD 芯片上运行的软件工具箱。
SGLang
软件栈
SGLang 是用于快速服务语言模型的开源软件,提供面向复杂 AI 工作负载的调度和优化功能。
TensorRT-LLM
软件栈
TensorRT-LLM 是 NVIDIA 为自家芯片优化的 LLM 推理软件栈。
TileRT
软件栈
TileRT 是面向极低延迟单用户生成的推理运行时,它把模型编译成一个常驻程序,而不是许多次内核启动。
Triton
软件栈
Triton 是基于 Python 的加速器 kernel 编写语言,让 ML 工程师不写底层代码也能接近手工调优的速度。
vLLM
软件栈
vLLM 是开源软件,通过组织请求和芯片内存,让语言模型高效服务大量用户。
阅读基准曲线
完整曲线更能说明问题。
LLM 服务需要在单用户速度与总吞吐量之间取舍。InferenceX 使用完整 Pareto 曲线和等交互性比较,展示不同运行点上的真实权衡。单一最大吞吐点无法代表完整系统。
基于实测数据
每个定义都连接真实方案。
每个术语页都会链接到该概念真正影响实测结果的 InferenceX 文章,包括 MTP 接受行为、NVL72 Wide EP 扩展,以及硬件不变时的软件性能提升。