技术指南 / AI 基础设施

读懂推理曲线背后的语言。

解释 InferenceX 使用的智能体推理、基准指标、服务技术、数值格式与分布式系统概念。 各条目以实测行为和已发布的基准测试方案为依据。

术语
118
类别
8
参考文章
31

118 个术语

基准指标

并发量

基准指标

并发量就是系统同一时间正在服务多少个人或请求。

测试配置

基准指标

一套测试配置就是产生某条曲线的全部选择:模型、引擎、镜像、精度、并行策略和工作负载。

等交互性

基准指标

等交互性就是让不同系统以相同速度向用户显示文字,再比较背后的硬件效率。

端到端归一化交互性

基准指标

这个指标衡量一整条回答到达得有多快,既算首 token 之前的等待,也算之后的流式速度。

访存受限与计算受限

基准指标

当运算单元是瓶颈时工作负载是计算受限,当等待数据搬运是瓶颈时则是访存受限。

非官方运行

基准指标

非官方运行是尚未入库到已发布数据集的基准运行,但仍可通过 URL 叠加绘制在图表上。

服务级目标

SLO

基准指标

SLO 是一套部署必须兑现的性能承诺,例如十条请求中有九条要在一秒内返回首 token。

交互性

基准指标

交互性表示模型开始回答后,单个用户看到新文字出现得有多快。

接受长度

AL

基准指标

接受长度是指每次验证中完整模型实际认可的草稿 token 数,它决定了投机解码是否划算。

每 token 能耗

J/token

基准指标

每 token 能耗表示系统产出一个 token 要花多少电,是每 token 成本在电力侧的对应指标。

每百万 token 成本

基准指标

它估算 AI 读取和生成一百万个 token 需要支付多少基础设施成本。

每美元 token 数

tok/$

基准指标

每美元 token 数表示按图表注明的成本口径,每投入 1 美元基础设施开支可以产出多少 token。

每美元性能

基准指标

每美元性能表示每投入一美元运行系统,能够获得多少有效 AI 输出。

每输出 token 时间

TPOT

基准指标

TPOT 是流式回答每个新片段之间的间隔;间隔越短,回答看起来越快越顺畅。

每兆瓦 token 吞吐量

基准指标

该指标衡量数据中心在固定电力额度下能产出多少 AI token。

模型算力利用率

MFU

基准指标

MFU 把模型实际完成的有效运算与芯片理论峰值运算量相除,得到一个效率百分比。

首 token 时间

TTFT

基准指标

TTFT 就是发送提示词后,到看到答案第一个片段前的“思考中……”时间。

输入与输出序列长度

ISL / OSL

基准指标

输入长度是模型要读多少内容,输出长度是模型要写多少内容;8K/1K 表示长提示词配较短回答。

算术强度

基准指标

算术强度表示每搬运一个字节能做多少次运算,它决定瓶颈落在计算单元还是显存上。

吞吐量

基准指标

吞吐量就是整个系统每秒一共能完成多少工作。

尾部延迟

基准指标

尾部延迟描述的是最慢的那部分请求,而不是典型请求,因为用户真正会注意到的正是这些。

延迟

基准指标

延迟就是需要等待多久;流式回答既有开始前的等待,也有后续文字之间的停顿。

总体拥有成本

TCO

基准指标

TCO 包含硬件采购,以及后续供电、制冷、网络和运维成本。

Goodput

基准指标

Goodput 只统计满足延迟目标的那部分工作量,看起来很快但赶不上截止时间的系统拿不到任何分数。

GPU 利用率

基准指标

GPU 利用率衡量加速器有多忙,但监控工具里常见的百分比可能很高,而真实效率仍然很低。

Pareto 前沿

基准指标

Pareto 前沿是一条“最佳权衡线”:线上的每个点都值得考虑,因为改善一项指标就必须牺牲另一项。

Roofline 曲线

基准指标

在 InferenceX 上,roofline 是按硬件配置在其最优点上画出的外包络线,用来展示它达到过的边界。

Warmup

基准指标

性能采集开始前先做一轮预热,让系统进入稳态,而不是在缓存为空的状态下被打分。

推理服务

草稿模型

推理服务

草稿模型是投机解码中那个又小又快的模型,先猜出若干后续 token,交给大模型一次性验证。

多 token 预测

MTP

推理服务

MTP 让模型一次猜测多个后续 token 并一起验证,从而减少缓慢的逐 token 步骤。

分块 prefill

推理服务

分块 prefill 把长提示词分片读取,而不是一次性读完,这样其他用户在此期间仍能持续收到 token。

分离式推理

PD disaggregation

推理服务

分离式推理把“读提示词”和“写答案”交给两组芯片,让每组都能针对自己的任务优化。

解码

推理服务

解码就是模型读完提示词后,一个 token 接一个 token 地写出答案。

离线推理

推理服务

离线推理处理一大堆没有用户在等的请求,唯一目标是每美元最多 token,而不是延迟。

连续批处理

推理服务

连续批处理让新请求在旧请求完成的瞬间就加入正在运行的批次,而不是等整个批次全部结束。

批处理

推理服务

批处理就像让多名乘客坐同一辆巴士:芯片一次处理多个请求,让每趟计算完成更多有效工作。

前缀缓存

推理服务

前缀缓存会记住重复开头的处理结果,例如相同系统提示词,让模型下次可以跳过这部分工作。

前缀缓存命中率

推理服务

命中率是指提示词中有多少 token 直接来自缓存而无需重算,在长会话中这通常是绝大部分。

推测解码

推理服务

推测解码让一个便宜的助手先起草多个 token,再由完整模型一次性审核,省去部分逐个生成步骤。

推理引擎

推理服务

推理引擎就像 AI 服务背后的交通调度员:它安排请求流转,并让芯片在正确时间执行正确任务。

预填充

推理服务

预填充就是模型先阅读并理解提示词,然后才开始写答案。

AI 推理

推理服务

把提示词、图片或音频交给已经训练好的模型,它会利用学到的知识给出答案。

EAGLE

推理服务

EAGLE 是一种为主模型起草多个可能后续 token 的方法,可让答案流式输出得更快。

KV 感知路由

推理服务

KV 感知路由把请求发给已经持有该会话状态的 worker,而不是发给当前最空闲的那个。

KV 缓存

推理服务

KV 缓存是模型对当前对话的工作记忆,让它生成新 token 时不必每次从头重读。

KV cache offload

推理服务

把芯片放不下的注意力状态暂存到主机内存,长会话下一轮就能直接恢复,而不必整段重算。

PagedAttention

推理服务

PagedAttention 像虚拟内存分页一样,把 KV cache 存进固定大小的小块,避免缓存内存浪费在用不到的空间上。

RadixAttention

推理服务

RadixAttention 把完成请求的 KV cache 按 token 内容存进基数树,任何新请求都能复用最长匹配前缀。

智能体推理

并行策略

宽专家并行

Wide EP

并行策略

宽专家并行把模型专家铺到大量芯片上,让每张芯片需要保存和移动的专家数据更少。

流水线并行

PP

并行策略

流水线并行让每颗芯片负责一部分层,沿链条传递激活值,而不是把每一层都切开。

上下文并行

CP

并行策略

上下文并行把一条长提示词拆到多颗芯片上,让它们分担读取提示词和扫描注意力状态的工作。

数据并行

DP

并行策略

数据并行复制多份相同模型并分摊请求,就像多开几条相同的收银通道。

数据并行注意力

DPA

并行策略

DP attention 让每个 rank 处理各自的一批序列并持有自己的缓存,而不是每个 rank 都存同一份副本。

序列并行

并行策略

序列并行把一条长序列切分到多颗芯片上,让一个请求的 token 由多个加速器同时处理。

张量并行

TP

并行策略

张量并行把一次大型计算拆给多张芯片,让它们共同完成。

专家并行

EP

并行策略

专家并行把模型中的不同“专家”分配给不同芯片,再把每个 token 送到需要的专家。

All-gather

并行策略

All-gather 是一种群体通信操作,结束时每颗芯片都拿到最初分散在所有芯片上的完整数据。

All-reduce

并行策略

All-reduce 让每张芯片完成一部分计算,再合并结果并把完整答案发回所有芯片。

All-to-all

并行策略

All-to-all 是一次有组织的交换:每张芯片都向其他每张芯片发送不同的数据包。

Reduce-scatter

并行策略

Reduce-scatter 把每颗芯片上对应位置的数据求和,然后让每颗芯片只保留合并结果中属于自己的那一片。

Scale-up 与 scale-out 网络

并行策略

Scale-up 是同一套芯片系统内部的超高速网络,scale-out 则连接不同服务器或机架。

硬件

数值精度

模型架构

稠密模型

模型架构

稠密模型对处理的每个 token 都动用全部参数,不像稀疏模型那样把 token 路由给少数专家。

多头潜在注意力

MLA

模型架构

MLA 会压缩模型对历史 token 的“笔记”,让长对话占用更少内存、继续生成的成本更低。

分组查询注意力

GQA

模型架构

分组查询注意力让多个查询头共享一组键值头,在几乎不损失质量的情况下缩小 KV cache。

滑动窗口注意力

SWA

模型架构

滑动窗口注意力让某些层只看最近一段 token,因此窗口填满之后它的缓存就不再继续增长。

混合注意力

模型架构

混合模型在不同层使用不同的注意力类型,因此它的缓存是几种不同状态,而不是一块统一的数据。

混合专家模型

MoE

模型架构

混合专家模型像一支大型专家团队:每个 token 只调用最合适的少数专家,无需每次动用全员。

激活参数

模型架构

激活参数是混合专家模型处理每个 token 时实际用到的权重,只占其庞大总规模的一小部分。

上下文窗口

模型架构

上下文窗口是模型一次能处理的最大 token 数,涵盖输入和到目前为止生成的全部内容。

稀疏注意力

模型架构

稀疏注意力只回看长上下文中最有用的部分,无需重新检查每个历史 token。

线性注意力

模型架构

线性注意力保存一份固定大小的运行摘要,而不是全部历史 token,因此内存不会随对话增长。

Reasoning 模型

模型架构

Reasoning 模型在回答前生成很长的隐藏思维链,用额外的输出 token 换取困难问题上更好的结果。

Tokenization

模型架构

Tokenization 把文本切分成模型实际读写的子词单元,所有性能和价格数字都以它计价。

软件栈

AITER

软件栈

AITER 是 AMD 调优过的 kernel 库,决定注意力和矩阵运算在 Instinct 芯片上究竟能跑多快。

ATOM

软件栈

ATOM 是 AMD 自研的推理引擎,是它在厂商专用运行时这条路线上的答案,而非上游开源引擎。

CUDA

软件栈

CUDA 是让程序在 NVIDIA 芯片上运行的软件工具箱。

CUDA graph

软件栈

CUDA graph 把一整串芯片操作录制一次并整体回放,从而免去逐个启动它们的开销。

CUTLASS

软件栈

CUTLASS 是 NVIDIA 的模板库,提供搭建接近硬件峰值速度的矩阵乘法 kernel 所需的积木。

FlashAttention

软件栈

FlashAttention 在高速片上内存中分块计算精确注意力,避免生成那个让注意力又慢又耗内存的巨大中间矩阵。

FlashInfer

软件栈

FlashInfer 是一个注意力 kernel 库,服务引擎直接调用它,而不必自己实现注意力。

GEMM

GEMM

软件栈

GEMM 即通用矩阵乘法,是训练和推理神经网络时占据绝大部分算术量的那一种计算。

Kernel 融合

软件栈

Kernel 融合把多个小的芯片操作合并成一个,中间数据留在快速内存里而不是反复经过 HBM。

KV cache 管理器

软件栈

KV cache 管理器负责把注意力状态存放在芯片之外,并决定哪些保留、哪些淘汰、什么时候取回。

NCCL

NCCL

软件栈

NCCL 是 NVIDIA 的集合通信库,在集合操作中负责芯片之间的数据搬运,RCCL 是 AMD 的对应实现。

NVIDIA Dynamo

软件栈

NVIDIA Dynamo 协调大量芯片 worker,负责路由请求、移动模型记忆,并把读提示词和写答案分配给合适的资源池。

ROCm

软件栈

ROCm 是让 AI 和高性能程序在 AMD 芯片上运行的软件工具箱。

SGLang

软件栈

SGLang 是用于快速服务语言模型的开源软件,提供面向复杂 AI 工作负载的调度和优化功能。

TensorRT-LLM

软件栈

TensorRT-LLM 是 NVIDIA 为自家芯片优化的 LLM 推理软件栈。

TileRT

软件栈

TileRT 是面向极低延迟单用户生成的推理运行时,它把模型编译成一个常驻程序,而不是许多次内核启动。

Triton

软件栈

Triton 是基于 Python 的加速器 kernel 编写语言,让 ML 工程师不写底层代码也能接近手工调优的速度。

vLLM

软件栈

vLLM 是开源软件,通过组织请求和芯片内存,让语言模型高效服务大量用户。

阅读基准曲线

完整曲线更能说明问题。

LLM 服务需要在单用户速度与总吞吐量之间取舍。InferenceX 使用完整 Pareto 曲线和等交互性比较,展示不同运行点上的真实权衡。单一最大吞吐点无法代表完整系统。

基于实测数据

每个定义都连接真实方案。

每个术语页都会链接到该概念真正影响实测结果的 InferenceX 文章,包括 MTP 接受行为、NVL72 Wide EP 扩展,以及硬件不变时的软件性能提升。