AI 推理术语表
模型架构

Tokenization

也称为 分词、tokenizer、token、BPE

先用大白话

Tokenization 把文本切分成模型实际读写的子词单元,所有性能和价格数字都以它计价。

技术定义

Tokenization 是文本与模型处理的离散 token ID 之间的转换,使用通过字节对编码(BPE)等方法学得的固定词表。

工程细节

tokenizer 把常见词映射为单个 token,把较罕见的字符串拆成多个,英文平均大约四个字符一个 token。不同模型家族词表不同,同一段文本在不同模型下的 token 数可能差异明显。下游一切都以 token 计价:上下文窗口、KV cache 大小、吞吐量、每 token 延迟和每百万 token 价格,数的都是这个单位而不是字符或单词。

为什么重要

token 效率是一个隐藏的价格杠杆:同样内容用更少 token 表达的模型,在相同单价下更便宜。比较供应商或基准测试时不对 tokenizer 差异做归一化,会悄悄扭曲成本和速度结论。

如何在 InferenceX 中解读

InferenceX 的指标以 token 计价,其 AgentX 轨迹用确定性合成 token 替换原始文本,同时保留每轮 token 数,因此回放的会话以与源工作负载相同的 token 算术压测服务系统。