AI 推理术语表
模型架构

Reasoning 模型

也称为 reasoning model、深度思考模型、思维链模型

先用大白话

Reasoning 模型在回答前生成很长的隐藏思维链,用额外的输出 token 换取困难问题上更好的结果。

技术定义

Reasoning 模型是被训练成额外花费生成 token 来推演问题的 LLM,在给出最终答案之前或同时产出大量中间推理。

工程细节

除了扩展训练算力,reasoning 模型还扩展测试时算力:它们用 token 来思考。一个数学或编程问题可能触发数千 token 的内部推演,输出长度相对聊天模型爆炸式增长。对服务而言,负载大幅偏向 decode,每请求的 KV cache 驻留量膨胀,每用户每秒 token 数成为决定难题几秒还是几分钟出答案的指标。

为什么重要

Reasoning 把推理变成了扩展前沿:能力现在通过在服务时花更多算力来提升,成倍放大对 decode 吞吐量的需求。它重塑了硬件优先级,转向内存带宽和互连,也是智能体工作负载主导当前基准设计的核心原因。

如何在 InferenceX 中解读

InferenceX 测试的前沿模型都具备 reasoning 能力,其场景反映了这类流量:固定序列测试中的长生成,以及 AgentX 中推演与工具调用在多轮之间交织的完整 agent 会话。