首 token 延迟约束
本页面展示首 token 延迟约束下的成本对比:在选定的最低交互性下,按 2 s、5 s、10 s 等各档首 token 延迟(TTFT)上限,逐档找出各芯片厂商每百万 token 成本最低的实测配置,并标注最优配置与厂商间的成本差距。所有柱形均来自实际运行过的配置,不做插值,可直接追溯到对应的 GitHub Actions 运行记录。
图表中的模型、芯片、框架与指标名称均沿用业界通用英文名称。
首 token 延迟约束
哪款芯片最优,取决于用户能接受多长的首 token 等待。本页面按每一档首 token 延迟(TTFT)上限,从同时满足交互性下限的实测配置中,逐厂商选出成本最低的一个。仅使用实测数据,不做插值,每个柱形都可追溯到对应的运行记录。