InferenceX
by
首页
AgentX
新
总览
仪表板
性能对比
技术文章
关于
Star
1,708
EN
LLM 推理 GPU 排行榜
哪款 GPU 最适合部署你的模型?以下每个排行都来自匹配交互速度下的实测基准数据,而非纸面规格,并随新结果自动更新。
DeepSeek V4 Pro
DeepSeek V4 Pro 最快 GPU 排行
按实测单 GPU tokens/s 排名
DeepSeek V4 Pro 最低成本 GPU 排行
按实测每百万 token 成本排名
DeepSeek V4.1 Flash
DeepSeek V4.1 Flash 最快 GPU 排行
按实测单 GPU tokens/s 排名
DeepSeek V4.1 Flash 最低成本 GPU 排行
按实测每百万 token 成本排名
DeepSeek R1
DeepSeek R1 最快 GPU 排行
按实测单 GPU tokens/s 排名
DeepSeek R1 最低成本 GPU 排行
按实测每百万 token 成本排名
Kimi K3
Kimi K3 最快 GPU 排行
按实测单 GPU tokens/s 排名
Kimi K3 最低成本 GPU 排行
按实测每百万 token 成本排名
Kimi K2.6
Kimi K2.6 最快 GPU 排行
按实测单 GPU tokens/s 排名
Kimi K2.6 最低成本 GPU 排行
按实测每百万 token 成本排名
GLM-5
GLM-5 最快 GPU 排行
按实测单 GPU tokens/s 排名
GLM-5 最低成本 GPU 排行
按实测每百万 token 成本排名
GLM-5.3
GLM-5.3 最快 GPU 排行
按实测单 GPU tokens/s 排名
GLM-5.3 最低成本 GPU 排行
按实测每百万 token 成本排名
MiniMax M3
MiniMax M3 最快 GPU 排行
按实测单 GPU tokens/s 排名
MiniMax M3 最低成本 GPU 排行
按实测每百万 token 成本排名
MiniMax M2.7
MiniMax M2.7 最快 GPU 排行
按实测单 GPU tokens/s 排名
MiniMax M2.7 最低成本 GPU 排行
按实测每百万 token 成本排名
Qwen3.8-Flash-Next
Qwen3.8-Flash-Next 最快 GPU 排行
按实测单 GPU tokens/s 排名
Qwen3.8-Flash-Next 最低成本 GPU 排行
按实测每百万 token 成本排名
Qwen3.5
Qwen3.5 最快 GPU 排行
按实测单 GPU tokens/s 排名
Qwen3.5 最低成本 GPU 排行
按实测每百万 token 成本排名
gpt-oss-120b
gpt-oss-120b 最快 GPU 排行
按实测单 GPU tokens/s 排名
gpt-oss-120b 最低成本 GPU 排行
按实测每百万 token 成本排名
Llama 3.3 70B
Llama 3.3 70B 最快 GPU 排行
按实测单 GPU tokens/s 排名
Llama 3.3 70B 最低成本 GPU 排行
按实测每百万 token 成本排名