
预计阅读 39 分钟
TPU 推理外部化全速推进
InferenceX、最高 50% 的每美元性能优势、TPU 软件栈的快速外部化、不断扩大的客户群、Ironwood、TPUv8i,以及正在收窄的 CUDA 护城河
- benchmark
- inference
- tpu
- +7
InferenceX 研究
关于智能体推理、AgentX 结果、芯片与推理框架经济性的基准测试文章。
不熟悉相关概念? 浏览 AI 推理术语表。
8 篇文章

预计阅读 39 分钟
InferenceX、最高 50% 的每美元性能优势、TPU 软件栈的快速外部化、不断扩大的客户群、Ironwood、TPUv8i,以及正在收窄的 CUDA 护城河

预计阅读 3 分钟
多出 50% 的 HBM 能挤出额外吞吐量,逐点遥测数据说明了它究竟从何而来

预计阅读 2 分钟
在这个运行点上,即便 AMD 硬件白送也仍然填不平差距

预计阅读 3 分钟
Dynamo router 成为瓶颈,没有提交使用上下文并行,而 AMD 完全没有用上 KV offload

预计阅读 3 分钟
NVIDIA 横扫这个 432B 模型,而缺失的 DP attention 数据点说明了缓存局部性为何变成路由约束

预计阅读 2 分钟
在长上下文 agentic 工作负载上,四年硬件迭代加上 4 位格式能换来什么


预计阅读 31 分钟
第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析