AI存储的评测风向正在悄然大变。根据MLCommons公布的MLPerf Storage v3.0结果,新增的KV Cache测试项首次将推理运行时状态纳入衡量范围,而焱融科技F9000X三节点集群在3D U-Net数据供给测试中跑出544GiB/s聚合带宽,并在Checkpoint 70B测试中同时取得读、写带宽双项第一。对开发者而言,这意味着选型时的评测表不能只看吞吐,还要看缓存能不能跨机复用。
MLPerf Storage v3.0改了规则,KV Cache为什么成了新考点?
MLPerf Storage是一个由MLCommons主导的第三方存储性能基准,长期被AI基础设施团队用作采购依据。v3.0最值得关注的变化是引入KV Cache测试项,模拟多轮会话中缓存整体写入与回读,并报告模拟输出Token吞吐、读写带宽和P95读取时延。这背后是推理结构的变化:在Transformer架构中,Key和Value会被保留为KVCache,避免每个Token重复计算上下文。当请求之间存在相同前缀,比如系统提示词或长文档背景,这部分状态理论上可跨请求复用。存储任务因此从训练前供数延伸到推理过程内部的运行时状态管理。
单看数字,544GiB/s并不足以解释这笔账是否划算。真正棘手的是三重系统难题:一是匹配严格,提示词模板微调、Token序列偏移或KVCache精度格式不一致,都会让前缀复用失效;二是显存有限,模型权重和并发上下文挤占空间,未被命中的缓存只能被淘汰或换出;三是节点孤立,A节点算出的缓存未必能被调度到B节点的请求命中。
从显存到共享池,焱融把缓存拆成了哪几层?
单机层面,焱融采用三级分层:G1为GPU显存,G2为主机内存,G3为本地SSD,由YRCache统一做内存配额、资源隔离与多盘NVMe聚合,目标是让缓存高效换入换出。但跨节点复用的瓶颈靠堆单机硬盘解决不了:当A节点忙、B节点空闲时,要么把请求塞回A节点排队,要么把缓存拉过来另找传输通路。焱融给出的方案是发布ContextBox,一台独立共享缓存一体机,定位为G3.5层。硬件上搭载最多26块U.2 NVMe SSD,配置4块NVIDIA BlueField-3双口200Gb DPU卸载数据路径,并通过RDMA/RoCE网络提供120GB/s实测带宽,单台可支撑8节点集群。软件由YRCache负责缓存匹配、生命周期管理与跨级流动,同时兼容LMCache、Mooncake等生态。它和G4持久化共享存储的分工就此清晰:传统分布式存储继续承担模型、数据集和Checkpoint,缓存则走短生命周期、毫秒级响应的独立层。
长上下文省了多少?实测TTFT最高降94%
按照焱融披露的一组企业测试数据,在8卡NVIDIA H20-3e、单卡141GB HBM、运行SGLang与GLM-5.1的环境下,接入YRCache与ContextBox后,在31K至129K的长输入区间内首Token时延降低了89%至94%,Token吞吐量提升3至6倍。
然而,出于评测独立的考量,这个结果也提醒开发者不要把它过度泛化。焱融同时给出一项测算,在64K输入、50%命中率与GPU持续满载的理想假设下,按市面Token定价折算,单台8卡服务器的月度等效产值可以从5.2万元跃升至11.9万元。直接告诉你这个「等效产值」一词即可止步:它并非真实营收或净利润,商业能否兑现仍要看付费流量是否饱满,以及专用硬件、网络改造成本、功耗与运维能不能一并覆盖。
选择缓存方案时,一笔算清单位有效Token的TCO
对整个推理服务架构师群体而言,更值得警惕的风险信号在于指标错配:存储榜单第一固然是热度话题,但推荐算法的逻辑与业务SLA未必是同一条曲线。评估的关键应转向「成本与价值比这一直接验证的工具算清 GPU 内存」这一层级——节省的重复计算算力必须显著大于保存、寻址、传输与装载的总代价。这之中没有一条唯一的中间捷径答案;短对话、低重复率的负载继续重新计算更合理,只有高命中、长上下文的前缀缓存才能挤出正收益。
真正能落地的做法,是把衡量标准统一到给定SLA约束下整套系统的单位有效Token综合成本。
小结:MLCommons用KV Cache测试传递出的信号已经很清楚——AI存储的竞争重心正从「为GPU更快供数」转向「让一次算完的结果被更多请求复用」。焱融在544GiB/s成绩和长上下文TTFT大幅下降的样例之外还需客观评估自身缓存命中率与网络条件,采买测试的时候别忽略这笔直接的和持续的验证工具 TCO。
