由 XSKY星辰天合 发布于2026-08-18
长上下文、多轮对话与智能体应用的普及,正在改变大模型推理的成本结构。KV Cache 曾是推理引擎内部的一项实现细节,如今已成为决定推理成本与吞吐上限的关键变量:显存容量的增长速度显著低于上下文长度的增长速度,将 KV Cache 卸载至显存之外的介质、并在需要时取回,已从一项可选优化转变为规模化推理的必要能力。
从表象上看,这是一个典型的存储命题——容量、带宽、延迟,都是存储行业长期处理的问题。但在工程实践中,这一判断并不成立。
KV Cache Offload 的实质,是一个由存储介质承载的推理问题。存储系统的契约是字节的持久化与检索,而 KV Cache 的契约是计算状态的复用。二者看似相邻,之间却隔着推理引擎完整的执行语义。跨不过这一层,产出的系统在功能上可以运行,在生产环境中却会以最难排查的方式出错。
这一判断出自一家在分布式存储领域积累十年的公司。恰恰因为长期处于存储这一侧,我们更清楚该问题的难点所在:存储能力是这一层的必要条件,但远不是充分条件。难点并不落在存储最擅长的地方,而这也决定了我们必须将能力向何处延伸。
本文依次论述四个问题:其一,为何仅凭存储能力不足以覆盖这一层;其二,这一领域的实际门槛由哪些因素构成;其三,做成这件事需要何种能力组合;其四,我们基于上述判断形成的定位,以及已取得的进展。
仅凭存储能力,为何不足以提供 KV Cache 卸载
存储行业在大容量、高带宽、低延迟上有几十年积累。分层介质、预取、压缩、一致性、分布式索引,这些能力早已成熟。市场上亦不乏高带宽缓存层与直连存储方案。
然而在与推理引擎对接之后可以发现:真正决定命中率与端到端收益的那些判断,没有一项能够在存储侧完成。以下三项差别不在程度,而在性质。
1、同一份字节,位置改变即失效
在存储系统中,写入的字节读出后仍是同一份字节,语义保持不变。这是存储最基本的承诺。
但在 KV Cache 中这一承诺并不成立。一段 KV 张量是在特定的 token 位置上计算得出的,其中已经携带位置信息;将其置于另一位置直接使用,模型不会报错,输出却是错误的。要使其重新可用,必须在推理侧执行额外的计算。
换句话说,这里的"读回来"并不等于"可以用"。仅此一项,便已越出存储接口所能表达的范围。

2、缓存层必须介入调度决策
存储系统从不参与调用方的调度。数据库不会告知应用"你这个请求可以少执行三步"。
但 KV 缓存层必须这样做。它需要在调度发生之前回答:这个请求还能从外部缓存里再补上多少 token。这个答复不是一个统计指标,它直接决定该请求进哪个批次、需要分配多少显存块、prefill 阶段要跳过多长一段计算。若答复失准,收益无从兑现;若前后答复不一致,调度器的状态将出现错乱。
更为棘手的是,请求可能已完成缓存查询、但最终未被调度。此时缓存层这一侧已经产生的副作用必须能够完整回滚,否则将出现缓存条目被长期占用或重复计数的问题。这是一个发生在推理调度器内部的状态一致性问题,与存储无关。

3、故障不表现为报错,而是静默返回错误结果
存储系统的典型失败是"读不到":超时、校验失败、副本不可用。此类故障信号明确,因而易于监控与定位。
KV Cache 的典型失败恰恰相反。KV 张量在不同引擎、不同芯片、不同注意力后端下有多种物理排布方式。一旦对排布的判断出错,程序不会崩溃,注意力照常计算,输出照常返回,只是内容是错的。
这类故障在生产环境中极难定位:没有异常栈,没有错误日志,只有模型"变笨了"。待其被发现时,往往已污染大量缓存条目。
这意味着这一层缺少安全网。存储系统可通过重试、校验与副本机制吸收大部分错误;而在此处,正确性必须在设计阶段即获得保证,而非在运行阶段被发现。

大规模 KV Cache 卸载的四重门槛
如果只是"越出存储的接口",这还只是范围问题。使该领域长期处于开放状态的,是以下四重挑战;它们叠加之后,构成了实际门槛。

1、新的 KV 结构出现在代码中,而非标准中
推理引擎必须为每一种 KV 状态结构定义一套处理逻辑。当前主流引擎支持的模型架构已超过 350 个,但它们的 KV 状态收敛为12 个语义类别——全注意力、MLA、滑窗、线性注意力状态等等。
这个收敛是好消息:绝大多数新模型不引入新的 KV 结构。但它同时也是坏消息——这 12 个类别以每年 3 至 5 个的速度增长,而增长发生在引擎主干的代码里,不发生在任何标准委员会里。
这决定了这一层的工作方式:无法等待标准稳定后再行进入。当某一 KV 类别在文档中被正式描述时,采用它的模型往往已上线许久。未能跟随引擎主干演进,其后果并非功能缺失,而是前述的静默错误。
2、识别不具备复用价值的 KV,难于完成搬运本身
这一点常被忽略,却最能检验对模型结构的理解。
并非所有 KV 都值得卸载,甚至并非所有 KV 都可能被复用。有些结构在原理上就不具备跨请求复用的语义——它的 KV 与解码前缀之间没有对应关系,或者历史状态在推进过程中被就地覆盖、根本没有留下可复用的中间快照。对这类结构,即便把搬运做到极致也不会产生任何命中收益。
要做出这个判断,前提是理解 KV 从哪里来、在什么边界上留痕。这些都写在模型结构里,不写在存储需求里。缺乏该判断能力的后果,是将工程资源投入无回报的方向,并向用户交付一项表面运行、实则不产生收益的功能。
反向的误判同样需要防范。结构最复杂的一类模型往往并非最难支持;而认为 KV 结构越新越可能不被支持,这一直觉也不成立——新一代结构往往更有利于卸载,因其 KV 体积更小、搬运成本更低。
3、"先上线、后修复"的工程节奏在此不适用
由于故障是静默的,这一层无法采用"先跑起来,出问题再修"的工程节奏。它要求在接入之前即可判定:当前环境的 KV 结构能否被准确识别;在存在不确定性时,应当拒绝启动,而非带着风险运行。
这是一个反直觉的产品取舍:宁可无法启动,也不接受静默错误。作出该取舍的前提,是团队明确知晓错误一旦发生将以何种形式呈现,而这一认知只能来自生产环境中的实际经历。
4、在国产算力平台上,参考实现的前提不成立
这是当前最为现实的一重挑战,同时也是最少被公开讨论的一重。
业界主流的 KV 卸载实现建立在几项芯片能力之上,这些能力在 NVIDIA 平台上是现成的。而在部分国产算力平台上,其中一项或几项并不可用,同时框架接入方式也与 CUDA 生态不同。
其结果是:将现有方案直接迁移,并非性能下降,而是链路无法成立。这不是参数调优可以解决的问题,需要在架构层面重新设计数据通路。
与此相关的是一个反直觉但反复出现的观察:"国产芯片生态封闭、无法深度适配"这个判断在很多情况下并不准确。相当一部分平台在底层的开放程度高于外界预期,运行时接口、算子库、编译器工具链都已开源,且普遍参照了 CUDA 的语义;真正的卡点往往出现在更上层,比如推理引擎以容器镜像形式交付而未单独开源。这是交付条件问题,不是技术封闭问题——两者的应对方式完全不同。作出这一区分的依据,是对代码的充分研读,而非与厂商的关系。
KV Cache 卸载需同时具备两类能力
综合上述四重挑战可以得出一个清晰的结论:这一层要求两类通常分属不同团队的能力,在同一产品中同时成立。

一侧是推理引擎的执行语义。调度决策如何做出、显存块如何分配、注意力后端如何排布 KV、一段缓存在什么位置上仍然有效、请求被抢占后状态如何恢复。这些知识只能从引擎的实现中获得。
另一侧是分布式存储工程。分层介质的编排、索引的一致性、驱逐策略、故障域的划分、以及在真实规模下的稳定性与可运维性。这些是存储行业数十年沉淀的结果,无法通过短期投入补齐。
缺少前者,产出的是一个吞吐可观却无法产生收益的缓存层:命中率无法提升,收益无从兑现,且存在静默错误的风险。缺少后者,产出的是一个可在实验环境中演示、但在生产规模下不具备可靠性的原型。
这正是该领域至今仍是开放问题的原因:它不落在任何一方的能力舒适区之内。
我们的技术实践
综合前述分析,我们对 KV Cache 这一层的技术归属形成如下判断。
其一,KV Cache 层无法仅凭存储能力覆盖。存储能力是必要条件,但不是充分条件。这里的界限不在厂商的行业归属,而在产品能力的边界:如果一个产品的边界停留在存储的抽象层之内,即只提供字节的持久化与检索,那么本文第一章列举的三项差别在它的接口上都是不可见的,因而无法被正确处理。这一约束对任何出身的团队同等适用。
其二,KV Cache 亦不会长期留存于推理引擎内部。KV Cache 复用的价值随复用范围的扩大而递增,从跨请求延伸至跨实例、跨节点乃至跨集群;而推理引擎的生命周期以单进程为边界,无法承担集群尺度上的状态持久化、索引维护与一致性保障。这些能力必须由独立于引擎的层次提供。
其三,KV Cache 属于把存储能力延伸进推理执行流程的产品。这也正是我们理解AI Native 存储的方式:所谓 AI 存储,其实质不是把既有存储产品适配到 AI 场景,那只能算 AI-ready;AI Native 意味着存储能力原生进入推理的执行语义之中——理解计算状态何时产生、在什么条件下可以复用、复用的收益又通过什么路径兑现。XSKY 的定位正建立在这一判断之上。
这也解释了我们的能力构成。我们在分布式存储领域已有十年的工程积累,涵盖分层介质编排、元数据一致性、驱逐策略以及大规模场景下的稳定性保障,这是这一层的必要条件。在此基础上,我们于近年持续投入对推理侧的研究:其方法并非将 AI 视为一类新增负载加以适配,而是深入推理引擎的执行流程,系统性地理解计算状态的产生时机、复用条件与收益路径——这是把必要条件补足为充分条件的关键一步。
两侧能力的结合,使我们在这一层取得了两项实质性进展。
一是率先实现生产级的 KV Cache Offload。此处的"生产级"具有明确界定:并非具备演示能力的原型系统,而是在真实业务规模下同时满足正确性保障、可观测性与可运维性要求的产品能力。
二是在国产算力平台上首个实现混合注意力模型的 KV Cache Offload。混合注意力模型在同一模型内同时包含全注意力层与线性注意力层,两类层的状态组织方式、复用边界与搬运粒度均不相同,是当前 KV 结构中复杂度最高的一类,同时也是新一代模型架构的重要演进方向。在业界参考实现的前提条件并不成立的国产平台上完成该能力的产品化交付,是对我们在这一层技术理解深度的直接检验。
我们对 KV Cache 的定位始终明确:它不是一个容量更大的缓存系统,而是推理执行流程的组成部分,只是在实现上需要以存储介质作为承载。
关于 MeshFusion:
XSKY 星飞推理存储系统是面向大模型推理场景的 KV 缓存层产品,提供跨请求、跨实例的计算状态复用能力,目前已在国产算力平台完成生产级落地。我们欢迎推理平台厂商、算力厂商及行业客户就本文所述议题开展技术交流与联合验证。