由 XSKY星辰天合 发布于2026-07-23
7 月 22 日,第十八届国际高性能计算和人工智能咨询委员会中国年会在北京顺利举办。本届大会以“通过 AI 网络,迈向 AI 工厂”为核心主题,聚焦智算转型浪潮下,AI 训练、推理所需的网络、算力、存储全栈基础设施建设。XSKY 星辰天合产品总监朱荣泽受邀出席,并在《AI 网络创新加速:KV Cache 方案及合作伙伴报告》专题分享环节作主题演讲,探讨规模化 AI 工厂下 KV Cache 共享存储的建设路径。

行业转型,AI 工厂重构 KV Cache 建设底层需求
随着大模型商业化走向规模化,企业智算平台正从零散算力节点升级为统一调度、弹性扩容的 AI 工厂,长上下文交互、批量文档解析、PD 分离分布式推理成为常态化业务。仅依靠本地显存承载 KV Cache 的模式瓶颈日益突出,将 KV Cache 卸载至外部共享存储已成为行业共识。
但落地并不容易:新一代混合注意力模型涌现带来了异构缓存布局适配难题;网络、存储、算力独立规划无法释放硬件的整体性能;国产昇腾算力长期缺少成熟缓存卸载配套方案,拖慢全栈国产化智算集群落地进度。
三重进阶,搭建全场景推理缓存底座
从架构设计、工程落地到生态协同,MeshFusion 形成完整技术演进路径,回应 AI 工厂浪潮下 KV Cache 由可选方案转向刚需基础设施的行业命题,搭建起一条从技术验证走向产业落地的完整链路。

架构之进:从标准 KV Cache 到异构混合注意力
MeshFusion 支持三种部署形态:激活本地 SSD 模式适合已有集群轻量化升级;DPU+JBOF 模式实现 KV Cache 绕过 CPU 直达 GPU 显存,架构形态类似 NVIDIA CMX 近存架构;独立集群部署面向超大规模 AI 工厂,存算分离按需扩展。
异构混合注意力的适配是架构层面的另一关键突破。新一代主流大模型已全面转向混合注意力架构,KV Cache 从统一的 K/V 张量演变为异构缓存,传统卸载方案无法直接适配。MeshFusion 在存储侧建立了面向混合注意力的缓存识别与分类管理能力,可正确处理异构 KV 布局。
工程之进:从技术可行到规模可用
ODCC AI 存储实验室已完成 MeshFusion 全场景标准化评测(☞点击查看报告详情),完整验证 DPU 近存架构、高速网络协同等全套技术路线,为规模化落地提供权威数据支撑。
基于 NVIDIA Spectrum-X 网络的评测显示,集群与单客户端的顺序读性能均逼近各自物理上限,集群带宽可随网口规模线性扩容;EC 纠删码与单副本性能基本持平,打破了 EC 必然拖慢性能的传统认知;Spectrum-X 网络高级特性进一步释放存网协同价值。此外,基于 Shared-Everything 架构的全局空间智能分配,可在 KV Cache 频繁写入与删除的场景下主动保护 SSD 寿命。
在跨算力平台适配层面,MeshFusion 已完成华为昇腾 910C 的验证(☞点击查方案详情),率先实现混合注意力模型 KV Cache SSD 卸载,完成了 DeepSeek V4、GLM-5.2、Qwen3.5/3.6 等主流模型适配,验证了从 GPU 到 NPU 的工程化能力。
生态之进:打通 GPU 与 NPU 双算力
市面上多数 KV Cache 加速方案仅适配单一类型算力硬件,很难满足当下企业混合部署、国产化替代的建设需求。MeshFusion 打通英伟达 GPU、华为昇腾 NPU 双算力生态,同一套存储底座可以统一承载异构算力集群的缓存卸载需求。
昇腾 910C 混合注意力 KV Cache SSD 卸载能力的验证,填补了国产 NPU 在长上下文缓存领域的方案空白,为计划搭建全栈 AI 工厂的企业提供完整缓存加速配套方案。
立足长远,协同共建推理基础设施
混合注意力已成为新一代模型的主流架构选择,推理业务规模持续扩张,KV Cache 存储正从“能不能卸”进入“怎么卸得更好”的新阶段。
从 ODCC 认证到 HPC-AI 年会分享,从英伟达 GPU 到昇腾 NPU,从标准 KV Cache 到异构混合注意力缓存,MeshFusion 的技术演进路径清晰地指向一个方向:将 KV Cache 存储做深、做透,使其成为可规模部署的工厂级推理基础设施。而实现这一目标,需要算力、网络、存储、框架产业链的多方协同,需要产业合力。XSKY 也将持续携手行业伙伴共建标准、打磨方案,助推智算推理产业长效稳健发展。