由 XSKY星辰天合 发布于2026-09-08
2026年9月2日,GPUStack AI Infra 生态与技术创新大会在北京举行。会上,XSKY 星辰天合与 GPUStack 正式签署战略合作协议,双方将发挥各自在 AI 数据基础设施和模型部署管理领域的能力优势,围绕共享 KV Cache、推理加速和异构算力适配等方向展开合作,共同构建面向 Token 工厂的 AI 基础设施。

内存墙围困 AI 推理,KV Cache 卸载打开提效空间
大模型进入规模化应用后,推理效率越来越受到内存容量和带宽的制约。AI 编码、企业知识库问答、复杂 Agent 工作流等场景通常包含长上下文、多轮交互和高并发请求,如果每次都重复计算相同内容,就会持续消耗 GPU 算力,拉长首 Token 等待时间。
KV Cache 能够保存已经计算过的上下文状态,并在后续请求中复用,从而减少重复计算。但随着模型规模和并发量增长,单台服务器的 GPU 显存和主机内存很快受到限制,缓存数据也难以在不同推理节点之间共享。
因此,如何将 KV Cache 从有限的显存扩展到主机内存和 NVMe SSD,并实现跨节点共享,成为提升推理性能、降低资源成本的重要方向。XSKY 与 GPUStack 的合作,正是围绕这一问题展开。
MeshFusion 构建 KVCache 和数据底座,GPUStack 连接算力与模型
XSKY MeshFusion 是面向 AI 推理的 KV Cache 扩展加速系统。突破 HBM 容量限制,支持百万级 Token 上下文,原生支持 KV Cache 卸载至共享存储池,释放 GPU 显存,缩短首 Token 响应时间,大幅提升推理吞吐效率,并已通过 ODCC 官方认证(☞点击查看评测报告)。
GPUStack 是一款开源的企业级 AI 基础设施平台,能将本地、云端或混合环境中的任意 GPU 资源统一纳管,组织成高性能 Token 工厂。平台提供模型实例配置、推理服务编排和性能基准测试等能力,企业通过统一界面即可管理模型服务并持续优化部署方案。
双方合作将 MeshFusion 的 KV Cache 存储能力与 GPUStack 的算力调度能力全面打通。让共享 KV Cache 直接接入企业级模型部署流程。

联合方案落地,推理加速效果可验
GPUStack 负责算力集群管理、模型部署与推理服务编排,XSKY MeshFusion 则提供面向 AI 推理的共享 KV Cache 能力。双方完成产品级集成后,企业可以通过 GPUStack 统一创建和管理 MeshFusion 缓存服务,并将共享缓存直接应用于模型部署。
推理性能跨越式提升
MeshFusion 通过原生 KV Cache 接口和高性能数据访问能力,减少重复上下文计算;GPUStack 则结合模型部署和推理调度,帮助推理请求更高效地使用已有缓存。
在相关测试中,TPS 从 2.3K 提升至 132K,提升约 57 倍;TTFT 从 54 秒优化至 0.97 秒,降低约 98%;读带宽达到 276 GiB/s,相当于集群理论带宽的 90.6%。随着缓存命中率提升,QPM 最高提升 6 倍。在AI编程场景中,代码补全响应从秒级进入毫秒级;企业知识库问答的首轮回复等待时间大幅缩短;Agent工作流的复杂推理链路也不再因缓存不足而频繁超时。
低资源消耗兼顾性能与成本
MeshFusion 将 KV Cache 从显存扩展至内存和 SSD,CPU 和内存开销极低,支持与推理引擎融合部署,无需额外服务器。GPUStack 统一调度推理任务,将各节点请求高效路由至共享存储池,并根据缓存命中情况动态调整实例分配。
MeshFusion 还能感知磁盘容量与磨损情况,主动均衡数据分布,延长 SSD 寿命。整套方案在不增加硬件投入的前提下,以更低资源消耗支撑更高推理并发。
广泛兼容主流算力与模型生态
联合方案同时支持 NVIDIA 、华为昇腾及阿里平头哥等多种算力生态,并兼容多种模型和推理框架。企业无需改变现有的算力环境和模型体系,即可将共享 KV Cache 能力接入 AI 推理流程。
GPUStack 统一纳管异构加速卡,通过可插拔推理后端让缓存与不同推理框架自动适配;MeshFusion 在存储层面完成与各算力平台的 KV Cache 对接。双方将算力、模型、缓存和数据连接起来,共同为企业提供一套灵活、易用的 AI 推理基础设施方案。

协同共生,共建 Token 工厂基础设施
此次合作的本质,是存储层与算力调度层的深度协同。 XSKY MeshFusion 的共享缓存能力与 GPUStack 的模型部署管理能力的结合,让 KV Cache 从底层技术能力真正落地到模型部署和运维流程。随着 AI 应用从单轮问答走向复杂工作流,这套“存储+算力”一体化的架构,为企业 AI 落地提供了兼顾效率与成本的可行路径。
未来,双方将继续推进模型管理、推理编排与 AI 数据基础设施的协同,适配更多模型、推理框架和异构算力环境,为企业规模化部署生成式 AI 提供更高效、更易管理的基础设施支撑。
关于 GPUStack
GPUStack 是由 GPUStack.ai 所推出的开源项目。GPUStack.ai 成立于2022年,是 AI Infra 解决方案提供商,目前已完成两轮共超亿元融资。创始团队成员均来自业界应用广泛的 Kubernetes 管理平台 Rancher 的核心团队。其中,联合创始人及 CTO 梁胜博士是前 SUSE 全球工程及创新总裁,加入 SUSE 之前,梁胜博士于2014年9月创立全球著名的容器管理平台公司 Rancher Labs 并担任 CEO。
关于 XSKY
北京星辰天合科技股份有限公司(简称“星辰天合”或“XSKY”)成立于2015年,是一家面向 AI 时代的统一数据平台提供商,十余年专注分布式存储,长期位列 IDC 市场报告 TOP 5*,且是唯一独立存储厂商,并在对象存储软件市场长期保持领导者地位。围绕企业 AI 数据的全生命周期,XSKY 提供极致性能、线性扩展、高可靠的一站式 AI 数据基础设施。公司产品与服务已在大模型、智算中心、具身智能、自动驾驶、智能制造、科研等多元领域的数千家企业级生产环境中经受验证。