新华三公司新闻

  • 产品与解决方案
  • 行业解决方案
  • 服务
  • 支持
  • 合作伙伴
  • 关于我们

2026 ODX|打造面向KV Cache的高效存储架构,新华三助力大模型推理降本增效

【发布时间:2026-09-07】

随着智能体应用加速落地,大模型推理对KV Cache的高效存储与复用提出了更高要求,传统存储架构正面临新的性能挑战。在2026开放数据中心大会存储分论坛上,紫光股份旗下新华三集团带来《智能体时代存储领域的新机遇与挑战》主题演讲,聚焦智能体时代KV Cache带来的存储架构变化,深入分析其在性能、复用与成本方面的核心挑战,并分享新华三面向AI原生场景的KV Cache(键值缓存)存储技术创新与落地实践。

descript

智能体与LLM技术迭代双轮驱动,正持续激化KV Cache的核心矛盾,即HBM的高度临时性与推理负载高效复用之间的冲突。对此,新华三集团存储产品线首席架构师陈钊指出:KV Cache已成为Token生产成本的决定性因素。模型厂商通过稀疏、压缩技术缩小KV Cache Size,短期内与更长上下文形成对冲,但远不足以满足智能体应用的并发要求;存储厂商则通过多级存储构建KV Cache缓存,减少重复计算,成为降本关键路径。其中外部存储相较本地存储而言,具有容量、性能、数据三个维度的池化共享能力,成为大规模智能体推理应用中KVCache卸载方案的一个必然选项。GPU算力与存储系统IO性能之间存在巨大的性能鸿沟,大模型稀疏注意力机制对数据存取的复杂性又不断加剧这一矛盾,KVCache的加载时间如何匹配算力成为核心难题,传统存储IO栈面临范式重构。

针对上述挑战,新华三通过CXL+NVMeoF构建多层KV Cache,以应对稀疏、前缀、短期及长期复用需求;同时依托原生KV存储软件栈设计,减少传统存储软件税,实现高并发可共享KV Cache存储池。

descript

硬件层面采用两层定制化架构:CXL高性能可共享内存池,通过集中式元数据管控与轻量化客户端,支持亚微秒级(500ns)Load/Store,实现随机稀疏精准读取;NVMeoF KV全闪存池,通过DPU直通构建高并发IO通道,提供亚毫秒级(500us)KV Put/Get。

软件层面,新华三CMS存储软件系统提供KV Cache原生的分布式存储软件,兼容通用服务器及多种DPU形态,以标准NVMeoF KV协议为纽带,构建KV Cache专用的扁平化精简IO栈,无须文件系统开销;以命名空间为配置单位,根据不同KV Cache索引要求,支持不同的打散分布策略和空间索引策略;弹性硬盘空间池,实现底层存储空间统一抽象,为不同命名空间弹性供应存储空间。

descript

随着智能体应用加速落地,KV Cache的高效存储将成为大模型推理降本增效的关键环节。陈钊表示,新华三将持续深耕AI原生存储技术创新,携手产业伙伴共建智算存储底座,为AI基础设施的持续升级提供有力支撑。

新华三官网
联系我们