“以存换算”成为AI推理共识 存储厂商切入算力优化赛道
创始人
2026-08-29 07:13:49
0

大模型规模化落地,正在把算力消耗的重心从训练推向推理。IDC预测,到2027年中国智能算力规模中推理占比将提高到72.6%,推理算力增速远超训练。推理环节的成本与效率,随之成为AI基础设施的新议题。

存储行业自身也处于涨价周期。高盛研报显示,2026年全球DRAM、NAND闪存、HBM的供需缺口分别达到4.9%、4.2%、5.1%,均为2011年以来最高水平,AI服务器贡献了超过50%的DRAM总需求。存储颗粒持续紧缺,大模型推理对显存、内存的消耗仍在放大。

2026年中国国际大数据产业博览会期间,中科曙光面向大模型推理的词元加速方案ParaCache正式发布。中科曙光分布式存储产品部总经理石静在沟通会上接受21世纪经济报道记者等采访时,回应了推理成本、KV Cache技术路线与存储行业定位变化等问题。

大模型推理分为Prefill与Decode两个阶段。前者对输入内容做批处理并生成KV Cache,后者逐字生成回答。多轮对话、长上下文场景下,历史内容的键值向量需要反复计算,计算量随上下文长度呈平方级增长,处理16K长度序列时,单次推理需执行2.56亿次键值对计算。

KV Cache是当前业界通用的解法:把已算好的键值向量缓存在GPU显存(HBM)中,生成新词元时直接读取缓存,避免重复计算。问题随之而来。显存容量有限、价格高昂,长上下文请求很快占满显存,形成业内所称的“显存墙”,即算力仍有富余,但系统已无法响应更多请求。

石静介绍,破解“显存墙”有两条路径:在源头压缩KV Cache体量,或把KV Cache卸载出显存,放到容量更大、成本更低的介质上,如CPU内存、SSD与分布式存储。以存储空间换计算的“以存换算”思路,已成为业界共识。

现有方案仍有短板。开源方案LMCache破除了KV Cache在推理实例间的隔离,并能实现同节点中不同GPU共享KV Cache,但在跨节点层面存在局限性。分布式存储天然具备池化共享能力,适合作为KV Cache的最外层,但受分布式锁等机制影响,延迟偏大,长期被当作冷数据仓库使用。

ParaCache的做法是以曙光ParaStor分布式存储为底座,构建覆盖GPU显存、CPU内存、SSD(或集中式存储FlashNexus)、分布式存储的四级缓存池,兼容vLLM、SGLang等主流推理框架,并与Mooncake等第三方KV管理软件厂商联合定制开发。针对分布式存储延迟问题,该方案对锁机制做了轻量化处理,改为追加写方式,并通过AI直通存储技术支持GPU显存与分布式存储之间的直接数据搬运。

据中科曙光披露的实测数据,120K输入长度下,单轮对话首词元时延(TTFT)最高降低98.5%,降至400毫秒;多轮会话TTFT降低超过80%,降至4.9秒;高并发场景词元吞吐量最大提升27倍。

应用层面,7月10日落成的首个全国产十万卡AI超集群曙光8000已部署该方案,并接入国家超算互联网。石静介绍,在金融行业某银行信用卡中心等应用场景下,并发吞吐量提升3倍左右;在教科研领域知识库问答场景下,并发度可提升15倍至20倍。另有国内头部互联网厂商已将该方案用于在线推理业务,中科曙光为其第一家完成KV Cache管理优化的合作厂商。

成本账没有统一答案。石静回应,收益因应用而异,无法给出统一数值,大致口径是在长上下文、多轮对话、知识库、高通量批量推理及智能体等场景下,内存或SSD配置上可节省约三分之一的硬件采购成本。

过去AI基础设施建设遇到瓶颈,惯常思路是堆GPU。石静表示,GPU成本高且供给受限,单纯堆砌难以为继;数据路径上的无效计算与额外搬运,也会拉低GPU效率。存算协同是大模型训推走向规模化生产的必然趋势。

在她看来,KV Cache管理软件代表大模型推理架构的范式变化。传统概念里GPU是架构中心,KV Cache只是计算过程中的临时状态。新架构下,KV Cache正从用完即弃的临时数据,变成可反复调用的数据资产,GPU围绕这些数据提供Prefill与Decode计算能力。KV Cache的管理水平,将影响推理应用的服务成本、响应速度与智能体扩展能力。

存储的定位随之重写。石静表示,存储已跳出数据容器的角色,从被动的IO响应转向主动的数据调度、缓存复用与计算卸载,这是AI驱动下数据基础设施的结构性变化。AI集群的规划建设思路也在改变:从只看GPU算力,变为算力、存储、网络乃至缓存的一体化规划,选型更多从总拥有成本出发,SSD与分布式存储被纳入KV Cache管理范畴,以平衡硬件成本与性能。

不同行业对AI存储的需求差异明显。石静介绍,大模型行业目前已以训推混合负载为主,训练需要极高带宽承载checkpoint写入,推理要求低时延与全局共享,追求总拥有成本最优;教育行业以知识库、教学问答、AI助教为主,小文件多、知识库版本迭代频繁;医疗行业影像、病理等非结构化数据体量大,长病程医学知识库的RAG推理,对把KV Cache卸载到更低成本层级的需求更迫切。

她也给出了技术边界。KV Cache复用的收益依赖公共重复上下文,短请求、不复用的场景收益有限;实时交易类等时延敏感型业务仍须依赖HBM,缓存下沉无法满足其性能要求。石静的判断是,这两类极端场景在当前推理应用中占比不高。

对国内厂商的机会,石静持乐观态度。她表示,国内大规模智算建设持续推进,计算、存储、网络的国产化方案增多,叠加私有化、私有域数据的本地需求,国内厂商有机会在存算协同赛道提供更多支撑。

切入KV Cache管理的存储厂商并非中科曙光一家。新华三今年3月发布X20000存储KV Cache方案,称首词元时延降低72%。开源社区的LMCache已被视为KV缓存管理领域的事实标准。围绕推理侧缓存管理,存储厂商的竞争已经展开。

相关内容

加息恐慌再现,芯片股光通信...
  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力...
2026-08-29 07:57:58
伦敦股市28日上涨
来源:新华社新华社伦敦8月28日电(记者赵阳)英国伦敦股市《金融时...
2026-08-29 07:57:53
全景揭秘2026级新生报到...
  本报讯(实习生 宋依珂 记者 赵琳)马上就要开学报到了,是不是...
2026-08-29 07:57:48
医疗保障法出台 这些看点值...
  医疗保障是减轻群众就医负担、增进民生福祉、维护社会和谐稳定的基...
2026-08-29 07:57:38
欧盟官员:未见俄罗斯欲进攻...
  新华社北京8月28日电 一名欧盟高级官员27日说,欧洲各国情报...
2026-08-29 07:57:33
美元指数28日上涨
来源:新华社新华社纽约8月28日电 美元指数28日上涨。衡量美元对...
2026-08-29 07:57:26
摩托罗拉预热全新施华洛世奇...
  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力...
2026-08-29 07:52:50
沃什杰克逊霍尔首秀震惊市场...
本次讲话让沃什的立场与特朗普要求降息的诉求形成更为鲜明的冲突。 当...
2026-08-29 07:52:44
鑫铂股份的前世今生:唐开健...
鑫铂股份是国内工业铝型材领域领先企业,专注于铝加工系列产品研发生产...
2026-08-29 07:52:38

热门资讯

加息恐慌再现,芯片股光通信重挫...   炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会! (来源:第一财经资讯...
伦敦股市28日上涨 来源:新华社新华社伦敦8月28日电(记者赵阳)英国伦敦股市《金融时报》100种股票平均价格指数28日...
全景揭秘2026级新生报到全流...   本报讯(实习生 宋依珂 记者 赵琳)马上就要开学报到了,是不是担心报到当天手忙脚乱?不熟悉入校流...
医疗保障法出台 这些看点值得关...   医疗保障是减轻群众就医负担、增进民生福祉、维护社会和谐稳定的基础性制度安排。十四届全国人大常委会...
欧盟官员:未见俄罗斯欲进攻北约   新华社北京8月28日电 一名欧盟高级官员27日说,欧洲各国情报机构没有发现俄罗斯正计划对北约欧洲...
美元指数28日上涨 来源:新华社新华社纽约8月28日电 美元指数28日上涨。衡量美元对六种主要货币的美元指数当天上涨0....
摩托罗拉预热全新施华洛世奇联名...   炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会! (来源:IT之家)I...
沃什杰克逊霍尔首秀震惊市场:美... 本次讲话让沃什的立场与特朗普要求降息的诉求形成更为鲜明的冲突。 当地时间周五,杰克逊霍尔全球央行年会...
鑫铂股份的前世今生:唐开健掌舵... 鑫铂股份是国内工业铝型材领域领先企业,专注于铝加工系列产品研发生产,具备全产业链配套优势。公司成立于...
开海在即,渔民集体“充电”   本报记者 孟祥畔  8月27日一大早,葫芦岛市沿海各乡镇街区的1500余名渔民,走进当地线下培训...