출처: 量子位원문 보기 ↗
원문 저작권은 출처에 있습니다. 이 사이트는 수집, 번역 또는 형식 정리만 합니다.
사실 흐름
해설과 영향
KV Cache 是 Transformer 模型推理时为避免重复计算而存储的每一层、每个 Token 的键值对。随着长上下文推理和高并发请求成为常态,其存储需求呈指数级暴涨。数据显示,单次请求的上下文长度从 4K Token 增至 128K Token 时,KV Cache 占用空间会直接增长 32 倍,达到 64GB;若叠加 100 个并发请求,需求将飙升至 TB 级别 [来源:eet-china.com]。如此量级,容量有限且成本高昂的 HBM 根本无力承担,这直接驱动 KV Cache 大规模向 NVMe SSD 迁移,企业级 SSD(eSSD)由此成为 AI 基础设施的新焦点。
这一转移并非简单的存储介质替换,而是推理系统架构的范式转移。以 Mooncake 分离式推理架构为例,其设计思路已从“给 GPU 喂数据”转变为“围绕 Tensor 生命周期编排整条数据路径” [来源:m.sohu.com]。系统通过全局调度器(Conductor)结合 KV Cache 分布、缓存命中率和节点负载来决策缓存复用,并利用 RDMA 等技术异步传输缓存数据,实现了“用更多存储换取更少计算”的目标。论文数据显示,该架构相较于基线系统,有效请求承载能力提升了 59% 至 498% [来源:m.sohu.com]。
这种架构变革正深刻重塑存储市场的格局。CFM 预测,到 2026 年,AI 推理将驱动 eSSD 成为 NAND 闪存最大的应用市场,占比达 37%,超过手机和 PC [来源:eet-china.com]。AI 推理对存储的随机读取、低时延和高寿命要求,使得 eSSD 的价值标尺从单纯的容量转向了性能与可靠性,其平均售价已达移动 NAND 的两倍 [来源:eet-china.com]。这标志着,存储不再是计算的外围辅助,而是决定 AI 服务成本与效率的核心基石。