Solidigm 在 AI 基础设施领域日重新定义 AI 存储

密度与性能兼得

第 1 节:存储密度与集群级性能的融合

AI 基础设施领域日 5 以一场现实审视拉开序幕。Allyn Malventano 调出了两年前的存储架构图。那时,KV 缓存甚至没有出现在这些幻灯片上。事实上,当时业界讨论中根本不存在这一层级。如今,它已成为 AI 推理性能的核心。这个领域的变化就是如此之快。Solidigm 非常高兴能够展示我们为这一全新层级所带来的价值。不过,背景故事就先说到这里,让我们直接来看数据。

Solidigm 覆盖了 AI 存储金字塔的完整堆栈。HBM 和 DRAM 面临供应紧张和价格上涨的双重压力。而在 G3.5 上下文层和 G4 共享存储层,容量才是关键所在。Solidigm D5-P5336 正是这一高容量层级的中坚力量。D7-PS1010 则为本地存储与上下文存储提供了旗舰级的性能表现。

本环节核心讨论内容

  • AI 存储贯穿训练、微调与推理全流程
  • G1 至 G4 内存层级,外加 G3.5 上下文存储层
  • KV 缓存计算:单个用户请求在处理 42,000 个 token 时,约需占用 13.1 GB 的 KV 缓存空间 (Llama 3 70B)
  • 上下文复用为何能消除重复计算开销

存储不再仅仅扮演持久化角色。当向量索引与 KV 缓存卸载至 SSD 时,存储实际上已承担起内存的功能。

第 2 节:24 PB 集群——TCP 基准性能测试结果

首先进行的是与 MinIO 合作的集群级负载测试。测试环境部署非常直接:采用 8x8 配置,即 8 个客户端系统同时访问 8 个存储服务器。每个存储节点配备 24 块 Solidigm D5-P5336 122TB 硬盘。原始总容量:24 PB(粗略估算,相当于每机箱约 3 PB)。

MinIO Warp 模拟 GPU 存储工作负载。客户端到存储节点的流量,通过每个客户端单个 400Gb 以太网网卡传输。存储节点则配备双 400GbE 网卡,分别用于处理面向客户端的流量和节点间互联流量。

本环节核心讨论内容

  • 8 节点集群,提供约 24PB 原始容量
  • 每个存储节点配备 24 块 Solidigm D5-P5336 122TB QLC SSD(每个机箱约 3PB)
  • Solidigm D7-PS1010 TLC 硬盘用于负载生成(客户端系统)
  • MinIO Warp 基准测试工具,采用 256 MiB 对象进行测试
  • 峰值 GET:8 个客户端时达到 268 GiB/s
  • 峰值 PUT:7 至 8 个客户端时达到 120 GiB/s
  • 全部 16 次测试运行,零错误

基准性能几乎呈线性扩展至 8 个节点。首字节延迟中位数稳定在 3 ms 至 5 ms 之间。超过 250 GB/s 的 TCP 吞吐量,考虑到 TCP 协议本身存在较高的协议开销,能跑出这一数字实属惊艳。很好。这组数据值得特别强调。按常规预期,TCP 性能在远未达到此水平时就会明显下降。不必对这样的规模感到惊讶——这正是向问题投入足够并行度之后应有的结果。

该集群设计构成了 MinIO ExaPOD 参考架构的基础构建单元。相同的节点配置可从 PB 级起步,横向扩展至 EB 级规模。

第 3 节:3 倍性能提升之旅 —— 堆栈调优

最初的数据表现良好。调优后的数据则表现更好。相较默认配置,性能提升了大约 3 倍。

第一阶段采用 Linux 和 MinIO 默认设置,建立 TCP 基准性能。第二阶段通过操作系统与网络结构的调优,消除调度抖动、数据包开销及拥塞瓶颈。第三阶段对 CPU、NIC、TCP、交换结构及 MinIO 布局进行协同调优,以实现最大吞吐量。代价是什么? 每个阶段都增加了调优的复杂度。

本环节核心讨论内容

  • 三阶段调优方法要点
  • SMT 已禁用,NIC 中断已绑定
  • MinIO 纠删码集调优:配置 24 个纠删码集,每个集包含 8 块硬盘,EC:4(纠删码比例为 4)
  • 根据线缆长度调整交换机与网卡的缓冲区参数
  • 全程记录每 GiB/s 吞吐量对应的 CPU 开销

调优工作之所以重要,是因为它为后续对比确立了基准点。如果未预先确立清晰的 TCP 基准,就无法衡量 RDMA(远程直接内存访问)带来的收益。

第 4 节:超越 TCP——双路径与 RDMA

Solidigm 正在探索进一步的性能提升方案。其中两条路径尤为突出。

第一,双路径:可使发起端 (initiator) 带宽翻倍。这对于未来与 NVIDIA B200 或 B300 等计算节点的集成尤为重要。 

第二,RDMA(远程直接内存访问):可在数据传输过程中绕过 CPU 开销。RDMA 可实现网络适配器之间的直接内存到内存通信。具备零拷贝、内核旁路、微秒级延迟等特性。在此类规模下,TCP 的开销会成为显著的性能瓶颈。预计这方面很快会有更多进展。

本环节核心讨论内容

  • TCP 开销先于 NVMe 成为瓶颈
  • RDMA 优势:零拷贝、内核旁路、微秒级延迟
  • 双路径 + RDMA 组合:旨在实现最大吞吐量
  • 调优复杂度随每一层叠加而增加

当前测试使用 DRAM 模拟 GPU 内存。RDMA 仍可降低 CPU 瓶颈并实现更高吞吐量。双路径与 RDMA 的结合会增加调优难度。但其性能回报值得投入。

MinIO MemKV:G3.5 层的实际应用

在 TCP 基准测试之后,演讲转向 MinIO MemKV。这正是 G3.5 概念的实际应用。

KV 缓存经常超出 GPU 上 HBM 的容量。在智能体工作负载中,上下文内存会持续扩展。当 HBM 被占满时,GPU 会驱逐并重新计算 KV 缓存。这在预填充阶段浪费了大量计算周期,并增加了首字延迟 (TTFT)。

本环节核心讨论内容

  • MinIO MemKV 作为分布式共享上下文内存
  • 支持直接 NVMe 访问,具备微秒级延迟
  • 无文件系统或内核开销
  • 每个 GPU 节点的并发请求提升 43 倍
  • 聚合吞吐量达 97 GB/s
  • 在超级 pods 中可扩展至每秒 16,000 个并发请求

MemKV 通过利用直接 NVMe 访问,绕过了传统文件系统和内核开销。它被设计为内存的延伸层,对于 KV 缓存这类瞬时数据,无需持久化功能。

演讲者指出,这是一个更适合通过优化软件来解决的问题,而非依赖 CXL 等复杂硬件。MemKV 直接从 NVMe 提供大型 KV 缓存块(2MB 至 64MB 的张量),避免了文件系统元数据的开销。

成本影响:在公有云中,单个 H200 节点每年可节省超过 200 万美元。更高的 GPU 利用率是节省成本的关键驱动力。

Solidigm 与 Metrum:存储即 AI 内存

第 1 节:RAG 检索

最后一节介绍了 Solidigm 与 Metrum 的合作成果。本次评估将 SSD 作为 AI 内存,用于 RAG 和 KV 缓存操作中的实际测试。

Metrum 摄取海量视频,生成详细的元数据,并为 AI 推理创建可搜索的数据库。此次评估使用真实视频流水线数据(而非合成基准测试),在 Solidigm D7-PS1010 SSD 上对比了 HNSW(基于内存的向量数据库)与 DiskANN(面向存储优化的向量数据库)的实际表现。

本环节核心讨论内容

  • Metrum AI 白皮书:“突破视频分析中的内存瓶颈
  • DiskANN 与 HNSW 性能对比(100 万、1000 万、1 亿向量规模)
  • DRAM 占用降低 65%:在 1 亿向量规模下,内存占用从 331 GB 降至 116 GB
  • 首字延迟 (TTFT) 提升 27.4 倍:从 39.26 秒缩短至 1.43 秒
  • 高并发下查询吞吐量提升 14%(1,024 线程)
  • 召回率保持 99% 以上,即使在 1 亿向量规模下依然稳定

在较低并发度和小规模数据集下,HNSW 略有优势。随着并发度提升,DiskANN 表现明显更优——尤其在真实视频流水线数据场景下。当向量规模扩展至 1 亿时,DiskANN 的性能曲线明显与 HNSW 拉开差距。这正是存储优化设计发挥作用的地方。

将海量数据集从昂贵的 DRAM 迁移到经济型 SSD 的能力带来了一种强大的优势,在不牺牲性能的情况下实现了显著的成本节约。在大规模场景下,DiskANN 完胜 HNSW。

第 2 节:KV 缓存卸载——消除冗余计算

除了向量数据库查找之外,SSD 在 KV 缓存卸载方面也扮演着关键角色。通过将重复出现的查询缓存到 Solidigm 硬盘上,系统显著改善了首字延迟 (Time to First Token),并消除了 GPU 的冗余重复计算。

一份包含 18 万个 token 的文档,将 GPU 内存推至 95% 的利用率。在无缓存复用的情况下,每个新问题都需要付出完整的 39 秒预填充成本。使用 SSD 支持的 KV 卸载,再次访问同一文档时,命中缓存仅需约 1.4 秒:不再有重复计算开销。

本环节核心讨论内容

  • KV 缓存卸载适用于重复的长上下文推理场景
  • 缓存命中时,上下文切换速度提升 27.4 倍
  • 释放宝贵的 GPU 算力,可用于其他任务
  • 适用于任何具有持久上下文的大规模 AI 系统

当系统需要服务数百甚至数千个并发用户时,这种效率提升至关重要。更快速、响应更及时的 AI 交互体验。宝贵的 GPU 计算资源被释放出来,用于处理其他工作负载。

第 3 节:这一切如何集成

演讲最后将 AI 数据流水线映射到支撑它的基础设施层级。

原始数据摄取与数据准备服务于训练和微调阶段。推理位于流水线末端,而 KV 卸载与归档环节则完成整个循环。基础设施层级从 G1(GPU HBM)延伸到 G2(主机 DRAM)、G3(本地 SSD)、G3.5(上下文内存存储)及 G4(共享存储)。

本环节核心讨论内容

  • AI 数据流水线:数据摄取、数据准备、训练、推理、归档
  • G1 到 G4 + G3.5 层级映射
  • D7-PS1010 用于本地和上下文性能
  • D5-P5336 用于共享容量层
  • 在 Solidigm AI 中央实验室进行遥测和实验室验证

产品定位非常明确。Solidigm D7-PS1010:负责本地启动、检查点存储,以及 G3.5 上下文存储层——这些场景对低延迟有着严格要求。Solidigm D5-P5336:则作为 G4 共享存储层的基石——该层级的决策焦点是容量与单 TB 成本。没有意外,各司其职。

总结

活动最后,与会代表展开了深入讨论,话题涉及部署细节、散热需求,以及 RDMA 与 TCP 路径在运维复杂度上的差异。所有演讲内容可通过 Tech Field Day 回放观看


关于演讲者

Allyn Malventano 是 Solidigm 的 AI/SSD 技术专家,专注于 AI 工作负载分类、SSD 优化,以及推理与 RAG 流水线的存储性能调优。他在存储架构领域拥有超过 15 年的经验,此前曾从事 SSD 验证与性能分析工作。

Dil Radhakrishnan 是 MinIO 的产品管理高级总监,负责高性能对象存储与 AI 数据平台的产品战略。他的工作重点包括扩展 S3 兼容存储以支撑 EB 级 AI 工作负载,以及开发 ExaPOD 参考架构。

AB Periasamy 是 MinIO 的联合创始人兼 CTO,负责分布式存储系统的架构设计,并领导 MemKV 及其他面向 AI 的原生存储创新的开发工作。