Avi Shetty:整个目标,整个游戏的关键,就是确保 GPU 得到充分利用。随着上下文内存的不断增长,您必须确保存储架构成为数据中心架构的一部分。
Ryan Shrout:大家好。欢迎收看《Six Five On The Road》。我是主持人 Ryan Shrout,现在在台北 Computex 2026 现场。今天我们要聊的是 AI 推理如何影响存储与计算领域。我身边是一位老朋友,Avi Shetty。您是 Solidigm 的 AI 生态系统与市场赋能副总裁。欢迎。感谢您参加这次访谈。
Avi:非常感谢,很高兴来到这里,也很高兴来到 Computex。我觉得这里会有很多来自生态伙伴的酷炫技术发布,我对此非常期待。
Ryan:过去这几年,看着 Computex 在台北的演变真的很有意思。AI 的演进革命几乎重新定义了很多预期,所以这一切都很有趣。
Avi:是啊,您能看到这个大会的价值主张和使命发生了根本性的变化,对吧? 我刚才还在和你们团队说,这大概是我第 14 年或第 15 年来这里了,但我以前是以客户的身份来的。我曾经是做 PC 业务的,所有最酷的 PC 技术都在这里发布。它曾是那些发布的核心地带,但现在已经完全变成了 AI 的舞台。
Ryan:我想问你几个关于数据中心和 AI 推理部署的问题。让我觉得有意思的是,虽然感觉很遥远,但其实就这两年,我们开始从训练转向推理。我想很多人开始觉得存储的容量和性能可能只在训练阶段重要。但在推理中,我们仍然看到存储是关键的价值和性能组成部分。为什么仍然如此?
Avi:我认为您会看到更多。如果没有,说明您了解得还不够多。您会看到更多关于存储作为推理相关架构讨论关键的论述。而根本原因在于,推理关乎对终端用户的响应速度。因此,数据根据其热度、是否在预填充缓存中、是否在 KV 缓存中、是否在 HBM 中,或者是否已被逐出,而位于不同的层级。所有这一切最终都归结为 Token TCO,这实际上是推理所需的关键指标。您不可能把所有东西都塞进 HBM 中,因此您需要新的层级来进行卸载、从缓存中读取数据,以便为您的操作提供更好的响应速度。我们做了一项研究,Solidigm 对一个简单的大语言模型请求进行了分析。比如说,我们在台北,问“where's the best dumpling available(哪里有最好吃的饺子)?” 这是一个简单的八九个词的查询。我们在网站上有一份完整的研究,叫做 Token 剖析[Prompt]。这个八词的查询会生成约 42,000 个 token。并产生大约 12[GB] 到 13 GB 的 KV 缓存数据,这些数据必须存储在某个地方。这只是单次查询。现在想象一下,如果您在工程环境中问“hey, fix this ticket on Jira, look for our history, whether we've solved it。(嗨,在 Jira 中解决这个工单,可以查看过去的历史,看看是不是解决过这个问题)” 这样的查询会复杂得多,因而会产生更多的 token。我认为这都属于推理工作负载的一部分,您也会看到数据量在持续增长。
Ryan:您提到了 KV 缓存,我知道这是很重要的一环。那上下文窗口呢? 企业可能还会在哪些方面看到存储的重要性?[need]
Avi:是的,上下文窗口正在不断增大。而当上下文窗口增长并完全占满 HBM 时,会发生什么? GPU 就不得不进行重新计算。这意味着,重新计算意味着 GPU 没有被充分利用。数据中心的主要资产就是 GPU。整个目标,整个游戏的关键,就是确保 GPU 得到充分利用。而且随着上下文内存的不断增长,您必须确保存储架构成为数据中心架构的一部分。您要确保在不同层级配置了相应的存储,并具备扩展能力。这一切都将提升最终 Token 输出的价值,从而确保 GPU 持续保持利用率。
Ryan:当企业在获取报价、评估 RFP、试图构建自己的基础设施时,您如何看待这种平衡的转变——从“我只需要担心需要多少 GPU”到如今智能体场景下“我需要多少 CPU”? 存储又该如何融入这个决策? 您建议企业怎样将存储纳入这类考量?
Avi:从根本上说,就是训练和推理之间的区别。训练发生在那些兆瓦级的数据中心、大型基础模型公司里,但推理可以发生在任何地方,对吧? 它可以在您的后台办公室,可以在您地下室的小型数据中心,也可以在本地托管机房。因此,这取决于每个企业的具体使用场景。NVIDIA 已经绘制了蓝图,比如今年,2026 年,是存储之年,对吧? 今年年初,黄仁勋在 CES 上谈到了存储,随后在 GTC 上又进一步强调了存储,也就是整个 KV 层。他有一句话,我觉得我们所有存储厂商以及 Solidigm 都深有共鸣,他说,上下文存储层未来将消耗掉整个存储的 TAM。这就是未来几年随着推理发展您将看到的上下文内存规模。对于正在确定最佳使用方式的企业来说,我认为他们需要问自己的问题是:我能承受多少延迟? 我能承受多少 GPU 重新计算的时间? 如果这些是非常关键的参数,那么您需要确保在三个层级上拥有正确的存储架构,即 G3(直连存储)、G3.5(上下文内存)和 G4(共享存储)。
Ryan:当您展望未来两三年,虽然在这个领域很难做出准确预测,但我很好奇,存储在未来两三年后会扮演什么角色? 是容量游戏? 还是性能游戏? 它会如何变化?
Avi:有这些因素的综合,对吧? 存储没有“一刀切”的解决方案。存储就像是整个内存层级——或者说“内存墙”——本质上是经济学问题。理想情况下,如果您问任何一位 GPU 或 CPU 架构师,“您想要什么?” 他们会说:“给我 1PB 的持久存储,非易失,但要有 SRAM 级的延迟。”但这在现实中是不可行的。这就是为什么我们需要分层。我们有 SRAM、缓存、HBM、DRAM,还有分层存储:分层存储、G3、G3.5 和 G4。其中每一层都会迎来创新,而 G3 的重点在于确保这一整个部分的核心目标就是保障您的 GPU 能够获得高速的数据供给,从而实现高 GPU 利用率。G3.5 的目标是确保您不必每次都重新计算上下文。因此这里既需要性能,也需要密度。这取决于您的工作负载有多大,以及上下文是什么。至于共享存储,我认为现在已经有了足够的数据证明:硬盘的时代已经结束。这是一个纯粹的数学选择题——您是想要九机架的硬盘,还是想要一个机架的高密度 QLC 存储?我这里有实实在在的产品。这是我们 122TB 的 U.2 规格 SSD。我们早在第四季度就率先推出了这款产品。
Ryan:这个存储容量很大,
Avi:容量确实很大,但还不够大——从数据中心效率来看,您可以在 1U 机箱里放 24 块这样的硬盘,这样就能获得 4PB 的容量,同时功耗低、可扩展,满足终端客户的需求。
Ryan:看到这场革命如何改变了你我来自 PC 领域时的工作方式,真是令人惊叹。我们过去经常会看到这样的硬盘,如今它们被重新定义用途,而瓶颈也在不断演变。Avi,感谢您参加这次访谈。真的很感谢这次交流。感谢大家收看我们在台北 Computex 2026 录制的《Six Five On The Road》。我是 Ryan Shrout。请记得关注我们的社交媒体,并在 sixfivemedia.com 上查看更多内容。