AI 基础设施正分化为两种截然不同的运营模式。一边是传统数据中心:一种通用型设施,旨在以可靠、安全且成本高效的方式运行多种应用。容量规划侧重于 CPU 利用率和物理或虚拟密度。
另一边是 AI 工厂:一种面向 AI 的原生生产环境,旨在以工业规模将数据转化为“智能情报”——持续进行训练、微调和模型服务,并以可量化的吞吐量确保有效推理。对于 AI 工厂而言,GPU 时数、Token 吞吐量、模型迭代速度和数据流水线效率是关键要素。在 AI 工厂中,存储不再是单纯的存储库,而是 AI 生产线上决定性能的关键环节。
AI 工厂最好被理解为一个为 AI 生命周期而生的专用生产系统。NVIDIA(英伟达)的术语表将其定义为管理整个 AI 生命周期的专用计算基础设施1,涵盖从数据摄取、数据准备,到训练、微调,直至大规模推理的全过程2。其中“产品”是以吞吐量衡量的“智能情报”,通常体现为单位时间内的 Token 数、推理次数或产出成果。
数据中心则是一个通用型设施,用于容纳服务器、存储系统、网络设备,以及电力、冷却、物理安防等维持其运行所需的辅助系统。国际能源署 (IEA) 将数据中心描述为配备 IT 设备机架及其配套基础设施的设施3。
AI 工厂同样也包含数据中心里常见的硬件和辅助系统。那么,真正的差异究竟在哪里?
一个有用的思维模型:AI 工厂可以存在于数据中心内部,但其运作方式更像一条生产线。它对计算、网络和存储要求更确定的性能表现,因为任何环节的瓶颈都会导致 GPU 资源匮乏,进而推高成本。
AI 工厂是一个集硬件、软件与运营流程于一体的综合堆栈,其设计目标如下:
关键要素在于,AI 工厂的产出并非某一特定的商业应用,而是持续不断产生的“智能”。这些智能可能表现为推荐系统、分类结果、内容摘要、智能体 (actors) 或代理 (agents)。NVIDIA 明确地将 AI 工厂描述为管理全生命周期并扩展大规模推理。1
AI 工厂将原始数据转化为经过训练的输出:AI 模型、预测结果、业务决策以及生成式内容。它将数据流水线视为生产基础设施,通过训练与推理持续优化输出效果。数据在流水线中被清理、暂存、转换、版本化并验证,从而确保模型质量建立在不断提升的数据质量基础之上。
您得到的不是一个“模型项目”,而是一系列彼此承接的任务。智能体随后可以将此变为一个可重复的流程。
当价值数万美元的 GPU 或 DPU 处于闲置状态时,成本会迅速攀升。其核心运营目标之一是最小化加速器的“气泡时间”(Bubble Time)——即 GPU 等待数据、同步或 I/O 操作的空闲时段。NVIDIA 的企业 AI 规模规划指南明确指出,本地 NVMe 存储可以通过将数据保持在靠近 GPU 的位置来消除存储瓶颈,从而提高训练和推理的吞吐量。5
正是这一核心理念——保持数据流水线的速度足够快,以确保 GPU 始终处于忙碌状态——决定了 AI 工厂与标准数据中心的存储架构决策存在显著差异。6 NVMe 存储如今已成为 AI 工厂基础设施和计算策略中不可分割的一部分,而不再像传统数据中心建设中那样被视为事后才考虑的因素。阅读我们的文章以了解更多:《NVIDIA GTC ’26 明确指出:AI 的下一次飞跃取决于存储》。
AI 工厂与数据中心共享许多相同的组件,但这些组件的选择和集成方式不同,以服务于 AI 吞吐量。
AI 工厂通常对存储和内存采用分层模型。
这正是 Solidigm 具有战略意义之处。随着数据集的增长,团队需要在不过度增加功耗、机架空间和运维开销的前提下,扩展容量和密度。阅读我们的文章,了解更多关于 AI 工厂存储的信息: 《理解 AI 数据存储中的 CMX(上下文内存扩展)》。
数据中心是支持数字服务的基础设施。它的存在是为了在适当的物理安全、电力调节、冷却、监控和运维保障下,提供可靠的计算、存储和网络服务。
IEA 的描述简单明了:数据中心容纳了安装在机架上的服务器、存储系统和网络设备,以及维持这些系统运行所需的辅助基础设施。3
正是这种通用型使命,使得数据中心在多租户、工作负载多样性方面表现出色,并拥有长期稳定的运营能力。
数据中心提供大规模训练、微调、部署和运行 AI 模型所需的基础设施和运营服务。这确保了计算、存储、网络和治理协同工作,使 AI 工作负载能够以可靠、安全且成本高效的方式运行。
数据中心的核心组件包括 IT 系统和基础设施,用于以可靠、安全的方式大规模运行计算工作负载,涵盖计算、存储、网络、电力、冷却、物理防护和运营管理。
机架式计算机持续运行,以处理请求、托管应用程序、存储文件并运行数据库。可能包含 CPU、加速器、内存和存储。
存储介质为服务器执行的所有进程保存数据,当本地存储不足时,它们会连接到计算服务器。对于延迟敏感的读取和高吞吐量需求,像 Solidigm D7-PS1010 这样的高性能 NVMe SSD 是最佳选择。对于需要最大化机架密度并将功耗降至最低的数据中心,高容量的 Solidigm D5-P5336 NVMe SSD 是理想之选。传统的存储选项如 HDD 甚至磁带可用于冷数据存储。要了解有关存储选项的更多信息,请阅读我们的文章: 《传统是磁盘驱动器的好归宿》。
交换器、路由器、以太网和光纤电缆将服务器相互连接起来。同时通过这些设备,服务器也能经由高带宽链路接入互联网。负载均衡器则负责管理流量,以确保网络请求得到均匀分配。在数据中心设计中,这些设备通常放置在机柜顶部。
数据中心维持运行需要消耗大量电力,且确保电力不中断至关重要。事实上,电力是数据中心面临的最大运营挑战。市电通过变电站引入,用于支持日常运营。但为了保证数据中心的持续运行,不间断电源 (UPS) 是不可或缺的后备措施。小规模部署时,UPS本质上相当于电池,可以在停电时维持数据中心运行。对于更长时间的停电,柴油发电机则可提供额外的电力冗余。
冷却是数据中心面临的第二大挑战。虽然从根本上分为液冷和风冷两大类,但这两种方式都存在多种细分的实现方案。
风冷:大多数风冷系统使用风扇,将冷空气吹过服务器并将热量带走排入机房。机房空调 (CRAC) 通过高架地板下送入冷空气,而列间冷却装置则可以布置在服务器之间。机上空调则无需高架地板,将热空气向上抽走,同时将冷空气向下送入机柜。目前,风冷方式最适合密度适中的通用型企业级机架。
液冷:直接液冷 (DLC) 通常指将冷板安装在设备外壳上,而直接芯片冷却 (DTC) 则是冷板直接接触芯片组件,这已成为大多数人在设想液冷场景时默认想到的系统。此外,浸没式液冷、列间液冷以及后门热交换器 (RDHx) 也是数据中心液冷方案中的其他选项。
混合冷却:当某些机架密度更高或需要更有针对性的冷却时(例如部署了AI Pod的环境),混合冷却方案应运而生,它将液冷和风冷方式结合起来。这可以体现为 GPU 或 CPU 采用直接芯片液冷方案,而服务器内则使用风扇来冷却内存和存储组件。
受控访问、监视和现场监控能够保护宝贵的数据、知识产权和基础设施,并抵御恶意行为者的攻击。这对于监管和合规要求也至关重要。
早期探测与灭火系统必须符合设施的风险标准。这可能需要使用非液体灭火剂,以避免计算机组件因液体而暴露于短路风险之中。
这包括嵌入系统各组件中的功能,用于跟踪磨损、闲置时间及其他运营指标。还可能包括通过数据中心基础设施管理 (DCIM) 软件进行的持续监控、可观测性工具、警报、事件响应及变更管理流程,以确保基础设施的长期可用性和投资保护。
数据中心通过提供持续、受保护的电力供应和冷却系统,将 IT 设备连接至可靠的网络,并通过严格的监控和流程管理来运行设备,从而确保应用程序安全、可靠地运行。
AI 工厂与传统数据中心共享基础设施基础,但在目标、架构和运营指标上存在显著差异——尤其是当 AI 工作负载成为性能、成本和扩展决策的主要驱动因素时。
在传统环境中,存储通常根据容量、弹性和成本进行规划配置。
在 AI 工厂中,存储常常演变为:
NVIDIA 的规模规划指南明确指出,本地 NVMe 存储可以消除瓶颈,让 GPU 尽可能快地访问数据1。这是一种非常“工厂式”的思维方式。NVMe 存储的存在,是为了确保生产流程持续运转。
数据中心基础设施非常耗电。这促使决策倾向于:
AI 工厂的运作方式类似于制造业:
随着 AI 采用率的增长,领导层的讨论转向了单位经济效益:
这正是存储决策能够产生可衡量影响的领域。如果通过避免 I/O 停顿来减少 GPU 闲置时间,那么同样的 GPU 集群就能产出更多的成果。
AI 不仅仅是“增加工作负载”。它正在冲击既有设施和运营假设。
电网容量和当地许可正日益成为决定 AI 基础设施扩展范围的关键因素。公开报告和预测多次将数据中心的增长与电力需求的上升挂钩。
GPU 基础设施和机架密度的提升带来了更高的单机架功耗需求,迫使团队必须面对以下挑战:
在传统环境中,存储延迟激增会成为制约因素。
而在 AI 训练中,存储停顿直接转化为 GPU 的闲置时间。这就是为什么架构设计日益强调在靠近计算的地方部署 NVMe 层。欲了解更多信息,请阅读我们的文章:《当 AI 耗尽内存时》。
AI 集群始终在进行通信,停机时间极少。如果东西向带宽受限,就会出现训练变慢、推理延迟不一致以及运维复杂化等问题。
AI 需要比以往更多的利益相关方参与——数据科学、平台工程、安全、法务和产品团队。如果没有运营模式(即“工厂”理念),团队就会陷入无休止的交接和脆弱的单次构建。
AI 工厂与数据中心的区别并非只是语义上的不同,它归根结底涉及物流和更大规模的规划框架。
对于企业领导者而言,实际启示是:您不能将 AI 视作另一种普通工作负载。如果那样做,您很可能会加剧那些已知的数据中心问题——电力限制、冷却瓶颈、网络连接和存储阻塞,从而导致昂贵的 GPU 闲置。
然而,如果您采用 AI 工厂的思维方式,您就能设计出使计算保持高效、并使 NVMe 存储成为战略加速器的流水线架构。这正是 Solidigm 的高容量 SSD 和高密度存储层能够发挥实际运营杠杆作用的地方——在扩展 AI 数据集和服务的同时,避免复杂性的同步增长。
不完全一样。AI 数据中心可以只是一个运行 AI 工作负载的设施,而 AI 工厂则意味着一种生产型运营模式,针对端到端吞吐量和持续迭代进行了优化。
它们用于 RAG 知识助手、安全分析、个性化推荐、工业 AI 和文档自动化等场景:任何需要 AI 模型在企业数据附近进行训练、微调或服务的地方。
它通常具有更高的机架密度、更多的东西向网络连接、更强的冷却需求,以及对性能更敏感的存储层级,以确保 GPU 和 DPU 等加速器不会因数据供给不足而闲置。
数据中心对电力进行调节和分配,通过冷却系统排出热量,通过网络连接各系统,并依靠运营流程来确保可靠性和安全性。
存储吞吐量直接影响 GPU 利用率。如果数据无法足够快地传输,加速器就会闲置,AI 成本就会上升;因此通常会采用本地 NVMe 存储来消除存储瓶颈。
首先是电力和冷却系统——由于加速器持续运行会产生大量热量。其次是面向东西向(服务器到服务器或服务器到存储)带宽的网络结构,然后是存储架构。GPU 的使用要求更多的 NVMe 层级和更高密度的 SSD 机架。
最常见的问题是:电力限制、热点区域、网络过度订阅、存储瓶颈,以及团队间的组织摩擦。
Solidigm 提供高性能的 NVMe SSD,为客户提供量身定制的产品路线图,以支持 AI 工厂的大规模扩展。产品组合包括液冷解决方案,以及全球应用最广泛的高容量驱动器,其中 NVMe SSD 容量已达 122.88TB(更大容量产品即将推出)。
首先,从端到端绘制 AI 生命周期(数据摄取 → 训练 → 部署),然后为吞吐量进行设计。在靠近计算的位置增加 NVMe 存储层,标准化数据治理和 MLOps 流水线,并采用单位经济指标,例如单次推理成本或每 Token 成本。
Scott Shadley 是 Solidigm 的领导叙事总监和传播者,关注推动应用前沿存储技术,包括计算存储、基于存储的 AI 和后量子加密。Scott 在半导体和存储领域拥有超 25 年经验,在工程和关注客户方面均从事过重要职位。
Cecily Whiteside 是 Solidigm 的搜索与内容经理。她为科技、生活方式及健康领域的网站与刊物撰写文章。Cecily 曾担任多家杂志的执行主编,并曾以撰稿人身份为美国及其他国家的多家出版物供稿。