AI 工厂与传统数据中心

关于差异、共性,以及 AI 如何重塑行业格局的探讨

AI 工厂与传统数据中心相比
AI 工厂与传统数据中心相比

AI 基础设施正分化为两种截然不同的运营模式。一边是传统数据中心:一种通用型设施,旨在以可靠、安全且成本高效的方式运行多种应用。容量规划侧重于 CPU 利用率和物理或虚拟密度。

另一边是 AI 工厂:一种面向 AI 的原生生产环境,旨在以工业规模将数据转化为“智能情报”——持续进行训练、微调和模型服务,并以可量化的吞吐量确保有效推理。对于 AI 工厂而言,GPU 时数、Token 吞吐量、模型迭代速度和数据流水线效率是关键要素。在 AI 工厂中,存储不再是单纯的存储库,而是 AI 生产线上决定性能的关键环节。

AI 工厂与数据中心

AI 工厂最好被理解为一个为 AI 生命周期而生的专用生产系统。NVIDIA(英伟达)的术语表将其定义为管理整个 AI 生命周期的专用计算基础设施1,涵盖从数据摄取、数据准备,到训练、微调,直至大规模推理的全过程2。其中“产品”是以吞吐量衡量的“智能情报”,通常体现为单位时间内的 Token 数、推理次数或产出成果。

数据中心则是一个通用型设施,用于容纳服务器、存储系统、网络设备,以及电力、冷却、物理安防等维持其运行所需的辅助系统。国际能源署 (IEA) 将数据中心描述为配备 IT 设备机架及其配套基础设施的设施3

AI 工厂同样也包含数据中心里常见的硬件和辅助系统。那么,真正的差异究竟在哪里?

意图

  • 数据中心以可预测的方式运行多种工作负载。可能包括企业资源计划 (ERP)、网站、虚拟桌面基础架构 (VDI)、数据库、分析类应用,以及部分与 AI 相关但非关键任务型的应用。
  • AI 工厂则持续产出聚焦于 AI 的输出成果。这包括训练好的模型、嵌入向量、智能体、推荐、预测等等。

主要约束

  • 数据中心:可靠性、成本、利用率、多租户
  • AI 工厂:确保持续为 DPU 和 GPU 等昂贵加速器提供数据的端到端流水线吞吐量

主导决策的运营指标

  • 数据中心:正常运行时间、延迟 SLO、每个虚拟机/容器的成本、电能使用效率
  • AI 工厂:训练耗时、微调耗时、每秒 Token 数、每次推理成本、GPU 闲置时间

一个有用的思维模型:AI 工厂可以存在于数据中心内部,但其运作方式更像一条生产线。它对计算、网络和存储要求更确定的性能表现,因为任何环节的瓶颈都会导致 GPU 资源匮乏,进而推高成本。

什么是 AI 工厂?

AI 工厂是一个集硬件、软件与运营流程于一体的综合堆栈,其设计目标如下:

  • 接收并整理海量数据(通常为多模态数据)
  • 反复训练并微调模型
  • 大规模部署模型(包括批量推理与实时推理)
  • 衡量输出质量、数据漂移、治理合规性与成本
  • 持续迭代(新数据 → 新模型版本 → 新部署)

关键要素在于,AI 工厂的产出并非某一特定的商业应用,而是持续不断产生的“智能”。这些智能可能表现为推荐系统、分类结果、内容摘要、智能体 (actors) 或代理 (agents)。NVIDIA 明确地将 AI 工厂描述为管理全生命周期并扩展大规模推理。1

AI 工厂具体做什么?

AI 工厂将原始数据转化为经过训练的输出:AI 模型、预测结果、业务决策以及生成式内容。它将数据流水线视为生产基础设施,通过训练与推理持续优化输出效果。数据在流水线中被清理、暂存、转换、版本化并验证,从而确保模型质量建立在不断提升的数据质量基础之上。

1. 它实现了模型迭代的工业化

您得到的不是一个“模型项目”,而是一系列彼此承接的任务。智能体随后可以将此变为一个可重复的流程。

  • 可预测的数据刷新周期:每日、每周、每月或其他设定周期
  • 工作流的自动化训练与微调
  • 评估关卡,用于在最大限度地减少偏见和幻觉风险的同时,维护准确性与安全性
  • 通过部署阶段进行升级,并具备在需要时回滚的机制
  • 对模型漂移4和持续性能的持续监控

2. 它要求对加速器效率进行优化

当价值数万美元的 GPU 或 DPU 处于闲置状态时,成本会迅速攀升。其核心运营目标之一是最小化加速器的“气泡时间”(Bubble Time)——即 GPU 等待数据、同步或 I/O 操作的空闲时段。NVIDIA 的企业 AI 规模规划指南明确指出,本地 NVMe 存储可以通过将数据保持在靠近 GPU 的位置来消除存储瓶颈,从而提高训练和推理的吞吐量。5

正是这一核心理念——保持数据流水线的速度足够快,以确保 GPU 始终处于忙碌状态——决定了 AI 工厂与标准数据中心的存储架构决策存在显著差异。6 NVMe 存储如今已成为 AI 工厂基础设施和计算策略中不可分割的一部分,而不再像传统数据中心建设中那样被视为事后才考虑的因素。阅读我们的文章以了解更多:《NVIDIA GTC ’26 明确指出:AI 的下一次飞跃取决于存储》

AI 工厂的组成部分

AI 工厂与数据中心共享许多相同的组件,但这些组件的选择和集成方式不同,以服务于 AI 吞吐量。

1. 针对 AI 优化的计算层

  • 专为训练或推理配置的 GPU/加速器节点
  • 支持预处理、编排和数据服务的高核数 CPU
  • 旨在最大限度减少停顿的内存和互连(例如,高效地为 GPU 提供数据)

2. 高吞吐量网络架构

  • 高服务器到服务器或服务器到缓存的带宽(即东西向流量)至关重要,因为在跨 GPU 集群的训练过程中,节点间存在海量通信需求,这常常成为性能瓶颈。
  • 低延迟、高带宽的互连,通常采用支持 RDMA 的交换结构,以避免依赖 CPU
  • 架构设计上强调避免 AI 集群的过度订阅,确保 GPU 之间能够实现持续的、全互联的通信。

3. 存储与数据流水线——企业 AI 成败的关键

AI 工厂通常对存储和内存采用分层模型。

  • 本地 NVMe 位于 GPU 节点上,用于热数据集、数据混洗 (shuffle) 和缓存,以避免远程 I/O 造成的停顿 
  • 高密度 SSD 层,用于大型训练数据集、特征存储、向量数据库和检查点存储库
  • 对象存储或分布式存储,用于冷数据、数据溯源和长期保留

这正是 Solidigm 具有战略意义之处。随着数据集的增长,团队需要在不过度增加功耗、机架空间和运维开销的前提下,扩展容量和密度。阅读我们的文章,了解更多关于 AI 工厂存储的信息: 《理解 AI 数据存储中的 CMX(上下文内存扩展)》

4. 编排与 MLOps

  • 流水线与作业调度等工作流引擎
  • 模型注册表和工件管理
  • 实验追踪和自动化评估
  • 数据治理和模型使用的策略控制

5. 安全、治理和合规

  • 数据访问控制与加密
  • 模型访问控制,尤其针对受监管行业
  • 训练数据和模型版本的审计跟踪

传统数据中心的作用是什么?

数据中心是支持数字服务的基础设施。它的存在是为了在适当的物理安全、电力调节、冷却、监控和运维保障下,提供可靠的计算、存储和网络服务。

IEA 的描述简单明了:数据中心容纳了安装在机架上的服务器、存储系统和网络设备,以及维持这些系统运行所需的辅助基础设施。3

正是这种通用型使命,使得数据中心在多租户、工作负载多样性方面表现出色,并拥有长期稳定的运营能力。

AI 数据中心的作用是什么?

数据中心提供大规模训练、微调、部署和运行 AI 模型所需的基础设施和运营服务。这确保了计算、存储、网络和治理协同工作,使 AI 工作负载能够以可靠、安全且成本高效的方式运行。

该术语的两种常见用法

  • 运行 AI 工作负载的数据中心,同时兼顾传统应用程序(数据库、Web、分析、VDI)
  • 专门为支持 AI 而设计的数据中心,具有更高的功率密度、更快的东西向网络,以及经过优化以确保加速器高效供给的存储层(在行为上更接近 AI 工厂) 
     

AI 数据中心的核心功能

  • 托管训练和/或推理集群,包含 GPU/加速器节点,用于模型开发和生产环境服务
  • 支持数据预处理和特征流水线,用于为训练和推理准备原始数据
  • 存储大量数据,例如文档、日志、图像、视频、遥测数据以及模型工件(如检查点和嵌入向量)
  • 为应用提供模型端点,例如内部助手、面向客户的 AI 功能和分析增强
  • 管理 AI 使用的治理、可观测性和成本控制,包括访问控制、审计能力、监控和单元经济学

数据中心的组成部分

数据中心的核心组件包括 IT 系统和基础设施,用于以可靠、安全的方式大规模运行计算工作负载,涵盖计算、存储、网络、电力、冷却、物理防护和运营管理。

1. 服务器

机架式计算机持续运行,以处理请求、托管应用程序、存储文件并运行数据库。可能包含 CPU、加速器、内存和存储。 

2. 存储系统

存储介质为服务器执行的所有进程保存数据,当本地存储不足时,它们会连接到计算服务器。对于延迟敏感的读取和高吞吐量需求,像 Solidigm D7-PS1010 这样的高性能 NVMe SSD 是最佳选择。对于需要最大化机架密度并将功耗降至最低的数据中心,高容量的 Solidigm D5-P5336 NVMe SSD 是理想之选。传统的存储选项如 HDD 甚至磁带可用于冷数据存储。要了解有关存储选项的更多信息,请阅读我们的文章: 《传统是磁盘驱动器的好归宿》

3. 网络设备

交换器、路由器、以太网和光纤电缆将服务器相互连接起来。同时通过这些设备,服务器也能经由高带宽链路接入互联网。负载均衡器则负责管理流量,以确保网络请求得到均匀分配。在数据中心设计中,这些设备通常放置在机柜顶部。

4. 电力系统

数据中心维持运行需要消耗大量电力,且确保电力不中断至关重要。事实上,电力是数据中心面临的最大运营挑战。市电通过变电站引入,用于支持日常运营。但为了保证数据中心的持续运行,不间断电源 (UPS) 是不可或缺的后备措施。小规模部署时,UPS本质上相当于电池,可以在停电时维持数据中心运行。对于更长时间的停电,柴油发电机则可提供额外的电力冗余。 

5. 冷却系统

冷却是数据中心面临的第二大挑战。虽然从根本上分为液冷和风冷两大类,但这两种方式都存在多种细分的实现方案。

风冷:大多数风冷系统使用风扇,将冷空气吹过服务器并将热量带走排入机房。机房空调 (CRAC) 通过高架地板下送入冷空气,而列间冷却装置则可以布置在服务器之间。机上空调则无需高架地板,将热空气向上抽走,同时将冷空气向下送入机柜。目前,风冷方式最适合密度适中的通用型企业级机架。

液冷:直接液冷 (DLC) 通常指将冷板安装在设备外壳上,而直接芯片冷却 (DTC) 则是冷板直接接触芯片组件,这已成为大多数人在设想液冷场景时默认想到的系统。此外,浸没式液冷、列间液冷以及后门热交换器 (RDHx) 也是数据中心液冷方案中的其他选项。

混合冷却:当某些机架密度更高或需要更有针对性的冷却时(例如部署了AI Pod的环境),混合冷却方案应运而生,它将液冷和风冷方式结合起来。这可以体现为 GPU 或 CPU 采用直接芯片液冷方案,而服务器内则使用风扇来冷却内存和存储组件。

6. 物理安全

受控访问、监视和现场监控能够保护宝贵的数据、知识产权和基础设施,并抵御恶意行为者的攻击。这对于监管和合规要求也至关重要。

7. 火灾探测和灭火

早期探测与灭火系统必须符合设施的风险标准。这可能需要使用非液体灭火剂,以避免计算机组件因液体而暴露于短路风险之中。 

8. 监控和管理

这包括嵌入系统各组件中的功能,用于跟踪磨损、闲置时间及其他运营指标。还可能包括通过数据中心基础设施管理 (DCIM) 软件进行的持续监控、可观测性工具、警报、事件响应及变更管理流程,以确保基础设施的长期可用性和投资保护。 

数据中心是如何工作的?

数据中心通过提供持续、受保护的电力供应和冷却系统,将 IT 设备连接至可靠的网络,并通过严格的监控和流程管理来运行设备,从而确保应用程序安全、可靠地运行。

数据中心运行的基本流程

  1. 电力被转换为可用、可靠的电能:市电进入设施,通过 UPS 系统进行调节,经由配电单元 (PDU) 分配,并由发电机提供后备支持,从而确保工作负载在电力中断期间保持在线。
  2. 散热以保持系统稳定:冷却基础设施(空气和/或液体)管理热负荷,从而使服务器和存储设备在安全温度范围内运行。
  3. 实现端到端连接:网络架构利用冗余和性能控制,将设施内部(东西向)的系统与外部世界(南北向)连接起来。
  4. 运维确保可靠性和安全性:团队负责监控性能、响应警报、管理补丁和变更、实施物理和网络安全控制,并保持事件响应就绪状态。
  5. 容量规划保持系统可持续性:持续评估基础设施,审视冗余目标,审查成本效益,在利用率和性能扩展空间之间取得平衡,以满足不断变化的需求。

AI 工厂与传统数据中心的主要差异

AI 工厂与传统数据中心共享基础设施基础,但在目标、架构和运营指标上存在显著差异——尤其是当 AI 工作负载成为性能、成本和扩展决策的主要驱动因素时。

1. 设计中心:吞吐量与通用可靠性

  • 数据中心:针对各种混合工作负载进行优化
  • AI 工厂:针对端到端 AI 吞吐量进行优化(数据 → 计算 → 模型工件 → 推理)

2. 存储角色:容量存储库与生产阶段

在传统环境中,存储通常根据容量、弹性和成本进行规划配置。

在 AI 工厂中,存储常常演变为:

  • 高性能 NVMe 层:为 GPU 提供数据供给
  • 专用存储平台 (CMX):设计用于卸载和复用 AI 推理期间生成的 KV 缓存
  • 高密度数据湖层:支持大规模数据集
  • 快速检查点与工件存储:支持重启和结果重现

NVIDIA 的规模规划指南明确指出,本地 NVMe 存储可以消除瓶颈,让 GPU 尽可能快地访问数据1。这是一种非常“工厂式”的思维方式。NVMe 存储的存在,是为了确保生产流程持续运转。

3. 扩展约束:空间和利用率与功耗和散热

数据中心基础设施非常耗电。这促使决策倾向于:

  • 更高效率的设计
  • 对功耗利用率的关注
  • 不同的冷却策略
  • 每 TB 更高密度、更高能效的 NVMe 存储

4. 运营模式:IT 服务管理与生产运营

AI 工厂的运作方式类似于制造业:

  • 输入:数据、计算周期、训练配方
  • 输出:具有可衡量吞吐量的智能情报
  • 质量控制:评估、监控、漂移跟踪

5. 经济性:单虚拟机成本与每 Token/成果成本

随着 AI 采用率的增长,领导层的讨论转向了单位经济效益:

  • 单次推理成本
  • 每 1,000 个 token 的成本
  • 每个“已解决问题”或“已分流工单”的成本
  • 单次模型刷新周期的成本

这正是存储决策能够产生可衡量影响的领域。如果通过避免 I/O 停顿来减少 GPU 闲置时间,那么同样的 GPU 集群就能产出更多的成果。

数据中心面临的问题(以及为何在 AI 时代更加严峻)

AI 不仅仅是“增加工作负载”。它正在冲击既有设施和运营假设。

1. 电力供应能力成为关键制约因素

电网容量和当地许可正日益成为决定 AI 基础设施扩展范围的关键因素。公开报告和预测多次将数据中心的增长与电力需求的上升挂钩。 

2. 冷却复杂性增加

GPU 基础设施和机架密度的提升带来了更高的单机架功耗需求,迫使团队必须面对以下挑战:

  • 热通道封闭的成熟度提升(或进行改造)
  • 液冷技术的准备
  • 更精细的气流和热监控

3. 存储性能瓶颈显现

在传统环境中,存储延迟激增会成为制约因素。

而在 AI 训练中,存储停顿直接转化为 GPU 的闲置时间。这就是为什么架构设计日益强调在靠近计算的地方部署 NVMe 层。欲了解更多信息,请阅读我们的文章:《当 AI 耗尽内存时》。 

4. 网络过度订阅成为一种隐形成本

AI 集群始终在进行通信,停机时间极少。如果东西向带宽受限,就会出现训练变慢、推理延迟不一致以及运维复杂化等问题。

5. 组织摩擦(一个主导结果的非技术性问题)

AI 需要比以往更多的利益相关方参与——数据科学、平台工程、安全、法务和产品团队。如果没有运营模式(即“工厂”理念),团队就会陷入无休止的交接和脆弱的单次构建。

结论

AI 工厂与数据中心的区别并非只是语义上的不同,它归根结底涉及物流和更大规模的规划框架。

  • 数据中心是一种通用型设施,旨在以强大的治理和成熟的运维能力可靠地运行多种工作负载。
  • AI 工厂则是一个为 AI 全生命周期而优化的生产系统,其产出是可衡量的智能,首要目标是流水线的吞吐量——从数据摄取到训练,再到大规模推理。 

对于企业领导者而言,实际启示是:您不能将 AI 视作另一种普通工作负载。如果那样做,您很可能会加剧那些已知的数据中心问题——电力限制、冷却瓶颈、网络连接和存储阻塞,从而导致昂贵的 GPU 闲置。 

然而,如果您采用 AI 工厂的思维方式,您就能设计出使计算保持高效、并使 NVMe 存储成为战略加速器的流水线架构。这正是 Solidigm 的高容量 SSD 和高密度存储层能够发挥实际运营杠杆作用的地方——在扩展 AI 数据集和服务的同时,避免复杂性的同步增长。

常见问题解答

AI 工厂是一种专为大规模生产而构建的环境,通过集成从数据摄取、训练到部署的完整生命周期,将数据转化为 AI 输出成果、模型及推理结果。

不完全一样。AI 数据中心可以只是一个运行 AI 工作负载的设施,而 AI 工厂则意味着一种生产型运营模式,针对端到端吞吐量和持续迭代进行了优化。

它们用于 RAG 知识助手、安全分析、个性化推荐、工业 AI 和文档自动化等场景:任何需要 AI 模型在企业数据附近进行训练、微调或服务的地方。

它通常具有更高的机架密度、更多的东西向网络连接、更强的冷却需求,以及对性能更敏感的存储层级,以确保 GPU 和 DPU 等加速器不会因数据供给不足而闲置。

数据中心对电力进行调节和分配,通过冷却系统排出热量,通过网络连接各系统,并依靠运营流程来确保可靠性和安全性。 

存储吞吐量直接影响 GPU 利用率。如果数据无法足够快地传输,加速器就会闲置,AI 成本就会上升;因此通常会采用本地 NVMe 存储来消除存储瓶颈。 

首先是电力和冷却系统——由于加速器持续运行会产生大量热量。其次是面向东西向(服务器到服务器或服务器到存储)带宽的网络结构,然后是存储架构。GPU 的使用要求更多的 NVMe 层级和更高密度的 SSD 机架。

最常见的问题是:电力限制、热点区域、网络过度订阅、存储瓶颈,以及团队间的组织摩擦。

Solidigm 提供高性能的 NVMe SSD,为客户提供量身定制的产品路线图,以支持 AI 工厂的大规模扩展。产品组合包括液冷解决方案,以及全球应用最广泛的高容量驱动器,其中 NVMe SSD 容量已达 122.88TB(更大容量产品即将推出)。

首先,从端到端绘制 AI 生命周期(数据摄取 → 训练 → 部署),然后为吞吐量进行设计。在靠近计算的位置增加 NVMe 存储层,标准化数据治理和 MLOps 流水线,并采用单位经济指标,例如单次推理成本或每 Token 成本。


关于作者

Scott Shadley 是 Solidigm 的领导叙事总监和传播者,关注推动应用前沿存储技术,包括计算存储、基于存储的 AI 和后量子加密。Scott 在半导体和存储领域拥有超 25 年经验,在工程和关注客户方面均从事过重要职位。

Cecily Whiteside 是 Solidigm 的搜索与内容经理。她为科技、生活方式及健康领域的网站与刊物撰写文章。Cecily 曾担任多家杂志的执行主编,并曾以撰稿人身份为美国及其他国家的多家出版物供稿。 

  1. 什么是 AI 工厂?[https://www.nvidia.com/en-us/glossary/ai-factory/]
  2. https://www.solidigm.com/solution-hub/artificial-intelligence.html
  3. https://www.iea.org/reports/energy-and-ai/energy-demand-from-ai
  4. 模型漂移也称为模型衰减或模型退化。[https://www.splunk.com/en_us/blog/learn/model-drift.html]
  5. https://docs.nvidia.com/ai-enterprise/planning-resource/ai-factory-white-paper/latest/ecosystem-architecture.html#nvidia-certified-storage
  6. https://www.solidigm.com/products/technology/nividia-gtc-26-takeaways.html
  7. https://www.databricks.com/resources/ebook/the-big-book-of-mlops