❓ 问题 / 💻 科技
📅 29.06.2026 03:33

如何搭建人工智能服务器?

了解如何构建 AI 服务器:逐步指南,包括选择组件、设置软件和优化性能,以成功使用人工智能。

我将讲述我为公司构建人工智能服务器的故事,以及最后的结果。公司给了我125,000美元的预算,并说需要用这笔钱组建一台能够支持大型模型的人工智能服务器,以便使用,并且能够在自己的数据集上训练自己的模型。当然,价格非常高,这样的预算其实不算大,无法真正组建一台非常认真严肃的设备。这就是我组建的内容,接下来我将阐述我的选择以及为什么选择这样配置。

服务器组件:

  • 平台:SuperMicro AS-4125GS-TNRT (SP5, 24 DIMM, 4U)
  • 处理器:2 x EPYC 9454 (48 核心 / 96 线程)
  • 内存:24 x Kingston Server Premier 32 GB
  • GPU 加速器:4 x NVIDIA Blackwell 96GB 服务器版
  • 硬盘:8 x Seagate Exos 10E2400 2.4TB SAS 10K
  • HBA 适配器:Broadcom SAS 9400-16e SGL (05-50013-00) PCIe 3.1 x8 LP, Tri-Mode SAS/SATA/NVMe 12G HBA, 16 端口 (4× ext SFF8644), 3416 IOC
  • SSD:2 × 1600 GB 服务器 Intel DC P4610 系列

平台

首先是平台。我选择了这个 SuperMicro,因为它可以安装 4–8 个 PCIe 5.0 的 GPU 加速器,这一点非常重要。如果安装 4 个加速器,它们可以自由放置,如果是 8 个则会非常紧凑,但在使用 NVLink 时,即使是紧凑的配置也是可以接受的。

处理器

选择了相当强大的处理器,但核心数量并不多,因为整个系统是在人工智能上构建的,这里 CPU 主要是辅助角色。AMD EPYC 是相当不错的处理器,拥有大量的核心和线程。每个处理器有 12 个内存通道,因此总共有 24 个。

内存

选择了容量为 32 GB 的内存条,因为 SuperMicro 平台有 24 个插槽,最好是全部填满。如果留下一部分插槽空着,例如取64 GB的内存条,但只安装16个,就可能会丧失30%-50%的内存带宽。原则很简单——处理器有多少内存通道,内存条就应该有多少个。

最终我们得到了768 GB,而不是1 TB,力求在预算内实现。这个容量完全足够,因为模型主要在 VRAM 中运行,只有在特殊情况下才会卸载到内存中。

GPU 加速器

这是最重要的组件之一。选择了 NVIDIA Blackwell 96GB 服务器版——相当有趣的显卡,具有较大的 VRAM 容量,同时又相对比较实惠, 比较 A100 或 H100。它们能够在内存中存储非常大的模型,而由 4–5 张显卡组成的组合可以处理最多 ~700B 参数的模型。

与更“顶级”的解决方案的区别在于,它们没有 NVLink,这意味着显卡无法结合起来进行超快速的内存传输。但在这里 PCIe 5.0 解决了这个问题——所有显卡都安装在 PCIe 5.0 上,并以高速交换数据,部分弥补了缺少 NVLink 的不足。

硬盘和 HBA

安装了 8 个 10 TB 的 SAS 服务器硬盘,组成 RAID 5。最终得到了大约 30 TB 的可用空间,用于数据集。由于模型各不相同,每个模型可能占用数百 GB,这样的容量完全足够。

此外,还安装了两个服务器 SSD,组成 RAID 1,用于存放系统。选择 SSD 而不是 NVMe,原因很简单:服务器 SSD 更耐用(约 ~3.5 PB 写入),而且 NVMe 更贵,而它们在此场景下的速度并不是关键。

总体来说,最终构建了一台这样的人工智能服务器。我不知道,也许对某些人会有帮助,如果有人在组建类似的机器。如果有问题,请在评论中提问,我会回答。

👁 117 💬 0 👍 0 👎 0