如何搭建人工智能服务器?
了解如何构建 AI 服务器:逐步指南,包括选择组件、设置软件和优化性能,以成功使用人工智能。
服务器组件:
- 平台:SuperMicro AS-4125GS-TNRT (SP5, 24 DIMM, 4U)
- 处理器:2 x EPYC 9454 (48 核心 / 96 线程)
- 内存:24 x Kingston Server Premier 32 GB
- GPU 加速器:4 x NVIDIA Blackwell 96GB 服务器版
- 硬盘:8 x Seagate Exos 10E2400 2.4TB SAS 10K
- HBA 适配器:Broadcom SAS 9400-16e SGL (05-50013-00) PCIe 3.1 x8 LP, Tri-Mode SAS/SATA/NVMe 12G HBA, 16 端口 (4× ext SFF8644), 3416 IOC
- SSD:2 × 1600 GB 服务器 Intel DC P4610 系列
平台
首先是平台。我选择了这个 SuperMicro,因为它可以安装 4–8 个 PCIe 5.0 的 GPU 加速器,这一点非常重要。如果安装 4 个加速器,它们可以自由放置,如果是 8 个则会非常紧凑,但在使用 NVLink 时,即使是紧凑的配置也是可以接受的。
处理器
选择了相当强大的处理器,但核心数量并不多,因为整个系统是在人工智能上构建的,这里 CPU 主要是辅助角色。AMD EPYC 是相当不错的处理器,拥有大量的核心和线程。每个处理器有 12 个内存通道,因此总共有 24 个。
内存
选择了容量为 32 GB 的内存条,因为 SuperMicro 平台有 24 个插槽,最好是全部填满。如果留下一部分插槽空着,例如取64 GB的内存条,但只安装16个,就可能会丧失30%-50%的内存带宽。原则很简单——处理器有多少内存通道,内存条就应该有多少个。
最终我们得到了768 GB,而不是1 TB,力求在预算内实现。这个容量完全足够,因为模型主要在 VRAM 中运行,只有在特殊情况下才会卸载到内存中。
GPU 加速器
这是最重要的组件之一。选择了 NVIDIA Blackwell 96GB 服务器版——相当有趣的显卡,具有较大的 VRAM 容量,同时又相对比较实惠, 比较 A100 或 H100。它们能够在内存中存储非常大的模型,而由 4–5 张显卡组成的组合可以处理最多 ~700B 参数的模型。
与更“顶级”的解决方案的区别在于,它们没有 NVLink,这意味着显卡无法结合起来进行超快速的内存传输。但在这里 PCIe 5.0 解决了这个问题——所有显卡都安装在 PCIe 5.0 上,并以高速交换数据,部分弥补了缺少 NVLink 的不足。
硬盘和 HBA
安装了 8 个 10 TB 的 SAS 服务器硬盘,组成 RAID 5。最终得到了大约 30 TB 的可用空间,用于数据集。由于模型各不相同,每个模型可能占用数百 GB,这样的容量完全足够。
此外,还安装了两个服务器 SSD,组成 RAID 1,用于存放系统。选择 SSD 而不是 NVMe,原因很简单:服务器 SSD 更耐用(约 ~3.5 PB 写入),而且 NVMe 更贵,而它们在此场景下的速度并不是关键。
总体来说,最终构建了一台这样的人工智能服务器。我不知道,也许对某些人会有帮助,如果有人在组建类似的机器。如果有问题,请在评论中提问,我会回答。

Обсуждение закрыто
Видно, что спор идет. Быстрый вход — и ответы откроются сразу.