Как собрать ИИ сервер?
Узнайте, как собрать ИИ сервер: пошаговое руководство по выбору компонентов, настройке программного обеспечения и оптимизации производительности для успешного использования искусственного интеллекта.
Компоненты сервера:
- Платформа: SuperMicro AS-4125GS-TNRT (SP5, 24 DIMM, 4U)
- Процессоры: 2 x EPYC 9454 (48 ядер / 96 потоков)
- Оперативная память: 24 x Kingston Server Premier 32 GB
- GPU ускорители: 4 x NVIDIA Blackwell 96GB Server Edition
- Жёсткие диски: 8 x Seagate Exos 10E2400 2.4TB SAS 10K
- HBA-адаптер: Broadcom SAS 9400-16e SGL (05-50013-00) PCIe 3.1 x8 LP, Tri-Mode SAS/SATA/NVMe 12G HBA, 16 port (4× ext SFF8644), 3416 IOC
- SSD: 2 × 1600 ГБ серверные Intel DC P4610 Series
Платформа
Начнём с платформы. Была выбрана SuperMicro именно эта, так как в неё можно установить 4–8 GPU ускорителей на PCIe 5.0, что очень важно. Если ставить 4 ускорителя, они будут стоять свободно, если 8 — уже впритык, но при использовании NVLink это всё равно допустимо даже при плотной компоновке.
Процессоры
Процессоры выбраны достаточно мощные, но не с избыточным количеством ядер, так как вся система собирается под ИИ, и здесь CPU играет скорее вспомогательную роль. AMD EPYC — вполне хорошие процессоры с большим количеством ядер и потоков. Каждый процессор имеет по 12 каналов памяти, то есть в сумме — 24.
Оперативная память
Оперативная память выбрана планками по 32 GB, так как в платформе SuperMicro 24 слота, и их желательно заполнить полностью. Если оставить часть слотов пустыми и, например, взять планки по 64 GB, но установить только 16 штук, то можно потерять до 30–50% пропускной способности памяти. Правило простое — сколько каналов памяти у процессоров, столько планок памяти и должно быть обязательно.
В итоге мы получаем не терабайт, а 768 GB, стараясь уложиться в бюджет. Такого объёма вполне достаточно, так как модели в основном работают в VRAM, а в исключительных случаях происходит offload в оперативную память.
GPU ускорители
Один из самых важных компонентов. Выбор пал на NVIDIA Blackwell 96GB Server Edition — достаточно интересные карты с большим объёмом VRAM и при этом относительно более доступные по сравнению с A100 или H100. Они способны держать в памяти очень крупные модели, а связка из 4–5 карт может обрабатывать модели до ~700B параметров.
Отличие от более «топовых» решений в том, что у них нет NVLink, то есть карты нельзя объединять для сверхбыстрой связи по памяти. Но здесь на помощь приходит PCIe 5.0 — все карты установлены на него и обмениваются данными на высокой скорости, частично компенсируя отсутствие NVLink.
Жёсткие диски и HBA
Жёсткие диски установлены серверные SAS на 10 TB — всего 8 штук, объединены в RAID 5. В итоге получается около 30 TB полезного пространства, которое используется под датасеты. Так как модели разные, и каждая может весить сотни гигабайт, этого объёма вполне достаточно.
Также установлены два серверных SSD в RAID 1, на которых находится система. Выбраны SSD, а не NVMe, по простой причине: серверные SSD более живучие (до ~3.5 PB записи), при этом NVMe дороже, а их скорость в данном сценарии не является критичной.
В целом получился вот такой ИИ сервер. Не знаю, может кому-то пригодится, если кто-то будет собирать похожую машину. Если есть вопросы — задавайте в комментариях, отвечу.

Обсуждение закрыто
Видно, что спор идет. Быстрый вход — и ответы откроются сразу.