Почему две V100

NVIDIA Tesla V100 — рабочая лошадка многих лабораторий и дата-центров. Карта на архитектуре Volta имеет 16 или 32 ГБ HBM2, 5120 CUDA-ядер и 640 тензорных ядер. Две таких видеокарты позволяют обучать модели среднего размера, запускать inference на больших батчах или распределять задачи между GPU.

Конечно, V100 уже не новая карта. В 2026 году она уступает A100 и H100, но остаётся доступным вариантом на вторичном рынке. Если бюджет ограничен, а задачи не требуют огромных моделей, две V100 — хороший старт. Главное понимать ограничения: нет FP8, меньше памяти, чем у A100, и старше архитектура.

Суперкомпьютер Kraken в серверном зале
Источник: Wikimedia Commons — Oak Ridge National Laboratory, CC BY 2.0, https://commons.wikimedia.org/wiki/File:Kraken_Supercomputer_(3592578852).jpg

Процессор и PCIe

Две V100 в исполнении PCIe занимают по 250 Вт каждая и требуют по 16 линий PCIe 3.0. Чтобы не создавать bottleneck, берите процессор с достаточным количеством линий PCIe. Варианты:

  • AMD EPYC 7002/7003/9004 — огромное количество PCIe-линий, часто 128 и больше. Позволяет развести две видеокарты на полноценных x16 и оставить линии под NVMe и сеть.
  • Intel Xeon Scalable — в двухпроцессорной конфигурации тоже даёт много линий, но уточняйте конкретную платформу.

Если планируете NVLink-мосты между картами, понадобятся V100 в исполнении SXM2 и соответствующая материнская плата. Для большинства самостоятельных сборок проще PCIe-версии — их проще купить и установить.

Материнская плата

Нужна плата с двумя слотами PCIe x16, расположенными так, чтобы карты не перекрывали друг друга. Идеально — серверная материнка E-ATX с двумя широкими слотами и продуваемым корпусом. Обратите внимание на:

  • расстояние между слотами;
  • наличие дополнительных разъёмов питания PCIe (6+2 pin или 8 pin);
  • поддержку резервирования питания слотов;
  • наличие слотов для NVMe SSD и сетевых карт;
  • возможность удалённого управления — IPMI или аналог.

Оперативная память

Для обучения нейросетей память часто становится bottleneck раньше, чем GPU. Минимум — 128 ГБ DDR4 ECC RDIMM. Если работаете с большими моделями или датасетами, берите 256–512 ГБ. EPYC позволяет легко набрать такой объём.

Также учитывайте скорость памяти. Для EPYC 7003 оптимальны модули 3200 МГц, для EPYC 9004 — 4800 МГц DDR5. Неправильная конфигурация памяти может снизить производительность на 10–20%.

Хранилище

ИИ — это огромные датасеты. Рекомендую такую схему:

  • Системный диск — NVMe SSD 500 ГБ – 1 ТБ.
  • Датасеты и модели — NVMe SSD 2–4 ТБ или RAID из нескольких NVMe.
  • Архив и бэкапы — SATA SSD или HDD большого объёма.

Если датасет помещается в NVMe, обучение идёт значительно быстрее, чем с HDD. Для очень больших данных используют сетевые хранилища с высокой пропускной способностью.

Блок питания

Посчитаем потребление:

  • 2 × V100 PCIe — около 500 Вт;
  • процессор EPYC — 200–280 Вт;
  • память, диски, вентиляторы, сеть — ещё 100–150 Вт.

В сумме получается 800–1000 Вт реального потребления. Берите БП на 1400–1600 Вт с сертификатом 80 Plus Platinum или Titanium и достаточным количеством разъёмов PCIe. Для серьёзной сборки лучше использовать два блока питания в резервировании.

Охлаждение

V100 PCIe — пассивные карты. Они рассчитаны на серверный обдув. В обычном корпусе их нужно обеспечить мощными вентиляторами и хорошей организацией потока. Альтернатива — готовые серверные корпуса 4U с горизонтальным обдувом. Температура GPU под нагрузкой должна держаться в пределах 70–80°C.

Сеть и управление

Для обучения на нескольких GPU важна быстрая связь между картами. Версии PCIe 3.0 x16 достаточно для большинства задач, но если планируете масштабироваться дальше, стоит посмотреть на NVLink или InfiniBand. Для управления сервером используйте IPMI/iDRAC/iLO — это сильно упрощает жизнь.

Софт и драйверы

Установите свежие драйверы NVIDIA, CUDA, cuDNN и фреймворки PyTorch или TensorFlow. Проверьте совместимость версий. Для V100 обычно достаточно CUDA 11.x или 12.x, но конкретные модели могут требовать определённых версий.

Вывод

Сборка на двух V100 — это не игровой ПК. Нужен мощный процессор с множеством PCIe-линий, 128+ ГБ RAM, NVMe-накопители, БП на 1400+ Вт и серьёзное охлаждение. Но при правильной сборке такая машина ещё долго будет полезна для обучения и inference средних моделей.

Особенности обучения на двух GPU

Если вы планируете обучать одну большую модель на двух видеокартах, понадобится распараллеливание. Для V100 без NVLink это обычно data parallelism через фреймворки. Скорость обучения растёт не идеально — обычно эффективность двух карт составляет 1,6–1,8x относительно одной. Связь по PCIe достаточна для большинства задач, но для огромных моделей лучше NVLink.

Если же вы запускаете независимые эксперименты, две карты работают как два отдельных ускорителя. Это проще и часто эффективнее для исследовательских задач.

Ошибки при сборке

  • Слабый процессор, который не успевает кормить GPU данными.
  • Недостаточно RAM — модель не помещается в память, и система начинает свопить.
  • Маленький БП — отключения и нестабильность.
  • Плохое охлаждение — троттлинг GPU и потеря производительности.
  • Медленные диски — GPU простаивает, ожидая загрузки батчей.

Итоговый чек-лист

  • Процессор с достаточным количеством PCIe-линий.
  • Материнская плата с двумя широкими слотами x16.
  • 128+ ГБ ECC RAM.
  • NVMe-накопители для системы и датасетов.
  • БП 1400–1600 Вт с запасом.
  • Корпус 4U с нормальным обдувом.
  • Свежие драйверы и фреймворки.

Корпус для такой сборки лучше выбирать серверный, а не десктопный. Десктопные корпуса обычно плохо продуваются при установке двух пассивных GPU. Серверный корпус 4U с горизонтальным обдувом позволяет видеокартам получать достаточный поток воздуха. Альтернатива — рабочие станции типа HP Z8 или Dell Precision с адаптированной системой охлаждения.

При подключении питания используйте отдельные линии от БП для каждой видеокарты, а не один разветвитель на две карты. Это снижает нагрузку на разъёмы и провода. Проверьте, чтобы толщина проводов соответствовала току.

После сборки обязательно проведите стресс-тест: FurMark или аналог для GPU, Prime95 или Linpack для CPU, memtest для RAM. Это выявит проблемы с охлаждением, питанием и стабильностью до запуска реальных задач.

При подборе материнской платы проверьте, как физически расположены слоты PCIe. Некоторые платы имеют слоты x16, но работающие на x8 электрически. Для V100 это может стать bottleneck. Ищите платы с двумя полноценными x16 и достаточным расстоянием между ними.

Также обратите внимание на версию PCIe. V100 — PCIe 3.0, поэтому достаточно слота x16 gen3. Но если планируете добавлять более новые карты в будущем, берите плату с PCIe 4.0 или 5.0.

Для хранения датасетов рассмотрите сетевое хранилище с 10 Гбит/с или выше. Если датасеты не помещаются на локальные NVMe, загрузка по сети может быть быстрее, чем работа с HDD. Главное — чтобы сеть не была узким местом.

После запуска системы настройте мониторинг GPU: температура, использование памяти, загрузка ядер, энергопотребление. Это поможет вовремя заметить проблемы и оптимизировать обучение.

После физической сборки проведите базовую настройку ОС. Для большинства задач подойдёт Ubuntu Server LTS с драйверами NVIDIA. Установите Docker, если планируете использовать контейнеры для экспериментов. Это упростит управление окружениями.

Также полезно настроить удалённый доступ через SSH с ключами, отключить вход по паролю для root и настроить firewall. Сервер ИИ часто имеет доступ к интернету для загрузки датасетов и моделей, поэтому безопасность важна.

Если вы не готовы к самостоятельной сборке, рассмотрите готовые рабочие станции для ИИ. Dell Precision, HP Z и Lenovo ThinkStation предлагают конфигурации с несколькими GPU, гарантией и поддержкой. Это дороже, но проще.

Если вы планируете использовать V100 для inference, обратите внимание на фреймворки оптимизации. TensorRT позволяет значительно ускорить inference на GPU NVIDIA за счёт квантования и оптимизации графа. Это особенно важно, если вы разворачиваете модели в production.

Для обучения используйте mixed precision. FP16 с тензорными ядрами V100 даёт заметное ускорение по сравнению с FP32, при этом экономит память. Только убедитесь, что ваши модели и фреймворк корректно поддерживают mixed precision.

Также стоит подумать о мониторинга обучения. Инструменты вроде Weights & Biases, TensorBoard или MLflow помогают отслеживать метрики, сравнивать эксперименты и находить оптимальные гиперпараметры.

И не забывайте про бэкапы моделей и датасетов. Обучение может занимать дни, и потерять результат из-за сбоя диска очень обидно.

Особенность V100 в том, что это уже не самая свежая архитектура. Поэтому не ждите от неё чудес на современных моделях, заточенных под Ampere или Ada Lovelace. Тем не менее, для большинства практических задач — компьютерное зрение, NLP среднего размера, табличные данные — V100 остаётся вполне рабочим инструментом.

Если вы планируете делиться сервером в команде, настройте разграничение доступа. JupyterHub, Kubernetes или просто планировщик задач помогут распределять ресурсы GPU между пользователями.

Также продумайте систему хранения моделей. Обученные веса могут занимать десятки гигабайт. Храните их на надёжном RAID или сетевом хранилище с версионированием.

Когда сервер собран, проведите тестовое обучение модели. Замерьте время на одной карте и на двух. Если ускорение слишком маленькое, возможно, есть bottleneck в CPU, памяти или дисках. Оптимизация пайплайна данных часто даёт больше, чем добавление GPU.

Также полезно настроить mixed precision training. На V100 это даёт существенное ускорение. Убедитесь, что loss scaling настроен правильно, чтобы избежать проблем с градиентами.

И не забывайте про кибербезопасность. Сервер ИИ часто имеет ценные модели и данные. Настройте firewall, SSH-ключи, регулярные обновления и резервное копирование.

Сборка сервера ИИ — интересный, но требовательный проект. Две V100 — хорошая отправная точка для тех, кто хочет заниматься машинным обучением без огромных вложений. Главное — не недооценивать требования к питанию, охлаждению и остальной системе.

Рассмотрим пример расчёта стоимости сборки. Две V100 б/у — основная статья расходов. Добавьте процессор EPYC 7402, материнскую плату Supermicro H12, 256 ГБ DDR4 ECC, NVMe-накопители, БП 1600 Вт и корпус 4U. Получится заметно дешевле новой A100, но дороже игрового ПК.

Если бюджет ограничен, можно начать с одной V100 и оставить слот для второй. Так вы разделите расходы во времени и сможете оценить, хватает ли одной карты.

Также учитывайте стоимость электричества. Сервер с двумя V100 может потреблять 800–1000 Вт под нагрузкой. За год это несколько тысяч киловатт-часов. Для домашней лаборатории это заметная строка в счетах.

И последнее: не забывайте про шум. Серверный корпус с мощными вентиляторами громкий. Для дома или небольшого офиса подумайте о шумоизоляции или размещении сервера в отдельном помещении.