Введение

Локальное развертывание больших языковых моделей (LLM) становится всё более востребованным: это позволяет не зависеть от облачных API, сохранять данные внутри компании и существенно снижать операционные затраты при большом объеме запросов. В этой статье разберем, как запустить локальный ИИ на сервере с двумя видеокартами NVIDIA Tesla V100.

NVIDIA Tesla V100 — это профессиональные ускорители на архитектуре Volta с 16 или 32 ГБ памяти HBM2, 5120 CUDA-ядер и 640 Tensor-ядер. Две такие карты через NVLink дают до 32–64 ГБ видеопамяти и высокую пропускную способность между GPU, что критично для inference больших моделей.

NVIDIA Tesla V100 SXM2 GPU

Требования к железу

  • Сервер с двумя слотами PCIe x16 или платформа под SXM2 с NVLink.
  • Две видеокарты NVIDIA Tesla V100 (16 GB или 32 GB).
  • Блок питания от 1600 Вт с резервом по мощности.
  • 64+ ГБ оперативной памяти DDR4/DDR5 ECC.
  • NVMe SSD от 500 ГБ для моделей и датасетов.
  • Ubuntu Server 22.04 LTS или Debian 12.

Почему именно V100?

Несмотря на возраст, Tesla V100 остается одним из лучших вариантов для локального ИИ по соотношению цена/производительность на вторичном рынке. Ключевые преимущества:

  • Tensor Cores — аппаратное ускорение FP16 и INT8.
  • NVLink — до 300 ГБ/с между двумя GPU.
  • HBM2 — высокая пропускная способность памяти.
  • Поддержка CUDA, cuDNN, NCCL из коробки.

Установка драйверов и CUDA

# Обновляем систему
sudo apt update && sudo apt upgrade -y

# Устанавливаем драйвер NVIDIA
sudo apt install -y nvidia-driver-535

# Перезагружаем сервер
sudo reboot

# Проверяем видимость обеих карт
nvidia-smi

После перезагрузки команда nvidia-smi должна показать оба устройства V100.

Настройка NVLink

Для двух GPU критично включить NVLink — это позволяет моделям распределяться между видеокартами без узкого места в PCIe.

# Проверяем топологию NVLink
nvidia-smi topo -m

# Убеждаемся, что статус NV4 или NVLink показан как XVB / NV#

Если NVLink не активен, проверьте физическое подключение мостов и поддержку платформы.

Запуск LLM через Ollama

Ollama — самый простой способ запустить локальную модель. Установка:

curl -fsSL https://ollama.com/install.sh | sh

# Запускаем модель с распределением на 2 GPU
ollama run llama3.1:70b

Ollama автоматически распределит модель между доступными GPU, если она не помещается на одну карту.

Альтернатива: vLLM для высокой нагрузки

Если планируется одновременная обработка множества запросов, лучше использовать vLLM с PagedAttention:

pip install vllm

python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Meta-Llama-3.1-70B \
  --tensor-parallel-size 2 \
  --gpu-memory-utilization 0.95

Параметр --tensor-parallel-size 2 включает тензорный параллелизм между двумя V100.

Производительность

На двух V100 32 GB можно комфортно запускать:

  • Llama 3.1 70B — до 25–35 токенов/с на выходе.
  • Llama 3.1 8B/70B в квантовании Q4 — десятки запросов в секунду через vLLM.
  • CodeLlama, Mistral Large, Qwen2.5 — при наличии оперативной памяти.

Типичные ошибки

  • Out of memory — уменьшите gpu-memory-utilization или используйте квантование.
  • Медленный inference — проверьте, активен ли NVLink, и не включен ли CPU fallback.
  • Тормоза при загрузке модели — используйте NVMe SSD и достаточный объем RAM.

Заключение

Сервер с двумя NVIDIA Tesla V100 — отличная основа для локального ИИ: бюджетнее A100/H100, но при этом достаточно мощная для inference современных LLM. Главное — правильно настроить NVLink, драйверы и выбрать подходящий inference-движок: Ollama для простоты или vLLM для нагруженных сценариев.

Если вы планируете сборку подобного сервера — обратите внимание на совместимость материнской платы, блока питания и системы охлаждения. В нашем каталоге всегда в наличии серверные видеокарты, процессоры, оперативная память и готовые конфигурации.