Введение
Локальное развертывание больших языковых моделей (LLM) становится всё более востребованным: это позволяет не зависеть от облачных API, сохранять данные внутри компании и существенно снижать операционные затраты при большом объеме запросов. В этой статье разберем, как запустить локальный ИИ на сервере с двумя видеокартами NVIDIA Tesla V100.
NVIDIA Tesla V100 — это профессиональные ускорители на архитектуре Volta с 16 или 32 ГБ памяти HBM2, 5120 CUDA-ядер и 640 Tensor-ядер. Две такие карты через NVLink дают до 32–64 ГБ видеопамяти и высокую пропускную способность между GPU, что критично для inference больших моделей.
Требования к железу
- Сервер с двумя слотами PCIe x16 или платформа под SXM2 с NVLink.
- Две видеокарты NVIDIA Tesla V100 (16 GB или 32 GB).
- Блок питания от 1600 Вт с резервом по мощности.
- 64+ ГБ оперативной памяти DDR4/DDR5 ECC.
- NVMe SSD от 500 ГБ для моделей и датасетов.
- Ubuntu Server 22.04 LTS или Debian 12.
Почему именно V100?
Несмотря на возраст, Tesla V100 остается одним из лучших вариантов для локального ИИ по соотношению цена/производительность на вторичном рынке. Ключевые преимущества:
- Tensor Cores — аппаратное ускорение FP16 и INT8.
- NVLink — до 300 ГБ/с между двумя GPU.
- HBM2 — высокая пропускная способность памяти.
- Поддержка CUDA, cuDNN, NCCL из коробки.
Установка драйверов и CUDA
# Обновляем систему
sudo apt update && sudo apt upgrade -y
# Устанавливаем драйвер NVIDIA
sudo apt install -y nvidia-driver-535
# Перезагружаем сервер
sudo reboot
# Проверяем видимость обеих карт
nvidia-smi
После перезагрузки команда nvidia-smi должна показать оба устройства V100.
Настройка NVLink
Для двух GPU критично включить NVLink — это позволяет моделям распределяться между видеокартами без узкого места в PCIe.
# Проверяем топологию NVLink
nvidia-smi topo -m
# Убеждаемся, что статус NV4 или NVLink показан как XVB / NV#
Если NVLink не активен, проверьте физическое подключение мостов и поддержку платформы.
Запуск LLM через Ollama
Ollama — самый простой способ запустить локальную модель. Установка:
curl -fsSL https://ollama.com/install.sh | sh
# Запускаем модель с распределением на 2 GPU
ollama run llama3.1:70b
Ollama автоматически распределит модель между доступными GPU, если она не помещается на одну карту.
Альтернатива: vLLM для высокой нагрузки
Если планируется одновременная обработка множества запросов, лучше использовать vLLM с PagedAttention:
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Meta-Llama-3.1-70B \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.95
Параметр --tensor-parallel-size 2 включает тензорный параллелизм между двумя V100.
Производительность
На двух V100 32 GB можно комфортно запускать:
- Llama 3.1 70B — до 25–35 токенов/с на выходе.
- Llama 3.1 8B/70B в квантовании Q4 — десятки запросов в секунду через vLLM.
- CodeLlama, Mistral Large, Qwen2.5 — при наличии оперативной памяти.
Типичные ошибки
- Out of memory — уменьшите
gpu-memory-utilizationили используйте квантование. - Медленный inference — проверьте, активен ли NVLink, и не включен ли CPU fallback.
- Тормоза при загрузке модели — используйте NVMe SSD и достаточный объем RAM.
Заключение
Сервер с двумя NVIDIA Tesla V100 — отличная основа для локального ИИ: бюджетнее A100/H100, но при этом достаточно мощная для inference современных LLM. Главное — правильно настроить NVLink, драйверы и выбрать подходящий inference-движок: Ollama для простоты или vLLM для нагруженных сценариев.
Если вы планируете сборку подобного сервера — обратите внимание на совместимость материнской платы, блока питания и системы охлаждения. В нашем каталоге всегда в наличии серверные видеокарты, процессоры, оперативная память и готовые конфигурации.