Частная LLM на vLLM

Разверните open-weight модель с OpenAI-совместимым API на своих GPU — данные не покидают сервер.

Туториал1 мин чтенияОбновлено 22 сент. 2026 г..md
На этой странице

1. Выберите сервер#

Модели на 70 млрд параметров в FP8 нужно около 80 ГБ памяти GPU плюс запас под KV-кэш. Для старта подойдёт gpu-l40s-4x или одна H200.

2. Запустите vLLM#

Shell
docker run -d --gpus all -p 8000:8000 \
  -v /models:/models vllm/vllm-openai:latest \
  --model /models/Qwen3-72B-Instruct --tensor-parallel-size 4

3. Вызовите API#

Shell
curl http://10.20.0.15:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'

Подходит любой OpenAI SDK — достаточно поменять base_url.

Советы по производительности#

  • Задайте --tensor-parallel-size равным числу GPU
  • Включите prefix caching для чатов с длинным системным промптом
  • Храните веса модели на локальном NVMe, а не в сетевом хранилище

Была ли страница полезной?

Нужна помощь?

Наши инженеры отвечают на заявки 24/7 — среднее время первого ответа 7 минут.

Написать в поддержку