# Частная LLM на vLLM

> Разверните open-weight модель с OpenAI-совместимым API на своих GPU — данные не покидают сервер.

Source: https://docs.avenlith.com/ru/llm-inference  
Category: ИИ и GPU  
Last updated: 2026-09-22

## 1. Выберите сервер

Модели на 70 млрд параметров в FP8 нужно около 80 ГБ памяти GPU плюс запас под KV-кэш. Для старта подойдёт `gpu-l40s-4x` или одна H200.

## 2. Запустите vLLM

```bash
docker run -d --gpus all -p 8000:8000 \
  -v /models:/models vllm/vllm-openai:latest \
  --model /models/Qwen3-72B-Instruct --tensor-parallel-size 4
```

## 3. Вызовите API

```bash
curl http://10.20.0.15:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'
```

Подходит любой OpenAI SDK — достаточно поменять `base_url`.

> **Warning:** > В vLLM нет аутентификации. Держите его в частной сети или за балансировщиком с проверкой API-ключа.

## Советы по производительности

- Задайте `--tensor-parallel-size` равным числу GPU
- Включите prefix caching для чатов с длинным системным промптом
- Храните веса модели на локальном NVMe, а не в сетевом хранилище
