Частная LLM на vLLM
Разверните open-weight модель с OpenAI-совместимым API на своих GPU — данные не покидают сервер.
1. Выберите сервер#
Модели на 70 млрд параметров в FP8 нужно около 80 ГБ памяти GPU плюс запас под KV-кэш. Для старта подойдёт gpu-l40s-4x или одна H200.
2. Запустите vLLM#
Shell
docker run -d --gpus all -p 8000:8000 \
-v /models:/models vllm/vllm-openai:latest \
--model /models/Qwen3-72B-Instruct --tensor-parallel-size 4
3. Вызовите API#
Shell
curl http://10.20.0.15:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'
Подходит любой OpenAI SDK — достаточно поменять base_url.
Советы по производительности#
- Задайте
--tensor-parallel-sizeравным числу GPU - Включите prefix caching для чатов с длинным системным промптом
- Храните веса модели на локальном NVMe, а не в сетевом хранилище
Была ли страница полезной?
Нужна помощь?
Наши инженеры отвечают на заявки 24/7 — среднее время первого ответа 7 минут.