# 使用 vLLM 部署私有大模型

> 在自有 GPU 上以 OpenAI 兼容 API 提供开源权重模型服务——数据绝不离开您的服务器。

Source: https://docs.avenlith.com/zh/llm-inference  
Category: AI 与 GPU  
Last updated: 2026-09-22

## 1. 选择服务器

FP8 精度的 700 亿参数模型约需 80 GB 显存，另需为 KV 缓存预留空间。`gpu-l40s-4x` 或单张 H200 是不错的起点。

## 2. 启动 vLLM

```bash
docker run -d --gpus all -p 8000:8000 \
  -v /models:/models vllm/vllm-openai:latest \
  --model /models/Qwen3-72B-Instruct --tensor-parallel-size 4
```

## 3. 调用 API

```bash
curl http://10.20.0.15:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'
```

任何 OpenAI SDK 均可使用——只需修改 `base_url`。

> **Warning:** > vLLM 本身不带认证。请将其置于私有网络中，或放在带 API 密钥校验的负载均衡器之后。

## 性能建议

- 将 `--tensor-parallel-size` 设为 GPU 数量
- 对系统提示较长的对话场景启用前缀缓存
- 将模型权重存放在本地 NVMe，而非网络存储
