使用 vLLM 部署私有大模型

在自有 GPU 上以 OpenAI 兼容 API 提供开源权重模型服务——数据绝不离开您的服务器。

教程1 分钟阅读更新于 2026年9月22日.md
本页内容

1. 选择服务器#

FP8 精度的 700 亿参数模型约需 80 GB 显存,另需为 KV 缓存预留空间。gpu-l40s-4x 或单张 H200 是不错的起点。

2. 启动 vLLM#

Shell
docker run -d --gpus all -p 8000:8000 \
  -v /models:/models vllm/vllm-openai:latest \
  --model /models/Qwen3-72B-Instruct --tensor-parallel-size 4

3. 调用 API#

Shell
curl http://10.20.0.15:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'

任何 OpenAI SDK 均可使用——只需修改 base_url

性能建议#

  • --tensor-parallel-size 设为 GPU 数量
  • 对系统提示较长的对话场景启用前缀缓存
  • 将模型权重存放在本地 NVMe,而非网络存储

本页内容对您有帮助吗?

仍需帮助?

我们的工程师 7×24 小时处理工单——平均首次响应时间 7 分钟。

联系技术支持