Private LLM mit vLLM betreiben
Ein Open-Weight-Modell mit OpenAI-kompatibler API auf eigenen GPUs betreiben – Daten verlassen nie Ihren Server.
Auf dieser Seite
1. Server wählen#
Ein 70B-Modell in FP8 braucht etwa 80 GB GPU-Speicher plus Platz für den KV-Cache. gpu-l40s-4x oder eine H200 sind ein guter Start.
2. vLLM starten#
Shell
docker run -d --gpus all -p 8000:8000 \
-v /models:/models vllm/vllm-openai:latest \
--model /models/Qwen3-72B-Instruct --tensor-parallel-size 4
3. API aufrufen#
Shell
curl http://10.20.0.15:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'
Jedes OpenAI-SDK funktioniert – ändern Sie nur die base_url.
Performance-Tipps#
--tensor-parallel-sizeauf die Anzahl der GPUs setzen- Prefix-Caching für Chats mit langen System-Prompts aktivieren
- Modellgewichte auf lokalem NVMe statt auf Netzwerkspeicher ablegen
War diese Seite hilfreich?
Noch Fragen?
Unsere Ingenieure beantworten Tickets rund um die Uhr — erste Antwort im Schnitt nach 7 Minuten.