# Private LLM mit vLLM betreiben

> Ein Open-Weight-Modell mit OpenAI-kompatibler API auf eigenen GPUs betreiben – Daten verlassen nie Ihren Server.

Source: https://docs.avenlith.com/de/llm-inference  
Category: KI & GPU  
Last updated: 2026-09-22

## 1. Server wählen

Ein 70B-Modell in FP8 braucht etwa 80 GB GPU-Speicher plus Platz für den KV-Cache. `gpu-l40s-4x` oder eine H200 sind ein guter Start.

## 2. vLLM starten

```bash
docker run -d --gpus all -p 8000:8000 \
  -v /models:/models vllm/vllm-openai:latest \
  --model /models/Qwen3-72B-Instruct --tensor-parallel-size 4
```

## 3. API aufrufen

```bash
curl http://10.20.0.15:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'
```

Jedes OpenAI-SDK funktioniert – ändern Sie nur die `base_url`.

> **Warning:** > vLLM hat keine Authentifizierung. Betreiben Sie es im privaten Netz oder hinter einem Load Balancer mit API-Key-Prüfung.

## Performance-Tipps

- `--tensor-parallel-size` auf die Anzahl der GPUs setzen
- Prefix-Caching für Chats mit langen System-Prompts aktivieren
- Modellgewichte auf lokalem NVMe statt auf Netzwerkspeicher ablegen
