# vLLM ile kendi LLM’inizi çalıştırın

> Açık ağırlıklı bir modeli kendi GPU’larınızda OpenAI uyumlu API ile sunun — veriler sunucunuzdan hiç çıkmaz.

Source: https://docs.avenlith.com/tr/llm-inference  
Category: Yapay zeka & GPU  
Last updated: 2026-09-22

## 1. Sunucu seçin

FP8 formatında 70 milyar parametreli bir model yaklaşık 80 GB GPU belleği ve KV önbelleği için ek alan ister. `gpu-l40s-4x` veya tek bir H200 iyi bir başlangıçtır.

## 2. vLLM’i başlatın

```bash
docker run -d --gpus all -p 8000:8000 \
  -v /models:/models vllm/vllm-openai:latest \
  --model /models/Qwen3-72B-Instruct --tensor-parallel-size 4
```

## 3. API’yi çağırın

```bash
curl http://10.20.0.15:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'
```

Tüm OpenAI SDK’ları çalışır — yalnızca `base_url` değerini değiştirin.

> **Warning:** > vLLM’de kimlik doğrulama yoktur. Özel ağda tutun veya API anahtarı kontrolü yapan bir yük dengeleyicinin arkasına koyun.

## Performans ipuçları

- `--tensor-parallel-size` değerini GPU sayısına eşitleyin
- Uzun sistem istemli sohbet iş yükleri için prefix önbelleğini açın
- Model ağırlıklarını ağ depolamasında değil, yerel NVMe’de tutun
