vLLM ile kendi LLM’inizi çalıştırın

Açık ağırlıklı bir modeli kendi GPU’larınızda OpenAI uyumlu API ile sunun — veriler sunucunuzdan hiç çıkmaz.

Eğitim1 dk okumaGüncellendi 22 Eyl 2026.md
Bu sayfada

1. Sunucu seçin#

FP8 formatında 70 milyar parametreli bir model yaklaşık 80 GB GPU belleği ve KV önbelleği için ek alan ister. gpu-l40s-4x veya tek bir H200 iyi bir başlangıçtır.

2. vLLM’i başlatın#

Shell
docker run -d --gpus all -p 8000:8000 \
  -v /models:/models vllm/vllm-openai:latest \
  --model /models/Qwen3-72B-Instruct --tensor-parallel-size 4

3. API’yi çağırın#

Shell
curl http://10.20.0.15:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'

Tüm OpenAI SDK’ları çalışır — yalnızca base_url değerini değiştirin.

Performans ipuçları#

  • --tensor-parallel-size değerini GPU sayısına eşitleyin
  • Uzun sistem istemli sohbet iş yükleri için prefix önbelleğini açın
  • Model ağırlıklarını ağ depolamasında değil, yerel NVMe’de tutun

Bu sayfa işinize yaradı mı?

Hâlâ yardıma mı ihtiyacınız var?

Mühendislerimiz talepleri 7/24 yanıtlar — ortalama ilk yanıt süresi 7 dakika.

Destekle iletişime geçin