vLLM ile kendi LLM’inizi çalıştırın
Açık ağırlıklı bir modeli kendi GPU’larınızda OpenAI uyumlu API ile sunun — veriler sunucunuzdan hiç çıkmaz.
1. Sunucu seçin#
FP8 formatında 70 milyar parametreli bir model yaklaşık 80 GB GPU belleği ve KV önbelleği için ek alan ister. gpu-l40s-4x veya tek bir H200 iyi bir başlangıçtır.
2. vLLM’i başlatın#
Shell
docker run -d --gpus all -p 8000:8000 \
-v /models:/models vllm/vllm-openai:latest \
--model /models/Qwen3-72B-Instruct --tensor-parallel-size 4
3. API’yi çağırın#
Shell
curl http://10.20.0.15:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "/models/Qwen3-72B-Instruct", "messages": [{"role": "user", "content": "Merhaba!"}]}'
Tüm OpenAI SDK’ları çalışır — yalnızca base_url değerini değiştirin.
Performans ipuçları#
--tensor-parallel-sizedeğerini GPU sayısına eşitleyin- Uzun sistem istemli sohbet iş yükleri için prefix önbelleğini açın
- Model ağırlıklarını ağ depolamasında değil, yerel NVMe’de tutun
Bu sayfa işinize yaradı mı?
Hâlâ yardıma mı ihtiyacınız var?
Mühendislerimiz talepleri 7/24 yanıtlar — ortalama ilk yanıt süresi 7 dakika.