Docker Model Runner (DMR), modelleri Docker Hub, OCI uyumlu registry veya Hugging Face'den çekip yerel olarak servis edebiliyor.
Docker Model Runner: Windows/Linux GPU gereksinimleri, llama.cpp/vLLM/Diffusers, OpenAI-Ollama API, context/VRAM, OCI modelleri ve Ollama farkları.
Docker Model Runner (DMR), modelleri Docker Hub, OCI uyumlu registry veya Hugging Face'den çekip yerel olarak servis edebiliyor.
Güncel Docker dokümanına göre DMR OpenAI ve Ollama uyumlu API'ler sunuyor; ayrıca Anthropic uyumlu endpoint'ler de API referansında belgeleniyor.
Inference backend'leri llama.cpp, vLLM ve Diffusers; vLLM ve Diffusers Linux + NVIDIA tarafında konumlandırılıyor.
Windows amd64 için Docker güncel gereksinimde NVIDIA GPU ve 576.57+ driver belirtiyor.
Ollama local model kullanımını çok basitleştirdi; Docker Model Runner ise model dağıtımını mevcut Docker/registry/Compose iş akışına yaklaştırıyor. Modeli yalnız bir klasörde tutmak yerine OCI artifact olarak version, pull/push ve deployment zincirine dahil edebilmeniz ana farklardan biri.
DMR modelleri ilk kullanımda indirip local cache'te tutar; request geldiğinde memory'ye yükler ve kullanılmadığında kaynak optimizasyonu için unload edebilir. Bu davranış sunucu kapasite planında cold load süresi ile resident VRAM'i ayırmayı gerektirir.
Docker Desktop Windows amd64 tarafında güncel doküman NVIDIA GPU ve driver 576.57+ şartını listeliyor. Docker Engine Linux tarafında CPU, NVIDIA CUDA, AMD ROCm ve Vulkan backend seçenekleri daha geniştir; dolayısıyla 'DMR AMD'de çalışır' cümlesi işletim sistemi belirtilmeden eksik kalır.
vLLM ve Diffusers backend'leri güncel DMR dokümanında Linux + NVIDIA GPU ile sınırlı konumlandırılıyor. Windows'ta llama.cpp tabanlı GGUF local LLM kullanımı daha doğal başlangıç noktasıdır.
nvidia-smi
docker version
DMR CLI model lifecycle için `docker model` komutlarını kullanır. Modeli registry'den pull edip çalıştırabilir, inspect ile metadata/context capability'yi görebilir ve uygulamanızı aynı host üzerindeki API'ye bağlayabilirsiniz.
`docker model` tanınmıyorsa Docker Desktop/Engine sürümü ve Model Runner'ın enable durumu kontrol edilmelidir. Eski Docker sürümünde internetten farklı CLI plugin kopyalamak yerine önce resmi güncelleme yolunu izleyin.
docker model --help
docker model pull ai/qwen2.5-coder
docker model inspect ai/qwen2.5-coder
Docker Desktop'ta host TCP erişimi etkinleştirildiğinde DMR API varsayılan örneklerde localhost:12434 üzerinden erişilebilir. OpenAI client'ları `/engines/v1` base URL, Ollama uyumlu client'lar aynı host endpoint'ini kullanabilir. Böylece mevcut SDK ve araçları local modele taşıma maliyeti düşer.
API uyumluluğu 'tüm Ollama/OpenAI özellikleri birebir aynıdır' anlamına gelmez. Tool calling, embeddings, model options ve streaming ihtiyacını kullanacağınız client özelinde test edin.
curl http://localhost:12434/engines/v1/models
curl http://localhost:12434/api/tags
Model weights aynı kalsa bile uzun context KV cache ve runtime buffer tüketimini büyütür. Docker `docker model configure --context-size` ile gerçek inference context'ini düşürüp artırmayı destekler. Out-of-memory hatasında ilk çözümlerden biri context'i küçültmektir.
Docker dokümanı model inspect'in maksimum supported context ile configured context'i aynı şey olarak göstermediğine dikkat çekiyor. 'Model 128K destekliyor' demek 128K'yı mevcut 8/12/16 GB VRAM'de pratik çalıştırabileceğiniz anlamına gelmez.
docker model configure --context-size 8192 ai/qwen2.5-coder
docker model inspect ai/qwen2.5-coder
llama.cpp quantized GGUF modelleriyle local geliştirme ve kaynak verimliliği için uygundur. vLLM Safetensors tabanlı yüksek throughput serving'e yönelir. Diffusers ise Stable Diffusion sınıfı text-to-image modellerini servis etmek için kullanılır.
Bu yüzden DMR yalnız 'Ollama alternatifi LLM runner' olarak değerlendirilmemeli; aynı ürün altında farklı inference engine ve model artifact iş akışları sunması asıl stratejik farkıdır.
Ollama hızlı kurulum, geniş topluluk, Modelfile ve basit local API deneyiminde hâlâ çok pratiktir. DMR ise Docker kullanan ekiplerde registry, Compose, artifact distribution, container uygulamalarla discovery ve standard deployment akışında avantaj sağlar.
Tek kişilik Windows workstation'da yalnız chat/coding modeli çalıştıracaksanız Ollama daha az kavramla başlayabilir. Aynı modeli uygulama stack'iyle versionlayıp registry'de paylaşacak, Linux GPU server'a taşıyacak veya Diffusers/vLLM kullanacaksanız DMR daha doğal olabilir.
Docker dokümanına göre Linux'ta DMR inference engine'leri container isolation boundary içinde çalışır. macOS ve Windows'ta engine'ler klasik container içinde değil, platform sandbox mekanizmalarıyla izole edilir. Bu ayrım güvenlik mimarisi değerlendirirken önemlidir.
Model artifact'ı da yazılım bağımlılığı gibi supply-chain girdisidir. Registry provenance, model kaynağı, lisans ve custom runtime flags production'a alınmadan incelenmelidir.
| İhtiyaç | Daha doğal seçenek |
|---|---|
| Hızlı tek kullanıcı local chat/coding | Ollama |
| Docker Compose/registry ile model lifecycle | Docker Model Runner |
| Linux yüksek throughput Safetensors | DMR + vLLM |
| Docker içinde image generation | DMR + Diffusers (Linux/NVIDIA) |
Komutları üretim sistemine uygulamadan önce bağlamı doğrulayın, yedek ve geri dönüş planı oluşturun. DNS, TLS, recovery, Docker veya WordPress ayarlarında birden fazla değişkeni aynı anda değiştirmek kök nedeni görünmez hale getirir.
Hayır. İki araç örtüşen local inference ihtiyaçlarını farklı ekosistem ve deployment öncelikleriyle çözüyor.
Güncel Docker Desktop Windows amd64 gereksinimi NVIDIA GPU listeliyor; AMD/ROCm desteği Docker Engine Linux tarafında belgeleniyor.
Hayır. Daha büyük context daha fazla memory tüketir ve gereksiz uzun context throughput'u düşürebilir. İhtiyaca göre en küçük yeterli context daha sağlıklıdır.
Sorun hosting, VPS, Docker, Cloudflare, Windows veya WordPress altyapınızda devam ediyorsa hata çıktısı ve mevcut mimariyle birlikte teknik destek kaydı oluşturabilirsiniz.