Arama Yap Mesaj Senden
Rückruf anfordern
+90
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro

Kontaktieren Sie uns

Standort Halkali Merkez Viertel Fatih Str. Ozgur Apt. No. 46, Kucukcekmece, Istanbul, 34303, TR
LOCAL AI · 2026 DONANIM REHBERİ

GeForce RTX 4090: Welche Local-AI-Modelle laufen?

Local-AI-Ratgeber 2026 für GeForce RTX 4090: LLM, Coding, Vision, Bild und Video nach Modellgröße, VRAM, Kontext und Praxistests vergleichen.

GeForce RTX 4090 · 24 GB GDDR6X24 GB VRAMLetzte technische Prüfung: 13. August 2026
VRAM / RAM24 GB VRAM
  • LLM / Coding
  • Vision
  • Image
  • Video
Kurzantwort

Die praktische Grenze wird zuerst durch den nutzbaren Beschleunigerspeicher bestimmt, danach durch Quantisierung, Kontext/KV-Cache und Runtime-Overhead. Die Seite trennt komfortable Modelle von Grenzfällen und unpassenden Zielen.

VRAM ≠ sistem RAM

Wichtig: Die Modelldatei allein bestimmt den Speicherbedarf nicht. KV-Cache, Kontext, Vision-Encoder, Runtime-Workspace und parallele Anfragen benötigen zusätzlichen Speicher.

01
Hardware- und Speicherrealität

GeForce RTX 4090 · 24 GB GDDR6X

Wir unterscheiden komfortabel, Grenzbereich/Tuning nötig und kein natürliches Ziel. Das ist aussagekräftiger als nur 'läuft/läuft nicht'.

Creator- und Community-Benchmarks ändern sich je nach Backend, Treiber, Quantisierung, Kontext, Batch und Power-Limit. Sie dienen als Praxisbeleg, nicht als garantierte Leistung.

02

Modell-Kompatibilitätsmatrix

10 model / varyant
ModellGröße / SpeicherWorkloadStatusTechnische Bewertung
Qwen3.5 27B Q4_K_M17 GBLLM · Vision · KodKomfortabel24 GB sınıfında güçlü genel/kodlama seçeneği; uzun bağlam ayrıca bellek tüketir.
Qwen3.5 35B-A3B INT420 GBMoE LLM · VisionKomfortabel24 GB kartta uygulanabilir; aktif parametre az olsa da toplam ağırlıkların bellekte tutulması gerekir.
Gemma 4 26B-A4B18 GB Ollama sınıfıMoE LLM · Vision · KodKomfortabel24 GB kartlarda güçlü kalite/kapasite dengesi sunan adaylardan.
gpt-oss-20b16 GB bellek hedefiReasoning · Agent · KodKomfortabelOpenAI resmi olarak 16 GB bellekte çalışabildiğini belirtiyor; bağlam ve backend ek yükü ayrıca değerlendirilir.
FLUX.2 Klein 4B~13 GB VRAMGörsel üretim · DüzenlemeKomfortabelResmi model kartı yaklaşık 13 GB VRAM ve RTX 3090/4070 ve üzerini hedefliyor.
Wan2.2 TI2V-5B5B video modeliT2V · I2V · 720pKomfortabelResmi kart 720p/24 fps ve tek RTX 4090 sınıfında çalışma hedefini açıklıyor.
Qwen3.5 35B-A3B Q424 GBMoE LLM · VisionGrenzbereich / Tuning nötig24 GB kart için ağırlık düzeyinde tavana dayanır; 32 GB sınıfı daha güvenli.
Gemma 4 31B31B sınıfıDense LLM · Vision · KodGrenzbereich / Tuning nötig24-32 GB üstü quantization planı gerektirir; bağlam büyüdükçe ek VRAM tüketir.
Qwen-Image 20B20B sınıfıGörsel üretim · MetinGrenzbereich / Tuning nötigKarmaşık metin yerleşimi, özellikle Çince/İngilizce yazı ve düzenleme işlerinde güçlü; quantized/offload planı gerekir.
gpt-oss-120b80 GB bellek hedefiReasoning · AgentKein natürliches Ziel für diese HardwareOpenAI MXFP4 ile 80 GB bellek hedefi veriyor; tipik oyuncu GPU'ları için sistem RAM/offload gerekir.
03 · Coding- und Agent-Modelle

Coding- und Agent-Modelle

Für Coding- und Agent-Workloads sollte das Modell Speicherreserve für Repository-Kontext, Tool-Aufrufe und KV-Cache lassen, statt den gesamten Speicher nur mit Gewichten zu belegen.

Qwen3.54B · 9B · 27B · 35B-A3B
gpt-oss20b · 120b
Gemma 412B · 26B-A4B · 31B
04 · Vision und Multimodal

Vision und Multimodal

Vision/Multimodal benötigt zusätzlichen Speicher für Bild-Encoder und visuelle Tokens. Ein Textmodell, das gerade passt, kann mit mehreren hochauflösenden Bildern zum Grenzfall werden.

Qwen3.5Text + Image · 256K etiketli context
Gemma 4Multimodal · reasoning · coding
05 · Bildgenerierungsmodelle

Bildgenerierungsmodelle

Bei Bildgenerierung zählen neben dem Checkpoint auch Text-Encoder, VAE, Auflösung und Referenzbilder. Die offizielle Model-Card-Anforderung ist der sinnvollste Ausgangspunkt.

  • FLUX.2 Klein 4B: ~13 GB VRAM resmi hedef
  • Z-Image-Turbo 6B: hızlı yerel üretim, tüketici GPU odağı
  • Qwen-Image 20B: güçlü metin renderı ve düzenleme
06 · Videogenerierungsmodelle

Videogenerierungsmodelle

Video-Diffusion ist deutlich schwerer als Chat-Inferenz. Auflösung, Frame-Zahl, VAE und temporale Module beeinflussen Speicher und Laufzeit stark.

  • Wan2.2 TI2V-5B: T2V + I2V · 720p · 24 fps
  • LTX-2.3: 22B sınıfı video/ses iş akışları
  • Quantized workflow: topluluk sonuçları resmî minimumdan ayrıdır
07
Quantisierung, Kontext und Offload

Q4, INT4, Q8, context ve CPU offload nasıl okunmalı?

Q4/INT4 reduziert die Gewichte, aber KV-Cache und Runtime-Workspace bleiben. Offload in System-RAM ermöglicht größere Modelle, kostet jedoch Durchsatz und Latenz.

Model weightsCheckpoint / quantization
+
KV cacheContext × layers × precision
+
RuntimeVision / VAE / workspace
=
Gerçek bellekVRAM + kontrollü offload
08

Modell-Radar 2026: Qualitäts-Score ist nicht Hardware-Kompatibilität

local.ai · canlı benchmark verisi

Der Intelligence-Score von local.ai kombiniert τ²-bench, GAIA und GDPval. Er ist ein Qualitätsindikator, keine Aussage darüber, ob das Modell in Ihren VRAM/RAM passt.

ModelDeveloperIntelligenceRoleHardware note
Step 3.7 FlashStepFun78,8Genel zekâ / reasoninglocal.ai Intelligence lideri; skor donanım uyumluluğu anlamına gelmez.
DeepSeek V4 Flash 0731DeepSeek77,5Genel / reasoning / kodÇok büyük model sınıfı; tüketici GPU'suna sırf 'Flash' adına bakarak uygun kabul edilmemeli.
Qwen3.6 27BQwen / Alibaba76,5Genel / coding / multimodal27B sınıfı güncel kalite referansı; checkpoint ve quantization boyutu ayrıca doğrulanmalı.
Qwen3.6 35B-A3BQwen / Alibaba74,9MoE / agent / multimodalAktif parametre düşük olsa da model ağırlıklarının bellek yerleşimi ayrıca hesaplanır.
Gemma 4 31B ITGoogle66,2Multimodal / coding / reasoningYerel kullanımda quantization ve context VRAM ihtiyacını belirler.
Nemotron 3.5 LightningNVIDIA65,5Agent / reasoning30B-A3B sınıfı güncel NVIDIA yerel/agent modeli.
Qwen3.5 9B BaseQwen / Alibaba59,3Küçük-orta local LLMOllama Q4 6,6 GB sınıfı nedeniyle 8 GB donanımlarda pratik önemi yüksek.
gpt-oss-20bOpenAI43,3Reasoning / agent / codingOpenAI resmi minimumu 16 GB bellek; benchmark skoru tek başına model seçimi değildir.

local.ai metodolojisi: Intelligence = %10 τ²-bench + %35 GAIA + %55 GDPval. Decode/prefill ölçümleri 32K soğuk context ve tek stream üzerinde raporlanır. Skorlar ve model sürümleri zamanla değişebilir.

09

Bild- und Videomodelle: welches Modell für welchen Zweck?

ComfyUI · Diffusers · local inference
TypeModelMemory referenceBest fitModel card
GörselFLUX.2 Klein 4B~13 GB VRAMHızlı yerel üretim, düzenleme, multi-referenceHugging Face ↗
GörselZ-Image-Turbo 6B16 GB tüketici sınıfıFotogerçekçilik, EN/Çince metin, 8 NFEHugging Face ↗
GörselQwen-Image-251220B model ailesiMetin doğruluğu, layout, multimodal entegrasyonHugging Face ↗
VideoWan2.2 TI2V-5B4090 resmi tüketici örneğiT2V + I2V, 720p, 24 fpsHugging Face ↗
VideoMotif-Video-2B2B sınıfıÜretici değerlendirmesinde VBench toplam 83,76Hugging Face ↗
Video + SesLTX-2.5Checkpoint/precision'a göreAçık ağırlık, yerel çalıştırma, senkron video + sesHugging Face ↗
Video + SesMiniMax H333B sınıfı2K'ya kadar, 15 sn'ye kadar, native stereo audio; lisansı ticari kullanım öncesi okunmalıHugging Face ↗
Metin / logo / tabela

Qwen-Image-2512 ve Z-Image-Turbo özellikle yazı üretimi için incelenmeli. Qwen ailesi karmaşık text rendering ve düzenlemede, Z-Image ise 16 GB tüketici sınıfında fotogerçekçilik ve EN/Çince metinde öne çıkıyor.

Yerel hızlı görsel

FLUX.2 Klein 4B için resmî yaklaşık 13 GB VRAM hedefi var. 16 GB kartlar burada 8 GB kartlara göre doğrudan farklı bir sınıfa geçiyor.

Yerel video

Wan2.2 5B olgun 720p/24 fps referansı; Motif-Video-2B daha küçük araştırma seçeneği; LTX-2.5 senkron ses-video; MiniMax H3 ise çok daha ağır 33B omni-modal sınıf. “En yeni” ile “donanımınıza en uygun” aynı şey değildir.

08

Benchmarks und Validierung

Resmî + gerçek cihaz
ModellÖlçüm / veriQuellentypWas zeigt es?
Wan2.2 TI2V-5B720p · 24 fpsResmi model kartıTek 4090 örneği
Qwen3.5 27B Q417 GBOllama24 GB'da rahat pay
24 GB model testi15B-35B aralığıYouTube 2026Tek GPU gerçek kullanım karşılaştırması
Benchmark okuma kuralı

Creator- und Community-Benchmarks ändern sich je nach Backend, Treiber, Quantisierung, Kontext, Batch und Power-Limit. Sie dienen als Praxisbeleg, nicht als garantierte Leistung.

09

Offizielle Quellen und Praxistests

15 kaynak
10

Häufige Fragen

Läuft Ollama auf dieser Hardware?

Ja, wenn quantisiertes Modell und Kontext in den verfügbaren Speicher passen. Beginnen Sie mit den als komfortabel markierten Modellen.

Garantiert eine passende Modelldatei hohe Geschwindigkeit?

Nein. KV-Cache, Runtime, Bandbreite, GPU-Architektur, Kontext und Laptop-Power-Limits beeinflussen die Leistung.

Q4 oder Q8?

Bei knappem VRAM ist Q4 oft sinnvoller, weil mehr Platz für Kontext bleibt. Q8 benötigt deutlich mehr Speicher.

Erhöht mehr RAM den VRAM?

Nein. System-RAM kann für Offload genutzt werden, vergrößert aber diskreten VRAM nicht. Unified Memory ist eine andere Architektur.

Reicht Ollama für Bildgenerierung?

Ollama ist primär für LLM/Vision. FLUX, Z-Image und Qwen-Image werden typischerweise mit ComfyUI oder Diffusers genutzt.

Was zählt bei lokaler Videogenerierung?

Neben Parametern zählen Auflösung, Frames, Precision, VAE und die Hardware-Angaben der Model Card.

Ist CPU-Offload sinnvoll?

Ja, wenn Kapazität wichtiger als Latenz ist. Für interaktive Nutzung ist mehr VRAM besser, sobald Offload zum Flaschenhals wird.

Soll ich immer den maximalen Kontext verwenden?

Nein. Nur den benötigten Kontext nutzen; KV-Cache wächst mit Kontext und verbraucht zusätzlichen Speicher.

11

Verwandte Local-AI-Ratgeber

EKA SUNUCU · GPU ALTYAPISI

Wird für ein größeres Modell ein GPU-Server benötigt?

Nennen Sie Checkpoint-Größe, Zielkontext und parallele Nutzerzahl; daraus lässt sich VRAM/RAM korrekt dimensionieren.

Top