Zum Hauptinhalt springen

Hardwareanforderungen

Die normale Chat-Oberfläche ist leichtgewichtig. Lokale Ollama-Modelle benötigen die meisten Ressourcen; Work-Container ergänzen CPU-, Speicher-, Prozess-, Image- und Projektspeicherbedarf.

Kurzreferenz​

HardwarePraktische ModelleHinweise
8 GB RAM, nur CPU1B-4B quantisiertTests und leichter Chat
16 GB RAM, nur CPU4B-8B quantisiertNutzbar, langsamer als GPU
8 GB VRAM4B-8B quantisiertGutes tägliches Setup
12-16 GB VRAM8B-14B quantisiertStarke Workstation
24 GB VRAM14B-32B quantisiertHigh-End lokal
48 GB+ VRAM/großer Unified Memory32B-70B quantisiertGroße Modellexperimente

Die Geschwindigkeit hängt von Architektur, Quantisierung, Kontext, Treibern und weiteren Prozessen ab.

Gute Einstiegsmodelle​

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

nomic-embed-text ist für Dokument-Embeddings, nicht für Chat.

VRAM und RAM​

Passt das Modell in VRAM, antwortet es deutlich schneller. Auslagerung in System-RAM funktioniert möglicherweise, ist aber langsamer. RAM zählt außerdem für CPU-Inferenz, GPU-Offload, lange Kontexte und die Anwendung.

Apple Silicon​

Unified Memory wird mit Betriebssystem und Anwendungen geteilt. Rechner mit mehr Unified Memory können größere quantisierte Modelle ausführen als ein System mit vergleichbarer diskreter VRAM-Angabe. Lass genügend Speicher frei.

NVIDIA​

NVIDIA bietet über CUDA meist die beste Kompatibilität. Nutze aktuelle Treiber und prüfe Docker-GPU-Zugriff.

AMD und Intel​

Die Unterstützung hängt von Ollama und Plattformtreibern ab; CPU-Inferenz bleibt verfügbar.

Speicherbedarf reduzieren​

  • Kleinere Modelle und Q4 statt Q8 verwenden.
  • Kontext verkürzen.
  • Ungenutzte Modelle entladen.
  • Embedding- und Chatmodell getrennt wählen.

Work-Laufzeitkapazität​

Jeder aktive Aufgabencontainer erhält standardmäßig:

  • 2 GB Arbeitsspeicher;
  • 2 CPUs; und
  • 256 Prozesse.

Standardmäßig sind zwei aktive Containeraufgaben instanzweit und eine pro Administrator erlaubt. Das sind Limits, keine Reservierungen; plane WebUI, Browser, Docker, Ollama und Aufgabe gleichzeitig ein. Unter Apple Silicon teilen alle Unified Memory.

Remote-Modelle sparen Modell-RAM/VRAM, beseitigen aber weder Docker noch Containerressourcen. Jede Aufgabe besitzt ein Docker-Volume ohne eigenes Festplattenkontingent; Installationen können Docker-Speicher erschöpfen. Überwache ihn und sichere Volumes getrennt.

Ändere WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT und WORK_MAX_ACTIVE_RUNTIMES_* erst nach Messung. Siehe Umgebungsvariablen.

Verwandte Dokumentation​