Wie man Ollama auf dem QNAP NAS mit Container Station einsetzt
Anwendbare Produkte
QTS, QuTS hero
Container Station
Szenario
Sie möchten große Sprachmodelle (LLMs) lokal auf Ihrem QNAP NAS ausführen, um private KI-Chats, Code-Unterstützung oder Dokumentenanalyse durchzuführen, ohne Daten in die Cloud zu senden. Ollama ist die beliebteste und anfängerfreundlichste Inferenz-Engine für diesen Zweck. Dieses Tutorial erklärt, wie Ollama auf dem QNAP NAS mit Container Station bereitgestellt wird.
Systemanforderungen
| Anforderung | Detail |
|---|---|
| QNAP App | Container Station 3.x oder später |
| NAS Architektur | x86_64 (Intel oder AMD CPU) (Nur wenige ARM-basierte Modelle werden unterstützt.) |
| Speicher |
|
| Speicher Speicherplatz |
|
| GPU (Optional) | Kompatible NVIDIA GPUs (siehe den Kompatibilitätsliste) Die GPU sollte im Systemsteuerung auf Container Station Modus eingestellt werden. |
Ollama versucht standardmäßig, das gesamte Modell in den Speicher zu laden. Wenn Ihr NAS nur 8–16 GB RAM hat, kann das Laden eines 14B oder größeren Modells den Systemspeicher erschöpfen, wodurch NAS-Dienste nicht mehr reagieren oder das System neu startet.
Datenverlust Risiko
Wenn Sie kein persistentes Volume für
/root/.ollama einbinden, gehen alle heruntergeladenen Modelle und Konfigurationen verloren, wenn der Container entfernt oder neu erstellt wird. Befolgen Sie immer die Anweisungen zum Einbinden von Volumes in diesem Tutorial.- Überprüfen Sie die Modellgröße im Voraus im Vergleich zu Ihrem verfügbaren RAM.
- Setzen Sie Speichergrenzen, um die Speichernutzung des Containers zu begrenzen.
- Beginnen Sie mit kleinen Modellen (1B oder 3B) und bewerten Sie die Systemstabilität, bevor Sie größere Modelle versuchen.
Verfahren
Methode 1: Nur-CPU-Bereitstellung (Keine GPU erforderlich)
Erstellen Sie Speicher Ordner.
Öffnen Sie File Station und erstellen Sie den folgenden Ordner, um Ollama-Modell-Daten zu speichern:
/share/Container/ollama
Screenshot: File Station — Erstellen des Ollama-Ordners unter /share/Container/Best PracticeWenn Ihr NAS über einen NVMe SSD Cache oder ein SSD Volume verfügt, erstellen Sie diesen Ordner auf der SSD. Die Modell-Ladegeschwindigkeit verbessert sich um bis zu 10 Mal im Vergleich zu HDDs.Erstellen Sie eine Docker Compose-Datei.
Gehen Sie in Container Station zu Anwendungen > Erstellen. Benennen Sie die Anwendung
ollamaund fügen Sie das folgende YAML ein:version: "3.8" services: ollama: image: ollama/ollama:latest container_name: ollama restart: unless-stopped ports: - "11434:11434" volumes: - /share/Container/ollama:/root/.ollama environment: - OLLAMA_HOST=0.0.0.0 - OLLAMA_KEEP_ALIVE=10m networks: - ai-network networks: ai-network: name: ai-network driver: bridge
Screenshot: Container Station — Bildschirm zur Anwendungserstellung mit YAML-Editor
Screenshot: Container Station — Speichergrenze festlegenDen Container bereitstellen.
Klicken Sie auf Erstellen. Container Station wird das Ollama-Image herunterladen und den Container starten. Warten Sie, bis der Status Läuft anzeigt.
Screenshot: Container Station — Ollama-Container zeigt "Läuft"-StatusZiehen Sie Ihr erstes Modell.
Öffnen Sie das Terminal des Containers (oder SSH in Ihr NAS und führen Sie Ihr Docker aus) und führen Sie aus:
# Für ein leichtes 3B-Modell (empfohlen für den ersten Test): ollama pull llama3.2:3b # Für ein Standard-9B-Modell (erfordert 16 GB+ RAM): ollama pull qwen3.5:9bDer Download kann je nach Ihrer Internetgeschwindigkeit mehrere Minuten dauern. Ein 9B Q4_K_M-Modell ist ungefähr 4–7 GB groß.
Hinweis- Überprüfen Sie, ob Sie genügend Festplattenspeicher haben, bevor Sie herunterladen. Verwenden Sie
ollama list, um vorhandene Modelle und deren Größen zu überprüfen. - Für ARM-basierte NAS-Modelle empfehlen wir, mit dem <1B-Modell zu beginnen, um die Speichernutzung zu überwachen.
- Überprüfen Sie, ob Sie genügend Festplattenspeicher haben, bevor Sie herunterladen. Verwenden Sie
Testen Sie das Modell.
Führen Sie im Container-Terminal aus:
ollama run qwen3.5:9bGeben Sie eine Eingabeaufforderung ein und bestätigen Sie, dass Sie eine Antwort erhalten. Geben Sie
/byeein, um zu beenden.
Methode 2: NVIDIA GPU-beschleunigte Bereitstellung
Zusätzliche Voraussetzungen für den GPU-Modus:
- NVIDIA GPU installiert und von QTS/QuTS hero erkannt
- GPU im Container Station Modus im Systemsteuerung eingestellt
- NVIDIA GPU-Treiber und NvKernelDriver von App Center installiert
Verwenden Sie die GPU-fähige Docker Compose-Konfiguration.
Ersetzen Sie das YAML aus Methode 1 durch Folgendes:
version: "3.8" services: ollama: image: ollama/ollama:latest container_name: ollama restart: unless-stopped ports: - "11434:11434" volumes: - /share/Container/ollama:/root/.ollama environment: - OLLAMA_HOST=0.0.0.0 - OLLAMA_KEEP_ALIVE=10m - NVIDIA_VISIBLE_DEVICES=all deploy: resources: reservations: devices: - driver: nvidia count: all capabilities: [gpu] networks: - ai-network networks: ai-network: name: ai-network driver: bridge
Screenshot: Container Station — GPU-fähige Docker Compose YAMLHinweisDie von QNAP mitgelieferten NVIDIA-Treiber können älter als die neueste Version sein. Wenn der Container mit aktivierter GPU nicht startet, überprüfen Sie die Treiberversion mitnvidia-smiauf dem Host und stellen Sie sicher, dass sie mit der Ollama-Image-Version kompatibel istBereitstellen und GPU-Zugriff überprüfen.
Nachdem der Container gestartet ist, öffnen Sie sein Terminal und führen Sie aus:
nvidia-smiSie sollten Ihr GPU-Modell, die Treiberversion und Speicherinformationen sehen.

Ziehen Sie ein Modell und bestätigen Sie die GPU-Beschleunigung.
ollama pull qwen3.5:9b ollama run qwen3.5:9bWährend das Modell eine Antwort generiert, öffnen Sie ein weiteres Terminal und führen Sie
nvidia-smiaus. Sie sollten beobachten, dass die GPU-Speichernutzung und die GPU-Auslastung steigen.
Ergebnis
Nach Abschluss dieses Tutorials werden Sie Folgendes haben:
- Ollama läuft auf Ihrem QNAP NAS bei
http://<NAS-IP>:11434 - Modelldaten werden in
/share/Container/ollamagespeichert (übersteht Container-Neuaufbauten) - Ein funktionierendes LLM, zugänglich über die Ollama API
Sie können die API von jedem Gerät in Ihrem lokalen Netzwerk testen:
curl http://<NAS-IP>:11434/api/generate -d '{
"model": "qwen3.5:9b",
"prompt": "Hallo, wie geht es Ihnen?",
"stream": false
}'
OLLAMA_HOST=0.0.0.0 Einstellung macht die Ollama API auf allen Netzwerkschnittstellen verfügbar. Öffnen Sie Port 11434 nicht für das Internet. Verwenden Sie Firewall Regeln oder die Netzwerkeinstellungen von QNAP, um den Zugriff nur auf Ihr lokales Netzwerk zu beschränken.Fehlerbehebung
Container beendet sich sofort nach dem Start
Dies kann durch unzureichenden RAM oder eine GPU-Treiberinkongruenz verursacht werden. Überprüfen Sie die Container-Logs in Container Station. Reduzieren Sie die Speicherbegrenzungen oder deaktivieren Sie den GPU-Modus.
Modellabruf schlägt auf halbem Weg fehl
Dies kann durch unzureichenden Festplattenspeicher oder Netzwerk-Timeout verursacht werden. Versuchen Sie, Speicher Speicherplatz freizugeben. Führen Sie ollama pull erneut aus; das System setzt dort fort, wo es gestoppt hat.
Antwortgeschwindigkeit ist sehr langsam (1–3 Token pro Sekunde)
Das Modell läuft möglicherweise auf der CPU statt auf der GPU oder das Modell ist zu groß für Ihren RAM. Überprüfen Sie Ihren GPU-Zugriff mit nvidia-smi innerhalb des Containers. Versuchen Sie, ein kleineres Modell zu verwenden.
Das NAS wird während der Inferenz unresponsive
Dies kann ein "Out of Memory"-Problem sein: Das Modell verbraucht den gesamten Systemspeicher. Wir empfehlen, das NAS neu zu starten. Setzen Sie ein Speicherverbrauchslimit in der Anwendung. Oder verwenden Sie ein kleineres Modell.
"Kann keine Verbindung zu Ollama herstellen"-Nachricht von Open WebUI
Dies kann durch eine falsche API-URL oder Docker Netzwerkisolation verursacht werden. Sie können http://ollama:11434 verwenden, wenn Sie sich im selben Docker Netzwerk befinden.
Für weitere Unterstützung fragen Sie andere Anwender und QNAP-Experten in der Community. Zur QNAP Community