[Wichtiger Sicherheit Hinweis] Gefälschte Qfinder Pro Websites entdeckt. Mehr erfahren >

Dieser Inhalt ist maschinell übersetzt. Bitte beachten Sie den Haftungsausschluss für maschinelle Übersetzung.
Umschalten auf Englisch

How to deploy Ollama on the QNAP NAS using Container Station
Wie man Ollama auf dem QNAP NAS mit Container Station einsetzt


Zuletzt geändertes Datum 2026-05-08

Anwendbare Produkte

QTS, QuTS hero

Container Station


Szenario

Sie möchten große Sprachmodelle (LLMs) lokal auf Ihrem QNAP NAS ausführen, um private KI-Chats, Code-Unterstützung oder Dokumentenanalyse durchzuführen, ohne Daten in die Cloud zu senden. Ollama ist die beliebteste und anfängerfreundlichste Inferenz-Engine für diesen Zweck. Dieses Tutorial erklärt, wie Ollama auf dem QNAP NAS mit Container Station bereitgestellt wird.


Systemanforderungen

AnforderungDetail
QNAP AppContainer Station 3.x oder später
NAS Architekturx86_64 (Intel oder AMD CPU)
(Nur wenige ARM-basierte Modelle werden unterstützt.)
Speicher 
  • Mindestens 8 GB (für 3B Modelle)
  • Mindestens 16 GB (für 7B Modelle)
Speicher Speicherplatz
  • Mindestens 20 GB zusätzlicher freier Speicher Speicherplatz zusätzlich zur Modell-Dateigröße.
  • Verwenden Sie nach Möglichkeit ein SSD-Volume.
GPU (Optional)Kompatible NVIDIA GPUs (siehe den Kompatibilitätsliste)
Die GPU sollte im Systemsteuerung auf Container Station Modus eingestellt werden.
Warnung
OOM (Out of Memory) Risiko
Ollama versucht standardmäßig, das gesamte Modell in den Speicher zu laden. Wenn Ihr NAS nur 8–16 GB RAM hat, kann das Laden eines 14B oder größeren Modells den Systemspeicher erschöpfen, wodurch NAS-Dienste nicht mehr reagieren oder das System neu startet.

Datenverlust Risiko
Wenn Sie kein persistentes Volume für /root/.ollama einbinden, gehen alle heruntergeladenen Modelle und Konfigurationen verloren, wenn der Container entfernt oder neu erstellt wird. Befolgen Sie immer die Anweisungen zum Einbinden von Volumes in diesem Tutorial.
Best Practice
  • Überprüfen Sie die Modellgröße im Voraus im Vergleich zu Ihrem verfügbaren RAM.
  • Setzen Sie Speichergrenzen, um die Speichernutzung des Containers zu begrenzen.
  • Beginnen Sie mit kleinen Modellen (1B oder 3B) und bewerten Sie die Systemstabilität, bevor Sie größere Modelle versuchen.

Verfahren

Methode 1: Nur-CPU-Bereitstellung (Keine GPU erforderlich)

  1. Erstellen Sie Speicher Ordner.

    Öffnen Sie File Station und erstellen Sie den folgenden Ordner, um Ollama-Modell-Daten zu speichern:
    /share/Container/ollama

    Screenshot: File Station — Erstellen des Ollama-Ordners unter /share/Container/

    Best Practice
    Wenn Ihr NAS über einen NVMe SSD Cache oder ein SSD Volume verfügt, erstellen Sie diesen Ordner auf der SSD. Die Modell-Ladegeschwindigkeit verbessert sich um bis zu 10 Mal im Vergleich zu HDDs.

  2. Erstellen Sie eine Docker Compose-Datei.

    Gehen Sie in Container Station zu Anwendungen > Erstellen. Benennen Sie die Anwendung ollama und fügen Sie das folgende YAML ein:

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    Screenshot: Container Station — Bildschirm zur Anwendungserstellung mit YAML-Editor
    Screenshot: Container Station — Speichergrenze festlegen

  3. Den Container bereitstellen.

    Klicken Sie auf Erstellen. Container Station wird das Ollama-Image herunterladen und den Container starten. Warten Sie, bis der Status Läuft anzeigt.

    Screenshot: Container Station — Ollama-Container zeigt "Läuft"-Status

  4. Ziehen Sie Ihr erstes Modell.

    Öffnen Sie das Terminal des Containers (oder SSH in Ihr NAS und führen Sie Ihr Docker aus) und führen Sie aus:

    # Für ein leichtes 3B-Modell (empfohlen für den ersten Test):
    ollama pull llama3.2:3b
    
    # Für ein Standard-9B-Modell (erfordert 16 GB+ RAM):
    ollama pull qwen3.5:9b

    Der Download kann je nach Ihrer Internetgeschwindigkeit mehrere Minuten dauern. Ein 9B Q4_K_M-Modell ist ungefähr 4–7 GB groß.

    Hinweis
    • Überprüfen Sie, ob Sie genügend Festplattenspeicher haben, bevor Sie herunterladen. Verwenden Sie ollama list, um vorhandene Modelle und deren Größen zu überprüfen.
    • Für ARM-basierte NAS-Modelle empfehlen wir, mit dem <1B-Modell zu beginnen, um die Speichernutzung zu überwachen. 
  5. Testen Sie das Modell.

    Führen Sie im Container-Terminal aus:

    ollama run qwen3.5:9b

    Geben Sie eine Eingabeaufforderung ein und bestätigen Sie, dass Sie eine Antwort erhalten. Geben Sie /bye ein, um zu beenden.


Methode 2: NVIDIA GPU-beschleunigte Bereitstellung

Hinweis

Zusätzliche Voraussetzungen für den GPU-Modus:

  • NVIDIA GPU installiert und von QTS/QuTS hero erkannt
  • GPU im Container Station Modus im Systemsteuerung eingestellt
  • NVIDIA GPU-Treiber und NvKernelDriver von App Center installiert
  1. Verwenden Sie die GPU-fähige Docker Compose-Konfiguration.

    Ersetzen Sie das YAML aus Methode 1 durch Folgendes:

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
          - NVIDIA_VISIBLE_DEVICES=all
        deploy:
          resources:
            reservations:
              devices:
                - driver: nvidia
                  count: all
                  capabilities: [gpu]
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    Screenshot: Container Station — GPU-fähige Docker Compose YAML

    Hinweis
    Die von QNAP mitgelieferten NVIDIA-Treiber können älter als die neueste Version sein. Wenn der Container mit aktivierter GPU nicht startet, überprüfen Sie die Treiberversion mit nvidia-smi auf dem Host und stellen Sie sicher, dass sie mit der Ollama-Image-Version kompatibel ist

  2. Bereitstellen und GPU-Zugriff überprüfen.

    Nachdem der Container gestartet ist, öffnen Sie sein Terminal und führen Sie aus:

    nvidia-smi

    Sie sollten Ihr GPU-Modell, die Treiberversion und Speicherinformationen sehen.

  3. Ziehen Sie ein Modell und bestätigen Sie die GPU-Beschleunigung.

    ollama pull qwen3.5:9b
    ollama run qwen3.5:9b

    Während das Modell eine Antwort generiert, öffnen Sie ein weiteres Terminal und führen Sie nvidia-smi aus. Sie sollten beobachten, dass die GPU-Speichernutzung und die GPU-Auslastung steigen. 

Ergebnis

Nach Abschluss dieses Tutorials werden Sie Folgendes haben:

  • Ollama läuft auf Ihrem QNAP NAS bei http://<NAS-IP>:11434
  • Modelldaten werden in /share/Container/ollama gespeichert (übersteht Container-Neuaufbauten)
  • Ein funktionierendes LLM, zugänglich über die Ollama API

Sie können die API von jedem Gerät in Ihrem lokalen Netzwerk testen:

curl http://<NAS-IP>:11434/api/generate -d '{
  "model": "qwen3.5:9b",
  "prompt": "Hallo, wie geht es Ihnen?",
  "stream": false
}'

Wichtig
Die OLLAMA_HOST=0.0.0.0 Einstellung macht die Ollama API auf allen Netzwerkschnittstellen verfügbar. Öffnen Sie Port 11434 nicht für das Internet. Verwenden Sie Firewall Regeln oder die Netzwerkeinstellungen von QNAP, um den Zugriff nur auf Ihr lokales Netzwerk zu beschränken.

Fehlerbehebung

Container beendet sich sofort nach dem Start

Dies kann durch unzureichenden RAM oder eine GPU-Treiberinkongruenz verursacht werden. Überprüfen Sie die Container-Logs in Container Station. Reduzieren Sie die Speicherbegrenzungen oder deaktivieren Sie den GPU-Modus.

Modellabruf schlägt auf halbem Weg fehl 

Dies kann durch unzureichenden Festplattenspeicher oder Netzwerk-Timeout verursacht werden. Versuchen Sie, Speicher Speicherplatz freizugeben. Führen Sie ollama pull erneut aus; das System setzt dort fort, wo es gestoppt hat.

Antwortgeschwindigkeit ist sehr langsam (1–3 Token pro Sekunde)

Das Modell läuft möglicherweise auf der CPU statt auf der GPU oder das Modell ist zu groß für Ihren RAM. Überprüfen Sie Ihren GPU-Zugriff mit nvidia-smi innerhalb des Containers. Versuchen Sie, ein kleineres Modell zu verwenden.

Das NAS wird während der Inferenz unresponsive

Dies kann ein "Out of Memory"-Problem sein: Das Modell verbraucht den gesamten Systemspeicher. Wir empfehlen, das NAS neu zu starten. Setzen Sie ein Speicherverbrauchslimit in der Anwendung. Oder verwenden Sie ein kleineres Modell.

"Kann keine Verbindung zu Ollama herstellen"-Nachricht von Open WebUI

Dies kann durch eine falsche API-URL oder Docker Netzwerkisolation verursacht werden. Sie können http://ollama:11434 verwenden, wenn Sie sich im selben Docker Netzwerk befinden.


War dieser Artikel hilfreich?

100% der Nutzer fanden es hilfreich.
Vielen Dank für Ihre Rückmeldung.

Für weitere Unterstützung fragen Sie andere Anwender und QNAP-Experten in der Community. Zur QNAP Community

Bitte teilen Sie uns mit, wie dieser Artikel verbessert werden kann:

Wenn Sie zusätzliches Feedback geben möchten, fügen Sie es bitte unten ein.

Wählen Sie die Spezifikation

      Mehr anzeigen Weniger
      Diese Seite in anderen Ländern / Regionen:
      Chatten Sie mit uns! Chatten Sie mit uns!
      back to top