[Importante Sicurezza Avviso] Rilevati siti web Qfinder Pro falsi. Scopri di più >

Questo contenuto è una traduzione automatica. Vedere la sezione Esclusione di responsabilità per la traduzione automatica.
Passa a Inglese

How to deploy Ollama on the QNAP NAS using Container Station
Come distribuire Ollama sul NAS QNAP utilizzando Container Station


Ultima data di modifica 2026-05-08

Prodotti Applicabili

QTS, QuTS hero

Container Station


Scenario

Vuoi eseguire modelli di linguaggio di grandi dimensioni (LLM) localmente sul tuo NAS QNAP per chat AI private, assistenza al codice o analisi dei documenti senza inviare dati al cloud. Ollama è il motore di inferenza più popolare e adatto ai principianti per questo scopo. Questo tutorial spiega come distribuire Ollama sul NAS QNAP utilizzando Container Station.


Requisiti di Sistema

RequisitoDettaglio
App QNAPContainer Station 3.x o successivo
Architettura NASx86_64 (CPU Intel o AMD)
(Sono supportati solo alcuni modelli basati su ARM.)
Memoria 
  • Almeno 8 GB (per modelli 3B)
  • Almeno 16 GB (per modelli 7B)
Spazio Archiviazione
  • Almeno 20 GB di spazio Archiviazione libero extra oltre alla dimensione del file del modello.
  • Utilizzare un volume SSD se possibile.
GPU (Opzionale)GPU NVIDIA compatibili (vedi il Elenco compatibilità)
La GPU dovrebbe essere impostata su Modalità Container Station nel Pannello di controllo.
Avviso
Rischio OOM (Out of Memory)
Ollama tenterà di caricare l'intero modello in memoria per impostazione predefinita. Se il tuo NAS ha solo 8–16 GB di RAM, il caricamento di un modello 14B o più grande potrebbe esaurire la memoria di sistema, causando l'irresponsività dei servizi NAS o il riavvio del sistema.

Rischio di Perdita di Dati
Se non monti un volume persistente per /root/.ollama, tutti i modelli scaricati e la configurazione andranno persi quando il container viene rimosso o ricreato. Segui sempre le istruzioni di montaggio del volume in questo tutorial.
Migliori Prassi
  • Controlla in anticipo la dimensione del modello rispetto alla RAM disponibile.
  • Imposta limiti di memoria per limitare l'uso della memoria del container.
  • Inizia con modelli piccoli (1B o 3B) e valuta la stabilità del sistema prima di tentare modelli più grandi.

Procedura

Metodo 1: Distribuzione solo CPU (Nessuna GPU richiesta)

  1. Crea cartelle Archiviazione.

    Apri File Station e crea la seguente cartella per memorizzare i dati del modello Ollama:
    /share/Container/ollama

    Schermata: File Station — creazione della cartella Ollama sotto /share/Container/

    Migliori Prassi
    Se il tuo NAS ha una cache SSD NVMe o un volume SSD, crea questa cartella sull'SSD. La velocità di caricamento del modello migliora fino a 10 volte rispetto agli HDD.

  2. Crea un file Docker Compose.

    In Container Station, vai a Applicazioni > Crea. Assegna un nome all'applicazione ollama e incolla il seguente YAML:

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    Schermata: Container Station — Schermata di creazione dell'applicazione con editor YAML
    Schermata: Container Station — Imposta il limite di memoria

  3. Distribuisci il container.

    Fare clic su Crea. Container Station scaricherà l'immagine Ollama e avvierà il container. Attendere fino a quando lo stato mostra In esecuzione.

    Screenshot: Container Station — container ollama che mostra lo stato "In esecuzione"

  4. Scarica il tuo primo modello.

    Apri il Terminale del container (o accedi tramite SSH al tuo NAS ed esegui il tuo Docker) e esegui:

    # Per un modello leggero 3B (consigliato per il primo test):
    ollama pull llama3.2:3b
    
    # Per un modello standard 9B (richiede 16 GB+ di RAM):
    ollama pull qwen3.5:9b

    Il download potrebbe richiedere diversi minuti a seconda della velocità di internet. Un modello 9B Q4_K_M è di circa 4–7 GB.

    Nota
    • Verifica di avere spazio su disco sufficiente prima di scaricare. Usa ollama list per controllare i modelli esistenti e le loro dimensioni.
    • Per i modelli NAS basati su ARM, consigliamo di iniziare con il modello <1B per monitorare l'uso della memoria. 
  5. Testa il modello.

    Nel terminale del container, esegui:

    ollama run qwen3.5:9b

    Digita un prompt e conferma di ricevere una risposta. Digita /bye per uscire.


Metodo 2: Distribuzione accelerata da GPU NVIDIA

Nota

Prerequisiti aggiuntivi per la Modalità GPU:

  • GPU NVIDIA installata e rilevata da QTS/QuTS hero
  • GPU impostata su Modalità Container Station nel Pannello di controllo
  • Driver NVIDIA GPU e NvKernelDriver installati da App Center
  1. Utilizzare la configurazione Docker Compose abilitata per GPU.

    Sostituire il YAML del Metodo 1 con il seguente:

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
          - NVIDIA_VISIBLE_DEVICES=all
        deploy:
          resources:
            reservations:
              devices:
                - driver: nvidia
                  count: all
                  capabilities: [gpu]
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    Screenshot: Container Station — YAML Docker Compose abilitato per GPU

    Nota
    I driver NVIDIA inclusi di QNAP potrebbero essere più vecchi dell'ultima versione rilasciata. Se il container non si avvia con la GPU abilitata, controllare la versione del driver con nvidia-smi sull'host e assicurarsi che sia compatibile con la versione dell'immagine Ollama

  2. Distribuire e verificare l'accesso alla GPU.

    Dopo l'avvio del container, aprire il suo terminale ed eseguire:

    nvidia-smi

    Dovresti vedere il modello della tua GPU, la versione del driver e le informazioni sulla memoria.

  3. Scaricare un modello e confermare l'accelerazione GPU.

    ollama pull qwen3.5:9b
    ollama run qwen3.5:9b

    Mentre il modello sta generando una risposta, aprire un altro terminale ed eseguire nvidia-smi. Dovresti osservare un aumento dell'uso della memoria GPU e dell'utilizzo della GPU. 

Risultato

Dopo aver completato questo tutorial, avrai:

  • Ollama in esecuzione sul tuo QNAP NAS a http://<NAS-IP>:11434
  • Dati del modello persistenti in /share/Container/ollama (sopravvivono alle ricostruzioni del container)
  • Un LLM funzionante accessibile tramite l'API di Ollama

Puoi testare l'API da qualsiasi dispositivo sulla tua rete locale:

curl http://<NAS-IP>:11434/api/generate -d '{
  "model": "qwen3.5:9b",
  "prompt": "Ciao, come stai?",
  "stream": false
}'

Importante
L'impostazione OLLAMA_HOST=0.0.0.0 espone l'API di Ollama su tutte le interfacce di rete. Non esporre la porta 11434 a Internet. Usa le regole Firewall o le impostazioni di rete di QNAP per limitare l'accesso solo alla tua rete locale.

Risoluzione dei problemi

Il container si chiude immediatamente dopo l'avvio

Questo può essere causato da RAM insufficiente o incompatibilità del driver GPU. Controlla i log del container in Container Station. Riduci le limitazioni di memoria o disabilita la modalità GPU.

Il download del modello fallisce a metà 

Questo può essere dovuto a spazio su disco insufficiente o timeout di rete. Prova a liberare spazio Archiviazione. Esegui nuovamente ollama pull; il sistema riprende da dove si era fermato.

La velocità di risposta è molto lenta (1–3 token al secondo)

Il modello potrebbe essere in esecuzione su CPU invece che su GPU, o il modello è troppo grande per la tua RAM. Verifica l'accesso alla GPU con nvidia-smi all'interno del container. Prova a utilizzare un modello più piccolo.

Il NAS diventa non reattivo durante l'inferenza

Questo può essere un problema di "memoria esaurita": il modello sta consumando tutta la memoria di sistema. Si consiglia di riavviare il NAS. Imposta un limite di utilizzo della memoria nell'applicazione. Oppure usa un modello più piccolo.

Messaggio "Impossibile connettersi a Ollama" da Open WebUI

Questo può essere causato da un URL API errato o dall'isolamento di rete Docker. Puoi usare http://ollama:11434 se sei sulla stessa rete Docker.


Questo articolo è stato utile?

100% delle persone lo ritengono utile.
Grazie per il feedback.

Per ulteriore assistenza, chiedi ad altri utenti e agli esperti QNAP nella community. Vai alla community QNAP

Informarci su come può essere migliorato l'articolo:

Per offrire un’ulteriore feedback, includerlo di seguito.

Scegliere le caratteristiche

      Mostra di più Meno
      Questo sito in altre nazioni/regioni
      Chatta con noi! Chatta con noi!
      back to top