Come distribuire Ollama sul NAS QNAP utilizzando Container Station
Prodotti Applicabili
QTS, QuTS hero
Container Station
Scenario
Vuoi eseguire modelli di linguaggio di grandi dimensioni (LLM) localmente sul tuo NAS QNAP per chat AI private, assistenza al codice o analisi dei documenti senza inviare dati al cloud. Ollama è il motore di inferenza più popolare e adatto ai principianti per questo scopo. Questo tutorial spiega come distribuire Ollama sul NAS QNAP utilizzando Container Station.
Requisiti di Sistema
| Requisito | Dettaglio |
|---|---|
| App QNAP | Container Station 3.x o successivo |
| Architettura NAS | x86_64 (CPU Intel o AMD) (Sono supportati solo alcuni modelli basati su ARM.) |
| Memoria |
|
| Spazio Archiviazione |
|
| GPU (Opzionale) | GPU NVIDIA compatibili (vedi il Elenco compatibilità) La GPU dovrebbe essere impostata su Modalità Container Station nel Pannello di controllo. |
Ollama tenterà di caricare l'intero modello in memoria per impostazione predefinita. Se il tuo NAS ha solo 8–16 GB di RAM, il caricamento di un modello 14B o più grande potrebbe esaurire la memoria di sistema, causando l'irresponsività dei servizi NAS o il riavvio del sistema.
Rischio di Perdita di Dati
Se non monti un volume persistente per
/root/.ollama, tutti i modelli scaricati e la configurazione andranno persi quando il container viene rimosso o ricreato. Segui sempre le istruzioni di montaggio del volume in questo tutorial.- Controlla in anticipo la dimensione del modello rispetto alla RAM disponibile.
- Imposta limiti di memoria per limitare l'uso della memoria del container.
- Inizia con modelli piccoli (1B o 3B) e valuta la stabilità del sistema prima di tentare modelli più grandi.
Procedura
Metodo 1: Distribuzione solo CPU (Nessuna GPU richiesta)
Crea cartelle Archiviazione.
Apri File Station e crea la seguente cartella per memorizzare i dati del modello Ollama:
/share/Container/ollama
Schermata: File Station — creazione della cartella Ollama sotto /share/Container/Migliori PrassiSe il tuo NAS ha una cache SSD NVMe o un volume SSD, crea questa cartella sull'SSD. La velocità di caricamento del modello migliora fino a 10 volte rispetto agli HDD.Crea un file Docker Compose.
In Container Station, vai a Applicazioni > Crea. Assegna un nome all'applicazione
ollamae incolla il seguente YAML:version: "3.8" services: ollama: image: ollama/ollama:latest container_name: ollama restart: unless-stopped ports: - "11434:11434" volumes: - /share/Container/ollama:/root/.ollama environment: - OLLAMA_HOST=0.0.0.0 - OLLAMA_KEEP_ALIVE=10m networks: - ai-network networks: ai-network: name: ai-network driver: bridge
Schermata: Container Station — Schermata di creazione dell'applicazione con editor YAML
Schermata: Container Station — Imposta il limite di memoriaDistribuisci il container.
Fare clic su Crea. Container Station scaricherà l'immagine Ollama e avvierà il container. Attendere fino a quando lo stato mostra In esecuzione.
Screenshot: Container Station — container ollama che mostra lo stato "In esecuzione"Scarica il tuo primo modello.
Apri il Terminale del container (o accedi tramite SSH al tuo NAS ed esegui il tuo Docker) e esegui:
# Per un modello leggero 3B (consigliato per il primo test): ollama pull llama3.2:3b # Per un modello standard 9B (richiede 16 GB+ di RAM): ollama pull qwen3.5:9bIl download potrebbe richiedere diversi minuti a seconda della velocità di internet. Un modello 9B Q4_K_M è di circa 4–7 GB.
Nota- Verifica di avere spazio su disco sufficiente prima di scaricare. Usa
ollama listper controllare i modelli esistenti e le loro dimensioni. - Per i modelli NAS basati su ARM, consigliamo di iniziare con il modello <1B per monitorare l'uso della memoria.
- Verifica di avere spazio su disco sufficiente prima di scaricare. Usa
Testa il modello.
Nel terminale del container, esegui:
ollama run qwen3.5:9bDigita un prompt e conferma di ricevere una risposta. Digita
/byeper uscire.
Metodo 2: Distribuzione accelerata da GPU NVIDIA
Prerequisiti aggiuntivi per la Modalità GPU:
- GPU NVIDIA installata e rilevata da QTS/QuTS hero
- GPU impostata su Modalità Container Station nel Pannello di controllo
- Driver NVIDIA GPU e NvKernelDriver installati da App Center
Utilizzare la configurazione Docker Compose abilitata per GPU.
Sostituire il YAML del Metodo 1 con il seguente:
version: "3.8" services: ollama: image: ollama/ollama:latest container_name: ollama restart: unless-stopped ports: - "11434:11434" volumes: - /share/Container/ollama:/root/.ollama environment: - OLLAMA_HOST=0.0.0.0 - OLLAMA_KEEP_ALIVE=10m - NVIDIA_VISIBLE_DEVICES=all deploy: resources: reservations: devices: - driver: nvidia count: all capabilities: [gpu] networks: - ai-network networks: ai-network: name: ai-network driver: bridge
Screenshot: Container Station — YAML Docker Compose abilitato per GPUNotaI driver NVIDIA inclusi di QNAP potrebbero essere più vecchi dell'ultima versione rilasciata. Se il container non si avvia con la GPU abilitata, controllare la versione del driver connvidia-smisull'host e assicurarsi che sia compatibile con la versione dell'immagine OllamaDistribuire e verificare l'accesso alla GPU.
Dopo l'avvio del container, aprire il suo terminale ed eseguire:
nvidia-smiDovresti vedere il modello della tua GPU, la versione del driver e le informazioni sulla memoria.

Scaricare un modello e confermare l'accelerazione GPU.
ollama pull qwen3.5:9b ollama run qwen3.5:9bMentre il modello sta generando una risposta, aprire un altro terminale ed eseguire
nvidia-smi. Dovresti osservare un aumento dell'uso della memoria GPU e dell'utilizzo della GPU.
Risultato
Dopo aver completato questo tutorial, avrai:
- Ollama in esecuzione sul tuo QNAP NAS a
http://<NAS-IP>:11434 - Dati del modello persistenti in
/share/Container/ollama(sopravvivono alle ricostruzioni del container) - Un LLM funzionante accessibile tramite l'API di Ollama
Puoi testare l'API da qualsiasi dispositivo sulla tua rete locale:
curl http://<NAS-IP>:11434/api/generate -d '{
"model": "qwen3.5:9b",
"prompt": "Ciao, come stai?",
"stream": false
}'
OLLAMA_HOST=0.0.0.0 espone l'API di Ollama su tutte le interfacce di rete. Non esporre la porta 11434 a Internet. Usa le regole Firewall o le impostazioni di rete di QNAP per limitare l'accesso solo alla tua rete locale.Risoluzione dei problemi
Il container si chiude immediatamente dopo l'avvio
Questo può essere causato da RAM insufficiente o incompatibilità del driver GPU. Controlla i log del container in Container Station. Riduci le limitazioni di memoria o disabilita la modalità GPU.
Il download del modello fallisce a metà
Questo può essere dovuto a spazio su disco insufficiente o timeout di rete. Prova a liberare spazio Archiviazione. Esegui nuovamente ollama pull; il sistema riprende da dove si era fermato.
La velocità di risposta è molto lenta (1–3 token al secondo)
Il modello potrebbe essere in esecuzione su CPU invece che su GPU, o il modello è troppo grande per la tua RAM. Verifica l'accesso alla GPU con nvidia-smi all'interno del container. Prova a utilizzare un modello più piccolo.
Il NAS diventa non reattivo durante l'inferenza
Questo può essere un problema di "memoria esaurita": il modello sta consumando tutta la memoria di sistema. Si consiglia di riavviare il NAS. Imposta un limite di utilizzo della memoria nell'applicazione. Oppure usa un modello più piccolo.
Messaggio "Impossibile connettersi a Ollama" da Open WebUI
Questo può essere causato da un URL API errato o dall'isolamento di rete Docker. Puoi usare http://ollama:11434 se sei sulla stessa rete Docker.
Per ulteriore assistenza, chiedi ad altri utenti e agli esperti QNAP nella community. Vai alla community QNAP