Comment déployer Ollama sur le NAS QNAP en utilisant Container Station
Produits applicables
QTS, QuTS hero
Container Station
Scénario
Vous souhaitez exécuter des modèles de langage étendus (LLM) localement sur votre NAS QNAP pour un chat IA privé, une assistance au codage ou une analyse de documents sans envoyer de données vers le cloud. Ollama est le moteur d'inférence le plus populaire et convivial pour les débutants à cet effet. Ce tutoriel explique comment déployer Ollama sur le NAS QNAP en utilisant Container Station.
Configuration système requise
| Exigence | Détail |
|---|---|
| App QNAP | Container Station 3.x ou version ultérieure |
| Architecture NAS | x86_64 (CPU Intel ou AMD) (Seuls quelques modèles basés sur ARM sont pris en charge.) |
| Mémoire |
|
| Espace Stockage |
|
| GPU (Optionnel) | GPU NVIDIA compatibles (voir le Liste de compatibilité) Le GPU doit être réglé sur le mode Container Station dans le Panneau de configuration. |
Ollama tentera de charger l'ensemble du modèle en mémoire par défaut. Si votre NAS dispose seulement de 8 à 16 Go de RAM, le chargement d'un modèle 14B ou plus grand peut épuiser la mémoire système, rendant les services NAS non réactifs ou provoquant le redémarrage du système.
Risque de perte de données
Si vous ne montez pas un volume persistant pour
/root/.ollama, tous les modèles téléchargés et la configuration seront perdus lorsque le conteneur sera supprimé ou recréé. Suivez toujours les instructions de montage de volume dans ce tutoriel.- Vérifiez la taille du modèle par rapport à votre RAM disponible à l'avance.
- Définissez des limites de mémoire pour limiter l'utilisation de la mémoire du conteneur.
- Commencez par des petits modèles (1B ou 3B) et évaluez la stabilité du système avant de tenter des modèles plus grands.
Procédure
Méthode 1 : Déploiement uniquement sur CPU (Pas de GPU requis)
Créez des dossiers Stockage.
Ouvrez File Station et créez le dossier suivant pour stocker les données du modèle Ollama :
/share/Container/ollama
Capture d'écran : File Station — création du dossier Ollama sous /share/Container/Meilleure pratiqueSi votre NAS dispose d'un cache SSD NVMe ou d'un volume SSD, créez ce dossier sur le SSD. La vitesse de chargement du modèle s'améliore jusqu'à 10 fois par rapport aux disques durs.Créez un fichier Compose Docker.
Dans Container Station, allez à Applications > Créer. Nommez l'application
ollamaet collez le YAML suivant :version: "3.8" services: ollama: image: ollama/ollama:latest container_name: ollama restart: unless-stopped ports: - "11434:11434" volumes: - /share/Container/ollama:/root/.ollama environment: - OLLAMA_HOST=0.0.0.0 - OLLAMA_KEEP_ALIVE=10m networks: - ai-network networks: ai-network: name: ai-network driver: bridge
Capture d'écran : Container Station — écran de création d'application avec éditeur YAML
Capture d'écran : Container Station — Définir la limite de mémoireDéployez le conteneur.
Cliquez sur Créer. Container Station va récupérer l'image Ollama et démarrer le conteneur. Attendez que le statut affiche En cours d'exécution.
Capture d'écran : Container Station — conteneur ollama affichant le statut "En cours d'exécution"Tirez votre premier modèle.
Ouvrez le Terminal du conteneur (ou connectez-vous en SSH à votre NAS et exécutez votre Docker) et lancez :
# Pour un modèle 3B léger (recommandé pour le premier test) : ollama pull llama3.2:3b # Pour un modèle 9B standard (nécessite 16 Go+ de RAM) : ollama pull qwen3.5:9bLe téléchargement peut prendre plusieurs minutes selon la vitesse de votre connexion Internet. Un modèle 9B Q4_K_M est d'environ 4 à 7 Go.
Note- Vérifiez que vous avez suffisamment d'espace disque avant de tirer. Utilisez
ollama listpour vérifier les modèles existants et leurs tailles. - Pour les modèles NAS basés sur ARM, nous recommandons de commencer avec le modèle <1B pour surveiller l'utilisation de la mémoire.
- Vérifiez que vous avez suffisamment d'espace disque avant de tirer. Utilisez
Testez le modèle.
Dans le terminal du conteneur, exécutez :
ollama run qwen3.5:9bTapez une invite et confirmez que vous recevez une réponse. Tapez
/byepour quitter.
Méthode 2 : Déploiement accéléré par GPU NVIDIA
Prérequis supplémentaires pour le mode GPU :
- GPU NVIDIA installé et détecté par QTS/QuTS hero
- GPU réglé sur le mode Container Station dans le Panneau de configuration
- Pilote GPU NVIDIA et NvKernelDriver installés depuis App Center
Utilisez la configuration Docker Compose activée pour GPU.
Remplacez le YAML de la méthode 1 par ce qui suit :
version: "3.8" services: ollama: image: ollama/ollama:latest container_name: ollama restart: unless-stopped ports: - "11434:11434" volumes: - /share/Container/ollama:/root/.ollama environment: - OLLAMA_HOST=0.0.0.0 - OLLAMA_KEEP_ALIVE=10m - NVIDIA_VISIBLE_DEVICES=all deploy: resources: reservations: devices: - driver: nvidia count: all capabilities: [gpu] networks: - ai-network networks: ai-network: name: ai-network driver: bridge
Capture d'écran : Container Station — YAML Compose activé pour GPU DockerNoteLes pilotes NVIDIA fournis par QNAP peuvent être plus anciens que la dernière version. Si le conteneur ne démarre pas avec le GPU activé, vérifiez la version du pilote avecnvidia-smisur l'hôte et assurez-vous qu'elle est compatible avec la version de l'image OllamaDéployez et vérifiez l'accès au GPU.
Après le démarrage du conteneur, ouvrez son terminal et exécutez :
nvidia-smiVous devriez voir votre modèle de GPU, la version du pilote et les informations de mémoire.

Tirez un modèle et confirmez l'accélération GPU.
ollama pull qwen3.5:9b ollama run qwen3.5:9bPendant que le modèle génère une réponse, ouvrez un autre terminal et exécutez
nvidia-smi. Vous devriez observer une augmentation de l'utilisation de la mémoire GPU et de l'utilisation du GPU.
Résultat
Après avoir terminé ce tutoriel, vous aurez :
- Ollama fonctionnant sur votre NAS QNAP à
http://<NAS-IP>:11434 - Données du modèle persistantes dans
/share/Container/ollama(survivent aux reconstructions de conteneurs) - Un LLM fonctionnel accessible via l'API Ollama
Vous pouvez tester l'API depuis n'importe quel appareil sur votre réseau local :
curl http://<NAS-IP>:11434/api/generate -d '{
"model": "qwen3.5:9b",
"prompt": "Bonjour, comment ça va ?",
"stream": false
}'
OLLAMA_HOST=0.0.0.0 expose l'API Ollama sur toutes les interfaces réseau. Ne pas exposer le port 11434 à Internet. Utilisez les règles Pare-feu ou les paramètres réseau de QNAP pour restreindre l'accès à votre réseau local uniquement.Dépannage
Le conteneur s'arrête immédiatement après le démarrage
Cela peut être causé par une RAM insuffisante ou une incompatibilité du pilote GPU. Vérifiez les journaux du conteneur dans Container Station. Réduisez les limitations de mémoire ou désactivez le mode GPU.
Échec du téléchargement du modèle en cours
Cela peut être dû à un espace disque insuffisant ou à un délai d'attente réseau. Essayez de libérer de l'espace Stockage. Relancez ollama pull; le système reprend là où il s'est arrêté.
La vitesse de réponse est très lente (1–3 tokens par seconde)
Le modèle peut fonctionner sur le CPU au lieu du GPU, ou le modèle est trop grand pour votre RAM. Vérifiez l'accès à votre GPU avec nvidia-smi à l'intérieur du conteneur. Essayez d'utiliser un modèle plus petit.
Le NAS devient non réactif pendant l'inférence
Cela peut être un problème de "mémoire insuffisante" : le modèle consomme toute la mémoire système. Nous recommandons de redémarrer le NAS. Définissez une limite d'utilisation de la mémoire dans l'application. Ou utilisez un modèle plus petit.
Message "Impossible de se connecter à Ollama" depuis Open WebUI
Cela peut être causé par une mauvaise URL d'API ou une isolation réseau Docker. Vous pouvez utiliser http://ollama:11434 si vous êtes sur le même réseau Docker.
Est-ce que cet article a été utile ?
Pour obtenir de l'aide supplémentaire, posez votre question aux autres utilisateurs et aux experts QNAP dans la communauté. Accéder à la communauté QNAP