[Important Sécurité Avis] Faux sites web Qfinder Pro détectés. En savoir plus >

Ce contenu est traduit automatiquement. Veuillez consulter la Clause de non-responsabilité relative à la traduction automatique.
Overschakelen naar Engels

How to deploy Ollama on the QNAP NAS using Container Station
Comment déployer Ollama sur le NAS QNAP en utilisant Container Station


Date de la dernière modification : 2026-05-08

Produits applicables

QTS, QuTS hero

Container Station


Scénario

Vous souhaitez exécuter des modèles de langage étendus (LLM) localement sur votre NAS QNAP pour un chat IA privé, une assistance au codage ou une analyse de documents sans envoyer de données vers le cloud. Ollama est le moteur d'inférence le plus populaire et convivial pour les débutants à cet effet. Ce tutoriel explique comment déployer Ollama sur le NAS QNAP en utilisant Container Station.


Configuration système requise

ExigenceDétail
App QNAPContainer Station 3.x ou version ultérieure
Architecture NASx86_64 (CPU Intel ou AMD)
(Seuls quelques modèles basés sur ARM sont pris en charge.)
Mémoire 
  • Au moins 8 Go (pour les modèles 3B)
  • Au moins 16 Go (pour les modèles 7B)
Espace Stockage
  • Au moins 20 Go d'espace libre supplémentaire Stockage en plus de la taille du fichier du modèle.
  • Utilisez un volume SSD si possible.
GPU (Optionnel)GPU NVIDIA compatibles (voir le Liste de compatibilité)
Le GPU doit être réglé sur le mode Container Station dans le Panneau de configuration.
Avertissement
Risque de manque de mémoire (OOM)
Ollama tentera de charger l'ensemble du modèle en mémoire par défaut. Si votre NAS dispose seulement de 8 à 16 Go de RAM, le chargement d'un modèle 14B ou plus grand peut épuiser la mémoire système, rendant les services NAS non réactifs ou provoquant le redémarrage du système.

Risque de perte de données
Si vous ne montez pas un volume persistant pour /root/.ollama, tous les modèles téléchargés et la configuration seront perdus lorsque le conteneur sera supprimé ou recréé. Suivez toujours les instructions de montage de volume dans ce tutoriel.
Meilleure pratique
  • Vérifiez la taille du modèle par rapport à votre RAM disponible à l'avance.
  • Définissez des limites de mémoire pour limiter l'utilisation de la mémoire du conteneur.
  • Commencez par des petits modèles (1B ou 3B) et évaluez la stabilité du système avant de tenter des modèles plus grands.

Procédure

Méthode 1 : Déploiement uniquement sur CPU (Pas de GPU requis)

  1. Créez des dossiers Stockage.

    Ouvrez File Station et créez le dossier suivant pour stocker les données du modèle Ollama :
    /share/Container/ollama

    Capture d'écran : File Station — création du dossier Ollama sous /share/Container/

    Meilleure pratique
    Si votre NAS dispose d'un cache SSD NVMe ou d'un volume SSD, créez ce dossier sur le SSD. La vitesse de chargement du modèle s'améliore jusqu'à 10 fois par rapport aux disques durs.

  2. Créez un fichier Compose Docker.

    Dans Container Station, allez à Applications > Créer. Nommez l'application ollama et collez le YAML suivant :

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    Capture d'écran : Container Station — écran de création d'application avec éditeur YAML
    Capture d'écran : Container Station — Définir la limite de mémoire

  3. Déployez le conteneur.

    Cliquez sur Créer. Container Station va récupérer l'image Ollama et démarrer le conteneur. Attendez que le statut affiche En cours d'exécution.

    Capture d'écran : Container Station — conteneur ollama affichant le statut "En cours d'exécution"

  4. Tirez votre premier modèle.

    Ouvrez le Terminal du conteneur (ou connectez-vous en SSH à votre NAS et exécutez votre Docker) et lancez :

    # Pour un modèle 3B léger (recommandé pour le premier test) :
    ollama pull llama3.2:3b
    
    # Pour un modèle 9B standard (nécessite 16 Go+ de RAM) :
    ollama pull qwen3.5:9b

    Le téléchargement peut prendre plusieurs minutes selon la vitesse de votre connexion Internet. Un modèle 9B Q4_K_M est d'environ 4 à 7 Go.

    Note
    • Vérifiez que vous avez suffisamment d'espace disque avant de tirer. Utilisez ollama list pour vérifier les modèles existants et leurs tailles.
    • Pour les modèles NAS basés sur ARM, nous recommandons de commencer avec le modèle <1B pour surveiller l'utilisation de la mémoire. 
  5. Testez le modèle.

    Dans le terminal du conteneur, exécutez :

    ollama run qwen3.5:9b

    Tapez une invite et confirmez que vous recevez une réponse. Tapez /bye pour quitter.


Méthode 2 : Déploiement accéléré par GPU NVIDIA

Note

Prérequis supplémentaires pour le mode GPU :

  • GPU NVIDIA installé et détecté par QTS/QuTS hero
  • GPU réglé sur le mode Container Station dans le Panneau de configuration
  • Pilote GPU NVIDIA et NvKernelDriver installés depuis App Center
  1. Utilisez la configuration Docker Compose activée pour GPU.

    Remplacez le YAML de la méthode 1 par ce qui suit :

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
          - NVIDIA_VISIBLE_DEVICES=all
        deploy:
          resources:
            reservations:
              devices:
                - driver: nvidia
                  count: all
                  capabilities: [gpu]
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    Capture d'écran : Container Station — YAML Compose activé pour GPU Docker

    Note
    Les pilotes NVIDIA fournis par QNAP peuvent être plus anciens que la dernière version. Si le conteneur ne démarre pas avec le GPU activé, vérifiez la version du pilote avec nvidia-smi sur l'hôte et assurez-vous qu'elle est compatible avec la version de l'image Ollama

  2. Déployez et vérifiez l'accès au GPU.

    Après le démarrage du conteneur, ouvrez son terminal et exécutez :

    nvidia-smi

    Vous devriez voir votre modèle de GPU, la version du pilote et les informations de mémoire.

  3. Tirez un modèle et confirmez l'accélération GPU.

    ollama pull qwen3.5:9b
    ollama run qwen3.5:9b

    Pendant que le modèle génère une réponse, ouvrez un autre terminal et exécutez nvidia-smi. Vous devriez observer une augmentation de l'utilisation de la mémoire GPU et de l'utilisation du GPU. 

Résultat

Après avoir terminé ce tutoriel, vous aurez :

  • Ollama fonctionnant sur votre NAS QNAP à http://<NAS-IP>:11434
  • Données du modèle persistantes dans /share/Container/ollama (survivent aux reconstructions de conteneurs)
  • Un LLM fonctionnel accessible via l'API Ollama

Vous pouvez tester l'API depuis n'importe quel appareil sur votre réseau local :

curl http://<NAS-IP>:11434/api/generate -d '{
  "model": "qwen3.5:9b",
  "prompt": "Bonjour, comment ça va ?",
  "stream": false
}'

Important
Le paramètre OLLAMA_HOST=0.0.0.0 expose l'API Ollama sur toutes les interfaces réseau. Ne pas exposer le port 11434 à Internet. Utilisez les règles Pare-feu ou les paramètres réseau de QNAP pour restreindre l'accès à votre réseau local uniquement.

Dépannage

Le conteneur s'arrête immédiatement après le démarrage

Cela peut être causé par une RAM insuffisante ou une incompatibilité du pilote GPU. Vérifiez les journaux du conteneur dans Container Station. Réduisez les limitations de mémoire ou désactivez le mode GPU.

Échec du téléchargement du modèle en cours 

Cela peut être dû à un espace disque insuffisant ou à un délai d'attente réseau. Essayez de libérer de l'espace Stockage. Relancez ollama pull; le système reprend là où il s'est arrêté.

La vitesse de réponse est très lente (1–3 tokens par seconde)

Le modèle peut fonctionner sur le CPU au lieu du GPU, ou le modèle est trop grand pour votre RAM. Vérifiez l'accès à votre GPU avec nvidia-smi à l'intérieur du conteneur. Essayez d'utiliser un modèle plus petit.

Le NAS devient non réactif pendant l'inférence

Cela peut être un problème de "mémoire insuffisante" : le modèle consomme toute la mémoire système. Nous recommandons de redémarrer le NAS. Définissez une limite d'utilisation de la mémoire dans l'application. Ou utilisez un modèle plus petit.

Message "Impossible de se connecter à Ollama" depuis Open WebUI

Cela peut être causé par une mauvaise URL d'API ou une isolation réseau Docker. Vous pouvez utiliser http://ollama:11434 si vous êtes sur le même réseau Docker.


Est-ce que cet article a été utile ?

100% des utilisateurs pensent que ces informations sont utiles.
Merci pour votre commentaire.

Pour obtenir de l'aide supplémentaire, posez votre question aux autres utilisateurs et aux experts QNAP dans la communauté. Accéder à la communauté QNAP

Veuillez nous indiquer comment améliorer cet article :

Si vous souhaitez fournir un commentaire supplémentaire, veuillez l’inclure ci-dessous.

Choisissez une spécification

      En voir davantage Moins
      Ce site est disponible dans d'autres pays/régions :
      Discutez avec nous ! Discutez avec nous !
      back to top