[Aviso importante de seguridad] Se han detectado sitios web falsos de Qfinder Pro. Más información >

Este contenido se ha traducido de manera automática. Consulte el Descargo de responsabilidad por la traducción automática.
Cambiar al inglés

How to deploy Ollama on the QNAP NAS using Container Station
Cómo implementar Ollama en el NAS de QNAP usando Container Station


Última fecha de modificación: 2026-05-08

Productos aplicables

QTS, QuTS hero

Container Station


Escenario

Desea ejecutar modelos de lenguaje grande (LLMs) localmente en su NAS QNAP para chat privado de IA, asistencia de código o análisis de documentos sin enviar datos a la nube. Ollama es el motor de inferencia más popular y fácil de usar para este propósito. Este tutorial explica cómo implementar Ollama en el NAS QNAP usando Container Station.


Requisitos del sistema

RequisitoDetalle
App de QNAPContainer Station 3.x o posterior
Arquitectura NASx86_64 (CPU Intel o AMD)
(Solo se admiten algunos modelos basados en ARM.)
Memoria 
  • Al menos 8 GB (para modelos 3B)
  • Al menos 16 GB (para modelos 7B)
Espacio Almacenamiento
  • Al menos 20 GB de espacio libre adicional Almacenamiento además del tamaño del archivo del modelo.
  • Utilice un volumen SSD si es posible.
GPU (Opcional)GPUs NVIDIA compatibles (ver el Lista de compatibilidad)
La GPU debe configurarse en Modo Container Station en el Panel de control.
Advertencia
Riesgo de OOM (Falta de memoria)
Ollama intentará cargar todo el modelo en la memoria por defecto. Si su NAS tiene solo 8–16 GB de RAM, cargar un modelo de 14B o más grande puede agotar la memoria del sistema, causando que los servicios del NAS se vuelvan no responsivos o que el sistema se reinicie.

Riesgo de pérdida de datos
Si no monta un volumen persistente para /root/.ollama, todos los modelos y configuraciones descargados se perderán cuando el contenedor sea eliminado o recreado. Siempre siga las instrucciones de montaje de volumen en este tutorial.
Práctica recomendada
  • Verifique el tamaño del modelo con respecto a la RAM disponible de antemano.
  • Establezca límites de memoria para limitar el uso de memoria del contenedor.
  • Comience con modelos pequeños (1B o 3B) y evalúe la estabilidad del sistema antes de intentar con modelos más grandes.

Procedimiento

Método 1: Implementación solo con CPU (No se requiere GPU)

  1. Crear carpetas Almacenamiento.

    Abra File Station y cree la siguiente carpeta para almacenar datos del modelo Ollama:
    /share/Container/ollama

    Captura de pantalla: File Station — creando la carpeta Ollama en /share/Container/

    Práctica recomendada
    Si su NAS tiene un caché SSD NVMe o un volumen SSD, cree esta carpeta en el SSD. La velocidad de carga del modelo mejora hasta 10 veces en comparación con los HDD.

  2. Crear un archivo Docker Compose.

    En Container Station, vaya a Aplicaciones > Crear. Nombre la aplicación ollama y pegue el siguiente YAML:

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    Captura de pantalla: Container Station — pantalla de creación de aplicaciones con editor YAML
    Captura de pantalla: Container Station — Establecer el límite de memoria

  3. Implemente el contenedor.

    Haga clic en Crear. Container Station descargará la imagen de Ollama y comenzará el contenedor. Espere hasta que el estado muestre Ejecutando.

    Captura de pantalla: Container Station — contenedor de ollama mostrando estado "Ejecutando"

  4. Descargue su primer modelo.

    Abra el Terminal del contenedor (o acceda por SSH a su NAS y ejecute su Docker) y ejecute:

    # Para un modelo ligero de 3B (recomendado para la primera prueba):
    ollama pull llama3.2:3b
    
    # Para un modelo estándar de 9B (requiere 16 GB+ de RAM):
    ollama pull qwen3.5:9b

    La descarga puede tardar varios minutos dependiendo de la velocidad de su internet. Un modelo 9B Q4_K_M es aproximadamente de 4–7 GB.

    Nota
    • Verifique que tenga suficiente espacio en disco antes de descargar. Use ollama list para comprobar los modelos existentes y sus tamaños.
    • Para modelos NAS basados en ARM, recomendamos comenzar con el modelo <1B para monitorear el uso de memoria. 
  5. Pruebe el modelo.

    En el terminal del contenedor, ejecute:

    ollama run qwen3.5:9b

    Escriba un mensaje y confirme que recibe una respuesta. Escriba /bye para salir.


Método 2: Despliegue acelerado por GPU NVIDIA

Nota

Requisitos adicionales para el Modo GPU:

  • GPU NVIDIA instalada y detectada por QTS/QuTS hero
  • GPU configurada en Modo Container Station en el Panel de control
  • Controlador de GPU NVIDIA y NvKernelDriver instalados desde App Center
  1. Utilice la configuración de Docker Compose habilitada para GPU.

    Reemplace el YAML del Método 1 con lo siguiente:

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
          - NVIDIA_VISIBLE_DEVICES=all
        deploy:
          resources:
            reservations:
              devices:
                - driver: nvidia
                  count: all
                  capabilities: [gpu]
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    Captura de pantalla: Container Station — YAML de Docker Compose habilitado para GPU

    Nota
    Los controladores NVIDIA incluidos de QNAP pueden ser más antiguos que la última versión. Si el contenedor no se inicia con la GPU habilitada, verifique la versión del controlador con nvidia-smi en el host y asegúrese de que sea compatible con la versión de imagen de Ollama

  2. Despliegue y verifique el acceso a la GPU.

    Después de que el contenedor se inicie, abra su terminal y ejecute:

    nvidia-smi

    Debería ver su modelo de GPU, versión del controlador e información de memoria.

  3. Descargue un modelo y confirme la aceleración de GPU.

    ollama pull qwen3.5:9b
    ollama run qwen3.5:9b

    Mientras el modelo genera una respuesta, abra otro terminal y ejecute nvidia-smi. Debería observar un aumento en el uso de memoria de la GPU y la utilización de la GPU. 

Resultado

Después de completar este tutorial, tendrás:

  • Ollama ejecutándose en tu NAS de QNAP en http://<NAS-IP>:11434
  • Datos del modelo persistidos en /share/Container/ollama (sobrevive a reconstrucciones de contenedor)
  • Un LLM funcional accesible a través de la API de Ollama

Puedes probar la API desde cualquier dispositivo en tu red local:

curl http://<NAS-IP>:11434/api/generate -d '{
  "model": "qwen3.5:9b",
  "prompt": "Hola, ¿cómo estás?",
  "stream": false
}'

Importante
La configuración OLLAMA_HOST=0.0.0.0 expone la API de Ollama en todas las interfaces de red. No expongas el puerto 11434 a Internet. Usa reglas de Firewall o la configuración de red de QNAP para restringir el acceso solo a tu red local.

Solución de problemas

El contenedor se cierra inmediatamente después de iniciar

Esto puede ser causado por insuficiente RAM o incompatibilidad del controlador de GPU. Revisa los registros del contenedor en Container Station. Reduce las limitaciones de memoria o desactiva el modo GPU.

La descarga del modelo falla a mitad de camino 

Esto puede ser resultado de espacio insuficiente en disco o tiempo de espera de red. Intenta liberar espacio en Almacenamiento. Vuelve a ejecutar ollama pull; el sistema se reanuda desde donde se detuvo.

La velocidad de respuesta es muy lenta (1–3 tokens por segundo)

El modelo puede estar ejecutándose en CPU en lugar de GPU, o el modelo es demasiado grande para tu RAM. Verifica el acceso a tu GPU con nvidia-smi dentro del contenedor. Intenta usar un modelo más pequeño.

El NAS se vuelve no responsivo durante la inferencia

Esto puede ser un problema de "falta de memoria": el modelo está consumiendo toda la memoria del sistema. Recomendamos reiniciar el NAS. Establece un límite de uso de memoria en la aplicación. O utiliza un modelo más pequeño.

Mensaje "No se puede conectar a Ollama" desde Open WebUI

Esto puede ser causado por una URL de API incorrecta o aislamiento de red de Docker. Puedes usar http://ollama:11434 si estás en la misma red de Docker.


¿Le ha resultado útil este artículo?

El 100% de las personas piensa que ayuda.
Gracias por sus comentarios.

Para obtener más ayuda, pregunte a otros usuarios y a los expertos de QNAP en la comunidad. Ir a la comunidad de QNAP

Díganos cómo podemos mejorar este artículo:

Si desea enviarnos más comentarios, inclúyalos a continuación.

Elija especificación

      Mostrar más Mostrar menos
      Este portal en otros países / regiones:
      ¡Chatea con nosotros! ¡Chatea con nosotros!
      back to top