Sådan implementeres Ollama på QNAP NAS ved hjælp af Container Station
Anvendelige produkter
QTS, QuTS hero
Container Station
Scenario
Du ønsker at køre store sprogmodeller (LLM'er) lokalt på din QNAP NAS til privat AI-chat, kodeassistance eller dokumentanalyse uden at sende data til skyen. Ollama er den mest populære og brugervenlige inferensmotor til dette formål. Denne vejledning forklarer, hvordan man implementerer Ollama på QNAP NAS ved hjælp af Container Station.
Systemkrav
| Krav | Detalje |
|---|---|
| QNAP-app | Container Station 3.x eller nyere |
| NAS-arkitektur | x86_64 (Intel eller AMD CPU) (Kun få ARM-baserede modeller understøttes.) |
| Hukommelse |
|
| Lager plads |
|
| GPU (valgfri) | Kompatible NVIDIA GPU'er (se Kompatibilitetsliste) GPU bør indstilles til Container Station-tilstand i Kontrolpanel. |
Ollama vil forsøge at indlæse hele modellen i hukommelsen som standard. Hvis din NAS kun har 8–16 GB RAM, kan indlæsning af en 14B eller større model udtømme systemhukommelsen, hvilket får NAS-tjenester til at blive uresponsive eller systemet til at genstarte.
Risiko for datatab
Hvis du ikke monterer et vedvarende volumen til
/root/.ollama, vil alle downloadede modeller og konfigurationer gå tabt, når containeren fjernes eller genskabes. Følg altid instruktionerne for volumenmontering i denne vejledning.- Tjek modelstørrelsen i forhold til din tilgængelige RAM på forhånd.
- Indstil hukommelsesgrænser for at begrænse containerens hukommelsesforbrug.
- Start med små modeller (1B eller 3B) og vurder systemets stabilitet, før du forsøger større modeller.
Procedure
Metode 1: Kun CPU-udrulning (Ingen GPU påkrævet)
Opret Lager-mapper.
Åbn File Station og opret følgende mappe til at gemme Ollama-modeldata:
/share/Container/ollama
Skærmbillede: File Station — oprettelse af Ollama-mappen under /share/Container/Bedste praksisHvis din NAS har en NVMe SSD-cache eller SSD-enhed, skal du oprette denne mappe på SSD'en. Modellastningshastigheden forbedres med op til 10 gange sammenlignet med HDD'er.Opret en Docker Compose-fil.
I Container Station, gå til Applikationer > Opret. Navngiv applikationen
ollamaog indsæt følgende YAML:version: "3.8" services: ollama: image: ollama/ollama:latest container_name: ollama restart: unless-stopped ports: - "11434:11434" volumes: - /share/Container/ollama:/root/.ollama environment: - OLLAMA_HOST=0.0.0.0 - OLLAMA_KEEP_ALIVE=10m networks: - ai-network networks: ai-network: name: ai-network driver: bridge
Skærmbillede: Container Station — Applikationsoprettelsesskærm med YAML-editor
Skærmbillede: Container Station — Indstil hukommelsesgrænsenUdrul containeren.
Klik på Opret. Container Station vil hente Ollama-billedet og starte containeren. Vent, indtil status viser Kører.
Skærmbillede: Container Station — ollama-container viser "Kører" statusHent din første model.
Åbn containerens Terminal (eller SSH ind i din NAS og exec din Docker) og kør:
# For en let 3B-model (anbefales til første test): ollama pull llama3.2:3b # For en standard 9B-model (kræver 16 GB+ RAM): ollama pull qwen3.5:9bDownloaden kan tage flere minutter afhængigt af din internetforbindelse. En 9B Q4_K_M-model er cirka 4–7 GB.
Note- Bekræft, at du har tilstrækkelig diskplads, før du henter. Brug
ollama listtil at kontrollere eksisterende modeller og deres størrelser. - For ARM-baserede NAS-modeller anbefaler vi at starte med <1B-modellen for at overvåge hukommelsesforbrug.
- Bekræft, at du har tilstrækkelig diskplads, før du henter. Brug
Test modellen.
Kør i containerens terminal:
ollama run qwen3.5:9bSkriv en prompt og bekræft, at du modtager et svar. Skriv
/byefor at afslutte.
Metode 2: NVIDIA GPU-accelereret implementering
Yderligere forudsætninger for GPU-tilstand:
- NVIDIA GPU installeret og registreret af QTS/QuTS hero
- GPU indstillet til Container Station-tilstand i Kontrolpanel
- NVIDIA GPU-driver og NvKernelDriver installeret fra App Center
Brug den GPU-aktiverede Docker Compose-konfiguration.
Erstat YAML fra metode 1 med følgende:
version: "3.8" services: ollama: image: ollama/ollama:latest container_name: ollama restart: unless-stopped ports: - "11434:11434" volumes: - /share/Container/ollama:/root/.ollama environment: - OLLAMA_HOST=0.0.0.0 - OLLAMA_KEEP_ALIVE=10m - NVIDIA_VISIBLE_DEVICES=all deploy: resources: reservations: devices: - driver: nvidia count: all capabilities: [gpu] networks: - ai-network networks: ai-network: name: ai-network driver: bridge
Skærmbillede: Container Station — GPU-aktiveret Docker Compose YAMLNoteQNAP's medfølgende NVIDIA-drivere kan være ældre end den nyeste udgivelse. Hvis containeren ikke starter med GPU aktiveret, skal du kontrollere driverversionen mednvidia-smipå værten og sikre, at den er kompatibel med Ollama-billedversionenImplementer og verificer GPU-adgang.
Efter containeren starter, åbnes dens terminal og kør:
nvidia-smiDu bør se din GPU-model, driverversion og hukommelsesinformation.

Træk en model og bekræft GPU-acceleration.
ollama pull qwen3.5:9b ollama run qwen3.5:9bMens modellen genererer et svar, åbnes en anden terminal og kør
nvidia-smi. Du bør observere GPU-hukommelsesbrug og GPU-udnyttelse stige.
Resultat
Efter at have gennemført denne vejledning, vil du have:
- Ollama kørende på din QNAP NAS ved
http://<NAS-IP>:11434 - Modeldata gemt i
/share/Container/ollama(overlever container-genopbygninger) - En fungerende LLM tilgængelig via Ollama API
Du kan teste API'en fra enhver enhed på dit lokale netværk:
curl http://<NAS-IP>:11434/api/generate -d '{
"model": "qwen3.5:9b",
"prompt": "Hej, hvordan har du det?",
"stream": false
}'
OLLAMA_HOST=0.0.0.0-indstillingen eksponerer Ollama API på alle netværksinterfaces. Eksponér ikke port 11434 til internettet. Brug Firewall-regler eller QNAP's netværksindstillinger til at begrænse adgang til kun dit lokale netværk.Fejlfinding
Containeren afsluttes straks efter start
Dette kan skyldes utilstrækkelig RAM eller GPU-driver mismatch. Tjek containerlogfiler i Container Station. Reducer hukommelsesbegrænsninger eller deaktiver GPU-tilstand.
Modeltrækning fejler midtvejs
Dette kan skyldes utilstrækkelig diskplads eller netværkstidsudløb. Prøv at frigøre Lager-plads. Genkør ollama pull; systemet genoptager fra hvor det stoppede.
Responshastigheden er meget langsom (1–3 tokens per sekund)
Modellen kan køre på CPU i stedet for GPU, eller modellen er for stor til din RAM. Bekræft din GPU-adgang med nvidia-smi inde i containeren. Prøv at bruge en mindre model.
NAS'en bliver uresponsiv under inferens
Dette kan være et "out of memory"-problem: modellen bruger al systemhukommelse. Vi anbefaler at genstarte NAS'en. Sæt en hukommelsesbrugsgrænse i applikationen. Eller brug en mindre model.
"Kan ikke oprette forbindelse til Ollama"-besked fra Open WebUI
Dette kan skyldes en forkert API-URL eller Docker netværksisolering. Du kan bruge http://ollama:11434 hvis du er på samme Docker netværk.
For yderligere hjælp kan du spørge andre brugere og QNAP-eksperter i vores community. Gå til QNAP Community