[重要なセキュリティのお知らせ] 偽の Qfinder Pro ウェブサイトが検出されました。もっと見る >

このコンテンツは、機械翻訳で翻訳されています。機械翻訳の免責条項をご覧ください。
英語に切り替える

How to deploy Ollama on the QNAP NAS using Container Station
Container Station を使用して QNAP NAS に Ollama を展開する方法


最終更新日: 2026-05-08

対象製品

QTS、QuTS hero

Container Station


シナリオ

データをクラウドに送信せずに、QNAP NAS 上でプライベート AI チャット、コード支援、ドキュメント分析のために大規模言語モデル(LLM)をローカルで実行したい場合、Ollama はこの目的に最も人気があり初心者に優しい推論エンジンです。このチュートリアルでは、Container Station を使用して QNAP NAS に Ollama をデプロイする方法を説明します。


システム要件

要件詳細
QNAP アプリContainer Station 3.x 以降
NAS アーキテクチャx86_64(Intel または AMD CPU)
(ARM ベースのモデルは一部のみ対応)
メモリ  
  • 少なくとも 8 GB(3B モデルの場合)
  • 少なくとも 16 GB(7B モデルの場合)
ストレージスペース
  • モデルファイルサイズに加えて、少なくとも 20 GB の余分なストレージスペースが必要です。
  • 可能であれば SSD ボリュームを使用してください。
GPU(オプション)互換性のある NVIDIA GPU(互換性リストを参照)
GPU はコントロールパネルで Container Station モードに設定する必要があります。
警告
OOM(メモリ不足)リスク
Ollama はデフォルトでモデル全体をメモリにロードしようとします。NAS の RAM が 8〜16 GB の場合、14B 以上のモデルをロードするとシステムメモリが枯渇し、NAS サービスが応答しなくなったり、システムが再起動する可能性があります。

データ損失リスク
永続ボリュームを/root/.ollamaにマウントしない場合、コンテナが削除または再作成されると、ダウンロードされたモデルと設定がすべて失われます。このチュートリアルのボリュームマウント手順に必ず従ってください。
ベストプラクティス
  • 事前にモデルサイズを使用可能な RAM と照らし合わせて確認してください。
  • コンテナのメモリ使用量を制限するためにメモリ制限を設定します。
  • 小さなモデル(1B または 3B)から始め、システムの安定性を評価してから大きなモデルに挑戦してください。

手順

方法 1: CPU のみのデプロイメント(GPU 不要)

  1. ストレージフォルダを作成します。

    File Stationを開き、Ollama モデルデータを保存するための次のフォルダを作成します:
    /share/Container/ollama

    スクリーンショット: File Station — /share/Container/ に Ollama フォルダを作成

    ベストプラクティス
    NAS に NVMe SSD キャッシュまたは SSD ボリュームがある場合、このフォルダを SSD に作成してください。モデルの読み込み速度が HDD と比べて最大 10 倍向上します。

  2. Docker Compose ファイルを作成します。

    Container Station でアプリケーション > 作成に移動します。アプリケーションに名前を付けollama、以下の YAML を貼り付けます:

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    スクリーンショット: Container Station — YAML エディター付きアプリケーション作成画面
    スクリーンショット: Container Station — メモリ制限を設定

  3. コンテナをデプロイします。

    作成をクリックします。Container Station は Ollama イメージを取得し、コンテナを開始します。ステータスが実行中と表示されるまで待ちます。

    スクリーンショット: Container Station — ollama コンテナが「実行中」ステータスを表示

  4. 最初のモデルを取得します。

    コンテナのターミナルを開く(または NAS に SSH で接続して Docker を実行)し、次を実行します:

    # 軽量な 3B モデル(初回テストに推奨):
    ollama pull llama3.2:3b
    
    # 標準的な 9B モデル(16GB 以上の RAM が必要):
    ollama pull qwen3.5:9b

    ダウンロードはインターネット速度によって数分かかる場合があります。9B Q4_K_M モデルは約 4〜7GB です。

    注意
    • 取得する前に十分なディスクスペースがあることを確認してください。ollama listを使用して既存のモデルとそのサイズを確認します。
    • ARM ベースの NAS モデルの場合、メモリ使用量を監視するために <1B モデルから始めることをお勧めします。 
  5. モデルをテストします。

    コンテナターミナルで次を実行します:

    ollama run qwen3.5:9b

    プロンプトを入力し、応答が受け取れることを確認します。終了するには/byeを入力します。


方法 2: NVIDIA GPU 高速化展開

注意

GPU モードの追加前提条件:

  • NVIDIA GPU が QTS/QuTS hero によってインストールされ、検出されていること
  • GPU がコントロールパネルで Container Station モードに設定されていること
  • NVIDIA GPU ドライバーと NvKernelDriver が App Center からインストールされていること
  1. GPU 対応の Docker Compose 設定を使用する。

    方法 1 の YAML を以下に置き換える:

    version: "3.8"
    
    services:
      ollama:
        image: ollama/ollama:latest
        container_name: ollama
        restart: unless-stopped
        ports:
          - "11434:11434"
        volumes:
          - /share/Container/ollama:/root/.ollama
        environment:
          - OLLAMA_HOST=0.0.0.0
          - OLLAMA_KEEP_ALIVE=10m
          - NVIDIA_VISIBLE_DEVICES=all
        deploy:
          resources:
            reservations:
              devices:
                - driver: nvidia
                  count: all
                  capabilities: [gpu]
        networks:
          - ai-network
    
    networks:
      ai-network:
        name: ai-network
        driver: bridge

    スクリーンショット: Container Station — GPU 対応 Docker Compose YAML

    注意
    QNAP のバンドルされた NVIDIA ドライバーは最新リリースより古い場合があります。GPU が有効な状態でコンテナが起動しない場合、ホスト上でnvidia-smiを使用してドライバーのバージョンを確認し、Ollama イメージバージョンと互換性があることを確認してください。

  2. GPU アクセスを展開して確認する。

    コンテナが起動したら、そのターミナルを開いて次を実行します:

    nvidia-smi

    GPU モデル、ドライバーのバージョン、メモリ情報が表示されるはずです。

  3. モデルをプルして GPU アクセラレーションを確認する。

    ollama pull qwen3.5:9b
    ollama run qwen3.5:9b

    モデルが応答を生成している間に、別のターミナルを開いてnvidia-smiを実行します。GPU メモリ使用量と GPU 利用率が増加していることを観察する必要があります。 

効果

このチュートリアルを完了すると、次のことができます:

  • QNAP NAS でhttp://<NAS-IP>:11434で Ollama を実行
  • /share/Container/ollamaにモデルデータを保存(コンテナ再構築後も保持)
  • Ollama API を介してアクセス可能な動作する LLM

ローカルネットワーク上の任意のデバイスから API をテストできます:

curl http://<nas-ip>:11434/api/generate -d '{"model":"qwen3.5:9b","prompt":" こんにちは、元気ですか?","stream": false}'

重要
OLLAMA_HOST=0.0.0.0設定は Ollama API をすべてのネットワークインターフェースに公開します。ポート 11434 をインターネットに公開しないでください。アクセスをローカルネットワークのみに制限するためにファイアウォールルールまたは QNAP のネットワーク設定を使用してください。

トラブルシューティング

コンテナが開始直後に終了する

これは RAM 不足や GPU ドライバの不一致が原因かもしれません。Container Station でコンテナログを確認してください。メモリ制限を減らすか、GPU モードを無効にしてください。

モデルのプルが途中で失敗する  

これはディスクスペース不足やネットワークタイムアウトが原因かもしれません。ストレージスペースを解放してください。ollama pullを再実行すると、システムは停止したところから再開します。

応答速度が非常に遅い(1〜3 トークン / 秒)

モデルが CPU で実行されているか、RAM に対してモデルが大きすぎる可能性があります。コンテナ内でnvidia-smiを使用して GPU アクセスを確認してください。より小さなモデルを使用してみてください。

推論中に NAS が応答しなくなる

これは「メモリ不足」問題である可能性があります。モデルがシステムメモリをすべて消費しています。NAS を再起動することをお勧めします。アプリケーションでメモリ使用量の制限を設定してください。または、より小さなモデルを使用してください。

Open WebUI からの「Ollama に接続できません」メッセージ

これは API URL の誤りや Docker ネットワークの隔離が原因かもしれません。同じ Docker ネットワークにいる場合はhttp://ollama:11434を使用できます。


この記事は役に立ちましたか?

100% の人が、これは役に立つと思っています。
ご意見をいただき、ありがとうございます。

さらにサポートが必要な場合は、コミュニティで他のユーザーや QNAP の専門家にご質問ください。 QNAP コミュニティへ

この記事の改善箇所をお知らせください。

その他のフィードバックがある場合は、以下に入力してください。

仕様を選択

      もっと見る 閉じる
      当ページを他の国/地域で見る:
      気軽にお問い合わせ! 気軽にお問い合わせ!
      back to top