ฉันจะเปลี่ยน SSD ที่มีการเตือนใน ที่เก็บข้อมูล Pool อย่างปลอดภัยได้อย่างไร?
ผลิตภัณฑ์ที่ใช้งานได้
- QNAP NAS running QTS or QuTS hero
- Models with hot-swappable drive bays
- RAID groups using SSDs (RAID 1, RAID 5, RAID 6, RAID 10, etc.)
คำอธิบายปัญหา
หนึ่งหรือมากกว่า SSD ใน ที่เก็บข้อมูล pool ของคุณแสดงสถานะ "Warning" ซึ่งบ่งชี้ว่าอายุการใช้งานของ SSD หมดแล้ว (เหลือ 0% ของอายุการใช้งาน) หรือมีการตรวจพบข้อผิดพลาด S.M.A.R.T. คุณต้องการทราบว่า:
- คุณสามารถถอดและเปลี่ยนไดรฟ์ Warning ได้อย่างปลอดภัยผ่านการสลับร้อนหรือไม่?
- ขั้นตอนที่ถูกต้องคืออะไร?
- ความเสี่ยงคืออะไรเมื่อ SSD หลายตัวแสดง Warning พร้อมกัน?
คำตอบสั้น ๆ
ใช่ — ไดรฟ์ที่มีสถานะ Warning สามารถสลับร้อนได้อย่างปลอดภัย เช่นเดียวกับไดรฟ์ Failed คุณสามารถดึง SSD Warning ออกจากช่องขณะ NAS เปิดอยู่ ใส่ SSD ทดแทนใหม่ และ RAID จะเริ่มสร้างใหม่โดยอัตโนมัติ อย่างไรก็ตาม คุณต้องเปลี่ยนไดรฟ์ทีละตัวและรอให้การสร้างใหม่เสร็จสิ้นก่อนที่จะเปลี่ยนตัวถัดไป
ขั้นตอนการแก้ปัญหา
ก่อนที่คุณจะเริ่ม
- ตรวจสอบให้แน่ใจว่าคุณมีการสำรองข้อมูลปัจจุบัน ของข้อมูลทั้งหมดในกลุ่ม RAID นี่เป็นสิ่งสำคัญโดยเฉพาะเมื่อมีไดรฟ์หลายตัวอยู่ในสถานะ Warning
- ตรวจสอบสถานะ RAID: ตรวจสอบให้แน่ใจว่าไม่มีไดรฟ์อื่นในกลุ่ม RAID อยู่ในสถานะ Failed หรือ Rebuilding ในขณะนี้
- ไปที่ ที่เก็บข้อมูลและสแนปช็อต → ที่เก็บข้อมูล/สแนปช็อต → เลือก ที่เก็บข้อมูล Pool → ดูสถานะกลุ่ม RAID
- ระบุที่ตั้งทางกายภาพ ของไดรฟ์ Warning:
- ไปที่ ที่เก็บข้อมูลและสแนปช็อต → ดิสก์/VJBOD → ค้นหา SSD Warning → คลิก Locate (ไฟ LED ของไดรฟ์จะกระพริบเพื่อช่วยให้คุณระบุช่องที่ถูกต้อง)
- เตรียม SSD ทดแทน:
- SSD ใหม่ต้องมีขนาดเท่ากับหรือใหญ่กว่าดิสก์ที่ถูกเปลี่ยน
- ตรวจสอบให้แน่ใจว่า SSD เข้ากันได้กับรุ่น NAS ของคุณ
ขั้นตอนทีละขั้น: การเปลี่ยนแบบ Hot-Swap
ขั้นตอนที่ 1: ถอด SSD ที่มีการเตือน
- เมื่อ NAS เปิดและทำงานอยู่ ให้ดึง SSD ที่มีการเตือนออกจากช่องดิสก์
- NAS จะส่งเสียงเตือน และสถานะกลุ่ม RAID จะเปลี่ยนเป็น เสื่อม
- นี่เป็นสิ่งที่คาดไว้ — RAID 5 สามารถทนต่อการขาดดิสก์ได้หนึ่งตัว, RAID 6 สามารถทนต่อการขาดดิสก์ได้สองตัว
สำคัญ: ห้ามปิด NAS ก่อนดึงดิสก์ การเปลี่ยนแบบ Hot-Swap ต้องทำขณะที่ระบบกำลังทำงาน
ขั้นตอนที่ 2: ใส่ SSD ทดแทน
- ใส่ SSD ใหม่ลงในช่องดิสก์เดิม
- NAS จะตรวจจับดิสก์ใหม่โดยอัตโนมัติ
- กลุ่ม RAID จะเริ่ม สร้างใหม่ โดยอัตโนมัติ
ขั้นตอนที่ 3: ตรวจสอบการสร้างใหม่
- ไปที่ ที่เก็บข้อมูลและสแนปช็อต → ที่เก็บข้อมูล/สแนปช็อต → เลือก ที่เก็บข้อมูล Pool
- กลุ่ม RAID จะแสดงสถานะ กำลังสร้างใหม่ พร้อมเปอร์เซ็นต์ความคืบหน้า
- รอให้การสร้างใหม่เสร็จสมบูรณ์ (100%) ก่อนดำเนินการเปลี่ยนดิสก์ถัดไป
คำเตือน: เวลาการสร้างใหม่ขึ้นอยู่กับขนาดดิสก์และภาระงานของระบบ ห้ามปิดหรือรีสตาร์ท NAS ระหว่างการสร้างใหม่
ขั้นตอนที่ 4: ทำซ้ำสำหรับดิสก์เพิ่มเติม (ถ้าจำเป็น)
หากคุณมี SSD ที่มีการเตือนหลายตัวที่ต้องเปลี่ยน:
- รอ จนกว่าการสร้างใหม่ปัจจุบันจะถึง 100% และสถานะ RAID จะกลับไปที่ พร้อม/ปกติ
- จากนั้นจึงดำเนินการเปลี่ยน SSD ที่มีการเตือนถัดไป
- ทำซ้ำขั้นตอนที่ 1–3 สำหรับแต่ละไดรฟ์, ทีละตัว.
หลังจากการเปลี่ยน
- ตรวจสอบสถานะของกลุ่ม RAID ว่าเป็น พร้อม โดยที่ไดรฟ์ทั้งหมดแสดงว่า ดี.
- ไปที่ ที่เก็บข้อมูลและสแนปช็อต → ดิสก์/VJBOD เพื่อยืนยันว่า SSD ใหม่ทั้งหมดได้รับการรับรู้และมีสุขภาพดี.
- รัน การขัด RAID (การตรวจสอบความสอดคล้องของข้อมูล) หลังจากการเปลี่ยนทั้งหมดเสร็จสิ้น:
- ไปที่ ที่เก็บข้อมูลและสแนปช็อต → เลือกกลุ่ม RAID → จัดการ → การขัด RAID.
ความเสี่ยงที่สำคัญเมื่อมี SSD หลายตัวอยู่ในสถานะเตือน
| ความเสี่ยง | คำอธิบาย |
|---|---|
| ความล้มเหลวของ RAID ระหว่างการสร้างใหม่ | เมื่อกลุ่ม RAID กำลังสร้างใหม่ (สถานะเสื่อมสภาพ) จะมี ไม่มีความทนทานต่อความผิดพลาด (สำหรับ RAID 5) หรือความทนทานลดลง (สำหรับ RAID 6) หาก SSD ที่เตือนอีกตัวหนึ่งล้มเหลวอย่างสมบูรณ์ระหว่างการสร้างใหม่ กลุ่ม RAID ทั้งหมดจะ สูญหาย. |
| ความไม่แน่นอนของอายุการใช้งาน SSD | SSD ที่มีอายุการใช้งาน 0% สามารถล้มเหลวได้ทันทีโดยไม่มีการเตือนเพิ่มเติม ยิ่งมีไดรฟ์เตือนในกลุ่มมากเท่าใด ความเสี่ยงของการล้มเหลวครั้งที่สองระหว่างการสร้างใหม่ก็ยิ่งสูงขึ้น. |
| ความเครียดจากการสร้างใหม่ | กระบวนการสร้างใหม่จะอ่านข้อมูลทั้งหมดจากไดรฟ์ที่เหลืออย่างเข้มข้น ซึ่งอาจเร่งการล้มเหลวของ SSD ที่หมดอายุการใช้งานอื่น ๆ. |
การลดความเสี่ยง
- ควรมีการสำรองข้อมูลที่ตรวจสอบแล้วก่อนเริ่ม — นี่คือข้อควรระวังที่สำคัญที่สุด.
- เปลี่ยนไดรฟ์ในช่วงเวลาที่ใช้งานน้อย เพื่อลดความเครียด I/O บนไดรฟ์เตือนที่เหลือระหว่างการสร้างใหม่.
- เปลี่ยนไดรฟ์ตามลำดับสุขภาพที่แย่ที่สุดก่อน — เริ่มต้นด้วย SSD ที่แสดงค่า S.M.A.R.T. ที่วิกฤตที่สุด.
- พิจารณาอัปเกรดระดับ RAID — หากคุณเผชิญกับการล้มเหลวของไดรฟ์หลายครั้งบ่อย ๆ RAID 6 (ทนต่อการล้มเหลวของไดรฟ์ 2 ตัว) ให้การป้องกันที่ดีกว่า RAID 5 (ทนต่อการล้มเหลวของไดรฟ์เพียง 1 ตัว).