NAS弹出SMART警告后,很多人会立刻点“完整检测”,希望先确认硬盘到底坏没坏。这个动作可能让一块状态不稳的盘承受连续读取,而关键数据还没有第二份可用副本。
更稳妥的顺序是:降低非必要负载,确认备份能读取,保存SMART原始值和阵列状态,再决定短测、长测、检查线材或更换硬盘。
本文是检查演示,不对应近期某一台真实故障设备。不同NAS品牌、SATA硬盘和NVMe固态盘的字段名称与阈值可能不同,应以设备和厂商文档为准。

先暂停转码、批量同步、下载和手动巡检等非必要高负载任务。阵列正在重建或恢复时,不要在不了解平台机制的情况下直接中断;先看阵列状态和备份情况,再决定操作。
至少保存以下信息:
-
硬盘型号、容量和序列号尾号。 -
SMART完整报告,不只截“正常/警告”一行。 -
存储池、卷和阵列状态。 -
最近是否出现I/O错误、掉盘、卡顿、异响或异常温度。 -
当前备份位置、最后成功时间和抽样恢复结果。
RAID提供冗余,不等于备份。误删、勒索软件、控制器故障和多盘同时异常仍可能影响整个阵列。
能使用smartctl的Linux或NAS环境,可以执行只读检查:
sudo smartctl -x /dev/sdX
把/dev/sdX替换为确认过的目标盘。先用NAS后台、lsblk或设备序列号核对盘位,避免看错硬盘。
USB硬盘盒、RAID卡和部分NAS会隐藏SMART或需要指定设备类型。命令失败不代表硬盘正常,也不要反复尝试未知写入参数。

机械硬盘常见的关注项包括:
硬盘已经把无法可靠使用的扇区替换到备用区域。非零值需要结合厂商阈值、历史趋势、自检结果和I/O日志判断。数值持续增加时,风险更高。
硬盘暂时无法稳定读取、等待后续确认的扇区。它可能在重写后恢复,也可能转为重映射。关键数据没有备份时,不要先用高负载测试反复读整盘。
离线检测中无法校正的扇区。与待定扇区、重映射增长或系统I/O错误同时出现时,应提高处理优先级。
传输校验错误常与SATA线、背板、接口接触或供电链路有关。CRC增加不等于盘面出现坏扇区。重新插接或更换已确认兼容的线材后,要继续观察原始值是否还在增加。
厂商对SMART ID和原始值的编码不完全一致。不要只凭网上的一张阈值表判断所有硬盘。

SMART短测通常耗时较短,适合在备份已经确认、硬盘没有明显异响或持续掉盘时做快速筛查:
sudo smartctl -t short /dev/sdX
命令会返回预计完成时间。到点后重新读取完整报告:
sudo smartctl -x /dev/sdX
长测会读取更多盘面,耗时可能达到数小时:
sudo smartctl -t long /dev/sdX
以下情况不宜把长测放在第一步:
-
关键数据没有可验证的第二份副本。 -
阵列已经降级,且同组其他盘状态也不明。 -
硬盘持续掉线、出现异响或大量I/O错误。 -
待定、不可校正或重映射指标持续增长。
此时应先复制最重要的数据,准备替换盘和恢复方案。不要使用badblocks -w一类破坏性写入测试检查仍有数据的硬盘。

先把关键目录复制到另一块独立存储,再做检测。单盘没有阵列冗余,检测过程中恶化会直接影响可读数据。
先确认阵列是否健康、冗余盘是否也有警告、备份能否恢复。换盘后的重建会让其余硬盘承受持续读取。老盘较多或已有第二块盘出现异常时,要准备从备份恢复,而不是把所有希望压在重建上。
减少非必要任务,保存日志和SMART报告,优先确认备份。不要同时拔出多块盘,也不要凭槽位灯颜色猜盘号。换盘前核对序列号和盘位映射。

-
只有CRC计数增加,盘面相关指标稳定:检查线材、背板、接口和供电,处理后观察增量。 -
重映射、待定或不可校正扇区增长:优先备份并准备换盘,结合自检和I/O日志判断时机。 -
SMART显示通过,但系统持续出现I/O错误或掉盘:继续查接口、供电、背板、控制器和内核日志,不能用“PASSED”排除故障。 -
数值稳定且自检通过:保留基线,设置告警,按周期复查,不代表硬盘永久安全。 -
NVMe出现介质错误、可用备用空间下降或严重警告:按NVMe字段和厂商阈值处理,不套用机械盘的扇区指标。
换线、换盘或完成重建后,至少做三件事:
-
重新读取SMART完整报告,比较原始值是否继续变化。 -
确认阵列、存储池和卷回到预期状态。 -
从备份中随机恢复几份文件并打开验证。
SMART提供的是一组健康线索。先保护数据,再保存证据,最后根据指标和存储拓扑选择检测,能降低“检测还没跑完,数据先读不出来”的风险。




