NAS 数据安全实战:RAID 不是备份,UPS 不是可选

三个必须先区分的概念
冗余(RAID):坏一块盘,数据还在,服务不中断。防的是硬件故障。
快照(Snapshot):记录某个时间点的数据状态,可以回滚。防的是误删、误改、勒索软件加密。
备份(Backup):独立的第二份副本,最好在另一个物理位置。防的是火灾、盗窃、整机损坏、误操作波及全盘。
RAID 不是备份,快照也不是备份。这三件事要成套做,缺一个就有无法覆盖的风险。
RAID 级别怎么选
| 级别 | 最少盘数 | 允许坏几块 | 可用容量 | 适合场景 |
|---|---|---|---|---|
| RAID 0 | 2 | 0 | N × 单盘 | 只在乎速度、数据可随时重建(极少用) |
| RAID 1 | 2 | 1 | 单盘容量 | 双盘位,最简单可靠 |
| RAID 5 / RAID-Z1 | 3 | 1 | (N-1) × 单盘 | 3–5 盘位的经典选择 |
| RAID 6 / RAID-Z2 | 4 | 2 | (N-2) × 单盘 | 6 盘位以上,或数据非常重要 |
| SHR-1 / TRAID | 2+ | 1 | 自动优化 | 硬盘容量不统一时 |
| SHR-2 / TRAID+ | 4+ | 2 | 自动优化 | 容量不统一且要双冗余 |
选 RAID 5 还是 RAID 6?
关键变量是重建时间。一块 8 TB 盘重建通常要几小时到十几小时,重建期间阵列处于降级状态,所有盘都在高强度读取。这时候第二块盘出问题的概率显著上升——尤其是同批次购买的硬盘,老化程度接近。
经验规则:
- 四盘位及以下:RAID 5 可以接受,但要配合备份
- 六盘位以上:强烈建议 RAID 6 或 RAID-Z2
- 无论几块盘:如果数据无法承受丢失,就该上双冗余 + 离线备份
关于容量不统一
传统 RAID 会把所有盘按最小的那块计算容量,四块盘如果是 8T+8T+8T+4T,传统 RAID 5 的可用容量是 4T×3=12T,浪费严重。
群晖的 SHR、铁威马的 TRAID、极空间的 ZDR、Unraid 的做法,都是为了解决这个痛点——允许混用容量,自动优化。如果你手上的盘容量参差,优先选带这类弹性阵列的系统。
快照:最便宜的“后悔药”
快照记录的是文件系统在某个时间点的元数据指针,创建几乎不占空间(只有后续数据变化时才占用增量空间)。
快照能防:
- 误删文件、误格式化
- 勒索软件加密(可以回滚到加密前)
- 软件升级或配置改动导致的损坏
快照不能防:
- 硬盘物理损坏(快照和原始数据在同一块盘上)
- 整机损坏、被盗、火灾
- 你主动删除了所有快照
建议配置: 保留策略设为“每小时 × 24,每天 × 7,每周 × 4,每月 × 12”,这样能覆盖从一小时前到一年前的各种回滚点。注意快照会占用空间,且快照越多,删除旧快照时的整理开销越大。
一个关键设置: 如果 NAS 支持,把快照目录设为对普通用户只读。勒索软件往往会遍历可写路径加密所有能写的文件,只读快照是一道有效防线。
3-2-1 备份原则怎么落地
3 份数据副本(原始数据 + 两份备份) 2 种不同介质(比如 NAS 硬盘 + 云端,或 NAS + 冷备硬盘) 1 份异地(放在物理上不同的地方)
家庭用户的可行方案:
方案 A:NAS + 冷备硬盘(成本最低)
买一块等于 NAS 可用容量的硬盘,每隔一两个月接上做一次完整备份,然后拔下来放到柜子里(甚至放到父母家)。离线状态意味着它不会被勒索软件触及,也不会因为 NAS 整机故障而受损。
方案 B:NAS + 云端(自动化程度最高)
用 rclone 或 NAS 自带的云同步工具,把重要目录加密后同步到对象存储(如阿里云 OSS、腾讯云 COS、Backblaze B2)。注意:
- 一定要在上传前加密,云端的明文数据等于暴露
- 算清楚流量费用,首次全量上传的流量可能不小
- 恢复速度受限于带宽,几百 GB 的数据恢复可能要几天——这是云备份最大的短板
方案 C:两台 NAS 互备(体验最好)
一台主力、一台备份机(可以是便宜的二手机型或另一台品牌 NAS),定时做 rsync 或系统自带的备份同步。如果能放在不同物理位置(比如办公室),那就接近理想的 3-2-1。
无论选哪个方案,都要定期做恢复演练。 没验证过的备份不算备份——每年至少实际恢复一次文件,确认流程走得通。
UPS:NAS 的必需品,不是配件
很多人觉得 UPS 是服务器机房才需要的东西,这是误解。NAS 最危险的时刻不是硬盘坏了,而是写入过程中断电。
断电的风险:
- 正在写入的数据丢失,文件系统不一致
- RAID 阵列处于不一致状态,需要重建校验,重建期间风险陡增
- 机械盘磁头来不及归位(虽然现代硬盘有断电保护,但不绝对)
- ZFS 虽然对断电更健壮,但同样可能出现最后一次事务丢失
怎么选:
- 类型:在线式(On-line,纯正弦波输出,最干净但贵)> 在线互动式 > 后备式。NAS 用在线互动式或后备式即可,关键是输出波形要好(纯正弦波优于方波,方波可能损坏电源模块)。
- 容量:不需要带很久,够撑到安全关机就行。300–500 VA 的机型足够一台 NAS 加交换机跑 5–15 分钟。
- 通信接口:必须有 USB 或网口,能连到 NAS 触发自动关机。群晖、威联通、绿联等都支持 USB UPS,在系统里开启后,断电到达阈值会自动安全关机。
- 电池寿命:UPS 电池一般 2–3 年要更换,到期不换等于没装。
配置要点: 把 UPS 的阈值设成“断电后 3–5 分钟关机”或“电量低于 50% 关机”。不要设成立即关机——短暂的电压波动会误触发,频繁关机反而伤机器。
账号与网络安全
NAS 挂着公网可访问的服务时,安全性比便利性重要得多。
必须做:
- 修改默认管理员账号名(不要用 admin)
- 强密码 + 两步验证
- 关闭 SMB1、关闭不用的服务(FTP、Telnet)
- 修改默认端口(5000/5001 是扫描器的首选目标)
- 开启自动封锁(多次密码错误后封 IP)
- 定期更新系统,订阅安全公告
- 关闭或谨慎使用外网穿透/中继服务,如果不需要远程访问就完全关掉
强烈建议:
- 用 VPN 代替端口映射访问内网服务(Tailscale、WireGuard 都是轻量选择)
- 只给应用最小的权限
- 定期检查登录日志,看有没有异常 IP
不要做:
- 把 NAS 的 5000/5001 端口直接映射到公网
- 用弱密码或复用其他网站的密码
- 长期不更新系统
硬盘巡检与更换
日常监控:关注 SMART 的这几项
- 05 重映射扇区计数:一旦开始增长,说明盘面已有坏道
- C5 当前待映射扇区数:即将被重映射的扇区
- C6 无法校正的扇区数
- 温度:长期超过 45 ℃ 会显著缩短寿命
- 通电时间、启停次数:判断老化程度
定期擦洗:群晖的数据擦洗、ZFS 的 scrub、RAID 的一致性检查,建议每月一次。它能发现并修复静默损坏(数据位在盘上悄悄出错但硬盘自己不知道)。
换盘流程:
1. 发现告警后立刻备份该盘上的重要数据(如果还能读) 2. 确认替代盘的容量不小于原盘、且是 CMR 3. 按系统流程停用并拔出旧盘(支持热插拔的可以直接拔) 4. 插入新盘,启动阵列重建 5. 重建期间避免大量写入,不要断电 6. 重建完成后验证数据完整性
一份可执行的检查清单
每月做一次:
- [ ] 查看所有硬盘的 SMART 状态
- [ ] 检查存储池容量使用率(超过 80% 就该规划扩容)
- [ ] 查看系统日志有没有异常错误
- [ ] 确认备份任务最近一次执行成功
每季度做一次:
- [ ] 跑一次数据擦洗 / 一致性检查
- [ ] 检查系统更新并评估是否升级
- [ ] 测试 UPS(拔掉市电,确认能正常触发关机——注意选在方便的时候)
- [ ] 做一次恢复演练,从备份里恢复一个文件
每年做一次:
- [ ] 检查 UPS 电池健康度
- [ ] 检查所有备份介质的可读性
- [ ] 复查账号权限清单,删除不再使用的账号
- [ ] 重新评估容量规划
最后
数据安全的本质是风险管理,而风险管理的第一步是承认风险一定会发生。硬盘会坏、人会误删、勒索软件会来。把所有希望寄托在 RAID 上,本质上是在赌“第二块盘不会在重建时坏”——这个赌注赢了是运气,输了是事故。
花在备份上的钱,只有在出事那天才知道值不值。而那一天终究会来。
最后更新于 2026年9月18日