暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

别让磁盘故障拖垮集群!vSAN永久磁盘故障的案例分享

IT那活儿 2026-05-09
67

点击上方“IT那活儿”公众号--专注于企业全栈运维技术分享,不管IT什么活儿,干就完了!!!

问题描述

客户现场VMware vSAN版本:7.0.2,其中一台服务器的磁盘组出现故障,显示为磁盘组其中一块儿HDD硬盘“永久磁盘故障”,即vSAN存储层中用于持久化存储数据的物理或逻辑磁盘出现异常,导致数据读写失败或存储性能下降或进一步影响虚拟化集群健康等严重故障。

问题处理

2.1 解决思路
移除故障硬盘并进行替换,然后将新硬盘重新加入磁盘组:
  • 第一步,先将出现故障的主机置于维护模式;
  • 第二步,在主机进入维护模式后,手动将故障的HDD硬盘从磁盘组中移除;
  • 第三步,在成功移除完故障的HDD硬盘后,将新磁盘添加到该磁盘组;
  • 第四步,确认HDD硬盘运行状态正常后,将主机退出维护模式。
2.2 处理过程
移除故障硬盘:
  • 如果主机未置于维护模式,直接移除故障的HDD硬盘,无法完成;
  • 如果强制移除,会出现报错,不建议进行该操作,故需要先将主机进入维护模式。
首先选择集群—配置—vSAN—磁盘管理执行主机校验“数据迁移预检查”,确认主机可以进入维护模式:
手动将主机置于“维护模式”,vSAN数据迁移选择“确保可访问性”:
主机进入维护模式过程中,集群的DRS服务会自动将该主机上运行的虚拟机动态迁移到其它主机,不会影响虚拟机的正常运行:
等待进入维护模式,通过近期任务状态查看:
主机成功进入维护模式:
从对应主机的磁盘组中移除有问题的HDD硬盘:
通过任务管理器,观察移除磁盘状态,确认已经完全移除成功:
更换故障硬盘,并确认通过管理页面可以识别到新硬盘。选择磁盘组,将新硬盘添加回磁盘组:
添加完成后确认磁盘数量,确认重新添加后的磁盘组和HDD硬盘状态正常:
将主机退出“维护模式”,集群DRS将会自动重新平衡虚拟机,无需人为干预。至此,vSAN磁盘故障问题成功解决。

问题总结

虽然vSAN配置了冗余、虚拟机副本等策略,但硬件故障依然可能导致业务中断。再多的技术措施也无法避免硬件的物理故障,冗余和监控只是减小风险的手段,无法消除潜在问题。所以备份、监控和及时的健康检查是必要的。
为了提高运维成效,在以后的工作中要做到以下几方面:
  • 优化监控策略
    在硬盘 IO 和存储状态监测上加大力度,确保能够捕捉早期问题。
  • 定期检查存储
    定期检查硬盘健康状态,做好预防工作。
  • 加深技术积累
    深入掌握vSAN故障恢复方法,避免遇到问题找不到思路。

END


本文作者:汤 汤 (上海新炬中北团队)

本文来源:“IT那活儿”公众号

文章转载自IT那活儿,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论