ThinkSystem DM 高可用性 (HA) 管理概述
描述
本文将回顾 ThinkSystem DM 系列存储部署中高可用性 (HA) 的工作原理。
适用系统
ThinkSystem DM系列节点
解决方案
高可用性 (HA) 对控制器配置由一对匹配的存储控制器(本地节点和伙伴节点)组成。每个节点都连接到对方的磁盘柜。当 HA 对中的一个节点遇到错误并停止处理数据时,其伙伴节点会检测到该节点的故障状态,并接管该控制器的所有数据处理工作。
接管 是指一个节点取得其伙伴节点存储控制权的过程。
归还 是指将存储设备归还给合作伙伴的过程。
默认情况下,在下列任何情况下都会自动发生收购:
- 当某个节点发生软件或系统故障,导致系统崩溃(意外重启)时,HA 对控制器会自动故障转移到其对端节点。对端节点从崩溃中恢复并启动后,该节点会自动执行恢复操作,使对端节点恢复正常运行。
- 当某个节点发生系统故障且无法重启时,例如,当某个节点因断电而发生故障时,HA 对控制器会自动故障转移到其对接节点,并从正常运行的存储控制器提供数据。
- 节点未收到来自伙伴节点的心跳消息。这可能是由于伙伴节点的硬件或软件故障(例如互连故障)导致的,该故障虽然没有引发系统崩溃,但仍阻止了其正常运行。
- 你停止了其中一个节点,但没有使用
-for-inhibit-takeover true参数。 - 您在未使用参数的情况下重启了其中一个节点
‑inhibit‑takeover true。(‑onboot该命令的参数storage failover默认启用。) - 远程管理设备(服务处理器)检测到伙伴节点发生故障。如果您禁用硬件辅助接管,则此情况不适用。
- 您也可以使用
storage failover takeover命令手动发起收购。
附加信息
以下列出的是不会发生收购的例外情况:
- 如果节点的存储设备同时断电,则无法进行标准的接管。
- 在启用集群 HA 的双节点集群中,使用 -inhibit-takeover true 参数停止或重启节点会导致两个节点都停止提供数据,除非您先禁用集群 HA,然后将 epsilon 分配给您希望保持在线的节点。