如果 CMM 检测到某个节点发生了严重问题,它将调用群集框架来强制关闭(应急)该节点并从群集成员中删除该节点。 实现这种功能的机制称为故障快速防护。 故障快速防护会使节点以两种方式关闭。
如果节点脱离群集,然后尝试启动新的群集,而不进行仲裁,则会被“隔离”,不能访问共享的磁盘。 有关使用故障快速防护的详细信息,请参见故障防护。
如果一个或多个特定于群集的守护程序出现故障(clexecd、rpc.pmfd、rgmd 或 rpc.ed),CMM 会检测到该故障,而节点将处于应急状态。
panic[cpu0]/thread=40e60: Failfast: Aborting because "pmfd" died 35 seconds ago. 409b8 cl_runtime:__0FZsc_syslog_msg_log_no_argsPviTCPCcTB+48 (70f900, 30, 70df54, 407acc, 0) %l0-7: 1006c80 000000a 000000a 10093bc 406d3c80 7110340 0000000 4001 fbf0 |
出现应急状态之后,节点可能重新引导并尝试重新加入群集;或者,如果群集是由基于 SPARC 的系统组成的,则停留在 OpenBootTM PROM (OBP) 提示符处。 所采取的操作取决于 auto-boot? 参数的设置。 可以在 OpenBoot PROM ok 提示符处使用eeprom(1M) 设置 auto-boot?。