Mecanismo de recuperación rápida (Sun Cluster 3.1: Guía de conceptos)

Sun Cluster 3.1: Guía de conceptos

Mecanismo de recuperación rápida

Si CMM detecta un problema crítico en un nodo, envía una señal a través de la estructura del clúster para forzar su apagado (pánico) y así retirar su pertenencia al clúster. El mecanismo por el que ello ocurre se denomina recuperación rápida. Éste obliga a un nodo a apagarse de dos formas.

Si un nodo abandona el clúster y después intenta crear uno nuevo sin tener quórum, queda “encerrado” y se le impide acceder a discos compartidos. Consulte Aislamiento de fallos para obtener detalles sobre este uso de la recuperación rápida.
Si uno o más daemons específicos del clúster dejan de existir (clexecd, rpc.pmfd, rgmd o rpc.ed) CMM detecta el fallo y el nodo entra en pánico.

Cuando la desaparición de un daemon del clúster hace que un nodo entre en pánico, aparecerá un mensaje parecido a éste en la consola de ese nodo.

panic[cpu0]/thread=40e60: Failfast: Aborting because "pmfd" died 35 seconds ago.
409b8 cl_runtime:__0FZsc_syslog_msg_log_no_argsPviTCPCcTB+48 (70f900, 30, 70df54, 407acc, 0)
%l0-7: 1006c80 000000a 000000a 10093bc 406d3c80 7110340 0000000 4001 fbf0

Después de la condición de pánico, el nodo podría rearrancar e intentar volverse a unir al clúster o permanecer en el indicador OpenBoot^TM PROM (OBP). La acción que se toma depende del valor del parámetro auto-boot? en la OBP.