#1020: Отказ кластера отказоустойчивости

Отредактирована: 707 дней назад

Симптомы

первая нода перешла в состояние fault, а затем обе ноды перешли в состояние undefined и нарушилась работа сети. При этом часть трафика продолжила идти через первую ноду.

Ошибка на первой ноде была:

Текущее состояние: fault

Предыдущее состояние: master

Неуспешные проверки: Работа модуля DNS, Доступность узла

При этом также с первой ноды стали постоянно сыпаться сообщения в почту об отсутствии питания на одном из блоков. Хотя при визуальном осмотре диод горит и кабель подключен.

Проблема решилась ручным переключением на вторую ноду.

При принудительной смене мастера в кластере отказоустойчивости, ноды не меняют свой статус.

Решение

  1. Перезагрузка первого узла.
  2. Есть плавающая проблема, после перезагрузки узла, на котором есть выключенный интерфейс участвующий в VRRP, адрес данного интерфейса может не спустится в систему из-за чего узле перейдет в состояние FAULT. Для исправления данной ошибки достаточно зайти в настройки выключенного интерфейса и сохранить их без изменений. Чтобы избежать подобной проблемы лучше удалять выключенные интерфейсы из настроек VRRP, пока не придут правки от разработчиков.

Причина

По проблеме с отключенными интерфейсами в кластере VRRP создана задача SUM-7689