#1020: Отказ кластера отказоустойчивости
Отредактирована: 707 дней назадСимптомы
первая нода перешла в состояние fault, а затем обе ноды перешли в состояние undefined и нарушилась работа сети. При этом часть трафика продолжила идти через первую ноду.
Ошибка на первой ноде была:
Текущее состояние: fault
Предыдущее состояние: master
Неуспешные проверки: Работа модуля DNS, Доступность узла
При этом также с первой ноды стали постоянно сыпаться сообщения в почту об отсутствии питания на одном из блоков. Хотя при визуальном осмотре диод горит и кабель подключен.
Проблема решилась ручным переключением на вторую ноду.
При принудительной смене мастера в кластере отказоустойчивости, ноды не меняют свой статус.
Решение
- Перезагрузка первого узла.
- Есть плавающая проблема, после перезагрузки узла, на котором есть выключенный интерфейс участвующий в VRRP, адрес данного интерфейса может не спустится в систему из-за чего узле перейдет в состояние FAULT. Для исправления данной ошибки достаточно зайти в настройки выключенного интерфейса и сохранить их без изменений. Чтобы избежать подобной проблемы лучше удалять выключенные интерфейсы из настроек VRRP, пока не придут правки от разработчиков.
Причина
По проблеме с отключенными интерфейсами в кластере VRRP создана задача SUM-7689