Представим ситуацию: в спальном районе города происходит физический отказ оборудования в опорном узле оператора. К этому узлу подключены десятки тысяч квартир и проходит весь трафик района: видео, мессенджеры, IP-телефония, онлайн-игры. Дежурный инженер получает оповещение, что пакеты начинают отбрасываться, скорость передачи падает, у пользователей начинает подтормаживать видео. А затем подключение к интернету исчезает совсем.
Конечно, починить поломку можно, и необходимое оборудование у оператора есть, но выезд бригады, оценка ущерба и его устранение займут как минимум часы. Всё это время десятки тысяч клиентов будут сидеть дома без связи. Возможно, у оператора даже настроен резервный канал связи, но его включение, настройка и перевод трафика пользователей также займут немало времени.
Другое дело, когда резервный канал не просто есть — он был заранее включён и работал «вхолостую» параллельно с основным. Оператору пришлось нести расходы, связанные с его непрерывной работой, зато когда настал «час икс», переход на резервную линию занял считанные мгновения и для большинства пользователей остался незамеченным. После чего бригада рабочих в спокойном режиме выехала на починку упавшего основного оборудования.
Только что мы описали два основных подхода к резервированию оборудования. Холодный резерв (Cold Standby) — когда запасное оборудование либо отсутствует физически, либо стоит на складе в выключенном состоянии, и при аварии требуется время на доставку, монтаж, настройку и загрузку конфигурации. И горячий резерв (Hot Standby) — когда резервный компонент работает на полную мощность, постоянно синхронизирован с основным и готов принять нагрузку за миллисекунды.
На самом деле, забегая вперёд, существует ещё и усреднённый компромиссный вариант — тёплый резерв (Warm Standby). При нём оборудование включено, операционная система загружена, но синхронизация данных происходит периодически, а не постоянно, и переключение занимает от нескольких секунд до нескольких минут.
Горячо, холодно
Причин задуматься об отказоустойчивости для операторов стало больше, отмечает коммерческий директор компании Mrnet Нина Цирулик. Помимо привычных проблем вроде технических аварий добавились периодические ограничения мобильного интернета. Они особенно болезненно отразились на сервисах, где требуется постоянное подключение — в доставке, такси, розничной торговле.
Главный и очевидный плюс горячего резервирования перед холодным — минимальное время восстановления. В идеально настроенной системе оно приближается к нулю. Для телеком-оператора, у которого простой магистрального канала стоит сотни тысяч рублей в минуту, горячий резерв — это не роскошь, а экономическая необходимость.
Также при горячем резерве можно не опасаться потери данных, поскольку синхронизация идёт непрерывно, и аварийное переключение не приведёт к потере пользовательских сессий или транзакций. А специалисты смогут починить неисправности или провести плановое обслуживание без остановки сервиса целиком.
При этом, указывает Нина Цирулик, горячее резервирование не следует путать с обещанием абсолютного «нулевого даунтайма». Скорость переключения на резерв во многом зависит от оборудования, настроек мониторинга, схемы маршрутизации, туннелей и поведения конкретных приложений.
«Фиксированный и мобильный доступ по-разному уязвимы к сбоям. Поэтому при правильно спроектированной архитектуре их сочетание снижает вероятность того, что проблема одного подключения оставит объект без связи», — пояснила эксперт.
Также, по её словам, для повышения устойчивости связи можно использовать сценарий балансировки (когда трафик одновременно идёт по нескольким каналам) или сценарий бондинга связи. Подробно о том, что такое бондинг и как он спасает бизнес от отключений связи, мы рассказывали в другой статье, но если вкратце — пакеты одного логического соединения могут передаваться через несколько физических каналов и собираться на стороне агрегирующего узла, за счёт чего трафик одной сессии не остаётся жестко привязанным к одному физическому каналу.
Заплати на всякий случай
Недостатки у горячего резервирования тоже есть, и самый очевидный, самый основной — это стоимость такой подстраховки. Резервное оборудование, работающее в горячем режиме, потребляет электроэнергию, генерирует тепло, изнашивается и требует обслуживания, причём за весь срок службы оно может вообще ни разу не понадобиться. По сути, оператор платит двойную цену за ту же самую функциональность. В масштабах крупных операторов цены получаются астрономическими.
Также горячий резерв требует точной настройки синхронизации и постоянного мониторинга, а ошибка в конфигурации может привести к аварии по типу split-brain, когда оба узла решат, что именно они являются основными, и начнут конфликтовать. И даже если всё настроено правильно, не исключён риск синхронного сбоя — особенно если основная и резервная системы работают на одинаковом оборудовании с одинаковой прошивкой.
«Даже мобильный и фиксированный каналы в отдельных случаях могут иметь общие элементы инфраструктуры или зависеть от одного питания на объекте. Поэтому при проектировании резерва важно смотреть не только на число каналов, но и на всю схему отказоустойчивости: насколько независимы подключения, предоставлены ли они разными операторами и проходят ли по разным физическим маршрутам, есть ли резервное питание, достаточно ли радиопокрытия и как система ведет себя при отказе. Если резервирование никогда не проверялось под реальной нагрузкой, его надежность остается предположением», — резюмировала Нина Цирулик.
В итоге горячий резерв становится решением для систем, где цена простоя значительно превышает стоимость дублирования. Магистральные коммутаторы, центры обработки вызовов, биллинговые платформы, ядро мобильной сети — здесь он обязателен.
Для менее критичных элементов выбор схемы резервирования превращается в балансирование между тремя факторами: допустимым временем простоя, бюджетом и сложностью эксплуатации. И горячий резерв занимает на этой шкале крайнюю позицию: максимальная надёжность за максимальную стоимость.







