Обращение поступило после очередного сбоя в работе ИТ-инфраструктуры. В момент инцидента были остановлены операции на складе: приёмка и отгрузка не выполнялись, сотрудники ожидали восстановления систем, клиенты — подтверждения сроков.
Руководству стало очевидно: проблема не в конкретном сбое, а в отсутствии отказоустойчивости как управленческого принципа.
Компания работает в сфере логистики и складского хранения. Критичными факторами для бизнеса являлись:
- круглосуточная работа складов;
- бесперебойная обработка заказов;
- синхронизация склада, офиса и транспорта;
- минимизация простоев.
В логистике ИТ — это операционная основа, а не поддерживающая функция.
ИТ-инфраструктура имела уязвимую архитектуру:
- ключевые сервисы были сосредоточены на отдельных узлах;
- резервирование было формальным;
- простой одного из серверов приводил к полной остановке операций;
- контроль доступности осуществлялся реактивно, по факту проблем;
- восстановление занимало непредсказуемое время.
Каждый инцидент напрямую превращался в операционный простой.
После повторяющихся сбоев руководство зафиксировало: стоимость простоя превышает затраты на системные изменения.
Рассматривались варианты:
- продолжать устранять аварии по факту;
- либо изменить ИТ-модель с фокусом на отказоустойчивость.
Было принято решение перейти к управляемой отказоустойчивой инфраструктуре, ориентированной на 24/7-работу.
Изменения касались не отдельных компонентов, а всей модели:
- пересмотрена архитектура ИТ-инфраструктуры — внедрён кластер высокой доступности из трёх нод для всех критических сервисов;
- зафиксированы допустимые параметры простоя и потери данных, внедрены принципы высокой доступности ключевых сервисов и недопустимости потерь;
- обеспечено резервирование критичных компонентов;
- организован мониторинг ключевых параметров 24/7 и постоянный контроль доступности;
- ИТ переведено в режим непрерывной операционной поддержки.
Отказоустойчивость стала частью бизнес-процессов, а не реакцией на инциденты.
Для логистической компании это дало следующие эффекты:
- простои складских операций были минимизированы;
- инциденты сведены к минимуму, восстановление стало предсказуемым;
- снизилось влияние ИТ на срывы сроков;
- руководство получило контроль над рисками и прозрачность ИТ в режиме реального времени;
- ИТ перестало быть точкой отказа бизнеса.
- Есть ли единая точка отказа в ИТ?
- Понятно ли, как быстро восстанавливается работа при сбое?
- Работает ли инфраструктура 24/7 без ручных вмешательств?
- Контролируется ли доступность систем постоянно?
- Известна ли цена простоя для бизнеса?
- Можно ли продолжать работу при отказе одного элемента?
Проверить — есть ли у меня такой риск
Если после проверки нужен разбор модели сопровождения, можно обсудить порядок работы и формат ответственности через Получить консультацию.