Обращение поступило в рабочий день, когда бизнес уже фактически стоял. Со слов руководства — «всё легло», склад не отгружает, сотрудники не могут работать, компания теряет деньги каждый час.
Штатный системный администратор был на месте, но дважды не уложился в сроки восстановления, которые сам же и называл. Через четыре часа стало понятно: ситуация не под контролем, бизнесу нужна срочная ИТ-поддержка.
«Всё легло. Компания стоит. Мы теряем деньги».
Ключевой внутренний сервис, на котором держалась отгрузка со склада, перестал работать. Сотрудники не могли выполнять свои обязанности, клиенты ждали, руководство не понимало, сколько это продлится и чем закончится.
В такой ситуации бизнес сталкивается не с ИТ-проблемой, а с управленческим кризисом:
- остановка основного бизнес-процесса — отгрузки;
- прямые финансовые потери;
- риск оттока постоянных клиентов;
- потеря доверия к управляемости компании;
- невозможность прогнозировать сроки восстановления.
Компания работала на инфраструктуре из:
- более 50 рабочих мест;
- 3 серверов;
- двух объектов — офис и склад.
ИТ сопровождал штатный системный администратор. Резервное копирование выполнялось в единственном экземпляре, только по базам данных, без контроля целостности и без резервирования серверов целиком.
Архитектура сервера изначально содержала ошибки, которые долгое время не проявлялись, но в критический момент привели к аварии.
В первые часы руководство и сотрудники рассматривали типовые варианты:
- «перезагрузить несколько раз и посмотреть»;
- попытка восстановления силами штатного администратора;
- запуск из резервной копии.
Все варианты выглядели логичными, пока не стало ясно, что они не работают.
Рядовые действия не дали результата. Штатный системный администратор оказался в тупике:
- подменного оборудования не было;
- резервная копия оказалась сбойной;
- архитектура не позволяла быстро восстановить сервис;
- каждая новая попытка только увеличивала простой.
Бизнес продолжал стоять, а риски росли с каждым часом.
Руководство приняло управленческое решение — экстренно привлечь внешнюю ИТ-команду.
Логика была простой и жёсткой:
- нужен контроль ситуации — профильная организация, предоставляющая детальный отчёт;
- нужна ответственность за результат — работа по договору;
- бизнес не может ждать, пока один человек «разберётся» — команда узкопрофильных специалистов занималась параллельно задачами от поиска комплектующих до восстановления данных со сбойного диска.
Проверить — есть ли у меня такой риск
После устранения аварии было принято второе решение — полностью пересмотреть подход к ИТ и выстроить корректную архитектуру серверной инфраструктуры с нуля, внедрив систему безотказности, отвечающую утверждённым срокам восстановления в случае сбоя.