Производство работало в режиме 24/7. Все ключевые процессы — от планирования до выпуска продукции — были завязаны на 1С. Формально система функционировала, но каждый сбой сервера приводил к остановке работы и ручному «тушению пожара».
После второго серьёзного инцидента стало очевидно: проблема не в конкретном сбое, а в самой ИТ-модели.
Для непрерывного производства критично:
- отсутствие незапланированных простоев;
- предсказуемость работы учётных и производственных систем;
- минимальные потери данных;
- чёткое понимание сроков восстановления при сбоях.
В такой модели 1С является не вспомогательной системой, а основой всего бизнеса.
ИТ-инфраструктура выглядела типично для «исторически сложившейся» модели:
- один физический сервер;
- на нём одновременно терминальный сервер и сервер баз данных 1С;
- резервное копирование выполнялось только на уровне баз данных;
- виртуальные серверы целиком не резервировались;
- сервер был единственной точкой отказа.
Фактически отказ сервера означал полную остановку производства.
После повторного инцидента руководство зафиксировало ключевой риск: единая точка отказа при отсутствии резервирования недопустима для 24/7-процесса.
Вопрос цены перестал быть определяющим — потери от простоя уже превышали любые инвестиции в ИТ.
Было принято решение:
- отказаться от текущей модели;
- перейти к архитектуре, исходя не из «как дешевле», а из допустимого простоя и допустимых потерь данных.
Изменения проводились на уровне управленческой модели ИТ:
- утверждены метрики допустимого периода простоя и допустимых потерь данных;
- под эти метрики подобрано решение высокой доступности;
- создан производительный кластер высокой доступности из трёх нод;
- внедрено резервное копирование виртуальных машин с контролем сроков восстановления;
- настроен мониторинг ключевых компонентов с мгновенным уведомлением ИТ-службы и руководства о потенциальных проблемах или их предвестниках;
- выстроено тесное взаимодействие всех ИТ-ролей: системных администраторов, специалистов 1С и разработчиков.
Технические решения подчинялись бизнес-метрикам, а не наоборот.
Для бизнеса это дало принципиально иной уровень устойчивости:
- исчез страх внезапной остановки производства;
- появились понятные и гарантированные сроки восстановления при сбоях;
- руководство получило контроль над рисками;
- ИТ перестало быть источником неопределённости.
Простой производства всегда дороже инвестиций в ИТ — даже на длинной дистанции. Плановый, управляемый простой ради надёжности несоизмеримо дешевле аварийной остановки.
Для непрерывного производства отказоустойчивость — не «улучшение», а базовое условие выживания бизнеса.
- Есть ли у вас единая точка отказа в 1С?
- Определены ли допустимые простои и потери данных?
- Резервируются ли серверы целиком, а не только базы?
- Проверяется ли восстановление резервных копий?
- Есть ли мониторинг ключевых компонентов?
- Понятно ли руководству, сколько времени займёт восстановление?
- Завязана ли стабильность бизнеса на один сервер или человека?
Проверить — есть ли у меня такой риск
Если после проверки нужен разбор модели сопровождения, можно обсудить порядок работы и формат ответственности через Получить консультацию.