Один сервер на всю компанию: что будет, если он остановится

Когда весь бизнес работает на одном сервере, вопрос не в том, сломается ли он, а в том, сколько компания простоит и что успеет потерять, когда он сломается.

У многих небольших компаний вся работа держится на одной машине. Так складывается естественно: сервер покупали под конкретную задачу, потом на него добавили ещё одну, затем третью. В итоге на нём и контроллер домена с учётными записями сотрудников, и база 1С, и общие папки, иногда почта или система видеонаблюдения. Пока техника работает, вопросов не возникает.

Проблема проявляется в момент отказа: останавливается не один сервис, а работа всей компании сразу. В бухгалтерии пропадает доступ к 1С, общие папки становятся недоступны, почта не приходит, а сетевые ресурсы перестают пускать сотрудников.

Вопрос не «сломается ли», а «сколько мы простоим»

Любое оборудование рано или поздно выходит из строя — это нормально и предсказуемо. Смысл подготовки не в том, чтобы этого избежать, а в том, чтобы заранее знать ответ на два вопроса: сколько времени займёт восстановление и какой объём данных при этом потеряется.

Если резервная копия делается раз в сутки ночью, то при отказе в четверг вечером теряется рабочий день. Приемлемо это или нет — вопрос управленческий, а не технический. И ответить на него лучше заранее, а не в момент аварии.

У этих двух величин есть общепринятые названия: допустимое время простоя и допустимый объём потерянных данных — в профессиональной среде их называют RTO и RPO. Звучит академично, но смысл простой: сколько часов компания может не работать и за какой период не жалко потерять данные. Ответы на эти два вопроса и определяют, какая отказоустойчивость вам нужна.

«У нас RAID, мы защищены»

Самое частое заблуждение. RAID действительно защищает от отказа одного или нескольких дисков — но это единственный сценарий, который он закрывает. Он не поможет, если выйдет из строя материнская плата, блок питания или сам RAID-контроллер, если сервер зальёт водой или его зашифрует вредоносная программа.

Отдельно стоит помнить, что RAID не защищает от ошибки человека. Файл, удалённый по неосторожности, исчезнет со всех дисков массива одновременно — в этом и заключается смысл зеркалирования. Поэтому RAID — это способ не останавливаться из-за одного неисправного диска, а не замена резервному копированию.

Что стоит проверить

  • Есть ли резервная копия за пределами сервера — копия на том же диске или в соседней папке не спасёт при отказе оборудования и не переживёт шифровальщика.
  • Сколько времени займёт восстановление — не в теории, а с учётом поиска оборудования, установки системы и восстановления данных.
  • Сколько ждать замену — есть ли ваша модель или совместимое оборудование в наличии у поставщиков, или речь о неделях ожидания.
  • Есть ли второй контроллер домена — если используется Active Directory, это одно из самых доступных улучшений. Войти на компьютер сотрудники смогут и так, за счёт кэшированных учётных данных, но общие папки, доменная авторизация в приложениях и служба DNS, которая обычно работает на том же сервере, станут недоступны.

Как снизить зависимость от одной машины

Решения бывают разного масштаба, но начать стоит с прямого ответа: если компания живёт на одном сервере, второй сервер — это не роскошь, а разумная цель. Остальные меры сокращают простой и потери, но саму зависимость от одной машины не убирают.

  • Проверенное резервное копирование — минимум, с которого начинают. Копии хранятся отдельно от сервера, восстановление хотя бы раз проверено на практике.
  • Запас критичных комплектующих — диск того же типа, блок питания. Недорого и заметно сокращает простой при типовых отказах.
  • Виртуализация — когда сервисы работают в виртуальных машинах, их можно значительно быстрее запустить на другом оборудовании, а не восстанавливать систему с нуля.
  • Второй сервер — новый или предыдущее поколение оборудования, выведенное из основной работы. Вариантов применения два: держать его как резерв, на котором копию можно поднять за минуты, или сразу распределить роли — например, вынести на него второй контроллер домена и хранение резервных копий. Второй вариант выгоднее: техника не простаивает, а работает и одновременно страхует. Современные системы резервного копирования умеют запускать виртуальную машину прямо из копии — например, Vinchin Backup & Recovery или Veeam Backup and Replication делают это за 15–60 секунд.

С чего начать

С честного ответа на вопрос: если этот сервер остановится сегодня, что будет завтра? Если ответ неочевиден, предлагаем провести бесплатное экспресс-обследование: приедем к вам на объект, посмотрим, что работает на сервере, как устроено резервное копирование и какие точки отказа есть в инфраструктуре, после чего предложим, чем стоит заняться в первую очередь, а что может подождать.

Вся работа на одном сервере?

Найдём и обозначим текущие точки отказа, оценим возможные последствия и время восстановления, порекомендуем, как снизить риски с учётом задач и бюджета.