Как я потерял данные клиента и что из этого вынес. История без happy-end в середине

Все началось в четверг. В 11:23 утра.

Я помню точное время потому, что именно тогда мне позвонил директор небольшой юридической фирмы и спросил почему файловый сервер не отвечает.

Что было до звонка:

Юридическая фирма. +/- 18 человек. Все документы — договоры, иски, переписка с судами — лежали на файловом сервере. Старенький Dell PowerEdge, Windows Server 2012 R2 и два диска в RAID 1.

Обслуживал их три года. Всё работало. Бэкапы делались каждую ночь на внешний USB-диск.

Именно «делались». В прошедшем времени.

Что случилось

Один из дисков в RAID начал сыпаться. Сервер это заметил и прислал уведомление. На email который никто не читал — ящик был настроен три года назад и с тех пор не проверялся.

Через две недели упал второй диск.

RAID 1 защищает от отказа одного диска. Когда падают оба — защищать нечем. Массив деградировал. Данные недоступны.

Я подключился удалённо. Открыл диспетчер дисков. Увидел два красных диска и почувствовал как желудок опускается куда-то в пол.

Следующие шесть часов

Первая мысль: бэкап. Подключаю USB-диск. Открываю папку с бэкапами.

Последний файл датирован тремя месяцами назад.

Скрипт бэкапа падал с ошибкой — закончилось место на USB-диске. Скрипт не присылал алертов об ошибках. Я не проверял бэкапы вручную. Три месяца данных — договоры, судебные документы, переписка — существовали только на умерших дисках.

Позвонил в компанию по восстановлению данных. Цена: от 45 000 рублей, срок — 5-10 рабочих дней, гарантии нет.

Директор фирмы был спокоен. Это хуже чем когда истерят.

Что удалось восстановить

Специалисты по восстановлению вытащили около 70% данных. За 52 000 рублей и восемь дней.

Три месяца документов пропало безвозвратно. Часть из них пришлось восстанавливать вручную — запрашивать копии у контрагентов, поднимать почту, звонить в суды.

Один договор так и не восстановили. По нему были разногласия с клиентом.

Я не знаю чем та история закончилась. После этого случая мы расстались.

Что я поменял после

Это не раздел «как правильно делать бэкапы». Это то что я лично внедрил после того как потерял клиента и поседел за одну неделю.

Первое — мониторинг состояния дисков.

Теперь на каждом сервере стоит скрипт который каждый день проверяет SMART дисков и шлёт отчёт в Telegram.
Не на email — в Telegram. Email игнорируют, Telegram читают.

smartctl -a /dev/sda | grep -E "Reallocated|Pending|Uncorrectable"

Если цифры не нули — это уже повод менять диск не дожидаясь отказа.

Второе — бэкап который проверяет сам себя.

Скрипт бэкапа теперь в конце пишет в Telegram: «Бэкап выполнен, размер файла X МБ». Если сообщения нет — значит что-то пошло не так.

Размер файла важен. Если бэкап сделался но весит 0 байт — это не бэкап, это повод напрячься.

Третье — правило 3-2-1.

3 копии данных. 2 разных носителя. 1 копия вне офиса.

Раньше я знал про это правило. После той истории я его соблюдаю.

Для малого бизнеса это выглядит так: бэкап на локальный NAS + копия в облако (Яндекс Диск, S3-совместимое хранилище) + раз в месяц архив на внешний диск который хранится не в офисе.

Четвёртое — тестовое восстановление.

Раз в квартал я беру случайный бэкап и восстанавливаю из него один файл. Не весь сервер — просто один файл чтобы убедиться что бэкап вообще читается.

Звучит банально. До того четверга я этого не делал ни разу.

Пятое — алерты на email которые никто не читает.

Я перенастроил все уведомления с почты в Telegram. RAID деградировал, диск умирает, бэкап не прошёл — всё это теперь приходит в личку. Немедленно.

Настройка занимает час. Цена вопроса — бесплатно.

Сколько это стоило

Прямые потери клиента: 52 000 рублей за восстановление данных. Плюс несколько дней работы сотрудников на ручное восстановление документов. Плюс один потерянный договор.

Мои потери: клиент который платил стабильно три года. Репутация в определённых кругах.

Стоимость правильно настроенного мониторинга и бэкапов: несколько часов работы и 0 рублей на инструменты.

Что я думаю про это сейчас

Я не сделал ничего криминального. Бэкапы были. Мониторинг был. Всё работало — до тех пор пока перестало.

Проблема была в том что я настроил систему и перестал её проверять. Три года без единого инцидента создают ложное ощущение что всё в порядке.

Инфраструктура — это не то что настраивается один раз. Это то за чем нужно следить постоянно.

Банальная мысль. Дорогой урок.

Если вам интересна тема IT-инфраструктуры для малого бизнеса без воды — пишу про это в блоге IT-Аптека и в Telegram-канале. Там же можно задать вопросы — отвечаю лично.