Как я потерял данные клиента и что из этого вынес. История без happy-end в середине
Все началось в четверг. В 11:23 утра.
Я помню точное время потому, что именно тогда мне позвонил директор небольшой юридической фирмы и спросил почему файловый сервер не отвечает.
Что было до звонка:
Юридическая фирма. +/- 18 человек. Все документы — договоры, иски, переписка с судами — лежали на файловом сервере. Старенький Dell PowerEdge, Windows Server 2012 R2 и два диска в RAID 1.
Обслуживал их три года. Всё работало. Бэкапы делались каждую ночь на внешний USB-диск.
Именно «делались». В прошедшем времени.
Что случилось
Один из дисков в RAID начал сыпаться. Сервер это заметил и прислал уведомление. На email который никто не читал — ящик был настроен три года назад и с тех пор не проверялся.
Через две недели упал второй диск.
RAID 1 защищает от отказа одного диска. Когда падают оба — защищать нечем. Массив деградировал. Данные недоступны.
Я подключился удалённо. Открыл диспетчер дисков. Увидел два красных диска и почувствовал как желудок опускается куда-то в пол.
Следующие шесть часов
Первая мысль: бэкап. Подключаю USB-диск. Открываю папку с бэкапами.
Последний файл датирован тремя месяцами назад.
Скрипт бэкапа падал с ошибкой — закончилось место на USB-диске. Скрипт не присылал алертов об ошибках. Я не проверял бэкапы вручную. Три месяца данных — договоры, судебные документы, переписка — существовали только на умерших дисках.
Позвонил в компанию по восстановлению данных. Цена: от 45 000 рублей, срок — 5-10 рабочих дней, гарантии нет.
Директор фирмы был спокоен. Это хуже чем когда истерят.
Что удалось восстановить
Специалисты по восстановлению вытащили около 70% данных. За 52 000 рублей и восемь дней.
Три месяца документов пропало безвозвратно. Часть из них пришлось восстанавливать вручную — запрашивать копии у контрагентов, поднимать почту, звонить в суды.
Один договор так и не восстановили. По нему были разногласия с клиентом.
Я не знаю чем та история закончилась. После этого случая мы расстались.
Что я поменял после
Это не раздел «как правильно делать бэкапы». Это то что я лично внедрил после того как потерял клиента и поседел за одну неделю.
Первое — мониторинг состояния дисков.
Теперь на каждом сервере стоит скрипт который каждый день проверяет SMART дисков и шлёт отчёт в Telegram.
Не на email — в Telegram. Email игнорируют, Telegram читают.
smartctl -a /dev/sda | grep -E "Reallocated|Pending|Uncorrectable"
Если цифры не нули — это уже повод менять диск не дожидаясь отказа.
Второе — бэкап который проверяет сам себя.
Скрипт бэкапа теперь в конце пишет в Telegram: «Бэкап выполнен, размер файла X МБ». Если сообщения нет — значит что-то пошло не так.
Размер файла важен. Если бэкап сделался но весит 0 байт — это не бэкап, это повод напрячься.
Третье — правило 3-2-1.
3 копии данных. 2 разных носителя. 1 копия вне офиса.
Раньше я знал про это правило. После той истории я его соблюдаю.
Для малого бизнеса это выглядит так: бэкап на локальный NAS + копия в облако (Яндекс Диск, S3-совместимое хранилище) + раз в месяц архив на внешний диск который хранится не в офисе.
Четвёртое — тестовое восстановление.
Раз в квартал я беру случайный бэкап и восстанавливаю из него один файл. Не весь сервер — просто один файл чтобы убедиться что бэкап вообще читается.
Звучит банально. До того четверга я этого не делал ни разу.
Пятое — алерты на email которые никто не читает.
Я перенастроил все уведомления с почты в Telegram. RAID деградировал, диск умирает, бэкап не прошёл — всё это теперь приходит в личку. Немедленно.
Настройка занимает час. Цена вопроса — бесплатно.
Сколько это стоило
Прямые потери клиента: 52 000 рублей за восстановление данных. Плюс несколько дней работы сотрудников на ручное восстановление документов. Плюс один потерянный договор.
Мои потери: клиент который платил стабильно три года. Репутация в определённых кругах.
Стоимость правильно настроенного мониторинга и бэкапов: несколько часов работы и 0 рублей на инструменты.
Что я думаю про это сейчас
Я не сделал ничего криминального. Бэкапы были. Мониторинг был. Всё работало — до тех пор пока перестало.
Проблема была в том что я настроил систему и перестал её проверять. Три года без единого инцидента создают ложное ощущение что всё в порядке.
Инфраструктура — это не то что настраивается один раз. Это то за чем нужно следить постоянно.
Банальная мысль. Дорогой урок.
Если вам интересна тема IT-инфраструктуры для малого бизнеса без воды — пишу про это в блоге IT-Аптека и в Telegram-канале. Там же можно задать вопросы — отвечаю лично.