Circuit breaker для руководителя: чему отказоустойчивость учит менеджмент

Мой скрапер отключает домен после трёх подряд ошибок 401, 404 или 410. Не после десятой попытки. После трёх.

Это circuit breaker, скучный паттерн из любого учебника по распределённым системам, и в коде он не вызывает у меня никаких эмоций. Теперь вопрос: сколько провалов подряд вы готовы профинансировать в проекте, прежде чем перекроете бюджет? У скрапера ответ записан в конфиге. У большинства руководителей ответа нет, поэтому мёртвые инициативы живут кварталами.

Я долго считала, что системы это холодная часть работы, а лидерство тёплая. Оказалось наоборот. Спокойствие под нагрузкой это не черта характера. Спокойствие это архитектура.

Fallback-цепочки. Моя система тянет 23 экономических индикатора, у каждого несколько источников с приоритетами, и когда падают все источники сразу, система публикует видимую дыру в данных вместо последнего устаревшего значения, которое выглядело бы прилично на графике. С командой то же самое. Честное «мы работаем на 60% мощности» полезнее дашборда, где всё зелёное. Замаскированная деградация всегда дороже объявленной.

Идемпотентность. Задачи классификации возобновляются с чекпоинта, упавший процесс не тарифицируется дважды. Управленческий аналог: решение с записанной причиной не перерешивается. Каждый пересмотр уже решённого вопроса это повторная оплата той же работы.

Провенанс. У каждого значения в базе есть источник и таймстемп последнего подтверждения. Спросите то же самое про правила в вашей команде. Откуда взялось? Кто автор? Когда проверялось? Унаследованные политики без провенанса это устаревшие данные, по которым всё ещё принимают решения.

Полная версия: https://anipers.com/media/graceful-degradation

11