Incident management concept (SRE): adapted ICS for software incidents. Severity levels (SEV1/2/3), Incident Commander (IC) coordinator role separate from Operations who fixes, Communications Lead handling status page, Scribe capturing timeline, SMEs on-demand. Detection via Prometheus SLO burn -> Alertmanager -> PagerDuty -> on-call IC. War room via Slack channel + Zoom + Incident.io orchestration. Customer comms via Statuspage (Investigating -> Identified -> Monitoring -> Resolved cadence every 30min) + Twitter + support macros. Mitigation toolkit: rollback, feature flag off, regional failover, manual circuit break — mitigate first, investigate later. Four scenarios: SEV-1 textbook response with rollback in 28min, statuspage 30-min comms cadence, follow-the-sun handoff between US and EU regions, anti-pattern of investigation > mitigation causing 45-min downtime. Includes 2 ADRs: rotating IC vs dedicated IC team, blameless culture enforcement.
Без процесса инцидент превращается в хаос: 15 человек в одном Zoom, никто не координирует, support не знает что писать, fix коммитится без review и ломает ещё больше. Incident Command System (адаптированный из firefighting FEMA) даёт роли, протокол коммуникации и discipline mitigation-first. Команды со зрелым процессом восстанавливают сервис в 3-5× быстрее (MTTR 15 минут vs 1 час) — это разница между «customer не заметил» и «попадание в news».
«Incident response — не "тушить пожар", а запустить организованный процесс. IC координирует, не чинит. Mitigation важнее investigation: сначала верни сервис, потом разбирайся почему. Каждое решение логируется — это потом будет timeline post-mortem.»
Три кита:
#inc-2026-05-14-checkout, Zoom bridge, Incident.io как оркестратор, runbook. Единственный источник правды на время инцидента.Edges показывают flow: detection chain (svc → prom → alertmanager → pagerduty → ic), IC делегирует роли, Ops следует runbook → rollback, Comms пишет в statuspage. Scribe пинит decisions в Slack и автоматом капчурит таймлайн через Incident.io.
SEV-1 textbook (28 минут) — детект на 90с (SLO burn 14× normal), IC ack на 2-й минуте, формальное /incident declare SEV-1, авто-создание Slack + Zoom + invite. IC делегирует роли явно по именам («Rajiv = Ops, Sofia = Comms, Devon = Scribe»). Ops подтверждает recent deploy через 5 минут, IC одобряет rollback, rollback завершается на 10-й минуте, 30-минутное окно верификации, [Resolved] на 30-й минуте. Ключевое: IC не открывал IDE, Comms не писала код, Ops не обновляла statuspage — роли сохранены, хаоса нет.
Communication cadence (правило 30 минут) — как Comms Lead ведёт 4 statuspage updates за 28-минутный инцидент. Шаблоны: [Investigating] → [Identified] → [Monitoring] → [Resolved]. Плоский язык, без жаргона («delays processing your order», не «kafka consumer lag»). Обновление минимум каждые 30 минут — silence читается как «не знаем / не парим / прячем». Для SEV-1 — твит из основного бренд-аккаунта (не только status). Support получает canned macros одновременно с публикацией. Кейс показывает: Comms Lead существует ровно для того, чтобы IC и Ops оставались сфокусированы.
Follow-the-sun handoff (8h SEV-2) — Stripe деградировал, US IC Maya переключила на Adyen fallback за 50 минут. К концу US business day — формальный handoff в EU. PagerDuty эскалирует Lukas в Berlin за 30 минут до окна, Scribe walks Lukas через timeline, Maya даёт verbal brief (severity, текущая митигация, открытые гипотезы, SME, vendor contacts, pending decisions). 30-минутное overlap, формальная передача IC роли в Incident.io. Без handoff обе зоны думают что «кто-то смотрит» — инцидент дрейфует unmonitored. Anti-pattern: outgoing IC просто уходит спать.
Анти-паттерн: investigation > mitigation (45-минутная кроличья нора) — Tom (он же автор v2.4) пейджится, confirmation bias («моё не могло сломаться»), скипает IC role assignment, лезет в traces вместо rollback. Через 25 минут добавляет неправильный индекс на DB. На 32-й минуте EM Sarah берёт IC, командует rollback, 45 минут downtime вместо 5. $50K revenue lost, статус-пейдж молчал 45 минут, Twitter и HackerNews узнали раньше клиентов. Lessons: автор deploy disqualifies из IC роли; мандатное IC declaration <5 мин; «recent deploy?» — first hypothesis.
ADR-IM-001: Rotating IC vs Dedicated IC team (см. на ноде svc).
ADR-IM-002: Blameless culture — насколько blameless и как enforce.
ICS — это тяжёлый процесс. Не нужен для:
Главное правило тяжёлого процесса: он окупается частотой. Если SEV-1/SEV-2 случается раз в год — ROI на Incident.io лицензию и тренинги отрицательный. Если раз в месяц — окупается за квартал. Если раз в неделю — investing в reliability, не в incident process.