opsmith / monitoring-incident-operations / Modul

Incident-Command-Simulation

Mehrdeutige Großstörungen führen: Rollen, Entscheidungslog und Kommunikation unter Zeitdruck.

Führen unter unvollständiger Evidenz

Einführung · 4 Abschnitte · ~12 Min Lesezeit · Stand

Die Betriebsfrage

Bei einer Großstörung ist die knappe Ressource Aufmerksamkeit. Incident Command schafft einen Ort für Entscheidungen, eine gemeinsame Zeitlinie und klare Rollen, ohne technische Diagnose in Statuskommunikation zu vermischen.

Command-Zyklus

  1. Incident Scope und Commander benennen
  2. Technische und Kommunikationsrollen trennen
  3. Auswirkung, Fakten und Hypothesen aktualisieren
  4. Nächste reversible Entscheidung zuweisen
  5. Status, Zeit und Entscheidung protokollieren

Entscheidung statt Aktionismus

Ein Statusupdate sagt, was bekannt ist, was als Nächstes geprüft wird und wann ein Update folgt. Es verspricht keine Ursache oder Wiederherstellungszeit ohne Evidenz. Der Commander koordiniert, statt jede technische Änderung selbst anzuordnen.

Im Check

Die Simulation trennt Ursache, Symptom und Kommunikationspflicht. Du wählst die früheste belegte Grenze und die nächste Entscheidung, nicht die lauteste Forderung im Chat.

Gelesen ist nicht geprüft: Im Modul entscheidest du die Fälle selbst und siehst danach, wo dein Urteil trägt.

3 Checks starten →

Modul-Aufbau

EINFÜHRUNGFühren unter unvollständiger Evidenz~12 Min
ADR-001INCIDENT-COMMANDsenior
TRACE-002MISSION · STATUS-EVIDENCEsenior
FLOW-003MISSION · COMMAND-CYCLEsenior

Quellen

  1. 01sre.google/sre-book/managing-incidents
  2. 02sre.google/workbook/incident-response