インシデント対応・災害復旧
障害をどう検知・対応し、誰がエスカレーションし、どう復旧するか。
- 重大度 — 標準運用の5段階。
- 検知 — 5分のポーリング周期(監視・ハートビート・ErrorLogs)。
- SLA — 可用性 99.95%〜99.9999%(協議)、対応完了目標は4時間以内。
- 役割 — AI が検知・分類・ランブック実行を自動化、高リスクは事前承認ゲート、新規・高リスクは人間の FDE Squad。
- エスカレーション — 顧客ごとの専任窓口がある Slack チャネル、24/7 対応、operator → manager → end user の段階。
- 事後 — 顧客の標準インシデントレポートに従い、ない場合は md レポートを提供。
- 災害復旧 — RTO 4時間、RPO 協議、DB・ソースを1日1回バックアップ(クラウドストレージまたは顧客指定)、FDE Box 障害は30分以内に解決またはBox交換、GIIP Engine は Azure リージョン冗長、DR テストは6か月に1回。