事件回應與災難復原
如何偵測與處理事件、由誰升級,以及服務如何復原。
- 嚴重程度 — 標準運營 5 級。
- 偵測 — 5 分鐘輪詢週期(監控、心跳、ErrorLogs)。
- SLA — 可用性 99.95%–99.9999%(約定),目標 4 小時內解決。
- 角色 — AI 自動化偵測/分類/操作手冊執行;高風險經事前審批;新發或高風險由人類 FDE Squad 處理。
- 升級 — 具每客戶專屬聯絡人的 Slack 頻道,7×24 覆蓋,operator → manager → end user 逐級。
- 事後 — 遵循客戶標準事件報告;若無則提供 md 報告。
- 災難復原 — RTO 4 小時;RPO 約定;DB 與原始碼每日備份(雲端儲存或客戶位置);FDE Box 故障 30 分鐘內修復或更換;GIIP Engine 採用 Azure 區域冗餘;每 6 個月進行一次 DR 測試。