giip
Trust

事件响应与灾难恢复

如何检测与处理事件、由谁升级,以及服务如何恢复。

  • 严重级别 — 标准运营 5 级。
  • 检测 — 5 分钟轮询周期(监控、心跳、ErrorLogs)。
  • SLA — 可用性 99.95%–99.9999%(约定),目标 4 小时内解决。
  • 角色 — AI 自动化检测/分诊/运行手册执行;高风险经事前审批;新发或高风险由人类 FDE Squad 处理。
  • 升级 — 带每客户专属联系人的 Slack 频道,7×24 覆盖,operator → manager → end user 逐级。
  • 事后 — 遵循客户标准事件报告;若无则提供 md 报告。
  • 灾难恢复 — RTO 4 小时;RPO 约定;DB 与源码每日备份(云存储或客户位置);FDE Box 故障 30 分钟内修复或更换;GIIP Engine 采用 Azure 区域冗余;每 6 个月进行一次 DR 测试。
安全评审咨询