在面对台湾机房停电的紧急情况下,技术团队应首先评估“最好”的方案(全面恢复、零数据丢失)、“最佳”步骤(最短停机时间与风险最小化)和“最便宜”的临时手段(临时备电、负载迁移)。对于服务器运维,优先保证数据完整性与服务可用性,选择成本最低但风险可控的临时措施,同时并行进行根因分析与长期修复。
确认人员安全、断电范围与影响设备,检查机房门禁与视频记录,标注受影响的服务器机柜、PDU与UPS。若存在明火、异味或冒烟,应立即疏散并联络消防。初步确认是市电中断还是局部配电故障,向电力单位或机房管理方获取告警信息与停电通报。
尽快收集监控系统、BMC/iLO/IMM日志、电力监控(Aggregator/PDU)、UPS与ATS事件记录。查看告警时间点、负载变化、温湿度报警与历史维护记录。通过这些数据判断是瞬时跳闸、过载、外部电网事件或设备故障。
按顺序检查市电进线、分配柜、发电机、ATS、UPS、PDU与机柜断路器。确认发电机是否自动启动、ATS是否切换、UPS是否放电或跳脱、PDU是否有输出。记录每一步的状态与指示灯,并拍照留证。
检查UPS电池电压与剩余放电时间、是否有告警或容量衰减;确认发电机燃油、冷却与控制系统是否正常,测试自动切换与并联逻辑。若UPS过热或电池组失效,视情况启用临时外接UPS或通过迁移减轻负载。
检查配电盘与断路器是否跳脱、接线是否松动、是否有短路或漏电保护动作。特别注意单相失压、相序错误与不平衡负载,这些常是导致机柜单侧失电的原因。记录断路器型号与触发历史以便厂商诊断。
检查交换机、核心路由器与上联链路是否受影响,确认机房内部网络连通性。对服务器做远程或本地开机检查:硬件自检、RAID与存储状态、文件系统完整性与关键服务日志,必要时以只读方式挂载磁盘防止写入导致数据损坏。
确认空调、冷通道是否工作,环境温湿度是否超过阈值。检查接地和等电位连接,接地不良会导致继电保护误动作或设备损坏。排查水浸、动物或施工误触等外部因素引发的停电事件。
建立事件通讯链:现场负责人、机房管理、网络/电力工程师、厂商支持与客户联络人。记录每次沟通内容与决定时间,按SLA和事件等级升级至相关供应商或电力公司,必要时启动应急变更与数据迁移计划。
根据业务优先级恢复关键服务:先恢复核心数据库、认证服务与外部API接入,再依次恢复非核心应用。若必须采取最便宜的临时措施,可短期内降低非关键负载、逐步迁移VM至其他机房或云端,从而缩短停机窗口。
在服务恢复后开展详细的根因分析(RCA),包含电力系统日志、维护记录、硬件寿命与设计缺陷。建议加强冗余:双路市电、N+1 UPS、定期电池更换、发电机负载测试、远程监控告警与演练。编写改善计划并跟踪执行。
清单要点:确认人员安全、记录停电时间与范围、采集UPS/PDU/ATS/发电机日志、检查断路器与接线、核对环境温湿度、排查接地与外部施工、验证网络与存储状态、通知相关方并归档事件报告。