从运维常见案例看,台湾服务器在使用CN2线路时,典型故障包括:链路抖动/丢包、BGP路由波动、节点不可达、ARP冲突/网关故障、以及宿主机资源(CPU/内存/磁盘)异常。遇到故障时应先按影响面和业务优先级判断:全网不可达>单节点不可达>性能下降。
常见症状有:持续高延迟或丢包、连接建立失败(SYN超时)、路由跳数异常、磁盘IO等待高或进程OOM。识别时使用ping、mtr、traceroute、ss、netstat等工具先定位网络层,再向上判断应用层。
若出现间歇性故障,优先关注链路与ISP侧抖动;若故障稳定复现,则考虑本地配置或宿主机资源问题。强调把握影响范围与复现条件。
立即执行ping(带统计)和mtr(或tracepath)对目标与网关进行测量,记录丢包率、延迟、跳数。对比不同时间、不同目标(同机内网、出口IP、ISP中转)可以判断是本地还是上游问题。
分层检查:物理链路(链路灯、交换机端口)→ L2(ARP冲突、MAC变化)→ L3(路由表、BGP)→ FW/NAT(策略、连接表)。使用ethtool、tcpdump抓包定位链路抖动或重置包,必要时与机房工程师核对光衰或端口错误统计。
常用工具:ping、mtr、traceroute、tcpdump、ethtool、ifconfig/ip、snmpwalk。保存抓包文件和路由表快照便于与ISP/接入方沟通。
首先确认是单节点还是跨机房、是否在固定时间段发生(高峰/分钟级批处理)。通过监控告警确定开始时间,导出监控曲线(延迟、丢包、带宽)作为佐证。
1) 本地环节:检查网卡错误、接口统计(RX/TX errors、collisions)。2) 机房交换:查看端口错误、链路聚合状态。3) 上游ISP:对比多跳mtr结果找出丢包发生节点。4) 应用层:查看连接重试、超时日志,判断是否为网络抖动导致。
临时手段包括切换到备用链路、增加重试和超时时间、限流保护。抓取ping/mtr/tcpdump样本并与ISP交换故障时间线,若为ISP侧问题,要求提供BGP、路由变化日志和物理链路统计。
检查BGP邻居状态、路由表(route show/ bgp summary),看是否有restarts、flap或大量route withdraw。使用bgp监控工具或router logs定位邻居中断点。
1) 若为邻居会话中断,核对TCP端口、ACL、防火墙规则是否阻塞;重启BGP进程或邻居会话可快速恢复。2) 若为路由被错误污染或被劫持,立即在上游提出Prefix filter、AS-PATH或社区过滤,并考虑宣布更精确路由(moat/blackholing要谨慎)。3) 与承载ISP沟通调度路由恢复。
建议配置合理的BGP防护(TTL-security、MD5、prefix-limit)、监控BGP flaps并启用RPKI/ROA验证以减少被劫持风险。
针对不同业务(Web、数据库、实时服务)预先定义RTO/RPO。发生严重故障时,按优先级先行切换关键服务到备机或云端,减少业务中断时间。
1) DNS层面:缩短TTL并在故障前预置备用IP/备用CDN;2) BGP层面:通过社区或本地优先级调整流量;3) 应用层:启用热备、读写分离或只读降级。切换同时记录每一步操作和回滚策略。
恢复后需做一致性校验(数据同步、事务完整性)、性能验证与事后根因分析(RCA),并将故障记录到运维知识库,以便下次更快定位与恢复。