1.
巡检目标与频率定义
(1) 明确巡检目标:最低实现电话服务可用率 99.9%。
(2) 巡检频率:生产节点每日按“按3”规则早中晚三次巡检。
(3) 巡检触发条件:检测到任意三次连续拨号失败或 SIP 注册丢失。
(4) 数据记录要求:每次巡检需记录时间、监测点、RTT、丢包率。
(5) 报告提交:巡检日报需在 2 小时内上传至运维平台并抄送产品经理。
(6) 工具建议:使用 ping、mtr、sngrep、tcpdump 以及 Zabbix/Prometheus 监控。
2.
硬件与虚拟化(VPS/主机)检查要点
(1) CPU/内存:检查 95% 阈值,避免持续满载导致软中断堵塞。
(2) 磁盘:SMART 状态、iostat 查看 5 分钟平均等待。
(3) 网络接口:查看 ifconfig/ethtool 错误计数与速率。
(4) 虚拟化层:KVM/Xen 上核平滑迁移、NUMA 拆分校验。
(5) 备份节点:核验热备 VPS 同步延迟不得超过 30 秒。
(6) 配置管理:Ansible playbook 校验主机名、SSH 密钥、时区与 NTP。
3.
域名、DNS 与 CDN 配置检查
(1) 域名解析:核验 A/AAAA/SRV 记录和 TTL,电话服务通常使用低 TTL(60s)。
(2) SRV 记录:确保 SIP 服务记录优先级与权重正确。
(3) CDN:电话媒体采用边缘转发时,检查边缘节点带宽与链路抖动。
(4) DNSSEC 与 域名续费:验证签名与到期日,避免因域名到期导致服务中断。
(5) 示例命令:dig _sip._udp.example.hk SRV +short,检查返回优先级。
(6) DNS 响应时间:要求<100ms 国际解析,香港本地<20ms。
4.
网络与 DDoS 防御巡检细则(含数据示例)
(1) 基本指标:链路带宽使用率阈值 70%,丢包>1% 需报警。
(2) BGP 与路由:检查 BGP 会话状态、AS 路由是否稳定。
(3) 防护规则:验证防火墙、ACL、速率限制与黑洞策略。
(4) 流量分析:通过 sflow/NetFlow 检测异常 95 百万包/分钟阈值。
(5) 案例说明:2025-08-12 某香港呼叫中心遭 UDP 放大攻击,峰值流量 1.2Tbps,被本地清洗+CDN 抵御后 8 分钟恢复。
(6) 下表示例为典型服务器和防护配置(数据示例):
5.
真实案例复盘与恢复流程
(1) 案例背景:某香港ISP在维护时误下发路由,导致区域内电话可达失败。
(2) 故障表现:SIP 注册失败、呼叫建立 503 返回、媒体无法透传。
(3) 诊断步骤:核查 BGP、路由表、MTR 至媒体节点并抓包分析。
(4) 恢复措施:回滚路由、启用备用链路、对受影响节点进行冷重启。
(5) 后续优化:加入更多外链、CDN 转发与自动化流量清洗策略。
(6) 教训:测试环境与生产环境路由隔离、变更需双人审批。
6.
巡检记录模板与自动化建议
(1) 模板字段:时间、巡检人、节点 IP、RTT(ms)、丢包(%)、状态、建议。
(2) 自动化脚本:定时使用 ping/mtr/sipgrep 并汇报至 Prometheus + Alertmanager。
(3) 指标阈值:RTT>200ms/丢包>1%/注册失败率>0.5% 即触发工单。
(4) 演练频次:每季度进行一次故障恢复演练,包含域名切换与 CDN 回源。
(5) 文档管理:所有巡检日志保留 365 天并定期审计。
(6) 结语:按“停机按3”的巡检制度结合自动化、CDN 与 DDoS 防护,可显著降低香港电话服务器的意外停机风险。
来源:培训手册为管理员讲解香港电话服务器停机按3的日常巡检要点