1. 环境准备与接入说明
准备账号与权限:申请PCCW机房账号与高防产品后,确认NOC/售后管理员联系信息与Portal登录权限。
确认带宽与端口:在控制台查看带宽、IP和防护策略,记录公网IP、内网IP与BGP/Anycast信息。
操作步骤:1) 登录PCCW控制台;2) 导出配置清单;3) 本地记录证书与密钥位置,避免在线明文传输。
2. 初始网络与BGP路由配置
核对路由:使用ssh连接交换机/服务器,运行ip route和bgp summary(若支持)确认路由。
BGP/Anycast设置:向PCCW提交ASN、前缀与社区需求,要求测试流量导向策略。
测试命令:ping、traceroute到公网和上游;使用tcpdump -n -i eth0 'tcp port 80'抓包验证可达性。
3. 系统及内核参数硬化
内核调优步骤:编辑/etc/sysctl.conf,设置 net.ipv4.tcp_syncookies=1、net.ipv4.ip_forward=0、net.ipv4.tcp_fin_timeout=15 等。
应用并验证:sysctl -p;查看当前值 sysctl net.ipv4.tcp_syncookies。
防护建议:关闭不必要服务,使用systemctl禁用未使用的端口与daemon。
4. 防火墙与iptables/nftables规则
基础策略:默认拒绝入站,允许输出与必要端口(如22、80、443)。
iptables示例:iptables -A INPUT -m conntrack --ctstate ESTABLISHED,RELATED -j ACCEPT;iptables -A INPUT -p tcp --dport 22 -s 管理IP -j ACCEPT;iptables -A INPUT -j DROP。
持久化与恢复:使用iptables-save > /etc/iptables/rules.v4,并测试重启后规则生效。
5. 高防策略与白/黑名单管理
控制台策略部署:在PCCW控制台创建防护策略,按业务端口绑定清洗策略与阈值。
白名单维护:将运维与监控IP加入白名单,避免误拦;定期审计。
黑名单规则:结合日志分析添加恶意IP段到黑洞或速率限制规则,记录变更理由与时间。
6. 流量监控与告警配置
监控项与阈值:带宽占用、连接数、突发流量、SYN/UDP包速率。设定分级阈值(警告/严重)。
工具与实现:部署Prometheus + node_exporter或Zabbix;关键点配置采集netstat、tcpdump切片、接口字节数。
告警规则:使用Alertmanager或Zabbix触发短信/邮件/钉钉机器人,阈值举例:95%带宽持续1分钟触发。
7. 日志采集与分析流程
日志类别:nginx/应用访问日志、系统auth、iptables日志、PCCW清洗日志。
集中化:部署ELK/EFK,Filebeat采集,配置索引与生命周期管理。
排查方法:出现异常时按时间线从清洗出口、边界防火墙到应用层逐级检查,使用grep/awk快速定位。
8. 备份、快照与恢复步骤
备份策略:配置定期全量+增量备份,包括数据库、配置文件、证书。设置异地备份到S3或PCCW提供备份空间。
快照操作:在PCCW控制台或虚拟化平台创建磁盘快照,记录快照ID与描述。
恢复演练:定期演练恢复流程:1) 恢复快照到测试实例;2) 运行完整性检查并验证服务;3) 记录时间与问题。
9. 应急响应(DDoS攻击)标准流程
检测与确认:监控触发阈值后,立即抓取tcpdump样本并确认是否为DDoS(高速、单一源/多源、异常包类型)。
缓解步骤:1) 在PCCW控制台提升清洗等级或启用黑洞策略;2) 临时调整防火墙速率限制;3) 通知PCCW NOC并提交ticket,附上抓包与流量图。
复盘与改善:攻击结束后分析攻击特征,更新防护规则与白名单,记录SOP并在周会复盘。
10. 与PCCW沟通与工单提交流程
工单准备:包含时间戳、受影响IP、端口、抓包样本(pcap)、带宽图(流量曲线)、期望动作。
联系方式:优先使用PCCW提供的NOC电话+Portal工单,同时抄送销售/客户经理。
跟进技巧:记录工单编号,按级别催办,必要时要求启动应急会议并请求日志导出权限。
11. 日常运维检查清单(周/月)
周检项:查看端口、内存、磁盘、CPU、连通性;验证备份执行情况;审查最近防火墙变更。
月检项:系统补丁与内核更新评估、证书到期检查、日志容量与索引健康检查。
记录与审批:所有变更执行前写变更单,变更后在CMDB记录并做回滚计划。
12. 性能优化与容量规划
性能分析:使用sar/iostat/iftop定位瓶颈,逐项优化(数据库索引、缓存、连接池)。
容量预估:按峰值流量和增长率估算所需带宽与清洗带宽,给PCCW预留弹性配额。
负载与分流:结合GSLB/负载均衡器分布流量,测试故障切换与会话保持策略。
13. 运维自动化脚本示例
自动化内容:环境初始化脚本(用户、SSH Key、sysctl)、防火墙规则部署脚本、备份定时任务。
示例步骤:1) 在配置管理工具(Ansible)中编写playbook;2) 使用模板管理iptables与sysctl;3) 在CI中加入变更回滚测试。
安全建议:脚本中不要明文写入秘钥,使用Vault或PCCW Secret管理服务。
14. 问:PCCW高防服务器遭遇SYN洪泛时我第一步应该做什么?
答:第一步保留证据并限流:立即抓取tcpdump(tcpdump -s 0 -w syn_attack.pcap 'tcp[tcpflags] & tcp-syn != 0'),在本地或边界开启速率限制(iptables -A INPUT -p tcp --syn -m limit --limit 500/s -j ACCEPT),同时在PCCW控制台提升清洗级别并提交包含抓包与带宽图的工单。
15. 问:如何与PCCW协作完成误报恢复(误拦正常流量)?
答:提供被误拦的IP/时间段与应用日志,要求PCCW回溯清洗日志定位规则;临时将受影响IP加入白名单或调整阈值,PCCW调整后观察30分钟无误报后再撤销白名单,整个过程记录变更单。
16. 问:运维团队如何定期验证高防策略有效性?
答:定期进行非生产环境的压力测试与DDoS模拟(使用第三方合规工具或双方协商的流量生成),在PCCW联动下测试清洗策略、告警触发与故障切换,并把结果写入SOP,必要时调整阈值与规则。
来源:技术人员必读的香港pccw高防服务器运维手册要点