1. 上线第一天:接管与基础硬化
- 验证连通与凭证:使用供应商给的控制台账号登录,拿到公网 IP、控制台密钥与控制台 VNC。
- 建立管理员访问:生成并上传 SSH 公钥(ssh-keygen; ssh-copy-id user@IP),禁止明文密码登录(编辑 /etc/ssh/sshd_config:PermitRootLogin no、PasswordAuthentication no;systemctl restart sshd)。
- 系统基础更新与时区:apt-get update && apt-get upgrade -y 或 yum update -y;timedatectl set-timezone Asia/Seoul;设置主机名 hostnamectl set-hostname your-hostname。
2. 网络与高防接入配置
- 与高防面板对接:在供应商控制台开启流量清洗、BGP/流量镜像或浮动 IP;确认清洗阈值与黑白名单机制。
- 本地流量限制与内核调优:启用 syncookies 等(sysctl -w net.ipv4.tcp_syncookies=1; sysctl -w net.ipv4.tcp_max_syn_backlog=4096; sysctl -w net.core.somaxconn=10240)。
- 简单速率限制实例:iptables -N LIMIT && iptables -A INPUT -p tcp --syn -m limit --limit 20/s --limit-burst 50 -j ACCEPT;或使用 nftables 规则做速率控制。
3. 监控、告警与日志集中化
- 安装代理并接入:apt install zabbix-agent 或部署 node_exporter + Prometheus,配置 server 地址,systemctl enable --now zabbix-agent。
- 告警策略与自动化:设置高优先级告警(流量、CPU、SYN 队列、磁盘 I/O),关联通知渠道(短信/钉钉/Slack)并写运行手册(runbook)。
- 日志收集:安装 rsyslog/Fluentd,将 /var/log 转发至远端 ELK/Graylog;配置 logrotate 定期轮换。
4. 备份与快照策略(可恢复性)
- 文件与数据库备份:数据库使用 mysqldump -u root -p DB > db.sql;关键文件 tar czf site-$(date +%F).tgz /var/www。
- 远端同步与保留:用 rsync -avz --delete /data backup@remote:/bak 或 rclone sync 到对象存储;设定保留策略(7/30/90 天)。
- 恢复演练:定期在演练环境执行恢复(还原 SQL、解压文件、重启服务),记录 RPO/RTO。
5. 常规维护与补丁流程
- 制定维护窗口:与客户协商低峰时间,提前发布通知并降低 DNS TTL。
- 补丁前检查流程:apt-get -s upgrade 做模拟,备份当前配置与数据,使用 tmux 执行升级并保留控制台日志。
- 内核或重启流程:systemctl stop app.service; apt-get upgrade; reboot;升级后验证服务(systemctl status、应用健康检查)。
6. 故障响应:DDoS 与网络中断实操步骤
- 初步定位:查看连接与流量(ss -s;ss -tunlp;iftop -i eth0;vnstat),抓包 tcpdump -i any -w attack.pcap 'tcp'。
- 快速缓解:调用供应商清洗;临时 iptables/nftables 丢弃高流量源(iptables -A INPUT -s 1.2.3.4 -j DROP 或 nft add rule inet filter input ip saddr 1.2.3.4 drop)。
- 扩展措施:在必要时切换到 CDN/负载均衡、启用浮动 IP 切换或 BGP null-route,记录证据并升级到 NOC,事件后做复盘与规则更新。
7. 问:如何在不影响业务的前提下模拟并验证高防规则?
问:如何安全地模拟攻击以验证高防配置?
答:在隔离环境使用 hping3 或 iperf3 进行流量测试(hping3 --flood -S -p 80 target_ip 在实验环境),并同时监控 CPU、网络带宽、SYN 队列(ss -s、netstat -anp、iftop)。不要在生产直接发洪水测试;先在镜像环境或与供应商合作进行流量回放。
8. 问:遇到硬件故障(网卡/磁盘)如何最小化停机?
问:物理故障的快速应对步骤是什么?
答:首先把受影响服务器流量切换到备用(浮动 IP 或负载均衡切换),在备用机验证服务可用;同时向供应商提工单启动 RMA。数据恢复用最近快照或 rsync/增量备份还原,数据库使用复制拓扑将从库提升为主库(提前准备好自动化脚本或使用 Orchestrator/MHA)。
9. 问:日志保留与合规性如何落地?
问:日志保存期与合规要求如何实现?
答:按法规与业务需求定义保存期(如 30/90/365 天),用 logrotate 配置轮换并压缩(示例:/etc/logrotate.d/app),并将归档同步到远端对象存储或冷备库;敏感日志加密传输(TLS)并限制访问权限,定期验证备份可恢复性和审计链路。
来源:韩国高防独立服务器租用后运维流程与故障响应最佳实践