1. 登录运维平台(控制台/API),验证账号权限:使用MFA、查看API Key有效期;执行curl示例:curl -H "Authorization: Bearer
2. 检查SSL证书有效期:openssl s_client -connect cdn.example.com:443 -servername cdn.example.com | openssl x509 -noout -dates;检查CNAME/A记录:dig +short cdn.example.com @8.8.8.8,确认解析到正确边缘节点或提供商CNAME。
3. 查看缓存配置:确认Cache-Control、Expires、Vary、Cookie白名单策略;用curl查看响应头:curl -I https://cdn.example.com/path -H "Host: example.com" ,记录cache-control和x-cache等字段,确认缓存键规则(包括query参数白名单)。
4. 执行缓存刷新:优先使用API批量刷新并记录任务ID。示例:curl -X POST https://api.cdn.example.com/v1/purge -H "Authorization: Bearer $TOKEN" -d '{"type":"url","objects":["/img/logo.png"]}',保存返回task_id用于后续查询。
5. 查询刷新状态:curl https://api.cdn.example.com/v1/purge/status/$TASK_ID;对边缘节点逐点验证:curl -I https://cdn.edge1.example.com/img/logo.png,看x-cache是否显示MISS并能回源;若误刷立即通过API提交回滚规则或再下发新的缓存指令。
6. 使用地理分布的curl或synthetic监测点检查生效:curl -H "Host: example.com" https://
7. 关键指标:95/99百分位响应时间(建议95p<200ms),缓存命中率(>85%),带宽使用率,错误率(4xx/5xx<0.5%),origin响应时间。设置Grafana告警阈值并定义抖动窗。
8. 常用命令:ping、traceroute/mtr排查网络;dig/nslookup检查DNS;curl -w '%{time_total}' 测量端到端延时;tcptraceroute或telnet看源站连通性;若异常,先切换流量到备用源并发起故障工单。
9. 汇总边缘访问日志与s3/ELK的日志,重点查找purge事件、客户端IP分布、请求峰值、4xx/5xx聚集时间。执行脚本统计最近24小时的cache-hit率并生成日报。
10. 配置Prometheus抓取边缘暴露的metrics(cache_hit, cache_miss, origin_latency),配置Alertmanager发送钉钉/邮件;示例规则:cache_miss_rate > 20% 持续5分钟触发。
11. 每月演练一次全链路purge(先在测试域),记录发起-生效时间;变更必须走CI/CD与变更单,变更前后对比命中率与延时。出问题按回滚流程低风险回退。
12. 保留上游源站快照与配置版本,当边缘异常时:1) 切换DNS到备用CDN或直连源;2) 临时下发长TTL或临时cache-control;3) 通知相关团队并开始根因定位。
13. 答:通过API获取task_id后,在多区域监测点用curl检查x-cache(应从HIT变为MISS且随后回源),并查看边缘purge日志时间戳,确保每个POP都记录了该task_id。
14. 答:先检查最近配置变更(cache-key、cookie白名单、query参数);使用日志按URI聚合查看命中/未命中比;确认origin是否返回Cache-Control或Set-Cookie导致绕过缓存。
15. 答:先判断是否为静态峰值流量(并发)或源站延时;查看95/99延时指标和origin_latency,若是origin问题,临时切流或加速回源;若是网络问题,展开traceroute并通知网络厂商。
