1. 在菲律宾云知行服务器上确认操作系统(Ubuntu/CentOS)、公网/内网IP与时区(Asia/Manila)。更新系统:Ubuntu 上执行 sudo apt update && sudo apt upgrade -y。关闭不必要防火墙或开放端口:Prometheus(9090)、Grafana(3000)、node_exporter(9100)、Alertmanager(9093)。
2. 下载并运行 node_exporter:wget https://.../node_exporter.tar.gz;tar zxvf;sudo useradd -rs /bin/false nodeusr;创建 systemd 单元 /etc/systemd/system/node_exporter.service,ExecStart 指向二进制;systemctl daemon-reload && systemctl enable --now node_exporter。验证:curl http://localhost:9100/metrics。
3. 在监控端服务器安装 Prometheus,编辑 prometheus.yml,加入 scrape_configs:- job_name: 'philippines-servers' static_configs: - targets: ['10.x.x.x:9100','10.y.y.y:9100']。启动并验证:curl http://localhost:9090/targets,确保 targets 为 UP。
4. 安装 Grafana,登录默认 admin/admin 后修改密码。导入社区 node_exporter/系统监控仪表盘,或自建 Panel 显示 CPU、内存、磁盘、网络、loadavg。设置时区为 Asia/Manila(Server/Preferences)。
5. 安装 Alertmanager 并配置 receiver(email/Slack/DingTalk/短信)。在 Prometheus 中添加 rule_files,例如 phpiles_alerts.yml,示例规则:- alert: HighCPU expr: avg by (instance)(irate(node_cpu_seconds_total{mode!="idle"}[5m])) > 0.8 for: 5m labels: severity: critical annotations: summary: "CPU 使用过高 {{ $labels.instance }}"。重载 Prometheus:kill -HUP 或通过 API。
6. Alertmanager 配置 routes,设置 group_by、group_wait、group_interval、repeat_interval;添加 receivers 配置:email、webhook(用于接入 PagerDuty/企业微信/DingTalk)。在菲律宾环境注意:短信/电话通知需要选择支持当地运营商的供应商并校验时差。
7. 常见排查:若指标丢失,先检查 node_exporter 是否运行(systemctl status)、端口连通(telnet/ss)、防火墙规则(iptables/nft)。Prometheus targets 若为 DOWN,查看 Prometheus 日志(journalctl -u prometheus)及 network 路由。Grafana 面板数据异常,检查 datasource 设置与 Prometheus 查询语法。
8. 问:在云知行菲律宾版本上快速排查网络延迟导致的告警误报?
9. 答:先确认网络抖动窗口:使用 ping/traceroute 查看丢包与跳数;在 Prometheus 中加入 network packet/drop 与 latency 指标,设置告警的 for 值(例如 10m)减少瞬时抖动误报;把 Alertmanager 的 group_wait 与 repeat_interval 调整为更宽容的值。
10. 问:本地 agent 无法上报到 Prometheus 时怎么处理?
11. 答:依次检查 agent 进程、端口监听、SELinux/防火墙规则;在 Prometheus 服务器上执行 curl http://
12. 问:有哪些针对菲律宾节点的最佳实践建议?
13. 答:注意时区与本地运维班次、选择支持菲律宾短信/语音通知供应商、监控外网带宽与本地 ISP 抖动、定期同步镜像与备份到同区域以降低跨境延迟,并在告警策略中加入更长的聚合窗口以避免短时网络波动误触发。
