线上跑 OpenClaw 不加监控等于裸奔。分享我的 Prometheus + Grafana 监控方案。
OpenClaw 暴露的指标
v2.2 开始,OpenClaw 内置了 Prometheus 指标导出,默认端口 9090:
metrics:
enabled: true
port: 9090
主要指标:
openclaw_requests_total:请求计数openclaw_request_duration_seconds:请求延迟openclaw_token_usage_total:Token 消耗openclaw_active_sessions:活跃会话数openclaw_skill_invocations_total:Skill 调用次数
Prometheus 配置
scrape_configs:
- job_name: 'openclaw'
static_configs:
- targets: ['localhost:9090']
scrape_interval: 15s
告警规则
groups:
- name: openclaw
rules:
- alert: HighLatency
expr: histogram_quantile(0.99, openclaw_request_duration_seconds_bucket) > 10
for: 5m
labels:
severity: warning
- alert: TokenBudgetAlert
expr: increase(openclaw_token_usage_total[24h]) > 100000
labels:
severity: critical
Grafana Dashboard
做了个 Dashboard 包含:
- 请求 QPS 和延迟分布
- Token 消耗趋势(按模型分)
- 活跃用户数
- Skill 调用排行
- 错误率
有了监控之后,Token 超支、性能下降、服务异常都能第一时间发现。推荐所有线上环境都配上。