⚡ 平均调查耗时
—
来自事故档案 duration_ms
✓ 高置信解释率
—
置信度 ≥ 70%
▤ 事故总数
—
SQLite 归档
⚠ 需关注
—
置信度 < 70%
事件队列 · /api/incidents
全部
需关注
已解释
加载中…
主动巡检 V2
防火,不救火预测catalog-service 内存泄漏
增长斜率推算,约
~2.7 天后触及 limit 触发 OOM。建议排查或提前扩容。风险3 个 Pod 无资源 limit
ns/production 下存在无
memory limit 的 Pod,节点资源争抢风险。成本2 节点长期低载
CPU 7 日均值
<8%,可考虑合并降配。企业版集群健康 · agent 视角
production
1 P1 未处置
media
全部正常
staging
1 项巡检风险
为什么不是传统监控大盘? 这里没有一整墙要你盯的曲线图。指标只留了 4 个——而且是给决策者算 ROI 的(定位时间、独立解决率、省下的工时),不是给你值班盯的。日常真正的交互仍在飞书;这个 dashboard 是「总览 + 分诊 + 看值不值」的地方,优先级低于飞书和报告页,V1 可只做事件队列,度量与主动巡检放 V2。