Dashboard · 指挥台(已接真实事故库)

Agent Command Center

事件队列来自 SQLite 事故档案/api/incidents)。主动巡检 / ROI 细项仍是 V2 愿景;V1 先把「分诊 + 证据抽屉 + 反馈」跑通。静态演示见 交互原型

今日概览

production 集群 · 4 节点 · 37 服务
⚡ 平均调查耗时
来自事故档案 duration_ms
✓ 高置信解释率
置信度 ≥ 70%
▤ 事故总数
SQLite 归档
⚠ 需关注
置信度 < 70%

事件队列 · /api/incidents

全部 需关注 已解释
加载中…

主动巡检 V2

防火,不救火
预测catalog-service 内存泄漏
增长斜率推算,约 ~2.7 天后触及 limit 触发 OOM。建议排查或提前扩容。
风险3 个 Pod 无资源 limit
ns/production 下存在无 memory limit 的 Pod,节点资源争抢风险。
成本2 节点长期低载
CPU 7 日均值 <8%,可考虑合并降配。企业版

集群健康 · agent 视角

production
1 P1 未处置
需关注
media
全部正常
健康
staging
1 项巡检风险
留意
为什么不是传统监控大盘? 这里没有一整墙要你盯的曲线图。指标只留了 4 个——而且是给决策者算 ROI 的(定位时间、独立解决率、省下的工时),不是给你值班盯的。日常真正的交互仍在飞书;这个 dashboard 是「总览 + 分诊 + 看值不值」的地方,优先级低于飞书和报告页,V1 可只做事件队列,度量与主动巡检放 V2。