用 TypeSafe 的 Jev 模型做了个 oncall 告警分诊 POC
TypeSafe AI 最近发布了 Jev 模型,我拿了 early access,顺手做了个 POC:jev-oncall。思路很简单,每个告警只调一次 Jev,让它做四个判断:这条要不要人工处理、严重度、归属哪个 team、是不是重复告警。
几个设计点:
1. fail-open:Jev 挂了或者超时,直接走原有链路,不会因为加了 AI 就把告警链搞成单点。
2. 一次调用:每条告警只花一次推理成本,不搞多轮 agent。
3. 去重图:重复告警聚类,只 page 一次。
4. 基于分布的路由:按历史分布把告警分给最可能的 team,而不是写死规则。
实测结果(14 条 synthetic alerts,Jev v13):0 静默丢失、0 漏 page、0 误 page,总成本 $0.0004。
12 条里 Jev 也有 2 条 team 归属判错,owner confidence 是下一步要解决的问题。
Repo 在这,README 里有 dashboard 截图和完整复现步骤:https://github.com/mingleiw/jev-oncall
准备接着做成完善的工具 欢迎提意见 和一起做

几个设计点:
1. fail-open:Jev 挂了或者超时,直接走原有链路,不会因为加了 AI 就把告警链搞成单点。
2. 一次调用:每条告警只花一次推理成本,不搞多轮 agent。
3. 去重图:重复告警聚类,只 page 一次。
4. 基于分布的路由:按历史分布把告警分给最可能的 team,而不是写死规则。
实测结果(14 条 synthetic alerts,Jev v13):0 静默丢失、0 漏 page、0 误 page,总成本 $0.0004。
12 条里 Jev 也有 2 条 team 归属判错,owner confidence 是下一步要解决的问题。
Repo 在这,README 里有 dashboard 截图和完整复现步骤:https://github.com/mingleiw/jev-oncall
准备接着做成完善的工具 欢迎提意见 和一起做

已获得 1 大米
共4条回复
✨ 您正在体验新版论坛UI

