2026-09-20 · DECISION TRACE

Jev 能力落地清单与替换上线

保留方案、指标、验证、复盘和治理判断,让结论能够追溯。

2026-09-20记录日期
决策记录记录类型
22章节数

Jev 能力落地清单与替换上线

  • HTML: https://decision.ht1072.top/2026-09-20-jev-rollout-list-2026-09-20.html
  • Local HTML: [已移除本地路径]
  • Generated: 2026-09-20T14:54:50+08:00

Jev 能力落地清单(基于本机体系盘点,2026-09-20)

依据:本机 20 个 cron 任务、10+ 常驻脚本、晨报/知识/Hindsight/记忆治理四条主线全量盘点 + Jev 真实能力实测 Jev 特性约束:只做结构化决策(boolean/choice/score),不生成文本、不写代码、无推理链 单项成本:~$0.00002/次(0.042/MTok),延迟 0.4-0.8s(跨洋实测) 关键优势:校准概率可复现(同对 8 次极差 0.010,零翻转),低置信 case 自动暴露(实测翻译质量模糊 case 自动给出 conf=0.4)


已落地

# 场景 状态
✅ 1 晨报跨源语义去重 已接入生产(Jev 优先 + LLM 兜底 + 故障降级全验证)

P0:直接可做(现成钩子、高频、零重构)

2. 晨报噪音过滤增强(filter_noise_items

  • 现状:纯字符串规则(V2EX 推广 ≥2 命中、导购词 ≥2 命中)——误报漏报都靠规则调参
  • Jev 角色boolean——"这是导购/促销/软文/无关推广内容吗",规则命中时二次确认,规则漏掉的语义变体兜底
  • 价值:规则误杀恢复 + 漏网推广拦截;每条 ~0.5s
  • 落点:fetcher.py filter_noise_items 后追加语义复核(MORNING_BRIEF_NOISE_JEVI=1 开)

3. 晨报翻译质量验收(新增质量门)

  • 现状auto_translate_sources 翻译后无验收——译错、漏译、术语错没人管
  • Jev 角色score(错误/瑕疵/准确)——翻译后抽检(如全量或按比例)
  • 实测:已用真实样张验证——格式正确、模糊 case 自动低置信(conf=0.4 暴露"星芒 vs 原文 Astra"这类争议译法)
  • 价值:翻译质量从"没人管"到"自动分级:高置信放行、低置信标记"
  • 落点auto_translate_sources 尾部

4. 早报条目重要度评分(配额取舍)

  • 现状:各源固定条数上限(5/12/3 条)——来源权重写死,与内容质量无关
  • Jev 角色score——"这条对技术读者重要吗"(1-5),跨源统一分数后取 TopN
  • 价值:低质条目(缺 desc、标题党)自动降权,好内容不再被源配额埋没
  • 注意:会改变晨报内容构成——建议先影子模式跑一周对比再切换

5. Wiki 治理告警分诊(llm-wikis-governance-alert

  • 现状:规则检测(断链/孤岛/陈页)→ verdict 直接决定是否发飞书告警——噪音全量推送
  • Jev 角色choice(真问题/可忽略/需人工)+ score(紧急度)——每条告警过一遍分诊
  • 价值:降低告警噪音(涛哥明确期望减少"告警后再手动介入");分诊结果可累积成治理信号
  • 落点:governance-daily 产出后、alert cron 判 verdict 前

6. Hindsight retain 预筛(每小时跑的常驻链路)

  • 现状hindsight-retain-daily 每小时执行,retain 全部候选条目
  • Jev 角色boolean——"这条信息值得长期记忆吗"(工具噪音/临时状态/重复信息过滤)
  • 价值:记忆库质量提升 + 省下游 LLM retain 成本;对应官方"universal verification"用例
  • 注意:先影子模式比对,确认不丢真实价值信息再启用

P1:需小幅改造(中频、有明确收益)

7. 搜索结果相关性排序(search_router

  • 现状:搜索 worker 返回结果直接输出,质量靠 worker 自己
  • Jev 角色score——每条结果相关性打分,TopN 截断
  • 价值:搜索结果质量提升、去掉噪音条目

8. 深度调研证据筛选(hermes-deep-research 流程)

  • 现状:调研证据收集后靠 LLM 通读筛选
  • Jev 角色boolean——"这条证据支持/反驳主论点吗",每条独立判
  • 价值:大材料量场景(HN 评论 502 条级别)先过滤再精读,省 LLM 成本

9. 摘要幻觉抽检

  • 现状summarize_batch 生成的摘要无验收
  • Jev 角色boolean——"摘要中的关键事实能在原文找到吗"
  • 价值:晨报摘要可靠性从"赌"到"抽检验证"

10. delegate_task 结果验收辅助

  • 现状:主 agent 人工读子代理报告判断是否达标
  • Jev 角色boolean/score——"报告是否完成目标、是否含可验证证据"首轮机器预判
  • 价值:对应官方"agent trace observability"用例;长任务验收加速
  • 注意:仅辅助,不替代独立 review 纪律

11. 记忆治理候选评分(memory_governance_day_eval + l0-governance-candidate

  • 现状:L0 候选提取+评估已跑(每日/每月),评估口径主要为规则+LLM
  • Jev 角色choice(该进 USER.md/MEMORY.md/丢弃)+ score(重要度)——候选三分类
  • 价值:治理判断标准化、可审计;恰与既有"L0 高水位治理"流程同构

12. 健康报告异常分诊(daily_health_report

  • 现状:阈值规则判断(未挂载=error 等),异常直接进 08:30 简表
  • Jev 角色choice(真异常/抖动/可忽略)——对模糊异常做二次分诊
  • 价值:减少"狼来了"(如版本检查失败的持续低危告警——记忆里有"达到更高阈值再处理"的诉求)

P2:探索型(有价值但要先设计)

13. 内容发布质量门(decision trace / 早报 HTML / wiki 入库)

  • Jev 角色boolean——发布前检查"是否符合该形态的硬要求"(标题/结构/链接完整性)
  • 注意:对外发布是高影响动作——Jev 只做预检,不替代独立 review 门禁

14. cron 审计失败分类(cron-audit-monthly

  • Jev 角色choice——失败原因归类(配置/网络/模型/脚本 bug)
  • 价值:月度审计从"列失败"到"按因归类"

15. 会话归档分类(session-librarian

  • Jev 角色choice——会话主题归类 + boolean——"是否值得归档保留"

16. 内容源筛选(Bilibili pipeline / Follow Builders)

  • Jev 角色score——素材相关性/价值分——对应现状 _tweet_score 启发式
  • 价值:源池筛选精细化

17. Agent 轨迹观测(对应官方 evals 的 "Agent Trace Observability")

  • Jev 角色choice——"这段 agent 轨迹需要人工看吗、多急"
  • 场景:长任务/子代理/桌面断联排查的辅助分诊

通用原则(从本次落地提炼)

  1. 影子优先:改变内容构成的场景(#4/#6/#12)先影子模式跑一周,比对无回归再切换
  2. 降级链必有:Jev 失败 → 降级路径(LLM 兜底或退回原规则)——去重场景已实证
  3. 低置信转人工:Jev conf < 阈值时不猜、标记——这正是它相对 LLM 自报置信度的核心优势
  4. 不可逆动作高门槛:删除/发布类动作阈值 ≥0.85;只读/打分类可放宽
  5. 审计必留:每个决策记录(input/prob/action/reason)落 run log,供周级校准
  6. 成本不是约束:$0.00002/次,即使全量跑也只有分币级——约束是正确性设计,不是预算

优先级判断依据

判据 权重
是否高频/常驻链路(价值随调用量放大)
是否已有现成钩子点(改造成本)
现状是否明显不可靠(规则漏报/无验收)
是否涉及不可逆动作(需更严设计)
与涛哥既有诉求的匹配度(降噪/自动化自循环/记忆治理)