Jev 能力落地清单与替换上线
- HTML: https://decision.ht1072.top/2026-09-20-jev-rollout-list-2026-09-20.html
- Local HTML:
[已移除本地路径]
- Generated: 2026-09-20T14:54:50+08:00
Jev 能力落地清单(基于本机体系盘点,2026-09-20)
依据:本机 20 个 cron 任务、10+ 常驻脚本、晨报/知识/Hindsight/记忆治理四条主线全量盘点 + Jev 真实能力实测
Jev 特性约束:只做结构化决策(boolean/choice/score),不生成文本、不写代码、无推理链
单项成本:~$0.00002/次(0.042/MTok),延迟 0.4-0.8s(跨洋实测)
关键优势:校准概率可复现(同对 8 次极差 0.010,零翻转),低置信 case 自动暴露(实测翻译质量模糊 case 自动给出 conf=0.4)
已落地
P0:直接可做(现成钩子、高频、零重构)
2. 晨报噪音过滤增强(filter_noise_items)
- 现状:纯字符串规则(V2EX 推广 ≥2 命中、导购词 ≥2 命中)——误报漏报都靠规则调参
- Jev 角色:
boolean——"这是导购/促销/软文/无关推广内容吗",规则命中时二次确认,规则漏掉的语义变体兜底
- 价值:规则误杀恢复 + 漏网推广拦截;每条 ~0.5s
- 落点:fetcher.py
filter_noise_items 后追加语义复核(MORNING_BRIEF_NOISE_JEVI=1 开)
3. 晨报翻译质量验收(新增质量门)
- 现状:
auto_translate_sources 翻译后无验收——译错、漏译、术语错没人管
- Jev 角色:
score(错误/瑕疵/准确)——翻译后抽检(如全量或按比例)
- 实测:已用真实样张验证——格式正确、模糊 case 自动低置信(conf=0.4 暴露"星芒 vs 原文 Astra"这类争议译法)
- 价值:翻译质量从"没人管"到"自动分级:高置信放行、低置信标记"
- 落点:
auto_translate_sources 尾部
4. 早报条目重要度评分(配额取舍)
- 现状:各源固定条数上限(5/12/3 条)——来源权重写死,与内容质量无关
- Jev 角色:
score——"这条对技术读者重要吗"(1-5),跨源统一分数后取 TopN
- 价值:低质条目(缺 desc、标题党)自动降权,好内容不再被源配额埋没
- 注意:会改变晨报内容构成——建议先影子模式跑一周对比再切换
5. Wiki 治理告警分诊(llm-wikis-governance-alert)
- 现状:规则检测(断链/孤岛/陈页)→ verdict 直接决定是否发飞书告警——噪音全量推送
- Jev 角色:
choice(真问题/可忽略/需人工)+ score(紧急度)——每条告警过一遍分诊
- 价值:降低告警噪音(涛哥明确期望减少"告警后再手动介入");分诊结果可累积成治理信号
- 落点:governance-daily 产出后、alert cron 判 verdict 前
6. Hindsight retain 预筛(每小时跑的常驻链路)
- 现状:
hindsight-retain-daily 每小时执行,retain 全部候选条目
- Jev 角色:
boolean——"这条信息值得长期记忆吗"(工具噪音/临时状态/重复信息过滤)
- 价值:记忆库质量提升 + 省下游 LLM retain 成本;对应官方"universal verification"用例
- 注意:先影子模式比对,确认不丢真实价值信息再启用
P1:需小幅改造(中频、有明确收益)
7. 搜索结果相关性排序(search_router)
- 现状:搜索 worker 返回结果直接输出,质量靠 worker 自己
- Jev 角色:
score——每条结果相关性打分,TopN 截断
- 价值:搜索结果质量提升、去掉噪音条目
8. 深度调研证据筛选(hermes-deep-research 流程)
- 现状:调研证据收集后靠 LLM 通读筛选
- Jev 角色:
boolean——"这条证据支持/反驳主论点吗",每条独立判
- 价值:大材料量场景(HN 评论 502 条级别)先过滤再精读,省 LLM 成本
9. 摘要幻觉抽检
- 现状:
summarize_batch 生成的摘要无验收
- Jev 角色:
boolean——"摘要中的关键事实能在原文找到吗"
- 价值:晨报摘要可靠性从"赌"到"抽检验证"
10. delegate_task 结果验收辅助
- 现状:主 agent 人工读子代理报告判断是否达标
- Jev 角色:
boolean/score——"报告是否完成目标、是否含可验证证据"首轮机器预判
- 价值:对应官方"agent trace observability"用例;长任务验收加速
- 注意:仅辅助,不替代独立 review 纪律
11. 记忆治理候选评分(memory_governance_day_eval + l0-governance-candidate)
- 现状:L0 候选提取+评估已跑(每日/每月),评估口径主要为规则+LLM
- Jev 角色:
choice(该进 USER.md/MEMORY.md/丢弃)+ score(重要度)——候选三分类
- 价值:治理判断标准化、可审计;恰与既有"L0 高水位治理"流程同构
12. 健康报告异常分诊(daily_health_report)
- 现状:阈值规则判断(未挂载=error 等),异常直接进 08:30 简表
- Jev 角色:
choice(真异常/抖动/可忽略)——对模糊异常做二次分诊
- 价值:减少"狼来了"(如版本检查失败的持续低危告警——记忆里有"达到更高阈值再处理"的诉求)
P2:探索型(有价值但要先设计)
13. 内容发布质量门(decision trace / 早报 HTML / wiki 入库)
- Jev 角色:
boolean——发布前检查"是否符合该形态的硬要求"(标题/结构/链接完整性)
- 注意:对外发布是高影响动作——Jev 只做预检,不替代独立 review 门禁
14. cron 审计失败分类(cron-audit-monthly)
- Jev 角色:
choice——失败原因归类(配置/网络/模型/脚本 bug)
- 价值:月度审计从"列失败"到"按因归类"
15. 会话归档分类(session-librarian)
- Jev 角色:
choice——会话主题归类 + boolean——"是否值得归档保留"
16. 内容源筛选(Bilibili pipeline / Follow Builders)
- Jev 角色:
score——素材相关性/价值分——对应现状 _tweet_score 启发式
- 价值:源池筛选精细化
17. Agent 轨迹观测(对应官方 evals 的 "Agent Trace Observability")
- Jev 角色:
choice——"这段 agent 轨迹需要人工看吗、多急"
- 场景:长任务/子代理/桌面断联排查的辅助分诊
通用原则(从本次落地提炼)
- 影子优先:改变内容构成的场景(#4/#6/#12)先影子模式跑一周,比对无回归再切换
- 降级链必有:Jev 失败 → 降级路径(LLM 兜底或退回原规则)——去重场景已实证
- 低置信转人工:Jev conf < 阈值时不猜、标记——这正是它相对 LLM 自报置信度的核心优势
- 不可逆动作高门槛:删除/发布类动作阈值 ≥0.85;只读/打分类可放宽
- 审计必留:每个决策记录(input/prob/action/reason)落 run log,供周级校准
- 成本不是约束:$0.00002/次,即使全量跑也只有分币级——约束是正确性设计,不是预算
优先级判断依据