2026-09-21 · DECISION TRACE

Jev 在 Hermes 体系中的适配环节评估

保留方案、指标、验证、复盘和治理判断,让结论能够追溯。

2026-09-21记录日期
评测记录记录类型
8章节数

Jev 在 Hermes 体系中的适配环节评估(基于全部实测)

2026-09-21|评估人:小墨 证据:本轮上下文剪枝全套实测(6 会话×2 模式 + 628 条抽检)+ 已上线三处生产接入 + 批量形态对照 + 稳定性/降级实验

结论

Jev 最适合落在控制层的「可逆判定」:去重、分诊、打分排序、预筛门禁。 最不适合的是不可逆的内容取舍(如上下文删除)。

本轮最大的收获不是「能不能用」,而是用在哪类问题上它才可靠。三条判据必须同时满足:

  1. 动作可逆 —— 判错能回退(标记 ≠ 删除,排序 ≠ 裁剪)
  2. 判据可核对 —— 有 ground truth 能事后验真(如 7 对人工裁定的重复判定)
  3. 问法是判别式 —— 比较/分档,而不是绝对式「还需要吗」

上下文剪枝三条全不满足(不可逆 + 判据无法自证 + 绝对式问法退化),所以判 NO-GO。 反之,已上线三处三条全满足,所以稳定运行。

一、路由矩阵(按体系环节)

环节 适配度 判断依据 现状
控制层·去重/相似判定 判据明确、动作可逆、有 ground truth ✅ 生产(晨报语义去重)
控制层·分诊/告警 二值/多档判定,动作是「是否打扰」 ✅ 已接(wiki 告警分诊)
控制层·重要度/价值打分 score 原语 + 分位排序 ✅ 影子期(重要度扫描)
记忆栈·retain 预筛 只标记不拦截,风险最低 ✅ 影子期(未拦截)
控制层·验收/质量抽检 中高 判定质量分,动作=标记 ✅ 已接(翻译 QA)
搜索层·意图分类/引擎选择 中高 choice 原语天然适配,选错可重搜 未接(路由决策现在靠读 42KB matrix + 主模型判断)
控制层·高影响动作前的粗筛 中高 预筛排序,动作=「要不要做」 未接(真实空缺)
执行层·agent 主循环主控 不生成文本;做主控会放大单点风险 ❌ 明确不接
上下文层·压缩/删除 不可逆 + 可重跑≠可恢复 + 判据无法自证 ❌ 本轮 NO-GO
出口层·内容生成 不适用 无文本生成能力 ❌ 不适用

二、已在生产验证的三处(不是推测)

落地 文件 形态
晨报语义去重 ~/.hermes/skills/productivity/morning-brief/scripts/fetcher.py Jev 优先 + LLM 兜底(backend=auto);坏 key 故障注入 7/7 转兜底
Wiki 告警分诊 ~/.hermes/scripts/wiki_alert_triage.py 是否打扰 + 紧急度
retain 预筛 ~/.hermes/scripts/hindsight_retain_prescreen.py 影子期,只标记不拦截

这三处的共性:判错的代价是「多看一眼」或「排序偏一位」,而不是「信息消失」。

三、最该补的两个空缺

  1. 搜索路由(路由决策现由 search-routing-matrix/SKILL.md 41,877 字节 + 主模型判断承担; search_router.py 本身是 search-worker 调用器,不含路由规则) - 把「读矩阵 + 主模型推理」的首跳路由换成一次 Jev choice;choice 原语天然适配。 - 为什么合适:选错可重搜(动作可逆)、有明确对照(命中质量)、成本极低。 - 边界:Jev 只做首跳,升级链(首搜无果→升级反爬)仍留给主模型(多跳推理是 Jev 公开短板)。
  2. 高影响动作前的可逆粗筛 - 在启动耗时/高成本流程(深度调研、大批量处理、发布前)之前,用 Jev 做优先级预筛: 「这批候选里哪些值得进下一步」。 - 为什么合适:动作是过滤输入而非裁剪产物,且分档由我们定(quantile),Jev 只提供排序。 - 这是当前体系真实空缺:现在这类判断要么靠规则,要么靠主模型逐条想。

四、明确不接

  • 上下文压缩 / 删除(本轮结论)
  • agent 主循环主控 / 任何唯一门控的高风险动作
  • 需要生成、解释、长文本输出的位置

五、四条工程纪律(本轮实测得来,必须沿用)

  1. 问法必须判别式:绝对式「还需要吗」会触发强先验 → 退化为全删/全同 (实测:boolean 模式下 6/6 会话保留率 0.0%,~390 候选无一过阈)。
  2. state 形态决定可靠性:records 绑定(每题自包含 + 隔离句 + ID 绑定校验) ≫ 整段 state 多问(同一问法实测 0.09–1.03 vs 0.02–0.37)。
  3. 量表是任意的 → 用分位排序,别用绝对阈值:模型分值整体低于量表名义中点, 固定阈值必然退化。
  4. 降级链内建:实测存在 429/503,必须指数退避 + 整次放弃回退(绝不半途生效)。

六、一句话口径

Jev 是「可编程的模糊 if」——它是控制层的一把好尺子,不是一把能裁掉材料的刀。 用它做判断和排序,不要用它的判断去永久删除内容。

更正说明(2026-09-21)

本报告初版把搜索路由记作「search_router.py 137 行纯规则分发」——经读源码核实为误。 该脚本是 search-worker 调用器(build prompt → 调 worker → 归一化 packet),不含任何路由规则; 路由决策实际由 search-routing-matrix/SKILL.md(41,877 字节)配合主模型判断承担。 矩阵表与「最该补的空缺」两条已同步更正;结论方向不变,但收益点应表述为「省掉每次加载路由矩阵的开销」。