2026-09-23 · DECISION TRACE

Jev 影子期数据汇总(2026-09-23)

保留方案、指标、验证、复盘和治理判断,让结论能够追溯。

2026-09-23记录日期
其他记录类型
10章节数

Jev 影子期数据汇总(2026-09-23)

  • HTML: https://decision.ht1072.top/2026-09-23-jev-shadow-summary-2026-09-23.html
  • Local HTML: [已移除本地路径]
  • Generated: 2026-09-23T10:03:06+08:00

Jev 影子期数据汇总(近 3 天,自 2026-09-20 起)

用途:判断影子场景是否转正。数据源为按日累积的审计文件,未被后续运行覆盖。

结论速览

场景 模式 天数 样本量 关键信号
条目重要度 影子 4 73 条 若启用会降权 7 条(0.096)
翻译验收 生产 4 48 条 标记 7 条(低分 3 / 低置信 7)
retain 预筛 影子 3 120 条 确认重复 39 对(0.325)
语义去重 生产 4 47 对 自动去重 11 / 待审 9
搜索路由门控 新接入(提示层) 1 1 条 need_web 1.0 / 覆盖率 1.0
Wiki 积压语义排序 新接入 3 110 条 {'P0': 27, 'P1': 28, 'P2': 55}

累计成本:$0.003418

形态(form)分组

2026-09-21 起 Jev 支持「单 state 多问」批量形态。批量与串行的分数存在稳定系统偏移 (score 均值 -0.169、最大 1.13),两种形态的数据不能混入同一条校准曲线。 旧数据无 form 字段,按 serial 处理。

重要度:单一形态:serial

  • 形态:单一形态:serial
  • serial:n=73,均值 1.96,范围 0.02–3.57,低分 7(0.096)

翻译验收:单一形态:serial

  • 形态:单一形态:serial
  • serial:n=48,均值 1.8,范围 1.1–1.99,标记 7

retain 预筛:⚠ 形态混合(batch + serial)—— 两形态分数不可直接比较,须分组解读

  • 形态:⚠ 形态混合(batch + serial)—— 两形态分数不可直接比较,须分组解读
  • batch:重复候选 40 对,确认重复 22(0.55);价值评分 n=30 均值 1.66
  • serial:重复候选 17 对,确认重复 17(1.0);价值评分 n=13 均值 1.63

1. 条目重要度(影子)

  • 扫描 73 条,均值 1.96,中位数 2.04
  • 分数分布:{"0.0-0.8 可忽略": 7, "0.8-1.5 边缘": 16, "1.5-2.5 一般": 30, "2.5-3.5 值得关注": 19, "3.5-5 重要": 1}

若启用会降权的条目(按分数升序,请人工判断是否合理)

分数 来源 标题
0.02 少数派 觉来知打明钟未,忽听邻家叫佛声:佛国老挝行记
0.17 新浪财经 9月21日周末要闻:原油期货大幅走高 交易员关注中东供应风险与外交动向 特朗普称胡塞武装同意不与美交战
0.23 Dev.to 你不是冒名顶替者,只是起点不同而已
0.49 Lobsters 纯文本文件面临风险
0.52 Dev.to 我的 AI 代理不被允许决定任何事情
0.54 The Verge 特朗普进一步践踏言论自由,新增记者禁令
0.61 Lobsters Lambda MicroEgg

2. 翻译验收

  • 抽检 48 条,标记 7 条
  • 分数均值 1.8,最低 1.1
  • 标记原因:低分(内容错误)3 条 / 低置信(措辞存疑)7 条

标记样本

分数 置信 来源 译文
1.66 0.49 Follow Builders Guillermo Rauch:近期AI浪潮最酷之处在于每个人都对……充满热情。
1.39 0.08 Follow Builders Aaron Levie:个人代理是“构建某种代理……”的终极体现
1.57 0.36 MIT Tech Review 解决美国边境“虚拟墙”旁发现的4种失败问题的方法
1.36 0.05 Hacker News 注意力即你所拥有的一切
1.63 0.45 Follow Builders Peter Yang:我认为广告市场将迎来一次残酷的觉醒:如果很大一部分……
1.64 0.47 Follow Builders Guillermo Rauch:除了我们类型安全的 TypeSafe @aisdk API(明白了吗?),你现在还可以使
1.1 0.2 Lobsters 原生 Mac UI 就此终结

3. retain 预筛(影子,未拦截)

  • 扫描 120 条记忆,确认重复 39 对(比例 0.325)

重复样本(prob 为 Jev 校准概率):

prob Jaccard 形态 A B
0.95 0.333 serial 用户要求分析一篇关于Jev的文章,并希望发散Jev的用法,以扩展Jev的使用方式。 用户要求分析一篇关于Jev的文章,并希望发散Jev的用法
0.97 0.667 serial 用户希望查看GitHub上wuyoscar/jev-skill仓库中jev的用法,以借鉴到自己的jev用法中。 用户希望查看GitHub上wuyoscar/jev-skill仓库中jev的用法,以借鉴到自己的jev用法中。
0.98 0.8 serial 决策追踪存档已发布,wiki 路径 [已移除本地路径] 决策追踪存档已发布,wiki 路径 [已移除本地路径]
0.95 0.733 serial 推荐方案:优先落地三项小步验证(批量请求替代逐对串行、checkpoint 配方先影子、校准协议升级 0923 汇总复用 推荐方案:优先落地三项小步验证(批量请求替代逐对串行、checkpoint 配方先影子、校准协议升级 0923 汇总复用
0.98 1.0 serial 本地代码核对:semanticdecidejev() 确认为逐对串行单请求循环(for ... urllib),jevi 本地代码核对:semanticdecidejev() 确认为逐对串行单请求循环(for ... urllib),jevi
0.98 1.0 serial P0 项 3:请求/响应纪律补齐(写进 client 与 reference):未来 choice 场景强制含逃生标签( P0 项 3:请求/响应纪律补齐(写进 client 与 reference):未来 choice 场景强制含逃生标签(
0.98 1.0 serial 仓库一手材料已读取核对:SKILL.md、agent-recipes.md(28 条配方)、question-desig 仓库一手材料已读取核对:SKILL.md、agent-recipes.md(28 条配方)、question-desig
0.98 1.0 serial 批量多问题实测:用真实 AIGATEWAYAPIKEY 向 https://ai-gateway.vercel.sh/v 批量多问题实测:用真实 AIGATEWAYAPIKEY 向 https://ai-gateway.vercel.sh/v
0.95 0.5 batch 用户要求生成一个HTML文件,内容为SVG绘制的鹈鹕骑自行车的2D动画,且明确表示不需要测试。 When: 2026
0.84 0.643 batch 三个候选场景评估后只准入一个:retain 预筛(35 调用点,17.5s→1.23s,-42% 成本,默认开);去重( 三个候选场景评估后只准入一个:retain 预筛(35 调用点,17.5s→1.23s,-42% 成本,默认开);去重(
0.89 0.6 batch 自测 7 项全过(真实调用):绑定校验拒绝未绑定 ID、批量 vs 串行逐条偏移 ≤0.01、拆批 10→4 组、非法返 自测 7 项全过(真实调用):绑定校验拒绝未绑定 ID、批量 vs 串行逐条偏移 ≤0.01、拆批 10→4 组、非法返
0.91 0.75 batch 预筛 cron 无 env 覆盖,批量会生效;晨报 cron 只设 MORNING_BRIEF_MODE=send,重要 预筛 cron 无 env 覆盖,批量会生效;晨报 cron 只设 MORNING_BRIEF_MODE=send,重要

4. 语义去重(生产)

  • 处理 47 候选对
  • 动作分布:{"auto_dedup": 11, "keep_both": 27, "flag_review": 9}
  • 后端分布:{"?": 6, "jev": 41}(jev 为 Jev,llm 为兜底)

5. 搜索路由门控(2026-09-21 新接入,提示层)

  • 运行 1 次 / 1 条请求 / 1 天
  • 分档:{"need_web": 1}
  • need_web 占比 1.0|uncertain 占比 0.0
  • 覆盖率 1.0(降级 0 次)|均值延迟 488ms|成本 $0.000020
  • 用法边界:只用「是」分支做提示,「否」分支不硬拦截;降级时全部归 uncertain → 不产生误拦

6. Wiki 积压语义排序(2026-09-21 新接入)

  • 运行 3 次 / 候选合计 110 条 / 3 天
  • 分档合计:{"P0": 27, "P1": 28, "P2": 55}
  • 降级 0 次|成本 $0.002123
  • P0 常客:["stale::hermes-ops/concepts/hindsight-085-clone-upgrade-verify-2026-07-27.md", "stale::hermes-ops/concepts/hindsight-upstream-0.8.5-eval-and-target-reset-2026-07-27.md", "stale::hermes-ops/concepts/hindsight-version-governance-closeout-2026-07-27.md", "orphan::knowledge-ops/queries/jev-p0-rollout-effect-report-2026-09-20.md", "stale::hermes-ops/concepts/hermes-session-worker-reliability.md", "stale::hermes-ops/concepts/hermes-official-docs-mirror.md"]
  • 产出物:~/llm-wikis/_meta/wiki-backlog-priority.md(只读建议清单,不改页面、不发通知)

需要你判断的三个问题

  1. 条目重要度是否转正MORNING_BRIEF_JEVI_IMPORTANCE_ENFORCE=1)? - 看上面低分榜是否合理;若大量正常内容被误判 → 调低 JEVI_IMPORTANCE_DROP(当前 0.8)而非转正 - 若上面「形态分组」显示混合形态,低分榜阈值只对收集它的那种形态有效,转正前须按当前形态重新校准
  2. retain 预筛是否启用「仅重复拦截」? - 看重复样本是否真重复;价值评分主观性强,建议只拦重复不拦低价值 - 形态在 2026-09-21 由串行切为批量,比较当日前后数据时须注意口径
  3. 语义去重阈值是否调整? - 看待审(flag_review)条目有多少是真该删的;若多 → 下调 JEVI_HIGH(当前 0.85)

数据源路径

  • ~/.cache/hermes/morning-brief/history/importance-*.jsonl
  • ~/.cache/hermes/morning-brief/history/translate_qa-*.jsonl
  • ~/.hermes/logs/hindsight-retain-prescreen/history/prescreen-*.jsonl
  • ~/.hermes/logs/morning-brief/run-*.json(semantic_dedup 字段)