Jev 影子期数据汇总(2026-09-23)
- HTML: https://decision.ht1072.top/2026-09-23-jev-shadow-summary-2026-09-23.html
- Local HTML:
[已移除本地路径] - Generated: 2026-09-23T10:03:06+08:00
Jev 影子期数据汇总(近 3 天,自 2026-09-20 起)
用途:判断影子场景是否转正。数据源为按日累积的审计文件,未被后续运行覆盖。
结论速览
| 场景 | 模式 | 天数 | 样本量 | 关键信号 |
|---|---|---|---|---|
| 条目重要度 | 影子 | 4 | 73 条 | 若启用会降权 7 条(0.096) |
| 翻译验收 | 生产 | 4 | 48 条 | 标记 7 条(低分 3 / 低置信 7) |
| retain 预筛 | 影子 | 3 | 120 条 | 确认重复 39 对(0.325) |
| 语义去重 | 生产 | 4 | 47 对 | 自动去重 11 / 待审 9 |
| 搜索路由门控 | 新接入(提示层) | 1 | 1 条 | need_web 1.0 / 覆盖率 1.0 |
| Wiki 积压语义排序 | 新接入 | 3 | 110 条 | {'P0': 27, 'P1': 28, 'P2': 55} |
累计成本:$0.003418
形态(form)分组
2026-09-21 起 Jev 支持「单 state 多问」批量形态。批量与串行的分数存在稳定系统偏移 (score 均值 -0.169、最大 1.13),两种形态的数据不能混入同一条校准曲线。 旧数据无
form字段,按serial处理。
重要度:单一形态:serial
- 形态:单一形态:serial
serial:n=73,均值 1.96,范围 0.02–3.57,低分 7(0.096)
翻译验收:单一形态:serial
- 形态:单一形态:serial
serial:n=48,均值 1.8,范围 1.1–1.99,标记 7
retain 预筛:⚠ 形态混合(batch + serial)—— 两形态分数不可直接比较,须分组解读
- 形态:⚠ 形态混合(batch + serial)—— 两形态分数不可直接比较,须分组解读
batch:重复候选 40 对,确认重复 22(0.55);价值评分 n=30 均值 1.66serial:重复候选 17 对,确认重复 17(1.0);价值评分 n=13 均值 1.63
1. 条目重要度(影子)
- 扫描 73 条,均值 1.96,中位数 2.04
- 分数分布:{"0.0-0.8 可忽略": 7, "0.8-1.5 边缘": 16, "1.5-2.5 一般": 30, "2.5-3.5 值得关注": 19, "3.5-5 重要": 1}
若启用会降权的条目(按分数升序,请人工判断是否合理):
| 分数 | 来源 | 标题 |
|---|---|---|
| 0.02 | 少数派 | 觉来知打明钟未,忽听邻家叫佛声:佛国老挝行记 |
| 0.17 | 新浪财经 | 9月21日周末要闻:原油期货大幅走高 交易员关注中东供应风险与外交动向 特朗普称胡塞武装同意不与美交战 |
| 0.23 | Dev.to | 你不是冒名顶替者,只是起点不同而已 |
| 0.49 | Lobsters | 纯文本文件面临风险 |
| 0.52 | Dev.to | 我的 AI 代理不被允许决定任何事情 |
| 0.54 | The Verge | 特朗普进一步践踏言论自由,新增记者禁令 |
| 0.61 | Lobsters | Lambda MicroEgg |
2. 翻译验收
- 抽检 48 条,标记 7 条
- 分数均值 1.8,最低 1.1
- 标记原因:低分(内容错误)3 条 / 低置信(措辞存疑)7 条
标记样本:
| 分数 | 置信 | 来源 | 译文 |
|---|---|---|---|
| 1.66 | 0.49 | Follow Builders | Guillermo Rauch:近期AI浪潮最酷之处在于每个人都对……充满热情。 |
| 1.39 | 0.08 | Follow Builders | Aaron Levie:个人代理是“构建某种代理……”的终极体现 |
| 1.57 | 0.36 | MIT Tech Review | 解决美国边境“虚拟墙”旁发现的4种失败问题的方法 |
| 1.36 | 0.05 | Hacker News | 注意力即你所拥有的一切 |
| 1.63 | 0.45 | Follow Builders | Peter Yang:我认为广告市场将迎来一次残酷的觉醒:如果很大一部分…… |
| 1.64 | 0.47 | Follow Builders | Guillermo Rauch:除了我们类型安全的 TypeSafe @aisdk API(明白了吗?),你现在还可以使 |
| 1.1 | 0.2 | Lobsters | 原生 Mac UI 就此终结 |
3. retain 预筛(影子,未拦截)
- 扫描 120 条记忆,确认重复 39 对(比例 0.325)
重复样本(prob 为 Jev 校准概率):
| prob | Jaccard | 形态 | A | B |
|---|---|---|---|---|
| 0.95 | 0.333 | serial | 用户要求分析一篇关于Jev的文章,并希望发散Jev的用法,以扩展Jev的使用方式。 | 用户要求分析一篇关于Jev的文章,并希望发散Jev的用法 |
| 0.97 | 0.667 | serial | 用户希望查看GitHub上wuyoscar/jev-skill仓库中jev的用法,以借鉴到自己的jev用法中。 | 用户希望查看GitHub上wuyoscar/jev-skill仓库中jev的用法,以借鉴到自己的jev用法中。 |
| 0.98 | 0.8 | serial | 决策追踪存档已发布,wiki 路径 [已移除本地路径] | 决策追踪存档已发布,wiki 路径 [已移除本地路径] |
| 0.95 | 0.733 | serial | 推荐方案:优先落地三项小步验证(批量请求替代逐对串行、checkpoint 配方先影子、校准协议升级 0923 汇总复用 | 推荐方案:优先落地三项小步验证(批量请求替代逐对串行、checkpoint 配方先影子、校准协议升级 0923 汇总复用 |
| 0.98 | 1.0 | serial | 本地代码核对:semanticdecidejev() 确认为逐对串行单请求循环(for ... urllib),jevi | 本地代码核对:semanticdecidejev() 确认为逐对串行单请求循环(for ... urllib),jevi |
| 0.98 | 1.0 | serial | P0 项 3:请求/响应纪律补齐(写进 client 与 reference):未来 choice 场景强制含逃生标签( | P0 项 3:请求/响应纪律补齐(写进 client 与 reference):未来 choice 场景强制含逃生标签( |
| 0.98 | 1.0 | serial | 仓库一手材料已读取核对:SKILL.md、agent-recipes.md(28 条配方)、question-desig | 仓库一手材料已读取核对:SKILL.md、agent-recipes.md(28 条配方)、question-desig |
| 0.98 | 1.0 | serial | 批量多问题实测:用真实 AIGATEWAYAPIKEY 向 https://ai-gateway.vercel.sh/v | 批量多问题实测:用真实 AIGATEWAYAPIKEY 向 https://ai-gateway.vercel.sh/v |
| 0.95 | 0.5 | batch | 用户要求生成一个HTML文件,内容为SVG绘制的鹈鹕骑自行车的2D动画,且明确表示不需要测试。 | When: 2026 |
| 0.84 | 0.643 | batch | 三个候选场景评估后只准入一个:retain 预筛(35 调用点,17.5s→1.23s,-42% 成本,默认开);去重( | 三个候选场景评估后只准入一个:retain 预筛(35 调用点,17.5s→1.23s,-42% 成本,默认开);去重( |
| 0.89 | 0.6 | batch | 自测 7 项全过(真实调用):绑定校验拒绝未绑定 ID、批量 vs 串行逐条偏移 ≤0.01、拆批 10→4 组、非法返 | 自测 7 项全过(真实调用):绑定校验拒绝未绑定 ID、批量 vs 串行逐条偏移 ≤0.01、拆批 10→4 组、非法返 |
| 0.91 | 0.75 | batch | 预筛 cron 无 env 覆盖,批量会生效;晨报 cron 只设 MORNING_BRIEF_MODE=send,重要 | 预筛 cron 无 env 覆盖,批量会生效;晨报 cron 只设 MORNING_BRIEF_MODE=send,重要 |
4. 语义去重(生产)
- 处理 47 候选对
- 动作分布:{"auto_dedup": 11, "keep_both": 27, "flag_review": 9}
- 后端分布:{"?": 6, "jev": 41}(jev 为 Jev,llm 为兜底)
5. 搜索路由门控(2026-09-21 新接入,提示层)
- 运行 1 次 / 1 条请求 / 1 天
- 分档:{"need_web": 1}
- need_web 占比 1.0|uncertain 占比 0.0
- 覆盖率 1.0(降级 0 次)|均值延迟 488ms|成本 $0.000020
- 用法边界:只用「是」分支做提示,「否」分支不硬拦截;降级时全部归 uncertain → 不产生误拦
6. Wiki 积压语义排序(2026-09-21 新接入)
- 运行 3 次 / 候选合计 110 条 / 3 天
- 分档合计:{"P0": 27, "P1": 28, "P2": 55}
- 降级 0 次|成本 $0.002123
- P0 常客:["stale::hermes-ops/concepts/hindsight-085-clone-upgrade-verify-2026-07-27.md", "stale::hermes-ops/concepts/hindsight-upstream-0.8.5-eval-and-target-reset-2026-07-27.md", "stale::hermes-ops/concepts/hindsight-version-governance-closeout-2026-07-27.md", "orphan::knowledge-ops/queries/jev-p0-rollout-effect-report-2026-09-20.md", "stale::hermes-ops/concepts/hermes-session-worker-reliability.md", "stale::hermes-ops/concepts/hermes-official-docs-mirror.md"]
- 产出物:
~/llm-wikis/_meta/wiki-backlog-priority.md(只读建议清单,不改页面、不发通知)
需要你判断的三个问题
- 条目重要度是否转正(
MORNING_BRIEF_JEVI_IMPORTANCE_ENFORCE=1)? - 看上面低分榜是否合理;若大量正常内容被误判 → 调低JEVI_IMPORTANCE_DROP(当前 0.8)而非转正 - 若上面「形态分组」显示混合形态,低分榜阈值只对收集它的那种形态有效,转正前须按当前形态重新校准 - retain 预筛是否启用「仅重复拦截」? - 看重复样本是否真重复;价值评分主观性强,建议只拦重复不拦低价值 - 形态在 2026-09-21 由串行切为批量,比较当日前后数据时须注意口径
- 语义去重阈值是否调整?
- 看待审(flag_review)条目有多少是真该删的;若多 → 下调
JEVI_HIGH(当前 0.85)
数据源路径
~/.cache/hermes/morning-brief/history/importance-*.jsonl~/.cache/hermes/morning-brief/history/translate_qa-*.jsonl~/.hermes/logs/hindsight-retain-prescreen/history/prescreen-*.jsonl~/.hermes/logs/morning-brief/run-*.json(semantic_dedup 字段)