Jev P0 方法论吸收执行与验证(勘误版)
- HTML: https://decision.ht1072.top/2026-09-20-jev-p0-absorption-execution-2026-09-20-r2.html
- Local HTML:
[已移除本地路径] - Generated: 2026-09-20T14:00:34+08:00
Jev P0 吸收执行与验证记录(2026-09-20)
依据:
~/llm-wikis/knowledge-ops/queries/jev-typesafe-absorption-eval-2026-09-20.md(评估结论:Watch + Sidecar Trial,P0 = 方法论吸收) 边界协议:references/boundary-controlled-partial-absorb-execution-2026-05-29.md
吸收了什么
| 项 | 落点 |
|---|---|
| 纪律一:原子决策分解 | ~/.hermes/skills/integration/external-project-absorption-eval/references/system-one-decision-methodology-2026-09-20.md |
| 纪律二:置信度三分法 | 同上 |
| 纪律三:阈值随风险缩放 | 同上 |
| SKILL.md 入口 | external-project-absorption-eval 新增「决策方法论类项目的最小吸收入口」段 + reference 索引 |
未吸收(边界留痕)
- 未安装 typesafe-sdk、未申请 API key、未调用 api.typesafe.ai
- 未引入 Jev runtime / 并行采样架构
- 未改默认模型路由、未写全局配置
- 未创建外部项目默认目录
- P1(Vercel Gateway 旁路验证)、P2(生态跟踪)未动
真实验证:晨报去重 A/B/C 实验
场景:晨报 prefetch 缓存(69 条 / 15 源),跨源语义去重是现状真实缺口(URL/标题精确去重全为 0)。
实验设计(三组对照,模型 deepseek-v4.1-flash @ 本机 AxonHub):
| 组 | 设计 | 结果 | 耗时 |
|---|---|---|---|
| A 基线 | 一次性 prompt 让 LLM 直接判"哪些重复" | 6/7 正确,漏判 1 对(Thariq 同一功能宣布+补充),无 reason | 72.6s |
| B 逐对原子 | 每对独立原子问题 + 确定度 + 三分法 | 7/7 正确,每条带可追溯 reason | 66.7s |
| C 批量原子 | 一次调用 + 每对独立成节原子问题 + 确定度 | 7/7 正确,带 reason | 81.3s |
勘误(2026-09-20 21:40):初版记录误写 A 基线耗时 6.0s——那是首次运行因模型名写错快速报错的耗时,非有效测量。有效运行三组耗时均在 60–80s 同量级(AxonHub 串行 curl 单连接),延迟差异不构成决策依据。
结论:
- 方法论收益真实:7/7 vs 6/7,且 A 组唯一的错判(漏判 Thariq 对)恰是"同一发布 + 补充说明"这种需要原子化"是否同一事件"才能抓到的类型。分解逻辑本身就是收益来源。
- 延迟三组同量级(60–80s,受本机串行 curl 限制):方法论升级不付延迟代价,收益纯粹来自准确率 + 可追溯性。B 慢是 7 次串行调用的网络开销,生产形态选 C(原子分解 + 单次打包)。
- ⚠️ 置信度自报偏乐观:C 组 7 个 confidence 值全部 ≥0.75(B 组另 7 个全部 ≥0.90),其中对[2](MIT Tech Review 同主题两篇)自报 0.75 却判对、对 Thariq 自报 0.95。LLM 自报置信度分布压缩在高位,不能直接当校准概率用——三分法的 FLOOR/HIGH 阈值必须按本域数据校准,不能照抄。这实测印证了 Jev 官方对 LLM 置信度的批评,也划清了「方法论可吸收、Jev 的校准概率本身才是 vendor 差异化」的边界。
- 低成本候选筛选(Jaccard ≥0.20) 是必要前置:69 条 → 7 候选对,避免 O(n²) LLM 全量调用。阈值 0.20 时无漏检(人工核对 ground truth 确认)。
Ground truth 人工核对(7 对):对[0] HN/Lobsters 同一篇文章=真重复;对[1] 掘金同作者系列两篇不同文章;对[2] MIT 同主题两篇独立文章;对[3][6] GitHub 不同仓库;对[4] Gary Marcus 两篇不同文章;对[5] Thariq 同一功能宣布=真重复。
Evidence Card
- Command / Check:
python3 /tmp/p0_jev_ab/ab_real.py+ab_c.py(已归档~/llm-wikis/knowledge-ops/evidence/jev-p0-absorption-2026-09-20/) - Exit Status:0(A/B/C 三组均完成)
- Covered:三条纪律写入 canonical skill reference;SKILL.md 入口 patch;晨报去重真实数据 A/B/C 验证完成,B/C 优于 A
- Not Covered:Jev SDK/API 真实调用(无 key);wiki 治理告警分诊场景未做(后续候选);置信度阈值长期校准曲线未建立(单次实验)
- Residual Risk:LLM 自报置信度不可靠 → 三分法阈值需按域校准;单日数据样本小(7 对),需晨报连续运行积累
- Confidence:高(方法论收益方向性结论明确;具体阈值数字为单日样本)
下一步建议
- 把 C 形态(原子分解 + 单次打包)接入晨报 fetcher.py 的去重环节,阈值先保守(FLOOR 0.50 / HIGH 0.85),跑一周积累校准数据
- 若校准数据显示自报置信度持续压缩在高位,考虑把 HIGH 提到 0.9+ 或改用「冲突检测」(A/B 判断不一致时转人)替代纯阈值
- wiki 治理告警分诊作为第二场景复制此模式