2026-09-20 · DECISION TRACE

Jev 真实接入对比与稳定性验证

保留方案、指标、验证、复盘和治理判断,让结论能够追溯。

2026-09-20记录日期
决策记录记录类型
7章节数

Jev 真实接入对比与稳定性验证

  • HTML: https://decision.ht1072.top/2026-09-20-jev-real-integration-2026-09-20.html
  • Local HTML: [已移除本地路径]
  • Generated: 2026-09-20T14:39:36+08:00

Jev P0 吸收执行与验证记录(2026-09-20)

依据:~/llm-wikis/knowledge-ops/queries/jev-typesafe-absorption-eval-2026-09-20.md(评估结论:Watch + Sidecar Trial,P0 = 方法论吸收) 边界协议:references/boundary-controlled-partial-absorb-execution-2026-05-29.md

吸收了什么

落点
纪律一:原子决策分解 ~/.hermes/skills/integration/external-project-absorption-eval/references/system-one-decision-methodology-2026-09-20.md
纪律二:置信度三分法 同上
纪律三:阈值随风险缩放 同上
SKILL.md 入口 external-project-absorption-eval 新增「决策方法论类项目的最小吸收入口」段 + reference 索引

未吸收(边界留痕)

  • 未安装 typesafe-sdk、未申请 API key、未调用 api.typesafe.ai
  • 未引入 Jev runtime / 并行采样架构
  • 未改默认模型路由、未写全局配置
  • 未创建外部项目默认目录
  • P1(Vercel Gateway 旁路验证)、P2(生态跟踪)未动

真实验证:晨报去重 A/B/C 实验

场景:晨报 prefetch 缓存(69 条 / 15 源),跨源语义去重是现状真实缺口(URL/标题精确去重全为 0)。

实验设计(三组对照,模型 deepseek-v4.1-flash @ 本机 AxonHub):

设计 结果 耗时
A 基线 一次性 prompt 让 LLM 直接判"哪些重复" 6/7 正确,漏判 1 对(Thariq 同一功能宣布+补充),无 reason 72.6s
B 逐对原子 每对独立原子问题 + 确定度 + 三分法 7/7 正确,每条带可追溯 reason 66.7s
C 批量原子 一次调用 + 每对独立成节原子问题 + 确定度 7/7 正确,带 reason 81.3s

勘误(2026-09-20 21:40):初版记录误写 A 基线耗时 6.0s——那是首次运行因模型名写错快速报错的耗时,非有效测量。有效运行三组耗时均在 60–80s 同量级(AxonHub 串行 curl 单连接),延迟差异不构成决策依据。

结论

  1. 方法论收益真实:7/7 vs 6/7,且 A 组唯一的错判(漏判 Thariq 对)恰是"同一发布 + 补充说明"这种需要原子化"是否同一事件"才能抓到的类型。分解逻辑本身就是收益来源。
  2. 延迟三组同量级(60–80s,受本机串行 curl 限制):方法论升级不付延迟代价,收益纯粹来自准确率 + 可追溯性。B 慢是 7 次串行调用的网络开销,生产形态选 C(原子分解 + 单次打包)。
  3. ⚠️ 置信度自报偏乐观:C 组 7 个 confidence 值全部 ≥0.75(B 组另 7 个全部 ≥0.90),其中对[2](MIT Tech Review 同主题两篇)自报 0.75 却判对、对 Thariq 自报 0.95。LLM 自报置信度分布压缩在高位,不能直接当校准概率用——三分法的 FLOOR/HIGH 阈值必须按本域数据校准,不能照抄。这实测印证了 Jev 官方对 LLM 置信度的批评,也划清了「方法论可吸收、Jev 的校准概率本身才是 vendor 差异化」的边界。
  4. 低成本候选筛选(Jaccard ≥0.20) 是必要前置:69 条 → 7 候选对,避免 O(n²) LLM 全量调用。阈值 0.20 时无漏检(人工核对 ground truth 确认)。

Ground truth 人工核对(7 对):对[0] HN/Lobsters 同一篇文章=真重复;对[1] 掘金同作者系列两篇不同文章;对[2] MIT 同主题两篇独立文章;对[3][6] GitHub 不同仓库;对[4] Gary Marcus 两篇不同文章;对[5] Thariq 同一功能宣布=真重复。

Evidence Card

  • Command / Check:python3 /tmp/p0_jev_ab/ab_real.py + ab_c.py(已归档 ~/llm-wikis/knowledge-ops/evidence/jev-p0-absorption-2026-09-20/
  • Exit Status:0(A/B/C 三组均完成)
  • Covered:三条纪律写入 canonical skill reference;SKILL.md 入口 patch;晨报去重真实数据 A/B/C 验证完成,B/C 优于 A
  • Not Covered:Jev SDK/API 真实调用(无 key);wiki 治理告警分诊场景未做(后续候选);置信度阈值长期校准曲线未建立(单次实验)
  • Residual Risk:LLM 自报置信度不可靠 → 三分法阈值需按域校准;单日数据样本小(7 对),需晨报连续运行积累
  • Confidence:高(方法论收益方向性结论明确;具体阈值数字为单日样本)

下一步建议

  1. 把 C 形态(原子分解 + 单次打包)接入晨报 fetcher.py 的去重环节,阈值先保守(FLOOR 0.50 / HIGH 0.85),跑一周积累校准数据
  2. 若校准数据显示自报置信度持续压缩在高位,考虑把 HIGH 提到 0.9+ 或改用「冲突检测」(A/B 判断不一致时转人)替代纯阈值
  3. wiki 治理告警分诊作为第二场景复制此模式

附:C 形态接入晨报 pipeline(同日完成)

用户确认走零凭证路线后,当日完成接入与真实验证。

改动~/.hermes/skills/productivity/morning-brief/scripts/fetcher.py,备份 fetcher.py.bak-20260920-semantic-dedup):

  • 新增 semantic_dedup_sources():Jaccard≥0.20 预筛 → 单次 LLM 调用处理全部候选对(C 形态)→ 三分法处置(FLOOR 0.50 / HIGH 0.85)→ 仅 auto_dedup 执行删除,其余仅记录
  • 挂载点:send 模式两条路径(缓存命中 / 重新抓取)均在 summarize/翻译前执行;prefetch 契约未动
  • 降级设计:候选对 >40 跳过本轮;LLM 失败退回精确去重;MORNING_BRIEF_SEMANTIC_DEDUP=0 可整体关闭
  • 审计:每对决策(action/confidence/jaccard/reason/kept/dropped)写入 run log(~/.hermes/logs/morning-brief/run-*.json

验证结果(真实 send 全链路,2026-09-20 14:20):

  • 语法编译通过;缓存路径与抓取路径均实跑成功
  • 77 条 → 6 候选对 → 3 条自动去重(HN/Lobsters 同文、Thariq 同发布+补充、MIT 通讯+其单篇),摘要/翻译/分类/产物格式全部正常,prefetch 缓存未污染
  • run log 审计完整落盘

⚠️ 边界案例(记入观察):MIT 对(The Download 通讯 vs 其单篇文章)在实验两轮判 keep_both、接入后两轮判 auto_dedup——同模型跨 run 判断翻转,且置信度都在 0.9+。这正是「LLM 自报置信度不稳定」的实证:去重这种不可逆动作,HIGH=0.85 可能仍偏低,连续跑一周校准数据后再定(候选措施:HIGH 提至 0.9+,或对同源同主题对强制 flag_review)。

Jev 真实接入准备(等 Vercel key,未执行):

  • ~/llm-wikis/knowledge-ops/evidence/jev-p0-absorption-2026-09-20/jev_ab_compare.py 已就绪:两条后端(Vercel AI Gateway typesafe-ai/jev evaluate 端点 / TypeSafe 原生 noul 原语),同 7 对 ground truth,跑完即出 deepseek B/C vs Jev 三组对照
  • 通路侦察结论:Vercel 网关元数据/价格一致($0.042/MTok、type=evaluation、32k ctx)、evaluate 端点格式验证为 boolean/choice/score(非原生 noul);Cloudflare Workers AI 目录 65 模型无 Jev,此路排除;TypeSafe 官方需 waitlist
  • key 到位后:export AI_GATEWAY_API_KEY=... && python3 jev_ab_compare.py vercel

附二:Jev 真实接入对比(2026-09-20 完成)

用户注册 Vercel 并提供 key 后,Jev 真实调用打通,同 7 对 ground truth 完成三方对照。

接入障碍与解法(真实踩坑):

  1. key 文件内容为 key:vck_...——复制时带上了 Vercel 控制台的 UI 前缀,需剥掉 key: 才是真 key
  2. 认证通过后仍被 customer_verification_required 拦下:Vercel AI Gateway 要求账号绑支付方式才解锁免费额度($5/月)
  3. 网关响应格式与官方 SDK 不同(关键):
原语 官方文档 Vercel 网关实测
boolean/noul noul: 0.95 {"type":"boolean","probability":0.57}无独立 confidence
choice choice/probabilities/confidence 同,但 criteria 接受对象或数组
score score/confidence criteria 必须传数组(传对象报 expected array, received object

三方对照结果

准确率 总耗时 成本
deepseek 逐对原子 (B) 7/7 66.7s 本地 AxonHub
deepseek 批量原子 (C) 7/7 81.3s 本地 AxonHub
Jev(真实调用) 6/7 3.7s(0.52s/对) $0.00014

关键发现

  1. 速度差 16 倍:Jev 0.52s/对 vs deepseek 端到端 9.5–11.6s/对。跨洋延迟下仍远快于 LLM 走本机网关。
  2. 准确率 Jev 反而低 1 分:唯一分歧在对[2](MIT Tech Review The Download 通讯 vs 其单篇文章)——Jev 判"同事件"prob=0.89,deepseek 两轮都判"不重复"。人工裁定:这是 newsletter 与其单篇内容,判重复更合理,即 Jev 在这题上更对;但该对的 ground truth 本身存在争议(candidate 与内嵌文章是否算重复,取决于晨报口径)。
  3. ⭐ 概率稳定性是本轮最有价值的发现:对[2]、对[5] 各跑 8 次,概率极差仅 0.010(0.88–0.89 / 0.93–0.94),判定 8/8 一致,零翻转。对照 deepseek 在 MIT 对上跨 run 直接翻转(实验 keep_both → 生产 auto_dedup),Jev 的"校准概率"在稳定性上名副其实——这不是营销话术,是可复现的工程属性。
  4. 置信度动态范围真实:Jev 概率分布 0.05–0.94(区分度充分),对照 LLM 自报全部压缩在 0.75+。

结论更新:本轮实测支持把评估结论从 Watch + Sidecar TrialSidecar(技术验证通过) 推进一层——Jev 的差异化不在"更快更便宜"(LLM 也能做对),而在概率可复现、可作为阈值门控的稳定信号。这正是不可逆动作(去重、分诊、放行)最需要的属性。

仍未做:未接入生产 pipeline(现有 LLM 版已跑通且 7/7,Jev 版需先解决对[2]口径分歧);未做 wiki 分诊场景;成本极低但依赖 Vercel 账号持续绑卡。

产物result_jev_vercel.json(7 对完整响应含 usage/cost)、jev_repeatability.py(稳定性实验)、jev_real_compare.py(可复跑对照)