2026-09-20 · DECISION TRACE

wuyoscar/jev-skill 社区用法评审:对本地 Jev 用法的借鉴清单

保留方案、指标、验证、复盘和治理判断,让结论能够追溯。

2026-09-20记录日期
其他记录类型
15章节数

wuyoscar/jev-skill 社区用法评审:对本地 Jev 用法的借鉴清单

  • HTML: https://decision.ht1072.top/2026-09-20-jev-community-usage-review-2026-09-20.html
  • Local HTML: [已移除本地路径]
  • Generated: 2026-09-20T19:19:54+08:00

wuyoscar/jev-skill 社区用法评审:对本地 Jev 用法的借鉴清单

结论

值得借鉴,但借鉴的是用法模式与纪律条款,不是它的包本身。 它最对本地胃口的是三件事:批量请求形态(单 state + 多独立问题,实测 Vercel 已支持)、 agent 自监督 checkpoint 的配方结构、以及校准与阈值纪律(附带一条重要负面结果)。 不吸:整包安装、通用阈值神话、固定间隔调用。 建议按 L1 参考吸收处理,不动主链、不换通道,把 P0 三项作为可选动作待确认后执行。

推荐方案

优先落地三项小步验证:批量请求替代逐对串行、checkpoint 配方先影子、校准协议升级(0923 汇总复用)。 其余按 P1 设计、P2 观察处理,不并行展开。

项目定位:它是什么,不是什么

wuyoscar/jev-skill 是面向 agent 的 Jev 决策工具箱:1 个通用 skill + 8 个专项 skill(triage、route、code-review、context、documents、find-code、simulation、ui)+ CLI + 一整套 evals/assets。它把 Jev 当"结构化判断层"用(boolean / choice / score),强调 recipes 是灵感不是菜单,56 个配方只取所需。

与我们当前接入的关系是互补而非替代:我们做的是生产 pipeline 侧(Vercel 网关 /v1/evaluate、jev_client 底座、降级链、影子期、审计落 run log);它做的是 agent 交互侧(checkpoint 注入、批量形态、校准方法)。通道不同(他们 OpenRouter alpha/decisions + typesafe/jev-1.13;我们 Vercel + typesafe-ai/jev),同模型两通道可视为未来冗余选项,但当前无更换必要。

本地现状对照

维度 本地当前 该 repo 的做法 差距
调用形态 全部逐条/逐对串行(去重 7 对、retain 40 条等) 单 state + 多独立问题批量,每问显式 scope 记录 ID 形态差距最大
场景 5 个生产场景(去重、噪音复核、翻译 QA、wiki 分诊、retain 预筛影子)+ 0923 到期汇总 8 专项 skill + 28 条 agent checkpoint 配方 我们尚未用 checkpoint 类
阈值 环境变量可调,三分法;不可逆动作高门槛 明确"任务专用 operating point",禁止通用 0.9 神话 理念一致,纪律可补强
校准 0923 到期汇总待做,分布统计已有 冻结数据集 + Brier/NLL/ECE + Wilson + coverage/selective risk + label audit 协议可复用
逃生 boolean/score 已按概率三分;choice 未广泛使用 未来 choice 强制含 unknown/insufficient_evidence/ask_user 待补
通道 Vercel OpenRouter(另有 Vercel) 冗余可选,P2

可借鉴清单

P0:小改动、可直接验证

1. 批量请求替代逐对/逐条串行(影响面最大)

把 dedup、retain 预筛、重要度扫描、噪音复核改成「一个 state + 多问题单请求」,每个问题用显式记录 ID 显式 scope(参考句式:Evaluate only state.records.ticket_104 ... use state.policy, not facts from another record)。本轮已实测 Vercel 网关支持多问题单请求:同一次请求送出 boolean + choice 两个问题,分别独立作答(probability 0.95 / choice auto_dedup 0.98),成本约 $0.00002。

适用对象:去重(~7 对)、retain 预筛(40 条)、噪音复核、重要度扫描。 落地前需在同一 ground truth 上做回归对比,防范跨记录污染;分组设上限(参考 40 条上限保护)。 收益不是延迟魔法,是调用点数与失败域的减少 + wall time 压缩(40 条串行 ~20-40s → 单请求级)。

2. agent 自监督 checkpoint 配方(我们先影子,不自动执行)

repo 的 28 条 agent 配方中最贴合我们已痛点的三条: - A06 completion evidence check:逐验收标准判"证据是否支持该标准",可用于子代理回执预筛与完成声明预检。 - A07 unsupported success language:判"宣告的成功是否被 ledger 支撑"。 - A02 stuck-loop recovery:choice(inspect_error / change_hypothesis / verify_fix / escalate)。 另有 A14 子代理回执准入(只唤醒相关紧急材料)。

关键约束(来自他们自己的 pilot):固定间隔注入 advice 会有害——baseline 12/12 完成 vs Jev 辅助臂 10/12,且成本与延迟更高。所以只在"有意义歧义点"使用、先影子/配对试验、度量 false interruption 与 total cost,不准入任何自动动作。

3. 请求/响应纪律补齐(写进 client 与 reference)

  • 未来 choice 场景强制含逃生标签(unknown / insufficient_evidence / ask_user),命中即转人;"selection is not permission"。
  • state 中 policy/criteria 与 untrusted 内容显式分离;提问传证据而非"请同意"。
  • 响应校验(概率范围、label 覆盖、有限性)防脏数据静默入库。
  • 沿用已有纪律:provider confidence ≠ 正确率;noul 低概率是 strong no 而非不确定;不在 primitives 之间搬阈值。

P1:先设计再动手

4. 校准协议升级(0923 汇总直接复用)

他们的口径:冻结带标签数据集、不事后调阈;Brier / NLL / ECE + 可靠性分箱(计数、观察正确率、平均预测概率)+ Wilson 区间;coverage 与 selective risk 分开报;label audit 单独成文。 他们的实证对我们的含义:BBH 160 题 Jev 85%;confidence ≥0.9 带仍有 8 个错;任务依赖极强(causal judgment 55%);高概率箱整体过自信(均值 0.981 vs 观察 0.890)。→ 支撑"不可逆动作阈值宁高 + review 兜底",并明确跨场景不得搬校准。成本极低(他们 320 次调用合计约 $0.012)。

5. 注入筛查(A11 可疑工具输出)批量并发登记 作为 batch 的补充(context 受限时用 bounded concurrency,stable IDs、按 ID 收集)。

P2:记入观察,不展开

OpenRouter 第二通道冗余(同模型双 route,故障切换用,需新 key 管理);版本 pin 与 resolved tag 记录(OpenRouter 可解析到 jev-1.13-20260917,Vercel 只回 alias,审计里记录 resolved tag 供漂移排查);高频场景 canonical request JSON 存证据目录便于校准复现。

不建议吸收

  • 固定间隔 Jev 调用(他们 pilot 已证否)。
  • 全量配方 / 8 专项 skill 包结构(我们单 client + reference 更贴合治理纪律)。
  • "0.9 = 安全"之类的通用阈值暗示。
  • 无 key 的模拟 fallback 流(我们有真实 key);但"API 错误 ≠ 同意"这条边界值得保留。

风险与边界

风险 1:批量形态改动影响面大

去重与 retain 预筛是生产链路,改请求形态须在同一 ground truth 上回归,确认无跨记录污染、无精度回退,再切换。

风险 2:checkpoint 配方可能引入噪音

他们自己的数据显示固定间隔 advice 反而降低完成率;任何 checkpoint 都先在影子/日志模式跑,度量 false interruption,不直接准入。

风险 3:校准外推

BBH 结果是英文公开题;我们的中文生产场景分布不同,任何阈值只在本场景有效,不得跨场景搬运。

证据与验证

  • 批量多问题实测:本轮用真实 AI_GATEWAY_API_KEY 向 https://ai-gateway.vercel.sh/v1/evaluate 发送单请求 2 个问题(boolean + choice),均独立作答成功,cost 约 $0.00002,resolved model 字段返回 typesafe-ai/jev。key 只读不打印。
  • 仓库一手材料:SKILL.md、agent-recipes.md(28 条配方)、question-design.md、calibration.md、implementation-patterns.md、CALIBRATION.md、CALIBRATION_RESULTS.md、SCENARIO_EXAMPLES.md、README.md 均已读取核对。
  • 本地代码核对_semantic_decide_jev() 确认为逐对串行单请求循环(for ... urllib),_jevi_review_noise_filter 逐条串行;jev_client.decide_boolean/decide_score 各处亦为逐条调用。

行动清单

  • 待确认:P0-1 批量形态落到 jev_client(新增多问题原语),小范围回归后切换。
  • 待确认:P0-2 checkpoint 配方作为 0923 后的影子试验项。
  • 待确认:P0-3 纪律条款补进 client 文档与 reference。
  • 待确认:0923 汇总按新校准协议补充可靠性分箱与 selective risk 指标。
  • 待确认:本评审挂进既有 rollout list(#7 之后补"批量形态"一条)。