wuyoscar/jev-skill 社区用法评审:对本地 Jev 用法的借鉴清单
- HTML: https://decision.ht1072.top/2026-09-20-jev-community-usage-review-2026-09-20.html
- Local HTML:
[已移除本地路径] - Generated: 2026-09-20T19:19:54+08:00
wuyoscar/jev-skill 社区用法评审:对本地 Jev 用法的借鉴清单
结论
值得借鉴,但借鉴的是用法模式与纪律条款,不是它的包本身。 它最对本地胃口的是三件事:批量请求形态(单 state + 多独立问题,实测 Vercel 已支持)、 agent 自监督 checkpoint 的配方结构、以及校准与阈值纪律(附带一条重要负面结果)。 不吸:整包安装、通用阈值神话、固定间隔调用。 建议按 L1 参考吸收处理,不动主链、不换通道,把 P0 三项作为可选动作待确认后执行。
推荐方案
优先落地三项小步验证:批量请求替代逐对串行、checkpoint 配方先影子、校准协议升级(0923 汇总复用)。 其余按 P1 设计、P2 观察处理,不并行展开。
项目定位:它是什么,不是什么
wuyoscar/jev-skill 是面向 agent 的 Jev 决策工具箱:1 个通用 skill + 8 个专项 skill(triage、route、code-review、context、documents、find-code、simulation、ui)+ CLI + 一整套 evals/assets。它把 Jev 当"结构化判断层"用(boolean / choice / score),强调 recipes 是灵感不是菜单,56 个配方只取所需。
与我们当前接入的关系是互补而非替代:我们做的是生产 pipeline 侧(Vercel 网关 /v1/evaluate、jev_client 底座、降级链、影子期、审计落 run log);它做的是 agent 交互侧(checkpoint 注入、批量形态、校准方法)。通道不同(他们 OpenRouter alpha/decisions + typesafe/jev-1.13;我们 Vercel + typesafe-ai/jev),同模型两通道可视为未来冗余选项,但当前无更换必要。
本地现状对照
| 维度 | 本地当前 | 该 repo 的做法 | 差距 |
|---|---|---|---|
| 调用形态 | 全部逐条/逐对串行(去重 7 对、retain 40 条等) | 单 state + 多独立问题批量,每问显式 scope 记录 ID | 形态差距最大 |
| 场景 | 5 个生产场景(去重、噪音复核、翻译 QA、wiki 分诊、retain 预筛影子)+ 0923 到期汇总 | 8 专项 skill + 28 条 agent checkpoint 配方 | 我们尚未用 checkpoint 类 |
| 阈值 | 环境变量可调,三分法;不可逆动作高门槛 | 明确"任务专用 operating point",禁止通用 0.9 神话 | 理念一致,纪律可补强 |
| 校准 | 0923 到期汇总待做,分布统计已有 | 冻结数据集 + Brier/NLL/ECE + Wilson + coverage/selective risk + label audit | 协议可复用 |
| 逃生 | boolean/score 已按概率三分;choice 未广泛使用 | 未来 choice 强制含 unknown/insufficient_evidence/ask_user | 待补 |
| 通道 | Vercel | OpenRouter(另有 Vercel) | 冗余可选,P2 |
可借鉴清单
P0:小改动、可直接验证
1. 批量请求替代逐对/逐条串行(影响面最大)
把 dedup、retain 预筛、重要度扫描、噪音复核改成「一个 state + 多问题单请求」,每个问题用显式记录 ID 显式 scope(参考句式:Evaluate only state.records.ticket_104 ... use state.policy, not facts from another record)。本轮已实测 Vercel 网关支持多问题单请求:同一次请求送出 boolean + choice 两个问题,分别独立作答(probability 0.95 / choice auto_dedup 0.98),成本约 $0.00002。
适用对象:去重(~7 对)、retain 预筛(40 条)、噪音复核、重要度扫描。 落地前需在同一 ground truth 上做回归对比,防范跨记录污染;分组设上限(参考 40 条上限保护)。 收益不是延迟魔法,是调用点数与失败域的减少 + wall time 压缩(40 条串行 ~20-40s → 单请求级)。
2. agent 自监督 checkpoint 配方(我们先影子,不自动执行)
repo 的 28 条 agent 配方中最贴合我们已痛点的三条: - A06 completion evidence check:逐验收标准判"证据是否支持该标准",可用于子代理回执预筛与完成声明预检。 - A07 unsupported success language:判"宣告的成功是否被 ledger 支撑"。 - A02 stuck-loop recovery:choice(inspect_error / change_hypothesis / verify_fix / escalate)。 另有 A14 子代理回执准入(只唤醒相关紧急材料)。
关键约束(来自他们自己的 pilot):固定间隔注入 advice 会有害——baseline 12/12 完成 vs Jev 辅助臂 10/12,且成本与延迟更高。所以只在"有意义歧义点"使用、先影子/配对试验、度量 false interruption 与 total cost,不准入任何自动动作。
3. 请求/响应纪律补齐(写进 client 与 reference)
- 未来 choice 场景强制含逃生标签(unknown / insufficient_evidence / ask_user),命中即转人;"selection is not permission"。
- state 中 policy/criteria 与 untrusted 内容显式分离;提问传证据而非"请同意"。
- 响应校验(概率范围、label 覆盖、有限性)防脏数据静默入库。
- 沿用已有纪律:provider confidence ≠ 正确率;noul 低概率是 strong no 而非不确定;不在 primitives 之间搬阈值。
P1:先设计再动手
4. 校准协议升级(0923 汇总直接复用)
他们的口径:冻结带标签数据集、不事后调阈;Brier / NLL / ECE + 可靠性分箱(计数、观察正确率、平均预测概率)+ Wilson 区间;coverage 与 selective risk 分开报;label audit 单独成文。 他们的实证对我们的含义:BBH 160 题 Jev 85%;confidence ≥0.9 带仍有 8 个错;任务依赖极强(causal judgment 55%);高概率箱整体过自信(均值 0.981 vs 观察 0.890)。→ 支撑"不可逆动作阈值宁高 + review 兜底",并明确跨场景不得搬校准。成本极低(他们 320 次调用合计约 $0.012)。
5. 注入筛查(A11 可疑工具输出) 与 批量并发登记 作为 batch 的补充(context 受限时用 bounded concurrency,stable IDs、按 ID 收集)。
P2:记入观察,不展开
OpenRouter 第二通道冗余(同模型双 route,故障切换用,需新 key 管理);版本 pin 与 resolved tag 记录(OpenRouter 可解析到 jev-1.13-20260917,Vercel 只回 alias,审计里记录 resolved tag 供漂移排查);高频场景 canonical request JSON 存证据目录便于校准复现。
不建议吸收
- 固定间隔 Jev 调用(他们 pilot 已证否)。
- 全量配方 / 8 专项 skill 包结构(我们单 client + reference 更贴合治理纪律)。
- "0.9 = 安全"之类的通用阈值暗示。
- 无 key 的模拟 fallback 流(我们有真实 key);但"API 错误 ≠ 同意"这条边界值得保留。
风险与边界
风险 1:批量形态改动影响面大
去重与 retain 预筛是生产链路,改请求形态须在同一 ground truth 上回归,确认无跨记录污染、无精度回退,再切换。
风险 2:checkpoint 配方可能引入噪音
他们自己的数据显示固定间隔 advice 反而降低完成率;任何 checkpoint 都先在影子/日志模式跑,度量 false interruption,不直接准入。
风险 3:校准外推
BBH 结果是英文公开题;我们的中文生产场景分布不同,任何阈值只在本场景有效,不得跨场景搬运。
证据与验证
- 批量多问题实测:本轮用真实 AI_GATEWAY_API_KEY 向
https://ai-gateway.vercel.sh/v1/evaluate发送单请求 2 个问题(boolean + choice),均独立作答成功,cost 约 $0.00002,resolved model 字段返回typesafe-ai/jev。key 只读不打印。 - 仓库一手材料:SKILL.md、agent-recipes.md(28 条配方)、question-design.md、calibration.md、implementation-patterns.md、CALIBRATION.md、CALIBRATION_RESULTS.md、SCENARIO_EXAMPLES.md、README.md 均已读取核对。
- 本地代码核对:
_semantic_decide_jev()确认为逐对串行单请求循环(for ... urllib),_jevi_review_noise_filter逐条串行;jev_client.decide_boolean/decide_score各处亦为逐条调用。
行动清单
- 待确认:P0-1 批量形态落到 jev_client(新增多问题原语),小范围回归后切换。
- 待确认:P0-2 checkpoint 配方作为 0923 后的影子试验项。
- 待确认:P0-3 纪律条款补进 client 文档与 reference。
- 待确认:0923 汇总按新校准协议补充可靠性分箱与 selective risk 指标。
- 待确认:本评审挂进既有 rollout list(#7 之后补"批量形态"一条)。