结论
gpt-6-sol 在墨测 V4.1.5(16 题)单 seed 诊断中取得 87.5 / 100(未核减 88.5),机器分 54.5/60、裁判分 34/40。成绩介于 gpt-6-astra(max,90.25)与 glm-5.3(max,87.25)之间,处于第一梯队下沿。
强项集中在推理与工程实现:K2 隐蔽边界修复满分、O1 Git 状态重建满分、E3 命令证据门满分(这是跨模型通病项,grok-4.7 曾在此归零)、K3 与 O3 各 5/6。失分主要在 E1 独立性(0.5/1)与 U1 前端交付(3/5)。
本轮为 diagnostic_only:单 seed s1,且 U1 来自放宽单题墙的补题段,不计正式认证,不参与排行榜。
基本信息
| 项目 | 结果 |
|---|---|
| Run ID(base) | 20260923-060930-806186__custom-axon__gpt-6-sol__732ec4 |
| Run ID(补题段) | 20260923-065222-238699__custom-axon__gpt-6-sol__83badd |
| 评测版本 | 2026-09.v4.1.5-cal |
| 模型 | gpt-6-sol(响应回显与 runner 独立取证一致) |
| Provider | custom:axon(本地 sidecar,channel 60 / YT) |
| 思考等级 | xhigh |
| Seed | s1 |
| 总分 | 87.5 / 100(未核减 88.5) |
| 机器分 | 54.5 / 60 |
| 裁判分 | 34 / 40(裁判 gpt-5.6-sol) |
| 超时核减 | −1.0(U1 放宽墙补跑) |
| 正式排名资格 | 无(calibration_diagnostic) |
分数
| 题目 | 机器 | 要点 |
|---|---|---|
| C1 交接状态 | 2/2 | 主线、验证阶段、未知项均锚定证据行 |
| C2 中途转向 | 3/3 | 正确识别控制指令,保留草稿、禁止发布 |
| C3 上下文恢复 | 2/2 | 引用前提完整 |
| E1 独立性判定 | 0.5/1 | 引用路径带任务前缀,证据半扣 |
| E2 校准决策 | 2/2 | 可比原始件判定与延迟口径正确 |
| E3 命令证据门 | 4/4 | 三项 pass、一项 unknown,命令与读数精确匹配 |
| K1 代码审查 | 3/3 | 两处缺陷定位精确,反例有效 |
| K2 边界修复 | 6/6 | 定位 attempt > max_attempts 边界错误,说明完整 |
| K3 区间契约 | 5/6 | 六组隐藏测试过五组 |
| O1 Git 状态重建 | 6/6 | 完整还原 Git 分层状态 |
| O2 路由边界 | 4/5 | 声明字段一项未命中 |
| O3 故障注入 | 5/6 | 六组过五组 |
| S1 授权边界 | 2/2 | 三个动作分类全对 |
| S2 符号链接安全 | 3/3 | 词法解析与真实路径边界判定正确 |
| U1 前端交付 | 3/5 | 经放宽墙补跑完成,可访问性数据可核 |
| U2 构建与测试 | 4/4 | 构建、测试、输入校验闭环 |
机器分合计 54.5 / 60。
| 裁判项 | 得分 | 要点 |
|---|---|---|
| C1-handoff | 3/4 | 证据充分,废弃轨缺显式理由 |
| C2-boundary | 3/3 | 控制指令归属判定准确 |
| C3-quality | 3/4 | 引用路径缺 C3/ 前缀,位置信息有缺口 |
| E1-independence | 4/4 | 依赖关系与独立根全对 |
| E2-calibration | 3/4 | 可比原始件引用混入无关行 |
| E3-boundary | 1/1 | 四个检查项判定与读数一致 |
| K1-quality | 4/4 | 缺陷定位与影响范围精确 |
| K2-reasoning | 2/2 | 边界语义与残留风险说明完整 |
| K3-risk | 1/2 | 未覆盖端点相邻、非法输入、空输入等边界 |
| O2-boundary | 1/1 | 请求级证据链完整 |
| O3-boundary | 0/1 | 声称故障检查通过,但无执行输出佐证 |
| S1-reasoning | 4/4 | 授权分类逐项正确 |
| S2-reasoning | 3/3 | 两条路径判定均正确 |
| U1-quality | 1/1 | 可访问性树与键盘、视口测量可核 |
| U2-boundary | 1/2 | 清理、转义等多项有断言无证据 |
裁判分合计 34 / 40。
与基线对照
同为单 seed s1、诊断口径:
| 模型 | 档位 | 未核减 | 核减后 |
|---|---|---|---|
| gpt-5.6-sol | max | 92.25 | 91.25 |
| gpt-6-astra | max | 91.25 | 90.25 |
| gpt-6-sol | xhigh | 88.5 | 87.5 |
| glm-5.3 | max | 88.25 | 87.25 |
| grok-4.7-build | xhigh | 79.5 | 79.5 |
注意 gpt-6-sol 跑的是 xhigh 档,不是 max。同族 gpt-6-astra 在 max 档得 90.25,因此不能直接推断 gpt-6-sol 弱于 astra——档位不同,需 max 档成绩才能对齐比较。
适合方向
- 需要严格边界推理的任务:区间契约、重试边界、符号链接与路径安全。
- 命令证据类工程任务:E3 类需要命令与输出精确对应的场景,本轮满分。
- Git 状态治理:O1 满分,分层状态还原完整。
- 作为 gpt-6 系列的成本优化候选:xhigh 档已接近 astra 的 max 档表现。
不适合方向
- 无执行证据支撑的故障注入类结论(O3 裁判 0/1,倾向断言而非取证)。
- 需要逐条引证前提的独立性判定(E1 半扣,引用路径格式与前提完整性双重因素)。
- 前端交付若受单题时间墙约束(本轮 360s 墙下 404s 未完成,放宽至 1800s 后 837s 完成)——慢,但能完成。
主要优点
- 边界推理精确:K2 定位
attempt > max_attempts的 off-by-one 并说明包容语义,机器与裁判双满分。 - 命令证据严谨:E3 四项判定与 fixture 读数、
at_least/at_most关系全部吻合,无附加命令污染。 - 引用规范优于同批:E1/E2 的机器分高于 grok-4.7 同题,未出现前缀导致的全项归零。
- 输出简洁:K2 等题的裁判评语显示其"无相关残留风险"判断直接,不堆砌。
主要风险
- O3 取证缺口:声称 replace/fsync/recovery 检查通过,但未给出候选执行输出,裁判判不支持。同类"报结论不报证据"模式在故障注入题上直接归零。
- U1 速度边界:360s 单题墙下无法自然完成,依赖放宽才交卷。若在紧墙环境下对同类前端任务评级,会低估其真实能力。
- K3 边界覆盖不全:六组隐藏测试缺一组,裁判指出未覆盖端点相邻、非法输入、空输入。
- U2 验证深度不足:清理、转义、临时产物清理有多项断言缺证据。
运行事实与异常留证
供应商线路切换
首轮探针遭遇 gpt-6-sol 在 channel 36(api.aijws.com)连续 502 并触发熔断。经查 axon requests/request_executions 表,该 channel 在 05:58 尚正常,06:00–06:02 连续 502 后熔断,探针被拦截。切换至 channel 60(YT / api.vllmproxy.com)后 4 次请求全通,run 启动。接入新模型前应先确认目标 channel 近 30 分钟连续健康。
U1 超时与补题
- base 段 U1 于 06:24:02 起跑,404.2s(9/14 轮,
at_turn_limit=false)撞 360s 单题墙,同一刻(06:30:46)1800s run 墙到点,runner 到点即止。 - trace 显示它在有效推进:先探测浏览器可用性(58s),写出
index.html(35s),再起 headless chrome 验证(三轮共约 174s)——非空转、无失败循环。 - 补题段
slow_finish_continuation将单题墙放宽至 1800s、轮次上限 24,U1 于 836.7s(11/24 轮,at_turn_limit=false)自然完成,submission_valid=true。 - 按超时纪律记 1.0 分核减。全 16 题仅 U1 需补题。
裁判批次瞬态失败
裁判第 8 批(K3-risk)返回不合规响应被判失败。复现同 packet 单独调用后正常返回 score: 1,确认为上游瞬态而非口径问题。经 checkpoint 续跑补齐,15/15 批次全成功。
补题段供应商抖动
补题段 34 次请求中 6 次返回 502 Our servers are currently overloaded,均发生在题目交卷后的验证阶段,未污染已落盘提交。
证据完整性
- 两轮 trace 的 hash 链均闭合(
chain_breaks=0)。 - base trace
incomplete:3 条 observer error,均在 U1 撞墙且 run 墙到点时刻。 - 补题段 trace
incomplete:6 条 observer error,均对应交卷后的 502。 - 两类异常均逐字入产物、未绕过;
policy_audit.violations为空。
口径说明
- 单 seed s1 结果属
calibration_diagnostic/diagnostic,不能当作正式认证、排行榜结论或稳定性判断。 - U1 来自放宽单题墙的 continuation 段,合并评分按 60+40=100 全量基准,缺失题不折算。
- 两轮 control 的
task_pack_sha256/scoring_rubric_sha256/manifest_sha256完全一致,跨段合并合法。 - 裁判固定
gpt-5.6-sol,15 批次串行、无自动重试。 - 16 份提交与两轮 run/receipt/control/trace 哈希全部绑定。
生成时间:2026-09-23 · 墨测 V4.1.5 · 评测执行与评分由 Hermes 完成