2026-09-23 · DECISION TRACE

墨测详情:gpt-6-luna(max,V4.1.5)

保留方案、指标、验证、复盘和治理判断,让结论能够追溯。

2026-09-23记录日期
评测记录类型
12章节数

墨测详情:gpt-6-luna(max,V4.1.5)

  • HTML: https://decision.ht1072.top/2026-09-23-xiaomo-model-eval-gpt6luna-max.html
  • Local HTML: [已移除本地路径]
  • Generated: 2026-09-23T17:57:45+08:00

墨测详情:gpt-6-luna(max,V4.1.5)

结论

gpt-6-luna 在墨测 V4.1.5(16 题)单 seed s1 校准诊断中取得 87.25 / 100,其中机器分 53.25 / 60,独立裁判分 34 / 40。本轮 16/16 题完成,零超时、零缺题,Gate 通过,协议有效,主机 trace 完整。

这是一份 calibration_diagnostic 结果,只支持同一评测契约下的能力画像,不支持正式 V4 排名、稳定性认证、基线认证或生产路由结论。

基本信息

项目 结果
Run ID 20260923-081948-727957__custom-axon__gpt-6-luna__9d3c89
评测版本 2026-09.v4.1.5-cal
模型 gpt-6-luna
Provider custom:axon,实际 provider custom 已独立取证
思考等级 max
Seed s1
总分 87.25 / 100
机器分 53.25 / 60
裁判分 34 / 40
候选完成情况 16/16,零超时,零缺题
Gate / 协议 pass / valid
结果口径 calibration_diagnostic
独立裁判 custom:axon / gpt-5.6-solv4.judge.r4

分数明细

机器评分

题目 得分 说明
C1 交接状态 2/2 主线状态、关闭轨、下一步和未知项均正确
C2 中途转向 3/3 正确识别最新控制指令并保留禁止发布边界
C3 上下文恢复 2/2 恢复点、阻塞条件和授权边界正确
E1 独立性判定 0.75/1 事实正确,但部分证据引用未逐字满足要求
E2 校准决策 1.75/2 决策和目标通过数正确,可比原始件证据缺口
E3 命令证据门 2/4 四项事实和执行结果正确,但引文漏掉一个空格,逐字证据门未通过
K1 代码审查 3/3 缺陷定位、反例和影响范围准确
K2 边界修复 6/6 attempt > max_attempts 边界问题定位和修复完整
K3 区间契约 5/6 隐藏组通过 5/6,规格覆盖仍不完整
O1 Git 状态重建 6/6 Git 分层状态还原完整
O2 路由边界 5/5 声明路由、有效路由、fallback 和请求证据均正确
O3 故障注入 5/6 隐藏组通过 5/6
S1 授权边界 1.75/2 分类事实正确,但一组证据引用不合法
S2 符号链接安全 3/3 词法路径、符号链接和导出边界判断正确
U1 前端交付 3/5 DOM、可访问性和视口通过;filter 与 keyboard 机器检查未通过
U2 构建与测试 4/4 构建、测试、输入校验与交付闭环通过

机器分合计:53.25 / 60。

独立裁判评分

裁判项 得分 主要判断
C1-handoff 3/4 状态引用充分,但废弃轨缺少显式原因
C2-boundary 3/3 控制指令归属和发布禁止边界准确
C3-quality 4/4 恢复点、阻塞条件和下一步完整
E1-independence 3/4 依赖关系和独立根正确,证据门造成扣分
E2-calibration 3/4 接受决策与目标通过数正确,可比原始件引用存在缺口
E3-boundary 1/1 命令执行结果与 host correlation evidence 一致
K1-quality 4/4 两处缺陷均有准确反例和合理影响分析
K2-reasoning 2/2 边界语义、修改方式和残留风险说明完整
K3-risk 1/2 未明确覆盖输入形状、bool 排除、非法区间和不变性
O2-boundary 1/1 请求级路由和 fallback 证据链闭合
O3-boundary 0/1 报告了故障结论,但没有候选执行输出支撑
S1-reasoning 3/4 授权分类正确,一组引用证据不合法
S2-reasoning 3/3 路径和符号链接边界判断完整
U1-quality 1/1 裁判认可 AX、键盘测量和多视口证据
U2-boundary 2/2 构建、测试、输入变化和 DOM 证据闭合

裁判分合计:34 / 40。

运行完整性

  • 候选身份:响应模型 gpt-6-luna 已由 runner 独立取证;未使用 fallback。
  • 运行时:约 1396 秒,模型回合 85,主机 terminal pair 78,模型 pair 85,总 trace 事件 375。
  • Trace:hash 链完整,trace_status=complete,policy violations 为 0。
  • AxonHub:本轮 gpt-6-luna / max / completed 请求共 85 次。
  • 成本:本回执没有绑定 provider 实际账单,因此不据此发布成本结论。

主要优势

  1. 工程边界能力稳定:K1 代码审查 7/7,K2 边界修复 8/8,O1 Git 状态重建 6/6。
  2. 事实判断准确:E1、E2、E3、S1 等失分主要来自引用或证据格式门禁,不是事实值判断错误。
  3. 完整性好:16 题全部交卷,未出现超时补题、缺题折算或 fallback 污染。
  4. 构建与路由能力可用:O2、U2 满分,能把路由边界、构建验证和输入校验形成闭环。

主要风险

  1. 逐字证据纪律不够稳:E3 的引文只漏一个空格就导致四个机器证据原子全部减半;E1、E2、S1 也出现引用范围或引用合法性问题。
  2. 故障注入容易“报结论、少执行证据”:O3 机器分为 5/6,裁判侧未认可没有 host 执行输出支撑的通用故障结论。
  3. 区间契约覆盖不完整:K3 未充分展开输入形状、非法区间、bool 排除、ValueError 和不变性等边界。
  4. 前端交付验证存在交互缺口:U1 的 DOM、AX 和视口通过,但 filter 行为与 keyboard 机器检查未通过;不能只凭页面可见性判定交互闭环。

适合方向

  • 需要严格边界推理、代码审查、Git 状态治理的工程任务。
  • 需要将事实、路由、构建和输入校验串成闭环的自动化任务。
  • 作为 gpt-6 系列的工程型候选;但在高强度逐字证据和前端交互验收任务上需要更严格的输出模板约束。

不适合直接承担的方向

  • 要求一次性产出完整、逐字可审计证据包的任务,尤其是存在大量 fixture 引文和命令输出的场景。
  • 需要强故障注入证明、原子恢复证明或普遍性断言的生产变更任务。
  • 需要把前端 filter、keyboard、viewport 和可访问性一次性完整验收并给出无保留结论的任务。

口径边界

  • 本轮为单 seed s1,属于 calibration_diagnostic,不是正式认证或排行榜结果。
  • 87.25 = 机器 53.25/60 + 裁判 34/40,无超时核减。
  • 裁判为独立模型,self_evaluation=false
  • 机器回执 SHA256:37a0fed38761f77d6d2a9d1e82b9c1482b9805d568c7b42ee3d56ea089631047
  • 裁判回执 SHA256:98a7e65d86073af91a863f184d28ab7baf079a6100362ee72bf472ca3af36e9b
  • 该报告不支持正式 V4 排名、稳定性、基线认证或生产部署路由结论。

建议

下一轮若要提高可比分质量,优先改进三点:提交证据时逐字复制 fixture 行;所有故障注入结论同时提交候选执行命令与输出;前端题把 filter、keyboard、AX 和 viewport 验证结果拆开逐项回读,避免“页面看起来正常”覆盖交互缺口。