2026-07-10 · DECISION TRACE

小墨模型评测详情:gpt-5.6-luna

保留方案、指标、验证、复盘和治理判断,让结论能够追溯。

2026-07-10记录日期
评测记录记录类型
9章节数

小墨模型评测详情:gpt-5.6-luna

  • HTML: https://decision.ht1072.top/2026-07-10-xiaomo-model-eval-detail-gpt-5-6-luna-20260710-092352.html
  • Local HTML: [已移除本地路径]
  • Generated: 2026-07-10T09:43:58+08:00

小墨模型评测详情:gpt-5.6-luna

结论

gpt-5.6-luna 本轮得分 141 / 160,达到主模型候选观察线。规划、分组、回归判断和 wiki 收口稳定,表达克制;主要问题是 T4 没有真实工具调用和可审计命令输出,工具执行闭环不合格。

基本信息

  • Run ID:20260710-092352__custom__gpt-5.6-luna
  • Provider:custom
  • Model:gpt-5.6-luna
  • Baseline:gpt-5.5
  • Scored by:gpt-5.5
  • Eval version:2026-05-20.v2
  • Score report:[已移除本地路径]

分数

题目 得分 简评
T1 主线保持 17 / 20 不串线并给停止点;资产拆分偏抽象,缺真实清单。
T2 复杂规划 19 / 20 结论、分层、先后、终态和停止点完整。
T3 commit grouping 18 / 20 分组与回滚边界清楚;可再补 branch / commit 模板。
T4 tool verification 12 / 20 方法列表正确,但 tools_used 为空且无命令输出,事实验证不可审计。
T5 regression 判断 19 / 20 focused test 优先,扩大条件完整。
T6 upgrade worth-it 19 / 20 能识别补丁重放与跨边界回归风险。
T7 wiki 收口 18 / 20 结构与分类口径清楚;可补命令和证据字段。
T8 drift triage 19 / 20 两类状态、判断顺序和误判提醒完整。

适合方向

  • Hermes 本地补丁分层、GitHub 同步前收口、升级收益评估。
  • wiki concept、判断矩阵与治理口径整理。
  • focused regression 与 drift triage 的中文决策说明。

不适合方向

  • 需要强制真实工具调用、命令证据和外部状态二次验收的无人值守任务。
  • 高风险发布、远端同步确认、provider/gateway 实际切换。
  • 未加外层硬审计的操作闭环。

相对 gpt-5.5

文字判断、规划和治理收口接近 gpt-5.5,部分答案更干净;但真实工具纪律低于基线要求,不能把“会描述验证流程”视为“已经完成验证”。

接入建议

建议作为 research worker / 文档治理 worker / 规划辅助 worker。暂不直接替代主模型,补一轮真实工具闭环复测后再判断是否进入主模型池。

风险 / 边界

  • T4 出现自述式验证:答案声称检查过,但 run 记录无工具证据。
  • 不应独立承担发布、同步、远端状态裁决等高风险主线执行。
  • 若用于操作型任务,外层必须校验 tools_used、命令输出和最终状态。

归档

  • 本地 run:[已移除本地路径]
  • 本地评分:[已移除本地路径]
  • 默认归档口径:本地 wiki + Decision Trace HTML,不写飞书主库。