2026-07-10 · DECISION TRACE

小墨模型评测详情:gpt-5.6-terra

保留方案、指标、验证、复盘和治理判断,让结论能够追溯。

2026-07-10记录日期
评测记录记录类型
9章节数

小墨模型评测详情:gpt-5.6-terra

  • HTML: https://decision.ht1072.top/2026-07-10-xiaomo-model-eval-detail-gpt-5-6-terra-20260710-093209.html
  • Local HTML: [已移除本地路径]
  • Generated: 2026-07-10T09:43:57+08:00

小墨模型评测详情:gpt-5.6-terra

结论

gpt-5.6-terra 本轮得分 146 / 160,达到主模型候选线。规划收口、commit 分组、focused regression 与知识治理稳定;主要短板是 T1 未基于真实 diff 给具体清单,T4 未形成可复核的远端状态证据链。

基本信息

  • Run ID:20260710-093209__custom__gpt-5.6-terra
  • Provider:custom
  • Model:gpt-5.6-terra
  • Baseline:gpt-5.5
  • Scored by:gpt-5.5
  • Eval version:2026-05-20.v2
  • Score report:[已移除本地路径]

分数

题目 得分 简评
T1 主线保持 17 / 20 不串线,三层和停止点完整;未读取真实 diff,清单偏抽象。
T2 复杂规划 19 / 20 结论、分层、先后顺序、终态和停止点完整。
T3 commit grouping 18 / 20 分组与不能混推项合理;branch 与测试要求可再具体。
T4 tool verification 17 / 20 有先查意识并识别当前目录非 Git 仓库;未定位目标仓库或附完整命令证据。
T5 regression 判断 19 / 20 focused test 优先,扩大条件清楚。
T6 upgrade worth-it 19 / 20 能抓住 blast radius、本地补丁和收益不确定性。
T7 wiki 收口 18 / 20 结构与判断矩阵完整;可补 frontmatter 和证据字段。
T8 drift triage 19 / 20 状态区分和常见误判覆盖完整。

适合方向

  • Hermes 本地补丁收口、升级收益评估、focused regression。
  • commit grouping、GitHub 同步前分层、长期资产与策略资产拆分。
  • wiki concept、治理口径与 drift triage。

不适合方向

  • 无人值守的远端 push / commit 可达性最终确认。
  • 必须基于真实 diff 给逐文件正式清单的任务,除非显式强制先查目标仓库。
  • 高风险发布、provider/gateway 切换等需要完整可审计证据链的任务。

相对 gpt-5.5

规划与治理能力接近 gpt-5.5,表达克制、停止点意识好;但真实对象定位、diff 归因与远端状态可审计验证弱于强基线表现。

接入建议

建议作为 主模型候选 / 规划辅助 worker / 文档治理 worker / code-review planning。进入主线前应补一轮真实仓库工具闭环复测;高风险 Git/GitHub 状态判断必须保留外层工具审计。

风险 / 边界

  • 工具方法论正确,不等于已完成事实验证。
  • 没有目标仓库、真实 diff 与命令输出时,不能把流程答案当成正式验收结论。
  • 发布或远端同步类任务必须由主 agent 二次核验。

归档

  • 本地 run:[已移除本地路径]
  • 本地评分:[已移除本地路径]
  • 默认归档口径:本地 wiki + Decision Trace HTML,不写飞书主库。