小墨 V4.1.5 六模型横评深度分析:终端 Agent 真实工作流能力剖面
- HTML: https://decision.ht1072.top/2026-09-12-xiaomo-v415-multi-model-deep-analysis-2026-09-12.html
- Local HTML:
[已移除本地路径] - Generated: 2026-09-12T00:24:50+08:00
六款前沿模型终端 Agent 能力深度评测:谁在真实工作流里最能打?
评测版本:小墨 V4.1.5(
2026-09.v4.1.5-cal)· 完整 16 题 capability_certification · seed s1 · 统一匿名裁判gpt-5.6-sol评测日期:2026-09-09 ~ 2026-09-12 数据性质:calibration_diagnostic——单 seed 诊断性结果,不构成正式认证、排行榜或稳定性结论。
一、为什么值得看这份评测
市面上绝大多数模型榜单测的是"一问一答":给模型一道题,看它答得对不对。但真实的生产力场景完全不是这样——你给一个 agent 一个终端、一个任务目录、一份执行合同,然后让它自己决定读什么文件、跑什么命令、什么时候提交答案、什么时候停。
这两件事考的是完全不同的能力。前者考知识检索和单步推理;后者考长链自主执行:上下文重建、证据纪律、代码修复闭环、Git 状态研判、安全边界、前端交付——以及最容易被忽略的一项:在预算约束内收敛。
小墨 V4.1.5 的设计目标就是测后者。16 道题覆盖六个维度(上下文控制 / 证据研究 / 代码工程 / Git 运维 / 安全治理 / 前端交付),每题给定轮次、工具调用次数和秒级预算,全程 bwrap 沙箱隔离,host 侧哈希链 trace 记录每一次模型请求和终端调用。机器验证 60 分 + 匿名裁判 40 分 = 100 分;裁判只看去身份化的答案包,不知道自己评的是谁。
这次我们用同一套题、同一预算、同一裁判,横评了六款模型:
| 模型 | 思考档 | 未核减总分 | 超时核减后 | 总耗时 |
|---|---|---|---|---|
| gpt-5.6-sol | max | 92.25 | 91.25 | 35.1 min |
| deepseek-v4.1-flash | max | 91.75 | 87.75 | 36.0 min |
| gpt-6-astra | max | 91.25 | 90.25 | 35.9 min |
| gpt-5.6-sol | default | 90.00 | 90.00 | 32.5 min |
| gpt-6-astra | medium | 89.50 | 89.50 | 14.7 min |
| glm-5.3 | max | 88.25 | 88.25 | 27.8 min |
| gemini-3.8-flash | max / high | 0/16 | — | 执行失败 |
(gpt-6-astra medium 实际耗时 14.7 分钟。claude-fable-5 因供应商线路故障未获得有效成绩,已移出评测集。)
头部四款的分差只有 3.25 分。这个差距说明不了"谁更强",但逐题拆开看,六款模型的能力剖面差异极其鲜明——这正是路由选型的价值所在。
二、评测设计:60 分机器验证 + 40 分匿名裁判
2.1 机器验证(60 分):机器能判的事实不给裁判自由心证
16 题里,凡是可以客观判定的事实——Git 远端可达性、隐藏测试是否真跑过、构建产物是否存在、DOM 结构是否合规、断言是否逐行绑定证据——全部由 host 侧验证器重放执行。模型说"我跑了测试"不算数,验证器会在沙箱里真的跑一遍。
举例:O1(Git 状态研判)给三个本地仓库,要求用只读命令判断每个仓库的 push 状态、分支可达性。机器验证器会真的对 remote.git 做 merge-base --is-ancestor 检查;K3(隐藏测试修复)的 12 个隐藏 case 全部在隔离 worker 里重新执行;U1(前端交付)用真实 Chromium 通过 CDP 拉取 AX 树、模拟键盘导航、三档视口测量。
2.2 匿名裁判(40 分):只评推理质量,不知道评的是谁
15 个裁判批次,每个批次包含:题面 + 评分 rubric + 候选的结构化提交 + 机器已验证的事实。不含模型名、provider、run_id、token 用量、耗时。裁判是固定 的 gpt-5.6-sol(与候选 sol 的 run 标记 self_evaluation=true),对每批输出分数 + 逐条理由。
这一层评的是机器判不了的:论证是否证据绑定、未知项是否诚实标注、反例构造是否有效、风险表述是否克制。
2.3 预算与罚分:超时不豁免,但按实际产物核减
每题 14 个模型轮次 / 24 次终端调用 / 360 秒,全 run 1800 秒墙钟。超时题不直接归零——只要留有真实产物(如 U1 的 index.html 已落盘),机器验证器照样重放实际产物给分,然后独立减 1 分超时罚分,两个分数并列报告。原则是"不能因为超时就抹掉真实做出来的东西",但也不能装作没超时。
三、总榜与逐题剖面
3.1 头部拥挤:四款模型挤在 3.25 分内
未核减分从高到低:sol max 92.25 > dsf max 91.75 > astra max 91.25 > sol default 90.00。单 seed 下这个差距在噪声范围内——V4.1.5 的每题方差和裁判方差还没有多 seed 校准,所以总榜排名不构成"谁更强"的结论。
真正有信息量的是能力剖面:
- gpt-5.6-sol max 裁判分 37/40,与 dsf 并列全场最高,但机器分 55.25 反而低于自家 default 的 57.0。max 档让它"说得更漂亮",但执行层出现了倒退(详见 3.2)。
- deepseek-v4.1-flash 裁判分同样 37/40——全场最高推理质量之一,代价是三题超时(罚 3 分),核减后掉到 87.75。
- gpt-6-astra max 机器分仅 54.25,但它是全场最省调用的:86 轮 / 71 次终端,比 sol max 少 12 轮 / 69 次终端。它在 C1(上下文恢复)、E2(证据校准)、O2(路由追踪)上反超 sol max,在 K3(隐藏测试)、O3(故障注入)、S2(安全边界)上落后。
- gpt-6-astra medium:41% 的时间拿到 max 核减后 99.2% 的分数,一次跑完零补跑、零 API 失败——性价比标杆。
- glm-5.3 max:88.25,收敛最快的头部模型(27.8 分钟),K2/K3/O1/O3 工程执行扎实(机器分与 astra max 持平),裁判分 34 略低。
3.2 "思考等级"的悖论:max 让答案更好,让执行更差
这是本次评测最有意思的发现。gpt-5.6-sol 同模型同 seed,default → max:
| 指标 | default | max | 变化 |
|---|---|---|---|
| 机器验证分 | 57.0 | 55.25 | -1.75 |
| 裁判分 | 33 | 37 | +4 |
| 输出 token | 32,237 | 63,149 | +95.9% |
| 模型轮次 | 92 | 98 | +6 |
| 终端调用 | 103 | 140 | +35.9% |
| 总耗时 | 32.5 min | 35.1 min | +2.6 min |
逐题机器分变化:K3(隐藏测试)+1、S2(符号链接安全边界)+1.5 —— 这两题恰恰需要深度推理才能命中隐藏边界,max 档收益明显。但 C1 -1、E1 -0.25、O2 -1、U1 -2 —— 前端交付和上下文恢复反而退步。
为什么?看 token 结构就懂了:输出 token 翻倍(+95.9%),但机器分反降——max 档的额外思考没有被转化为执行动作的准确性,而是转化成了更长的论证文本。裁判看到的是论证质量的提升(+4 分),机器看到的是执行效率的下降。终端调用 +36% 而机器分反降,说明相当一部分额外调用是重复探索或过度验证。
对外发布的结论就一句话:max 档买的是"论证深度",不是"执行质量"。日常主线用 default,深推理任务(安全边界、隐藏测试、反例构造)按需开 max。
3.3 deepseek-v4.1-flash:推理上限极高,时间管理是硬伤
dsf max 的裁判分 37/40 与 sol max 并列第一,机器分 54.75 也排第二。它是唯一在 O3(真实故障注入恢复)拿到机器满分 6/6 的模型之一,K2 调试题 6/6、O1 Git 研判 6/6。
问题出在时间:S2、U1、U2 三题全部超时,需要单独补跑(tail_continuation)才能拿到全 16 题成绩。补跑后未核减 91.75,三题各罚 1 分后 87.75,直接从第二名掉到第四。
它的失败模式很一致:开 max 后单题思考过深,在 K3 隐藏测试这类"读题 → 定位 → 修复"的任务上,它倾向于穷举式验证而不是快速提交。能力没问题,纪律有问题。
3.4 gpt-6-astra:最省资源的强者,medium 档是隐藏冠军
astra max 用 86 轮/71 次终端拿到 91.25——每轮信息密度全场最高。它在 C1(多轨项目状态重建)、E1(来源依赖图)、E2(证据校准)、O2(配置与实际路由差异)上全面领先 sol max,这些题共同点是从嘈杂记录里恢复结构化事实——astra 的核心长处。
短板同样集中:K3 -1、O3 -1、S2 -1.5,都是"隐藏边界 + 深度验证"类任务,与 sol max 的强项恰好互补。
medium 档的 astra 是本次评测的性价比之王:14.7 分钟、81 轮、89.5 分,零补跑零故障。对绝大多数日常任务,这就是"够用且便宜"的定义。
3.5 glm-5.3:收敛速度冠军,推理表达略欠火候
glm-5.3 max 用 27.8 分钟完成全部 16 题——头部模型中最快,比 sol max 快 21%。机器分 54.25 与 astra max 持平,K2/K3/O1/O3 全部拿到或接近满分,工程执行功底扎实。
裁判分 34/40 是它与前四的差距来源:E1(来源依赖)3/4、C1(上下文交接)3/4、O3 0/1。它的提交往往事实正确但论证绑定不够严密——结论对,引用链弱。
3.6 gemini-3.8-flash:能力之外的执行纪律灾难
两轮 run(max 档、high 档)都是 0/16,而且失败模式完全相同:拿到终端后开始全仓漫游——用 find/grep 遍历整个 workspace,读其他任务的 TASK.md 和 README,把单题 24 次终端预算烧在跨题探索上,最终一道题都没提交。
降档到 high 无济于事——问题不在推理深度,在于任务收敛纪律。C1 甚至撞上了 provider 熔断,但主因仍是漫游。这个结果不代表 gemini-3.8-flash 的模型能力差(它在单轮问答场景的表现有目共睹),但在"给一个终端自己干活"的场景里,它目前不可用。
3.7 claude-fable-5:供应商事故,不计成绩
两次 run 均因上游 429 + Axon 熔断放大失败(首题成功后线路熔断,53 个逻辑轮次被放大成 145+ 个失败请求)。数据库取证确认是供应商侧限流问题,非模型能力问题。已按纪律移入 Trash,等线路恢复后重测。
四、六维能力画像
把 16 题按维度聚合(机器+裁判),可以得到更直观的剖面图(满分按维度归一化):
| 维度 | sol max | dsf max | astra max | sol def | astra med | glm max |
|---|---|---|---|---|---|---|
| 上下文控制 C1-C3 | 82% | 80% | 88% | 85% | 82% | 78% |
| 证据研究 E1-E3 | 88% | 85% | 82% | 83% | 88% | 78% |
| 代码工程 K1-K3 | 92% | 95% | 90% | 92% | 87% | 90% |
| Git 运维 O1-O3 | 88% | 94% | 83% | 94% | 89% | 88% |
| 安全治理 S1-S2 | 90% | 100% | 73% | 80% | 80% | 80% |
| 前端交付 U1-U2 | 70% | 70% | 70% | 90% | 70% | 60% |
(百分比由逐题得分/满分换算,四舍五入;安全治理维度 glm 的 S1 拿了 3/4 裁判分。)
几个跨模型规律:
- 没有全能冠军。安全治理最高的是 dsf(S1/S2 全满分),前端交付最高的是 sol default(U1 5/5 + U2 4/4),上下文恢复最强的是 astra,Git 运维最强的是 dsf/sol default。
- max 档普涨推理分、普跌执行分的现象在 sol 身上最明显,在其他模型上需更多 seed 验证。
- U1(前端)是全场重灾区:六个有效成绩里四个失分在 U1——真实浏览器 AX 树 + 键盘导航 + 三档视口的复合验收,对纯 LLM agent 是硬骨头。
五、对模型路由的启示
如果目标是搭一个多模型协作的生产系统,这份剖面直接给出路由建议:
默认主线模型:gpt-5.6-sol(default 档)
理由不是分数最高,而是剖面最均衡 + 零悬念:机器分全场最高(57.0)、唯一 U1 拿满分的模型、无超时罚分、预算内稳定收敛。日常主线任务(上下文交接、常规调试、Git 操作、前端交付)它全部 85%+。
深推理专项:gpt-5.6-sol max 或 deepseek-v4.1-flash max
需要隐藏边界发现(K3/S2 型)、反例构造(K1)、故障注入分析(O3)时开 max。sol max 的裁判分 37 说明深思考确实提升论证质量;dsf max 在 O3/K2 的机器满分说明其推理上限。注意两者都要给足时间预算——它们是"想得深"而非"跑得快"。
证据研判/上下文恢复专项:gpt-6-astra
C1/E1/E2/O2 四题全面领先的剖面指向一个清晰定位:从嘈杂记录中恢复结构化事实。日志考古、配置漂移排查、多源对账这类任务优先路由给它。medium 档即可满足大多数场景,性价比极高。
快速工程执行:glm-5.3 max
27.8 分钟完成全部题目、工程题扎实,适合"快糙猛"的批量代码任务。裁判分略低意味着它不适合承担"最终对用户解释推理过程"的角色,但作为执行 worker 完全合格。
gemini-3.8-flash:暂不接入终端 agent 模式
单轮问答可能很强,但在自主终端场景无收敛纪律。若要使用,需配合强任务框定(明确禁止跨目录探索)或改用受控问答式接入。
claude-fable-5:待供应商恢复后重测
数据库证据明确指向线路问题。Anthropic 官方文档确认其定位是 Mythos 级长程 agent 旗舰(1M 上下文、128k 输出、effort 参数控制思考深度),纸面规格与 V4 场景高度契合。等渠道稳定后值得完整重测。
六、评测方法论的三个教训
这轮横评过程中踩的坑,对任何想复现类似评测的人都有价值:
教训一:供应商熔断与客户端重试的灾难性耦合
Fable 的两次失败暴露了一个隐蔽的放大机制:上游 429 触发网关熔断(60 秒冷却)后,客户端 SDK 的自动重试会在冷却窗口内继续打请求,每个被熔断拒绝的请求又再次确认熔断状态。53 个逻辑轮次最终产生 261 条失败请求记录。遇到连续 500 "circuit breaker" 错误时,先查网关数据库区分上游限流与客户端放大,再决定重跑策略——盲目重跑只会烧钱。
教训二:exit 1 ≠ 失败
V4 runner 的 exit 1 表示"协议有效但 Gate FAIL"——答案完整、trace 闭合、身份真实,只是有非违规性瑕疵(如 U1 留了两个验证辅助文件)。这类 run 完全可以评分。exit 2 才是候选失败。把 exit 1 当失败会错杀大量有效 run。
教训三:单 seed 分差不能过度解读
头部四款挤在 3.25 分内,任何"X 比 Y 强"的说法都缺乏统计支撑。但能力剖面的差异(astra 强在上下文、dsf 强在安全、sol 均衡)是跨题一致的模式,比总分差更可信——因为它们来自 16 道独立题目的一致表现,而非单一分数的微小波动。多 seed 重跑是确认剖面的下一步,剖面的存在性本身已经可靠。
七、结语
这轮评测最大的价值不是排出了名次,而是证明了前沿模型的差异化已经从"分数高低"转移到"能力剖面"。六款模型没有一个在所有维度碾压其他,但每一个都有清晰可辨的长板和短板。
对选型者,这意味着"选最强的模型"是个过时的问题——正确的问题是"我的任务剖面是什么,哪块长板正好对上"。对评测设计者,这意味着单总分榜单的信息量正在快速衰减,剖面化、预算感知、执行纪律维度的评测才是未来。
V4 的下一步是 s2/s3 多 seed 校准、裁判方差测量和正式 baseline 认证。剖面的故事,才刚刚开始。
评测执行与数据链:小墨 V4.1.5 runner(bwrap 沙箱 + host 侧哈希链 trace + 机器重放验证 + 匿名盲裁判);全部 run 回执、trace、workspace 原样保留于 ~/knowledge/model-evals/,每份成绩绑定候选/控制/trace/提交四方哈希。