博客 · 分析
DeepSeek Harness 基准评测:60 个真实任务,三个维度
2026 年 8 月 25 日 · dshbase · 给安装者的量化评估
多数 Agent 评测止步于「能跑」或「跑不起来」。要看清一套工具,得有数字。上海人工智能实验室的司南评测体系发布了一份这样的报告:在 WildClawBench 上用 60 项真实环境长程智能体任务,从 Score(任务完成能力)、Cost(调用成本)、Time(执行耗时) 三个维度评估 DeepSeek Harness,任务覆盖生产力流程、代码智能、社交交互、搜索检索、创意合成与安全对齐,中英文、含多模态。
一句话结论:中上能力、低成本、较高耗时
DeepSeek V4 Pro + DeepSeek Harness 综合得分 45.0,落在 GPT-5.4 + DSH(53.8) 与 GLM 5 / Qwen3.5 397B + DSH(39.2) 之间,在 7 个价格相对稳定的 DSH 配置里排第 3。报告的定性很精准:「中上能力、低成本、较高耗时」。
GPT-5.6 Sol 与 Claude Fable 5(OpenClaw 载体)仅作高分上限参照——两者单任务平均成本约为该组合的 9.5 倍与 14.6 倍,不在同价格口径内比较。
同模型换 Harness:成本直接腰斩
最有信息量的对比是控制模型不变。与同模型 OpenClaw 相比,DeepSeek Harness 给 V4 Pro 带来小幅提分,同时 成本下降约 50%,耗时仅增加约 4.2%。折算整组 60 项任务:模型调用总成本约 6 美元对 12 美元,顺序执行总耗时约 630 分钟对 605 分钟;单位成本得分从约 218 分/美元提升到约 450 分/美元(+106%)。
跨模型适配:Harness 不是对谁都免费加成
横向比较不同模型搭载 DSH 后的变化,效果并不一致,这正是报告的可贵之处:
- GPT-5.4 + DSH——全场最佳:53.8 分(五种 Harness 组合中排第 2,仅次于 Codex),成本最低 0.30 美元/任务(−9.1%),平均耗时 3.98 分钟最快。
- Qwen3.5 397B + DSH——得分、成本、耗时三项同时改善,协同效应明显。
- DeepSeek V4 Pro + DSH——小幅提分 + 显著降本,适合成本敏感、可异步/批量的任务。
- Grok 4.20 Beta + DSH——得分增幅最大,但耗时接近翻倍、成本更高。
- GLM 5 与 MiniMax M2.7 + DSH——暂无明确综合优势;GLM 5 单任务平均耗时 10.60 分钟,最慢。
模型响应延迟、工具调用策略、失败重试、上下文压缩和任务终止判断都会影响耗时——这些机制目前还无法跨模型平滑迁移。
安装者该带走什么
- 预算敏感、能接受排队? V4 Pro + DSH 是目前测得性价比最高的组合,适合成本敏感、允许异步或批量执行的智能体任务。
- 交互时延敏感? 别只盯 V4 Pro——数据显示 GPT-5.4 + DSH 平均 3.98 分钟且成本更低。选 Harness 有时比选模型更管用。
- 预期方差: 同一 Harness 对部分模型是放大器,对另一些等于没装。任务规划、提示模板、工具协议仍需按模型特点调优。
报告给出的优化方向也很直白:缩短工具调用链、减少无效循环、改进上下文压缩与任务终止策略。对一款上线两周的 developer preview 来说,45.0 分加上不到 0.1 美元/任务的成本曲线,已经是不错的起点——而「每美元得分」这个指标,值得每个版本发布后都重跑一遍。