Blog · 分析
从 30.2% 到 96.2%——差距在 Harness
2026年8月20日 · dshbase · 改写分析

八月这波 DeepSeek 新闻,最容易被记住的是价格和参数。更耐看的信号其实坐在模型旁边:DeepSeek Harness——决定这些 token 会变成日常工作流,还是只变成演示的那层运行时。
本文改写自把 V4 Pro 与 Harness 放到同一张牌桌上的微信分析(如「30.2到96.2」那类讨论)。文中数字按公开报道口径引用;厂商自有评测请照常打折看。
模型故事是真的——但不完整
V4 Pro 带着长上下文、双接口形态、工具调用和抢眼标价上线。对 Agent 工作负载来说,缓存命中更要命:你在不断重读历史。价格故事会改账单;它本身不会改「工具失败怎么恢复」「坏会话怎么回放」。
30.2 → 96.2:权重没动,环境变了

反复被引用的 ARC-AGI-3 案例:ARC Prize 口径下 Opus 一类基线大约 30.2%;开发者 Jeremy Berman 换上接近 Claude Code 的环境、动作通道和文件系统日志,让模型写解析器、搜索、模拟器,公开关卡上冲到约 96.2%(有报道写到单次 24/25)。上百个程序、近万行代码——仍然是同一套权重。
跳升的不是「卡片上的智商」,而是模型在两次猜测之间被允许做什么:落盘、迭代、给问题装仪表。普通人听见「模型变强了」;做系统的人该听见「运行时把动作空间放开了」。
为什么 Harness 才是黏性层
前沿分数会继续互咬,价格会继续挤压。一旦运行时吞下你的插件、权限、项目目录、缓存策略和失败回放,迁移成本就会长出来。上游模型可以换;团队已经养成的干活方式很少会整包扔掉。
DeepSeek Harness 押的就是这层:工具/策略/存储/上下文的 Cordis 接缝、Trajectory 事件级回放、可见的 token/缓存表、能比「再挂一个 MCP」更深的社区插件。UI 细节仍落后于 Codex 一类壳——早期生态经常是刻意粗糙的。
我们在 dshbase 怎么用这个判断
- 只是尝鲜 V4 Pro:看价格、接口形态、工具调用,能不能塞进你已有的工具链。
- 要做长期 Agent 工作流:要会话回放、权限边界、缓存可见、可审计的插件故事——从 Trajectory 追踪 和 成本与缓存 开始。
- 装社区插件:把「在我机器上真能跑」当成产品。我们的 目录 只在真实安装路径通过后标已验证——可插拔运行时如果没有安装真相,就只是更长的 README。
结论
模型发布会给你能力上限;Harness 决定你能不能把上限压进周二下午的活。便宜模型很多,能把模型变成系统的运行时不多。下一轮要看的,不只是下一份第三方榜单,而是有没有几个 DSH 插件变成普通开发者离不开的承重墙。