博客 · 评测
Space Bunny 接进 DSH:BYOM 实际意味着什么
2026年9月28日 · dshbase · X pulse
一个模型登上公开榜,一天之内就有人把 DeepSeek Harness 指了过去。这个顺序就是这篇笔记的全部故事。Space Bunny 的排名是别人正在兴奋的一张快照。对安装者要紧的部分更窄:@cxjwin 描述量子位(QbitAI)把 OpenRouter 接进 DSH,跑编码测试。我们没有重跑那些测试。我们也不会编一个分数、一个参数量、一个价格或一个名次,然后假装自己量过。有用的问题是:下拉框不再是 DeepSeek 的 id 之后,「自带模型」到底让你承诺了什么。
DSH 是 harness。模型是客人。客人不会继承主人的名声,主人也不会继承客人的榜单。
那条帖子实际展示了什么
被引用的帖子是实验室笔记,不是合并公告。一组人走了一条 OpenAI 兼容的路——OpenRouter——把它对准 harness 里的编码任务。周围通常的多供应商叙事在做它一直在做的事:如果这个壳能住下不止一家的权重,那么壳就是产品,模型就是卡带。这个叙事在方向上就是 DSH 存在的原因。它也是人们跳过「把卡带装进去是否安全」那些检查的方式。
在这种接法里,OpenRouter 是别人端点前面的路由器。你选中的 id 可能扇出到不止一个后端,后端可以换,id 字符串还可以保持好看。「我们测了 Space Bunny」在你能说出供应商 slug、精确 id 和测试日期之前,是不完整的。帖子如果没锁这些,测试就是演示。演示可以有。演示不是采购决定。
把 DSH 当成 OpenAI 兼容的运行时
接入路径就是模型接入教程已经当成常态的那条:一个端点、一把 Key、一个模型 id,以及一个说聊天补全形状的 harness。官方 DeepSeek id 是顺利的那条路,因为工具调用的方言和缓存行为被做预设的人练过。经路由器而来的第三方 id 是同一组按钮、另一份合同。
BYOM 是你带四样东西,不是一样:
- 基础 URL 和 Key,以及这把 Key 住在哪里的说法。桌面泄露和路由器 Key 是坏组合;把凭据贴进一个你没锁定的客户端之前,先看桌面端讨论。
- 精确的模型 id 字符串,从测试当天提供方的页面上抄,不要凭榜单绰号的记忆。
- 一个失败即停的工具调用测试。如果模型发不出 harness 能接受的 schema,它会在编码上看起来很笨,原因和榜单分数无关。
- 一份保留与日志的说法。路由器记。提供方记。你的会话日志也记。私有仓库的三份副本就是一项政策,不管你写没写下来。
这些都不会出现在排名表上。它们都会出现在事故报告里。
夸模型之前,先验证工具调用
奖励单一答案的榜,奖励的就是单一答案。Harness 奖励的是一个能调用 bash、编辑器和搜索,然后读工具结果、而不再发明文件第二份副本的模型。Space Bunny 也许做得好。你发现的方式是一个固定夹具,不是一条时间线。
小到可以跑两遍的夹具:
- 一个有一条失败测试和一份短 README 的仓库。没有秘密,没有客户数据。
- 用标准模式,这样工具表就是你真会用的那份,不是玩具。如果你比的是成本而不是能力,把同一任务在极简模式里再跑一遍,两份都记下。这个区分就是省 Token 笔记的全部要点。
- 一句指令。存下来。模型之间如果改了这句话,你量到的是这句话。
- 看第一次工具调用。参数错了、工具名缺失,或者该调用的地方写成了一段散文计划,都是方言失败。停,并把这个记下来。不要帮模型十分钟,再给这份帮助打分。
GLM-5.3 对 GPT-5.6-Sol 是该抄的形状:一份 PRD,两位客人,差别在工程默认值而不是气氛。我们没有说 Space Bunny 对得上其中任何一次运行。我们说的是这个方法碰得起一个新名字。
不要把日榜当成偶像
样本、裁判模型或提示词模板一变,榜就会重排。周二排第一的模型,权重没动,周五也可以变成脚注。Space Bunny 的攀升是好奇的理由。它不是把生产 profile 重新指过去的理由,也不是发一条「DSH 现在支持最强编码器」的理由。Harness 支持的是一个端点。端点后面是一个模型。模型在一张你控制不了的表上过了很好的一周。
绰号风险是同一种马虎的一部分。「Space Bunny」是你记得住的牌子,也是你可能打错的 id。提供方喜欢可读的名字,然后在后面接日期、尺寸和量化标签,那些才会改变权重。笔记里写绰号、配置里写别的东西,笔记就是虚构。把 id 锁进 profile,把日期锁进实验记录。下个月重跑时,先 diff 这个 id。它如果动了,你就不是在复现。
比较同一条轨迹
DSH 相对聊天框的优势,是会话是一份事件日志。用它。轨迹追踪是让你停止争论助手最后一段、开始争论工具调用的方法。做 BYOM 测试时,留下两份共享任务、模式和用户提示的轨迹:
- 第一处错误编辑发生在哪里。
- 模型有没有重读它刚刚写过的文件。
- 它用同样的参数调用同一个工具多少次。
- 失败是一个坏补丁,还是 schema 被拒绝之后它根本没收到的工具结果。
最后这一刀是榜单会擦掉的。工具可靠性未知的模型会把一个会话烧得很「有想法」,同时 harness 在拒绝它的调用。把这个算成 harness 不匹配,再决定你是否在乎到要写一个适配器。不要把它平均进「模型更不擅长写代码」。
缓存行为不会仅仅因为按钮在同一个 UI 里,就和原生 DeepSeek id 一样。前缀缓存是提供方的能力。路由器可能不把缓存字段传过去,或者只对某些后端传。如果你留在 DSH 的理由是账单,重读成本指南,并假定第三方路线是冷的,直到发票另说。PTC 补不上这个洞。它从来补不上。
未知权重是一个安全决定
从榜单的一行里,你不知道模型用什么训练、它会不会吐出被展示过的秘密,也不知道 OpenRouter 路由之后谁能读到提示词。「未知权重」不是侮辱。它是描述。把它当成桌面端笔记里的未签名二进制:沙箱里可以好奇,生产检出里不受欢迎。
不需要假装我们审计过 Space Bunny 的限制:
- 第一次会话跑在一次性克隆里。权限模型仍然适用——批准工具,不要因为模型正在热门就给一把很宽的 shell。
- 在 agent 能列出目录之前,拿走 env 文件、令牌和客户转储。编码测试不需要它们。好奇的工具调用会找到它们。
- 假定提示词会被每一个你叫不出名字的跳点保留。代码如果不是公开的,路由器就不是认识新模型的地方。
- 不要对一个你还没看着它完成一次无聊修补的 id 打开创造模式,也不要为此招募一队 agent。多 agent 的花费会把一种坏方言乘上去。玻璃房那篇假定你读得见成员做了什么。你读得见。你仍然不该用一个还没面试过的客人去装满一间房间。
如果量子位那组编码测试可以复现,下一篇诚实的文章是一份锁着 id 的轨迹 diff。在那之前,Space Bunny 在 DSH 里意味着 harness 做了它的工作:让一个第三方端点坐在通常坐着第一方模型的位置上。这就是功能。判断仍然是你的。
X 上的来源
只有社区信号。不是基准表,也不是官方集成公告。
- @cxjwin — Space Bunny 冲榜之后,量子位把 OpenRouter 接进 DSH 做编码测试。
- 周围把 DSH 说成多供应商 harness 的帖子。是叙事,不是兼容矩阵。