Blog · 指南

DeepSeek Harness 视觉:给纯文本 Agent 装上眼睛

2026 年 8 月 14 日 · dshbase

DeepSeek 自家的模型是纯文本的——没有视觉模态,所以它「看」不了你上传的图片。就这一个事实,催生了 dsh 插件生态里最热闹的一角:大家抢着给一个瞎的 Agent 装眼睛、装手、装投放目标。下面是 dsh 0.1.0-rc.6 上真正好用的那些,以及图片上传被拒时该怎么办。

上传问题:图片为什么会被拒

装任何东西之前,先搞懂失败模式。官方仓库里最常见的抱怨是:支持视觉的第三方模型(gpt-5.4、kimi、o1/o3/o4、grok)无法上传图片——请求在 dsh 的网关里打了个来回,视觉模态没能活着出来,于是模型压根没收到像素。DeepSeek 自家的一手模型反而不受影响,因为它们本就是纯文本:前端本就不该给它们弹图片上传。修复有两条路:选一个能撑过这次往返的视觉模型,或者——更靠谱——把图片交给一个专门的视觉插件,让它用文字描述回来。

modlens:第一个,也仍是标杆

modlens 是 DeepSeek Harness 的第一个视觉插件,近千 star,至今仍是基准。它的模型是:粘一张图,拿回结构化的 JSON 证据——OCR、布局、语义——然后你的纯文本模型再据此推理。与其硬把像素塞进一个读不了的模型,modlens 把图片转成了模型消化的东西。它是插件目录里 star 最多的视觉插件,在 dsh 0.1.0-rc.6 上验证为 ok

dsh-vision-toolkit:完整工具箱

如果说 modlens 是参考实现,dsh-vision-toolkit 就是厨房水槽。它「帮纯文本模型处理视觉任务」,覆盖面广得多:意图感知的图片问答、长截图 OCR、UI 还原、grounding、像素 diff、Artifacts。差别就在「读这张截图」和「读这张 4000px 的滚动长截图,再跟上一张做 diff、告诉我 UI 哪里变了」之间。它在 dsh 0.1.0-rc.6 上从源码构建(git-build),社区份量很足。

dsh-vision-primitives:原生定位,零 MCP

dsh-vision-primitives 是更新、更有主张的那个。它是一个「原生交互式视觉推理插件」,围绕Set-of-Mark 编号网格覆盖层做精确视觉定位,且「零外部 MCP」。Set-of-Mark 技法在图片区域上叠编号标记,让模型说「点 7 号」而不是「点左上角那个大概是按钮的东西」。要做 UI 自动化、要精确指哪打哪,这就是你要的机制。目录标了 not-on-npm,需从源码装。

dsh-drop-to-path:把拖拽找回来

UX 上的粘合剂是 dsh-drop-to-path:它「让你把图片和文件直接拖给纯文本模型,保留原生附件体验,发送时自动转成路径」。这点很微妙但很实在——对纯文本模型来说,一张原始图片粘贴没有意义,但一个指向文件的路径,是模型能转交给视觉工具或直接读取的东西。这个插件保留了熟悉的拖拽手势,同时把载荷换成文本模型真能用的形态。

怎么选

  • 最快实现「读这张图」modlens,粘贴拿 JSON 证据。
  • 重型视觉工作流(截图、diff、UI 还原)→ dsh-vision-toolkit
  • 精确指哪 / UI 自动化dsh-vision-primitives 的 Set-of-Mark 覆盖层。
  • 只想把拖拽找回来dsh-drop-to-path

结语

在 DeepSeek 出原生视觉模型之前,打法就是:别跟上传承门较劲,把图片交给插件,让它转成文字或结构化 JSON。modlens 和 dsh-vision-toolkit 覆盖了绝大多数场景,dsh-vision-primitives 补上精确定位,dsh-drop-to-path 保住手感。要看这四者当前、实测过的阵容(含确切安装命令),去插件目录

全部文章 →

🌐 English