
zouyuanqing/dsh-vision-primitives
30最近提交 2026年8月15日
dsh-vision-primitives DSH 插件
dsh-vision-primitives 是一个原生 DSH 插件,为纯文本智能体提供精确的视觉推理能力。它使用 Set-of-Mark 编号网格、确定性像素坐标数学以及一系列工具(截屏、缩放、标注、测量、差分、颜色、OCR),将视觉感知与精确像素坐标桥接。可选集成 MiMo V2.5 多模态模型进行描述和视觉定位。
如何安装 dsh-vision-primitives DSH 插件
dsh plugin --profile <name> add github:zouyuanqing/dsh-vision-primitives来源命令需要人工核对。复制不会执行命令。
dsh-vision-primitives DSH 插件数据来源
dsh-vision-primitives DSH 插件快照日期:2026年8月16日
discovered
dsh-vision-primitives DSH 插件能做什么
- vision_capture:截屏(全屏/区域,多显示器合并)或读取工作区 PNG 到会话帧。
- vision_grid:叠加 Set-of-Mark 编号网格,返回带编号图片和每格精确 box/center。
- vision_zoom:局部无损最近邻放大,保留到原帧的坐标映射链。
- vision_analyze:结构化输出 caption、layout、elements,包含归一化/像素 box、SOM 格子编号和屏幕坐标。
- vision_ocr:Windows 原生 OCR,返回词文本框及帧/屏幕坐标。
- vision_diff:帧差分,确定性变化检测,输出变化像素 bbox、比例和高亮图。
dsh-vision-primitives DSH 插件适合哪些场景
- 让纯文本 LLM 查看 UI 截图,通过解析网格坐标精确点击某个按钮。
- 桌面自动化测试:截屏,通过差分检测变化,验证 UI 元素像素位置。
- 向推理智能体提供结构化视觉证据(描述、布局、元素),用于多步视觉任务。
- 从截图区域提取文本(OCR),然后测量检测到的元素之间的距离。
- 结合 vision_capture、vision_grid 和 vision_zoom 在高分辨率图片中精确定位并标注目标。
dsh-vision-primitives DSH 插件适合谁
- 希望在 DSH 智能体上添加视觉推理能力,且无需外部 MCP 服务器的用户。
- 在 Windows 上构建自动化视觉测试、屏幕抓取或 GUI 自动化工作流的开发者。
- 使用 MiMo 多模态模型并需要与 DSH 无缝集成进行视觉定位的用户。
dsh-vision-primitives DSH 插件的限制
- 屏幕截取和原生 OCR 目前仅限 Windows(使用 PowerShell 和 WinRT API)。
- 帧文件存储在 sandboxPolicy.workspaceRoot/.vispri 目录下。
- MiMo 工具(vision_describe、vision_locate、vision_analyze)需要 MIMO_API_KEY 和互联网访问。
- 动态插件沙箱(cordis_define)无法激活客户端半部,因此 WebUI 配置卡片仅在 bundle 安装形态下可用。
dsh-vision-primitives DSH 插件的仓库 README 摘录
以下文字摘自 dsh-vision-primitives DSH 插件的上游仓库 zouyuanqing/dsh-vision-primitives 的 README,版权归原作者,仅作引用。
**Native interactive visual-reasoning plugin for DeepSeek Harness (DSH).** 给纯文本智能体装上"精确的眼睛":以 **Set-of-Mark 编号网格 + 确定性像素坐标数学** 为核心,让 Harness 智能体对屏幕/图片做精确到像素的视觉交互推理 —— 全程零外部 MCP 服务器,视觉推理内核 100% 在 DSH Host 运行时内以纯 JS 执行。 Design inspired by [vision-primitives-mcp](https://github.com/zouyuanqing/vision-primitives-mcp), re-implemented as a **native DSH plugin** (official profile bundle: host half + WebUI client half). ## 特性 | | | |---|---| | 🧠 **智能体即视觉模型** | 插件产出图片路径 + 确定性坐标数学;Harness 多模态智能体(或内置 MiMo 后端)看图决策,插件把"模糊感知"换算成"精确像素" | | 🎯 **SOM 编号网格** | `vision_grid` 叠加编号网格 → `vision_resolve(cell)` 得格子中心精确坐标,消除视觉模型坐标误差 | | 🔍 **局部无损放大** | `vision_zoom` 最近邻放大(像素级保真),保留到原帧的坐标映射链 | | 📐 **几何验证** | `vision_annotate` / `vision_measure` / `vision_diff` / `vision_find_color` / `vision_ocr` 确定性验证 | | 🖥️ **MiMo V2.5 后端** | `vision_describe` / `vision_locate`(多模态理解 + 视觉定位),并注册 `mimo` 模型路由(LlmAdapter,流式/函数调用/图像输入全支持) | | 📋 **聊天框贴图(paste-to-path)** | 纯文本模型下聊天框粘贴图片 → 自动转为"文件路径 + 视觉证据"文本注入(社区 paste-to-path 方案原生实现,默认关闭);视觉模型保持原生图片附件不受影响 | | 🔁 **发送时图片桥接** | 默认开启:纯文本模型也能粘贴/拖动图片(原生缩略图,无"模型不支持图片"报错);发送时图片缓存为工作区文件,以 `[Attached image: 路径]` 文本交给模型,模型可按需 `read_image` / `vision_analyze` —— 灵感来自社区 [dsh-image-
阅读完整 README仓库许可: MIT
dsh-vision-primitives DSH 插件常见问题
如何安装 dsh-vision-primitives?
在 DSH 终端中运行 `dsh plugin --profile <name> add github:zouyuanqing/dsh-vision-primitives`。你也可以使用 `#<commit-sha>` 固定到特定版本。安装后重新启动 DSH,插件会自动注册 vision_* 工具。
使用所有功能都需要 API key 吗?
不需要。核心视觉原语(网格、缩放、标注、测量、差分、颜色、OCR)完全离线工作,无需任何 API key。只有基于 MiMo 的工具(vision_describe、vision_locate、vision_analyze)需要 MIMO_API_KEY。你可以通过 `dsh credentials set MIMO_API_KEY <your-key>` 或在 WebUI 配置卡片中设置。
是否支持 macOS 或 Linux?
目前屏幕截取和原生 OCR 仅限 Windows,因为依赖 PowerShell 和 WinRT API。其他基于现有图片文件的功能(如 vision_grid、vision_zoom、vision_analyze)如果图片由其他来源提供,可能在其他平台工作,但插件主要针对 Windows 设计。
如何为纯文本模型启用 paste-to-path?
Paste-to-path 默认关闭。要启用,请进入设置 → 插件配置 → Vision Primitives,将 `pasteToPath` 设为 true。你也可以通过命令行或 cordis.patch.yml 配置。启用后,在聊天框中粘贴图片会自动插入文件路径和 MiMo 摘要。
我可以将这个插件与 MiMo 以外的多模态模型一起使用吗?
插件注册了一个 `mimo` 模型路由,与小米的 MiMo V2.5 API 配合使用。如果你有其他多模态模型,可以尝试通过自定义集成使用 vision_analyze 工具,但内置的多模态功能与 MiMo 绑定。核心视觉原语与模型无关。