
OoWJZZoO/dsh-read-image
30最近提交 2026年8月15日
dsh-read-image DSH 插件
dsh-read-image 是 DeepSeek Harness 的一个插件,允许非多模态模型处理图片。它拦截粘贴的图片,替换为 [Image #N] 占位符,并注册一个 read_image 工具,调用独立的视觉模型来描述图片。该插件在纯文本和多模态路由上都能工作,并在适当时回退到内置工具。
如何安装 dsh-read-image DSH 插件
dsh plugin --profile web add github:OoWJZZoO/dsh-read-image复制不会执行命令。安装 dsh-read-image DSH 插件前请核对仓库和版本。
dsh-read-image DSH 插件数据来源
dsh-read-image DSH 插件快照日期:2026年8月16日
discovered
dsh-read-image DSH 插件能做什么
- 在纯文本路由中,粘贴的图片会被接受并替换为 [Image #N] 占位符,防止像素数据到达文本 API。
- 注册一个一流的 read_image 工具,支持通过索引(image_index)或文件路径(file_path)读取图片,并可覆盖提示、推理努力、超时和令牌限制等参数。
- 支持通过 settings.yaml 或 Web 界面配置视觉提供商、模型以及工具调用的默认参数。
- 包含启动时的环境自检,如果任何 Harness 合约发生变化,插件会安全失败,记录诊断信息而不影响 Harness 本身。
dsh-read-image DSH 插件适合哪些场景
- 让纯文本模型通过 read_image 工具描述聊天中粘贴的图片。
- 从本地文件路径(如 /path/to/图片.png)读取图片,让模型分析其内容。
- 为缺乏原生多模态支持的模型添加 OCR、物体检测或视觉推理能力。
- 多次重新读取同一张图片以进行重复分析或使用不同的提示。
dsh-read-image DSH 插件适合谁
- 希望为纯文本模型扩展图片理解能力的 DeepSeek Harness 用户。
- 使用纯文本 LLM 但偶尔需要视觉输入的开发者和研究人员,无需切换多模态模型。
dsh-read-image DSH 插件的限制
- 需要配置一个独立的视觉模型(提供商和模型必须支持图片输入)。
- 依赖 Harness 的内部合约;如果 Harness 版本发生不兼容变化,安全自检可能阻止加载。
- 视觉模型调用消耗 API 令牌并可能产生费用;默认超时为 5 分钟,但可调整。
- 该插件处于早期开发阶段(v0.1.0),可能与未来版本的 DeepSeek Harness 不兼容。
dsh-read-image DSH 插件的仓库 README 摘录
以下文字摘自 dsh-read-image DSH 插件的上游仓库 OoWJZZoO/dsh-read-image 的 README,版权归原作者,仅作引用。
> Plug-and-play image reading for text-only DeepSeek Harness models: pasted images are admitted, projected as `[Image #N]`, and read back through a first-class `read_image` tool backed by a configurable vision model — no preset changes required. A [DeepSeek Harness](https://github.com/deepseek-ai/deepseek-harness) plugin that lets **non-multimodal models "see" images**. - **Pasted images are no longer rejected** — text-only routes are declared to accept image input, so the api-proxy admission gate lets them through. - **`[Image #N]` projection** — on text-only routes, image blocks in the model request are replaced in place with `[Image #N]` text; pixels never reach a text API. Native multimodal routes pass through untouched. - **First-class `read_image` tool** (registered automatically in every session, shadowing the built-in tool of the same name): - `image_index` — read the Nth image in the conversation (`[Image #N]`); - `file_path` — read an image file from a path (PNG/JPEG/WebP/GIF); - `prompt` / `reasoning_effort` / `timeout_ms` / `max_tokens` / `max_thinking_tokens` — optional overrides; omitted parameters use the configured defaults (the current real defaults are int
阅读完整 README仓库许可: MIT
dsh-read-image DSH 插件常见问题
如何安装 dsh-read-image?
运行 `dsh plugin --profile web add github:OoWJZZoO/dsh-read-image`,然后重启 `dsh web`。你也可以手动安装:将包添加到 profile 的依赖中,并在 `cordis.patch.yml` 中插入插件行。详细步骤请查看 README。
需要配置什么视觉模型?
你需要一个支持图片输入的多模态模型(例如 pi-ai 路由,设置 `input: [text, image]`)。在 `settings.yaml` 的 `dsh-read-image` 部分或通过 Web 界面(设置 → 读取图片)设置提供商和模型。插件将使用该模型处理图片。
为什么 read_image 返回空结果或报错?
常见原因:视觉模型未正确配置、模型提供商不支持图片输入、图片文件路径无效、或模型的令牌限制(思考+输出)超限。请检查会话日志以及 `~/.dsh/logs/dsh-read-image-guard.log` 中的诊断信息。
在多模态路由上能使用 read_image 吗?
可以,但在已经声明图片输入的路由(如 mimo-v2.5)上,插件不会注入 `[Image #N]` 占位符或注册自定义工具。此时会使用内置的 `read_image` 工具(返回图片本身)。插件仅在纯文本路由上激活。
插件在 Windows 上能工作吗?
可以。插件运行时是纯 Node.js,Windows 完全支持。所有命令使用 `%USERPROFILE%` 代替 `~`。Harness 原生处理 Windows 路径。手动安装步骤相同;如果用到 POSIX 脚本,请在 Git Bash、WSL 或 MSYS2 下运行。