
shinjiyu/dsh-plugin-multimodal
30最近提交 2026年8月15日
dsh-plugin-multimodal DSH 插件
本插件拦截 DSH 网页中的图片附件,区分处理:若主模型支持看图(如 Claude、GPT、自建网关),直接转发;若主模型仅文本(官方 DeepSeek),则通过可配置的侧车视觉模型转写图片(OCR+描述)后注入对话。同时提供 `see_image` 工具用于分析磁盘截图。
如何安装 dsh-plugin-multimodal DSH 插件
dsh plugin --profile web add github:shinjiyu/dsh-plugin-multimodal复制不会执行命令。安装 dsh-plugin-multimodal DSH 插件前请核对仓库和版本。
dsh-plugin-multimodal DSH 插件数据来源
dsh-plugin-multimodal DSH 插件快照日期:2026年8月16日
discovered
dsh-plugin-multimodal DSH 插件能做什么
- 直接转发图片到支持视觉的主模型
- 纯文本主模型下自动通过侧车模型进行图片转写
- 通过环境变量 DSH_VISION_* 配置侧车 API
- 未设 DSH_VISION_* 时回退 OPENAI_BASE_URL/OPENAI_API_KEY
- 提供 `see_image` 工具用于分析磁盘上的截图
- 支持在 cordis.patch.yml 中自定义注入点
dsh-plugin-multimodal DSH 插件适合哪些场景
- 在纯文本 DeepSeek 聊天中粘贴错误截图,询问红色文字内容
- 在 Claude 会话中附加 UI 原型图获取设计反馈
- 使用 `see_image` 命令分析磁盘上的截图
- 使用便宜的视觉侧车模型分担主模型的图片处理负载
- 集成自定义视觉网关(如 GLM-4.5V)作为侧车而不修改官方适配器
dsh-plugin-multimodal DSH 插件适合谁
- 需要在 DSH 网页聊天中粘贴图片的用户
- 希望使用侧车视觉模型为纯文本主模型转写图片的开发者
dsh-plugin-multimodal DSH 插件的限制
- 纯文本主模型场景下必须配置一个真正能看图的侧车模型(如 GLM-4.5V)
- 侧车模型不能是纯文本模型(如 deepseek-v4-flash)
- 仅适用于 `dsh web`;安装插件后旧会话的工具表不会更新
- 不是完整的视觉工具箱——仅处理附件准入,不提供模型主动调用的视觉工具
- 微信群二维码约 7 天过期,需手动覆盖文件更新
dsh-plugin-multimodal DSH 插件的仓库 README 摘录
以下文字摘自 dsh-plugin-multimodal DSH 插件的上游仓库 shinjiyu/dsh-plugin-multimodal 的 README,版权归原作者,仅作引用。
DeepSeek Harness 官方线路是**纯文本**。Web 里贴图会被拒:`当前模型不支持图片`。 这个插件补的是**贴图准入**,不是视觉工具箱。 1. 主模型本身收图(Claude / GPT / 自建视觉网关)→ 原样把图交给模型,不转文字 2. 主模型是纯文本(官方 DeepSeek)→ GUI 先收下图,sidecar 转成文字再发给主模型 3. `see_image` 给磁盘上的截图用 官方 PI adapter 已经会做第 1 步,不会做第 2 步:不支持就 `UNSUPPORTED_CONTENT`。Anionex 的 `dsh-vision-toolkit` 是另一条路:给 agent 一堆 `vision_*` 工具,要模型自己去调。本插件让**粘贴不被拒**。 对应需求:[Discussions #588](https://github.com/deepseek-ai/deepseek-harness/discussions/588) · 介绍帖:[Show and tell #1709](https://github.com/deepseek-ai/deepseek-harness/discussions/1709) ## 安装 ```powershell dsh plugin --profile web add github:shinjiyu/dsh-plugin-multimodal ``` 本地路径: ```powershell dsh plugin --profile web add D:\tempWorkspace\dsh-plugin-multimodal ``` 然后**重启** `dsh web`。旧会话的工具表不会更新。 GitHub topic:`dsh-plugin` ## 配置 环境变量(不要把 key 写进仓库): | 变量 | 作用 | |------|------| | `DSH_VISION_BASE_URL` | 视觉接口,例如 `https://api.example/v1` | | `DSH_VISION_API_KEY` | 该接口的 key | | `DSH_VISION_MODEL` | 必须是**真能看图**的模型,例如 `glm-4.5v` | | `DSH_VISION_PROMPT` | 可选。默认 OCR + 描述界面 | 没设 `DSH_VISION_*` 时回退 `OPENAI_BASE_URL` / `OPENAI_API_KEY`。`GLM-5.2-FP8` 这类文本模型**不能**当 sidecar。 也可以在 profile 的 `cordis.patch.yml` 里写: ```yaml - id: dsh-plug
阅读完整 README仓库许可: MIT
dsh-plugin-multimodal DSH 插件常见问题
为什么我粘贴图片还是提示“当前模型不支持图片”?
请确认已正确配置视觉侧车模型:设置 DSH_VISION_MODEL(如 glm-4.5v)和对应的 API key,并重启 `dsh web`。如果侧车未配置,插件无法转写图片。
可以用官方 DeepSeek 模型配合这个插件吗?
可以,这正是插件的主要用途。插件会自动检测官方 DeepSeek 模型为纯文本,然后使用你配置的侧车视觉模型将图片转写为文字,再输入给主模型。
应该使用什么侧车模型?
任何真正支持图片输入的模型,如 GLM-4.5V、GPT-4o、Claude 3.5 Sonnet 等。不要使用纯文本模型(如 deepseek-v4-flash、GLM-5.2-FP8)。侧车通过 DSH_VISION_MODEL 或 OPENAI 兼容接口配置。
如何分析磁盘上的截图文件?
安装插件后,在 DSH 对话中使用 `see_image` 工具,例如输入 `see_image: /path/to/screenshot.png`,插件会通过侧车模型进行分析。
插件支持哪些图片格式?
README 未明确限制格式,取决于侧车模型的支持情况。常见的 PNG、JPEG、WebP 等格式通常都能使用,前提是侧车模型支持。