跳到正文

ximengxiaolan/dsh-vision-bridge

30最近提交 2026年8月14日

dsh-vision-bridge DSH 插件

dsh-vision-bridge 通过补丁方式让 DSH 支持在纯文本模型输入框中粘贴图片。它会拦截发送前的图片附件,调用配置的 OpenAI 兼容视觉模型生成文字描述,替换掉图片内容。会话中图片仍会显示,便于用户参考。

如何安装 dsh-vision-bridge DSH 插件

dsh plugin --profile web add dsh-vision-bridge

复制不会执行命令。安装 dsh-vision-bridge DSH 插件前请核对仓库和版本。

dsh-vision-bridge DSH 插件数据来源

dsh-vision-bridge DSH 插件快照日期:2026年8月16日

discovered

dsh-vision-bridge DSH 插件能做什么

  • 自动检测粘贴的图片,调用视觉模型将其转换为文字描述。
  • 同一进程内缓存同一图片(按 attachmentId)的描述,避免重复计费。
  • 视觉模型调用失败时降级显示错误信息,不影响对话继续。
  • 支持通过环境变量或 profile YAML 配置 API Key、Base URL、模型和语言。
  • 当路由模型原生支持图片时,直接放行原图,不进行转换。

dsh-vision-bridge DSH 插件适合哪些场景

  • 在纯文本模型(如 DeepSeek V4/V4-Flash)对话中发送图片。
  • 无需切换模型即可获得图片理解能力。
  • 避免同一图片重复调用视觉模型产生费用。
  • 使用任意 OpenAI 兼容视觉模型(如 qwen-vl-max、GLM-4V)进行图片识别。

dsh-vision-bridge DSH 插件适合谁

  • 使用纯文本模型但需要附带图片的 DeepSeek 用户。
  • 希望在不更换模型的情况下为 DSH 集成视觉能力的开发者。

dsh-vision-bridge DSH 插件的限制

  • 需要自备 OpenAI 兼容视觉模型的 API Key 和 Base URL。
  • 子智能体会话因 DSH 内核限制不支持贴图。
  • 描述准确性依赖所选视觉模型,可能产生错误或不完整的描述。

dsh-vision-bridge DSH 插件的仓库 README 摘录

以下文字摘自 dsh-vision-bridge DSH 插件的上游仓库 ximengxiaolan/dsh-vision-bridge 的 README,版权归原作者,仅作引用。

让纯文本模型(DeepSeek V4 / V4-Flash)在对话里"看见"图片:**在输入框直接粘贴图片并发送,插件自动调用一个 OpenAI 兼容的视觉模型(VLM)把图片识别成文字描述,再把描述喂给 DeepSeek 继续处理。** 会话中图片照常显示;只有发给模型的内容变成文字。 ## 原理 DSH 对纯文本模型会在提交时拒绝图片(`MODEL_DOES_NOT_SUPPORT_IMAGES`)。本插件打通两个官方扩展点: 1. **准入放行**:给 `ctx.llm.resolveModelInfo` 打补丁,声明当前模型支持 `image` 输入,让图片附件能进入会话。 2. **发模型前转换**:包装 `llm.streamWithRegistration`,每次请求发往模型前扫描所有消息中的图片块,调用配置的 VLM 生成文字描述,替换成: ``` [用户附上的图片已由视觉模型自动识别(qwen-vl-max)] <描述内容> ``` 如果路由到的模型**原生支持图片**,则放行原图、不做转换。 ## 安装 ```sh # 前置:dsh CLI 与 pnpm dsh plugin --profile web add dsh-vision-bridge # 或从 git 安装: dsh plugin --profile web add https://github.com/<your-name>/dsh-vision-bridge ``` 安装后重启 profile(`dsh web`)。 ## 配置 唯一需要的是一个 **OpenAI 兼容多模态模型**(`/chat/completions` + `image_url`),例如阿里云百炼 `qwen-vl-max`、智谱 GLM-4V 等。 环境变量: ```powershell $env:VISION_API_KEY = "sk-..." $env:VISION_BASE_URL = "https://dashscope.aliyuncs.com/compatible-mode/v1" $env:VISION_MODEL = "qwen-vl-max" $env:VISION_LANG = "zh" # zh | en ``` 或在 profile 的 `cordis.patch.yml` 中配置(优先于环境变量): ```yaml - id: dsh-vision-bridge config: apiKey: 'sk-...' baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1' model: 'qwen-vl-max' lang: z

阅读完整 README仓库许可: MIT

dsh-vision-bridge DSH 插件常见问题

dsh-vision-bridge 支持哪些模型?

它适用于 DSH 路由到的任何模型,但专门为纯文本模型(如 DeepSeek V4 和 V4-Flash)设计。如果模型原生支持图片,插件会直接放行原图而不转换。用于描述图片的视觉模型必须兼容 OpenAI API(如 qwen-vl-max、GLM-4V)。

如何配置视觉模型?

你可以设置环境变量 VISION_API_KEY、VISION_BASE_URL、VISION_MODEL 和 VISION_LANG。或者在 cordis.patch.yml 中插件的 config 块下配置。Base URL 必须指向支持 /chat/completions 且能处理 image_url 的端点。

图片描述会被缓存吗?

是的,在同一进程内,插件会根据图片的 attachmentId 缓存描述。如果你多次发送同一张图片,插件会复用之前的描述,不会重复调用视觉模型,从而节省费用和时间。

视觉模型调用失败怎么办?

如果视觉模型调用失败(超时、错误等),插件不会中断对话。它会将图片替换为类似「[图片识别失败: 原因]」的文字,让你可以继续对话。

子智能体会话中可以使用本插件吗?

不可以。子智能体会话仍然受 DSH 内核限制,不支持贴图。本插件仅在主聊天界面中生效。