跳到正文

XyTT2N2bTc/dsh-aux-vision

40最近提交 2026年8月14日

dsh-aux-vision DSH 插件

dsh-aux-vision 是一款 DSH 插件,可为任意纯文本大模型添加视觉能力。它自动将图片路由至视觉模型(默认 opencode-go/mimo-v2.5),将图片转换为像素级描述,并将描述注入当前对话轮次供主模型使用。插件无需修改主模型或路由,且通过缓存避免重复视觉调用。

如何安装 dsh-aux-vision DSH 插件

dsh plugin --profile web add github:<owner>/dsh-aux-vision

来源命令需要人工核对。复制不会执行命令。

dsh-aux-vision DSH 插件数据来源

dsh-aux-vision DSH 插件快照日期:2026年8月16日

discovered

dsh-aux-vision DSH 插件能做什么

  • 通过能力申报补丁,为任意纯文本模型声明图片支持
  • 纯文本轮次零视觉调用,历史图片从缓存重写,不消耗模型资源
  • 视觉模型不可用时支持占位文本降级或报错
  • 提供 vision_ask 工具,允许主模型针对指定附件二次提问
  • 描述缓存支持按 provider/model 和附件 ID 缓存,TTL 可配置
  • 原生视觉路由(会话/子代理使用声明 image 的模型)时不重写、不注入

dsh-aux-vision DSH 插件适合哪些场景

  • 在对话中使用纯文本模型(如 DeepSeek-V3)的同时,讨论用户上传的图片
  • 为之前仅支持文本的工作流增加图片分析能力,无需更换主模型
  • 为自定义微调模型添加视觉理解功能
  • 构建多模态 Agent,由文本模型解读独立视觉模型生成的描述

dsh-aux-vision DSH 插件适合谁

  • 希望保留喜爱的纯文本模型但偶尔需要图片理解的 DSH 用户
  • 需要视觉上下文但不想切换至原生视觉模型的开发者,构建 Agent 或工作流

dsh-aux-vision DSH 插件的限制

  • 视觉模型自身可能产生不准确的描述(如 mimo v2.5 偶发质量波动)
  • 能力申报补丁会导致文本模型在 models 目录显示为支持图片(外观副作用)
  • 需要手动配置视觉候选链或依赖自动发现;默认无预配置的降级方案
  • 仅限 DSH 环境下使用,不是独立解决方案

dsh-aux-vision DSH 插件的仓库 README 摘录

以下文字摘自 dsh-aux-vision DSH 插件的上游仓库 XyTT2N2bTc/dsh-aux-vision 的 README,版权归原作者,仅作引用。

DeepSeek Harness 辅助视觉插件:**任意纯文本主模型 + 任意有识图能力的模型**(默认 `opencode-go/mimo-v2.5`)。含图轮次自动让视觉模型看**原图(像素级)**,并把描述以文本 注入当前轮供主模型使用;纯文本轮**零视觉调用**。主模型与路由保持完全不变。 ## 核心优势 - **不换主模型**:为任意文本模型补齐图片准入,再由独立视觉模型完成识图。 - **自动且保真**:用户图片、历史图片和 `read_image` 结果都会按需转为像素级描述;会话 UI 仍保留原图。 - **成本可控**:纯文本轮零视觉调用;同图描述按视觉模型和附件缓存,重复图不消耗批次名额。 - **稳定降级**:视觉模型不可用、限流或超时时,可继续对话并注入可识别的占位文本。 - **可定向追问**:`vision_ask` 能让主模型针对指定附件或本地图片再次提问,无须更换当前会话模型。 零运行时依赖(不 import 任何 `@deepseek-ai` 包,全部结构调用 `ctx.llm` / `ctx.attachments`), 完整复用 DSH 的 llm 服务管线(`resolveModelInfo` / `prepareCall` / 流式协议),不重复实现 provider 适配。 ## 工作原理 ``` 发图(prompt RPC) ── 准入守卫 ──┬─ 通过(① 能力申报:未声明 image 的模型补报 image) └─ 拒绝(未安装插件时的现状) ↓ followup → inbox → 原图消息落日志(**UI 显示原图**) ↓ 请求构建(历史含图消息一并进入请求) ② llm/stream:请求含图 & 路由未声明 image ├─ 有图:视觉模型看原图 → 描述文本原位替换 image 块(改写请求副本)→ 主模型作答 └─ 无图:直通(零视觉调用、零开销) ``` | 环节 | 说明 | | --- | --- | | ① 能力申报 | 补丁 `llm.resolveModelInfo`:凡原方法未声明 `image` 的模型,在返回副本中补入 `image`。prompt 准入守卫 / selectModel 守卫 / read_image 模态闸门因此对任意文本模型放行。pi-ai 适配器线路级检查读 pi-ai 目录,不受影响(最后一道安全网)。卸载/禁用即还原。 | | ② 注入 | `llm/stream`:LOOP 请求含图(用户发图 / read_image 工具结果 / 历史图片)且路由未声明 image 时,把图片块替换为视觉描述(缓存优先)或占位,改写请求副本放行。

阅读完整 README仓库许可: MIT

dsh-aux-vision DSH 插件常见问题

如何安装 dsh-aux-vision?

可以通过 DSH 插件命令安装:`dsh plugin --profile web add github:<owner>/dsh-aux-vision`。也可以手动构建并复制文件到 profile 的 node_modules 目录,具体步骤见 README。

这个插件支持所有纯文本模型吗?

是的,它支持 DSH 支持的所有纯文本模型。插件会修补模型的能力声明,使其显示为支持图片,路由和守卫逻辑会放行图片。实际图片理解由独立的视觉模型完成。

我可以用自己的视觉模型吗?

当然可以。在插件配置中设置 `visionChain` 列表,指定你偏好的视觉模型(provider 和 model 名称)。如果链不可用,插件会自动扫描所有已注册 provider 的图片模型作为兜底。

每张图片都会产生额外费用吗?

不一定。插件会缓存图片描述(按 provider/model 和附件 ID),重复图片(同一图片同一轮或后续轮次)不会触发视觉调用。只有新图片或缓存未命中时才会调用视觉模型。

如果视觉模型不可用或超时怎么办?

默认情况下,插件会插入占位文本(如 '[图片附件 {id}:辅助视觉模型暂不可用]')并继续对话。你也可以配置为报错。主模型仍会收到消息,对话不会中断。