
Scorp1o117/dsh-tool-vision
40最近提交 2026年8月16日
dsh-tool-vision DSH 插件
dsh-tool-vision 桥接了纯文本模型与视觉输入之间的鸿沟。它提供 inspect_image 工具和图像桥接功能,将粘贴的图像转换为文本提示,保持代理循环不变性。支持任何 OpenAI 兼容的视觉 API(GPT-4o、Qwen-VL、GLM-4V 等)。
如何安装 dsh-tool-vision DSH 插件
dsh plugin --profile web add dsh-tool-vision复制不会执行命令。安装 dsh-tool-vision DSH 插件前请核对仓库和版本。
dsh-tool-vision DSH 插件数据来源
dsh-tool-vision DSH 插件快照日期:2026年8月16日
discovered
dsh-tool-vision DSH 插件能做什么
- inspect_image 工具:将本地文件或 URL 发送到任何 OpenAI 兼容的 /chat/completions 端点,返回文本答案。
- 图像桥接:在图像进入持久日志之前将其转换为文本提示,保持代理循环不变性。
- 全局工具层:inspect_image 工具全局注册,进程中所有代理均可调用。
- Web UI 设置(v0.3.0):配置 API 端点、密钥、模型和桥接选项,热生效无需重启。
- 零依赖(除 dsh SDK 外);支持 OpenAI、阿里云 DashScope、智谱、Moonshot、Ollama 等。
- 直接支持多模态模型:在 multimodalModels 中列出的模型会直接接收图像块。
dsh-tool-vision DSH 插件适合哪些场景
- 让纯文本 DSH 代理描述图像内容并回答相关问题。
- 将粘贴的图像桥接为文本提示,使对话日志与持久推导保持一致。
- 使用 inspect_image 工具自动化图像分析工作流(如截图分析、文档扫描)。
- 通过 Ollama 兼容端点集成本地视觉模型,实现离线图像处理。
- 使用 Web UI 设置快速切换不同视觉提供者,无需重启。
dsh-tool-vision DSH 插件适合谁
- 需要为代理添加视觉理解能力的 DSH 用户。
- 构建 AI 代理以处理聊天或自动化场景中图像的开发者。
- 希望利用外部视觉 API(如 GPT-4o、Qwen-VL)而不修改 DSH 核心的用户。
dsh-tool-vision DSH 插件的限制
- 桥接后的图像在对话中变为文本提示(而非像素),因此纯文本模型无法进行像素级上下文推理。
- 图像通过 base64 传输,请注意隐私和大小限制(默认最大 10 MB)。
- 该插件独立于 dsh-llm 路由/重试系统;失败时会向代理返回明确的错误信息。
dsh-tool-vision DSH 插件的仓库 README 摘录
以下文字摘自 dsh-tool-vision DSH 插件的上游仓库 Scorp1o117/dsh-tool-vision 的 README,版权归原作者,仅作引用。
**GitHub**: [Scorp1o117/dsh-tool-vision](https://github.com/Scorp1o117/dsh-tool-vision) · **npm**: [dsh-tool-vision](https://www.npmjs.com/package/dsh-tool-vision) [](https://github.com/Scorp1o117/dsh-enhancement-suite) [](https://www.npmjs.com/package/dsh-enhancement-suite) Part of the [DeepSeek Harness Enhancement Suite](https://github.com/Scorp1o117/dsh-enhancement-suite) — Vision · Soul/Persona · Long-term Memory · Plugin Marketplace. External vision model for [DeepSeek Harness](https://github.com/deepseek-ai/deepseek-harness). DeepSeek's own models are text-only, and the harness derives every model request strictly from the session log (`llm/stream` requests must equal the durable derivation — the agent-loop invariant). This plugin bridges the gap in two ways: 1. **`inspect_image` tool** — sends an image (local file, or http(s) URL) to **any OpenAI-compatible** `/chat/completions` endpoint that supports `image_url` content parts, and returns the vision model's textual answer into the agent loop. 2. **Image bridge (v0.2.1
阅读完整 README仓库许可: MIT
dsh-tool-vision DSH 插件常见问题
如何在 DSH 配置文件中安装 dsh-tool-vision?
你可以通过 npm 安装:在配置目录中运行 `pnpm add dsh-tool-vision`。然后在配置文件的 `cordis.patch.yml` 中添加挂载项,或者使用一键命令:`dsh plugin --profile web add dsh-tool-vision`。插件会自动发现并挂载。
支持哪些视觉模型?
该插件支持任何兼容 OpenAI 的 API,只要支持 `image_url` 内容部分。例如 OpenAI GPT-4o/GPT-4o-mini、阿里云 DashScope Qwen-VL、智谱 GLM-4V、Moonshot 以及本地 Ollama 的视觉模型(如 llama3.2-vision)。你可以在插件设置中配置 `baseURL` 和 `model`。
图像桥接是如何工作的?
当你将图像粘贴到纯文本模型时,桥接会在 `agent/pre-step` 瀑布中拦截消息,将图像内容替换为文本提示,例如 '[User sent an image, exported to: <path>. Inspect it with the inspect_image tool...]'。然后代理可以调用 `inspect_image` 通过配置的视觉端点分析图像。这保持了会话日志的不变性。
不使用 Web UI 也能使用该插件吗?
可以。插件完全在后台运行。你可以通过配置文件(`cordis.patch.yml`)或环境变量进行配置。Web UI 设置部分是可选的可视化配置方式;所有更改都可以直接编辑 `settings.yaml` 文件完成。
Web UI 中设置部分没有出现怎么办?
插件会在首次启动时自动修补 `dsh-host-apiproxy` 命名空间白名单。你需要重启一次 `dsh web` 使修补生效。之后设置部分应该会出现在 设置 → 视觉模型 下。如果仍然没有出现,请检查插件是否正确挂载,以及是否是最新版本。