
wangyang10/image-vision
80最近提交 2026年8月14日
image-vision DSH 插件
该插件为 DeepSeek Harness (DSH) 添加了视觉能力,使纯文本模型(如 DeepSeek)能够处理图片。它会自动调用 OpenAI 兼容的识图 API(包括 OpenRouter、SiliconFlow、智谱、Kimi、通义千问、本地 Ollama 等),支持图片描述、问答和 OCR。同时支持多图对比和结构化 JSON 输出,并在 macOS 上内置了图片预处理(HEIC/AVIF 转换、缩放、压缩)。
如何安装 image-vision DSH 插件
dsh plugin --profile web add dsh-image-vision复制不会执行命令。安装 image-vision DSH 插件前请核对仓库和版本。
image-vision DSH 插件数据来源
image-vision DSH 插件快照日期:2026年8月16日
discovered
image-vision DSH 插件能做什么
- 模型不具备视觉能力时自动调用识图 API
- 支持本地图片、http(s) URL 和 data URL
- macOS 自动预处理:HEIC/HEIF/AVIF 转 JPEG,TIFF/BMP 转 PNG,长边超 2048px 自动缩放,超 10MB 自动压缩
- 多图对比与问答
- OCR 文字提取,支持 --json 结构化输出
- 可通过环境变量或 .env 文件配置;DSH 插件还支持凭据存储
image-vision DSH 插件适合哪些场景
- 让纯文本模型描述照片内容
- 从截图或文档中提取文字(OCR)
- 比较两张图片并指出差异
- 在对话中引用图片进行上下文问答
- 在不离开聊天界面的情况下自动处理图片
image-vision DSH 插件适合谁
- 希望为纯文本模型添加视觉能力的 DSH 用户
- 构建需要理解图片但无需多模态模型的 AI 助手的开发者
image-vision DSH 插件的限制
- 运行时需要第三方识图 API 密钥(VISION_API_KEY)和网络连接
- 图片预处理(HEIC/AVIF 转换、缩放)目前仅支持 macOS(通过 sips)
- DSH 插件版本无需 Python 依赖,但标准技能版本需要 Python 3
- 图片大小限制:默认 maxEdge=2048px,maxBytes=10485760(10MB),可配置
image-vision DSH 插件的仓库 README 摘录
以下文字摘自 image-vision DSH 插件的上游仓库 wangyang10/image-vision 的 README,版权归原作者,仅作引用。
让没有视觉能力的模型(如 DeepSeek 等纯文本模型)也能"看图":自动调用 OpenAI 兼容的识图模型 API(OpenRouter、SiliconFlow、智谱、Kimi、通义千问、 本地 Ollama 等),完成图片描述、问答、OCR 等任务。 **一个仓库,多个 Agent 宿主**:同一套技能逻辑分别以标准 skill 和宿主插件的形式 提供给 Codex、Claude Code、DeepSeek Harness(DSH)等使用。 ## 支持的 Agent | Agent | 接入物 | 推荐安装方式 | 调用方式 | 运行时依赖 | |---|---|---|---|---| | **Codex** | 标准 skill(`skills/image-vision/`) | 自动安装 / 一键脚本 `TARGET=codex` | 发图提问自动触发;或手动跑 python 脚本 | python3 + sips(macOS) | | **Claude Code** | 标准 skill | 自动安装 / 一键脚本 `TARGET=claude` | 同上 | python3 + sips(macOS) | | **DeepSeek Harness (DSH)** | 插件(`dsh-image-vision/`,推荐) | 一键脚本 / 手动 / 把仓库地址发给 DSH 自动装 | 模型直接调 `vision_query` 工具;输入框 `/image-vision` | 无(纯 Node 内置模块) | | **DeepSeek Harness (DSH)** | 标准 skill(轻量方案) | 一键脚本 `TARGET=dsh` | 发图提问触发技能,模型跑 python 脚本 | python3 + sips(macOS) | | 其他支持 SKILL.md 的宿主 | 标准 skill | 复制到对应技能目录 | 依宿主而定 | python3 | ### 仓库结构 ``` image-vision/ ├── skills/image-vision/ # 标准 skill:Codex / Claude Code / 其他 SKILL.md 宿主 / DSH 轻量接入 │ ├── SKILL.md # 技能说明(各宿主通用) │ ├── scripts/vision_query.py │ ├── agents/openai.yaml │ └── references/providers.md ├── dsh-image-vision/ # DSH 插件:深度接入(Cordis 插件,独立可 publish) │ ├── lib/*.js #
阅读完整 README仓库许可: MIT
image-vision DSH 插件常见问题
如何配置 Image Vision 插件的 API 密钥?
在 ~/.dsh/image-vision.env 或 ~/.codex/image-vision.env 文件中添加 VISION_API_KEY=你的密钥。也可以直接设置环境变量。DSH 插件还支持将密钥存入 DSH 的凭据系统(设置页或 ~/.dsh/.credentials.yaml)。
支持哪些识图 API 提供商?
任何 OpenAI 兼容的识图 API:OpenRouter、SiliconFlow、智谱、Kimi、通义千问(Qwen)以及本地 Ollama。通过 VISION_API_BASE 和 VISION_MODEL 指定。详细示例见 references/providers.md。
使用插件需要安装 Python 吗?
DSH 插件版本(dsh-image-vision)是纯 Node.js ESM 模块,零 Python 依赖。只有标准技能版本(用于其他宿主)才需要 Python 3。
支持哪些图片格式?
本地图片:HEIC/HEIF/AVIF/TIFF/BMP/JPEG/PNG(macOS 会自动预处理前四种)。URL 和 data URL:支持远程 API 支持的任何格式。插件还会对过大图片进行缩放和压缩。
插件能在 Windows 或 Linux 上使用吗?
插件本身可在任何支持 Node.js 的 OS 上运行(DSH 可运行)。但自动图片预处理(HEIC/AVIF 转换、缩放)目前仅支持 macOS(使用内置 sips 工具)。在其他平台上,原始图片会直接发送,你可能需要手动转换格式。