
YOGEMOW/DeepSeek_Prism
30最近提交 2026年8月15日
DeepSeek_Prism DSH 插件
DeepSeek_Prism 是一个 DSH 插件,让纯文本模型(如 deepseek-v4-flash)能理解图片。它调用外部视觉 API 提取可见事实,压缩为紧凑的 VEP/1 证据包回传主模型,支持自动缩放、多 Provider 降级和本地缓存。
如何安装 DeepSeek_Prism DSH 插件
dsh plugin --profile <name> add @yogemow/deepseek-prism-dsh来源命令需要人工核对。复制不会执行命令。
DeepSeek_Prism DSH 插件数据来源
DeepSeek_Prism DSH 插件快照日期:2026年8月16日
discovered
DeepSeek_Prism DSH 插件能做什么
- 当模型无法读取图片(Unsupported format / binary)时强制触发识别。
- 默认输出 ≤520 字符(约 50–150 tokens)的 VEP/1 紧凑证据。
- 支持五种详细模式的分节报告:页面还原、问题定位、报错日志、文本表格、图表数据。
- 自动缩放超过 2048px 的图片(使用内置 sharp),支持 AVIF/TIFF/SVG 转为 PNG。
- 多 Provider 预设(SiliconFlow、智谱、ModelScope、阿里、OpenRouter、Groq)与自动降级。
- SHA-256 本地缓存,24 小时 TTL,上限 1000 条,支持 `--no-cache` 跳过。
DeepSeek_Prism DSH 插件适合哪些场景
- 让纯文本模型读取截图,提取 UI 元素或错误信息。
- 分析图表和图形,返回结构化数据供后续处理。
- 处理扫描文档或表格,模型无法直接解析图片格式时。
- 在对话中自动将上传的图片转换为文本证据输入模型。
- 调试视觉 API 调用,测试不同 Provider 而无需修改主模型。
DeepSeek_Prism DSH 插件适合谁
- 使用 DeepSeek Harness 且需要偶尔识图能力的纯文本模型开发者。
- 希望避免切换多模态模型,但仍能在工作流中受益于图像分析的用户。
DeepSeek_Prism DSH 插件的限制
- 需要外部视觉 API 密钥(如 SiliconFlow API key),不是本地视觉模型。
- 仅支持 Node.js >= 18;纯 CLI 环境可能缺少 sharp 缩放后端。
- VEP 输出是压缩摘要,不是完整图像描述,复杂场景可能丢失细节。
- 插件仍在早期开发阶段(v0.7.1),大图或动画图片可能存在边缘情况。
DeepSeek_Prism DSH 插件的仓库 README 摘录
以下文字摘自 DeepSeek_Prism DSH 插件的上游仓库 YOGEMOW/DeepSeek_Prism 的 README,版权归原作者,仅作引用。
为纯文本 DeepSeek 模型(如 `deepseek-v4-flash`)提供按需识图能力的 Codex / DeepSeek Harness(DSH)双平台 Skill:图片由外部视觉 API 提取可见事实,压缩为低 Token 的 VEP/1 视觉证据包回传主模型,由主模型继续完成推理、规划与决策。 ## 版本选择 | 版本 | 定位 | 说明 | | --- | --- | --- | | **[v0.7.1](https://github.com/YOGEMOW/DeepSeek_Prism/releases/tag/v0.7.1)** | **零补丁版** | DSH 当前主线:自包含 Cordis 组合包,`prism_see` 工具 + 纯文本模型图片准入 VEP 降级 + 技能运行时注册 + 设置卡片;harness 本体零改动、上游更新零冲突、卸载零残留 | | **[v0.6.2](https://github.com/YOGEMOW/DeepSeek_Prism/releases/tag/v0.6.2)** | **实用版** | DSH 完整 UI 体验:原图保留展示 + VEP 折叠链接/识别进度卡片 + Web 设置卡片可编辑;需应用 `harness-patch/dsh-prism-harness.patch`(可选增强) | | **[v0.2.0](https://github.com/YOGEMOW/DeepSeek_Prism/releases/tag/v0.2.0)** | **Codex 推荐 skills 版** | Codex 平台的技能本体(SKILL.md + `scripts/vision.mjs` + references),安装到 `~/.codex/skills/deepseek-prism` | ## 功能 - 强制触发协议:主模型无法直接读图(Unsupported format / 无法读取 / binary)时,立即调用 `scripts/vision.mjs` 识图。 - VEP/1 紧凑证据:默认输出 ≤520 字符(约 50–150 tokens),字段按优先级裁剪。 - `--detail` 五模式分节报告:页面还原(A1–A7)/ 问题定位 / 报错日志 / 文本表格 / 图表数据。 - 自动分级:小图/简单任务默认 VEP/1;长内容(代码截图、长日志、文档、宽/高比大的图)自动走 `--detail` 完整通道;超长内容自动续写并合并。 - 程序化输出:`--raw` 输出清洗后的原文;`--full` 输出 `{raw, parsed}` JSON 信封。 - 输入预处理:解析图片宽高(含 AVIF/TIFF/SVG 的 sharp metadata 回退),超过
阅读完整 README仓库许可: MIT
DeepSeek_Prism DSH 插件常见问题
如何安装 DeepSeek_Prism DSH 插件?
在终端中运行命令 `dsh plugin --profile <name> add @yogemow/deepseek-prism-dsh`,将 `<name>` 替换为你的 DSH 配置文件名称(如 `web`)。插件会自动安装最新版本(v0.7.1)。安装完成后重启 DSH web 服务即可生效。
使用这个插件需要 API 密钥吗?
是的,你需要一个受支持的视觉提供商的 API 密钥。插件默认使用 SiliconFlow,因此你需要设置 `SILICONFLOW_API_KEY` 环境变量或放在 `.env` 文件中。你也可以通过 `VISION_PROVIDER` 和 `VISION_API_KEY` 环境变量配置其他提供商,如智谱、ModelScope 或 Groq。
支持哪些图片格式?
插件支持常见的图片格式如 PNG、JPEG、GIF、WebP,还能处理 AVIF、TIFF 和 SVG 格式,会通过 sharp 库转换为 PNG。对于动画 GIF,缩放时会保留所有帧。图片必须通过本地文件路径或 URL 访问。
什么是 VEP?为什么它重要?
VEP 是视觉证据包(Visual Evidence Packet)的缩写。它是一种紧凑格式,将图片中的可见事实压缩为低 Token 表示(通常 50–150 tokens),以便纯文本模型在不超出上下文限制的情况下使用这些信息。默认的 VEP/1 输出是一个结构化摘要,包含来源、模型、行动、目标、摘要和细节等字段。
我可以在没有 DSH Web 界面的情况下使用这个插件吗?
可以,插件也可以在 CLI 环境中工作,但需要确保模型能调用 `prism_see` 工具。如果没有 Web 界面,你仍然可以安装插件并通过 DSH CLI 使用。不过,对话中自动将上传图片转换为 VEP 的功能需要 Web 前端;在 CLI 中,你需要手动调用 `vision.mjs see` 并传入图片路径。