
ferstar/dsh-tool-ocr
30最近提交 2026年8月15日
dsh-tool-ocr DSH 插件
dsh-tool-ocr 是一个独立的 DeepSeek Harness 插件,为没有视觉输入能力的模型(如 DeepSeek 聊天模型)添加了 `ocr` 工具,使其能够从本地图像或会话附件中提取文本。该插件基于 newbee-ocr 引擎(PP-OCRv6),支持路径和附件 ID 两种输入方式。需要预装 nbocr 二进制文件,并可配置语言、检测模型、超时等参数。
如何安装 dsh-tool-ocr DSH 插件
dsh plugin --profile web add dsh-tool-ocr复制不会执行命令。安装 dsh-tool-ocr DSH 插件前请核对仓库和版本。
dsh-tool-ocr DSH 插件数据来源
dsh-tool-ocr DSH 插件快照日期:2026年8月16日
discovered
dsh-tool-ocr DSH 插件能做什么
- 提供 `ocr` 工具,包含 `recognize`、`status`、`install`/`check` 动作。
- 支持通过本地文件路径(相对于会话工作区)或 `attachment_id`(从会话附件物化)输入图像。
- 输出按阅读顺序排列的文本、引擎信息、逐块边界框、审核标志以及启发式 Markdown 表格。
- 能处理 MNN 诊断输出对引擎 stdout 的污染,并支持调用取消和超时。
- 可配置参数:命令、参数、环境变量、语言、检测模型、最大图像大小、最大输出大小、最大文本字符数、超时时间。
dsh-tool-ocr DSH 插件适合哪些场景
- 让 DeepSeek 聊天模型能够读取对话中的屏幕截图或扫描文档中的文字。
- 在自动化工作流中提取图像中的文本,例如处理收据、表单或验证码。
- 结合 dsh 分支的图像占位符功能,实现类似多模态模型的拖放式 OCR 体验。
- 作为自定义工具的基础组件,在 DeepSeek Harness 中集成 OCR 能力。
dsh-tool-ocr DSH 插件适合谁
- 使用 DeepSeek Harness 并希望为纯文本模型添加 OCR 功能的用户。
- 在 DSH 环境中编写自动化脚本需要提取图像文本的开发者。
dsh-tool-ocr DSH 插件的限制
- 需要手动安装 nbocr 二进制文件(预编译或从源码构建)并配置其路径。
- 在官方 DeepSeek Harness 中仅支持文件路径输入;附件 ID 输入需要使用特定分支并启用图像占位符。
- 图像格式和大小受 maxImageBytes(默认25MB)和 maxTextChars(默认12000)限制。
- OCR 准确率依赖 PP-OCRv6 模型和输入图像质量,可能无法同等处理所有语言或字体。
dsh-tool-ocr DSH 插件的仓库 README 摘录
以下文字摘自 dsh-tool-ocr DSH 插件的上游仓库 ferstar/dsh-tool-ocr 的 README,版权归原作者,仅作引用。
English | [中文](README.zh.md) A standalone [DeepSeek Harness](https://github.com/deepseek-ai/deepseek-harness) plugin: local image text recognition for models **without vision input** (e.g. DeepSeek chat models), backed by the standalone [newbee-ocr](https://github.com/zibo-chen/newbee-ocr-cli) (`nbocr`) engine over PP-OCRv6 models. Fully out-of-tree: depends only on published dsh base packages (`@deepseek-ai/cordis`, `@deepseek-ai/dsh-tools`, `@deepseek-ai/dsh-subprocess`, …). No coupling to the deepseek-harness repository. ## What it provides | Item | Description | |---|---| | `ocr` tool | Model-facing tool: `recognize` / `status` / `install` (alias of check) / `check` actions | | Image inputs | Local `path` (resolved against the session workspace) or `attachment_id` (image already attached to the conversation, materialized to a temp file) | | Output | Reading-ordered `<text>`, engine facts, per-block bounding boxes (`include_boxes`), review flags (low-confidence / amount / numeric / date / quantity, `needsReview`), heuristic Markdown table (`table`) | | Robustness | Survives MNN diagnostics polluting engine stdout; honors caller cancellation and timeout | ## Two ways to use
阅读完整 README仓库许可: MIT
dsh-tool-ocr DSH 插件常见问题
如何安装 dsh-tool-ocr?
首先,从 newbee-ocr-cli 发布页安装 nbocr 二进制文件(例如使用一键安装脚本)。然后运行 `dsh plugin --profile web add dsh-tool-ocr` 将插件添加到您的 DSH 配置文件中。最后,按照 README 中的说明将插件配置添加到 `cordis.patch.yml` 文件中。
为什么在官方 DeepSeek Harness 中 ocr 工具无法使用图像附件?
官方 DeepSeek Harness 会阻止未声明图像输入的模型上传图像,该插件无法绕过此限制。您只能使用 `path` 输入方式(例如 `ocr { path: "C:/image.png" }`)。要使用 `attachment_id`,需要使用支持图像占位符的 DSH 分支版本。
OCR 支持哪些语言?
插件本身是语言无关的,实际支持的语言取决于 nbocr 引擎和 PP-OCRv6 模型。您可以通过 `language` 选项配置(例如 'chinese'、'english'),具体取决于 nbocr 中可用的模型。请参考 newbee-ocr-cli 文档获取完整的支持语言列表。
如果 OCR 引擎无法产生输出,如何调试?
首先检查 nbocr 二进制文件是否正确安装以及 `command` 路径是否有效。运行工具时使用 `action: "status"` 验证引擎就绪状态。如果引擎有输出但插件没有返回,请检查 `maxOutputBytes` 和 `maxTextChars` 限制。您也可以直接使用测试图像运行 nbocr 二进制文件来隔离问题。
dsh-tool-ocr 可以用于 DeepSeek 聊天模型以外的模型吗?
可以,该插件适用于 DeepSeek Harness 中的任何纯文本模型,只要模型能够调用工具。`ocr` 工具作为函数提供给模型,不限于 DeepSeek 聊天模型。