跳到正文

linkingoscar/dsh-attachment-formats

31最近提交 2026年8月15日

dsh-attachment-formats DSH 插件

该插件扩展了 DeepSeek Harness 聊天框,支持 PDF、Office 文档、TIFF、epub 等多种附件格式。它通过文档卡片保持输入区域整洁,对于长文档会溢出到工作区并使用索引卡片模式,让模型可以逐页读取,避免静默截断。

如何安装 dsh-attachment-formats DSH 插件

dsh plugin --profile web add github:linkingoscar/dsh-attachment-formats

复制不会执行命令。安装 dsh-attachment-formats DSH 插件前请核对仓库和版本。

dsh-attachment-formats DSH 插件数据来源

dsh-attachment-formats DSH 插件快照日期:2026年8月16日

discovered

dsh-attachment-formats DSH 插件能做什么

  • 支持 PDF(文本层提取,使用 pymupdf4llm 或 pdfjs;扫描 PDF 通过 tesseract.js、百度 OCR 或 VLM 识别)
  • 支持 Office 格式:.docx、.xlsx、.pptx 以及旧版 .doc、.xls、.ppt(通过 LibreOffice)
  • 支持电子书格式:epub、odt、rtf(通过 pandoc 或回退方案)
  • 将 TIFF 图像转换为 PNG 页面(多页,最多 20 页)
  • 读取文本文件(txt、md、json、代码),支持 UTF-8/GB18030 回退
  • 将 BMP、ICO、AVIF、SVG 等通过浏览器 canvas 转换为 PNG
  • 文档卡片:内容挂载在聊天框上方,发送时合并并添加来源标记
  • 长文档索引模式:内容溢出到工作区,模型通过 read 工具读取
  • 基于上下文压力的自适应合并限制
  • /attach 斜杠命令:list、full(合并全文)
  • 回形针按钮、拖拽、粘贴支持
  • 外部文档服务器和百度/VLM OCR 集成

dsh-attachment-formats DSH 插件适合哪些场景

  • 上传一个含文本层的 PDF,将其内容作为文档卡片合并到对话中
  • 处理扫描 PDF,通过 OCR 提取文本并输入到模型上下文
  • 拖拽一个含表格的 .docx 文件,表格结构保留为 Markdown 管道表格
  • 处理长 PDF(超过 8 万字符),使用索引卡片模式让模型逐页读取
  • 使用百度 OCR 或远程 VLM 提高扫描文档的识别准确率
  • 将多页 TIFF 图像转换为 PNG 页面供图像草稿栏使用

dsh-attachment-formats DSH 插件适合谁

  • 需要上传并处理 PDF、Office 和其他文档格式的 DeepSeek Harness 用户
  • 处理长文档、希望避免上下文截断的用户(索引卡片模式)

dsh-attachment-formats DSH 插件的限制

  • 旧版 Office 格式(.doc/.xls/.ppt)需要主机安装 LibreOffice headless(soffice)
  • epub、odt、rtf 需要 pandoc 以获得最佳效果;无 pandoc 时 epub/odt 回退到进程内提取,rtf 不支持
  • 扫描 PDF OCR 置信度低于 45 会回退到图像;外部 OCR(百度、VLM)需要 API 密钥或端点
  • TIFF 支持限制为每文件最多 20 页
  • 文本文件超过 16MB 会被拒绝;零拷贝仅适用于工作区中 512KB 到 16MB 的文件
  • PDF 文本提取通过 pymupdf4llm 限制为 40 页;更大的 PDF 使用更快的 pdfjs 引擎
  • 首次使用 tesseract.js 会下载约 24MB 的语言数据

dsh-attachment-formats DSH 插件的仓库 README 摘录

以下文字摘自 dsh-attachment-formats DSH 插件的上游仓库 linkingoscar/dsh-attachment-formats 的 README,版权归原作者,仅作引用。

English | [中文](README.zh.md) A [DeepSeek Harness](https://github.com/deepseek-ai/deepseek-harness) web plugin that makes the composer accept many more attachment formats, Codex-style. Zero core-package changes: a pure plugin that reuses the harness-native image draft rail, upload limits, history rendering and model request pipeline. ## Supported formats | File | Handling | Destination | | --- | --- | --- | | PNG / JPEG / WebP / GIF | native pipeline (plugin not involved) | image draft rail (native) | | **PDF (with text layer)** | text-layer extraction (≤40 pages via the pymupdf4llm high-fidelity engine; larger/unavailable falls back to pdfjs) | full text on a **document card** (merged on send); over-limit → workspace spill + index card | | **PDF (scanned / no text layer)** | tesseract.js OCR (accepted only at confidence ≥45), falls back to page images | OCR success → text channel; failure → image draft rail (vision models only) | | **Word (.docx) / Excel (.xlsx) / PPT (.pptx)** | text extraction — docx via mammoth HTML → turndown, **tables kept as Markdown pipe tables** | document card (merged on send); over-limit → spill + index card | | **Legacy .doc / .xls / .ppt** | LibreOff

阅读完整 README仓库许可: Apache-2.0

dsh-attachment-formats DSH 插件常见问题

如何安装 dsh-attachment-formats?

该插件是一个标准的 DSH 网页插件。您可以通过 DeepSeek Harness 的插件管理器添加该插件的仓库 URL 进行安装。README 未提供具体安装命令,但通常您可以通过宿主机的插件管理界面从 GitHub 添加此插件。

这个插件支持没有文本层的扫描 PDF 吗?

支持的,它通过 OCR 处理扫描 PDF。默认使用 tesseract.js,也可以集成百度 OCR API 或远程 VLM(兼容 OpenAI 的视觉端点)。如果 OCR 置信度低于 45,则回退到将页面图像作为图像草稿发送给视觉模型。

我可以附加很长的文档而不丢失内容吗?

可以,插件针对长文档(超过 8 万字符)提供了索引卡片模式。它会将内容溢出到工作区,只发送简短的索引卡片。模型可以通过原生的 read 工具逐页读取,因此不会静默截断任何内容。

除了 PDF 和 Office,还支持哪些格式?

支持 PDF、DOCX、XLSX、PPTX、旧版 Office 格式(通过 LibreOffice)、TIFF、EPUB、ODT、RTF、纯文本文件(txt、md、json、代码)以及多种图像格式(BMP、ICO、AVIF、SVG 等)。原生图像格式(PNG、JPEG、WebP、GIF)则通过内置管道处理。

使用这个插件需要安装额外的工具吗?

部分功能需要外部工具。旧版 Office 格式需要 LibreOffice headless(soffice)。epub/odt/rtf 建议安装 pandoc 以获得最佳效果。缺少这些工具时插件会显示明确的错误信息。OCR 方面,tesseract.js 开箱即用但首次使用会下载数据;百度 OCR 需要 API 密钥。