跳到正文

Zachary7456/dsh-voice-mic

30最近提交 2026年8月15日

dsh-voice-mic DSH 插件

dsh-voice-mic 为 DSH Web 界面增加实时语音转写功能。提供三种识别引擎:浏览器内置(Web Speech API)、本地离线后端(sherpa-onnx + SenseVoice/Paraformer)和云端 API(兼容 OpenAI)。用户可通过麦克风按钮或快捷键(Alt+V)录音,转写结果实时写入输入框,不自动发送。

如何安装 dsh-voice-mic DSH 插件

dsh plugin --profile web add github:Zachary7456/dsh-voice-mic

复制不会执行命令。安装 dsh-voice-mic DSH 插件前请核对仓库和版本。

dsh-voice-mic DSH 插件数据来源

dsh-voice-mic DSH 插件快照日期:2026年8月16日

discovered

dsh-voice-mic DSH 插件能做什么

  • 录音期间实时将识别结果写入输入框
  • 三种引擎可选:浏览器内置、本地离线后端、云端 API
  • 一键部署本地后端(Python + 模型下载,支持断点续传)
  • 支持中、英、日、韩、粤等多语言(SenseVoice 模型)
  • 快捷键 Alt+V(可配置)切换录音
  • 云端 API 兼容 OpenAI、Groq、硅基流动等
  • 本地后端只绑定 127.0.0.1,音频不出本机
  • 无需构建步骤,client 半改动刷新即生效

dsh-voice-mic DSH 插件适合哪些场景

  • 在 DSH Web 界面中免手打字,用语音输入
  • 离线使用本地模型进行语音识别,保护隐私
  • 多语言转写,满足国际用户需求
  • 对接已有的 OpenAI 兼容接口,自定义 ASR 服务
  • 快速记录笔记或通过语音执行命令

dsh-voice-mic DSH 插件适合谁

  • 习惯语音输入而非打字的 DSH Web GUI 用户
  • 需要扩展 DSH 语音能力的开发者
  • 在打字不便的环境中(如无障碍、移动场景)的用户

dsh-voice-mic DSH 插件的限制

  • 浏览器识别需 Chrome/Edge(Web Speech API 限制)
  • 快捷键仅在页面获得焦点时生效(浏览器限制)
  • 本地后端需要 Python 3.9+ 并下载模型(约 158–223 MB)
  • 云端 API 会产生费用;录音期间约每秒调用一次 API
  • DSH 重启后需重新部署本地后端,除非配置 autoStart
  • 本地后端仅绑定 127.0.0.1,其他主机无法访问

dsh-voice-mic DSH 插件的仓库 README 摘录

以下文字摘自 dsh-voice-mic DSH 插件的上游仓库 Zachary7456/dsh-voice-mic 的 README,版权归原作者,仅作引用。

DeepSeek Harness Web GUI 语音输入插件。录音后实时转写并写入输入框,不自动发送。 ## 安装 要求:dsh `>=0.1.0-rc.6`、Node.js `>=18`。浏览器识别需 Chrome/Edge;本地后端另需 Python `3.9+`。 ```bash dsh plugin --profile web add github:Zachary7456/dsh-voice-mic # 或(npm 发布后):dsh plugin --profile web add dsh-voice-mic ``` 安装后重启 `dsh web`。插件带 bundle patch,会自动挂进 profile,无需手动改 `cordis.patch.yml`。 验证: ```bash dsh --profile web --dump-config | grep dsh-voice-mic curl -s http://127.0.0.1:3080/plugins/dsh-voice-mic/client.js | head -c 100 ``` ## 使用 - 输入框左侧麦克风按钮:点按切换录音,默认快捷键 `Alt+V`(设置页可改) - 录音期间识别结果实时写入输入框草稿;停止后提交,不自动发送 - 快捷键仅在页面获得焦点时生效(浏览器限制) - 实时写入采用追尾替换:只更新上次追加的尾缀,不覆盖手动输入;无结果或出错时自动回滚 ## 识别引擎 设置 → 语音输入 → 识别引擎,三选一。 ### 浏览器内置(默认) 零配置,走 Web Speech API。中文质量与延迟取决于浏览器与网络。说话停顿导致浏览器自行断开识别会话时,插件自动重启识别器继续监听,直到手动停止。 ### 本地离线后端 设置页一键部署:检测 Python → pip 安装依赖 → 下载模型(断点续传,可取消)→ 启动 `asr_server.py` → 轮询就绪。已下载的模型会缓存,切换模型免重复下载。 模型: | 模型 | 适用 | 大小 | |---|---|---| | SenseVoiceSmall int8 | 中/英/日/韩/粤,日常使用 | ~158MB | | Paraformer | 仅普通话,准确率与标点最佳 | ~223MB | - 模型目录:`~/.dsh/voice/models/<model>`(可用 `DSH_VOICE_MIC_MODEL_DIR` 覆盖);下载缓存:`~/.dsh/voice/cache` - 服务端口默认 `7860`,只绑定 `127.0.0.1` - 后端进程由 dsh 托管:dsh 重启后需重新点部署(或配置 `autoStart: true` 自动拉起) - 转写期间音频不出本机

阅读完整 README仓库许可: MIT

dsh-voice-mic DSH 插件常见问题

如何安装 dsh-voice-mic?

运行命令 `dsh plugin --profile web add github:Zachary7456/dsh-voice-mic`,安装后重启 `dsh web`。插件自带 bundle patch,会自动挂入 profile,无需手动修改 cordis.patch.yml。验证方式:`dsh --profile web --dump-config | grep dsh-voice-mic`。

为什么快捷键 Alt+V 没反应?

快捷键仅在浏览器页面获得焦点时生效,这是浏览器的安全限制。另外请检查是否在设置页面修改了快捷键。可以通过设置页或环境变量 `DSH_VOICE_MIC_HOTKEY` 更改快捷键。

本地后端可以在离线情况下使用吗?

可以。本地后端完全在本地运行,使用 sherpa-onnx 和 SenseVoice/Paraformer 模型。首次部署需要 Python 3.9+ 并下载模型(约158-223MB)。模型下载后会被缓存,后续离线识别无需网络。

如何配置云端 API 进行语音识别?

在设置 → 语音输入 → 识别引擎中选择「云端 API」。填入 base URL、API key 和模型名称。插件内置了 OpenAI、Groq、硅基流动的预设。API 密钥存储在浏览器 localStorage 中,由浏览器直连服务商,不经过 DSH。

支持哪些浏览器?

浏览器内置识别需要 Chrome 或 Edge(Web Speech API)。本地后端和云端 API 兼容任何支持 Web Audio API 的现代浏览器。插件 client 端是纯 JavaScript,在大多数浏览器中都能工作。