@haoku123/dsh-voice

@haoku123 · 语音与音频
检测未发现问题无安装脚本

为 DSH Web UI 提供全双工语音对话:按键/切换说话、实时字幕、宿主端语音识别与流式朗读,并支持真正的打断。

v0.7.0版本
GitHub 源码安装安装方式
2026-08-19最近更新
3Star
dsh plugin --profile web add github:haoku123/dsh-voice查看仓库

插件介绍

根据仓库资料整理 · commit edccb01

主要功能

  • 支持点按切换或按住说话(发送键/Ctrl)两种语音输入方式,并显示实时字幕。
  • 宿主端使用 SenseVoice(sherpa-onnx)进行语音识别,原生支持简体中文、标点及逆文本正规化(ITN)。
  • AI 回复按句流式合成并朗读(Edge TTS),通过 SSE 推送到前端。
  • 真正的打断(barge-in):用户开口说话即停止播放并取消正在进行的回合。
  • 内置 ASR 模型缓存代理,支持断点续传及自定义 Hugging Face 镜像。
  • 连续对话模式下基于 RMS 的静音检测自动分段,全程无需 API key。

适合什么时候用

  • 希望在 DSH Web UI 中免打字、用语音与 AI 对话的场景。
  • 以中文为主、需要高准确率语音识别(含标点与 ITN)的用户。
  • 需要在 AI 正在朗读回复或推理时随时打断并重新发言的实时交互场景。

安装后会多出什么

界面输入框内的麦克风按钮(支持点按/长按语音输入) · 语音识别时的实时字幕/加载指示浮层

使用前需要

  • 需要 DSH Web UI(web profile)及配套依赖 @deepseek-ai/cordis、@deepseek-ai/dsh-web。
  • Node.js 版本需 ≥22.19 或 ≥24(需 node:zlib 的 zstd API)。
  • 首次使用需从 Hugging Face(或可配置的镜像,如 hf-mirror.com)下载语音识别模型文件。
  • 浏览器需授予麦克风权限,并依赖浏览器级回声消除(无 JS 层 AEC)。

在 GitHub 阅读完整 README

权限与能力

安装后它能碰到什么
不覆盖任何 dsh-base 宿主行:不接管沙箱、审批、凭据等能力。
宿主能力
浏览器 UI环境变量文件系统外部网络会话数据宿主子进程遥测
能力是范围不是结论:很多能力是功能所需。

基本信息

仓库haoku123/dsh-voice安装方式GitHub 源码安装(需 allowBuilds)安装提示源码安装会在你的机器上执行 prepare 构建,需要 allowBuilds 授权;建议用 github:haoku123/dsh-voice#edccb01 锁定本次检测的 commit。收录日期2026-08-15固定 commitedccb0133766 · 2026-08-19
dsh plugin --profile web add github:haoku123/dsh-voice