@dsh-voice/bundle

@Jesse-njx · 语音与音频
检测有风险提示无安装脚本

为 DSH 终端 agent 提供语音输入与语音回复能力,支持免手动口述指令与后台任务语音播报。

v0.1.0版本
GitHub 源码安装安装方式
2026-08-13最近更新
2Star
dsh plugin --profile web add github:Jesse-njx/dsh-voice查看仓库

插件介绍

根据仓库资料整理 · commit 37164b1

主要功能

  • transcribe 工具将口述音频(文件或麦克风录音)转写为文字,并作为用户消息插入对话,而非工具输出。
  • speak 工具在后台任务中合成语音并播放,立即返回 jobId,不阻塞当前回合;失败时以提示形式注入而不中断对话。
  • 聊天界面展示带播放/暂停、时长、后端标记与转写文本的语音卡片,音频文件缺失时自动降级为纯文本卡片。
  • /voice 命令可开关自动朗读回复、查看状态,或直接从输入框发送一段文字合成语音。
  • 支持多种可选的语音转文字与文字转语音后端(whisper.cpp、macOS 内置识别、OpenAI、say、piper、edge-tts),默认离线优先,云端后端需显式配置才会启用。
  • 所有音频以本地文件形式存放于 ~/.dsh/voice,会话记录中仅保存引用与转写文本,不上传音频本身。

适合什么时候用

  • 离开键盘时想用语音口述一条指令,让 agent 转写后继续处理任务。
  • 长时间构建或无人值守的后台任务运行时,想让 agent 用语音播报结果而不是盯着日志。
  • 更喜欢终端 agent 用语音朗读回复,减少阅读大段文字输出的负担。

安装后会多出什么

界面聊天中的语音卡片(播放/暂停、时长、后端标记、转写文本)
命令/voice on/voice off/voice status/voice speak <text>
Agent 工具transcribespeak

使用前需要

  • 需要 DSH web 平台客户端(依赖 dsh-client-runtime 与 dsh-client-ui-conversation)。
  • 语音转文字默认使用离线后端(whisper.cpp 二进制或 macOS 内置 SFSpeechRecognizer),录音功能需要 ffmpeg 或内置 swift shim。
  • 文字转语音默认使用 macOS 自带 say 命令,也可配置本地 piper 或云端 edge-tts。
  • 若启用 OpenAI 语音转文字后端,需要配置 OPENAI_API_KEY。
  • 与 dsh-crosstalk 插件配合使用可将语音转写发送给其他本地会话(可选)。

在 GitHub 阅读完整 README

权限与能力

安装后它能碰到什么
不覆盖任何 dsh-base 宿主行:不接管沙箱、审批、凭据等能力。
宿主能力
Agent 控制浏览器 UI凭据环境变量文件系统外部网络会话数据宿主子进程
能力是范围不是结论:很多能力是功能所需。

基本信息

仓库Jesse-njx/dsh-voice安装方式GitHub 源码安装(需 allowBuilds)安装提示源码安装会在你的机器上执行 prepare 构建,需要 allowBuilds 授权;建议用 github:Jesse-njx/dsh-voice#37164b1 锁定本次检测的 commit。收录日期2026-08-14固定 commit37164b11690a · 2026-08-13
dsh plugin --profile web add github:Jesse-njx/dsh-voice