Harness Trust
插件商店
检查已安装插件
搜索插件、npm 包名或仓库
EN
首页
/
插件商店
/
视觉与多模态
/
dsh-plugin-image-input
dsh-plugin-image-input
@Elohia · 视觉与多模态
检测有风险提示
无安装脚本
来源一致
行为与描述一致
为纯文本 LLM 提供图片输入接管:粘贴/拖拽图片自动转文字描述后发送
v0.1.1
版本
npm 预构建包
安装方式
2026-08-15
最近更新
0 · 352
Star · 周下载
复制安装命令
dsh plugin --profile web add dsh-plugin-image-input
查看仓库
插件介绍
根据仓库资料整理 · commit a96667f
主要功能
在输入框粘贴或拖拽图片,按 Enter/发送时自动转为结构化文字描述并随消息一起发出
提供图片转文字按钮,可先把描述插入输入框自行编辑后再发送
当前模型原生支持视觉(如 qwen-vl、gpt-4o)时插件自动放行,走原生图片通道
设置页可配置 OpenAI 兼容视觉 API 的 baseUrl、model、apiKey、maxTokens
支持多张图片逐张转换后一起发送
未在设置页填写时可回退读取本地配置文件或环境变量(如 DASHSCOPE_API_KEY、OPENAI_API_KEY)中的 API Key
适合什么时候用
使用纯文本 LLM(如 DeepSeek)对话,但需要发送图片(截图、图表、K线图等)内容
希望复用已有的 OpenAI 兼容视觉 API(如 qwen-vl、gpt-4o、glm-4v)来给非视觉模型补充图片理解能力
安装后会多出什么
界面
输入框左侧“🖼️ 图片转文字”按钮 · 设置页“图片转文字”配置表单(baseUrl/model/apiKey/maxTokens)
使用前需要
需要一个 OpenAI 兼容的视觉模型 API(baseUrl + model + apiKey),如 DashScope qwen-vl、GPT-4o、GLM-4v
仅支持 DSH web 端(client.platform 为 web)
需通过 dsh plugin --profile web add 安装并重启 DSH web 生效
配置存于 ~/.config/mm-vision/config.json,或可用环境变量(MM_VISION_API_KEY / DASHSCOPE_API_KEY / QWEN_API_KEY / OPENAI_API_KEY / GEMINI_API_KEY)提供 API Key
在 GitHub 阅读完整 README
权限与能力
安装后它能碰到什么
不覆盖任何 dsh-base 宿主行:不接管沙箱、审批、凭据等能力。
宿主能力
浏览器 UI
凭据
环境变量
文件系统
外部网络
能力是范围不是结论:很多能力是功能所需。
基本信息
仓库
Elohia/dsh-plugin-image-input
npm
dsh-plugin-image-input@0.1.1
安装方式
npm 预构建包
收录日期
2026-08-15
固定 commit
a96667f6b144
· 2026-08-15
dsh plugin --profile web add dsh-plugin-image-input
复制
dsh-plugin-image-input — DeepSeek Harness 插件商店 · Harness Trust