dsh-plugin-image-input

@Elohia · 视觉与多模态
检测有风险提示无安装脚本来源一致行为与描述一致

为纯文本 LLM 提供图片输入接管:粘贴/拖拽图片自动转文字描述后发送

v0.1.1版本
npm 预构建包安装方式
2026-08-15最近更新
0 · 352Star · 周下载
dsh plugin --profile web add dsh-plugin-image-input查看仓库

插件介绍

根据仓库资料整理 · commit a96667f

主要功能

  • 在输入框粘贴或拖拽图片,按 Enter/发送时自动转为结构化文字描述并随消息一起发出
  • 提供图片转文字按钮,可先把描述插入输入框自行编辑后再发送
  • 当前模型原生支持视觉(如 qwen-vl、gpt-4o)时插件自动放行,走原生图片通道
  • 设置页可配置 OpenAI 兼容视觉 API 的 baseUrl、model、apiKey、maxTokens
  • 支持多张图片逐张转换后一起发送
  • 未在设置页填写时可回退读取本地配置文件或环境变量(如 DASHSCOPE_API_KEY、OPENAI_API_KEY)中的 API Key

适合什么时候用

  • 使用纯文本 LLM(如 DeepSeek)对话,但需要发送图片(截图、图表、K线图等)内容
  • 希望复用已有的 OpenAI 兼容视觉 API(如 qwen-vl、gpt-4o、glm-4v)来给非视觉模型补充图片理解能力

安装后会多出什么

界面输入框左侧“🖼️ 图片转文字”按钮 · 设置页“图片转文字”配置表单(baseUrl/model/apiKey/maxTokens)

使用前需要

  • 需要一个 OpenAI 兼容的视觉模型 API(baseUrl + model + apiKey),如 DashScope qwen-vl、GPT-4o、GLM-4v
  • 仅支持 DSH web 端(client.platform 为 web)
  • 需通过 dsh plugin --profile web add 安装并重启 DSH web 生效
  • 配置存于 ~/.config/mm-vision/config.json,或可用环境变量(MM_VISION_API_KEY / DASHSCOPE_API_KEY / QWEN_API_KEY / OPENAI_API_KEY / GEMINI_API_KEY)提供 API Key

在 GitHub 阅读完整 README

权限与能力

安装后它能碰到什么
不覆盖任何 dsh-base 宿主行:不接管沙箱、审批、凭据等能力。
宿主能力
浏览器 UI凭据环境变量文件系统外部网络
能力是范围不是结论:很多能力是功能所需。

基本信息

仓库Elohia/dsh-plugin-image-inputnpmdsh-plugin-image-input@0.1.1安装方式npm 预构建包收录日期2026-08-15固定 commita96667f6b144 · 2026-08-15
dsh plugin --profile web add dsh-plugin-image-input