dsh-vision-proxy

@Flyvhidbwo · 视觉与多模态
检测到高风险来源一致

为纯文本 DeepSeek 模型提供图片自动转译识图能力,可选付费 VLM 或本机免费 Ollama

v0.3.1版本
npm 预构建包安装方式
2026-08-21最近更新
12 · 1,789Star · 周下载
查看风险检测到高风险发现,本站不提供一键安装;请先阅读安全报告。查看仓库

插件介绍

根据仓库资料整理 · commit d246d85

主要功能

  • 注册新的模型路由 deepseek-vision,对话中附加的图片会先经 OpenAI 兼容 VLM 转译成文字,再交给纯文本 DeepSeek 作答
  • 支持百炼/Qwen、QwenCloud、智谱、OpenRouter 等任意 OpenAI 兼容端点,并可为多个 fallbackModels 分别配置端点
  • 无 API key 时自动探测本地 Ollama(默认开启),图片转译不出本机、免注册
  • 匿名端点强制 20 秒超时、429 立即失败并进入 60 秒冷却,避免整轮对话卡死
  • 按图片内容 SHA-256 哈希做进程内缓存(上限 200 条),同一张图仅转译一次
  • 安装时通过 postinstall 一问式确认是否有 VLM API key,非交互环境自动跳过;启动时打印隐私提示说明当前使用的端点

适合什么时候用

  • 使用非多模态(纯文本)DeepSeek 模型,但仍想在 GUI 对话中直接粘贴图片
  • 希望图片处理留在本机、不经第三方 API,可依赖零配置本地 Ollama 识图
  • 已有百炼/智谱/OpenRouter 等 OpenAI 兼容 VLM 账号,想低成本给 DeepSeek 接上识图能力

安装后会多出什么

界面模型选择器新增 “DeepSeek + 自动识图”(deepseek-vision)路由选项

使用前需要

  • 需要 DSH 0.1.1-rc.2(adapter prepareCall 接口)及 Node.js ≥ 22.19
  • 走付费快速通道需配置 VISION_API_KEY 或 DASHSCOPE_API_KEY(百炼/QwenCloud/智谱/OpenRouter 等任一 OpenAI 兼容端点的 key)
  • 若不配置 key,需本机安装并运行 Ollama(默认监听 localhost:11434)才能识图
  • 可选依赖 sharp 用于超大图片自动降采样,未安装则跳过该功能
  • pnpm ≥ 10 默认拦截安装脚本,需在 profile 的 pnpm-workspace.yaml 中为本插件和 sharp 设置 allowBuilds 后重新安装

在 GitHub 阅读完整 README

权限与能力

安装后它能碰到什么
不覆盖任何 dsh-base 宿主行:不接管沙箱、审批、凭据等能力。
宿主能力
凭据环境变量文件系统外部网络
能力是范围不是结论:很多能力是功能所需。

基本信息

仓库Flyvhidbwo/dsh-vision-proxynpmdsh-vision-proxy@0.2.6安装方式npm 预构建包收录日期2026-08-14固定 commitd246d8511822 · 2026-08-21