dsh-visual-plugin

@jyh20030112 · 视觉与多模态
检测有风险提示无安装脚本

为纯文本 DSH 模型接入任意 OpenAI 兼容视觉模型,自动描述图片和视频并在侧边面板展示

v0.3.0-beta.0版本
GitHub 源码安装安装方式
2026-08-21最近更新
10Star
dsh plugin --profile web add github:jyh20030112/dsh-visual-plugin查看仓库

插件介绍

根据仓库资料整理 · commit 87aafef

主要功能

  • 自动为用户上传的图片及包含图片的工具结果生成描述,仅在模型请求副本中插入,原始对话保持不变
  • 在源图片下方生成生命周期卡片,实时展示分析中/成功/失败状态
  • 若图片同时附带提问,描述会围绕用户的问题生成
  • 提供 vision_describe 工具,供模型在自动描述信息不足时追问细节
  • 支持上传 MP4/M4V/MOV/AVI/MPG/MKV/WebM 等视频,校验扩展名、文件签名与 FFprobe 结果一致后接受
  • 将视频转码为 H.264/yuv420p MP4,用 PySceneDetect 提取关键帧并调用视觉模型生成带时间戳的分析结果

适合什么时候用

  • 希望让纯文本对话模型也能理解用户发来的图片内容
  • 需要分析用户上传的短视频并让模型基于关键帧内容回答问题
  • 已有一个 OpenAI 兼容的视觉模型服务,想接入到 DSH 对话流程中

安装后会多出什么

界面设置 → 插件 → Vision Bridge 配置卡片(填写端点、模型名、API Key、侧边栏开关、历史条数) · 右侧面板:图片/视频分析历史卡片,可切换查看、播放视频、把选中视频暂存到聊天草稿 · 依赖健康状态展示(FFmpeg/FFprobe/PySceneDetect 检测结果)
Agent 工具vision_describe

使用前需要

  • 需要一个 OpenAI 兼容的视觉模型端点及对应 API Key
  • 视频分析需要主机安装 FFmpeg/FFprobe ≥ 6.1(含 libx264,且为同一大版本)
  • 视频分析需要主机安装 PySceneDetect ≥ 0.7.1 且 < 0.8
  • 依赖多个 DSH 核心组件(如 dsh-credentials、dsh-host-webserver、dsh-llm、dsh-session 等)作为 peerDependencies

在 GitHub 阅读完整 README

权限与能力

安装后它能碰到什么
不覆盖任何 dsh-base 宿主行:不接管沙箱、审批、凭据等能力。
宿主能力
Agent 控制浏览器 UI凭据环境变量文件系统外部网络会话数据宿主子进程
能力是范围不是结论:很多能力是功能所需。

基本信息

仓库jyh20030112/dsh-visual-plugin安装方式GitHub 源码安装(需 allowBuilds)安装提示源码安装会在你的机器上执行 prepare 构建,需要 allowBuilds 授权;建议用 github:jyh20030112/dsh-visual-plugin#87aafef 锁定本次检测的 commit。收录日期2026-08-15固定 commit87aafef73b0c · 2026-08-21
dsh plugin --profile web add github:jyh20030112/dsh-visual-plugin