picturereader

@jing-hy · 视觉与多模态
检测有风险提示无安装脚本来源一致

让纯文本 DeepSeek 模型具备读图能力:本地像素分析+OCR+可选外部视觉模型,原生缩略图粘贴即用

v3.0.6版本
npm 预构建包安装方式
2026-08-21最近更新
31 · 1,473Star · 周下载
dsh plugin --profile web add picturereader查看仓库

插件介绍

根据仓库资料整理 · commit 8aba6fc

主要功能

  • 视觉孪生 adapter:将纯文本模型原位包装为「支持图片」,实现原生缩略图、粘贴/图片块自动转文本证据回传
  • 隐私/智能/严谨三种路由模式,控制是否及何时调用外部视觉模型(VLM),隐私模式硬性禁止外呼
  • 本地纯 JS 像素级工具链:扫描、三引擎 OCR(内置/PaddleOCR/RapidOCR)、取样、裁剪、取色、对比、批量分析
  • 文档转图片:将 pdf/word/excel/ppt 逐页转为 PNG 供模型逐页读取,纯本地无需联网
  • 可选外部 VLM 桥接:配置 OpenAI 兼容端点后,模型按路由策略自主决定是否外呼视觉模型做语义理解
  • Web 设置页新增「图片阅读」卡片,用于配置使用模式、外部视觉 API 与视觉桥模型

适合什么时候用

  • 使用纯文本 DeepSeek 模型时需要理解截图、图表、照片等图片内容
  • 处理身份证、合同等敏感图片,要求全程本地分析、零外部流量
  • 需要批量读取 PDF/Word/Excel/PPT 文档内容或做图片间差异比对、审图校对

安装后会多出什么

界面设置页「图片阅读」卡片(模式选择、外部视觉 API 配置、视觉桥模型多选) · 模型列表中的「(视觉)」变体标记,粘贴图片时显示原生缩略图
命令dsh plugin add picturereadernode scripts/setup-ocr.mjsnode scripts/setup-rapid.mjsnode scripts/setup-doc-venv.mjs
Agent 工具image_scanimage_ocrimage_sampleimage_cropimage_paletteimage_compareimage_batchvision_analyzedocument_to_image

使用前需要

  • 已验证兼容 DeepSeek Harness EAC 4.2.0 及 @deepseek-ai/dsh-client-ui-workspace rc.7
  • 依赖 peerDependencies:@deepseek-ai/dsh-settings、@deepseek-ai/schemastery、@deepseek-ai/dsh-llm
  • 可选:外部 OpenAI 兼容视觉 API 端点(如 LM Studio、云端 VLM),用于智能/严谨模式下的语义理解
  • 可选:安装 PaddleOCR 或 RapidOCR 以增强文字识别能力
  • 可选:文档转图片功能需已安装 LibreOffice 及 PyMuPDF(doc_venv)

在 GitHub 阅读完整 README

权限与能力

安装后它能碰到什么
不覆盖任何 dsh-base 宿主行:不接管沙箱、审批、凭据等能力。
宿主能力
Agent 控制浏览器 UI凭据环境变量文件系统外部网络宿主子进程
能力是范围不是结论:很多能力是功能所需。

基本信息

仓库jing-hy/picturereadernpmpicturereader@3.0.6安装方式npm 预构建包收录日期2026-08-16固定 commit8aba6fcf804a · 2026-08-21
dsh plugin --profile web add picturereader