你的 AI 是纯文本模型,看不懂图片?dsv-bridge 帮它把图片变成文字描述。
dsv-bridge 是 DeepSeek Vision CLI(dsv) 的套壳 skill: 当 AI 遇到本地无法 OCR/识别的图片时,自动把图片交给 DeepSeek 网页版识图模式(真·多模态视觉理解,非 OCR)处理,返回结构化文字描述。
你的 AI(纯文本, 无视觉)
↓ 发来图片 / 需要看图
dsv-bridge(skill)
↓ 自动调用
deepseek-vision-cli(dsv)
↓ 驱动浏览器
DeepSeek 识图模式 → 返回图片描述文本
| 场景 | 效果 |
|---|---|
| 用户发照片问"这是什么动物/品种" | ✅ 识别物种+特征+场景 |
| 用户发截图问"这图里有什么" | ✅ 完整描述内容 |
| 用户发 K线图/图表 | ✅ 分析形态与含义 |
| 用户发文档截图 | ✅ 提取文字+理解语义 |
| 模型无视觉能力 | ✅ 通过 dsv 间接获得看图能力 |
实测:识别过动物照片(两只狗+品种推断)、人物照片(樊少皇+活动信息+水印文字)、K线图(红三兵形态分析)、几何图形(颜色/形状/文字全对)。
dsv-bridge 会自动定位 dsv,找不到时自动从 GitHub 克隆。手动安装:
git clone https://github.com/menghuanshiguang/deepseek-vision-cli /var/minis/workspace/deepseek-vision
# 依赖: Python 3 + minis-browser-use(iSH 自带) + Pillow/scipy(可选,用于验证码破解)把 SKILL.md 和 scripts/ 放入你的 AI 工具的 skills 目录(如 /var/minis/skills/dsv-bridge/)。
# ① 触发验证码: 自动填手机号 + OpenCV破解数美验证 + 发短信, ~15秒退出
python3 /var/minis/workspace/deepseek-vision/dsv.py --login 138****1234
# ② 收到短信后, 完成登录(立即退出)
python3 /var/minis/workspace/deepseek-vision/dsv.py --verify 123456
⚠️ 核心设计: CLI 永不在"等人工输入"上阻塞。 token 失效时识图会快速失败并提示登录命令,不会卡住你的 AI agent。
# AI 无法识别图片时, 自动执行:
python3 /var/minis/skills/dsv-bridge/scripts/dsv_bridge.py <图片路径> "这是什么?"
# 自定义问题
python3 /var/minis/skills/dsv-bridge/scripts/dsv_bridge.py photo.jpg "图中人物是谁?穿什么?"输出: DeepSeek 识图模式的文字回答(stdout 纯文本),日志在 stderr。
dsv_bridge.py
├─ 定位 dsv(环境变量 DSV_CLI_DIR / 本地目录 / GitHub 自动克隆)
├─ 调 dsv <图片> <问题>
│ ├─ token 有效 → 识图模式 → 上传 → 提问 → 流式回答
│ └─ token 失效 → 快速失败, 提示登录命令
└─ stdout 输出回答
dsv 内部自动处理:
- 🎯 数美验证码(OpenCV 颜色分割,无需大模型)
- 🔒 PoW 反爬(浏览器前端自动算,无需破解)
- 🧹 会话用后即删(对话列表零污染)
- 📦 大图自动压缩 + 分块上传
dsv-bridge/
├── SKILL.md # skill 定义(触发条件 + 调用说明)
├── scripts/
│ └── dsv_bridge.py # 桥接脚本(定位 dsv + 调识图 + 输出)
└── README.md # 本文件
- 图片会上传到 DeepSeek 服务器处理,敏感图片注意隐私
- 每次识图约 20-30 秒(含模型生成时间)
- 识图模式是 DeepSeek 内测功能,UI 改版可能需更新 dsv 选择器
- 遵守 DeepSeek 服务条款,个人学习研究使用
MIT © menghuanshiguang
⭐ 有用的话点个 Star!