Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

7 Commits
 
 
 
 
 
 
 
 
 
 

Repository files navigation

🖼️ dsv-bridge — 给不会"看"图的 AI 一双眼睛

你的 AI 是纯文本模型,看不懂图片?dsv-bridge 帮它把图片变成文字描述。

dsv-bridge 是 DeepSeek Vision CLI(dsv) 的套壳 skill: 当 AI 遇到本地无法 OCR/识别的图片时,自动把图片交给 DeepSeek 网页版识图模式(真·多模态视觉理解,非 OCR)处理,返回结构化文字描述。

你的 AI(纯文本, 无视觉)
   ↓ 发来图片 / 需要看图
dsv-bridge(skill)
   ↓ 自动调用
deepseek-vision-cli(dsv)
   ↓ 驱动浏览器
DeepSeek 识图模式 → 返回图片描述文本

✨ 它能做什么

场景 效果
用户发照片问"这是什么动物/品种" ✅ 识别物种+特征+场景
用户发截图问"这图里有什么" ✅ 完整描述内容
用户发 K线图/图表 ✅ 分析形态与含义
用户发文档截图 ✅ 提取文字+理解语义
模型无视觉能力 ✅ 通过 dsv 间接获得看图能力

实测:识别过动物照片(两只狗+品种推断)、人物照片(樊少皇+活动信息+水印文字)、K线图(红三兵形态分析)、几何图形(颜色/形状/文字全对)。


📦 安装

1. 安装底层 dsv CLI(自动,或手动)

dsv-bridge 会自动定位 dsv,找不到时自动从 GitHub 克隆。手动安装:

git clone https://github.com/menghuanshiguang/deepseek-vision-cli /var/minis/workspace/deepseek-vision
# 依赖: Python 3 + minis-browser-use(iSH 自带) + Pillow/scipy(可选,用于验证码破解)

2. 安装 skill

SKILL.mdscripts/ 放入你的 AI 工具的 skills 目录(如 /var/minis/skills/dsv-bridge/)。


🚀 使用流程

一次性登录(约 1 分钟,异步不阻塞)

# ① 触发验证码: 自动填手机号 + OpenCV破解数美验证 + 发短信, ~15秒退出
python3 /var/minis/workspace/deepseek-vision/dsv.py --login 138****1234

# ② 收到短信后, 完成登录(立即退出)
python3 /var/minis/workspace/deepseek-vision/dsv.py --verify 123456

⚠️ 核心设计: CLI 永不在"等人工输入"上阻塞。 token 失效时识图会快速失败并提示登录命令,不会卡住你的 AI agent。

日常使用(AI 自动)

# AI 无法识别图片时, 自动执行:
python3 /var/minis/skills/dsv-bridge/scripts/dsv_bridge.py <图片路径> "这是什么?"

# 自定义问题
python3 /var/minis/skills/dsv-bridge/scripts/dsv_bridge.py photo.jpg "图中人物是谁?穿什么?"

输出: DeepSeek 识图模式的文字回答(stdout 纯文本),日志在 stderr。


🔧 工作原理(无需关心,了解即可)

dsv_bridge.py
  ├─ 定位 dsv(环境变量 DSV_CLI_DIR / 本地目录 / GitHub 自动克隆)
  ├─ 调 dsv <图片> <问题>
  │    ├─ token 有效 → 识图模式 → 上传 → 提问 → 流式回答
  │    └─ token 失效 → 快速失败, 提示登录命令
  └─ stdout 输出回答

dsv 内部自动处理:

  • 🎯 数美验证码(OpenCV 颜色分割,无需大模型)
  • 🔒 PoW 反爬(浏览器前端自动算,无需破解)
  • 🧹 会话用后即删(对话列表零污染)
  • 📦 大图自动压缩 + 分块上传

📁 文件结构

dsv-bridge/
├── SKILL.md               # skill 定义(触发条件 + 调用说明)
├── scripts/
│   └── dsv_bridge.py      # 桥接脚本(定位 dsv + 调识图 + 输出)
└── README.md              # 本文件

⚠️ 注意事项

  • 图片会上传到 DeepSeek 服务器处理,敏感图片注意隐私
  • 每次识图约 20-30 秒(含模型生成时间)
  • 识图模式是 DeepSeek 内测功能,UI 改版可能需更新 dsv 选择器
  • 遵守 DeepSeek 服务条款,个人学习研究使用

📜 License

MIT © menghuanshiguang

⭐ 有用的话点个 Star!

About

🖼️ 给不会看图的大模型一双眼睛: 本地AI无法OCR/识别的图片 → DeepSeek识图模式(套壳 deepseek-vision-cli) 的 skill

Topics

Resources

Stars

8 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages