☰
ModLens 生态全景与路线图:从图片视觉桥到 ModSearch 搜索桥,独立开发者如何打造插件矩阵
2026/9/26 2:38:14 网站建设 项目流程

ModLens 生态全景与路线图:从图片视觉桥到 ModSearch 搜索桥,独立开发者如何打造插件矩阵

【免费下载链接】modlensThe first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。项目地址: https://gitcode.com/gh_mirrors/mo/modlens

ModLens 是面向 DeepSeek Harness(dsh)的首个视觉插件,也是 DeepSeek、GLM 等纯文本编码 Agent 的"视觉桥":粘贴一张图片,即可得到结构化 JSON 证据(OCR 全文、版面区域、语义实体),让读不了图的模型也能"看见"。本文完整梳理 ModLens 生态:视觉桥如何工作、一键安装与实测效果、姊妹项目 ModSearch 搜索桥,以及独立开发者如何以"单一职责"理念打造插件矩阵。

🧩 一张图看懂:ModLens 视觉桥的工作流程

DeepSeek 的旗舰聊天模型和 GLM-5.3 本身都是纯文本模型,无法读取图片。ModLens 的思路很克制:不改模型、不改宿主,只在图片进入对话时做一次"翻译"——把它交给视觉引擎读一遍,再把结果以结构化证据的形式还给文本模型。

整个流程三步:

  1. 触发:粘贴的图片进入对话(不同宿主下可能是临时文件路径,也可能是从会话记录里捞回来的路径),skill 自动触发,无需任何触发词;
  2. 转换:内置视觉引擎之一(Gemini、OpenAI 兼容、Anthropic、Antigravity CLI、Claude CLI、Kimi CLI)读取图片;
  3. 回传:输出不是随意一段描述,而是 schema 约束的 JSON——OCR 全文、按阅读顺序排列的版面区域、实体与关系列表,模型回答时会引用其中的具体细节,而不是"编"。

这个"证据,而非想象"的契约定义在 src/schema.ts,完整输出字段规范见 docs/output-schema.zh-CN.md,触发逻辑与工作流写在 skills/modlens/SKILL.md。

🚀 一键安装:视觉插件的 3 种上手方式

方式一:dsh 用户一条命令。这是最轻的装法,整个插件就是一个 dsh 包:

npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.26.5

安装后注册了modlens_read_image原生工具,并为纯文本模型自动生成(modlens vision)变体入口(原生视觉模型如 GLM-5.3-Flash 会自动排除,绝不覆盖其原生看图能力)。

方式二:其他宿主用 skill 安装。Claude Code、Codex、Pi、OpenCode 等宿主通过 skill 接入:

npx -y skills add liustack/modlens --skill modlens --global

方式三:把安装交给你的 AI。把 INSTALL.md 交给正在对话的 Agent,它会自动探测本机已有环境、配置引擎并跑健康检查。

值得强调的是零配置起步:ModLens 会复用你机器上已登录的 Claude Code、Codex 等 CLI;什么都没有的话,免费的 Antigravity CLI 无需任何 key,申请一个免费的 Gemini key(约 3 分钟、无需信用卡)则能把每次读取压到 5-10 秒。

对于不用终端的 dsh Web 用户,设置页的 Plugins 入口里有专门的 ModLens 配置卡片:切换视觉引擎、填 key 与端点、勾选哪些本地登录可以被复用,保存即生效——连配置文件都不用打开。

📊 实测:密集图表、批量图片与"粘贴恢复"

官方展示的几组真实运行(全部驱动纯文本 DeepSeek-V4-Flash,未经剪辑)能很好地说明"视觉桥"的成色:

128 个 AI 模型的散点图对比——双轴、对数刻度、按提供方着色、虚线标记的重点区域,全部被逐字读出。密集图表正是视觉桥最容易翻车的场景:

一条推文截图:作者、文案、照片细节(两人各穿什么衣服)、时间戳,以及 5.4M 浏览、1.6K 回复、11.6 万点赞等每一个互动数字都不缺:

还有一条容易被忽略的路径——粘贴恢复(recover-paste)。在 Claude Code、Pi、OpenCode 里,粘贴的图片字节会先落到本地会话存储(JSONL 或 SQLite),而不是普通临时文件。ModLens 会自动探测自己运行在哪个宿主里,把图片字节"捞回来"再读取:

各宿主的存储位置与恢复细节见 docs/harness-setup.zh-CN.md。

🔍 ModSearch 搜索桥:补上模型的"第二感官"

需要看图的模型,通常也需要联网。ModSearch 是 ModLens 的姊妹项目,同一套工艺用在另一个缺失的感官上:给没有网络访问能力的模型提供Web 搜索、X 搜索和单页抓取——免费、免注册、无需 API key:

npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modsearch@latest

围绕 DeepSeek Harness,目前已经能看出一个清晰的"感官分工"插件矩阵:

插件负责的"感官"一句话定位
ModLens👁️ 视觉图片粘贴 → 结构化 JSON 证据(OCR、版面、语义)
ModSearch🌐 网络Web 搜索、X 搜索、单页抓取,免费无 key
dsh-screenshot📸 捕获热键截屏直接进 dsh("截屏"是捕获的活,刻意不在 ModLens 里做)
AIManager🖥️ 入口最轻的 dsh 桌面外壳,零代码零配置一键安装依赖
dsh-market🛒 市场dsh 内置插件市场,800+ 社区插件一键安装更新
DSH Desktop📱 前端免 Node.js 的桌面端,手机远程控制与 IM 通道在路线图上

每个插件只做一件事,边界互相咬合——这正是矩阵的雏形。

🛠️ 独立开发者能复用的 4 个做法

ModLens 由单一作者维护、不接受 PR(issue 驱动路线图,MIT 协议随便 fork),它的路径对小团队和个人开发者很有参考价值:

  1. 把边界写进仓库,而不是写在口头上。AGENTS.md 与 CONTRIBUTING.md 明确列出"永不加入"清单:摄像头、截屏热键、裁剪/像素工具箱、bounding box 与置信分——视觉解析是唯一职责,联网交给 ModSearch,截屏交给 dsh-screenshot。矩阵不是一个大而全的工具,而是几把边界清晰的尖刀。
  2. 用可复现的证据说话。evals/ 目录为每次实验留档:命令、版本、输入 SHA-256、原始输出、耗时与评分,任何"它能读密集图表"的说法都可以重跑验证。连提示注入测试图(evals/cases/prompt-injection/)都是脚本生成的,图片内容一律按不可信输入处理(见 docs/security.zh-CN.md)。
  3. 信任本身就是功能。复用本地 CLI 的登录读图时,每次都会在结果里标注"花了谁的配额";API key 可以不进 argv 和聊天;所有错误输出先做脱敏。对个人项目来说,"不坑用户的钱包"是最便宜的口碑。
  4. 保持最轻的接触面。没有 hook、没有守护进程、不改任何宿主配置:skill 宿主里就是一个文件夹,dsh 里就是一个插件,卸载 = 删文件夹,Agent 立刻回到出厂状态。

🗺️ 路线图信号与参与方式

CHANGELOG.md 是这份路线图最诚实的载体:从 dsh 各版本兼容(0.1.0 → 0.1.7)、第三方文本模型的(modlens vision)变体(families: ['*']可自选)、按 provider 的代理路由,到多 API key 轮换与配额冷却、Windows 全链路支持——几乎每个版本都由一个真实用户 issue 推动,节奏是数天一版。

想参与也简单:开 issue(bug、建议、读不懂的报错)就是最直接的贡献;fork 则是完全属于你的副本——MIT 协议下改名、改造、再发布都不需要许可:

git clone https://gitcode.com/gh_mirrors/mo/modlens

一句话总结:ModLens 用"一个插件补一个感官"的方式,展示了独立开发者如何围绕 DeepSeek Harness 生态,把视觉桥、搜索桥、截屏、市场这些边界清晰的模块拼成插件矩阵——而下一个缺失的感官,也许正等着你来补。

【免费下载链接】modlensThe first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。项目地址: https://gitcode.com/gh_mirrors/mo/modlens

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询