开发与工程 ocrvision-bridgeimage-to-deepseek-harnessgemini-apiprovider-failovermultimodal

ModLens — 纯文本模型的视觉外挂

为 DeepSeek、GLM 等纯文本编码模型外挂视觉能力:粘贴图片,即得结构化 JSON 证据(OCR、版面、语义)。

FollowSkills 评估 · FSRS-2.0
推荐
67/ 100 五分制 3.4 / 5
1 2 3 4 5 6
1信任安全19 / 25 · 3.8/5

证据显示最小权限设计良好:allowed-tools 仅 Bash,配置文件 0600,密钥支持隐藏输入避免进入 shell 历史和对话,复用其他 harness 登录需逐项明确同意(onboard.md 的 consent 规则),kimi-cli 不自动加入故障转移链以保护订阅额度,每次复用在 meta.warnings 中标注花的是谁的额度,图片内容被明确声明为不可信输入。扣分点:recover-paste 读取本地会话存储(~/.claude/projects 等)属敏感数据访问,虽有作用域和 0600 保护但实际行为未经执行验证;gemini 免费档数据可能被 Google 使用仅一句提醒;外部网络服务数据流披露依赖 docs/security.md(本次未在源文件中完整见到)。

2可靠稳定12 / 20 · 3.0/5

SKILL.md 对错误路径处理非常细致:exit 78 结构化诊断、guard 退出码语义明确、schema 失败重试策略、超时处理、'never fabricate image content' 原则,launcher 脚本逻辑自洽(版本解析、node 22.19 下限检查、POSIX sh 实现)。扣分点:静态审查无法执行任何路径,核心 CLI 的实际行为(@liustack/[email protected])不可复现;测试套件存在(vitest、stamp.test.mjs)且 CI 覆盖三平台,但本次证据中未包含针对 skill 关键路径的具体测试内容;依赖外部网络服务和第三方 CLI 登录态,故障模式部分依赖未验证的观察。

3适用触发12 / 15 · 4.0/5

受众和场景非常清晰:纯文本模型(DeepSeek、GLM)需要读图;触发条件精确定义(图片扩展名路径、[Image #1] 占位符、guard 判定),明确排除自有视觉模型和 web search;guard 机制防止在视觉模型上误触发;提供中文文档(configure.zh-CN.md)。扣分点:核心功能依赖海外服务(Gemini API、Anthropic、Google Antigravity),对中国大陆网络需依赖代理配置,虽有 proxy 字段支持但默认路由可达性存疑,文档未专门说明大陆直连方案;大量引用尚不存在的模型/版本号(DeepSeek-V4、GLM-5.3、2026年8月),未来兼容性声明无法核实。

4规范维护12 / 15 · 4.0/5

信息架构优秀:SKILL.md 精简、references 按需分层(runtime/onboard/configure/find-image)、双语文档、MIT 许可明确、版本钉死 3.26.1 并有 stamp 测试防止漂移、CHANGELOG 与 release 流程绑定、发布走 OIDC trusted publishing、单一维护者明确的更新模式(不接受 PR,通过 issue 反馈)。扣分点:发布者为个人、未经验证,长期维护责任无机构背书;'不接受 PR' 限制社区维护路径;文档中未见的部分(docs/security.md、CHANGELOG.md 实际内容)无法在本证据中核实。

5有效结果7 / 15 · 2.3/5

核心任务(图片转结构化 JSON 证据)设计完整:OCR/版面/语义输出契约明确、多 provider 容错、uniqueness 在于零配置复用本地登录态和 paste 恢复。README 附带多张演示截图声称实际可用。扣分点:静态审查无法验证输出直接可用性;演示图为作者自述证据;夸大营销语言('全网最强'、'🥇 最强视觉插件')与效果验证无直接关联;实际效果高度依赖所配置的视觉模型质量。

6证据核验5 / 10 · 2.5/5

可核查的一手材料较多:完整的 launcher 脚本源码、分层文档、钉死版本、CI 工作流(三平台测试矩阵 + 发布护栏)、npm provenance 发布。扣分点:静态审查无法执行复现;效果声明(demo 截图)无法独立核实;对未来模型(DeepSeek-V4、GLM-5.3 等)的引用无法交叉验证;未看到 CI 实际运行结果或具体测试覆盖 skill 关键路径的证据。

证据充分度: 评估于 2026年9月18日 审查版本 a1923d016c2b
使用前请注意
  • 本评分为纯静态源码审查,未执行任何命令,所有运行时行为(CLI 实际输出、guard 判定、paste 恢复)均未验证。
  • recover-paste 会读取本机 Claude Code / Pi / OpenCode 的会话存储以提取粘贴图片,使用前请确认接受此本地数据访问;恢复产物应按文档要求删除。
  • 核心视觉能力依赖海外服务(Gemini、Anthropic、Antigravity),中国大陆网络通常需配置代理;建议先配置 proxy 再启用 gemini-api 等路线。
  • Gemini 免费档数据可能被 Google 用于改进产品,处理敏感图片时请优先选择自持密钥的 OpenAI 兼容端点或其他路线。
  • 文档大量引用尚未发布或无法核实的模型版本(DeepSeek-V4、GLM-5.3 等),相关兼容性声明请以实际运行结果为准。
  • 发布者为未经验证的个人维护者且不接受 PR,长期维护与安全响应依赖单一作者,建议锁定钉死版本 3.26.1 并关注其 SECURITY.md 的漏洞报告渠道。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

ModLens 是一个 Agent Skill,把图片转换为结构化 JSON 证据,让没有视觉能力的文本模型能够读图。它通过 modlens CLI 完成:整图文字转录、按阅读顺序划分版面区域、抽取实体与语义关系,并如实标注不确定内容。内置六个视觉引擎(Gemini、任意 OpenAI 兼容端点、Anthropic、Antigravity CLI、claude-cli、kimi-cli),并可复用本机 Codex、OpenCode、Pi、Grok 等已登录的视觉能力,形成一条自动故障切换链。它对 DeepSeek Harness 以单个插件形式安装,对 Claude Code、Codex、Pi、OpenCode 则以单个 skill 文件夹形式安装,无 hooks、无代理、不改任何配置。作者为单人维护,不接受 PR。

当会话中出现 .png/.jpg/.jpeg/.webp/.gif/.heic/.heif 的路径或 URL、或 [Image #1] 之类粘贴占位符而模型本身看不到图片时,该 skill 强制触发(先跑 modlens guard 判定模型是否真无视觉),然后调用 modlens CLI 把图片送给配置好的视觉引擎,返回含 result.summary、result.ocr.full_text、result.layout.regions、result.semantics 的 JSON;meta.attempts 与 meta.warnings 记录每次尝试的引擎与配额去向。支持 -p 固定引擎、--timeout、-o 输出文件、--prompt 聚焦提示,并自带 modlens doctor 健康检查与 modlens config 配置管理。运行时优先用 PATH 上的 modlens(需 ≥3.26.1),否则退到 npx/bunx 拉取固定版本。

  1. 用 DeepSeek 纯文本旗舰模型写代码的开发者,想把截图、设计稿或报错弹窗直接粘进聊天,让模型读图后继续干活。
  2. 已在 Claude Code、Codex、Pi 或 OpenCode 有付费订阅、想零新增费用复用现有视觉额度的用户。
  3. 不想注册任何账号的用户,可装免费的 Antigravity CLI 作为无密钥视觉通道。
  4. 持有 OpenAI 兼容端点(通义 qwen-vl、GLM 开放平台、SiliconFlow、自托管 vLLM/Ollama 等)的团队,想接进统一的视觉管线。
  5. 需要批量读密集图表(如散点图、数据可视化截图)并要求模型引用具体数字而非臆造的用户。

这个 Skill 有哪些优点和局限?

优点
  • 对系统改动极小:skill harness 上就是一个文件夹,dsh 上就是一个插件,卸载即删,无 hooks、无本地代理、不改任何 harness 配置。
  • 零配置起步:可复用 Claude Code、Codex、OpenCode、Pi 的现有登录,免费 Gemini key 即可把单次读图压到 5-10 秒。
  • 证据而非想象:输出全文转录、阅读顺序版面与实体关系,并显式标注不确定项;从不伪造图片内容。
  • 十路视觉来源与自动故障切换,meta.attempts 让每次回退都有据可查;被复用的配额会在 meta.warnings 中标明。
局限
  • 需要网络和外部视觉服务:没有可用引擎(无密钥、无 CLI 登录)时完全无法工作。
  • Antigravity CLI 与 agent CLI 通道单次读图需 15-45 秒,明显慢于 API 通道。
  • 不支持 claude-cli 之外的零注册方案都要装额外工具;复用其他 harness 的登录需要逐个显式授权。
  • README 的能力声明(如读取截图的细节程度)来自作者自述演示,无独立测试套件或第三方评测佐证;作者不接受 PR,单人维护。
  • 核心定位是纯文本模型的外挂;如果模型本身有原生视觉(如 GLM-5.3-Flash),guard 会拒绝使用本 skill。

如何安装这个 Skill?

其他 harness:用 skills.sh 安装,npx -y skills add liustack/modlens --skill modlens --global,重启后让 AI 按仓库的 INSTALL.md 配置并跑健康检查;或直接把安装指令发给你的 AI。DeepSeek Harness:npx -y @deepseek-ai/dsh plugin --profile web add @liustack/[email protected]。若健康检查为空,推荐申请免费 Gemini API key(Google AI Studio,约三分钟),或装 Antigravity CLI(curl -fsSL https://antigravity.google/cli/install.sh | bash 后运行 agy 登录)实现零注册。

如何使用这个 Skill?

装好后直接聊天:粘贴图片或丢入路径并提问,skill 会自动触发;也可以显式让 AI『用 modlens 读这张图』或『帮我安装/切换 modlens 的视觉引擎』。skill 内部流程是:先跑 modlens guard --model <模型ID> 确认模型无原生视觉,再 modlens -i <路径或URL> 读图,最后从 JSON 的 summary/ocr/layout/semantics 字段引用具体内容作答。粘贴过一次后,同一图片的后续提问无需再粘贴。

相关 Skills