agent-vision-toolkit
为纯文本模型提供视觉能力工具箱与技能,支持多图理解、图片问答、长截图 OCR、前端 UI 还原与 GUI 自动化,可选无缝接入 Codex、Claude Code、Pi、Oh My Pi、OpenCode 等主流 agent,并可直接识别粘
查看原仓库英文描述
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
基础信息核对
资料已更新项目活跃度
数据覆盖 92% · 抽样数据 · 数据截至 2026-09-10
100 次提交 · 最近推送 14 天前
8/14 已关闭 · 响应数据未覆盖
22/25 已关闭 · 首次响应中位数 0 天
6 位近 90 天活跃贡献者
最近发布 27 天前
1214 Stars · 47 Forks
安装
该项目不以标准 DSH 插件形式分发(视觉工具包加技能,npx skills add 分发,非 DSH 插件)。安装与使用方式请查看原仓库。