seek://map/anionex-dsh-vision-toolkit
DSH 视觉工具箱
#vision #screenshots #ui-restoration #ocr #tool-integration
TL;DR
上游 agent-vision-toolkit 的 DSH 原生集成:据其 README 十个专用视觉工具加配套 vision-skills Skill,教智能体何时检视、定位、OCR、裁剪、矢量化或比对像素;面向纯文本模型,自带免费共享视觉配额与自举 Python 运行时。
上游 README 自己的开门见山:"提供 10 个工具"——十个视觉工具 + 配套 Skill,把仅支持文本的 DeepSeek Harness 智能体改造成接近多模态的工作者——这背后是项目自己的 agent-vision-toolkit。视觉是 DSH 工具链里相对薄弱的赛道,而这条插件提供的是一组彼此可组合的原语而不是一个单一的描述接口,因此值得收录。
速览
- install
- dsh plugin --profile web add @anionex/dsh-vision-toolkit
- license
- MIT
要点
- DSH profile 原生集成:经 dsh plugin add 装入 web / headless / desktop 的 profile,出现在设置页的 Vision Toolkit 卡片中
- 据其 README,十个工具可独立调用、可组合成工作流;坐标一律使用原图像素,定位结果可直接喂给裁剪、矢量化或下游自动化
- 随附的 vision-skills Skill 内置上游操作手册:长截图 OCR、UI/图形/草图还原、结构化抽取与截图操作 GUI
- 作为上游 Anionex/agent-vision-toolkit 的 DeepSeek Harness 集成发行,视觉任务方法论沉淀在上游仓库
- README 自称生态首个综合视觉插件;本站不将其转述为事实
- MIT 许可;npm 安装目标为 @anionex/dsh-vision-toolkit
常见问题
它与 dsh-tool-describe-image 有何不同?
describe-image 是单工具封装,把附图转发给你配置的任意 OpenAI 兼容视觉端点。DSH Vision Toolkit 据其 README 提供十个专用工具加一个 Skill,自带免费视觉配额,并运行隔离的 Python 运行时处理图像——定位与配置面都不同。
需要自备 API key 吗?
README 记载安装后即可用的免费共享视觉服务(含每日配额);只有在设置中切换 provider 时才需要 key。
它会取代多模态模型吗?
它的设计目标是让纯文本模型通过工具调用和 vision-skills 工作流完成视觉任务。README 将其描述为并行的交互模式,而非替代品。
在 DSH Desktop 上安装有什么坑?
README 指出 DSH Desktop 2.0.1 内置市场的安装存在已知问题——文档给出的可靠路径是从托盘打开 DSH Terminal 手动执行 dsh plugin --profile desktop add。
官方参考