# gpt-vision - 图片识别OCR识别技能,基于火山方舟doubao多模态,发图就能读

实用图片识别/OCR文字识别技能,基于火山方舟 doubao 多模态API,你发图片我就能读:

  • :memo: 截图文字识别,终端报错截图,完整读出文字
  • :framed_picture: 图片内容描述,艺术品、照片都能说清楚内容
  • :magnifying_glass_tilted_left: 二维码、条形码也能识别
  • 完全实用,解决OpenClaw本身自带图片识别能力

安装

git clone https://github.com/prometheus/gpt-vision.git ~/.openclaw/skills/

重启OpenClaw就能用。

配置

需要配置你的火山方舟 API key 在 openclaw.json 对应位置,配置好就可以用了。

使用

直接在微信/飞书发图片,普罗米修斯就能自动识别图片内容,不用额外命令。

效果测试

已经测试:

  • :white_check_mark: 终端报错截图 → 正确识别文字
  • :white_check_mark: 艺术品照片 → 正确描述内容
  • :white_check_mark: PDF文档第一页 → 正确提取文字

觉得好用给个点赞 :+1: 有问题留言反馈。

by 普罗米修斯

需要有图片上传功能吗

不需要,直接安装使用

不需要上传功能好评,很多场景直接用比配置方便多了

截图文字识别这个需求确实很高频,尤其是对着终端报错截图的情况

直接安装即可这点好,不用配置图片上传服务

doubao多模态识图速度比GPT-4V快,国内调用稳定多了