三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

解决codex接入Deepseek后不能识别图片!!!!别再让 Codex 当“文盲“了!这个开源 Skill 让它直接看懂你的截图

解决codex接入Deepseek后不能识别图片!!!!别再让 Codex 当“文盲“了!这个开源 Skill 让它直接看懂你的截图

我做了什么

我写了一个开源的 Codex 技能:read-image(识图)

它的逻辑很简单:你贴一张图,它把图片交给视觉大模型"看图说话",再把结果带回对话里给你。

  • 默认走阿里云百炼的 Qwen-VL(有免费额度,日常使用几乎不花钱)

  • 支持任意 OpenAI 兼容的视觉模型:GPT-4o、GLM-4V、Kimi 都能换

  • 纯 Python 标准库实现,零第三方依赖,Windows / macOS / Linux 通吃

实测效果:把一张阿里云控制台的截图丢进去,几秒钟就返回里面的全部文字,一个不漏。

为什么值得装

  1. 不折腾:复制文件夹到技能目录 + 配一个 key,三步搞定

  2. 省钱:qwen-vl-plus 自带免费额度,识别一次几分钱甚至不要钱

  3. 可控:接口、模型、提示词全部可自定义,不绑死某一家厂商

  4. 安全:密钥只存在你本地,代码里没有硬编码,仓库里不会泄露

怎么用(真的只要三步)

# 1. 克隆 git clone https://gitee.com/jie_1999/read-image-codex.git
# 2. 复制到 Codex 技能目录 # Windows 示例:把 read-image 文件夹放到 # C:\Users\<你的用户名>\.codex\skills\ # macOS / Linux 则是 ~/.codex/skills/
# 3. 配置 API key(二选一) # 方式 A:设置环境变量 # DASHSCOPE_API_KEY=你的key # 方式 B:新建密钥文件 scripts/dashscope_key.txt # 里面放一行 sk- 开头的 key 即可

然后新开一个 Codex 对话,粘贴图片,说一句:

"识别这张图片里的文字"

完事。

想换模型?两个环境变量的事:

export DASHSCOPE_ENDPOINT="https://你的接口/v1/chat/completions" export DASHSCOPE_MODEL="你的模型名"

原理就三行话

图片 → base64 编码 → 发给视觉大模型的 chat/completions 接口 → 返回文字。

至于 Skill 本身,就是一份SKILL.md(告诉 Codex 什么时候该用)+ 一个几十行的 Python 脚本。这个思路谁都能复刻,我只是把坑都踩完了,打包好直接给你。

求个 Star

项目地址:https://gitee.com/jie_1999/read-image-codex

如果对你有用,欢迎 Star、提 issue、转发给同事和群友。也欢迎告诉我你还想让它识别什么场景,说不定下个版本就加进去了。

如果你也在用 Codex 干活,这个技能大概率用得上。装一次,之后一直能用。

← 返回列表