最近DeepSeek v4 Flash 正式版发布了,并且可以一键支持Codex(现在已经和ChatGPT合并了,不过老路还是习惯叫它Codex),说实话性价比是真的炸裂。但最大的问题还是DeepSeek看不了图,截图给它,它说”我是纯文本模型,无法处理图片”。今天老路教大家一招免费解法,10分钟让Codex + DeepSeek支持图片识别。
一、先说为什么 DeepSeek 看不了图
DeepSeek 的模型(包括 v4 Flash 正式版)是纯文本模型,不支持多模态:它只认文字,不认图片。你把截图丢给它,它根本”看不见”。

这不管是写代码还是处理其他工作都很痛苦:
- 截图发过去 → 它说看不了,让你贴文字
- 界面设计稿 → 它理解不了布局
- 图表/流程图 → 直接懵
Codex这么强的Agent,看不了图,性价比再炸裂,也相当于没有眼睛,能力直接砍掉3/4,之前老路写过的Hermes+DeepSeek不能看图的解决方案,也是类似的道理,再好用的Agent看不了图,相当于没用。
二、免费给 DeepSeek 装一双”眼睛”
思路很简单:DeepSeek 看不了图,那就找一个免费的视觉模型替它”看”,再把”看”的能力接进来。
这次老路用的是智谱的 GLM-4.6V-Flash,完全免费的视觉模型,128K 上下文,OpenAI 兼容接口,注册就有,不用充值。

整体链路长这样:

这相当于给 DeepSeek 装了个”看图翻译”的外挂。
三、实操步骤
老路的做法是:直接跟 Codex 对话,让它自己封装 MCP、再封装成 Skill。 全程老路只负责提一句话需求和提供APIKey。
第 1 步:注册智谱开放平台,拿免费 APIKey
- 打开 https://open.bigmodel.cn (智谱开放平台)
- 注册登录
- 进入 API Key 页面创建密钥
glm-4.6v-flash免费,不用充值
拿到一串 xxxxxxxx.xxxxxxxx 格式的 API Key。

第 2 步:告诉 Codex 需求(一句话)
在 Codex 对话里直接输入:
你自己做个mcp,底层调用GLM-4.6V-Flash,来进行图片理解,可以搞定吗?
Codex 会自动:
- 生成
server.py(MCP 服务器代码) - 写好调用 GLM-4.6V-Flash 的逻辑
- 注册到它的 MCP 配置文件

第 3 步:把APIKey给Codex
把从GLM拿到的apikey直接发给Codex,它会自己配置并进行测试。

第 4 步:真实图片测试
Codex自己的测试通过后,Codex 就把这套能力”记”下来了,发给他一张图来进行实际测试,可以看到已经可以正确识别图片内容了,并且还发现了之前代码的一些小错误,很是丝滑。


第 4 步:把MCP封装成Skill,并支持全局使用
同样,和Codex对话,让它把mcp封装成Skill,并且支持全局可用
把这个图片识别的mcp,封装成skill,并需要支持全局使用。

完成后,重启Codex客户端,新建一个对话框,上传一张图片,试试图片识别,完全没问题!

四、跟”手动下载项目”的区别
老路知道有人会说”GitHub 上有现成的”,但让 Codex 自己封装有两个好处:
| 对比 | 手动下载项目 | 让 Codex 自己封装 |
|---|---|---|
| 依赖 | 依赖别人维护的仓库 | 自给自足,代码自己生成 |
| 适配 | 要自己改配置适配版本 | Codex 按你的环境自动适配 |
| 理解 | 装完就完 | Codex 理解每个文件的作用,出问题自己会修 |
| 扩展 | 要读文档才能改 | 直接对话加需求,它帮你改 |
本质:让 AI 干活,而不是让 AI 的现成作品替你干活。
最爽的是免费,虽然有并发量限制,但是个人使用完全够,一分钱不用花。
五、过程中的几个坑和注意
| 坑/注意 | 说明 |
|---|---|
| 免费模型限流(429) | 调用太频繁会触发限流,项目内置了自动重试,还不行会降级到其他免费视觉模型 |
| 图片太大 | 超过 10MB 会自动压缩(需要装 pillow,一般的图片都没问题) |
| Key 别泄露 | API Key 别提交到 Git、别贴到公开地方,要添加到..gitignore(Codex会自动处理,不过自己还是要确认下) |
| 国内直连 | bigmodel.cn 国内可以直接访问,不用折腾网络 |
六、跟 Hermes 看图方案的对比
之前老路写过一篇 Hermes+DeepSeek 看图,用 Google 的免费模型给 Hermes 配视觉能力。这次是给 Codex 配,用的是智谱的模型,两条路各有各的好:
| 维度 | Hermes + Gemini | Codex + GLM-4.6V-Flash |
|---|---|---|
| 免费 | ✅ | ✅ |
| 国内访问 | ⚠️ Gemini 需要网络环境 | ✅ 国内直连 |
| 接入方式 | 配置 fallback | MCP + Skill |
| 适用 | Hermes 日常对话 | Codex 写代码场景 |
如果你主力是 Codex,就搞 GLM-4.6V-Flash 这条;如果主力是 Hermes,看那篇 Gemini 的。
总结
DeepSeek v4 Flash 正式版真香,但”看不了图”是真痛点。解法也很简单:
- GLM-4.6V-Flash —— 智谱免费视觉模型
- MCP 桥接 —— 让 Codex 能调用它
- Skill 封装 —— 一次配置,永久复用
全程零成本,十分钟搞定。以后报错截图、设计稿、图表,直接丢给 Codex 就行。
想了解更多 AI 工具和搞钱路子,看看我博客里的 免费eSIM+1GB全球流量 和 Google AI Studio 那几篇,都是老路亲测过的。