Codex + DeepSeek 可以看图了!完全免费!10分钟搞定!

最近DeepSeek v4 Flash 正式版发布了,并且可以一键支持Codex(现在已经和ChatGPT合并了,不过老路还是习惯叫它Codex),说实话性价比是真的炸裂。但最大的问题还是DeepSeek看不了图,截图给它,它说”我是纯文本模型,无法处理图片”。今天老路教大家一招免费解法,10分钟让Codex + DeepSeek支持图片识别

一、先说为什么 DeepSeek 看不了图

DeepSeek 的模型(包括 v4 Flash 正式版)是纯文本模型,不支持多模态:它只认文字,不认图片。你把截图丢给它,它根本”看不见”。

这不管是写代码还是处理其他工作都很痛苦:

  • 截图发过去 → 它说看不了,让你贴文字
  • 界面设计稿 → 它理解不了布局
  • 图表/流程图 → 直接懵

Codex这么强的Agent,看不了图,性价比再炸裂,也相当于没有眼睛,能力直接砍掉3/4,之前老路写过的Hermes+DeepSeek不能看图的解决方案,也是类似的道理,再好用的Agent看不了图,相当于没用。

二、免费给 DeepSeek 装一双”眼睛”

思路很简单:DeepSeek 看不了图,那就找一个免费的视觉模型替它”看”,再把”看”的能力接进来。

这次老路用的是智谱的 GLM-4.6V-Flash,完全免费的视觉模型,128K 上下文,OpenAI 兼容接口,注册就有,不用充值。

整体链路长这样:

相当于给 DeepSeek 装了个”看图翻译”的外挂。

三、实操步骤

老路的做法是:直接跟 Codex 对话,让它自己封装 MCP、再封装成 Skill。 全程老路只负责提一句话需求和提供APIKey。

第 1 步:注册智谱开放平台,拿免费 APIKey

  1. 打开 https://open.bigmodel.cn (智谱开放平台)
  2. 注册登录
  3. 进入 API Key 页面创建密钥
  4. glm-4.6v-flash 免费,不用充值

拿到一串 xxxxxxxx.xxxxxxxx 格式的 API Key。

第 2 步:告诉 Codex 需求(一句话)

在 Codex 对话里直接输入:

你自己做个mcp,底层调用GLM-4.6V-Flash,来进行图片理解,可以搞定吗?

Codex 会自动:

  • 生成 server.py(MCP 服务器代码)
  • 写好调用 GLM-4.6V-Flash 的逻辑
  • 注册到它的 MCP 配置文件

第 3 步:把APIKey给Codex

把从GLM拿到的apikey直接发给Codex,它会自己配置并进行测试。

第 4 步:真实图片测试

Codex自己的测试通过后,Codex 就把这套能力”记”下来了,发给他一张图来进行实际测试,可以看到已经可以正确识别图片内容了,并且还发现了之前代码的一些小错误,很是丝滑。

第 4 步:把MCP封装成Skill,并支持全局使用

同样,和Codex对话,让它把mcp封装成Skill,并且支持全局可用

把这个图片识别的mcp,封装成skill,并需要支持全局使用。

完成后,重启Codex客户端,新建一个对话框,上传一张图片,试试图片识别,完全没问题

四、跟”手动下载项目”的区别

老路知道有人会说”GitHub 上有现成的”,但让 Codex 自己封装有两个好处:

对比手动下载项目让 Codex 自己封装
依赖依赖别人维护的仓库自给自足,代码自己生成
适配要自己改配置适配版本Codex 按你的环境自动适配
理解装完就完Codex 理解每个文件的作用,出问题自己会修
扩展要读文档才能改直接对话加需求,它帮你改

本质:让 AI 干活,而不是让 AI 的现成作品替你干活。

最爽的是免费,虽然有并发量限制,但是个人使用完全够,一分钱不用花。

五、过程中的几个坑和注意

坑/注意说明
免费模型限流(429)调用太频繁会触发限流,项目内置了自动重试,还不行会降级到其他免费视觉模型
图片太大超过 10MB 会自动压缩(需要装 pillow,一般的图片都没问题)
Key 别泄露API Key 别提交到 Git、别贴到公开地方,要添加到..gitignore(Codex会自动处理,不过自己还是要确认下)
国内直连bigmodel.cn 国内可以直接访问,不用折腾网络

六、跟 Hermes 看图方案的对比

之前老路写过一篇 Hermes+DeepSeek 看图,用 Google 的免费模型给 Hermes 配视觉能力。这次是给 Codex 配,用的是智谱的模型,两条路各有各的好:

维度Hermes + GeminiCodex + GLM-4.6V-Flash
免费
国内访问⚠️ Gemini 需要网络环境✅ 国内直连
接入方式配置 fallbackMCP + Skill
适用Hermes 日常对话Codex 写代码场景

如果你主力是 Codex,就搞 GLM-4.6V-Flash 这条;如果主力是 Hermes,看那篇 Gemini 的。

总结

DeepSeek v4 Flash 正式版真香,但”看不了图”是真痛点。解法也很简单:

  1. GLM-4.6V-Flash —— 智谱免费视觉模型
  2. MCP 桥接 —— 让 Codex 能调用它
  3. Skill 封装 —— 一次配置,永久复用

全程零成本,十分钟搞定。以后报错截图、设计稿、图表,直接丢给 Codex 就行。

想了解更多 AI 工具和搞钱路子,看看我博客里的 免费eSIM+1GB全球流量Google AI Studio 那几篇,都是老路亲测过的。

×

感谢您的支持

💳
支付宝
💬
微信支付
Bitcoin
USDT
QR Code

📌 老路分享
🔧 toolmixr.com — 老路最常用的免费工具
genaipick.com — 最新AI评测
本网站部分链接为联盟链接,通过它们购买或注册不会增加您的费用,但老路会获得小额佣金,感谢支持!
隐私政策 | 使用条款 | 关于