Hermes + DeepSeek 不能看图?5分钟白嫖Google免费模型实现图片识别!

很多人跟老路一样用 DeepSeek 作为 Hermes 的主力模型,便宜、代码能力强、中文好。但它有个硬伤——不支持多模态,没法识别图片。每次想贴个截图给它看,都要切到别的工具,非常蛋疼。今天分享一个老路一直在用的方案,不花钱,不改代码,直接在 Hermes 里配一下就好,5分钟搞定。

如果你也在用 Hermes,而且苦于 DeepSeek 没有多模态,这篇文章应该能帮你省不少事。

效果如下:

先说说痛点

Hermes 是目前我用过最顺手的 AI 客户端,支持多模型切换、工具调用、本地运行,体验很好,同样接入Deepseek,我的直观感觉是Hermes响应速度要高于Codex。

我主力模型用的 DeepSeek,原因是:

  • 便宜(比 Claude 、ChatGPT比便宜的不是一点半点)
  • 代码能力强(日常足够用)
  • 中文理解好

但最大的问题——DeepSeek 不支持多模态。你在聊天框里贴一张截图,它看不到。想让它分析 UI 设计、看报错截图、识别图片里的文字……统统不行。

之前我的解决方案是:切到 ChatGPT 或者 Gemini 看一眼,看完再切回来。麻烦,而且容易断掉思路。

后来我研究了一下 Hermes 的配置,发现它有一个辅助视觉模型(vision fallback)的机制。简单说就是:主力模型用 DeepSeek(文本),遇到图片的时候自动调另一个模型来处理。

而 Google AI Studio里很多模型都是免费的, Gemini 3.1 Flash Lite 就是,而且还支持多模态。这不就白嫖了吗?

方案原理

你粘贴图片 → Hermes 发现 DeepSeek 看不了 → 自动转发给 Gemini → Gemini 识别后返回结果

整个过程在后台完成,你在聊天界面感知不到切换,体验跟在 ChatGPT 里贴图一样流畅。

需要的材料

项目说明费用
Hermes你已经在用的免费
DeepSeek主力模型按量计费(很便宜)
Google AI Studio API Key免费额度够用免费
Gemini 2.0 Flash视觉模型免费

第一步:获取 Google API Key

  1. 打开 Google AI Studiohttps://aistudio.google.com/apikey
  2. 用你的 Google 账号登录
  3. 「创建API密钥」
  4. 复制生成的 Key,保存好

点击“创建API密钥”,在弹出的对话框里随便起个名字,项目可以重新创建一个,然后点击“创建密钥”就完事了

Google 目前给了免费额度,不用关心上限,正常使用,完全够,万一真的超限额了,换个模型继续白嫖。

第二步:在 Hermes 里配置

老路是使用桌面端配置的

在 Hermes 桌面端的设置里:

  1. 找到 Providers模型配置
  2. 添加一个 Google 的 provider:
Provider: google
API Key: 你的 Google API Key
  1. 然后在 DeepSeek 的模型配置里,找到 vision_model(视觉模型)选项
  2. 设置为 gemini-3.1-flash-litegemini-2.5-flash-lite(都足够用)

如果你是命令行,直接改配置文件

打开 Hermes 的配置文件(一般在 ~/.hermes/config.yaml 或你自定义的位置),找到模型配置部分。

config.yaml 里找到 DeepSeek 的 provider 配置,添加一个 vision_model 字段:

providers:
  deepseek:
    model: deepseek-reasoner
    api_key: 你的DeepSeek Key

  google:
    model: gemini-3.1-flash-lite
    api_key: 你的Google API Key

然后在 agent 或 session 配置里:

vision:
  provider: google
  model: gemini-3.1-flash-lite

不同版本的 Hermes 配置格式可能略有不同,但思路是一样的——给主力模型配一个视觉后备

使用效果

配置好之后,再跟 Hermes 聊天的时候:

  • 纯文字对话 → 依然是 DeepSeek 处理
  • 你贴了一张图片 → Hermes 自动调 Gemini 识别,把结果返回给你

举个例子,我让 Hermes 看封面截图,让它反推分析提示词。DeepSeek 处理不了,自动走了 Gemini,Gemini 识别截图里的信息,然后 DeepSeek 根据这个分析做出反推。

全程我就是在聊天框里贴了张图,没有任何额外操作。

实测数据

我用了一段时间,几个体感:

场景之前现在
看报错截图切到别的工具直接贴图,秒识别
分析网页设计手动描述截图即可
OCR 识别图片文字用另外的工具Gemini 直接提取
AI 生成的图片效果描述不出来贴图给 AI 看

常见问题

Q:会不会泄露隐私?

A:图片会经过 Google 的服务器。如果你有隐私顾虑,建议不要传敏感截图。一般的技术截图、UI 设计图、报错信息没什么问题。

Q:响应速度怎么样?

A:Gemini-3.1-flash-lite 本身就是轻量模型,识别图片速度很快,一般在几秒秒内返回,确实也遇到过繁忙的时候,再执行一次即可,毕竟免费的,不能要求太高。

Q:可以识别什么类型的内容?

A:支持常见格式:PNG、JPG、WebP。能识别图片里的文字、物体、场景、UI 元素等。

其他模型也可以

如果你不想用 Google,只要是Hermes 支持的模型厂商都可以。

最划算的还是 Gemini-3.1-flash-lite——免费,够用,白嫖不心疼。

因为老路还实验了付费的XiaoMI MiMo,那余额哗哗的掉。。。

总结

这个配置花 5 分钟就能搞定,核心就三步:

  1. Google AI Studio 拿一个 API Key
  2. 在 Hermes 里配上 Google provider
  3. 把 Gemini 设为 DeepSeek 的视觉模型

之后你再也不用因为「DeepSeek 不能看图」而打断思路了。贴图、识别、继续聊——一气呵成。

同样的道理,Hermes还支持不同的辅助模型,完全可以发挥你的想象,让不同的模型处理它最擅长的部分,然后让主力模型来给出最终结论~

当然,如果你不想麻烦,那么用一个支持视觉识别的模型作为主模型就行了,一步到位,可以参考老路这篇Kimi K3+Hermes的教程,原生就支持。

×

感谢您的支持

💳
支付宝
💬
微信支付
Bitcoin
USDT
QR Code

📌 老路分享
🔧 toolmixr.com — 老路最常用的免费工具
genaipick.com — 最新AI评测
本网站部分链接为联盟链接,通过它们购买或注册不会增加您的费用,但老路会获得小额佣金,感谢支持!
隐私政策 | 使用条款 | 关于