很多人跟老路一样用 DeepSeek 作为 Hermes 的主力模型,便宜、代码能力强、中文好。但它有个硬伤——不支持多模态,没法识别图片。每次想贴个截图给它看,都要切到别的工具,非常蛋疼。今天分享一个老路一直在用的方案,不花钱,不改代码,直接在 Hermes 里配一下就好,5分钟搞定。
如果你也在用 Hermes,而且苦于 DeepSeek 没有多模态,这篇文章应该能帮你省不少事。
效果如下:
先说说痛点
Hermes 是目前我用过最顺手的 AI 客户端,支持多模型切换、工具调用、本地运行,体验很好,同样接入Deepseek,我的直观感觉是Hermes响应速度要高于Codex。
我主力模型用的 DeepSeek,原因是:
- 便宜(比 Claude 、ChatGPT比便宜的不是一点半点)
- 代码能力强(日常足够用)
- 中文理解好
但最大的问题——DeepSeek 不支持多模态。你在聊天框里贴一张截图,它看不到。想让它分析 UI 设计、看报错截图、识别图片里的文字……统统不行。
之前我的解决方案是:切到 ChatGPT 或者 Gemini 看一眼,看完再切回来。麻烦,而且容易断掉思路。
后来我研究了一下 Hermes 的配置,发现它有一个辅助视觉模型(vision fallback)的机制。简单说就是:主力模型用 DeepSeek(文本),遇到图片的时候自动调另一个模型来处理。
而 Google AI Studio里很多模型都是免费的, Gemini 3.1 Flash Lite 就是,而且还支持多模态。这不就白嫖了吗?

方案原理
你粘贴图片 → Hermes 发现 DeepSeek 看不了 → 自动转发给 Gemini → Gemini 识别后返回结果
整个过程在后台完成,你在聊天界面感知不到切换,体验跟在 ChatGPT 里贴图一样流畅。
需要的材料
| 项目 | 说明 | 费用 |
|---|---|---|
| Hermes | 你已经在用的 | 免费 |
| DeepSeek | 主力模型 | 按量计费(很便宜) |
| Google AI Studio API Key | 免费额度够用 | 免费 |
| Gemini 2.0 Flash | 视觉模型 | 免费 |
第一步:获取 Google API Key
- 打开 Google AI Studio:https://aistudio.google.com/apikey
- 用你的 Google 账号登录
- 点 「创建API密钥」
- 复制生成的 Key,保存好

点击“创建API密钥”,在弹出的对话框里随便起个名字,项目可以重新创建一个,然后点击“创建密钥”就完事了

Google 目前给了免费额度,不用关心上限,正常使用,完全够,万一真的超限额了,换个模型继续白嫖。
第二步:在 Hermes 里配置
老路是使用桌面端配置的
在 Hermes 桌面端的设置里:
- 找到 Providers 或 模型配置
- 添加一个 Google 的 provider:
Provider: google API Key: 你的 Google API Key
- 然后在 DeepSeek 的模型配置里,找到 vision_model(视觉模型)选项
- 设置为
gemini-3.1-flash-lite或gemini-2.5-flash-lite(都足够用)



如果你是命令行,直接改配置文件
打开 Hermes 的配置文件(一般在 ~/.hermes/config.yaml 或你自定义的位置),找到模型配置部分。
在 config.yaml 里找到 DeepSeek 的 provider 配置,添加一个 vision_model 字段:
providers:
deepseek:
model: deepseek-reasoner
api_key: 你的DeepSeek Key
google:
model: gemini-3.1-flash-lite
api_key: 你的Google API Key
然后在 agent 或 session 配置里:
vision: provider: google model: gemini-3.1-flash-lite
不同版本的 Hermes 配置格式可能略有不同,但思路是一样的——给主力模型配一个视觉后备。
使用效果
配置好之后,再跟 Hermes 聊天的时候:
- 纯文字对话 → 依然是 DeepSeek 处理
- 你贴了一张图片 → Hermes 自动调 Gemini 识别,把结果返回给你
举个例子,我让 Hermes 看封面截图,让它反推分析提示词。DeepSeek 处理不了,自动走了 Gemini,Gemini 识别截图里的信息,然后 DeepSeek 根据这个分析做出反推。
全程我就是在聊天框里贴了张图,没有任何额外操作。

实测数据
我用了一段时间,几个体感:
| 场景 | 之前 | 现在 |
|---|---|---|
| 看报错截图 | 切到别的工具 | 直接贴图,秒识别 |
| 分析网页设计 | 手动描述 | 截图即可 |
| OCR 识别图片文字 | 用另外的工具 | Gemini 直接提取 |
| AI 生成的图片效果 | 描述不出来 | 贴图给 AI 看 |
常见问题
Q:会不会泄露隐私?
A:图片会经过 Google 的服务器。如果你有隐私顾虑,建议不要传敏感截图。一般的技术截图、UI 设计图、报错信息没什么问题。
Q:响应速度怎么样?
A:Gemini-3.1-flash-lite 本身就是轻量模型,识别图片速度很快,一般在几秒秒内返回,确实也遇到过繁忙的时候,再执行一次即可,毕竟免费的,不能要求太高。
Q:可以识别什么类型的内容?
A:支持常见格式:PNG、JPG、WebP。能识别图片里的文字、物体、场景、UI 元素等。
其他模型也可以
如果你不想用 Google,只要是Hermes 支持的模型厂商都可以。
最划算的还是 Gemini-3.1-flash-lite——免费,够用,白嫖不心疼。
因为老路还实验了付费的XiaoMI MiMo,那余额哗哗的掉。。。
总结
这个配置花 5 分钟就能搞定,核心就三步:
- 去 Google AI Studio 拿一个 API Key
- 在 Hermes 里配上 Google provider
- 把 Gemini 设为 DeepSeek 的视觉模型
之后你再也不用因为「DeepSeek 不能看图」而打断思路了。贴图、识别、继续聊——一气呵成。
同样的道理,Hermes还支持不同的辅助模型,完全可以发挥你的想象,让不同的模型处理它最擅长的部分,然后让主力模型来给出最终结论~

当然,如果你不想麻烦,那么用一个支持视觉识别的模型作为主模型就行了,一步到位,可以参考老路这篇Kimi K3+Hermes的教程,原生就支持。