一个只有 10 亿参数(1B)的开源大模型,可以吊打包括Gemma 7B 、 Llama 7B、Qwen3.5-2B,并且只需要2G显存就能跑起来,你要不要试试?
最近 OpenBMB 正式发布了 MiniCPM5-1B。参数只有 1B,但在多个公开评测中拿了第一,堪称「2026年最强小钢炮」。
今天咱们不写复杂的编译部署,直接用 Ollama 跑,再给hermes配置上,轻型应用直接token自由。
先说说MiniCPM5-1B 是什么
MiniCPM5-1B 是 OpenBMB 推出的轻量级开源语言模型。跟那些动辄几十 G 的大模型不同,它最大的特点就是:小,但强,完整精度的文件只有2.17G,2G显存就能玩起来。
| 特性 | 参数 |
|---|---|
| 参数规模 | 1B(10亿) |
| 上下文长度 | 131072 Token(128K) |
| 双模式 | Think(深度思考)/ No Think(快速模式) |
| 支持 Agent | 工具调用、代码生成 |
| 部署方式 | Ollama、llama.cpp、LM Studio 等 |
1B 参数,登顶排行榜
MiniCPM5-1B 最让人惊讶的就是综合性能。
根据 Artificial Analysis 最新公布的 Sub-4B 开源模型排行榜,MiniCPM5-1B 以 17.9 分位列第一。

| 模型 | 分数 |
|---|---|
| MiniCPM5-1B | 17.9 🥇 |
| Qwen3.5-2B | 16.3 |
| Nanbeige4 3B | 16.1 |
| NVIDIA Nemotron Nano 4B | 14.7 |
| Gemma 7B | 8.4 |
| Llama 7B | 8.1 |
一个 1B 的模型,分数是 Gemma 7B 的两倍多。虽然不是所有场景都适用,但至少说明——小模型的时代真的来了。
Ollama 一键部署
这是我推荐的方式,因为 Ollama 真的是目前最简单好用的本地模型管理工具。
如果你还没装 Ollama
去 https://ollama.com 下载对应系统版本,Windows、macOS、Linux 都支持。装完就完事了,不需要配环境。

模型下载,推荐Huggingface
不同量化版本

| 版本 | 大小 | 适合 |
|---|---|---|
| Q4_K_M | ~688MB | 日常使用,够用 |
| Q8_0 | ~1.15GB | 需要更高质量 |
| F16 | ~2.17GB | ⭐ 完整精度 |
完整精度的只有2.17G,也就是2G显存就能玩,必须直接下载完整的。当然,如果你就是日常对话使用,Q4版本也足够用了。
Ollama部署
模型下载到本地后,执行以下命令创建Modefile把模型挂载到Ollama,例如在windows的桌面右键打开终端,以周桌面在C盘为例
:: 1. 写入基础模型路径 echo 'FROM 你下载保存模型的路径\MiniCPM5-1B-F16.gguf' > Modelfile :: 2. 执行导入 ollama create MiniCPM5-1B-F16 -f C:\Users\你的用户名\Desktop\Modelfile

看到sucess就说明挂载成功了,可以使用ollama list命令来确认,可以看到,我的本地模型列表里第一个就是最新加入的MiniCPM5-1B模型

测试能不能跑
跑起来后在客户端直接跟它聊天,响应还是蛮快的。

用 Ollama 对接 Hermes
如果你跟我一样用 Hermes 作为 AI 客户端,那把 MiniCPM5-1B 加进去也很简单。配置好后,你就可以在 Hermes 里直接用上本地 1B 模型,跑一些轻量任务完全不占 API 额度。
老路用的Hermes桌面端
打开Hermes设置,在模型里选择Custom endpoint,然后点击set up Custom endpoint


选择Local / custom endpoint,兼容端点处输入:http://localhost:11434/v1,注意后面一定要带有v1
http://localhost:11434/v1

点击连接,成功后会有如下显示,此时就设置好了,可以回到对话窗体,选择模型对话即可。


如果你用命令行的话,需要找到 Hermes 配置文件
Hermes 的配置文件一般在:
- Windows:
C:\Users\你的用户名\.hermes\config.yaml - macOS / Linux:
~/.hermes/config.yaml
用记事本或 VS Code 打开。
添加 Ollama provider
在 providers 部分添加一个 Ollama 的配置:
providers:
ollama:
model: minicpm5-1b
base_url: http://localhost:11434/v1
api_key: "" # 本地不需要 API Key
在会话中使用
保存配置文件后,重启 Hermes。在新建会话或切换模型时,选择 ollama/minicpm5-1b 即可。
体验
MiniCPM5-1B 虽然只有 1B 参数,但在 Hermes 里跑日常任务完全够用。响应速度很快,基本感觉不到延迟。对于简单的问答、翻译、文字润色这些场景,完全可以走本地,省下 API 调用次数。
实测
老路用自己的机器跑了一下,体感如下:
代码能力
让它写一个网页爬虫,代码逻辑基本正确,稍微调一下就能跑。对于 1B 模型来说表现很不错。

逻辑推理
经典的「昨天是明天」那种推理题,它能理清逻辑链条,没有翻车。

小说生成
让它写一个5000字左右的小说,几秒钟完成。

支持 128K 超长上下文
131072 Token 的上下文意味着什么?
- 一次性读完一本电子书
- 分析整个项目源码
- 处理长篇论文
- 超长聊天记录
- 多份 PDF 文档
对于需要做知识整理、代码分析或者长文总结的用户来说,体验比传统 8K、32K 上下文模型好太多了。
总结
MiniCPM5-1B 给老路的感受就是——1B 模型能做成这样,有点离谱。
以前提到本地模型,大家第一反应是「参数量太小,没法用」。但 MiniCPM5-1B 证明了一件事:高质量数据 + 先进训练策略,小参数也能出好效果。
适合谁
- ✅ 想在本地跑模型,但显卡不给力
- ✅ 需要长上下文处理
- ✅ 想要一个轻量 Agent 模型
- ✅ 想白嫖本地推理,不花 API 钱
不适合谁
- ❌ 需要最强生成质量(还是得用大模型)
- ❌ 需要多模态能力(它纯文本)
- ❌ 机器配置本身就很高了(直接上更大的模型)
另外,喜欢玩本地模型和AI应用的还可以看看这两篇
1 免费克隆你的声音