2G显存也能玩本地大模型,吊打Gemma 7B、Llama 7B、Qwen3.5-2B,保姆级本地部署教程

一个只有 10 亿参数(1B)的开源大模型,可以吊打包括Gemma 7B 、 Llama 7B、Qwen3.5-2B,并且只需要2G显存就能跑起来,你要不要试试?

最近 OpenBMB 正式发布了 MiniCPM5-1B。参数只有 1B,但在多个公开评测中拿了第一,堪称「2026年最强小钢炮」。

今天咱们不写复杂的编译部署,直接用 Ollama 跑,再给hermes配置上,轻型应用直接token自由。

先说说MiniCPM5-1B 是什么

MiniCPM5-1B 是 OpenBMB 推出的轻量级开源语言模型。跟那些动辄几十 G 的大模型不同,它最大的特点就是:小,但强,完整精度的文件只有2.17G,2G显存就能玩起来

特性参数
参数规模1B(10亿)
上下文长度131072 Token(128K)
双模式Think(深度思考)/ No Think(快速模式)
支持 Agent工具调用、代码生成
部署方式Ollama、llama.cpp、LM Studio 等

1B 参数,登顶排行榜

MiniCPM5-1B 最让人惊讶的就是综合性能。

根据 Artificial Analysis 最新公布的 Sub-4B 开源模型排行榜,MiniCPM5-1B 以 17.9 分位列第一

模型分数
MiniCPM5-1B17.9 🥇
Qwen3.5-2B16.3
Nanbeige4 3B16.1
NVIDIA Nemotron Nano 4B14.7
Gemma 7B8.4
Llama 7B8.1

一个 1B 的模型,分数是 Gemma 7B 的两倍多。虽然不是所有场景都适用,但至少说明——小模型的时代真的来了。

Ollama 一键部署

这是我推荐的方式,因为 Ollama 真的是目前最简单好用的本地模型管理工具。

如果你还没装 Ollama

https://ollama.com 下载对应系统版本,Windows、macOS、Linux 都支持。装完就完事了,不需要配环境。

模型下载,推荐Huggingface

【点这里从Huggingface下载】

不同量化版本

版本大小适合
Q4_K_M~688MB日常使用,够用
Q8_0~1.15GB需要更高质量
F16~2.17GB⭐ 完整精度

完整精度的只有2.17G,也就是2G显存就能玩,必须直接下载完整的。当然,如果你就是日常对话使用,Q4版本也足够用了。

Ollama部署

模型下载到本地后,执行以下命令创建Modefile把模型挂载到Ollama,例如在windows的桌面右键打开终端,以周桌面在C盘为例

:: 1. 写入基础模型路径
echo 'FROM 你下载保存模型的路径\MiniCPM5-1B-F16.gguf' > Modelfile

:: 2. 执行导入
ollama create MiniCPM5-1B-F16 -f C:\Users\你的用户名\Desktop\Modelfile

看到sucess就说明挂载成功了,可以使用ollama list命令来确认,可以看到,我的本地模型列表里第一个就是最新加入的MiniCPM5-1B模型

测试能不能跑

跑起来后在客户端直接跟它聊天,响应还是蛮快的。

用 Ollama 对接 Hermes

如果你跟我一样用 Hermes 作为 AI 客户端,那把 MiniCPM5-1B 加进去也很简单。配置好后,你就可以在 Hermes 里直接用上本地 1B 模型,跑一些轻量任务完全不占 API 额度。

老路用的Hermes桌面端

打开Hermes设置,在模型里选择Custom endpoint,然后点击set up Custom endpoint

选择Local / custom endpoint,兼容端点处输入:http://localhost:11434/v1,注意后面一定要带有v1

http://localhost:11434/v1

点击连接,成功后会有如下显示,此时就设置好了,可以回到对话窗体,选择模型对话即可。

如果你用命令行的话,需要找到 Hermes 配置文件

Hermes 的配置文件一般在:

  • Windows: C:\Users\你的用户名\.hermes\config.yaml
  • macOS / Linux: ~/.hermes/config.yaml

用记事本或 VS Code 打开。

添加 Ollama provider

providers 部分添加一个 Ollama 的配置:

providers:
  ollama:
    model: minicpm5-1b
    base_url: http://localhost:11434/v1
    api_key: ""  # 本地不需要 API Key

在会话中使用

保存配置文件后,重启 Hermes。在新建会话或切换模型时,选择 ollama/minicpm5-1b 即可。

体验

MiniCPM5-1B 虽然只有 1B 参数,但在 Hermes 里跑日常任务完全够用。响应速度很快,基本感觉不到延迟。对于简单的问答、翻译、文字润色这些场景,完全可以走本地,省下 API 调用次数。

实测

老路用自己的机器跑了一下,体感如下:

代码能力

让它写一个网页爬虫,代码逻辑基本正确,稍微调一下就能跑。对于 1B 模型来说表现很不错。

逻辑推理

经典的「昨天是明天」那种推理题,它能理清逻辑链条,没有翻车。

小说生成

让它写一个5000字左右的小说,几秒钟完成。

支持 128K 超长上下文

131072 Token 的上下文意味着什么?

  • 一次性读完一本电子书
  • 分析整个项目源码
  • 处理长篇论文
  • 超长聊天记录
  • 多份 PDF 文档

对于需要做知识整理、代码分析或者长文总结的用户来说,体验比传统 8K、32K 上下文模型好太多了。

总结

MiniCPM5-1B 给老路的感受就是——1B 模型能做成这样,有点离谱。

以前提到本地模型,大家第一反应是「参数量太小,没法用」。但 MiniCPM5-1B 证明了一件事:高质量数据 + 先进训练策略,小参数也能出好效果。

适合谁

  • ✅ 想在本地跑模型,但显卡不给力
  • ✅ 需要长上下文处理
  • ✅ 想要一个轻量 Agent 模型
  • ✅ 想白嫖本地推理,不花 API 钱

不适合谁

  • ❌ 需要最强生成质量(还是得用大模型)
  • ❌ 需要多模态能力(它纯文本)
  • ❌ 机器配置本身就很高了(直接上更大的模型)

另外,喜欢玩本地模型和AI应用的还可以看看这两篇

1 免费克隆你的声音

2 ComfyUI生成中文封面

×

感谢您的支持

💳
支付宝
💬
微信支付
Bitcoin
USDT
QR Code

📌 老路分享
🔧 toolmixr.com — 老路最常用的免费工具
genaipick.com — 最新AI评测
本网站部分链接为联盟链接,通过它们购买或注册不会增加您的费用,但老路会获得小额佣金,感谢支持!
隐私政策 | 使用条款 | 关于