写在前面:我一直想找一个能本地运行的语音克隆工具,之前试过一些在线的,声音数据要上传,心里总是不踏实。后来发现了 Voicebox,一个开源的本地语音工作室,直接在电脑上跑,模型和数据都不出本机。试了几天,确实好用,功能多得有点出乎意料。
Voicebox 是什么?

Voicebox(https://github.com/jamiepine/voicebox)是一个纯本地运行的开源 AI 语音工作室,相当于 ElevenLabs 和 WisprFlow 的开源平替,而且两个功能合二为一了。
它能做什么?
- 从几秒的录音里克隆任何人的声音
- 用克隆的声音朗读任意文字(23 种语言)
- 全局听写:在任何输入框里按快捷键,说话自动打字
- 给 AI Agent 安上声音:Claude Code、Cursor 这些工具可以通过 Voicebox 跟你说话
最关键的是——全部在本地运行,模型和数据都不出你的电脑。
项目情况
Star: 40.6k Fork: 4.9k 协议: 开源 最后更新: 上周
安装
Voicebox 是一个桌面应用,下载安装包直接装,下载地址:https://github.com/jamiepine/voicebox/releases
Windows 用户:
下载 .msi 安装包,双击安装就行。
macOS 用户:
下载 .dmg 文件,Apple Silicon 和 Intel 都有对应的版本。
Linux 用户:
目前没有预编译的二进制文件,需要从源码构建。
装完打开,界面是一个漂亮的桌面窗口,跟普通软件一样用。

核心功能
1. 语音克隆
使用之前先要做一些基础配置,点击界面左侧菜单最后一个齿轮(设置),如果你是N卡,选GPU,安装CUDA,使用显卡会大幅提升克隆速度,装完如下图:

配置模型,还是左侧菜单,点倒数第二个,我自己用的是它清单里最好的模型,可以照抄,它会去huggingface下载,所以,需要魔法哦。

| 引擎 | 语言 | 特点 |
|---|---|---|
| Qwen3-TTS | 10种 | 中文效果好,支持语速/语气控制 |
| LuxTTS | 英文 | 轻量级,1GB显存就能跑 |
| Chatterbox Multilingual | 23种 | 语言覆盖最广 |
| Chatterbox Turbo | 英文 | 支持表情标签[laugh][sigh]等 |
| Kokoro | 8种 | 极小模型(82M),CPU也能跑,带50个预设声音 |
| TADA | 10种 | HumeAI的语音语言模型 |
每个模型的的效果不一样,我目前只需要中文,所以就用了Qwen。
2. 声音克隆 + 后处理
模型选完后,需要创建一个声音档案,也就是你想克隆的声音,你可以自己录一段,也可以直接上传一个音频,根据官方的建议,弄个30秒的音频效果最好。

完成档案创建后,就来到了实操界面,这里可以用你的声音来说不同的语言,如下,可以翻译成很多种语言,很好玩。

然后输入你想克隆声音的文本,点按钮就可以生成了

克隆的时候,还可以追加效果:
自带了 4 个预设效果:机器人音、收音机音、回声室、低音炮。也可以自建预设。


3. 全局听写
配置一下就可以在任何输入框里按全局快捷键,说话就能自动打字了。基于 Whisper 语音识别。
这个功能做视频字幕、写文章、记笔记都很实用。你不需要再手动打字了,说话就行。

4. Agent 语音输出
这个是最有意思的功能。Voicebox 支持 MCP 协议,也就是说——
Claude Code、Cursor、Cline 这些 AI 编程工具,可以通过 Voicebox 直接跟你说话。
你跟 AI 说「帮我解释一下这段代码」,它不只是在终端里打字回复,还会开口读给你听,用的还是你克隆的声音。
配置方式:给 AI Agent 加一个工具调用 voicebox.speak,它就自动调用 Voicebox 朗读文本。

5. 无限长度生成
一般在线语音工具对文字长度有限制(比如一次最多 2000 字),Voicebox 会自动分段生成然后拼接,最长支持 50,000 字符。读一整篇文章都没问题。
中文效果
我主要测了中文。用 Qwen模型,录了大概 40 秒的样本,克隆出来的声音识别度很高,语调和停顿都挺自然。
- 克隆相似度:⭐⭐⭐⭐
- 中文发音:⭐⭐⭐⭐⭐(Qwen3 的中文底子好)
- 生成速度:⭐⭐⭐⭐(有显卡更快)
- 自然度:⭐⭐⭐⭐
相比在线的 ElevenLabs,音质上还有差距,但考虑到免费 + 本地运行 + 隐私安全,这个差距完全可以接受。
适合什么场景
| 场景 | 推荐 |
|---|---|
| 视频配音 | ⭐⭐⭐⭐⭐ |
| 文章转语音 | ⭐⭐⭐⭐⭐ |
| 无障碍辅助(读屏) | ⭐⭐⭐⭐⭐ |
| AI Agent 语音输出 | ⭐⭐⭐⭐ |
| 多语言内容制作 | ⭐⭐⭐⭐ |
| 有声书制作 | ⭐⭐⭐⭐ |
跟在线服务对比
| 对比项 | Voicebox | ElevenLabs |
|---|---|---|
| 费用 | 免费 | 按月订阅 |
| 隐私 | 本地运行 | 数据上传服务器 |
| 语言 | 23种 | 29种 |
| 音质 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 语音克隆 | ✅ | ✅ |
| 全局听写 | ✅ | ❌ |
| Agent 语音 | ✅ | ❌ |
| 需要网络 | 仅首次下载模型 | 需要 |
| 开源 | ✅ | ❌ |
我的感受
Voicebox 跟我想象的不太一样——我以为是命令行工具,结果是完整的桌面应用;我以为只能克隆声音,结果还带全局听写和 Agent 语音输出。
最让我惊喜的是 Agent 语音输出。让 Claude Code 在写代码的时候开口说话,体验很奇妙。而且用的是你自己的声音,不是千篇一律的机器声。
不过它也有一点门槛:如果你想体验不同模型的效果,那么几个 TTS 引擎加起来要下载好几十个 G 的模型文件,对你的硬盘空间有要求。
如果你是做内容的、做视频的、或者天天跟 AI Agent 打交道的,推荐试试。
更多 AI 工具推荐请访问我的导航站 toolmixr.com
喜欢折腾本地AI工具的还可以看看老路下面这两篇文章