本文目录6 个章节
01. 什么是 Voicebox?它能解决哪些语音痛点
Voicebox 是一款安装在你本地电脑上的免费开源 AI 语音工作室软件。它的定位是替代像 ElevenLabs 这样按字收费的云端语音服务。使用 Voicebox,所有的语音生成、模型计算和声音数据都留在你自己的电脑上,既不需要按月订阅付费,也不用担心说话内容泄露到云端服务器。
Voicebox 软件主要涵盖四大核心功能:声音克隆(用你自己的声音配音)、文字转语音朗读、Stories Editor 多轨广播/播客创作,以及系统全局语音听写(按快捷键把说话变成文字打入任意应用中)。
Voicebox 核心代表性指标
-
0 元
软件与所有 AI 模型均在本地电脑上免费运行,无需购买云端字符包或按月订阅。
-
3-10 秒
只需录制或上传 3 至 10 秒的清晰朗读语音,软件即可自动克隆出专属音色。
-
<300ms
按下全局听写快捷键后,语音转文字自动粘贴至活动窗口的平均响应时间。
Voicebox 软件与传统云端语音平台对比
-
Voicebox 本地 AI 语音工作室
完全免费且隐私安全,生成次数不受限制,支持声音克隆、多音轨播客制作与电脑全局语音听写。
-
传统云端 TTS 服务 (如 ElevenLabs)
需要按生成的字符数量持续付费,依赖稳定网络,且声音文件必须上传至第三方服务器。
02. 软件安装与极速启动指南
Voicebox 软件支持苹果 Mac(支持 M1-M4 系列芯片加速)、Windows 以及 Linux 电脑。软件提供了极简的极速安装与启动流程。
Voicebox 软件安装启动 3 步骤
-
下载或克隆软件代码库
在电脑上使用 Git 命令下载 Voicebox 软件仓库。
-
一键自动安装依赖环境
打开终端运行
just setup命令,软件会自动下载配置好所需的 Python 依赖与 AI 模型引擎。 -
启动桌面软件界面
运行
just dev命令,软件会弹出图形化桌面操作界面并完成后台初始化。
git clone jamiepine/voicebox
cd voicebox
just setup
just dev03. 声音克隆与音色库管理实操
在 Voicebox 中,你可以非常轻松地把任何人的声音克隆出来并保存为音色。软件支持零样本(Zero-Shot)快速克隆,只需要一段非常短的音频样本。
3 秒声音克隆操作流程
-
录制或导入声音文件
用手机或麦克风录制 3 到 10 秒清晰、没有背景杂音的人声朗读音频。
-
导入软件并抽取音色
在软件的 Voice 界面点击添加声音,导入音频,AI 会自动抽取并生成专属音色卡。
-
打字生成专属配音
在输入框中打字并选择刚刚生成的音色,点击生成即可用该声音进行朗读。
软件内部集成了多种不同特色的 AI 引擎:如果你追求克隆声音最像、表达最自然,推荐选择 Qwen3-TTS 模型;如果你追求极速生成、做实时朗读,推荐选择轻量的 Kokoro 82M 模型;如果你要制作多语言跨国配音,可以选择 Chatterbox 模型。
04. 单文本生成与多轨播客创作
在软件的主界面中,你可以选择两种配音模式:单段文本快速生成和 Stories Editor 多轨播客编辑器。
在单段文本模式下,你只需要在框里粘贴文字,选择想要的声音 Profile 和音效模型,点击生成按钮,几秒钟后就可以在下方播放并导出 WAV 或 MP3 高清音频文件。
对于需要制作多角色对话、广播剧或播客工程的场景,可以使用 Stories Editor。在多轨编辑器中,你可以创建多条音轨,给角色 A 和角色 B 分配不同的声音,单独调节说话语速、音高平移(Pitch Shift)以及混响(Reverb)音效,最后合成一整段完整的对话音频。
05. 如何开启系统级全局语音听写功能
Voicebox 不仅能合成说话,还能当成你的电脑语音输入法使用。软件内置了全局听写(Dictation Mode)功能。
使用方法非常简单:在软件的设置面板中开启 Dictation 听写功能,并配置你习惯的全局快捷键(例如 Option+Space 或 Alt+Space)。此后在电脑上使用微信聊天、写文档、在浏览器搜索或写代码时,只要按下快捷键对麦克风说话,说话结束后 Voicebox 就会自动把语音转换成文字,并打入当前光标所在的输入框中。
06. AI 助手连接与声音调优建议
如果你平时使用 Cursor、Claude Code 或 Cline 等 AI 编程助手,还可以把 Voicebox 软件连接到你的 AI 工具里,让 AI 助手用 Voicebox 的声音直接把回答读给你听。
只需要在 AI 助手的配置文件里加上 Voicebox 的 MCP 服务设置即可:
{
"mcpServers": {
"voicebox": {
"command": "uv",
"args": [
"run",
"--directory",
"/path/to/voicebox/backend",
"mcp-server"
]
}
}
}查看声音效果调优与卡顿解决技巧
如果电脑配置较低或显存不足导致生成卡顿,可以在软件设置中将合成模型切换为轻量的 Kokoro 82M 引擎,或者在设置中勾选量化加速(int8 量化)。macOS 用户如果遇到内存占用过高,可以在系统环境变量中增加 MLX_GPU_MEMORY_LIMIT=0.7 来限制软件的最大内存开销。
REFERENCES