
AI 配音工具越來越厲害,但主流服務像 ElevenLabs 都是雲端訂閱制,字數一多錢包就在哀嚎,而且要把自己的聲音上傳到別人的伺服器,總是有點毛毛的。有沒有「免費、開源、可以在自己電腦離線跑」的選擇呢?
有的!開發出 MiniCPM 系列的 OpenBMB 團隊,在 2026 年 4 月開源了 VoxCPM2:一個 20 億(2B)參數的文字轉語音(TTS)模型,用超過 200 萬小時的多語言語音資料訓練,支援 30 種語言(當然包含中文,甚至還有粵語、閩南話等方言),輸出 48kHz 錄音室等級音質。GitHub 上已累積超過 3.4 萬顆星,是目前最熱門的開源 TTS 專案之一。
最有趣的是它的「Voice Design」功能——不用任何參考音檔,只要用一句話描述「中年男性、聲音低沉、講話慢條斯理」,它就能憑空生出一個符合描述的聲音。這篇文章阿正老師就帶大家在 Windows 和 Mac 上把 VoxCPM2 裝起來玩!
文章目錄
一、VoxCPM2 是什麼?
VoxCPM2 是 OpenBMB 於 2026 年 4 月發布的開源 TTS 模型,架構上走「tokenizer-free」路線:不像傳統 TTS 先把聲音切成離散 token,而是透過擴散自迴歸(diffusion autoregressive)架構直接生成連續的語音表示,講起話來更自然、更有感情起伏。底層以 MiniCPM-4 為骨幹,搭配 AudioVAE V2 的內建超解析度設計,餵 16kHz 的參考音檔也能直接輸出 48kHz 高音質。
授權是最佛心的 Apache 2.0——權重、程式碼全開源,商用也免費。想先聽聽效果再決定要不要安裝的話,官方在 Hugging Face 上有線上試玩 Demo,瀏覽器打開就能玩。
| 官方網站 | https://github.com/OpenBMB/VoxCPM |
| 最新版本 | VoxCPM2(2B)(發布日期2026-04) |
| 支援系統 | Windows / macOS(Apple Silicon 支援 MPS)/ Linux;另有 GGUF 版可純 CPU 執行 |
| 費用 | 免費(Apache 2.0 開源,可商用) |
| 中文支援 | ✅ 支援中文,另含粵語、閩南話等 9 種中文方言(介面與文件以英文/簡中為主) |
二、三大招牌功能:語音設計、聲音克隆、30 種語言
1. Voice Design 語音設計。不需要任何參考音檔,直接用自然語言描述想要的聲音——性別、年齡、音色、情緒、語速都可以指定,模型就會「無中生有」一個新聲音。做 Podcast 旁白、遊戲 NPC 配音、有聲書角色,再也不用到處找音源。
2. 聲音克隆(Voice Cloning)。提供一小段參考音檔加上對應的逐字稿,模型就能延續該聲音的音色、節奏、情緒與風格來唸你給的文字,還能再用文字描述微調風格(Controllable Voice Cloning)。
3. 30 種語言直接合成。中、英、日、韓、法、德、西、泰、越等 30 種語言,輸入文字就能直接合成,不用加語言標籤,還支援粵語、閩南話、四川話等中文方言。官方公布的中文合成錯誤率(CER)在 1% 上下,屬於目前開源模型的前段班。
三、環境需求:你的電腦跑得動嗎?
- Python:3.10 以上、3.13 以下
- PyTorch:2.5.0 以上(NVIDIA 顯卡需 CUDA 12.0 以上)
- 顯示記憶體(VRAM):官方文件標示約 5~8GB(依執行設定與精度而異)
- Mac 用戶:Apple Silicon 可走 MPS 加速;也可用社群維護的 GGUF 量化版(llama.cpp-omni)在 CPU/Metal 上跑,官方數據 M4 Pro 上 Q8_0 的 RTF 約 1.76(即生成 1 秒語音約需 1.76 秒)
以阿正老師的桌機(RTX 5070 12GB)來說,VRAM 是綽綽有餘的;官方數據 RTX 4090 上 RTF 可低到約 0.3,代表能做到即時串流生成。M4 Mac Mini 16GB 這類機器建議測試時可以觀察:MPS 模式與 GGUF 量化版哪個生成速度比較理想,以及長文本生成時的記憶體占用狀況。
四、安裝步驟(Windows/Mac)
官方已把套件上架 PyPI,安裝比想像中簡單。先確認電腦已安裝 Python 3.10~3.12,然後開啟終端機(Windows 用「命令提示字元」或 PowerShell、Mac 用「終端機」):
步驟 1:建立虛擬環境(建議,避免跟其他 Python 套件打架)
python -m venv voxcpm-env # Windows 啟動: voxcpm-env\Scripts\activate # Mac / Linux 啟動: source voxcpm-env/bin/activate
步驟 2:安裝 VoxCPM
pip install voxcpm
步驟 3:第一次執行(會自動從 Hugging Face 下載模型權重)
voxcpm --text "歡迎收看軟體玩家!" --output demo.wav
模型權重從 Hugging Face 的 openbmb/VoxCPM2 下載,2B 模型檔案有數 GB,第一次執行請耐心等候;連 Hugging Face 不順的話,官方也支援改用 ModelScope 下載(pip install modelscope)。
五、網頁介面與指令用法
不想打指令的話,官方專案內建 Gradio 網頁介面。從 GitHub 下載(git clone)專案後,在專案資料夾執行:
python app.py --port 8808 # 然後用瀏覽器開啟 http://localhost:8808 # 指定運算裝置(auto / cpu / mps / cuda): python app.py --device auto
指令列玩法也很直覺,舉幾個官方範例(中文說明由阿正老師加註):
# 語音設計:用文字描述憑空生出新聲音 voxcpm --text "今天要介紹一款免費軟體" \ --instruction "年輕女性,聲音清亮,語速稍快,活潑" \ --output design.wav # 聲音克隆:參考音檔 + 逐字稿 voxcpm --text "這是聲音克隆測試" \ --prompt-audio my_voice.wav \ --prompt-text "參考音檔裡實際講的內容" \ --output clone.wav
(實際參數名稱請以 官方文件 為準,不同版本可能略有調整。)
六、常見問題與注意事項
- 裝不起來?最常見的原因是 Python 版本不符(必須 3.10~3.12)或 PyTorch/CUDA 版本太舊,先用
python --version確認版本再安裝。 - 生成的聲音跟想像不一樣?官方明確說明 Voice Design 與克隆的結果每次執行會有差異,建議同一組設定多生成 1~3 次挑最好的,這是已知限制不是你的問題。
- 沒有獨立顯卡?可以走 GGUF 量化版(llama.cpp-omni 等社群方案)用 CPU 跑,速度較慢但可用;或先用 Hugging Face 線上 Demo 過過癮。
- 繁體中文?模型支援中文合成,但訓練語料以簡中為主的可能性高,繁中文本直接輸入即可合成,發音細節(如破音字)建議測試時多留意。
想比較雲端方案的話,可以參考阿正老師之前寫的 ElevenLabs AI 語音教學;如果你已經在玩本地 AI,VoxCPM2 跟 Ollama、LM Studio 搭配起來,文字生成+語音合成就能全部在自己電腦完成。
七、阿正老師的總結
✅ 優點
- 完全免費開源(Apache 2.0),商用也 OK
- 本地離線執行,聲音資料不出自己電腦
- Voice Design 用一句話就能「設計」新聲音
- 30 種語言+中文方言,48kHz 高音質輸出
- 生態豐富:GGUF、ONNX、vLLM 加速方案齊全
⚠️ 缺點
- 需要基本的終端機操作能力,門檻比雲端服務高
- 建議有 5~8GB VRAM 的顯卡,純 CPU 跑較慢
- Voice Design/克隆結果每次生成有隨機差異
- 介面與文件以英文/簡中為主,無繁中介面
阿正老師點評:VoxCPM2 最適合三種人:不想付訂閱費的內容創作者、在意隱私想離線跑的本地 AI 玩家,以及需要大量配音的開發者(商用免費太香了)。如果你只是偶爾要一段配音,先玩 Hugging Face 線上 Demo 就好;玩上癮了再裝到自己電腦,一毛錢都不用花。
你的電腦也能開口說話了
從本地 LLM 到本地 TTS,開源 AI 已經把整條內容生產線搬進個人電腦。你會拿 VoxCPM2 來做什麼?Podcast 旁白、影片配音,還是幫自己的專案加上語音功能?
歡迎在下面留言跟阿正老師分享!









