VoxCPM2 完整安裝教學(2026)!免費開源 AI 語音生成:用一句話「設計」聲音、複製聲音,中文超自然還能在自己電腦跑

0
36 人次

VoxCPM2 完整安裝教學(2026)!免費開源 AI 語音生成:用一句話「設計」聲音、複製聲音,中文超自然還能在自己電腦跑

AI 配音工具越來越厲害,但主流服務像 ElevenLabs 都是雲端訂閱制,字數一多錢包就在哀嚎,而且要把自己的聲音上傳到別人的伺服器,總是有點毛毛的。有沒有「免費、開源、可以在自己電腦離線跑」的選擇呢?

有的!開發出 MiniCPM 系列的 OpenBMB 團隊,在 2026 年 4 月開源了 VoxCPM2:一個 20 億(2B)參數的文字轉語音(TTS)模型,用超過 200 萬小時的多語言語音資料訓練,支援 30 種語言(當然包含中文,甚至還有粵語、閩南話等方言),輸出 48kHz 錄音室等級音質。GitHub 上已累積超過 3.4 萬顆星,是目前最熱門的開源 TTS 專案之一。

最有趣的是它的「Voice Design」功能——不用任何參考音檔,只要用一句話描述「中年男性、聲音低沉、講話慢條斯理」,它就能憑空生出一個符合描述的聲音。這篇文章阿正老師就帶大家在 Windows 和 Mac 上把 VoxCPM2 裝起來玩!



一、VoxCPM2 是什麼?

VoxCPM2 是 OpenBMB 於 2026 年 4 月發布的開源 TTS 模型,架構上走「tokenizer-free」路線:不像傳統 TTS 先把聲音切成離散 token,而是透過擴散自迴歸(diffusion autoregressive)架構直接生成連續的語音表示,講起話來更自然、更有感情起伏。底層以 MiniCPM-4 為骨幹,搭配 AudioVAE V2 的內建超解析度設計,餵 16kHz 的參考音檔也能直接輸出 48kHz 高音質。

授權是最佛心的 Apache 2.0——權重、程式碼全開源,商用也免費。想先聽聽效果再決定要不要安裝的話,官方在 Hugging Face 上有線上試玩 Demo,瀏覽器打開就能玩。

image_44FC10C3

官方網站 https://github.com/OpenBMB/VoxCPM
最新版本 VoxCPM2(2B)(發布日期2026-04)
支援系統 Windows / macOS(Apple Silicon 支援 MPS)/ Linux;另有 GGUF 版可純 CPU 執行
費用 免費(Apache 2.0 開源,可商用)
中文支援 ✅ 支援中文,另含粵語、閩南話等 9 種中文方言(介面與文件以英文/簡中為主)

二、三大招牌功能:語音設計、聲音克隆、30 種語言

1. Voice Design 語音設計。不需要任何參考音檔,直接用自然語言描述想要的聲音——性別、年齡、音色、情緒、語速都可以指定,模型就會「無中生有」一個新聲音。做 Podcast 旁白、遊戲 NPC 配音、有聲書角色,再也不用到處找音源。

2. 聲音克隆(Voice Cloning)。提供一小段參考音檔加上對應的逐字稿,模型就能延續該聲音的音色、節奏、情緒與風格來唸你給的文字,還能再用文字描述微調風格(Controllable Voice Cloning)。

3. 30 種語言直接合成。中、英、日、韓、法、德、西、泰、越等 30 種語言,輸入文字就能直接合成,不用加語言標籤,還支援粵語、閩南話、四川話等中文方言。官方公布的中文合成錯誤率(CER)在 1% 上下,屬於目前開源模型的前段班。

⚠️ 聲音克隆請注意法律與道德界線!未經本人同意克隆他人聲音,可能觸法(詐騙、人格權侵害等)。請只克隆自己的聲音,或取得明確授權的聲音,切勿用於偽造他人發言。

三、環境需求:你的電腦跑得動嗎?

  • Python:3.10 以上、3.13 以下
  • PyTorch:2.5.0 以上(NVIDIA 顯卡需 CUDA 12.0 以上)
  • 顯示記憶體(VRAM):官方文件標示約 5~8GB(依執行設定與精度而異)
  • Mac 用戶:Apple Silicon 可走 MPS 加速;也可用社群維護的 GGUF 量化版(llama.cpp-omni)在 CPU/Metal 上跑,官方數據 M4 Pro 上 Q8_0 的 RTF 約 1.76(即生成 1 秒語音約需 1.76 秒)

以阿正老師的桌機(RTX 5070 12GB)來說,VRAM 是綽綽有餘的;官方數據 RTX 4090 上 RTF 可低到約 0.3,代表能做到即時串流生成。M4 Mac Mini 16GB 這類機器建議測試時可以觀察:MPS 模式與 GGUF 量化版哪個生成速度比較理想,以及長文本生成時的記憶體占用狀況。


四、安裝步驟(Windows/Mac)

image_191758D9

官方已把套件上架 PyPI,安裝比想像中簡單。先確認電腦已安裝 Python 3.10~3.12,然後開啟終端機(Windows 用「命令提示字元」或 PowerShell、Mac 用「終端機」):

步驟 1:建立虛擬環境(建議,避免跟其他 Python 套件打架)

python -m venv voxcpm-env
# Windows 啟動:
voxcpm-env\Scripts\activate
# Mac / Linux 啟動:
source voxcpm-env/bin/activate

步驟 2:安裝 VoxCPM

pip install voxcpm

步驟 3:第一次執行(會自動從 Hugging Face 下載模型權重)

voxcpm --text "歡迎收看軟體玩家!" --output demo.wav

image_012647DA


模型權重從 Hugging Face 的 openbmb/VoxCPM2 下載,2B 模型檔案有數 GB,第一次執行請耐心等候;連 Hugging Face 不順的話,官方也支援改用 ModelScope 下載(pip install modelscope)。
詳細的安裝步驟,可參考官方的操作說明(簡體中文,可轉繁中)

image_198BAB2A


五、網頁介面與指令用法

不想打指令的話,官方專案內建 Gradio 網頁介面。從 GitHub 下載(git clone)專案後,在專案資料夾執行:

python app.py --port 8808
# 然後用瀏覽器開啟 http://localhost:8808

# 指定運算裝置(auto / cpu / mps / cuda):
python app.py --device auto

image_655F6E6E

指令列玩法也很直覺,舉幾個官方範例(中文說明由阿正老師加註):

# 語音設計:用文字描述憑空生出新聲音
voxcpm --text "今天要介紹一款免費軟體" \
  --instruction "年輕女性,聲音清亮,語速稍快,活潑" \
  --output design.wav

# 聲音克隆:參考音檔 + 逐字稿
voxcpm --text "這是聲音克隆測試" \
  --prompt-audio my_voice.wav \
  --prompt-text "參考音檔裡實際講的內容" \
  --output clone.wav

(實際參數名稱請以 官方文件 為準,不同版本可能略有調整。)


六、常見問題與注意事項

  • 裝不起來?最常見的原因是 Python 版本不符(必須 3.10~3.12)或 PyTorch/CUDA 版本太舊,先用 python --version 確認版本再安裝。
  • 生成的聲音跟想像不一樣?官方明確說明 Voice Design 與克隆的結果每次執行會有差異,建議同一組設定多生成 1~3 次挑最好的,這是已知限制不是你的問題。
  • 沒有獨立顯卡?可以走 GGUF 量化版(llama.cpp-omni 等社群方案)用 CPU 跑,速度較慢但可用;或先用 Hugging Face 線上 Demo 過過癮。
  • 繁體中文?模型支援中文合成,但訓練語料以簡中為主的可能性高,繁中文本直接輸入即可合成,發音細節(如破音字)建議測試時多留意。

想比較雲端方案的話,可以參考阿正老師之前寫的 ElevenLabs AI 語音教學;如果你已經在玩本地 AI,VoxCPM2 跟 OllamaLM Studio 搭配起來,文字生成+語音合成就能全部在自己電腦完成。


七、阿正老師的總結

✅ 優點

  • 完全免費開源(Apache 2.0),商用也 OK
  • 本地離線執行,聲音資料不出自己電腦
  • Voice Design 用一句話就能「設計」新聲音
  • 30 種語言+中文方言,48kHz 高音質輸出
  • 生態豐富:GGUF、ONNX、vLLM 加速方案齊全

⚠️ 缺點

  • 需要基本的終端機操作能力,門檻比雲端服務高
  • 建議有 5~8GB VRAM 的顯卡,純 CPU 跑較慢
  • Voice Design/克隆結果每次生成有隨機差異
  • 介面與文件以英文/簡中為主,無繁中介面

阿正老師點評:VoxCPM2 最適合三種人:不想付訂閱費的內容創作者、在意隱私想離線跑的本地 AI 玩家,以及需要大量配音的開發者(商用免費太香了)。如果你只是偶爾要一段配音,先玩 Hugging Face 線上 Demo 就好;玩上癮了再裝到自己電腦,一毛錢都不用花。


你的電腦也能開口說話了

從本地 LLM 到本地 TTS,開源 AI 已經把整條內容生產線搬進個人電腦。你會拿 VoxCPM2 來做什麼?Podcast 旁白、影片配音,還是幫自己的專案加上語音功能?

歡迎在下面留言跟阿正老師分享!

留下回覆

請輸入你的評論!
請在這裡輸入你的名字