用自己的聲音,讓 AI 先念一遍
Voicebox:免費、在自己電腦跑的聲音複製
- 費用
- 免費
- 步驟
- 4 步
- 適合
- 想做副業的人
- 費用說明
- 免費開源(MIT),在自己電腦跑,不用 API 費用;第一次用要下載語音模型(我用的約 3.9 GB)
- 我的實測
- 我自己聽:非常像,還是台灣口音
- 查證日期
- 2026.10.10
這是什麼
一個免費開源的 AI 語音工作室,裝在自己的電腦上。給它一段十幾秒的錄音,它就能用你的聲音念任何文字,中文也可以。錄音和做出來的聲音都留在自己電腦裡,不會上傳到任何網站。
誰需要
- 拍短影音要錄旁白,常常一句錄好幾次的人
- 想在正式錄音之前,先聽聽稿子順不順、長度剛不剛好的人
要不要錢
免費(MIT 開源),在自己電腦跑,不用 API 費用。第一次用會下載語音模型,我用的那個約 3.9 GB。有 NVIDIA 顯卡會比較快;沒開顯卡加速也能用 CPU 跑,我一句大約 45 秒。
怎麼開始
- 到官網 voicebox.sh 或 GitHub 的發行頁,下載 Windows 版安裝。
- 準備一段 10~20 秒、背景安靜的自己的錄音,加上跟錄音一字不差的逐字稿。不會剪的話,可以請 Claude Code 幫忙:
幫我從「旁白.m4a」剪出一段 10~20 秒、剛好是完整句子的乾淨錄音,存成 wav。
剪好後用 Whisper 聽寫一次,給我這段錄音一字不差的逐字稿。
- 在 Voicebox 新增一個聲音,上傳這段錄音和逐字稿,語言選中文。
- 打上想念的文字,選你的聲音,按生成。
我實際怎麼用
我從自己之前錄好的 AI 快報旁白剪了 14 秒,讓它用我的聲音念三句新的話:一句台灣口語、一句中英混雜、一句有數字的。
我自己聽的結果:非常像,也是台灣口音,只有「報告」的「報」念得不太準。
中間踩到一個坑:前兩次,AI 念每一句之前,都先多念一句我根本沒寫的話。原因是我給的逐字稿,多了一句錄音裡沒有的內容;改成跟錄音一字不差之後就正常了。
小提醒
- 逐字稿一定要跟錄音一字不差。 多一句、少一句,AI 都可能把多出來的話念出來。
- 只能用自己的聲音,或本人同意的聲音。 官方文件也寫明,複製別人的聲音要先取得同意。
- 發到 IG、FB 的話,逼真的 AI 聲音要標示「AI 生成」。 我建議拿它先試聽稿子、抓秒數,正式發布還是用自己錄的,觀眾比較信任。
- 安裝檔沒有 Windows 數位簽章,電腦可能跳出警告。只從官網或 GitHub 官方發行頁下載。
- 個別字可能念不準,像我的「報告」。要用之前,整句聽過一次。