聲音克隆:複製自己的聲音
你做好了 Podcast 第一集的稿,坐下來錄音,說了三遍「各位聽眾大家好」,每次都覺得哪裡不對——語氣太硬、停頓太多、結尾音尾巴翹起來。錄完剪完,又發現有幾段稿子要修,改完得重錄那幾段,聲音對不上、環境音對不上、情緒也對不上。
如果你的聲音已經被 AI「記住了」,改稿就只要貼文字、按合成——剩下的交給模型。這就是聲音克隆在創作流程裡最直接的價值:把你的聲音變成可以批次呼叫的素材,而不是每次都要你坐在麥克風前重錄。
這堂學什麼
- 聲音克隆的原理白話版:模型是怎麼「記住」一個聲音的
- 錄樣本的三個品質關鍵:環境、時長、語料內容選擇
- 在 ElevenLabs 建立即時克隆(IVC)與專業克隆(PVC)的差異與選擇邏輯
- 在 Fish Audio 克隆中文聲音:最快 15 秒樣本上傳後拿到可用模型
- 法律與條款紅線:哪些聲音你不能克隆、克隆後能拿來做什麼
- 防詐常識:AI 聲音詐騙的識別方式
觀念一:克隆不是複製貼上,是「學聲音的習慣」
很多人以為聲音克隆是把你的聲音「存起來」直接播放。實際上完全不是這回事。
AI 聲音克隆的本質是:給模型聽你的聲音,讓它學會「你說話的方式」——包括你的音色、語速節奏、尾音習慣、氣聲頻率——然後把這套「說話方式」轉換成模型的參數。之後當你輸入一段新文字,模型用的是這套參數來合成語音,不是播放你的錄音。

這帶來一個重要的實際結論:你原本的錄音品質決定了模型能學到多好的「習慣」。樣本裡有背景雜音、有空調嗡嗡聲、有手機震動聲,模型都會一起學進去。你的樣本越乾淨、越一致,克隆出來的聲音就越穩定。
觀念二:即時克隆 vs 專業克隆——選哪個?
目前主流平台把聲音克隆分成兩種等級,以 ElevenLabs 的叫法最具代表性:
即時克隆(Instant Voice Cloning, IVC):上傳 1~2 分鐘的樣本,幾秒鐘內模型就能用。原理是「以你的聲音為條件信號」,讓現有的大模型在生成時即時調整輸出風格。速度快,但對獨特腔調、情緒變化的還原度有限,短內容夠用,長篇朗讀可能會漂移。
專業克隆(Professional Voice Cloning, PVC):需要 30 分鐘以上的樣本,模型真的重新微調(fine-tune)——不只調整生成時的條件,而是更改模型本身的參數,讓你的聲音變成這個版本模型的「預設行為」。品質更穩,情緒變化也更自然,但要時間跑訓練(通常 3~6 小時)。

對大多數 Podcast 與口播創作者,從 IVC 開始是合理的:門檻低、可以馬上試音感覺對不對。等到你確定這個聲音模型要長期用,再認真錄 30 分鐘語料、跑 PVC。
觀念三:錄出好樣本的三個關鍵
1. 環境:背景噪音是你的第一個敵人
不需要錄音室。你需要的是安靜的小空間:最好是衣物多的衣帽間、有軟裝的臥室。浴室雖然隔音但有大量殘響(echo),不適合。廚房冰箱、空調出風口旁邊——避開。
測試方法:用手機錄 30 秒靜音,戴耳機放給自己聽。如果聽得到嗡嗡聲或間歇性噪音,換個地方再測。
麥克風不一定要很貴。手機直接錄、USB 麥克風、Podcast 動圈麥克風都可以——但要固定麥克風位置,不要一邊錄一邊移動距離,否則音量忽大忽小,模型會學到不一致的能量分布。
2. 時長:夠就好,不用貪多
IVC 版本:1 到 2 分鐘的乾淨錄音就夠了。不要錄 10 秒試試看——樣本太短,模型沒有足夠的素材學到你語調的全部特徵,生成的聲音會偏向平台的「平均腔」。
PVC 版本:30 分鐘是基本底線,60 分鐘以上更好。這個時長不是一次錄完——可以分幾天錄,每次 5~10 分鐘,上傳時把所有檔案一起放進去。
3. 語料:你說什麼比你說多久更重要
很多人直接對著麥克風唸自己文章的某一段——問題是,那段文字的語氣可能都差不多(全部是陳述句),模型學到的語調就太窄了。
好的語料應該包含:
- 句子長短混搭(有長句、有短句)
- 有問句、有感嘆句、有停頓
- 自然口語(「那個、就是說、對啊」這類連接詞沒問題)
- 你平常說話會有的情緒起伏——不要一直維持「電視新聞主播腔」

手把手實戰
工具選擇說明
這堂課用兩個平台各示範一次:
| 平台 | 中文品質 | 方案 | 適合場景 |
|---|---|---|---|
| Fish Audio | 頂級(中日韓最強) | 免費 8,000 credits/月;付費 Plus 約 $20/月(年繳更省) | 中文 Podcast、口播、中文有聲書 |
| ElevenLabs | 中等(英文為主,多語言尚可) | 免費 10,000 credits/月;Starter $6/月起 | 英文內容、多語言混用 |
中文創作者首選 Fish Audio;英文或需要多語言切換的選 ElevenLabs。以下兩條路徑都完整走一遍。
路徑 A - Fish Audio:克隆中文聲音
Step 1:準備樣本檔
先錄好你的樣本音訊。格式建議:WAV 或 MP3 皆可,44100 Hz 以上取樣率。用手機錄的話,iOS 的「語音備忘錄」預設就是 44100 Hz,夠用。
把錄好的檔案命名清楚(例如 my-voice-sample.wav),放到桌面備用。
Step 2:到 Fish Audio 建立聲音
前往 fish.audio 並登入帳號(Google 帳號快速登入即可)。
點上方選單的「Voice Clone」或直接到 fish.audio/voice-clone/。
頁面上有「Upload Audio」區塊,把你的樣本拖進去。免費版最多可上傳 1 個音訊檔,付費版可以上傳多個(讓模型學到更多樣的語料)。
Step 3:填寫聲音資訊
- Voice Name:填你自己取的名字,例如
我的中文聲音 - Language:選
Chinese - Description:選填,建議填「25歲台灣男聲/女聲,自然口語風格」之類的描述,方便之後搜尋自己的聲音
按「Create Voice」——上傳完成後,通常不到 30 秒就能用。
Step 4:測試克隆聲音
切到「TTS」頁面,在「Select Voice」裡找到你剛才建立的聲音(通常在「My Voices」分類下)。
在文字框貼入以下測試段落:
大家好,我是這個 Podcast 的主持人。今天我們要聊的主題,
是 AI 工具如何改變一個人做節目的方式。如果你對這個題目有興趣,
歡迎繼續聽下去。
按「Generate」,聽看看。重點聽:語調的起伏自不自然、語速對不對、氣聲有沒有出來。
如果整體感覺到位但某一句不對,可能是那句本身標點符號的問題——在句子之間多加逗號或句號,可以影響停頓節奏。
路徑 B - ElevenLabs:建立即時克隆(IVC)
Step 1:準備樣本
同上,準備 1~2 分鐘的乾淨錄音。格式:MP3 或 WAV 皆可。
Step 2:到 ElevenLabs 建立 Voice
前往 elevenlabs.io 登入,點左側選單的「Voices」→「Add a New Voice」。
選擇「Clone Your Voice」底下的「Instant Voice Clone」。
Step 3:上傳與設定
- 把你的樣本拖進上傳區
- 填 Voice Name(英文或中文都可以)
- 填 Description(例如:Natural Taiwanese Chinese speaker, calm narrative style)
按「Add Voice」。
注意:ElevenLabs 在這一步有一個同意確認:你必須勾選「I have all the necessary rights or permissions to clone this voice and I acknowledge that I take full responsibility for any unauthorized use of someone else's voice.」這是平台的法律保護機制——必須勾,且你必須確保這真的是你自己的聲音或你有授權克隆的聲音。
Step 4:測試合成
建立完成後去「Speech Synthesis」頁面,在 Voice 下拉選單裡選你剛才加的聲音。
貼入測試文字,按「Generate」聽看看。ElevenLabs 的 IVC 對中文的支援近年有改善,但如果你做的是純中文內容,語調可能略顯偏「外國人說中文」感——這就是 Fish Audio 在中文上的優勢所在。
實戰:用克隆聲音唸一段新稿
克隆聲音建好之後,實際把它用進你的創作流程裡:
場景:你改了 Podcast 稿的某一段,要重新生成那段音訊
把修改後的稿子段落貼進去:
上週我們提到,AI 工具最大的誤解是「它會取代你」。
實際上,更精確的說法是:會用 AI 工具的人,會取代不會用的人。
這兩件事聽起來像,但意義完全不同。
生成後,下載 MP3 檔。打開你的剪輯軟體(Premiere、DaVinci Resolve、甚至 CapCut 都可以),把這段新音訊放進時間軸,取代原本要重錄的那段——對齊、淡入淡出,完成。
這就是克隆聲音在工作流程裡的位置:不是要取代你所有的錄音工作,而是讓「改稿重錄這一件小事」不再是一個要重新開 session 的大工程。

法律與平台條款:這條線不能踩
這一段認真讀,不是嚇你——是給你一個清楚的邊界,讓你在這個邊界內放心創作。
平台條款的共同底線
ElevenLabs 和 Fish Audio 的使用政策都明確寫道:你只能克隆自己的聲音,或你有明確書面授權可以克隆的聲音。
ElevenLabs 特別列明禁止的行為包括:在沒有當事人同意的情況下複製他人聲音、以 AI 聲音冒充他人、用合成聲音製造欺騙性內容。違反者帳號會被封停,情節嚴重還可能面臨法律追究。
Fish Audio 同樣要求上傳者確認擁有聲音的合法使用權。
法律面:已經在動了
美國田納西州 2024 年通過的 ELVIS Act,把未經授權克隆聲音列為民事與刑事責任。歐盟的 AI 法規也把聲音克隆納入管制,要求留存同意紀錄與可追溯性。台灣目前雖然沒有專法,但依照《個人資料保護法》與民法人格權的相關條文,未經同意錄製並克隆他人聲音,同樣有法律風險。
實際操作紅線整理

| 情境 | 可以 / 不行 |
|---|---|
| 克隆自己的聲音做 Podcast | 可以 |
| 克隆有書面授權的聲優/配音員聲音 | 可以(要留存授權文件) |
| 拿朋友的聲音「試試好不好玩」 | 不行——就算是朋友也需要明確同意 |
| 克隆名人/藝人/主播聲音 | 絕對不行,不管用途 |
| 用克隆聲音冒充他人、詐騙 | 刑事責任 |
商用授權
ElevenLabs:付費方案(Starter 起,每月 $6)生成的音訊擁有商用授權,可以放到有廣告的 YouTube 頻道、Podcast 商業合作、客戶案子。免費方案生成的音訊不能商用。
Fish Audio:免費方案的每月 8,000 credits 主要供個人測試用(無商用授權);正式商用建議升級付費方案,API 費用約 $15/百萬 UTF-8 位元組(中文一個字約佔 3 位元組)。
防詐提醒:AI 聲音詐騙長這樣
目前最常見的 AI 聲音詐騙流程:詐騙集團從公開平台抓到目標人物的聲音樣本,克隆後打電話給家屬,偽裝「我出事了,你先轉帳給我」。因為聲音真的像,受害者往往沒有懷疑。
識別方法:
- 問一個只有對方才知道的問題:家裡貓咪的名字、上週一起去哪裡——不是密碼問題,是私人記憶細節。AI 聲音只有聲音,沒有記憶。
- 掛掉,用另一個管道確認:直接打對方的號碼回撥,或傳訊息確認。
- 任何要求緊急轉帳的電話,先暫停 30 秒:這個場景天然適合詐騙,不管對方的聲音有多真。
在這個課程裡,我們學的是用 AI 聲音做創作——但了解它被濫用的方式,是同等重要的素養。
常見坑
坑 1:樣本上傳後,合成的聲音完全不像我
症狀:生成出來的語音音色對,但語調完全是「機器腔」,聽起來像在唸單字。
原因:最常見的是樣本裡的語料太單一——全部都是平穩的陳述句,沒有語調起伏。另一個常見原因是樣本太短(低於 30 秒)。
解法:重錄 1~2 分鐘,刻意加入問句(「你有想過嗎?」)、短感嘆(「對啊,就這樣。」)、停頓,讓語調有高低;重新上傳,刪掉舊的樣本。
坑 2:合成出來有背景雜音或呼吸噪音特別明顯
症狀:生成的音訊裡有間歇性嗡嗡聲,或每句之間有誇張的喘氣聲。
原因:你的原始錄音有底噪,模型把它當成你說話習慣的一部分一起學了。
解法:
- 找到那份原始樣本音訊
- 用 Audacity(免費)或 Adobe Audition 的「Noise Reduction」功能先處理底噪
- 處理後的乾淨版本重新上傳,建立新的聲音模型
ElevenLabs 有提供簡單的音訊清理功能(Studio 裡的 Audio Cleanup),可以在上傳前先跑一遍。
坑 3:ElevenLabs 中文合成出來聲調完全跑掉(4聲變成全是2聲)
症狀:唸「媽麻馬罵」這種聲調對比明顯的字時,全部扁掉,聽起來很詭異。
原因:ElevenLabs 的底模以英文為主,對中文聲調的還原在 IVC 階段特別容易失真——你的樣本是中文,但底模的「語感」是英文的,兩者打架。
解法一:換到 Fish Audio——它的底模原生支援中文,聲調問題幾乎不存在。
解法二:如果非用 ElevenLabs 不可,試試把文字裡聲調容易跑掉的字用標點符號(逗號、破折號)強制加停頓,讓模型分段處理。這是 workaround,不保證有效。
坑 4:Fish Audio 免費方案 Credits 不夠用
症狀:合成到一半看到「Insufficient credits」,剩下的文字沒法生成。
每月免費 8,000 credits:Fish Audio S1 模型大約 1 credit ≒ 1 個中文字,8,000 credits ≈ 8,000 字的生成量。一集 20 分鐘 Podcast 的稿大約 3,0005,000 字,免費方案每月大約夠用 12 集。
解法:
- 短期:把文字分段貼上,最重要的段落先生成,次要的下個月再補
- 長期:升級付費方案(Plus 約 $20/月,年繳更省,credits 量大幅提升),或改用 Fish Audio API 按用量付費(約 $15/百萬 UTF-8 位元組,實際使用量很低的話比月費划算)
作業
- 錄一段 1~2 分鐘的中文聲音樣本:環境安靜、語料包含陳述句、問句與短感嘆。錄完用手機回放確認沒有明顯底噪。
- 在 Fish Audio 上傳樣本,建立你的聲音模型。用以下這段文字測試:
各位好,歡迎收聽這個節目。今天我想聊的,
是一個很多人都有但很少人說出口的困惑——
當 AI 工具越來越多,我們到底應該先學哪個?
- 把生成的音訊下載下來,用任何播放器聽:語調自不自然、音色像不像你?如果哪個字聽起來怪,試著改一下那個字前後的標點符號,重新生成一次。
- 選做:在 ElevenLabs 用同一份樣本建立一個 IVC,比較兩個平台生成的中文音質差異,記下你的觀察。
下一課預告
你現在有了自己的克隆聲音模型。但一集 Podcast 不只是「念稿」——還有開場音樂、段落切換、訪談剪輯、後製混音、上架到 Spotify。第 4 課《Podcast 工作流:一個人做一檔節目》,會把整條生產線拉出來:從稿子到最終上架的 MP3,每個環節用什麼工具、順序怎麼排、哪些步驟可以讓 AI 幫你跑。你的克隆聲音就是這條流水線的核心素材。