精華筆記

· @aihub.tw

AI 語音與音樂

聲音克隆:複製自己的聲音

聲音克隆:複製自己的聲音

你做好了 Podcast 第一集的稿,坐下來錄音,說了三遍「各位聽眾大家好」,每次都覺得哪裡不對——語氣太硬、停頓太多、結尾音尾巴翹起來。錄完剪完,又發現有幾段稿子要修,改完得重錄那幾段,聲音對不上、環境音對不上、情緒也對不上。

如果你的聲音已經被 AI「記住了」,改稿就只要貼文字、按合成——剩下的交給模型。這就是聲音克隆在創作流程裡最直接的價值:把你的聲音變成可以批次呼叫的素材,而不是每次都要你坐在麥克風前重錄。

這堂課適合誰 適合:想做 Podcast、口播影片、有聲書、配音的創作者,對自己的聲音有一定要求但不想每次都重錄。需要基礎:零基礎 OK,但建議先看完第 2 課(文字轉語音),了解 TTS 的基本運作方式。前置課:第 2 課。

這堂學什麼

  • 聲音克隆的原理白話版:模型是怎麼「記住」一個聲音的
  • 錄樣本的三個品質關鍵:環境、時長、語料內容選擇
  • 在 ElevenLabs 建立即時克隆(IVC)與專業克隆(PVC)的差異與選擇邏輯
  • 在 Fish Audio 克隆中文聲音:最快 15 秒樣本上傳後拿到可用模型
  • 法律與條款紅線:哪些聲音你不能克隆、克隆後能拿來做什麼
  • 防詐常識:AI 聲音詐騙的識別方式

觀念一:克隆不是複製貼上,是「學聲音的習慣」

很多人以為聲音克隆是把你的聲音「存起來」直接播放。實際上完全不是這回事。

AI 聲音克隆的本質是:給模型聽你的聲音,讓它學會「你說話的方式」——包括你的音色、語速節奏、尾音習慣、氣聲頻率——然後把這套「說話方式」轉換成模型的參數。之後當你輸入一段新文字,模型用的是這套參數來合成語音,不是播放你的錄音。

聲音克隆原理:模型學的是說話方式

這帶來一個重要的實際結論:你原本的錄音品質決定了模型能學到多好的「習慣」。樣本裡有背景雜音、有空調嗡嗡聲、有手機震動聲,模型都會一起學進去。你的樣本越乾淨、越一致,克隆出來的聲音就越穩定。

觀念二:即時克隆 vs 專業克隆——選哪個?

目前主流平台把聲音克隆分成兩種等級,以 ElevenLabs 的叫法最具代表性:

即時克隆(Instant Voice Cloning, IVC):上傳 1~2 分鐘的樣本,幾秒鐘內模型就能用。原理是「以你的聲音為條件信號」,讓現有的大模型在生成時即時調整輸出風格。速度快,但對獨特腔調、情緒變化的還原度有限,短內容夠用,長篇朗讀可能會漂移。

專業克隆(Professional Voice Cloning, PVC):需要 30 分鐘以上的樣本,模型真的重新微調(fine-tune)——不只調整生成時的條件,而是更改模型本身的參數,讓你的聲音變成這個版本模型的「預設行為」。品質更穩,情緒變化也更自然,但要時間跑訓練(通常 3~6 小時)。

IVC 與 PVC 對照表

對大多數 Podcast 與口播創作者,從 IVC 開始是合理的:門檻低、可以馬上試音感覺對不對。等到你確定這個聲音模型要長期用,再認真錄 30 分鐘語料、跑 PVC。

觀念三:錄出好樣本的三個關鍵

1. 環境:背景噪音是你的第一個敵人

不需要錄音室。你需要的是安靜的小空間:最好是衣物多的衣帽間、有軟裝的臥室。浴室雖然隔音但有大量殘響(echo),不適合。廚房冰箱、空調出風口旁邊——避開。

測試方法:用手機錄 30 秒靜音,戴耳機放給自己聽。如果聽得到嗡嗡聲或間歇性噪音,換個地方再測。

麥克風不一定要很貴。手機直接錄、USB 麥克風、Podcast 動圈麥克風都可以——但要固定麥克風位置,不要一邊錄一邊移動距離,否則音量忽大忽小,模型會學到不一致的能量分布。

2. 時長:夠就好,不用貪多

IVC 版本:1 到 2 分鐘的乾淨錄音就夠了。不要錄 10 秒試試看——樣本太短,模型沒有足夠的素材學到你語調的全部特徵,生成的聲音會偏向平台的「平均腔」。

PVC 版本:30 分鐘是基本底線,60 分鐘以上更好。這個時長不是一次錄完——可以分幾天錄,每次 5~10 分鐘,上傳時把所有檔案一起放進去。

3. 語料:你說什麼比你說多久更重要

很多人直接對著麥克風唸自己文章的某一段——問題是,那段文字的語氣可能都差不多(全部是陳述句),模型學到的語調就太窄了。

好的語料應該包含:

  • 句子長短混搭(有長句、有短句)
  • 有問句、有感嘆句、有停頓
  • 自然口語(「那個、就是說、對啊」這類連接詞沒問題)
  • 你平常說話會有的情緒起伏——不要一直維持「電視新聞主播腔」

錄出好樣本的三個關鍵

手把手實戰

工具選擇說明

這堂課用兩個平台各示範一次:

平台 中文品質 方案 適合場景
Fish Audio 頂級(中日韓最強) 免費 8,000 credits/月;付費 Plus 約 $20/月(年繳更省) 中文 Podcast、口播、中文有聲書
ElevenLabs 中等(英文為主,多語言尚可) 免費 10,000 credits/月;Starter $6/月起 英文內容、多語言混用

中文創作者首選 Fish Audio;英文或需要多語言切換的選 ElevenLabs。以下兩條路徑都完整走一遍。

路徑 A - Fish Audio:克隆中文聲音

Step 1:準備樣本檔

先錄好你的樣本音訊。格式建議:WAV 或 MP3 皆可,44100 Hz 以上取樣率。用手機錄的話,iOS 的「語音備忘錄」預設就是 44100 Hz,夠用。

把錄好的檔案命名清楚(例如 my-voice-sample.wav),放到桌面備用。

Step 2:到 Fish Audio 建立聲音

前往 fish.audio 並登入帳號(Google 帳號快速登入即可)。

點上方選單的「Voice Clone」或直接到 fish.audio/voice-clone/

頁面上有「Upload Audio」區塊,把你的樣本拖進去。免費版最多可上傳 1 個音訊檔,付費版可以上傳多個(讓模型學到更多樣的語料)。

Step 3:填寫聲音資訊

  • Voice Name:填你自己取的名字,例如 我的中文聲音
  • Language:選 Chinese
  • Description:選填,建議填「25歲台灣男聲/女聲,自然口語風格」之類的描述,方便之後搜尋自己的聲音

按「Create Voice」——上傳完成後,通常不到 30 秒就能用。

Step 4:測試克隆聲音

切到「TTS」頁面,在「Select Voice」裡找到你剛才建立的聲音(通常在「My Voices」分類下)。

在文字框貼入以下測試段落:

大家好,我是這個 Podcast 的主持人。今天我們要聊的主題,
是 AI 工具如何改變一個人做節目的方式。如果你對這個題目有興趣,
歡迎繼續聽下去。

按「Generate」,聽看看。重點聽:語調的起伏自不自然、語速對不對、氣聲有沒有出來。

如果整體感覺到位但某一句不對,可能是那句本身標點符號的問題——在句子之間多加逗號或句號,可以影響停頓節奏。

路徑 B - ElevenLabs:建立即時克隆(IVC)

Step 1:準備樣本

同上,準備 1~2 分鐘的乾淨錄音。格式:MP3 或 WAV 皆可。

Step 2:到 ElevenLabs 建立 Voice

前往 elevenlabs.io 登入,點左側選單的「Voices」→「Add a New Voice」。

選擇「Clone Your Voice」底下的「Instant Voice Clone」。

Step 3:上傳與設定

  • 把你的樣本拖進上傳區
  • 填 Voice Name(英文或中文都可以)
  • 填 Description(例如:Natural Taiwanese Chinese speaker, calm narrative style)

按「Add Voice」。

注意:ElevenLabs 在這一步有一個同意確認:你必須勾選「I have all the necessary rights or permissions to clone this voice and I acknowledge that I take full responsibility for any unauthorized use of someone else's voice.」這是平台的法律保護機制——必須勾,且你必須確保這真的是你自己的聲音或你有授權克隆的聲音。

Step 4:測試合成

建立完成後去「Speech Synthesis」頁面,在 Voice 下拉選單裡選你剛才加的聲音。

貼入測試文字,按「Generate」聽看看。ElevenLabs 的 IVC 對中文的支援近年有改善,但如果你做的是純中文內容,語調可能略顯偏「外國人說中文」感——這就是 Fish Audio 在中文上的優勢所在。

實戰:用克隆聲音唸一段新稿

克隆聲音建好之後,實際把它用進你的創作流程裡:

場景:你改了 Podcast 稿的某一段,要重新生成那段音訊

把修改後的稿子段落貼進去:

上週我們提到,AI 工具最大的誤解是「它會取代你」。
實際上,更精確的說法是:會用 AI 工具的人,會取代不會用的人。
這兩件事聽起來像,但意義完全不同。

生成後,下載 MP3 檔。打開你的剪輯軟體(Premiere、DaVinci Resolve、甚至 CapCut 都可以),把這段新音訊放進時間軸,取代原本要重錄的那段——對齊、淡入淡出,完成。

這就是克隆聲音在工作流程裡的位置:不是要取代你所有的錄音工作,而是讓「改稿重錄這一件小事」不再是一個要重新開 session 的大工程。

克隆聲音在 Podcast 工作流中的位置

法律與平台條款:這條線不能踩

這一段認真讀,不是嚇你——是給你一個清楚的邊界,讓你在這個邊界內放心創作。

平台條款的共同底線

ElevenLabs 和 Fish Audio 的使用政策都明確寫道:你只能克隆自己的聲音,或你有明確書面授權可以克隆的聲音

ElevenLabs 特別列明禁止的行為包括:在沒有當事人同意的情況下複製他人聲音、以 AI 聲音冒充他人、用合成聲音製造欺騙性內容。違反者帳號會被封停,情節嚴重還可能面臨法律追究。

Fish Audio 同樣要求上傳者確認擁有聲音的合法使用權。

法律面:已經在動了

美國田納西州 2024 年通過的 ELVIS Act,把未經授權克隆聲音列為民事與刑事責任。歐盟的 AI 法規也把聲音克隆納入管制,要求留存同意紀錄與可追溯性。台灣目前雖然沒有專法,但依照《個人資料保護法》與民法人格權的相關條文,未經同意錄製並克隆他人聲音,同樣有法律風險。

實際操作紅線整理

聲音克隆的法律邊界

情境 可以 / 不行
克隆自己的聲音做 Podcast 可以
克隆有書面授權的聲優/配音員聲音 可以(要留存授權文件)
拿朋友的聲音「試試好不好玩」 不行——就算是朋友也需要明確同意
克隆名人/藝人/主播聲音 絕對不行,不管用途
用克隆聲音冒充他人、詐騙 刑事責任

商用授權

ElevenLabs:付費方案(Starter 起,每月 $6)生成的音訊擁有商用授權,可以放到有廣告的 YouTube 頻道、Podcast 商業合作、客戶案子。免費方案生成的音訊不能商用。

Fish Audio:免費方案的每月 8,000 credits 主要供個人測試用(無商用授權);正式商用建議升級付費方案,API 費用約 $15/百萬 UTF-8 位元組(中文一個字約佔 3 位元組)。

防詐提醒:AI 聲音詐騙長這樣

防詐常識:你的聲音也是別人可以克隆的 只要有人拿到你 3~10 秒的清晰聲音樣本(從 IG 限時動態、YouTube、Podcast 都能錄到),技術上就可以克隆你的聲音。這不是要嚇你停止創作,而是要讓你知道「接到家人聲音」不代表「是家人打的」。

目前最常見的 AI 聲音詐騙流程:詐騙集團從公開平台抓到目標人物的聲音樣本,克隆後打電話給家屬,偽裝「我出事了,你先轉帳給我」。因為聲音真的像,受害者往往沒有懷疑。

識別方法:

  1. 問一個只有對方才知道的問題:家裡貓咪的名字、上週一起去哪裡——不是密碼問題,是私人記憶細節。AI 聲音只有聲音,沒有記憶。
  2. 掛掉,用另一個管道確認:直接打對方的號碼回撥,或傳訊息確認。
  3. 任何要求緊急轉帳的電話,先暫停 30 秒:這個場景天然適合詐騙,不管對方的聲音有多真。

在這個課程裡,我們學的是用 AI 聲音做創作——但了解它被濫用的方式,是同等重要的素養。

常見坑

坑 1:樣本上傳後,合成的聲音完全不像我

症狀:生成出來的語音音色對,但語調完全是「機器腔」,聽起來像在唸單字。

原因:最常見的是樣本裡的語料太單一——全部都是平穩的陳述句,沒有語調起伏。另一個常見原因是樣本太短(低於 30 秒)。

解法:重錄 1~2 分鐘,刻意加入問句(「你有想過嗎?」)、短感嘆(「對啊,就這樣。」)、停頓,讓語調有高低;重新上傳,刪掉舊的樣本。

坑 2:合成出來有背景雜音或呼吸噪音特別明顯

症狀:生成的音訊裡有間歇性嗡嗡聲,或每句之間有誇張的喘氣聲。

原因:你的原始錄音有底噪,模型把它當成你說話習慣的一部分一起學了。

解法:

  1. 找到那份原始樣本音訊
  2. 用 Audacity(免費)或 Adobe Audition 的「Noise Reduction」功能先處理底噪
  3. 處理後的乾淨版本重新上傳,建立新的聲音模型

ElevenLabs 有提供簡單的音訊清理功能(Studio 裡的 Audio Cleanup),可以在上傳前先跑一遍。

坑 3:ElevenLabs 中文合成出來聲調完全跑掉(4聲變成全是2聲)

症狀:唸「媽麻馬罵」這種聲調對比明顯的字時,全部扁掉,聽起來很詭異。

原因:ElevenLabs 的底模以英文為主,對中文聲調的還原在 IVC 階段特別容易失真——你的樣本是中文,但底模的「語感」是英文的,兩者打架。

解法一:換到 Fish Audio——它的底模原生支援中文,聲調問題幾乎不存在。

解法二:如果非用 ElevenLabs 不可,試試把文字裡聲調容易跑掉的字用標點符號(逗號、破折號)強制加停頓,讓模型分段處理。這是 workaround,不保證有效。

坑 4:Fish Audio 免費方案 Credits 不夠用

症狀:合成到一半看到「Insufficient credits」,剩下的文字沒法生成。

每月免費 8,000 credits:Fish Audio S1 模型大約 1 credit ≒ 1 個中文字,8,000 credits ≈ 8,000 字的生成量。一集 20 分鐘 Podcast 的稿大約 3,0005,000 字,免費方案每月大約夠用 12 集。

解法:

  • 短期:把文字分段貼上,最重要的段落先生成,次要的下個月再補
  • 長期:升級付費方案(Plus 約 $20/月,年繳更省,credits 量大幅提升),或改用 Fish Audio API 按用量付費(約 $15/百萬 UTF-8 位元組,實際使用量很低的話比月費划算)

作業

  1. 錄一段 1~2 分鐘的中文聲音樣本:環境安靜、語料包含陳述句、問句與短感嘆。錄完用手機回放確認沒有明顯底噪。
  2. 在 Fish Audio 上傳樣本,建立你的聲音模型。用以下這段文字測試:
各位好,歡迎收聽這個節目。今天我想聊的,
是一個很多人都有但很少人說出口的困惑——
當 AI 工具越來越多,我們到底應該先學哪個?
  1. 把生成的音訊下載下來,用任何播放器聽:語調自不自然、音色像不像你?如果哪個字聽起來怪,試著改一下那個字前後的標點符號,重新生成一次。
  2. 選做:在 ElevenLabs 用同一份樣本建立一個 IVC,比較兩個平台生成的中文音質差異,記下你的觀察。

下一課預告

你現在有了自己的克隆聲音模型。但一集 Podcast 不只是「念稿」——還有開場音樂、段落切換、訪談剪輯、後製混音、上架到 Spotify。第 4 課《Podcast 工作流:一個人做一檔節目》,會把整條生產線拉出來:從稿子到最終上架的 MP3,每個環節用什麼工具、順序怎麼排、哪些步驟可以讓 AI 幫你跑。你的克隆聲音就是這條流水線的核心素材。

#AI 語音#聲音克隆#ElevenLabs#Fish Audio#Podcast

← 回所有文章