精華筆記

· @aihub.tw

AI 語音與音樂

AI 語音全景:TTS、克隆、音樂

AI 語音全景:TTS、克隆、音樂

你錄了一支口播,剪輯老半天,最後覺得聲音聽起來很奇怪——音調偏高、氣息不穩、台語腔偷跑出來。或者你想做 Podcast,卻沒有錄音設備,租工作室又太貴。又或者你接了一個短片案,需要片頭音樂,找配樂要版權費,找人作曲要時間和預算。

這些問題,2026 年的 AI 語音工具幾乎全部能解決。問題是工具太多,每一個都說自己最好,你一開始就被淹沒了。

這堂課先退一步,幫你畫一張地圖。搞清楚 AI 語音全貌,每一課要學的東西在地圖哪個位置,學起來才不會迷路。

這堂課適合誰 適合:想做口播、Podcast 或為影片配音/配樂的創作者,對 AI 工具感到好奇但還沒動手試過的人。需要基礎:零基礎 OK,不需要任何程式或錄音知識,會開瀏覽器就行。前置課:無(這是第 1 課)。

這堂學什麼

  • AI 語音三大類應用:TTS(文字轉語音)、聲音克隆、AI 音樂生成的用途與界線,知道自己的需求屬於哪一類
  • 主流工具全覽:ElevenLabs、Fish Audio、Suno、Adobe Podcast——中文表現重點標注,讓你知道哪個工具適合你的內容
  • 免費額度與商用授權:哪個方案可以直接拿去賺錢,哪個用了要標出處,哪個免費版根本不能商用
  • 倫理紅線預告:用 AI 複製別人聲音的法律與道德界線,這件事你要在第 1 課就知道
  • 六堂課路線圖:從這裡到能做出一集完整 Podcast,你要走哪幾步

觀念一:AI 語音的三大類應用

AI 語音工具很多,本質上只有三個用途。搞清楚三類的界線,才不會用錯工具。

AI 語音三大類應用地圖:TTS、聲音克隆、AI 音樂的輸入輸出、代表工具與適用場景

ElevenLabs 官網(2026 年 7 月實況) 圖:ElevenLabs 官網(2026 年 7 月實況),來源:elevenlabs.io

TTS(Text-to-Speech,文字轉語音)

你寫一段文字,AI 讀給你聽。這是最常見的應用:把文章配音、為影片加旁白、讓 app 說話。輸入是「字」,輸出是「聲音檔」。

現代 TTS 品質已很高,幾乎聽不出是 AI。關鍵差異在:語調自然度(停頓、重音)、中文斷句是否準確、情緒能否用自然語言指定(例如 [激動地]這件事太重要了!)。

聲音克隆(Voice Cloning)

你提供幾秒到幾分鐘的參考音訊,AI 學習你的聲音特徵,之後用「你的聲音」讀任何文字。不用每次錄音也能出內容,出差了也能照常更新。克隆分兩個層次:

  • 即時克隆(Instant Clone):上傳 30 秒即可,幾秒出結果,相似度約 70–80%
  • 專業克隆(Professional Clone):錄 20–30 分鐘指定文本,相似度可達 95%,第 3 課深入操作

AI 音樂生成

你寫一段描述(例如「輕鬆爵士鋼琴,台灣味,Podcast 片頭,無人聲,30 秒」),AI 生成完整的曲子,帶人聲或純器樂都可以。2026 年的工具單曲可做到 8 分鐘以上,音質接近專業製作。

三類可以組合:AI 音樂做片頭,克隆聲音說旁白,TTS 處理口播——第 6 課綜合實戰的架構正是如此。


觀念二:主流工具全覽與中文表現

以下是 2026 年你會用到的主要工具,依類別整理,中文支援重點標注。

主流 AI 語音工具對照卡片:TTS、克隆、音樂三類各工具的中文評分、核心強項與最低商用費用

TTS 工具對照

工具 中文支援 強項 注意事項
Fish Audio S2.1 Pro ★★★★★ 中文 Tier 1 中文最自然,83 種語言,[括號語法] 控制情緒 免費版僅個人用,不可商用
ElevenLabs ★★★☆☆ 多語言 v2 英文頂級,情緒豐富,生態最完整 中文有時斷句奇怪,免費版不可商用
Adobe Podcast ★★★★☆ 語音增強 + TTS 一條龍,整合 Premiere 需訂閱 Creative Cloud,功能偏錄音後製

Fish Audio 中文為什麼這麼強? S2.1 Pro 在超過 1,000 萬小時音訊資料上訓練,中文列為 Tier 1,斷句、輕聲、兒化音處理比英美系工具準確;[括號語法] 讓你用自然語言指定情緒,例如 [興奮地]這個消息讓我很開心!,不限固定選項,頭對頭試聽評比勝率 61%。

ElevenLabs 英文為什麼仍值得備著? 內容有英文或中英夾雜的場景,ElevenLabs 的英文語調自然度仍是業界天花板;純中文有時斷句奇怪、台灣特有詞發音不準,中文創作者以 Fish Audio 為主、ElevenLabs 為輔。

音樂生成工具對照

工具 版本(2026) 強項 備注
Suno v5.5(2026/03) 帶人聲、8 分鐘長曲、自訂聲線 WMG 授權合作後生態更穩
Udio v2 純器樂精細,Jazz / 古典強 付費方案可商用

Suno v5.5(2026/03) 重點: 支援自訂聲音克隆(哼幾句讓它幫你唱)、個人化風格模型、單曲最長 8 分鐘以上。2025 年底 Suno 與 WMG 和解並建立授權合作,商業生態趨於穩定。


觀念三:免費額度、方案價格與商用授權

這一節最重要——很多人用免費方案做完大量內容,才發現「不能商用」,白做了。先把規則搞清楚再動手。

主流工具定價與商用授權對照:Fish Audio、ElevenLabs、Suno 各方案月費、額度與是否可商用,及最低商用門檻

ElevenLabs 方案(2026/07)

方案 月費 額度 商用授權
Free $0 10,000 字元/月(約 10 分鐘) 不可商用,需標出處
Starter $6 30,000 字元/月(約 30 分鐘) 可商用
Creator $22 100,000 字元/月(約 100 分鐘) 可商用,含專業聲音克隆
Pro $99 600,000 字元/月(約 600 分鐘) 可商用

Starter 是最低商用門檻($6/月,約 190 台幣)。Creator 才包含「專業聲音克隆」。額度:標準模型 1 字元 = 1 credit;Flash / Turbo 模型 0.5 credit / 字元(效率翻倍)。

Fish Audio 方案(2026/07)

方案 月費(年繳) 額度 商用授權
Free $0 8,000 字元/月 不可商用
Plus $5.50 200 分鐘高品質生成/月 可商用
Pro $37.50 1,620 分鐘高品質生成/月 可商用

API 計費:S2.1 Pro,$15 美元/百萬 UTF-8 位元組。注意:中文每字 3 位元組,同字數的中文 API 成本約是英文的 3 倍。

Suno 方案(2026/07)

方案 月費(年繳) 每月生成量 商用授權
Free $0 約 10 首/天(50 點數/天) 不可商用
Pro $10($8 年繳) 約 500 首/月(2,500 點數) 可商用
Premier $30($24 年繳) 約 2,000 首/月(10,000 點數) 可商用,含進階分軌

授權細節: Suno 修改授權條款後,即使付費用戶,Suno 仍是技術上的「作者」,你拿到的是「永久商業授權」而非著作權所有。實際使用差別不大,但純 AI 生成、沒有親自寫詞的曲子,在台灣與美國目前無法登記著作權。


觀念四:倫理紅線——第 1 課就要知道這件事

AI 聲音克隆技術強大,也很容易被濫用。以下是紅線清單,之後第 3 課操作聲音克隆時你會再看到它。

聲音克隆倫理紅線:左側可以做(克隆自己、書面同意、標示 AI),右側不能做(冒充真人、詐騙、未經同意散播、惡意用途)

可以做:

  • 克隆自己的聲音用於創作內容
  • 取得當事人明確書面同意後,幫他們克隆聲音(例如語音演員授權你使用)
  • 製作虛構的 AI 角色,並明確標示為 AI 聲音

不能做:

  • 用 AI 冒充真實存在的人說出他沒說過的話
  • 用克隆聲音進行詐騙或商業欺騙
  • 在沒有得到同意的情況下,使用他人的聲音製作任何公開內容
  • 情色或惡意內容

台灣雖無 AI 聲音專法,但散佈不實聲音可能觸犯《刑法》誹謗罪或詐欺罪,民事上涉及肖像權與人格權侵害。「我只是用 AI 工具」不是免責理由。

商業使用的底線 如果你要把 AI 語音內容放到商業頻道、廣告、付費課程,三件事一定要先確認:(1)你使用的方案有商用授權;(2)克隆的聲音是你自己或已取得書面同意;(3)AI 生成的內容在適當位置標示。這堂課後面每一個實作都會提醒你。

手把手實戰:第一次摸到三種工具

這堂是概覽課,實戰目標不是做出成品,而是讓你的手真的碰到工具、感受差異。每個步驟都可以用免費方案完成。

建立你的工具帳號清單

先把三個主要平台的帳號開好,之後每一課直接用:

都可以免費試用。開好帳號後先別亂點,後面步驟會帶你操作。

在 Fish Audio 生成第一句中文語音

登入 Fish Audio 後,點上方「TTS」進入文字轉語音介面。

  1. 在「Select Voice」選一個中文語音(建議先選官方的「中文女聲」或「中文男聲」預設聲音)
  2. 在文字框輸入以下測試句:
台灣的夜市有各種各樣的小吃,有蚵仔煎、臭豆腐、大腸麵線。每一口都是記憶裡的味道。
  1. 點「Generate」,等待約 2–3 秒
  2. 播放音訊,若滿意再下載

聆聽重點:「蚵仔煎」發音是否準確、「麵線」的輕聲、句子停頓是否自然、整體語調有無起伏。這些就是你之後評比工具的基準點。

在 ElevenLabs 生成同一句話,聽差異

登入 ElevenLabs,點左側「Text to Speech」。

  1. 在「Voice」下拉選單搜尋「Chinese」或「Mandarin」,選一個預設中文聲音
  2. 輸入和 Fish Audio 完全一樣的句子:
台灣的夜市有各種各樣的小吃,有蚵仔煎、臭豆腐、大腸麵線。每一口都是記憶裡的味道。
  1. 「Model」選「Multilingual v2」(目前 ElevenLabs 對中文效果最好的模型)
  2. 點「Generate」,播放並下載

把兩個音檔對比聽: Fish Audio 中文斷句通常更自然,台灣詞發音更準;ElevenLabs 可能帶一點外國腔。但若內容是英文或中英夾雜,結論可能相反——工具沒有絕對好壞,只有適不適合你的內容。

在 Suno 生成第一首音樂

登入 Suno,點「Create」。你會看到兩種模式:

  • Simple Mode(簡單模式):輸入一段描述,Suno 自動產生歌詞和風格
  • Custom Mode(自訂模式):你自己寫歌詞、設定風格

先用 Simple Mode 試試。在描述欄輸入:

輕鬆的台灣 Podcast 片頭音樂,帶一點爵士鋼琴,沒有人聲,30 秒,溫暖親切的感覺

按「Create」,Suno 會同時生成兩個版本。聽完兩個,選你比較喜歡的那個。

注意:免費方案不可商用,也無法下載 WAV。第 5 課會用 Pro 方案做完整的配樂流程。

記錄你的第一印象,建立工具筆記

在 Notion 或 Apple 備忘錄建一頁「AI 語音工具筆記」:

Fish Audio 第一印象:
ElevenLabs 第一印象:
Suno 第一印象:
我最想深入的工具:
我的主要場景:(口播 / Podcast / 影片旁白 / 配樂)

這是你的基準線。每一課結束後回來加一行,六堂課後你會看到完整的進步軌跡。


常見坑

坑 1:用免費版試了覺得效果普通,就直接放棄

免費方案的生成品質有限制:ElevenLabs 免費版用的模型比付費版舊一個世代,額度只有 10,000 字元/月;Fish Audio 免費版超量就降速。如果試了覺得「還好而已」,先別放棄——建議先用免費版確認功能面(介面、中文支援、有沒有你要的功能),品質判斷要在付費方案下才準確。

坑 2:用免費方案做好大量內容,才發現不能商用

Fish Audio、ElevenLabs、Suno 的免費方案都不含商用授權。有廣告分潤的 YouTube、付費課程、商業廣告,全都是商業使用——違反條款。

解法:內容要商用,開始製作前先升級:

  • Fish Audio Plus:$5.50/月(年繳)
  • ElevenLabs Starter:$6/月
  • Suno Pro:$10/月($8 年繳)

三個加起來不到 700 台幣/月,比後來重做素材划算多了。

坑 3:拿 ElevenLabs 的中文效果當作 AI TTS 的整體標準

很多中文用戶第一次試 AI TTS 是從 ElevenLabs 開始,試了覺得中文不夠自然就放棄。這是工具選錯,不是技術的問題。中文內容先從 Fish Audio 試;如果 Fish Audio 也覺得不夠自然,再考慮錄原聲或聲音克隆方案。

坑 4:Suno 免費版生成的音樂放進商業影片

Suno 免費版生成的音樂不可用於商業目的:廣告、有廣告分潤的 YouTube 頻道、付費課程素材都算商業使用。「只是當背景音樂應該沒關係」——錯,只要頻道有廣告收益就構成商業使用。片頭音樂要商用,在 Suno Pro 方案下生成。


六堂課路線圖

六堂課學習路線圖:從 AI 語音全景(本課)、TTS 精進、聲音克隆、Podcast 工作流、AI 音樂到綜合實戰,各課學完能做到什麼

六堂課的邏輯:從概念到實作、從單一工具到整合工作流。

主題 學完能做什麼
第 1 課 AI 語音全景(本課) 知道該用哪個工具、哪些坑不要踩
第 2 課 文字轉語音:自然到聽不出是 AI 做出品質達標的中文口播段落
第 3 課 聲音克隆:複製自己的聲音 不用每次錄音也能持續出內容
第 4 課 Podcast 工作流:一個人做一檔節目 從腳本到剪輯的完整一人流程
第 5 課 AI 音樂:Suno 寫歌與配樂 為自己的節目做原創片頭曲
第 6 課 綜合實戰:有片頭音樂的 Podcast 一集 端到端做完整一集 Podcast

每一課都有作業,而且作業會是下一課的輸入素材——你不是在練習假案例,你是在一步步打造自己真正的節目。


作業

完成以下三件事,帶著成果進第 2 課:

  1. 開好三個帳號:Fish Audio、ElevenLabs、Suno,免費方案登入,確認介面正常
  2. 做比較試聽:同一段中文(30–50 字)放進兩個 TTS 各生成一次,寫下三個差異——這是第 2 課的起點
  3. 想清楚使用場景:口播?旁白?Podcast?配樂?這個答案決定第 2 課要深入哪個方向

下一課預告

第 2 課進入第一個實作主題:文字轉語音。深入 Fish Audio S2.1 Pro 和 ElevenLabs 的進階參數,學會用 [情緒語法] 讓 AI 語調有起有伏,做出一段 60 秒品質達標的口播成品。如果你現在的感覺是「AI 語音有點機器感」,第 2 課之後你很可能改變這個判斷。

#AI 語音#TTS#聲音克隆#AI 音樂#ElevenLabs#Fish Audio#Suno

← 回所有文章