綜合實戰:有片頭音樂的 Podcast 一集
學完五課工具,很多人卡在同一個問題:「我知道每個工具怎麼用,但要做一集完整 podcast,我到底該先開哪個視窗?」
這不是笑話——我看過不止一個人在第三步才發現 Suno 免費版無法商用,或者後製到一半才意識到所有音檔的音量根本不一致。工具會用跟「把工具串成產品」是兩件不同的事。這堂課就做這件事:從零到一,完整走一集有片頭音樂的 podcast,每一步給你可以複製的 prompt 和設定,結尾算清楚實際花多少錢。
這堂學什麼
- 六步驟 SOP:企劃→腳本→聲音克隆→口播生成→片頭音樂→後製上架,每步有交付物定義
- 完整可複製的腳本 prompt、Fish Audio TTS 設定、Suno 片頭音樂 prompt
- 後製混音:Audacity 免費做到 Spotify 標準(-16 LUFS)
- 成本試算:從免費仔到正式商業節目的費用區間
- 六個高頻踩坑(含具體症狀與解法)
觀念:六步驟生產線
做一集 podcast 本質是一條組裝線,每個工位只做一件事、輸出一個交付物,下個工位接著進場。順序亂掉就會卡——最常見的就是腳本還沒定稿就開始錄音,改了一次就要重錄一次。

以下就照這條線走一遍。範例節目設定:單人說書節目,主題「AI 工具週報」,每集目標 10–15 分鐘,中文普通話,創作者用自己的聲音。
手把手實戰
步驟一:企劃——用三個問題鎖定這一集
在開任何工具之前,先在一張白紙(或 Notion 頁面)回答三個問題:
① 這集主題一句話:______________
② 目標聽眾在哪個場景聽:通勤/睡前/工作背景
③ 這集結束後,聽眾會做什麼或想到什麼?
把這三個答案存成「節目設定表」。後面寫腳本、生成音樂風格,都從這張表出發,而不是憑感覺。
範例設定表:
主題:Suno v5.5 片頭音樂實戰(本課的 demo 內容就用這個)
場景:通勤,聽眾在捷運上
行動:聽完去 Suno 試一首
步驟二:用 AI 生成完整腳本
腳本是這條線最重要的交付物——TTS、後製都以它為基礎,改一字就可能要重來。所以先把腳本寫到「可以朗讀」的程度再進下一步。
把這個 prompt 丟給 Claude 或 ChatGPT:
你是台灣 podcast 主持人,說話自然、口語,有節奏感。
幫我寫一集「AI 工具週報」第 12 集的完整腳本,主題是「Suno v5.5:AI 現在能幫你寫片頭音樂了」。
要求:
- 長度:1,800–2,200 個中文字(對應 10–12 分鐘播出)
- 結構:[片頭音樂說明(5秒停頓標記)] → 開場白(1–2分鐘) → 主題一(工具介紹) → 主題二(實戰示範) → 重點回顧 → 片尾 CTA
- 數字、英文縮寫要「寫成可以念的樣子」(例:v5.5 寫成「第五點五版」)
- 段落之間加 [停頓 1 秒] 標記
- 輸出格式:純文字,不要加任何 Markdown
收到腳本後,大聲讀一遍——嘴巴讀起來卡住的地方就是 TTS 也會卡的地方,趁現在改。這個步驟花 15 分鐘,能省後面 1 小時。

步驟三:Fish Audio 聲音克隆
用自己的聲音做口播,克隆一次可以無限用。Fish Audio 在中文(包含台灣腔)的表現在現有工具裡最穩,2026 年只需 10 秒乾淨錄音就能完成克隆。
錄音規格(決定克隆品質的關鍵):
- 環境:安靜房間,關冷氣、關電扇
- 設備:任何有指向性的麥克風都行,手機離嘴 20 公分也可以
- 長度:30–60 秒,讀一段自然對話或新聞稿
- 格式:WAV 或 MP3,44100 Hz 以上
錄完後到 fish.audio,登入後點右上角頭像→「Voice Cloning」→「Create Voice」,上傳音檔,填寫聲音名稱(例:my-tw-voice-2026)與語言設定選「Chinese (Traditional)」,按 Submit。模型訓練大約 1–3 分鐘。
訓練完後,在「My Voices」點進剛建的聲音,用幾句測試文字確認音色和語調——這一步不跳過,克隆有問題早發現比生完整稿再發現好。
步驟四:生成口播音檔
腳本確認完、聲音克隆好,現在用 Fish Audio TTS 批次生成。
Fish Audio 方案選擇:
- Free:8,000 credits/月,個人非商業用途。一個中文字約佔 3 bytes UTF-8,8,000 credits ≈ 2,600 字。足夠測試,不夠一集商業內容。
- Plus:促銷價約 $5.50/月(年繳),額度大幅提升,可商用。
- API 計費:$15/100 萬 UTF-8 bytes,適合量產。
批次生成步驟:
把腳本拆成幾個段落(每段不超過 500 字),避免單次生成過長被截斷。在 Fish Audio 的 TTS 頁面:
- 選 Model:選你自己克隆的 Voice
- 貼入段落文字
- Speed:0.9–1.0(正常語速稍慢一點,有呼吸感)
- 按 Generate,下載為 MP3
注意腳本裡的 [停頓 1 秒] 標記——在 Fish Audio 裡這些標記要手動刪掉,不然它會把這幾個字念出來。停頓改用 Audacity 後製加靜音片段。
把每個段落音檔命名清楚,例:ep12-01-opening.mp3、ep12-02-topic1.mp3——後製時才不會搞混順序。

步驟五:Suno 生成片頭音樂
片頭音樂讓節目有識別感,30 秒以內、能循環的器樂是最好用的格式。
方案確認(先確認再動工):
| 方案 | 月費 | Credits/月 | 商用授權 | 可用模型 |
|---|---|---|---|---|
| Free | $0 | 50 credits/日 | 否 | v4.5-all |
| Pro | $10 | 2,500 | 是 | v5.5 |
| Premier | $30 | 10,000 | 是 | v5.5 |
如果你的 podcast 要上架、要放廣告或業配,一定要用 Pro 以上。Suno 免費版生成的音樂只能個人非商業使用。
生成片頭音樂的 Suno prompt:
使用 Custom Mode,填入 Style 欄位:
upbeat lo-fi podcast intro, acoustic guitar loop, light percussion, warm and friendly tone, 30 seconds, no vocals, fade in at beginning, fade out at end
Style 填完後,Lyrics 欄位留空(器樂不需要歌詞),Title 填節目名稱。選 v5.5 模型,按 Create。
一次生成兩首候選,聽完選一首。判斷標準:前 5 秒能不能抓住注意力,後半段夠不夠穩定——因為片頭音樂通常在主持人開始說話後就會被壓低淡出,後段不需要太有戲劇性。
選好後下載 MP3。如果買 Pro,這首音樂的商用授權就跟著走了。

步驟六:後製混音(Audacity 免費完成)
後製只做三件事:把所有音軌按順序排好、片頭音樂淡出壓到背景、整體音量標準化。用 Audacity(免費、跨平台)就夠了。
操作流程:
① 匯入所有音軌
開 Audacity,把片頭音樂和所有口播 MP3 拖入。每個檔案會變成一條獨立的音軌。
② 排列時間軸
用 Time Shift 工具把音軌排到對的時間點:
- Track 1:片頭音樂(從 0:00 開始)
- Track 2:開場白(從 0:03 開始,讓音樂先播 3 秒再講話)
- Track 3 以後:依序接上其他口播段落
口播段落之間,用「Generate → Silence」填入 0.5 秒靜音作為自然停頓。
③ 片頭音樂淡出
點擊片頭音樂軌→「Effect → Fading → Fade Out」套用在音樂的第 3–8 秒(主持人開始說話的區間),讓音樂自然壓低。
④ 音量標準化:打到 -16 LUFS
Spotify 的播放標準是 -14 LUFS,Apple Podcasts 是 -16 LUFS,業界通用值取 -16。
Audacity 內建:「Effect → Loudness Normalization」→ Perceived Loudness 填 -16 → OK。整軌套用一次搞定。
⑤ 匯出
「File → Export → Export as MP3」,Bitrate Mode 選 Constant(CBR),Bitrate 選 192 kbps——這是 podcast 音質與檔案大小的甜蜜點。存檔命名加上集數:aiweekly-ep12.mp3。
步驟七:上架到 Spotify 與 Apple Podcasts
台灣 podcast 生態目前兩條路:
Spotify for Creators(原 Anchor):完全免費、無限上傳,直接在 Spotify 播放,同時能一鍵分發到 Apple Podcasts、Amazon Music 等平台。台灣創作者最多人用的入門方案。
Firstory:台灣本土平台,介面中文、客服有中文支援,基本方案 $15/月,附帶更完整的分析數據。累積一定聽眾後可以考慮。
以 Spotify for Creators 為例,上架步驟:
- 到 creators.spotify.com 登入
- 點「New Episode」→上傳 MP3
- 填寫集數標題、描述(show notes)、分集編號
- 設定發布時間(可預約)→ Publish
- Apple Podcasts 會透過 RSS 自動同步,第一次可能等 24–48 小時審核
Show notes 怎麼寫? 丟給 Claude:
以下是這集 podcast 腳本,幫我寫 200 字以內的 show notes,
台灣繁中,條列重點,最後放一個「本集工具」清單。
[貼上腳本]
生成後微調就可以直接用。
成本總計
以下以「每月固定做四集、要商用上架」的情境估算。
| 工具 | 用途 | 方案 | 月費 |
|---|---|---|---|
| Fish Audio Plus | 聲音克隆 + TTS 口播 | 年繳促銷 | $5.50 |
| Suno Pro | 片頭音樂(商用授權) | 月繳 | $10 |
| Spotify for Creators | 上架分發 | 免費 | $0 |
| Audacity | 後製混音 | 永久免費 | $0 |
| 合計 | $15.50/月 |
只做個人非商業節目:Fish Audio Free + Suno Free = $0。商用才需要付費。
ElevenLabs 替代方案:如果中文以外還有英文內容,ElevenLabs Starter($6/月)的英文自然度比 Fish Audio 高,可以兩者並用——英文段落用 ElevenLabs,中文段落用 Fish Audio。
常見坑
坑 1:錄音有底噪,克隆出來的聲音全帶雜音
症狀:生成的口播音檔有持續的「嗡嗡」或「嘶嘶」聲。根本原因幾乎都是克隆用的錄音本身就有環境噪音——冷氣聲、電腦風扇、街道聲。Fish Audio 的克隆模型會把噪音學進去。
解法:重錄。要求:關所有電器、用棉被圍住麥克風三面也行。或先用 Adobe Podcast Enhance(免費)清噪音再上傳克隆。重新訓練克隆只要 1–3 分鐘,不要將就。
坑 2:腳本一次全貼進 Fish Audio,結果被截斷
症狀:生成的音檔在某個地方突然停止,後面的文字都沒有念。Fish Audio 單次輸入有字數上限,超過就靜默截斷,不會報錯。
解法:每次輸入不超過 500 字。把腳本分段,每段存獨立 MP3,後製再接。分段點選在自然停頓處(例:每個主題的結尾),後製較容易銜接。
坑 3:Suno Free 版生成的音樂不能商用
症狀:節目上架、收到業配,才想到背景音樂版權問題。Suno 免費版的輸出屬於個人非商業使用,放進有廣告收入的 podcast 就違反授權條款。
解法:在開始做節目前先確認商用授權需求,如果要商用,當月就訂 Pro($10/月)再生成片頭音樂。已經用免費版生成的音樂不能靠後來升級「追認」——那首音樂生成時的授權狀態就定了。最保險的做法是用 Pro 帳號重新生成一首。
坑 4:後製音量忽大忽小
症狀:聽眾回饋說「主持人聲音一下大一下小」,或片頭音樂比說話聲大很多。原因是各段口播用不同設定生成,或 TTS 的語速/強調不同導致響度差異。
解法:後製最後一步一定要做 Loudness Normalization,不要跳過。如果某段特別大聲,先選那段音軌→「Effect → Amplify」手動降一點 dB,再做全軌的 -16 LUFS 標準化。規則:先個別修異常,再整體標準化。
坑 5:Apple Podcasts 拒絕 RSS Feed,錯誤訊息是 "Invalid podcast feed"
症狀:透過 Spotify for Creators 上架後,自動同步到 Apple Podcasts 卻顯示失敗或一直等待。
常見原因:
- 集數描述含有 HTML 特殊字元(
<、&)但沒有正確跳脫 - MP3 的 ID3 tag 有亂碼(用非 UTF-8 編碼的軟體存過)
- 封面圖片不符合 Apple 要求(最小 1400×1400px,最大 3000×3000px,JPG 或 PNG)
解法:到 podba.se/validate 貼上你的 RSS Feed 網址,它會列出每個錯誤項目。修完對應問題再重新提交。
坑 6:Fish Audio 免費帳號 8,000 credits 不夠一集
症狀:生到一半顯示「Insufficient credits」,剩下的腳本沒辦法生成。8,000 credits 換算約 2,600 中文字,一集 10 分鐘腳本大約 1,800 字是夠的,但如果加上多次重生(試音色、修發音)就很快耗盡。
解法有兩條:一是用完之前就把腳本定稿再生成正式版,不要邊改邊生。二是升級 Fish Audio Plus($5.50/月年繳),額度足夠一個月做 4–8 集且可商用。如果只是測試,等次月 1 日 credits 自動補充再繼續。
坑 7:台語詞彙或特定地名用 Fish Audio 生成發音錯誤
症狀:腳本裡有「澎湖」、「旗山」、「三重」這類台灣地名,或「阿嬤」、「厝」之類台語詞,Fish Audio 用普通話規則念出來就怪。
解法:TTS 裡無法直接插入注音,改用「諧音替換」:把腳本裡發音錯誤的字替換成聽起來接近的普通話發音。例如「三重」(ㄙㄢ ㄔㄨㄥˊ,台語「Saⁿ-tiōng」)在節目說明時可以改成「台北三重地區」讓上下文帶出正確讀法。或者該詞改在後製後用真人重錄一小段貼回去。

成本 vs 時間對照
第一集學習曲線最陡:企劃加腳本 30–60 分鐘,克隆聲音 10 分鐘,TTS 生成 20 分鐘,Suno 片頭 10 分鐘,後製 30–45 分鐘。合計約 2–2.5 小時。
從第二集起,聲音克隆不用重做、流程熟悉,一集大約 45–60 分鐘。這就是為什麼課程一開始強調「SOP 先建對」——前期投資決定後期效率。
作業
- 完整跑一遍:以你自己的節目題目為主題,從企劃到上架走完六個步驟,拿到 Spotify for Creators 的播出連結。
- 成本盤點:把你用的工具方案寫下來,算出你的月費。如果是 $0,想清楚是否真的沒有商用需求。
- 發布第一集後:把連結分享給至少三個人聽,蒐集一條具體的反饋(不是「很好」,是「哪一段讓你最有共鳴」或「哪一段你想跳過」)。
- 選做:試著把 Fish Audio 替換成 ElevenLabs Creator($22/月),比較同一段腳本的中英文發音差異,決定你的長期工具組合。
下一課預告
這個系列到這裡教完了「聲音」這條線——但做出聲音只是一半。更多創作者面對的下一個問題是:怎麼把這個聲音搭上畫面? 影片課「AI 影片製作」會接著這條線走:用 Kling、Runway 做口播影片,把你的 podcast 剪成 Reels、YouTube Shorts,或者結合第 4 課的 Podcast 工作流做成影音節目。
如果你的目標是系統化產出內容——一個人維持多個平台、多種格式——「AI 內容系統」課會教你把這套工作流接上排程、自動化,讓一集素材裂變成六種格式。課程連結在頁面底部,選你下一步最需要的那條路。