Podcast 工作流:一個人做一檔節目
想做 Podcast 的人很多,真正做出來的少之又少——不是沒有話題,而是卡在「第一集就死」這道關卡:錄音環境不夠安靜、一個人說話說不出對話感、後製不知道從哪下手、上架流程看了三篇教學還是搞不清楚。於是「想做個 Podcast」這個念頭一擱就是好幾年。
2026 年的 AI 工具正在把這些門檻一一拆掉。你不需要錄音設備、不需要找搭檔、不需要懂 DAW:用 TTS 或聲音克隆生成人聲、用 NotebookLM 一鍵變出雙人對談感、用 Auphonic 五分鐘完成後製、透過 RSS 提交一次就同步到 Spotify 與 Apple Podcasts。這堂課把這條生產線從頭走到尾——結束時你手上有一集真實可上架的五分鐘節目音檔。
這堂學什麼
- Podcast 腳本模板:結構化腳本怎麼寫,讓 Claude 生成、自己微調,一集三十分鐘以內完成
- 單人配音流程:ElevenLabs vs. Fish Audio 怎麼選,如何讓 TTS 聽起來像主持人而不是朗讀機器
- 雙人對談不用找搭檔:用 NotebookLM Audio Overview 把腳本或資料文件變成兩個 AI 主持人的深度對話
- 後製只做兩件事:Auphonic 降噪 + 音量正規化(-16 LUFS),讓音檔達到平台標準
- 一鍵上架所有平台:RSS 提交到 Spotify、Apple Podcasts 的完整步驟與細節
觀念一:三道傳統門檻,AI 各給一個解法
傳統 Podcast 製作有三道讓新手卡死的門檻:

門檻 1:錄音設備與環境。麥克風、隔音、消除背景噪音——這些在 TTS 面前全部消失。ElevenLabs Creator 方案($22/月)或 Fish Audio 的 S2 Pro 模型,生成出來的音質本來就是錄音室等級。
門檻 2:一個人說話缺乏對話感。單人 Podcast 難聽的原因不是沒有搭檔,而是沒有問答節奏。NotebookLM 的 Audio Overview 功能讓你把腳本或資料文件丟進去,AI 自動生成兩個主持人你來我往的深度對話,完全不需要真人搭檔,而且免費。
門檻 3:後製混音技能。Auphonic 把這個門檻壓成「上傳一個鍵」:自動降噪、自適應音量調整、輸出符合 Spotify 標準的 -16 LUFS 音量。2026 年版本支援分段降噪——只對有噪音的段落處理,靜音段落不動,語音聽起來更自然。
觀念二:單人 TTS vs. 雙人對談,先選定節目定位
不是每集都要做雙人對談。先根據節目類型決定主要形式:

| 形式 | 適合場景 | 工具 | 月費 |
|---|---|---|---|
| 單人 TTS | 深度解說、書評、教學 | Fish Audio S2 Pro / ElevenLabs | $0–22 |
| 單人克隆聲 | 建立個人品牌聲音 | 第 3 課的克隆聲音 | 同上 |
| 雙人 AI 對談 | 訪談感、議題討論、讀書會 | NotebookLM Audio Overview | 免費 |
| 混搭 | 克隆聲片頭+AI 對談主體 | 兩者組合 | $0–22 |
本課實戰兩條路都走一次,你可以決定哪條路符合自己的節目定位。
手把手實戰:一集五分鐘節目完整產出
以「AI 工具週報」這個假設節目為例。每集介紹一個值得關注的 AI 工具,時長五分鐘(約 900 字腳本)。
Step 1:用 Claude 生成結構化腳本
Podcast 腳本跟部落格文章的差異在「說話感」:句子要短、要有停頓提示、要有情緒起伏。把這個 prompt 丟給 Claude:
你是一個科技 Podcast 節目的腳本作家。幫我寫一集五分鐘的單人 Podcast 腳本(約 900 字),主題是「[你的主題]」。
格式要求:
1. 片頭(20秒):節目名稱+本集主題預告,用問句吊胃口
2. 主體(四分鐘):分三個段落,每段一個重點。每段開頭用一句「橋接語」轉場
3. 結尾(30秒):本集重點回顧+呼籲行動(CTA)+下集預告
說話風格:
- 口語、台灣繁中、不要書面感
- 句子控制在 20 字以內
- 需要停頓的地方標 [停頓] 或 [換氣]
- 需要強調的詞用 **粗體** 標記
主題:本週 AI 工具推薦——Fish Audio S2 Pro 聲音克隆新功能
生成後把 [停頓]、[換氣] 這些標記留著,下一步 TTS 設定會用到。然後自己讀一遍腳本——把聽起來卡的句子改掉。AI 寫的腳本有時太「整齊」,加幾句不完整的口語句型反而更自然:「這功能,說真的⋯⋯我第一次看到時也愣了一下。」
腳本長度換算參考:正常語速大約每分鐘 200–220 字(台灣中文)。五分鐘節目約需 1,000–1,100 字,扣掉片頭/片尾的音樂靜音,實際腳本約 900 字。
Step 2:單人配音——選 Fish Audio 還是 ElevenLabs
根據節目語言和預算選工具:
繁體中文節目首選 Fish Audio S2 Pro。2026 年 3 月一份為期 10 天、蒐集超過 71,000 組有效對比的盲測結果顯示,Fish Audio S2 Pro 在中文和日文語音品質排名業界第一,勝過 ElevenLabs、OpenAI TTS 等。免費方案每月 8,000 credits(約 13 分鐘生成量),測試夠了;正式上架選 Plus 方案(原價 $20/月,年付促銷約 $5.5/月)。
英文或英中混合節目選 ElevenLabs Creator 方案($22/月,10 萬 characters/月)。Creator 方案有 Professional Voice Cloning 功能,輸出 192 kbps 高品質音檔,情緒控制比 Fish Audio 更細膩,適合英語 Podcast 商用發行。
Fish Audio 操作步驟:
- 前往 fish.audio/tts
- 右上角下拉選「S2 Pro」模型
- 把腳本貼入文字框;遇到
[停頓]標記,改成......(魚音用省略號觸發停頓) - 語速設為
0.95(微慢,清晰不急促) - 點「生成」,下載 WAV 格式(後製完再壓縮成 MP3,避免二次失真)
如果你在第 3 課已建立自己的聲音克隆模型,這裡直接從語音庫選你的克隆聲——這是最能建立個人品牌的做法。
Step 3:雙人對談——NotebookLM Audio Overview
NotebookLM 的 Audio Overview 是 Google 推出的免費功能,只要有 Google 帳號就能用。2026 年已支援超過 80 種語言包括繁體中文。生成的音檔是兩位 AI 主持人針對你的資料展開的深度對話,可以直接下載為 MP3。

操作流程:
- 前往 notebooklm.google → 建立新的 Notebook
- 上傳「資料來源」:可以是 Google 文件(你的腳本/研究資料)、PDF、網頁 URL、YouTube 網址
- 右側找「Audio Overview」面板,點「Generate」
- 選格式:「Deep Dive」是最完整的深度討論形式,適合節目正片;「Brief」是快速摘要,適合片段插入
- 等待 1–3 分鐘生成完畢,點「Download」拿到 MP3
讓中文對話品質更好的技巧:在你上傳的文件第一行加上「請以台灣繁體中文進行討論」,並確認 Google 帳號介面語言已設為繁體中文。資料來源越有標題、越分段,AI 的對話越有條理——丟進一整份沒結構的文字檔,AI 容易講得雜亂。
NotebookLM 輸出當素材剪接:AI 生成的對話可能有十幾分鐘,但你的節目只需要五分鐘。用 Audacity(免費)把對話中最精華的段落剪出來,再配上你用 TTS 做的片頭和片尾。混搭模式非常常見——聽眾只知道節目好聽,不在乎是怎麼做的。
Step 4:後製——Auphonic 降噪與音量正規化
Spotify 和 Apple Podcasts 都建議 -16 LUFS 的音量標準。TTS 生成的音檔音量通常偏離標準,而 NotebookLM 輸出有時帶輕微的數位噪音。Auphonic 一個步驟同時解決這兩件事。
前往 auphonic.com,免費帳號每月有兩小時的後製配額,一集五分鐘節目只用到配額的 1/24。
設定步驟:
- 登入後點「New Production」
- 上傳你的音檔(WAV 或 MP3 都接受)
- Loudness Target:填
-16.0 LUFS(Apple Podcasts/Spotify 標準值) - Adaptive Leveler:開啟——自動拉平片頭、主體、片尾之間的音量差異
- Noise & Hum Reduction:選「Light」。TTS 音檔不需要重度降噪,開太強反而讓聲音有「水下感」
- Output Format:選「MP3, 192 kbps」
- 點「Start Production」,等 1–2 分鐘,下載成品
完成後的音檔就是可以直接上架的成品。把這份設定存成 Preset,之後每集後製直接一鍵套用,省掉重複設定的時間。
Step 5:準備上架素材——封面圖與節目描述
Spotify 和 Apple Podcasts 的技術要求如下:
| 素材 | 規格 |
|---|---|
| 封面圖 | 正方形、1400×1400 到 3000×3000 px、JPG 或 PNG、RGB 色彩模式 |
| 音檔 | MP3 格式、128–320 kbps、取樣率 44.1 kHz |
| 節目描述 | 最長 4,000 字,前兩行是搜尋結果顯示的部分,要包含關鍵字 |
| 單集標題 | 建議不超過 100 字元,加上集數編號方便管理 |
封面圖用 Canva 免費製作(搜尋「Podcast Cover」模板,選 3000×3000 px 規格輸出)。節目描述用 Claude 寫:
我有一個 AI 工具介紹的 Podcast 節目,叫做「AI 工具週報」,每集介紹一個值得用的 AI 工具,聽眾是對 AI 感興趣的台灣上班族。
請幫我寫:
1. 節目整體介紹(150 字,用於 Spotify/Apple Podcasts 節目描述頁,要包含「AI 工具」「每週更新」「繁體中文」這幾個關鍵字)
2. 這集的單集描述(100 字,主題是 Fish Audio S2 Pro 聲音克隆,說清楚聽眾這集能學到什麼)
語氣:輕鬆、直接,像在跟朋友介紹一個好東西。
```</div>
<div class="step"><h4>Step 6:用 RSS.com 上架 Spotify 與 Apple Podcasts</h4>
你需要一個 Podcast 托管平台存放音檔並產生 RSS Feed。推薦新手用 [RSS.com](https://rss.com):有完全免費的方案可以先起步,進階功能的 All-in-One 方案約 $11.99/月(年付),上傳後自動提交到 Spotify、Apple Podcasts、Amazon Music 等 40+ 平台,不用每個平台分別申請。
**初次設定步驟**:
1. 到 RSS.com 建立帳號,填寫節目資訊(名稱、分類、語言選「Chinese(Traditional)」)
2. 上傳封面圖
3. 點「New Episode」,上傳 MP3 音檔,填寫單集標題和描述
4. 點「Publish」,RSS Feed 立刻生成
5. RSS.com 首次發布後會**自動提交**到 Spotify 和 Apple Podcasts;Spotify 審核約 3–5 個工作天,Apple Podcasts 約 1–3 天
之後每集只要上傳 MP3 → 填描述 → 發布,各平台會在幾小時內自動更新。
**只想上 Spotify?** 直接到 [creators.spotify.com](https://creators.spotify.com) 建立頻道並直接上傳 MP3,零月費。壞處是無法同步到 Apple Podcasts 和其他平台——長期來看還是建議用 RSS.com。</div>
</div>

## 混搭進階技巧:半控制式腳本搭 NotebookLM
如果你想讓節目對話感更強,又不想完全失去對內容的控制,可以用「大綱驅動」的方式:
1. 用 Claude 寫一份「討論大綱」而不是完整腳本:5–8 個問題加上每題的關鍵論點
2. 把這份大綱加上你的背景資料(新聞、研究報告)一起上傳進 NotebookLM
3. 生成 Audio Overview——AI 主持人會圍繞你設定的問題展開對話
4. 下載 MP3,用 Audacity 剪掉跑題的段落
5. 加上自己 TTS 錄的片頭片尾,拼成完整一集
這個做法的好處是:NotebookLM 的對話有真實的討論感與意外感,但你透過大綱控制了方向,不會讓 AI 自由發揮到跑題。
## 常見坑
這條生產線最容易卡住的五個地方,先用一張速查表看症狀對解法,細節在後面逐一展開:

**坑 1:TTS 聽起來平板,沒有「主持人感」**
症狀:AI 聲音每句語調一樣,聽三分鐘就想關掉。
根本原因:腳本句子太長、缺乏停頓標記。TTS 模型遇到長句子會一口氣唸完,沒有呼吸感。
解法:把句子控制在 20 字以內,用句號斷開;在換氣點加 `......`(Fish Audio)或逗號;語速調到 0.9–0.95。如果 ElevenLabs 支援 SSML 語法,可以插入精確停頓:
```xml
今天要介紹的這個工具,<break time="0.5s"/>說真的,改變了我的工作流。
坑 2:NotebookLM Audio Overview 一直出英文,不說中文
症狀:上傳了中文文件,生成出來的音訊還是兩個說英文的 AI 主持人。
原因:NotebookLM 的語言判斷有時被文件混合語言影響,預設偏向英文。
解法:
- 確認 Google 帳號介面語言設為「繁體中文(台灣)」
- 在上傳文件的第一行加上:「請使用繁體中文討論以下內容:」
- 如果還是出英文,在 Notebook 的 Note 欄新增一則筆記:「Audio Overview 請使用繁體中文」,再重新生成
目前(2026 年 7 月)NotebookLM 的中文 Audio Overview 已顯著改善,但台灣口音仍不夠自然——接受這個現況,或僅把 NotebookLM 用在英文對談段落、自己再加中文旁白包夾。
坑 3:Auphonic 後製後聲音有「水下感」或「金屬殘響」
症狀:後製完的音檔聲音變悶,帶有奇怪的數位染色。
原因:Noise Reduction 開太強。TTS 音檔本身噪音極低,開「Medium」或「Strong」降噪會把語音的高頻分量一起刪掉。
解法:把「Noise & Hum Reduction」調回「Light」,或直接關掉降噪——TTS 音檔通常不需要降噪,只需音量正規化就夠了。只有把 NotebookLM 輸出混入時,才考慮開 Light 降噪。
坑 4:RSS.com 提交後 Spotify 審核被退
症狀:等了一週還沒通過審核,或收到 Artwork does not meet requirements 的拒絕信。
常見原因:
- 封面圖尺寸不足 1400×1400 px,或用了 CMYK 色彩模式(要用 RGB)
- 節目描述裡有垃圾廣告字眼(電話號碼、純推銷語句)
- 首集音檔帶有受版權保護的背景音樂(第 5 課會教用 Suno 生成無版權配樂)
解法:Canva 輸出時確認選「PNG」格式與「RGB」色彩模式;節目描述精簡去掉推銷語;背景音樂確保是自製或 CC0 授權。
坑 5:多個音檔合併後音量忽大忽小
症狀:TTS 片頭和 NotebookLM 主體拼接後,片頭很小聲、主體很大聲,或反過來。
原因:兩個來源的音量基準不同。
解法:不要先拼再送 Auphonic——分開後製,讓 Auphonic 各自正規化到 -16 LUFS,再用 Audacity 拼接。Auphonic 輸出的音量基準一致,拼起來不會有落差。
作業
- 走完一次完整流程:用這堂課的步驟,做出一集 3–5 分鐘的 Podcast 音檔。主題自定,可以是你熟悉的領域加上「AI 怎麼改變它」。
- 兩種形式都試一次:一次用 Fish Audio/ElevenLabs 單人 TTS,一次用 NotebookLM Audio Overview 做雙人對談。聽完兩個版本,決定你的節目走哪條路。
- 上架一集:就算是試播性質,把音檔上傳到 RSS.com 或 Spotify for Creators,拿到一個真實的節目連結,傳給三個朋友請他們聽,收集反饋。
- 選做:把 Auphonic 的設定存成 Preset,之後每集後製直接一鍵套用。
下一課預告
節目有了聲音,差的是音樂。一個好的片頭音樂能讓聽眾在三秒內認出你的節目;適合的配樂讓知識型內容聽起來不枯燥。第 5 課進入《AI 音樂:Suno 寫歌與配樂》——用 Suno v5.5 生成節目專屬的片頭曲、過場音樂,甚至完整的歌曲。
Suno 在 2026 年的商業授權已大幅調整:在與 Warner Music Group 達成合作協議後,付費方案生成的音樂可以商用發行,Suno 不抽分潤,但「所有權」的歸屬有幾個重要細節需要搞清楚——第 5 課完整說明。