文字轉語音:自然到聽不出是 AI
你第一次把稿子丟進 TTS 工具,聽到自己的文字被念出來——感覺怎樣?八成是「還好」,或者「有點怪」。AI 語音幾秒內把整頁文字念完,確實省了錄音的麻煩;但仔細聽,語調是平的,每句結尾音量沒有自然下降,數字唸成「一零二」而不是「一百零二」,「行業」的「行」明明該唸「háng」,它偏唸「xíng」。這就是多數人第一次體驗 TTS 的感受:快是快,但一聽就知道是機器。
問題不是工具不行,是你還沒學會「說 AI 的語言」。TTS 不是「貼上去按播放」那麼簡單——你輸入的每個標點、每句斷行、每個英中夾雜的詞,都在影響最終聲音。這堂課就來拆解這些細節,讓你的 AI 口播輸出從「將就能用」變成「聽不出是 AI」。
這堂學什麼
- 選工具:ElevenLabs 與 Fish Audio 的定位差異,什麼情境選哪個
- 參數控制:穩定性、語速、風格誇張度三個核心旋鈕怎麼調
- 中文咬字:多音字、輕聲、英中混讀的處理方式,加音素讓 AI 不唸錯
- 標點與斷句:逗號、句號、破折號、省略號各自製造什麼節奏效果
- 長文工作流:幾千字腳本如何分段、批次產出、保持聲音一致性
- 實戰:同一段口播稿做出溫暖、嚴肅、興奮三種情緒版本
觀念一:選工具之前先想用途
市面上 TTS 工具很多,但你真正需要選的只有兩個角色——多語言情緒旗艦與中文語感首選。

ElevenLabs:2026 年 7 月現況,Free 方案每月 10,000 個 credits(約 10 分鐘高品質 TTS),但不含商業授權,且須標出處。Starter $6/月取得 30,000 credits 與商業授權;Creator $22/月取得 121,000 credits、192 kbps 高品質輸出與專業聲音克隆。最大差異化優勢是 v3 模型支援 [audio tags] 情緒標記——直接在文字裡寫 [excited]、[whispers] 就能控制情緒,這是目前市場上最直覺的情緒控制方案。
Fish Audio:台灣、中國創作者的中文首選。S2.1 Pro 模型(2026 年 6 月上線)在 Fair Use 範圍內免費開放 API;網頁版 Free 方案每月 8,000 credits(約 7 分鐘生成量)試用;Plus $11/月(250,000 credits、約 200 分鐘、含商業授權)、Pro $75/月。支援 83 種語言,但最大亮點是中文咬字精準度,以及「混合音素+文字」輸入格式可以逐字指定拼音,直接解決多音字問題。
結論:英文口播、需要細膩情緒標記,或做多語言混讀內容,選 ElevenLabs。中文為主的 Podcast 或口播,先用 Fish Audio。兩者都可以免費試水溫,不用急著付費——但拿去賣錢前一定要升付費方案,後面常見坑會細說為什麼。
觀念二:三個旋鈕決定聲音質感
不管哪個平台,TTS 的核心參數都圍繞同樣三組概念——只是介面的標籤不同。

穩定性(Stability):值域 0–1。低穩定性聲音更有情緒起伏,但每次產出結果略有隨機差異;高穩定性聲音平穩一致但容易單調。口播建議 0.4–0.6,需要字字清晰的教學型內容可以拉到 0.65–0.70。
語速(Speed):1.0 是原速。人耳舒適的語速大概是 0.85–1.15。正式訪談或新聞感設定 0.90,輕鬆聊天感設定 1.05–1.10。超過 1.30 以後咬字開始含糊,不建議用在需要字字清晰的教學或簡報配音。
風格誇張度(Style Exaggeration):這是 ElevenLabs 特有的參數。設 0 是最接近原聲的自然輸出;往上調會讓情緒特徵更誇張。Podcast 建議 0.10–0.20——輕微強調就好,0.40 以上聽起來像在演舞台劇。
Fish Audio 沒有 Style 這個旋鈕,但它的 S2.1 模型接受自然語言情緒指令(在參考音頻或提示詞中描述),後面實戰步驟會示範。
觀念三:中文 TTS 的三個特有難題
中文的難不在詞彙,在發音規則。這三個問題是新手最常踩的雷。

多音字(polyphone):「行業」的「行」讀 háng、「行走」讀 xíng;「的士」的「的」讀 dī;「曝光」有人唸 pù、有人唸 bào。Fish Audio S2.1 支援「混合音素輸入」,直接在字後面標注拼音:
這個行<phoneme alphabet="pinyin" ph="háng">業</phoneme>已經被 AI 顛覆了。
ElevenLabs 沒有這個功能,只能靠「換字」迂迴處理——把「行業」改寫成「產業」來回避誤讀。這個迂迴方法 99% 的時候夠用,不要為了一個字換工具。
輕聲與變調:「你好」的「你」因為後面跟著上聲,實際唸陽平(ní)。現代 TTS 模型對主流的連讀規則處理得不錯,但如果你發現某個字念錯,可以在前後加逗號強迫重新判斷節奏:「你,好」讓模型獨立處理每個音節。
英中混讀:「你的 API 每個月免費給 200 分鐘」這種句子,AI 有時在英文縮寫後面停頓過長或過短。處理方法:把縮寫拼全(「Application Programming Interface」)、加連字號逐字拆(「A-P-I」)、或在縮寫前後加逗號製造明確斷句邊界:「你的, A-P-I, 每個月」。
觀念四:標點符號是你給 AI 的節奏譜
在 TTS 裡,標點不只是語法記號,它是你對模型下的「停頓指令」。以下是實際測試過的效果:
| 符號 | 停頓時長(約) | 語調效果 | 適用場景 |
|---|---|---|---|
, 逗號 |
0.2–0.3 秒 | 短暫呼吸,語調持平 | 列舉、轉折 |
。 句號 |
0.4–0.5 秒 | 完整停頓,音量略降 | 段落結尾 |
…… 省略號 |
0.6–0.8 秒 | 拉長停頓,語調下沉 | 猶豫、戲劇性留白 |
—— 破折號 |
0.1–0.2 秒 | 急促轉折,語調上揚 | 補充說明、倒裝強調 |
| 空行 | 0.8–1.0 秒 | 比句號更長的靜默 | 章節分隔、戲劇性暫停 |
實際口播腳本往往太「書面」——長句一路到底、逗號用得太少。最快的改善方法:把稿子大聲朗讀一遍,每個你自然換氣的地方補一個逗號或破折號。光是這個動作,不換一個字,TTS 節奏感就能提升一大截。

手把手實戰:同一段口播稿三種情緒版本
我們用以下這段 Podcast 開場白做示範:
歡迎收聽《AI 工具週報》。我是你的主持人——今天要聊的主題,可能會顛覆你對效率的想法。AI 音樂生成已經可以商用了,門檻低到讓人咋舌。接下來二十分鐘,跟我一起來拆解。
建立帳號,選好聲音與模型
ElevenLabs(英文情緒示範):前往 elevenlabs.io,用 Google 帳號登入,不需要信用卡。進入左側「Text to Speech」,點右側 Voice 下拉 → Browse voices,搜尋「podcast」找一個你喜歡的聲音。接著點齒輪圖示進入 Settings,把模型切換成 Eleven v3——只有 v3 才支援 [audio tags],是這堂課的核心功能。
Fish Audio(中文口播):前往 fish.audio/tts,不需要登入也可以試用。選擇模型 S2.1 Pro,在聲音庫搜尋「中文」或「普通話」選一個接近你目標風格的聲音。Free 方案每月約 7 分鐘生成額度,練習一段短稿綽綽有餘。
版本一:溫暖輕鬆型
目標:讓聽眾感受到「像朋友在說話」。
ElevenLabs 英文版,直接貼以下文字:
[warmly] Welcome to AI Weekly. I'm your host — today's topic might just flip how you think about efficiency. [softly] AI music generation is now commercially viable. And the barrier to entry? [laughs softly] Lower than you'd expect. Stick with me for the next twenty minutes.
Voice Settings:
- Stability: 0.45
- Style Exaggeration: 0.15
- Speed: 1.05
Fish Audio 中文版:
歡迎收聽《AI 工具週報》。我是你的主持人——今天要聊的主題,可能會顛覆你對效率的想法。AI 音樂生成已經可以商用了,門檻低到讓人咋舌……接下來二十分鐘,跟我一起來拆解。
注意省略號「……」製造的自然停頓感——這是溫暖風格的關鍵標點。產出後下載 MP3,命名 intro-warm.mp3。
版本二:嚴肅專業型
目標:商業簡報感、說服力強。
ElevenLabs 英文版:
[serious tone] Welcome to AI Weekly. Today's discussion addresses a significant shift in the creative industry. [measured pace] AI music generation has achieved commercial viability. The implications for content creators are substantial. [pause] Let's examine this together.
Voice Settings:
- Stability: 0.70
- Style Exaggeration: 0.05
- Speed: 0.90
Fish Audio 中文版——注意這一版稿子的改動,沒有換任何關鍵詞,只改了標點和句型:
歡迎收聽《AI 工具週報》。今天的主題,涉及創作產業的一項重大轉變。AI 音樂生成,已正式達到商業可用的標準。這對內容創作者的影響,不容忽視。讓我們一起來分析。
你會發現:去掉感嘆語氣詞、把省略號換成句號、縮短每句長度——單純標點與句型的改變,就能製造截然不同的氣場,參數甚至不需要動。
版本三:興奮緊迫型
適合短影片片頭、breaking news 感口播。
ElevenLabs 英文版:
[excited] Welcome — this is AI Weekly, and today's story is huge. [urgently] AI music generation just went commercial, and the barrier to entry is shockingly low. [fast pace] Twenty minutes. That's all you need. Let's go.
Voice Settings:
- Stability: 0.30
- Style Exaggeration: 0.25
- Speed: 1.15
Fish Audio 中文版:
《AI 工具週報》,開始了!今天這個主題——你一定沒想到。AI 音樂生成已經可以商用,而且門檻低到讓人崩潰!二十分鐘,跟我一起搞懂這件事!
三個版本都產好後,並排播放對比。你會發現:稿子本身的用詞和標點,是區分情緒最大的槓桿——改稿的效果遠比調參數更明顯。這個觀念是整堂課最值錢的一句話,請記住它。
長文轉語音工作流:3,000 字以上的腳本
實際 Podcast 腳本可能是 3,000–5,000 字。直接全貼進去,TTS 通常會在段落交界處語調斷裂、聲音「接縫」明顯。
推薦工作流:
- 分段:每 300–500 字(對應約 2–3 分鐘音頻)切成獨立段落,每段獨立產出
- 統一設定:把 voice 名稱、speed、stability 的數值記錄在腳本文件頁首——截圖也行,確保每段參數完全相同
- 批次產出:Fish Audio 網頁版可以一次貼、一次下載;ElevenLabs Creator 方案以上($22/月)有 Projects 功能,可上傳整份 PDF/Word 自動分段產出並記住設定
- 後製合批:用 Audacity(免費)或 GarageBand 把各段音頻串接,段落之間插入 0.3–0.5 秒靜音,讓聽眾有換氣空間

Fish Audio 多音字音素實戰
如果稿子裡出現以下詞,在 Fish Audio 輸入前先做處理:
| 原詞 | 問題描述 | 推薦處理方式 |
|---|---|---|
| 行業 | 行→誤唸 xíng | 改「產業」或加音素 ph="háng" |
| 的士 | 的→誤唸 de | 改寫「計程車」 |
| 曝光 | 有 pù/bào 爭議 | 稿子改「讓更多人看到」 |
| 數據 | 中國用語,台灣不自然 | 改「資料」 |
| 銀行 | 行→確認唸 háng | 一般沒問題,誤讀再加音素 |
Fish Audio S2.1 的音素語法:
這個<phoneme alphabet="pinyin" ph="háng">行</phoneme>業,今年成長率達到三十%。
如果不確定音素語法是否正確,最安全的方案是換一個沒有多音問題的同義詞。能迂迴解決的,就不要花時間研究語法。
常見坑
坑 1:Free 方案的輸出拿去商用,版權違規
Fish Audio Free 方案(每月 8,000 credits、約 7 分鐘)是試用層,條款規定商業用途需升付費方案。ElevenLabs Free 方案更明確:「非商業使用,且必須標注由 ElevenLabs 產製」。你在 YouTube 開啟廣告分潤、在課程平台販售影片,都是商業用途。最低只需要升 ElevenLabs Starter($6/月)或 Fish Audio Plus($11/月),就取得商業授權。 這是最容易忽略的合規問題,升級費用非常低,別省這一筆。
坑 2:同一段文字跑兩次,結果不一樣
症狀:相同文字、相同設定在 ElevenLabs 重新產出,這次和上次的語調略有差異,某個字的停頓不見了。原因:Stability 低於 0.4 時,模型會引入隨機性——這是設計如此,讓聲音更「活」。解法有兩個:一是調高 Stability 到 0.6–0.7,犧牲一點情緒換一致性;二是接受「這次最好」的結果,立刻下載存檔,不要關掉分頁再重跑。一旦關閉,那個最理想的版本就再也拿不回來了。
坑 3:標點太少,語調一片平
症狀:整段念完幾乎沒有起伏,像機器人報天氣。診斷方法:把稿子貼到任何文字編輯器,看看每 100 字裡有幾個停頓標點——如果少於 4–5 個,就是太少。修法:把稿子大聲唸一遍,每個自然換氣的地方補逗號;需要強調的詞前後補破折號;段落之間空一行。光是加標點,不換一個字,TTS 質感可以有感提升。
坑 4:英文縮寫放在中文句子裡,唸法崩掉
症狀:「你的 ROI 高達 300%」,AI 在「ROI」前後有詭異的停頓,或縮寫被拆成奇怪的音節。原因:中英切換時,模型需要在不同語言的發音規則之間跳轉,銜接點容易出錯。三種解法,從簡到繁:
# 方案一:換成中文(最省事)
你的投資報酬率高達三百%
# 方案二:加連字號逐字拆
你的 R-O-I 高達三百%
# 方案三:在縮寫前後加逗號製造明確邊界
你的, ROI, 高達三百%
數字也是同理:「300%」改成「百分之三百」,「2,000 元」改成「兩千元」——中文語境下全中文數字聽起來更自然。
坑 5:長文後半段語氣越念越弱
症狀:3,000 字腳本後半段的語調比前半段弱,像是「沒力了」。原因:書面稿越到後面越常出現「因此」「所以」「總結來說」這類收尾句型,加上低穩定性設定,AI 真的會把語調往下帶。解法:後半段文字刻意改用短句、多加疑問句或驚嘆語氣,或把後段的 Stability 從 0.45 微降到 0.35,讓後段反而更有活力——用參數補救稿子的「後勁不足」。
作業
- 用 Fish Audio Free 方案,把你自己寫的一段 200 字口播稿(任何主題都行)轉成 TTS,下載 MP3。
- 把同一段稿子用三種標點版本各跑一次:第一版維持原樣、第二版每句話補一個逗號、第三版把逗號全改成省略號——比較三個版本的節奏差異,不換任何字,只改標點。
- 找稿子裡至少一個多音字,確認它是否被正確唸出來,若有問題用換字或音素語法修正。
- 選做(推薦):把溫暖/嚴肅/興奮三種情緒版本都產出,傳給一個朋友盲聽,問他「哪個版本最不像 AI」。把答案帶來討論——你對結果的猜測很可能和現實不一樣。
下一課預告
這堂課學的是用別人的聲音——從聲音庫挑一個聲音、調一調就出爐。但如果你想要一個專屬自己的聲音呢?一個聽起來就像你、可以拿去做任何口播的 AI 版本?
第 3 課《聲音克隆:複製自己的聲音》就從這裡開始:錄一段乾淨的樣本、上傳、訓練,然後你的 AI 分身就出現了。它可以唸任何你沒說過的文字,用你的音色、你的語感。我們也會一起討論聲音克隆的授權紅線——複製別人的聲音需要經過什麼授權程序,踩到這條線法律風險很高。