精華筆記

· @aihub.tw

AI 影片生成

原生音訊與剪輯後製

原生音訊與剪輯後製

你生出第一支 AI 影片的那一刻,很可能發現同一個問題:畫面很美,沒有聲音。或者有聲音,但人物的嘴巴跟台詞完全對不上——嘴還在動,字幕已經換行了。

這是 2025 年的困境。到 2026 年上半年,主流模型已經有四個原生支援同步音訊,不用你另外找配音工具或 AI 配樂,模型生成的同時就把對白、音效、背景音一起合進去。但「支援」跟「好用」之間還有一段距離。這堂課把這段距離的細節說清楚,讓你知道該怎麼寫 prompt、選哪個模型、哪裡的品質還不夠好需要後製補強。後製工具的部分,我們用免費的 CapCut 走一遍完整流程:從生成影片到輸出帶字幕、帶配樂的 1080p 成片。

這堂課適合誰 適合:想讓 AI 生成的影片有聲音、有字幕、可以發布的人;或是已生成影片但不知道怎麼後製的創作者。需要基礎:看過第 1 課的模型概覽;最好跑過第 2 課的文生影片,手上有至少一支生成好的影片素材。前置課:第 2 課(文生影片)或第 3 課(圖生影片)皆可。

這堂學什麼

  • 原生音訊的運作原理——為什麼同一段文字,有的模型會「演出來」,有的只是念出來
  • 音訊 prompt 的四要素:說話角色、語氣/情緒、環境音、背景音樂
  • 三大模型的對嘴品質實況比較:Veo 3.1、Kling 3.0、Seedance 2.0
  • 用免費 CapCut 完成後製全流程:剪輯 → 自動字幕 → 配樂 → 輸出
  • 哪些坑一定會踩:音訊跑掉、字幕亂碼、音樂版權問題的具體解法

觀念一:原生音訊 vs 後製加音,差在哪

「原生音訊」是指模型在生成影片的同時,把聲音一起合成進去——這意味著:對白、演員嘴型、環境音效、背景音樂都是同一個推理過程的產物,時間軸是對齊的。

傳統的後製加音是另一條路:影片生好之後,你找一個 TTS(文字轉語音)工具把對白念出來,再用剪輯軟體把這段音訊貼到影片軌道上,手動對時間。這個做法的問題是:嘴型是模型自己亂動的,它不知道你之後要配什麼台詞——所以對嘴就是靠運氣。

原生音訊 vs 後製加音兩條路的工作流比較

2026 年 2 月之後,主流模型陸續支援原生音訊,目前實務上以 Veo 3.1、Kling 3.0、Seedance 2.0 三個為主(OpenAI 的 Sora 2 也曾支援,但 Web 與 App 已於 2026 年 4 月停服、API 也將在 9 月下架,不列入考慮)。Runway Gen-4.5 和 Hailuo 02 仍然是無聲輸出,需要後製加音。

觀念二:三大模型的音訊品質差在哪

支援原生音訊不等於品質一樣好。以 2026 年 7 月的現況來說,三個主力模型在音訊這塊有明顯的品質差距:

Veo 3.1 — 音效層次最豐富

Google 的 Veo 3.1 在環境音和背景音樂的層次上目前是最好的一個——雨聲、腳步聲、空間殘響,這些細節的合成精度業界最高。但如果你的 prompt 是讓人物直接說話,對嘴精度屬於中等,偶爾會看到嘴型跟子音明顯落差。API 起價:Veo 3.1 Fast 含音訊 $0.15/秒,旗艦版 $0.40/秒。訂閱入口:Google AI Pro $19.99/月起。

Seedance 2.0 — 對嘴精度最高

ByteDance 的 Seedance 2.0 採用音素級(phoneme-level)對嘴技術,是目前主流模型裡唯一支援多語言高精度唇型對齊的。你指定台灣中文或台語腔調的對白,嘴型跟到子音層級——不是「看起來大概對」,而是音節分得清楚。API 定價相對分散,第三方平台起價約 $0.045/秒,官方 Volcengine 走量定價較高,一般創作者建議從第三方平台的免費額度試用後再考慮。

Kling 3.0 — 多人對話最自然

快手的 Kling 3.0(Omni 版)在多角色對話場景的表現最突出:兩個人在對話,每個角色的嘴型分別跟自己的那段音訊對齊,這是其他模型做不到的。如果你的影片需要「兩個人來回講話」這種場景,Kling 3.0 目前是唯一選項。含音訊生成費率:720p 是 9 點/秒、1080p 是 12 點/秒(Standard 月費方案每月分配點數)。

三大模型音訊品質比較評分表

觀念三:音訊 prompt 的四個要素

不管你用哪個模型,音訊 prompt 要寫進去的東西有固定的四個層次。少了任何一層,模型就會自己亂猜:

要素 說明 範例
說話角色描述 誰在說話、聲音特徵、語言腔調 a calm mid-30s Taiwanese woman speaking Mandarin with a soft voice
語氣與情緒 對白的情緒色彩、速度 speaking warmly and slowly, as if addressing a close friend
環境音 場景應該有的背景聲響 ambient café noise, gentle rain outside, low chatter in background
背景音樂 旋律風格、樂器、強度 soft acoustic guitar, quiet and understated, not competing with voice

這四層不必每次都寫完整——如果是全程旁白型影片,重點放在前兩層;如果是純環境感的無人影片,重點放在第三四層。

音訊 prompt 四要素分解圖

手把手實戰

這一節帶你走完完整流程:用 Kling 3.0 生一支 8 秒含音訊的示範影片,再用 CapCut 免費方案完成後製。

選 Kling 3.0 的原因很直接:免費方案每天給 66 點、不需信用卡就能試,含音訊 1080p 費率在同級模型裡偏低,是最適合新手入門的性價比選擇。真的要量產再升級 Standard 方案(月費約 $10、每月 660 點,首月常有促銷價)。你也可以把同樣的 prompt 拿去 Veo 3.1 Fast 生,感受兩者的音效差距。

Step 1:準備含音訊的完整 prompt

這步是整個流程最重要的一關。很多人直接把描述畫面的 prompt 送進去,沒有加音訊指令——模型就會生出無聲影片或隨機加一段配樂。

以下是一個「咖啡廳產品廣告」的完整示範 prompt,包含畫面和音訊四個層次:

Cinematic close-up of a steaming espresso cup on a wooden café table in the morning golden hour. The camera slowly pulls back to reveal a pair of hands wrapping around the cup.

A calm mid-30s Taiwanese woman speaks in Mandarin with a warm, unhurried tone: "早安,今天從這杯開始。" Her voice is intimate and low, as if speaking only to the viewer.

Ambient sound: quiet café ambience, gentle clink of ceramic, soft background chatter. Background music: minimal acoustic guitar fingerpicking, barely audible, fading in from silence. Cinematic feel, not commercial.

幾個寫法細節要注意:

  • 台詞用引號包起來:"早安,今天從這杯開始。" 是告訴模型這段是要說出來的對白,不是描述文字
  • 聲音特徵寫在角色後面:warm, unhurried tone 讓模型知道情緒方向,減少它自己猜到奇怪的結果
  • 音樂強度要明確:barely audible, fading in from silence 是防止音樂蓋過對白的關鍵句,不寫的話模型有時會生出配樂壓過人聲

Step 2:在 Kling 3.0 生成含音訊的影片

登入 klingai.com。如果你沒有帳號,用 Google 帳號直接登入,免費方案會給你 66 點的每日配額,不需要填信用卡。

進入 AI Video → Text to Video,切換模型到 Kling 3.0。在設定面板找到 Audio 的開關,確認它是 on(預設有些版本是關閉的)。

把 Step 1 的 prompt 貼入文字框:

  • 時長:選 8 秒(成本最可預期)
  • 解析度:1080p 含音訊是 12 點/秒,8 秒共 96 點——這超過免費每日 66 點,要用 Standard 的每月點數;想純靠免費額度,先跑一支 5 秒 720p(約 45 點)試流程
  • 模式:Standard 就夠,不需要選 Pro

按 Generate,等 60-90 秒。

生出來之後,先不要急著下載,先戴上耳機聽一遍:確認人聲清楚、環境音有出現、配樂沒有蓋過對白。如果音訊不對,在下一段看對應的解法。

下載格式選 MP4 720p 或 1080p,不要選 GIF(沒有音訊)。

Step 3:匯入 CapCut,做基本剪輯

CapCut 有桌面版(Mac/Windows)和網頁版(capcut.com),兩者功能相近。建議用桌面版,匯出速度比較快。

開新專案 → 把下載的 MP4 拖進媒體庫 → 拖到時間軸。

免費方案的限制先知道:1080p 輸出 OK;自動字幕限 10 分鐘/專案;每月 5 次 AI 背景移除;帶有「Pro」標籤的特效匯出會有浮水印。對新手來說,免費額度完全夠一支 60 秒以內的成品。

基本剪輯操作:

分割:把時間軸指針移到要切的位置,按 S 或點工具列的「剪刀」圖示
刪除片段:選中不要的片段 → Delete 鍵
調整順序:直接拖拉片段

這支 8 秒的示範影片不需要大改,先把頭尾有問題的幀(通常是前 0.5 秒和最後 0.5 秒模型的轉場雜訊)切掉就好。

Step 4:加自動字幕

左側工具列 → 字幕自動識別

CapCut 的語音辨識引擎會讀取影片裡的人聲,自動生成帶時間碼的字幕。幾個設定要確認:

  • 語言:選「中文(台灣)」或「中文(普通話)」,不要讓它自動偵測——自動偵測常常跑去選「日文」或「英文」,字幕就變成亂碼
  • 過濾語氣詞:可以開啟,會自動去掉「嗯、啊、呃」這些停頓音

辨識完成後,字幕條會出現在時間軸下方。點進去逐條確認:

  • 斷句位置對不對(有時一句話被切成兩條,或兩句話被合成一條)
  • 用字有沒有同音字錯誤(模型常把「一杯」辨識成「一悲」,「開始」辨識成「開示」之類的)

確認沒問題後,點任何一條字幕 → 全選 → 在右側的「字體」面板選你想要的字型。台灣常用的是「思源黑體」(SourceHanSans)或「台北黑體」,如果 CapCut 內建沒有,選接近的「Noto Sans TC」也可以。

Step 5:加背景音樂(版權安全)

如果你的 prompt 已經讓模型生了一段背景音樂,這步可以跳過。但如果你覺得原生音樂不夠好,或想換成你自己挑的曲子,這步要特別注意版權。

CapCut 內建音樂庫裡有很多標記 「商業授權」 的曲子,這些可以放心用在商業影片。操作:左側 → 音訊 → 搜尋欄輸入情境關鍵字(例如「輕鬆」、「咖啡廳」、「清晨」)→ 選有「商用」標籤的,試聽後拖到音訊軌。

音量調整:把 AI 生成影片的原始音軌(人聲+環境音)和新加的背景音樂各自調整音量。一般的做法是背景音樂壓在人聲音量的 30-40% 以下,不然會互相干擾。

在時間軸上點背景音樂軌 → 右側「音量」滑桿調到 30%,再試聽一遍。

免費商用音樂的替代來源 不想用 CapCut 內建音樂庫的話,以下來源的音樂可以商用:YouTube Audio Library(CC0 授權)、Pixabay Music(CC0)、Freesound(依單曲授權,要確認每首)。下載後直接匯入 CapCut 的媒體庫再拖到音訊軌。

Step 6:匯出 1080p 成片

右上角點 匯出。設定:

  • 解析度:1080p(免費方案上限)
  • 幀率:與原始影片一致,通常是 24fps 或 30fps
  • 格式:MP4(H.264)

匯出後,戴耳機從頭聽到尾一遍,完整地當觀眾聽。常見的最後問題:字幕消失太快、背景音樂突然暴衝、結尾硬切沒有淡出。發現問題就回去改,重新匯出。

這支 8 秒成片就是你的「第一支帶完整音訊的 AI 影片」。

CapCut 後製六步流程圖

常見坑

坑 1:生出來有人聲但嘴型完全對不上

症狀:影片裡的人物嘴巴一直動,但聲音和嘴型完全不同步,差了一到兩秒。

原因:通常是 prompt 裡的台詞太長,或用了中文和英文混雜的對白。模型的音素對齊演算法對單一語言的效果最好,一旦夾雜語碼轉換就容易出錯。

解法三選一:把台詞剪短(8 秒影片裡的對白最多 20 個字最穩);換 Seedance 2.0,它的音素級對嘴在多語言場景表現明顯更好;或改成「背對鏡頭說話」或「側臉說話」的構圖,對嘴問題就看不出來了。

坑 2:自動字幕辨識語言跑掉,全部變亂碼

症狀:CapCut 自動識別字幕完成後,時間軸裡全是日文漢字或韓文,或者顯示的是一堆問號。

原因:CapCut 的語言自動偵測遇到有背景音樂的影片時,容易把人聲判斷成旋律,選到錯誤的語言模型。

解法:回到「自動識別」設定頁,把語言從「自動偵測」改成「中文(台灣)」再跑一次。如果還是有問題,把背景音樂軌靜音後再跑辨識。備案工作流:用 OpenAI Whisper(本地或 API)先生成 SRT 字幕檔,再到 CapCut 字幕 → 匯入字幕 → 選 SRT 檔——Whisper 對台灣中文的準確率明顯更好。

坑 3:背景音樂匯出時版權被擋

症狀:你用了 CapCut 音樂庫的曲子,匯出後上傳到 YouTube 或 Instagram,幾小時後收到「版權聲明」通知,影片被靜音或收益被導走。

原因:CapCut 音樂庫裡有些曲子只標記「限個人非商業使用」,但並沒有在播放介面明確提醒,你在免費方案裡選到了那類曲子。

解法:在 CapCut 音樂庫搜尋時,只選有「商用」或「商業授權」標籤的曲子(搜尋篩選器可勾選)。或改用 YouTube Audio Library 或 Pixabay Music 的 CC0 授權曲子匯入,授權最乾淨。事後補救:在平台「版權管理」申訴並附上素材來源連結,成功率不低但要等幾天。

坑 4:AI 生成的環境音和你後來加的配樂「打架」

症狀:成品裡可以同時聽到兩種背景音在撞,聽起來很吵、很廉價。

原因:Kling 或 Veo 生成時已經在音訊軌裡合成了一段環境音,你後製時又疊了一段配樂,兩個音軌的音量都沒有壓,結果互相干擾。

解法:在 CapCut 時間軸裡找到原始影片音訊軌 → 右鍵 → 分離音訊。把環境音軌音量往下壓,只保留人聲,再加配樂並調整到適當水位。最終目標:人聲 100%、環境音 20-30%、配樂 25-40%。

三軌音量平衡示意圖

作業

必做:

  1. 用這堂課的 prompt 結構,選一個你想做的場景(可以是產品展示、旅遊景點、人物旁白),寫出包含四個音訊要素的完整 prompt
  2. 用 Kling 3.0 的免費每日額度生成這支影片(8 秒含音訊)
  3. 用 CapCut 完成後製:剪頭尾 → 加自動字幕 → 加配樂 → 輸出 1080p

自我檢查清單:

  • 影片裡的人聲清楚可辨識
  • 字幕語言正確、沒有同音字錯誤
  • 配樂沒有蓋過人聲
  • 用的音樂有商用授權

選做:

把同一個 prompt 拿到 Veo 3.1 Fast($0.15/秒)也生成一次,戴耳機聽環境音細節的差距——你會立刻知道什麼情境值得多花這個錢。

下一課預告

第 5 課走完,你手上有了:帶音訊的 AI 影片、後製好的字幕、配樂齊備的成品。這些都是零件。

第 6 課把所有零件組起來跑一次完整任務:60 秒廣告從腳本到成片。你會學到:怎麼把一個完整的廣告概念拆成鏡頭表、每個鏡頭分別用什麼 prompt 生成、多段影片在 CapCut 裡的剪接節奏、成品上傳前的最後品質檢查清單。完整跑一次之後,你有能力獨立接下「幫品牌做一支廣告」的委託了。

#AI 影片生成#原生音訊#剪輯後製#CapCut#字幕#Kling#Veo

← 回所有文章