精華筆記

· @aihub.tw

AI 影片生成

綜合實戰:60 秒廣告從腳本到成片

綜合實戰:60 秒廣告從腳本到成片

五堂課學了模型選擇、prompt 結構、圖生影片、多鏡頭一致性、原生音訊——但很多人卡在同一個地方:學完每個單項,就是「組裝不起來」。單鏡頭生得漂亮,一到要連成 60 秒的廣告,鏡頭與鏡頭之間感覺斷掉,角色前後長相不一樣,或者東拼西湊完根本不知道費用花去哪了。

這堂課的目的就是打通最後這一哩路。我們從一個真實的廣告需求出發,完整走一遍腳本→分鏡→逐鏡生成→音訊→剪輯→輸出,中間每個決策點都說清楚。

這堂課適合誰 適合:已經上完第 1–5 課、想把所有技能整合成一支完整成品的人。需要基礎:建議先讀第 2 課(prompt 結構)和第 4 課(多鏡頭一致性)。前置課:第 5 課。

這堂學什麼

  • 廣告腳本如何拆成 AI 可直接使用的分鏡格式
  • 10 個分鏡的逐鏡生成策略:哪幾顆用 Veo、哪幾顆用 Kling,為什麼
  • 失敗鏡頭的三種處理策略,不用全部重生
  • 完整成本試算:10 鏡頭×6 秒的實際費用落在哪個區間
  • 常見坑 6 個:讓最後一哩路不翻車
  • 剪輯時序與輸出設定,讓 AI 生成的片段在 CapCut / DaVinci 裡接得起來

觀念一:60 秒廣告的生產線長什麼樣

在你打第一個 prompt 之前,先確認整條流水線的全貌。AI 影片的生產邏輯跟傳統拍片不一樣——傳統拍片是拍好再剪,AI 影片是先想好再生,生完才補空缺。

AI 廣告生產線全覽

六個階段,每個階段的輸出物就是下一個階段的輸入:

  1. 腳本:30–40 字的廣告文案 + 情緒基調
  2. 分鏡規劃:把腳本拆成 8–12 顆鏡頭,每顆標清楚持續秒數、畫面描述、攝影機動作
  3. 逐鏡生成:按分鏡表依序生成,一顆一顆確認再往下
  4. 音訊合成:原生音訊已含在生成步驟裡,這裡補配樂或旁白
  5. 剪輯組裝:把所有鏡頭拉進剪輯軟體,對齊節奏、加轉場
  6. 輸出交付:1080p MP4,依照平台規格設定

最容易犯的錯是跳過第 2 步直接開始生成——腦子裡有個大概的畫面就開打。這樣做的結果是:生了 30 顆鏡頭,最後只用得上 8 顆,浪費的費用跟時間都是雙倍。先把分鏡表填滿,再開始生成。

觀念二:模型分工不是「選最貴的最好」

60 秒廣告的每一顆鏡頭需求不同。你不需要把全部 10 顆都跑最高品質的模型——這是預算失控的主因。

鏡頭分工策略

以 2026 年 7 月的定價做分工參考:

鏡頭類型 建議模型 費用/秒(API)
開場英雄鏡頭、品牌 close-up Veo 3.1 Quality $0.20–0.40
動態廣角、環境 B-roll Veo 3.1 Fast $0.10–0.15
主角特寫、需要前後一致 Kling 3.0(多鏡頭模式) ~$0.084–0.168
草稿測試、確認構圖用 Veo 3.1 Lite $0.03–0.05
省錢原則 先用 Veo 3.1 Lite(最便宜)打草稿確認構圖和動態方向,確認 OK 再升到 Fast 或 Quality 出正式版本。草稿跑一遍全部 10 顆大約 $1.8–3 美元,可以先找出哪幾顆一定要重設計,再花大錢生正式版。

手把手實戰:一支台灣手沖咖啡品牌的 60 秒廣告

這裡用一個具體案例完整走一遍。品牌設定:台灣精品咖啡「晨霧莊園」,受眾是 25–40 歲的都市上班族,訴求是「每天早晨的小奢侈」。目標平台:Instagram Reels 和 YouTube Shorts,成品規格 1080×1920(9:16 竪版),60 秒。

Step 1:用 AI 寫廣告腳本

不要從空白開始寫腳本。把品牌資料和訴求丟給 Claude 或 ChatGPT,讓它先出初稿:

你是一位台灣的廣告創意總監。

品牌:晨霧莊園——台灣精品手沖咖啡
受眾:25–40 歲都市上班族
訴求:「每天早晨的小奢侈」
影片長度:60 秒
平台:Instagram Reels、YouTube Shorts(竪版 9:16)
風格:溫暖、電影感、緩慢節奏,沒有旁白,靠畫面和音樂說話

請給我:
1. 一句廣告語(中文,不超過 10 字)
2. 60 秒的影片腳本,格式是「時間碼 | 畫面描述 | 氛圍備注」,共 10 個場景

腳本拿到後,先自己讀一遍——判斷每個場景「能不能被 AI 影片模型生出來」。具體可描述的畫面可以生,抽象情感、品牌故事只能靠畫面暗示。有沒有要求「同一個主角在多個場景出現」?有的話,第 4 課的一致性策略要記得用上。

Step 2:建分鏡表,每一格都要夠具體

腳本只是文字,分鏡表是你跟 AI 模型溝通的語言。建一個試算表或 Notion 表格,欄位如下:

鏡頭編號 | 時間碼    | 秒數 | 攝影機 | 主體     | 畫面描述               | 音效/音樂    | 生成模型   | 狀態
S01      | 0:00–0:06 | 6s   | 慢推近  | 霧中山景  | 清晨山腰薄霧,遠景樹影  | 環境音/鳥叫  | Veo Quality | 待生成
S02      | 0:06–0:12 | 6s   | 固定    | 咖啡豆特寫| 棕色咖啡豆慢慢倒入...  | 豆子碰撞聲   | Kling 3.0  | 待生成
...

這個表格在整個製作過程中不斷更新狀態欄。每一顆鏡頭生完、確認可用就標「完成」;需要重生就標「重生」並記原因。

分鏡表範例

「晨霧莊園」的 10 顆分鏡分配如下:

鏡頭 秒數 內容 模型選擇
S01 6s 開場:清晨山腰薄霧 Veo 3.1 Quality
S02 6s 咖啡豆倒入磨豆機特寫 Veo 3.1 Fast
S03 6s 女性手部(主角)操作手沖 Kling 3.0
S04 5s 熱水緩緩注入濾杯,蒸氣升起 Veo 3.1 Fast
S05 6s 主角側臉,捧著咖啡杯 Kling 3.0
S06 5s 窗邊晨光穿透咖啡液特寫 Veo 3.1 Quality
S07 6s 主角走向窗邊 Kling 3.0
S08 5s 城市街景窗外,快速 Veo 3.1 Fast
S09 6s 主角微笑喝第一口 Kling 3.0
S10 9s 品牌 Logo 帶標語,淡出 Veo 3.1 Quality

6 顆用 Kling 或 Veo Fast,4 顆用 Veo Quality。這樣的分配讓「最重要的鏡頭最高品質」,同時控制預算。

Step 3:逐鏡生成,一次只跑一顆

不要一次把所有 prompt 丟進去批次跑。逐顆生成的原因:你可以在每顆確認之後,根據實際結果微調下一顆的 prompt,保持風格和光線的一致性。

以 S01 為例,Veo 3.1 Quality 的 prompt:

Cinematic drone shot slowly pushing toward a misty mountain ridge at dawn, 
Taiwan mountain scenery, golden hour light breaking through fog, 
lush green trees with morning dew, peaceful and serene atmosphere, 
soft warm color grading, 4K, shallow depth of field, natural lighting

以 S03 為例,Kling 3.0 的 prompt(強調手部操作一致性):

Close-up shot of a young Asian woman's hands carefully pouring hot water 
from a gooseneck kettle into a ceramic pour-over coffee dripper, 
slow and precise motion, steam rising softly, 
warm indoor morning light, cozy kitchen atmosphere, 
35mm lens look, soft bokeh background, natural skin tones
注意:Kling 多鏡頭主角一致性 S03、S05、S07、S09 都出現同一個主角。用 Kling 3.0 的「多鏡頭主體一致性」功能時,先生成 S03 並取得這顆鏡頭的角色參考 ID(或截圖),後續的 S05/S07/S09 都帶這個參考進去生成。第 4 課講過的方法在這裡就是關鍵——不做這步,四顆鏡頭的主角臉會不是同一個人。

生成完每一顆,先做三個檢查:

每生成一顆先過三個檢查

  1. 物理合理性:水往下流、手持的東西有重量感、光源方向一致
  2. 時間長度夠不夠:要求 6 秒,AI 生的如果只有 4.5 秒,剪輯裡會很難填
  3. 風格色調跟前一顆接不接得起來:光線冷暖差太多等等需要在後製調色

Step 4:音訊策略——原生 + 補錄

2026 年主流模型的原生音訊已經夠用於環境音和 B-roll,但「主角的動作聲音」仍需要人工處理。晨霧莊園廣告的音訊計畫:

  • S02(咖啡豆碰撞聲)、S04(注水聲、蒸氣聲):Veo 的原生音訊通常對環境音很準確,生成時在 prompt 加上 with realistic ambient sound, coffee beans rattling sound effect 即可
  • S03、S05、S07、S09(主角動作):Kling 3.0 原生音訊生成的手部動作聲有時會有雜音;如果品質不夠,用 ElevenLabs 的音效生成或直接從音效庫(Freesound、Pixabay 音效)補
  • 全片配樂:用 Suno 或 Udio 生成一段 70 秒、鋼琴為主的暖調背景音樂。在 prompt 裡說明「台灣精品咖啡品牌廣告,溫暖,電影感,沒有人聲,鋼琴為主旋律」
配樂長度記得比成片多 10 秒 AI 生的配樂有時結尾很突然。讓 Suno 或 Udio 生 70 秒,實際用 60 秒,結尾才有空間讓音樂自然淡出而不是硬切。

Step 5:剪輯組裝與輸出

把所有鏡頭和音訊素材整理好再進剪輯軟體。建議的資料夾結構:

晨霧莊園廣告/
├── raw/          ← AI 生成的原始影片片段
│   ├── S01_veo_quality_v1.mp4
│   ├── S01_veo_quality_v2.mp4   ← 重生版
│   └── ...
├── audio/        ← 配樂、音效
│   ├── bgm_piano_70s.mp3
│   └── sfx/
├── export/       ← 成品輸出目錄
└── project.capcut  ← 或 .drp(DaVinci)

剪輯重點:

  • 影格率統一:所有 AI 生成的片段確認都是 24fps 或 30fps,混用會讓動態感覺不一致
  • 轉場克制:AI 影片畫面本身已經有動感,不需要太多花俏轉場;直切(硬切)配合音樂節拍比溶接效果好
  • 調色:統一用一個 LUT 或 CapCut 的「電影感暖調」預設,讓 Veo 和 Kling 生成的鏡頭色調接近
  • 輸出:1080×1920,H.264,25Mbps,交付前在手機螢幕上預覽一次——AI 影片在電腦上看跟在手機上看感覺差很多

Step 6:成本實算

把所有花費記下來,才知道下次如何優化預算。以「晨霧莊園」為例:

成本試算對照圖

草稿階段(用 Veo 3.1 Lite 確認構圖):

  • 10 顆 × 6 秒 × $0.04/秒 = 約 $2.4 美元

正式生成:

  • S01、S06、S10(Veo Quality, 9+6+9秒) = 24秒 × $0.30 = $7.2
  • S02、S04、S08(Veo Fast, 6+5+5秒) = 16秒 × $0.13 = $2.1
  • S03、S05、S07、S09(Kling 3.0, 6+6+6+6秒) = 24秒 × $0.13 = $3.1

重生費用(假設有 2 顆需要重跑一次):

  • 2 顆 × 6 秒 × $0.15 = $1.8

音訊:

  • Suno Pro 訂閱分攤:約 $0.5

合計約:$17 美元(約 550 台幣)

這個數字跟傳統委外拍廣告的差距是幾十倍。如果你之後量產(每個月 2–4 支),Kling 3.0 Pro 訂閱方案($25.99/月含 3,000 點數)會比用 API 更划算。

用 Kling Pro 訂閱算:
3,000 點數 / 月
Kling 3.0 @ 720p 約 6 點/秒 → 3000 / 6 = 500 秒可用
500 秒 / 24 秒每支 ≈ 每月可生成約 20 支的主角鏡頭群
訂閱月費 $25.99 → 每秒約 $0.052,比 API 便宜接近 60%

常見坑

最後一哩路的 6 個常見坑

坑 1:鏡頭之間的主角臉不一樣

症狀:S03 的主角是長髮、瓜子臉,到 S05 變成了圓臉、深眼窩,明顯不是同一個人。 原因:沒有帶主角參考,每次生成 Kling 都重新「想像」一個人。 解法:用第 4 課的 Kling 多鏡頭一致性功能。第一顆主角鏡頭生完後,在後台找到「角色一致性/Character Reference」選項,上傳截圖或取得 ID,後面所有主角鏡頭都帶這個參考。這是最常被跳過的步驟。

坑 2:AI 生的影片有浮水印

症狀:下載的 MP4 右下角有平台 logo 或「KLING AI」字樣,放廣告完全不能用。 原因:用了免費方案或某些低階訂閱,商業輸出沒有權限。 解法:Kling 3.0 需要 Standard 方案($6.99/月)以上才有商業授權且無浮水印輸出。Veo 3.1 透過 API 呼叫沒有浮水印問題。下載前先確認方案等級。

坑 3:prompt 一模一樣,每次生出來的結果差很多

症狀:S04 注水的 prompt 第一次生出來效果很好,重生一次卻完全不同風格。 原因:AI 影片模型有隨機性(即使 seed 相同,不同模型或批次仍有差異)。 解法:把每次成功的鏡頭立刻存下來,不要覺得「反正可以再生一次」。另外把成功的 prompt 貼進分鏡表的備注欄——再次生成時完全照抄,並在 Veo API 裡指定同一個 seed 值:

response = client.models.generate_video(
    model="veo-3.1-quality",
    prompt="...",
    config={"seed": 42}  # 固定 seed 提高重現性
)

坑 4:剪輯時發現鏡頭長度不夠

症狀:要求生成 6 秒,AI 生出來的片段實際是 4.8 秒,在剪輯軟體裡剛好接不到下一顆。 原因:部分模型對時長的控制不精準,可能生出 ±1 秒的誤差。 解法:生成時要求稍微長一點(如果要 6 秒就設 7 秒),剪輯時截掉尾段。另一個做法是在 CapCut 把短一點的鏡頭做「慢動作 80%」,拉長到足夠長度——對大部分畫面(特寫、靜態)效果不錯,快速移動的鏡頭就別這樣做。

坑 5:批次生成後才發現前三顆風格跟後七顆差很多

症狀:前期用 Veo 3.1、後期換成 Kling 3.0,調色時才發現兩個模型的「暖調」色溫根本不同,整段片子撞色。 原因:不同模型對同樣的 warm cinematic 描述有自己的詮釋。 解法:在 prompt 裡加具體的技術參數描述而不只是情感描述。比如:

# 情感描述(不夠精確):
warm cinematic atmosphere

# 技術描述(更好):
color temperature around 4500K, soft amber highlights, slight warm tint,
exposed for skin tones, no harsh contrast

或者所有鏡頭都用同一個 LUT 在剪輯軟體統一調色,讓模型差異在後製收斂。

坑 6:成本失控——沒記錄就沒感覺

症狀:一個下午跑完以為沒花多少,結帳才發現 API 帳單超出預算兩倍。 原因:沒有在生成前估算、沒有即時記錄,也沒有開 API 用量上限警示。 解法:生成前先計算:鏡頭秒數 × 模型費率 = 這一顆的成本,加總後才確認要生。API 平台都有「用量上限」設定(Vertex AI 叫 Quota、Kling 叫每日點數上限),先設好,一分錢都超不出去。用一個 Google 試算表或 Notion 表格追蹤每一顆的費用——生到第 5 顆就知道整支廣告要花多少錢。

作業

  1. 用這堂課的模板,為「你自己的一個品牌或服務」寫一份 10 顆分鏡的分鏡表。還沒有真實品牌?虛構一個也可以。重點是把每一顆的鏡頭描述、秒數、模型選擇、預估費用都填進去,讓自己在開始生成之前就知道這支廣告會花多少錢。
  2. 實際生成 3–5 顆鏡頭(先跑 Lite 草稿版),確認構圖和動態方向可用再升正式版。把生成的素材截圖或短片傳到學員社群給大家看。
  3. 選做:把 10 顆鏡頭全部生完,丟進 CapCut 或 DaVinci 剪成一支完整影片。成品不需要完美,走完整個流程最重要。

下一課預告

你現在已經有能力生成一支 60 秒廣告——恭喜,這真的不是一般人都做得到的事。但如果你想量產(比如每週一支、或者幫客戶接案),手動跑每一步會成為瓶頸。進階篇會教你怎麼把這整條生產線自動化:用 API 串接腳本生成和影片生成,讓 AI 從一段品牌描述直接輸出一份分鏡 JSON,再自動批次呼叫 Kling 或 Veo,最後把成品打包丟到你的雲端資料夾——你只需要審核和做最後的剪輯決定。一人影視部門,開始運轉。

#AI 影片生成#Kling#廣告製作#分鏡腳本#綜合實戰

← 回所有文章