精華筆記

· @aihub.tw

AI 影片生成

多鏡頭一致性:角色與場景不走鐘

多鏡頭一致性:角色與場景不走鐘

你興高采烈做好第一支 AI 影片,接著想讓主角再出現一次。你把完全一樣的 prompt 貼回去,按下生成——主角換了一張臉。髮型不同、眼睛顏色不同、連身高比例都跑掉了。你再試一次,再換一張臉。試到第四次,每一個人看起來都像同一個家族的陌生成員,就是沒有一個是你原本設定的角色。

這不是 bug,這是 AI 影片生成的底層機制決定的:每次生成,模型都是從頭取樣,沒有記憶上一個鏡頭的任何視覺資訊。這堂課教你用現有工具把這個問題從根源解決——不靠運氣,靠方法。

這堂課適合誰 適合:想做多鏡頭短片、廣告、故事影片,卻發現角色每個鏡頭都走樣的創作者與行銷人員。需要基礎:建議先完成第 2 課(文生影片 prompt 結構)與第 3 課(圖生影片)。前置課:第 2、3 課。本課主要操作平台是 Kling 3.0(kling.ai),免費方案每天 66 點可以測試核心功能,無需馬上付費。

這堂學什麼

  • 一致性為什麼難:擴散模型「無記憶取樣」的本質,以及 2026 年的解法方向
  • Kling 3.0 元素庫(Element Library):用多角度參照圖把角色存成可重用的身分卡
  • 圖生影片 + Bind Subject:最快速的單鏡頭角色鎖定方法
  • 多鏡頭分鏡板(Multi-Shot Omni):一次生成六個連貫鏡頭
  • 景別變化策略:用構圖差距掩蓋殘餘不一致,這是剪輯師的老把戲
  • 實戰:三鏡頭小故事從分鏡腳本到成片

為什麼一致性這麼難

「無記憶取樣」示意圖:同一段 prompt 兩次生成,得到兩張不同的臉

傳統影視拍攝,同一個演員走過三個鏡頭,觀眾大腦自動把三個畫面串成「同一個人」。AI 影片裡沒有這個演員——每次生成就像重新請一個素人試鏡。如果你不主動做「外觀錨定」,你只能祈禱隨機值碰巧接近。

擴散模型的工作原理是:從純雜訊出發,根據文字描述一步步「去噪」成影像。這個去噪過程每次都有隨機性。你的描述越模糊(「一個短髮女孩」),隨機空間越大,每次長出的臉越不同;你描述再精確(「瓜子臉、雙眼皮、齊瀏海、米色風衣」),仍然有相當的臉部隨機性。

2026 年以前,主流解法是「LoRA 訓練」:用你自己的角色圖訓練一個自訂模型,讓它「記住」那個臉。成本高(需要大量 GPU 時間)、門檻高(需要懂模型微調)。

2026 年以後,主流商用模型開始內建角色參照系統。Kling 3.0(2026 年 2 月 5 日 Kuaishou 發布)走得最遠:它的元素庫讓你用多角度參照圖把角色「存」進去,後續每個鏡頭直接綁定元素,完全不需要訓練任何模型。

Kling 3.0 的三個一致性工具

工具一:元素庫(Element Library)

元素庫建立流程:多角度參照圖 → 上傳 kling.ai → AI 合成元素卡 → 生成時綁定

元素庫的邏輯是「把角色存成一張可重用的身分卡」。建立流程:

  1. 準備角色的多角度參照圖:正面、左 45°、右 45°、背面,各一張
  2. 圖片要求:高解析度、光線均勻、背景乾淨(建議純色或去背)
  3. 進入 kling.ai → 左側選單「我的元素」→「建立元素」→ 上傳圖片 → 命名

建好後,元素卡記住角色的臉部比例、髮型、膚色、體型。之後在任何生成任務選用這個元素,模型就有外觀錨點可以參照。

Kling 3.0 元素也支援聲音綁定 你可以上傳一段角色說話的影片,模型會提取聲紋存入元素卡。之後這個角色出現在任何鏡頭說話時,聲音都會保持一致——對白影片、旁白短片都適用。

工具二:圖生影片 + Bind Subject

如果你手邊有一張角色的高品質靜態圖(AI 生成或真實照片),這是最快速的單鏡頭方法:

  1. kling.ai → 影片生成 → 圖生影片
  2. 上傳角色圖
  3. 開啟「綁定主體(Bind Subject)」開關
  4. 寫動作 prompt(只描述行為,不用重複外觀,因為模型直接從圖片讀取)
  5. 生成

Bind Subject 把這張圖的臉部和服裝鎖住,生成的影片裡主角不會走樣。缺點是一次只能處理一個鏡頭,跨鏡一致性仍需配合元素庫。

工具三:多鏡頭分鏡板(Multi-Shot Omni)

Multi-Shot Omni 分鏡板示意:六個分鏡格各設景別、鏡頭運動、時長,全部綁定同一角色元素,總時長不超過 15 秒

Multi-Shot Omni 是 Kling 3.0 最強的功能:一次最多定義六個鏡頭,在同一個 15 秒生成裡維持角色連貫性並自動處理鏡頭切換。

每個分鏡格可以設定:

設定項目 說明
持續時間(秒) 每個鏡頭的長度,總計不超過 15 秒
景別 遠景 / 中景 / 近景 / 特寫
鏡頭運動 推、拉、搖、跟拍、靜止
敘事描述 這個鏡頭發生什麼
角色元素 選哪個元素出現在這個鏡頭

因為是同一次生成,模型在所有鏡頭共用同一個潛在空間,跨鏡頭的一致性遠高於分開生成再剪接。這是為什麼要用 Multi-Shot 而不是生成六個單獨影片再拼在一起。

景別變化:掩蓋殘餘不一致的設計技巧

即使有最好的工具,AI 影片仍然可能有輕微的臉部漂移或服裝細節差異。老手的應對方式不是硬逼模型做到完美,而是用分鏡設計讓觀眾的眼睛自然接受

核心原則:相鄰兩個鏡頭的景別差距越大,觀眾越不容易察覺細節不一致。

景別差距掩蓋不一致策略:特寫接特寫高風險、中景接中景需謹慎、遠景接特寫低風險

鏡頭切換組合 一致性風險 建議做法
特寫 → 特寫 高:臉部放大,差異一覽無遺 避免連排兩個特寫
中景 → 中景 中:服裝、姿勢都看得清 prompt 確保服裝描述一致
遠景 → 近景 低:景別跳躍大,接受空間大 最推薦的跨鏡切換方式
全景 → 特寫 低:視覺焦點完全改變 可有效「重置」觀眾期待

還有一個技巧:在鏡頭切換時同時改變場景光線或色調。日景切夜景、室外切室內——觀眾的眼睛在處理大環境差異時,對角色細節的注意力自然降低。這不是騙觀眾,傳統剪輯裡也一直在用這個原理。

實戰:三鏡頭小故事

場景設定:一個女孩在城市夜晚尋找一家傳說中的咖啡店。

第一步:建立角色元素

用 AI 生圖工具(Midjourney 或 Stable Diffusion)為主角生成四張角度圖,或直接用一張正面清晰照。進入 kling.ai「我的元素」建立元素卡,命名「城市女孩-小晴」。等待 AI 合成(通常 30 秒~1 分鐘)。

第二步:規劃分鏡腳本

鏡頭 1 — 遠景:城市街道,建立環境

景別:遠景(Extreme Wide Shot) 鏡頭運動:緩慢推進 時長:5 秒

A young woman in a beige trench coat walks along a misty Tokyo street 
at dusk, neon signs reflecting on wet pavement. 
Camera slowly pushes forward toward her. 
Cinematic, warm amber and teal tones, shallow depth of field.

遠景的優點:臉部細節看不清,一致性風險最低,適合開場建立世界觀。不需要在 prompt 裡描述臉部,元素庫的角色資訊就夠了。

鏡頭 2 — 中景:停下來查地圖,情節推進

景別:中景(Medium Shot) 鏡頭運動:靜止 時長:4 秒

Same young woman in a beige trench coat stops on the sidewalk, 
looks at her phone with a slight frown, then glances up with a flicker 
of recognition. Warm evening light. Static camera. Medium shot from chest up.

注意:進入中景後臉部開始可見,prompt 裡要重複關鍵服裝描述(beige trench coat),讓模型在這個鏡頭繼續遵守外觀設定。從遠景切中景,景別差距讓觀眾的眼睛有緩衝,即使有輕微漂移也難被察覺。

鏡頭 3 — 近景:推開門,情感高峰

景別:近景(Close-up) 鏡頭運動:輕微跟拍 時長:6 秒

Close-up of the young woman's face, eyes lighting up with a warm smile 
as she pushes open a wooden door. Golden light spills from inside, 
illuminating her expression. Shallow depth of field, soft bokeh background. 
Camera follows slightly forward.

近景讓表情成為主角,情感最強烈。從中景跳到近景景別變化明確,是整個三鏡頭序列裡最安全的切換。

第三步:在 Multi-Shot Omni 生成

  1. kling.ai → 影片生成 → 選「Multi-Shot(Omni)」模式
  2. 點「新增分鏡」,逐一填入三個鏡頭的設定
  3. 每個分鏡格的「角色」欄位,選擇「城市女孩-小晴」元素
  4. 確認總時長:5 + 4 + 6 = 15 秒(剛好是 Kling 3.0 的最大限制,不超過)
  5. 選品質:720p 消耗 6 點/秒;1080p + 原生音訊消耗 12 點/秒

費用試算:

品質選項 單價 15 秒成本
720p(無音訊) 6 點/秒 90 點
1080p + 原生音訊 12 點/秒 180 點

免費方案每天 66 點,要攢 13 天才能跑一次。若是 Standard 方案($6.99 首月,約 660 點/月),180 點大約佔月配額的 27%,可做約三四組這樣的測試。Kling 3.0 在主流模型裡性價比最高,同等品質成本約是 Veo 3.1 的 40~50%。

  1. 點「生成」,等待約 2~5 分鐘

第四步:檢查並決定是否重跑

生成結果品質檢查流程:臉部、服裝、光線三個檢查點,通過就保留、不過就單獨重跑該鏡頭

收到影片後,依序確認:

  1. 角色臉部:三個鏡頭的臉部輪廓、髮型、膚色有無明顯跳動?
  2. 服裝一致性:風衣顏色、細節有無改變?
  3. 場景光線:黃昏色調是否貫穿三個鏡頭?環境感連貫嗎?

如果某一個鏡頭出問題,不用整組重來。記下那個鏡頭的 prompt,單獨調整後可以分開生成,再用 CapCut 或 DaVinci Resolve 把三個片段接回去——第 5 課會完整教這個後製流程。

常見坑

坑 1:元素庫建好之後角色仍然嚴重走樣

症狀:明明綁定了元素,生成出來的臉部比例和參照圖差很多,鼻子形狀、眼距都不對。

原因:參照圖的光線有強烈陰影,或仰角、俯角過大,讓模型誤讀了臉部結構。

解法:重新準備參照圖——使用正面自然光照,確保臉部無強烈陰影。背景換成純白或淺灰,去背後再上傳效果最好。如果參照圖是 AI 生成的,用同一組 prompt + seed 再生一批多角度圖,而不是隨意找網路上的類似臉孔(因為那些臉其實是不同的人)。


坑 2:Multi-Shot 總時長超過 15 秒,生成按鈕灰掉或出現限制提示

症狀:設定了四個鏡頭(5+6+5+3=19 秒),按下生成時按鈕不可用,或跳出「超出模型最大時長限制」的提示。

Kling 3.0 的 Multi-Shot Omni 上限是 15 秒。超過就需要把故事拆成兩段:第一段 15 秒、第二段再另開一個分鏡板。拆分點要選在景別差距最大的切換處,這樣兩段接起來最不明顯。


坑 3:連排兩個特寫,臉部差距肉眼可見

症狀:鏡頭 2 和鏡頭 3 都是特寫,角色的眼距在兩個鏡頭明顯不同,觀眾一下就看出來。

這是最常見的初學者錯誤。特寫把臉放到整個畫面,一點點差異都被放大。解法有兩種:

  1. 在兩個特寫之間插入一個中景或遠景作緩衝,讓觀眾的眼睛「重置」
  2. 如果劇情真的必須連排特寫,改用鏡頭運動製造連續感——第一個特寫慢慢拉開到中景,再推進第二個特寫,觀眾感覺是「一個連續鏡頭」而不是「兩個不同的臉」

坑 4:換鏡後角色的服裝顏色不見了

症狀:鏡頭 1 角色穿米色風衣,到了鏡頭 3 變成深藍外套。

模型對「服裝視覺記憶」的跨鏡持久性有限,即使用了元素庫也要在每個鏡頭的 prompt 重複關鍵服裝描述。養成這個格式習慣:

[開頭固定加] Same character, beige linen trench coat, [其他動作描述...]

描述要精確到顏色、材質、版型——「beige linen trench coat, buttoned」比「外套」有效十倍。顏色英文描述比中文更精確(模型在英文 token 上訓練量更大)。


坑 5:生成完才發現場景光線前後不連貫,夜景突然變白天

症狀:三個鏡頭生成完,前兩個鏡頭是黃昏暖光,第三個鏡頭突然變成正午硬光。

原因:第三個鏡頭的 prompt 沒有重複時間/光線設定。Multi-Shot Omni 雖然是同一次生成,但每個分鏡格的敘事描述是各自獨立的。把光線描述當成固定句子貼進每個格子:

[固定光線描述] Dusk lighting, warm amber tones, neon reflections on wet pavement.

如果場景之間本來就要換時間(例如刻意的「閃回」或「時間跳躍」),那要在 prompt 裡明確說明,別讓模型自己猜。

作業

  1. 用 AI 生圖工具為你的主角生成四張角度圖(正面 / 左 45° / 右 45° / 背面),在 Kling 3.0 元素庫建立元素卡,確認縮圖看起來符合你設定的角色外觀。

  2. 為一個三鏡頭場景規劃分鏡腳本:開場遠景建立環境 → 中景推進情節 → 近景捕捉情感。三個 prompt 都寫完之後,檢查每一個是否都包含服裝描述和光線設定。

  3. 在 Multi-Shot Omni 生成這三個鏡頭,下載後逐鏡比對:角色臉部、服裝、光線三項各幾分?哪個鏡頭出問題?嘗試調整 prompt 重新生成那個鏡頭。

  4. 選做:嘗試加入「日景 → 夜景」的場景切換,感受環境變化如何降低跨鏡不一致的違和感。

下一課預告

你現在有畫面了:角色一致、場景連貫、鏡頭切換也自然。但一部完整的影片還差一件事——聲音。第 5 課《原生音訊與剪輯後製》會教你善用 Veo 3.1 和 Kling 3.0 的原生音訊生成(對白、音效、背景音樂一起出),以及如果需要後製,怎麼用 CapCut 或 DaVinci Resolve 把多段影片和音訊拼成一部完整作品。畫面加聲音之後,你離第 6 課的 60 秒廣告就只差最後一步的組裝了。

#AI 影片生成#Kling 3.0#多鏡頭#角色一致性#分鏡設計

← 回所有文章