精華筆記

· @aihub.tw

AI 影片生成

圖生影片:讓照片與設計動起來

圖生影片:讓照片與設計動起來

你手上有一張讓你很滿意的產品照:打光完美、構圖乾淨、感覺很有質感。但你需要的是影片,不是照片。如果用文生影片重新生成,出來的結果跟原圖長相可能差十萬八千里——AI 重新亂數生成了一個「類似」的東西,不是你給它的那個。杯子的形狀、包裝的顏色、質地,通通不對。

這就是圖生影片(Image-to-Video)存在的原因:你手上已經有素材,AI 的任務不是憑空發明,而是讓它動起來。一支咖啡廣告裡飄著熱氣、老家人的黑白照片裡那個人輕輕眨了一下眼睛、一份設計稿平滑地旋轉展示每個角度——這些都是圖生影片辦到、文生影片很難精準複製的事。

這堂課適合誰 適合:手上有照片、產品圖、設計稿想讓它動起來的人;電商賣家、設計師、行銷人員、有家族老照片想讓它活起來的任何人。需要基礎:會上傳圖片、會打文字就行,零基礎 OK。前置課:第 1 課(AI 影片模型地圖)、第 2 課(文生影片 prompt 結構)。

這堂學什麼

  • 搞懂圖生影片 vs 文生影片的差異與選擇時機,不再用錯工具
  • 三種主流素材類型的實戰做法:產品圖、人像/老照片、設計稿
  • 首尾幀(First/Last Frame)技術:精準控制影片的開頭與結尾畫面
  • 動作描述三層結構:主體動作 + 鏡頭運動 + 氛圍,少一層就差一截
  • Kling 3.0、Veo 3.1、Seedance 2.0 的圖生影片功能比較,選對平台省錢

觀念一:文生影片 vs 圖生影片,用錯工具白費力

圖生影片 vs 文生影片:先問「手上有沒有素材」的決策流程,以及文生轉圖生的混用策略

這兩個工具的核心差別只有一句話:文生影片是 AI 從零發明,圖生影片是 AI 讓你的素材動起來

文生影片 圖生影片
輸入 文字描述 一張圖 + 描述動作的文字
可控性 低,AI 自由發揮 高,畫面錨定在你給的圖
適合情境 腦中有畫面但無素材 手上已有圖,要讓它動
常見用途 概念影片、風景場景 產品廣告、老照片、展示

判斷方式很簡單:任何人拿著一張照片說「這個幫我做成影片」——答案就是圖生影片。如果你腦中有一個畫面但什麼素材都沒有,才用文生影片。

還有一種混用策略:先用文生影片生一張符合你需求的靜態幀,截圖後再用圖生影片讓它動起來。這讓文生影片的創意力搭配圖生影片的控制力,是第 4 課多鏡頭一致性會深入用到的手法。

觀念二:三種素材類型的特性與挑戰

三種素材類型對照:產品圖、人像老照片、設計稿 UI 各自的特性、主要地雷與建議模型

產品圖動態化 是電商和品牌行銷最常見的需求。難點在於:產品本身不能變形或消失。AI 容易讓杯子邊緣「液化」、包裝文字扭曲。關鍵是讓主體靜止,改用鏡頭動作——不要叫 AI 旋轉產品(容易爆炸式形變),而是指定「鏡頭緩慢推進、產品維持靜止」。

人像與老照片 的情感衝擊力強——讓黑白老照片裡的人眨個眼、微微轉頭,家人看到幾乎都會震撼。難點是臉部表情最容易扭曲,尤其原始解析度低的老照片。做法:動作幅度壓到最小、解析度先用工具拉高、prompt 要非常具體。

設計稿與 UI 截圖 適合設計師和行銷人員:讓 UI 介面做滑動展示、讓品牌 Logo 動態出場。幾何圖形比較穩定,但畫面裡的文字是最大地雷——AI 生成的文字動態幾乎一定走樣。建議在 prompt 明確鎖死文字不動,後製再疊字。

觀念三:首尾幀控制,開頭結尾你說了算

首尾幀控制示意:首幀圖 A 到尾幀圖 B 之間由 AI 補間,以及有尾幀與無尾幀兩種使用情境

Kling 3.0 的「首尾幀」(First/Last Frame)功能讓你同時上傳兩張圖:第一張是影片的開頭畫面,第二張是結尾畫面,AI 負責補出中間所有的動態過渡。這是圖生影片裡最值得掌握的進階功能之一。

Before/After 展示:第一張上傳「舊的樣子」、最後一張上傳「新的樣子」,AI 做出一個平滑的變化過渡動畫。護膚品的使用前後、室內設計的改造前後、產品包裝的改版對比——都用這招,省去剪輯硬接的工夫。

精準場景過渡:廣告裡需要從一個產品角度流動到另一個角度,又不想剪接太生硬,用首尾幀讓它自然地滑過去。

操作方式(Kling.ai 網頁版):進入「圖生影片」後,上傳首幀圖,然後開啟「End Frame」選項上傳尾幀圖,在 prompt 描述中間的過渡動作即可。首尾兩張圖的構圖和主體位置盡量對齊,AI 補出的過渡才自然——構圖差太多,中間會有不自然的跳躍感。

觀念四:動作描述三層結構

動作描述三層結構:由上到下為主體動作、鏡頭運動、氛圍與光線,各層附常用英文例詞

圖生影片的 prompt 不需要描述畫面長什麼樣(AI 已經看到圖了),只需要告訴它「怎麼動」。動作描述分三層,少了任何一層結果都比較隨機:

第一層:主體動作(Subject Motion)

告訴 AI 畫面裡的主角要做什麼。越具體越好,動詞要精確。

❌ 讓它動起來
✅ steam rising gently from the coffee cup, subtle ripples on the liquid surface
✅ person slowly turns head slightly left, gentle blink, micro smile
✅ product slowly rotates 45 degrees clockwise

第二層:鏡頭運動(Camera Motion)

指定攝影機的移動方式。這一層最容易被忽略,但對質感影響巨大:

指令 效果
slow push in / dolly in 鏡頭緩慢推近,有張力感
slow pull out / dolly out 鏡頭緩慢拉遠,有空間感
pan left / pan right 水平搖鏡
tilt up / tilt down 垂直搖鏡
static camera 鏡頭固定不動,突出主體動作
handheld shake 手持晃動,紀錄片真實感
orbit / arc shot 環繞拍攝

第三層:氛圍與光線(Atmosphere)

時段、光線、視覺風格。這層決定整支影片的「味道」:

golden hour lighting, warm tones          ← 早晨/黃昏暖光
cinematic, shallow depth of field         ← 電影感背景虛化
black and white, vintage film grain       ← 黑白老照片質感
soft studio lighting, clean white bg     ← 商業攝影風格
moody blue hour, cool tones              ← 冷色調情緒感

把三層組在一起,才是一個完整的動作 prompt:

[主體動作] steam gently rising from the coffee cup, subtle swirl on the liquid surface
[鏡頭運動] slow push in camera movement, static product
[氛圍]     warm golden light, shallow depth of field, cinematic 4K quality

手把手實戰:三種素材各做一支

實戰一:咖啡產品圖 → 廣告短片

目標:一張咖啡杯產品照,做成有蒸汽飄起、鏡頭緩慢推進的廣告影片感。

準備素材:找一張或拍一張咖啡杯照片,建議 16:9 橫向構圖、主體置中、背景簡單。解析度 1080p 以上效果更好。背景雜亂的話先用 remove.bg 或 Photoshop 去背換純色底。

使用平台:Kling.ai 網頁版(Kling 3.0)

步驟:

  1. 前往 kling.ai,登入後選擇「影片創作 → 圖生影片」
  2. 上傳咖啡杯照片
  3. 在 Prompt 欄位輸入:
steam rising gently from the coffee cup, subtle ripples on the liquid surface,
slow push in camera movement, product remains completely static,
warm golden hour lighting, shallow depth of field, cinematic quality, 4K
  1. 模型選 Kling 3.0,解析度 1080p,時長 5s
  2. 按生成,等待約 2–3 分鐘

結果判斷:蒸汽有自然飄動感、杯子形狀沒有明顯扭曲、背景沒有亂跳→成功。如果杯子邊緣走樣,加一行:

keep the coffee cup shape perfectly stable, no deformation, no morphing

費用參考:Kling 3.0 Standard 月費約 $8 美元含 660 積分,5 秒 1080p 無音訊耗 40 積分(~$0.48/支)。API 第三方 ~$0.075/s,5 秒約 $0.38。

實戰二:老照片 → 動態記憶影片

目標:一張黑白或早年家族照,讓照片裡的人做出細微的真實感動作(眨眼、微笑、輕微轉頭)。情感衝擊力強,製作難度低。

準備素材:掃描或拍攝老照片,解析度越高越好。如果原始照片模糊,先用超解析度工具處理:Topaz Photo AI(付費、桌面版)或 Magnific AI(網頁版)都能把老照片放大 4–8 倍再修復細節,這一步對臉部一致性的幫助非常大。

使用平台:Kling.ai 網頁版(Kling 3.0,對人臉一致性訓練較好)

步驟:

  1. 上傳放大修復後的老照片
  2. Prompt 輸入:
the person slowly turns their head slightly to the right, gentle eye blink,
subtle warm smile forming, micro facial expressions, natural breathing movement,
static camera, soft vintage lighting, cinematic,
preserve the original photo style and grain, maintain black and white aesthetic throughout
  1. 模型選 Kling 3.0,時長 5s,解析度 720p(老照片建議先用 720p 試,滿意再出 1080p)

關鍵原則:老照片動作幅度要壓到最小。效果最好的組合是:頭轉 15 度以內 + 眨眼 + 輕微呼吸起伏。別叫它「揮手」「站起來」——幅度越大,臉部扭曲機率越高。

結果判斷:臉部特徵基本保持一致、表情自然→成功。出現「臉融掉」症狀,加:

maintain facial features and identity, no face distortion, no morphing

實戰三:設計稿/UI截圖 → 品牌展示影片

目標:把一個 App UI 截圖或產品設計稿,做成一個平滑的展示動畫,用於 pitch deck 或社群貼文。

準備素材:設計稿截圖(PNG 格式,透明底更好)或 App UI 截圖。建議輸出 9:16 直向,適合 Reels/Shorts 平台投放。

使用平台:Veo 3.1(Google AI Studio)或 Seedance 2.0(fal.ai)

步驟(Veo 3.1 via Google AI Studio):

  1. 前往 aistudio.google.com,登入 Google 帳號
  2. 新建專案,選擇影片生成模式
  3. 上傳設計稿截圖
  4. Prompt 輸入:
smooth cinematic reveal of the product design,
camera slowly orbiting around it, clean white studio background,
sharp focus on the design details throughout,
all text elements remain perfectly sharp, legible, and completely static,
professional product showcase, modern tech aesthetic, 4K quality
  1. 模型選 Veo 3.1 Fast,時長 8s

步驟(Seedance 2.0 via fal.ai,API 整合用):

  1. 前往 fal.ai/models/bytedance/seedance-2.0/image-to-video
  2. 上傳設計稿圖片,選擇輸出比例(16:9 或 9:16)
  3. 在 prompt 填入動作描述(英文,與上方格式相同)
  4. 按 Run 生成,通常 2 分鐘內完成

文字區域保護——設計稿裡如果有文字,prompt 一定要加:

keep all text elements sharp, legible, and completely static,
no text distortion, no text movement whatsoever

費用參考:Veo 3.1 Fast 每秒 $0.10–0.15,8 秒約 $0.80–1.20。Veo 3.1 Lite $0.03–0.05/s,更便宜但畫質略低。

進階選做:首尾幀 Before/After 展示

這一步選做,但效果很值得:用 Kling 3.0 的首尾幀功能做「改造前 → 改造後」的過渡動畫。

素材:兩張同樣主體、不同狀態的對比圖(改版前後、改造前後、季節對比、護膚前後)。兩張圖的構圖盡量對齊——主體位置相近,AI 補間才自然。

步驟:

  1. 在 Kling.ai 圖生影片介面,上傳首幀圖(Before 狀態)
  2. 開啟「End Frame」選項,上傳尾幀圖(After 狀態)
  3. Prompt 描述過渡方式:
smooth cinematic transition from before to after state,
seamless and elegant morph, slow deliberate movement,
no abrupt cuts or jumps, maintain consistent lighting throughout,
cinematic quality
  1. 時長選 6–8s,讓過渡有足夠的呼吸空間

注意:兩張圖構圖差太多,中間會有不自然跳躍感。如果跳躍明顯,試試讓 Before/After 兩張保持相同角度與位置。

常見坑

圖生影片的失敗多半重複同一批症狀。下面這張對照表先幫你把病因定位清楚,細節解法接著逐坑拆解:

圖生影片五大常見坑對照表:每個坑的症狀與一句話解法,含比例不符、主體液化、人臉扭曲、文字亂碼、缺乏電影感

坑 1:圖片比例跟生成設定不符,畫面被截切或壓縮變形

症狀:上傳了一張 1:1 方形產品圖,選了 16:9 的生成比例,結果兩側出現黑邊,或畫面被硬拉寬導致主體比例嚴重失真。

解法:上傳前先確認輸出比例,把圖片裁切成對應比例再上傳。手機直幅照(9:16)選 9:16,橫幅產品圖選 16:9,方形圖選 1:1(適合 IG)。Kling 和 Veo 都提供多種比例選項,選對是第一步。

坑 2:主體過度形變,產品「液化」了

症狀:生成完發現咖啡杯邊緣不規則、形狀明顯走樣,或整個杯子像融化了一半。這是圖生影片最常見的失敗。

解法:動作幅度太大是主因。改成讓主體靜止,只動鏡頭:

product remains completely static, no deformation, no morphing,
camera slowly pushes in, only the steam and liquid surface move subtly

另外,提升解析度也有幫助(720p → 1080p)——AI 在高解析度下有更多細節錨點,主體形變機率降低。

坑 3:老照片人臉扭曲,認不出來

症狀:輸出影片裡,老照片的人臉跟原始照片差很多,甚至是完全另一個人的臉。

解法:動作幅度過大或原始照片解析度太低,都會造成這個問題。三步走:

  1. 先用 Topaz Photo AI 或 Magnific AI 把老照片解析度拉高再輸入
  2. prompt 只做最細微的動作:subtle eye blink, micro smile, gentle head tilt 10 degrees
  3. 明確加上保護指令:
preserve facial identity and features throughout, no face morphing, no skin texture changes

如果三步都做了還是不對,試試換不同生成種子(seed)重跑幾次——圖生影片有隨機性,多試幾次通常能找到好的。

坑 4:設計稿裡的文字動態後變亂碼

症狀:上傳含有文字的設計圖,輸出影片裡文字扭曲,英文字母排列混亂,中文字直接爛掉成無意義符號。

這是 AI 影片模型的已知弱點:Kling、Veo、Seedance 對畫面內文字的動態處理都不好,尤其中文字。解法分三層:

  1. prompt 明確鎖死文字:
all text elements remain perfectly static, sharp, and legible throughout the entire video,
zero text movement, no text distortion
  1. 如果還是走樣,後製用剪輯軟體(CapCut、Premiere)在原始位置重新疊靜態文字圖層
  2. 如果文字是核心視覺,先把文字去掉再送進圖生影片,後製再合成——文字和動態分開處理品質最穩

坑 5:動了但沒有電影感,像廉價投影片動畫

症狀:影片動起來了,但質感很假,像 PowerPoint 的「放大/淡入」動畫,沒有任何電影感。

解法:幾乎都是只寫了主體動作,缺少鏡頭運動和氛圍層。補上這兩層:

[在原本 prompt 後面加]
subtle camera lens breathing, organic natural movement,
cinematic color grade, warm highlights, gentle vignette,
film-like motion blur on moving elements

另外,時長加長:3 秒容易顯得倉促,試試 6–8 秒讓動作有足夠呼吸空間,氛圍才撐得起來。

作業

  1. 三種素材各做一支:找一張自己的產品照(或 Unsplash 找一張 CC0 產品圖)、一張老照片、一張你喜歡的設計或 App 截圖。三支影片都實際生成完成,比較哪種素材最容易上手。
  2. A/B 測試 prompt:用同一張圖試兩個 prompt——第一次只用簡單的「讓它動起來」,第二次用完整三層結構(主體動作 + 鏡頭運動 + 氛圍)。截圖或錄下兩份結果對比輸出品質差異,這個對比後面課程的多鏡頭練習會用到。
  3. 選做:用 Kling 3.0 首尾幀功能,找兩張 Before/After 圖(改造前後、新舊包裝、季節對比),做一支過渡動畫。

下一課預告

你已經會讓單一素材動起來了。但一支 30 秒廣告可能要切換 5、6 個鏡頭,每個鏡頭裡的主角——那個產品、那個人物——必須長得一樣。AI 自己亂數生成很容易讓主角「跨鏡頭換臉」,觀眾會直接出戲。第 4 課《多鏡頭一致性:角色與場景不走鐘》教你怎麼讓 AI 在不同鏡頭之間保持主角的一致外觀:從角色設定參考圖、Kling 3.0 的主體鎖定功能,到跨鏡頭工作流程——這是 AI 影片進入職業級應用的關鍵一堂。

#AI 影片生成#圖生影片#Kling#首尾幀控制#產品影片#老照片修復

← 回所有文章