第一支 AI 影片:文生影片 prompt 結構
第 1 課我們把 2026 年的 AI 影片地圖攤開來看:Veo 3.1、Kling 3.0、Seedance 2.0 各有什麼強項、要花多少錢,也看到曾經的 Sora 2 為什麼退出主選單。這堂課開始進入實作。但在按下「生成」之前,有件事必須先說清楚:你腦子裡想的那幅畫面,AI 完全看不到。
你說「生成一支帥氣的咖啡廣告」,AI 怎麼知道你要推鏡還是俯拍?要工業風還是溫暖木系?主角是黑咖啡還是拿鐵?它不知道。它會依照機率,生成它「覺得最可能是廣告的東西」——結果往往是陳腔濫調:一杯咖啡在桌上不動,蒸氣緩緩升起,背景是模糊的咖啡廳。你對,但沒有靈魂,也沒有你的想法。
想讓 AI 生成你腦中的那支影片,你需要一套結構化語言。這堂課把這套語言拆開來教。
這堂學什麼
- Prompt 四層結構:鏡頭語言、主體動作、環境光線、風格——每層都要有資訊量
- 鏡頭術語白話化:推拉搖移、景別(特寫到全景到鳥瞰)用講人話的方式記住
- 好壞 prompt 對照:同一個主題,差幾個字,輸出結果差多少
- 迭代技巧:生成 → 找出哪層沒到位 → 只修那一層 → 再生成,三輪逼近目標
- 實戰:同一個 prompt 在 Kling 3.0、Veo 3.1、Seedance 2.0 各生成一次,比較模型差異
觀念一:為什麼你的 prompt 沒用
多數人第一次寫 AI 影片 prompt,會寫成這樣:
一個女生在咖啡廳喝咖啡
這句話有三個問題:
- 沒有鏡頭指令:AI 不知道要推鏡還是靜態,就隨機。
- 主體動作模糊:「喝咖啡」是動作,但她在微笑?沉思?低頭看手機?每次生成可能不一樣。
- 沒有光線與風格:攝影師走進咖啡廳第一件事是看光——AI 也需要這個。
AI 影片模型實際上在同時處理四層資訊:鏡頭怎麼動、畫面裡有什麼在動、光怎麼打、整體視覺風格是什麼。你的 prompt 只覆蓋一層,剩下三層 AI 自由發揮——結果好不好看天意,而且每次不一樣。
這就是為什麼有人說「AI 生成很難控制」。問題通常不在模型,在 prompt 沒有足夠的資訊量。

觀念二:Prompt 四層結構
把 prompt 拆成四層,每層覆蓋一個維度。寫的時候由上到下:鏡頭先說,主體接著,環境跟上,風格收尾。
第一層:鏡頭語言(Camera)
告訴 AI「攝影機怎麼動、怎麼框景」。這是最影響視覺衝擊力的一層,新手最常忽略。
景別(Shot Size),由近到遠:
| 術語 | 白話 | 適合用在 |
|---|---|---|
extreme close-up (ECU) |
超特寫 | 眼睛、嘴唇、指尖細節 |
close-up (CU) |
特寫 | 臉部為主 |
medium shot (MS) |
中景 | 腰部以上,人物表情+肢體 |
full body shot |
全身 | 完整人物動作 |
wide shot |
廣角全景 | 場景全貌 + 人物位置 |
establishing shot |
建立鏡 | 交代地點(開場常用) |
aerial / bird's eye |
空拍俯瞰 | 城市、地景、大場面 |
鏡頭移動(Camera Movement):
push in(推鏡):攝影機往主體靠近,製造張力、強調情緒pull out / zoom out(拉鏡):離開主體,帶出環境感、疏離感pan left / pan right(搖鏡):攝影機左右水平旋轉,帶過場景tilt up / tilt down(俯仰):攝影機上下旋轉,視角高低切換tracking shot(跟拍):攝影機跟著移動中的主體走orbit / 360°(環繞):攝影機繞著主體轉一圈,產品展示常用static shot(靜態固定):攝影機完全不動,主體的動作是焦點handheld(手持):帶輕微晃動感,貼近紀錄片或真實感

第二層:主體動作(Subject)
明確描述主角在做什麼、表情如何。不只說「坐著」,說「雙手捧著咖啡杯,抬頭望向窗外,嘴角微揚」。
核心原則:AI 影片擅長呈現一個持續動作,不擅長「突然切換」。一個動作寫清楚比塞三個動作強得多。描述動作的詞要精準:
弱:走路
強:walking slowly with measured steps, arms relaxed, looking slightly downward
第三層:環境與光線(Environment & Lighting)
- 場景地點:
in a rustic Tokyo café、on a rooftop at sunset、inside a minimalist white studio - 時間/自然光:
golden hour(黃昏溫暖光)、blue hour(天剛黑、藍紫調)、midday harsh sunlight(正午硬光)、overcast soft light(陰天漫射光) - 人工光:
neon-lit night(霓虹夜景)、dramatic side lighting(側光強調輪廓)、soft diffused light(柔光箱感)、backlit silhouette(逆光剪影) - 環境細節:加一兩個具體元素讓場景更真實,例如
mist rising from the ground、rain streaks on the window、floating dust particles
第四層:風格(Style)
決定整體視覺調性。常用關鍵字:
cinematic:電影感,寬螢幕比例、景深明顯、對比高commercial:廣告感,明亮、飽和、精緻乾淨documentary:紀錄片感,手持、真實感、自然色彩analog film:底片感,顆粒、褪色、復古色調4K ultra-realistic:高擬真,清晰細節、無濾鏡感anime style:二次元筆觸,線條感明顯
最後可以加解析度和時長暗示:4K, 5 seconds。
觀念三:好壞 Prompt 對照

同樣的主題,看差在哪:
範例 A:咖啡廣告
弱:一個女生在咖啡廳喝咖啡
強:
Close-up shot, slowly pushing in.
A woman in her late 20s holds a warm latte with both hands,
gaze drifting toward the rain-streaked window, a subtle smile forming.
Cozy Tokyo café interior, golden-hour warm light filtering through foggy glass,
soft bokeh background, wisps of steam rising.
Cinematic, commercial feel, warm color grade, 4K.
Duration: 5 seconds.
範例 B:都市空拍
弱:城市的空拍
強:
Aerial shot, slow pull-up while rotating clockwise.
A dense urban skyline at blue hour,
skyscrapers with glowing windows reflected in a river below,
vehicle traffic trails forming long light streaks on elevated highways.
Atmospheric haze, dramatic contrast between warm amber city lights and cool violet twilight sky.
Cinematic, hyperrealistic, 4K.
Duration: 8 seconds.
中文 prompt 可以用嗎?
可以。Kling 3.0 和 Seedance 2.0 對中文指令的理解很強(ByteDance 系列均針對中文優化),Veo 3.1 則建議一律用英文——中文理解準確率明顯偏低,容易跑偏。
實用折衷做法:先用中文想清楚四層結構,再請 Claude 翻譯成 prompt 英文:
幫我把以下影片 prompt 翻成精確的英文,保留所有鏡頭術語和細節,不要過度意譯:
鏡頭:特寫,推鏡
主體:咖啡師雙手緩慢將牛奶旋入咖啡,拉花圖案逐漸成形
環境:專業咖啡吧台,暖色聚光燈,木質檯面,蒸氣輕升
風格:電影感,廣告質感,暖色調,4K
觀念四:迭代——生成不是一次到位
多數人第一次按下生成,看到結果不對就放棄換題目。但職業創作者的工作流程是這樣:
第一次生成 → 看哪層沒到位 → 只修那一層 → 再生成
每次只動一個變數,你才知道是哪句話起作用。如果什麼都改,你學不到任何東西,下次還是亂猜。
迭代三問,每次生成後問自己:
- 鏡頭對了嗎? 景別、移動方式是你要的?
- 主體動作對了嗎? 演員表情、動作到位?
- 氣氛對了嗎? 顏色、光線、風格是你要的調性?
一問一問排除,通常三輪內可以逼近目標。

手把手實戰:同 prompt 三平台比較
這次實戰目標:寫一個 prompt,在 Kling 3.0、Veo 3.1、Seedance 2.0 各生成一次,看同樣的文字在不同模型手裡長什麼樣。
三個平台的免費/入門方式(2026 年 7 月現況):
| 平台 | 免費配額 | 最低付費 | 入口 |
|---|---|---|---|
| Kling 3.0 | 每天 66 credits | Standard $6.99/月(660 credits) | kling.ai |
| Veo 3.1 | Google AI Studio 試用 | Google AI Pro $19.99/月(含 Veo 3.1 Fast) | aistudio.google.com |
| Seedance 2.0 | Dreamina 每天 2-3 支 | 官方 API ~$0.14/秒 | dreamina.capcut.com |
Step 1:寫好基礎 prompt
選一個中等複雜度的場景:「咖啡師手部特寫,製作拿鐵拉花」。
先用中文四層想清楚:
鏡頭:極特寫,緩慢推鏡
主體:咖啡師雙手將蒸奶緩慢旋入濃縮咖啡,拉花葉片圖案逐漸成形,動作專注穩定
環境:專業咖啡吧台,溫暖聚光燈,深色木質檯面,輕薄蒸氣升起
風格:電影感,廣告品質,暖色調,4K
整理成英文 prompt:
Extreme close-up shot, slowly and smoothly pushing in.
A barista's skilled hands gently pour steamed milk into a dark espresso,
a latte art leaf pattern forming with each precise, controlled movement.
Professional café counter, warm focused overhead lighting, dark wooden surface,
soft wisps of steam rising gently from the cup.
Cinematic, commercial photography quality, warm golden color grade, 4K.
Duration: 5 seconds.
這個 prompt 涵蓋四層,而且每層都有具體細節。
Step 2:在 Kling 3.0 生成
- 登入 kling.ai,點左側「Video Generation」→「Text to Video」
- 把 prompt 完整貼進輸入框
- 設定:
- Model:選最新版(Kling 3.0)
- Duration:5 seconds
- Aspect Ratio:16:9
- Quality:Standard(免費帳號選這個;Pro 帳號可選 Professional)
- 點「Generate」,等約 60-90 秒
Kling 3.0 的強項是主體一致性——手部動作通常清晰自然。生成完成後,觀察:拉花過程是否流暢?有沒有出現手指變形或液體物理異常?
免費配額說明:5 秒 Standard 影片約消耗 30-60 credits,每天 66 免費 credits 夠跑 1-2 次。Standard 方案 $6.99/月,660 credits,大約可生成 10-20 支 5 秒影片。
Step 3:在 Veo 3.1 生成
- 到 aistudio.google.com,用 Google 帳號登入
- 點「Create」→「Video」(需要 Google AI Pro 訂閱,或使用試用期)
- 確認選到 Veo 3.1 Fast 或 Standard 模型
- 貼入同一個英文 prompt(Veo 要用英文,別貼中文版)
- 送出,等待生成
Veo 3.1 的強項是物理真實感——流體、蒸氣、光影細節往往比其他模型更細緻。仔細比較:蒸氣升起的動態是否更自然?木質檯面的材質感有沒有出來?
費用說明:Veo 3.1 Fast API $0.15/秒(含原生音訊),Standard $0.40/秒。Google AI Pro $19.99/月包含每月 1,000 AI credits,是目前入門 Veo 最划算的方式。
Step 4:在 Seedance 2.0 生成
- 到 dreamina.capcut.com,用 TikTok 或 Google 帳號登入
- 點「Video Generation」→「Text to Video」
- 選擇 Seedance 2.0 模型
- 可以直接貼中文 prompt,Seedance 對中文的理解很穩定:
極特寫鏡頭,緩慢推鏡。咖啡師雙手將蒸奶緩慢旋入濃縮咖啡,拉花葉片圖案逐漸成形,動作專注穩定。專業咖啡吧台,溫暖聚光燈,深色木質檯面,輕薄蒸氣升起。電影感,廣告品質,暖色調,4K,5秒。
- 送出生成,Dreamina 免費配額大約每天可以生成 2-3 支
Seedance 2.0 官方 API 定價約 $0.14/秒,是目前主流模型中性價比最高之一。注意比較:同樣的內容,中文 prompt 版本和英文版本的結果有沒有差異?
Step 5:比較三個結果
拿到三個影片,用這個框架比較:
| 比較維度 | Kling 3.0 | Veo 3.1 | Seedance 2.0 |
|---|---|---|---|
| 手部細節準確度 | 填入觀察 | 填入觀察 | 填入觀察 |
| 流體/蒸氣真實感 | 填入觀察 | 填入觀察 | 填入觀察 |
| 暖色調還原 | 填入觀察 | 填入觀察 | 填入觀察 |
| 推鏡動作流暢度 | 填入觀察 | 填入觀察 | 填入觀察 |
| prompt 遵循度 | 填入觀察 | 填入觀察 | 填入觀察 |
沒有「哪個最好」的答案。真正的問題是:哪個結果最貼近你的 prompt 描述?你的觀察就是你最個人化的模型選擇指南。
Step 6:做一輪迭代
選出最接近你預期的那個結果,找出一個「還差一點」的地方,只修改那層的 prompt。
例如,覺得推鏡動作不夠緩慢有力:
原:slowly and smoothly pushing in
改:very slowly pushing in with an almost imperceptible creep, hyper-smooth motion
覺得光線太冷,不夠溫暖:
原:warm focused overhead lighting
改:warm candlelight-adjacent lighting, amber and honey tones, soft fill light, subtle lens flare
送出、比較、再修。這個「改一層、生成、看差異」的迴圈,就是你日後做每一支影片的基本操作節奏。

Sora 2 為什麼不在實戰裡
第 1 課提過 Sora 2,這堂課實戰刻意沒有它,原因很現實:OpenAI 已於 2026 年 4 月 26 日關閉 Sora 的 Web 與 App(網頁版和 iOS),僅存的 API 也將在 2026 年 9 月 24 日終止,官方已請用戶自行匯出內容。Sora 的敘事連貫性曾是它的強項,但一個正在下架的工具,不值得你現在投入時間學。這也呼應第 1 課的提醒:練方法,不要練某個特定平台——你這堂課學到的四層 prompt 寫法,Veo 3.1、Kling 3.0、Seedance 2.0 都通用,將來換模型一樣能用。課程實戰以 Veo 3.1 + Kling 3.0 + Seedance 2.0 為主力。
常見坑
坑 1:prompt 太短,每次生成風格都不一樣
症狀:同一句簡短 prompt,連跑三次,一次偏暗、一次偏亮、鏡頭每次都不同,沒辦法重現你喜歡的版本。
原因:短 prompt 留給模型的自由空間太大,它每次「自由發揮」的結果自然不穩定。你愈少說,它愈隨機。
解法:四層都至少寫一句話。測試標準:給別人看你的 prompt,他應該能大致想像出畫面;如果他說「我不知道你想要什麼風格」,就是還不夠。
坑 2:一個 clip 塞太多動作,結果東拼西湊
症狀:「女生走進咖啡廳、點了咖啡、坐下來喝、掏出筆記本開始寫字」——生成結果要麼只完成第一個動作,要麼動作間的轉場像硬切,毫無流暢感。
原因:AI 影片模型(5-10 秒)最擅長呈現一個持續動作,不是一段有轉場的劇情。多個動作的剪接邏輯屬於後製層,不屬於生成層。
解法:一個 clip = 一個動作。四個動作就生成四個 clip,後製時剪接。第 5 課的剪輯課會完整講這個工作流程。
坑 3:中文 prompt 丟給 Veo 3.1,場景完全跑偏
症狀:貼中文 prompt 給 Veo 3.1,生成出來的場景和描述天差地遠——描述「溫暖咖啡廳」,出來卻是戶外街景;描述「推鏡」,鏡頭完全沒動。
原因:Veo 3.1 訓練資料以英文為主,中文指令的理解準確率明顯偏低,尤其是涉及鏡頭術語時。
解法:Veo 3.1 一律用英文 prompt。中文思考後,請 Claude 翻譯:
幫我把以下影片 prompt 翻成精確的英文,保留所有鏡頭術語和場景細節,不要過度意譯:
[你的中文四層 prompt]
坑 4:手部特寫出現多餘手指或關節變形
症狀:生成有人物手部的特寫鏡頭,手指數量不對、關節方向奇怪,或手部在動作過程中形狀突然改變。
原因:手部動態是所有 AI 影片模型共同的弱點(不只 Kling)。極特寫 + 複雜手部動作是高難度組合,對模型的空間理解要求極高。
解法:
- prompt 加入
anatomically correct hands, stable hand movement引導模型注意 - 把景別從
extreme close-up放寬到close-up或medium shot,減少手部在畫面中的佔比 - 多生成幾次(3-5 次),挑最好的一次——手部問題屬於隨機性 bug,多跑幾次機率會改善
- 設計構圖時讓手部「部分入鏡」:
partially visible hands entering frame,降低模型需要生成的完整手部細節量
坑 5:Veo 3.1 原生音訊和畫面不同步
症狀:Veo 3.1 生成的影片帶有原生環境音或音效,但聲音和畫面動作有約 0.5-1 秒的偏移——咖啡倒入杯子的聲音比畫面慢了一拍,或液體流動沒有對應的水聲。
原因:Veo 的音訊生成是模型推測「這個畫面應該有什麼聲音」,和真實錄音不同,細節同步無法保證,尤其在涉及動作觸發音效時。
解法:如果音訊同步是你的需求,生成時在 prompt 結尾加 no audio 或選擇無音訊版本,後製階段再疊加音效和音樂。第 5 課「原生音訊與剪輯後製」會完整講這個工作流程。
作業
- 基礎練習:選一個你想做的場景(自己的產品、旅遊地點、人物),用四層結構寫出完整 prompt,在 Kling 3.0 或 Seedance 2.0 生成一次。截圖你的 prompt 和生成結果。
- 三平台比較:用同一個 prompt 跑三個平台(Kling / Veo / Seedance),填好比較表,記下哪個結果最接近你的預期、差在哪。
- 迭代練習:選出最接近的那個結果,做一輪迭代——只修改一層 prompt,再生成一次。記下你改了哪個字、結果有什麼變化。
這三個結果和你的觀察整理成筆記,以後你做的每一支影片都會參考它。這份「個人 prompt 資料庫」的價值會隨著你做的影片數量一直累積。
下一課預告
這堂課從零開始,純靠文字告訴 AI 要拍什麼。但如果你已經有現成的圖片——品牌 logo、產品照、設計稿、人物相片——能不能讓它直接動起來?
第 3 課講圖生影片:把靜態圖片作為起點,讓品牌視覺動起來。電商產品照旋轉展示、設計稿化為動態廣告、人物圖像開口說話——這是設計師和電商創作者最常用的工作流程,而且通常比純文生影片更容易控制最終畫面,因為你已經有了一個視覺錨點。