影音腳本:短影音、口播與分鏡
你打開 AI,說:「幫我寫一支介紹這個產品的 60 秒短影音腳本。」
它給你一段文字,有開場、有中間、有結尾——看起來很完整。你照著唸,錄一遍,回放一聽:整個人僵住了。你說話的節奏怪怪的,像在朗讀作文,而不是在跟觀眾說話。你唸到一半氣不夠用,斷句的位置全部不對。你把觀眾當成讀者在說話,但觀眾沒有辦法在螢幕暫停、倒帶、重讀——他們只有一次機會跟上你。
這不是 AI 能力不夠,是你的 prompt 沒有告訴它腳本和文章的本質差異。這堂課就把這件事搞清楚。
這堂學什麼
- 腳本和文章的根本差異:為什麼 AI 預設給你的是「文章版腳本」,而不是「可以說話的腳本」
- 短影音的 3 秒鉤子結構:前 3 秒決定你的影片有沒有人看完
- 口播稿的口語化改寫:三個把書面語變成說話語言的技巧
- 60 秒、3 分鐘、10 分鐘的不同腳本結構——內容量和節奏完全不一樣
- 實戰:從一個 idea 出發,生成 60 秒腳本 + 分鏡表的完整流程
觀念一:腳本不是文章
這是整堂課最重要的一句話,先記起來:腳本是給耳朵聽的,文章是給眼睛看的。這兩件事有本質上的差異。

你讀文章的時候,眼睛可以跳回去重讀看不懂的句子,可以在複雜的地方停下來想一下。但是觀眾在聽你說話,沒有這個選項。你說過就過了。你的意思沒有在 0.5 秒內被抓住,觀眾就往下滑了。
這代表什麼?腳本有它自己的一套規則:
一、句子要短。 文章可以寫「由於近年來短影音平台的快速崛起,創作者對於內容的節奏掌握越來越成為決定成效的核心要素」——這句話你讀懂了嗎?懂。但如果有人對你說這句話,你大概聽到一半就斷掉了。口播版本應該是:「短影音興起之後,節奏決定一切。」兩句換一句,意思沒少,好說多了。
二、要有「呼吸感」。 腳本寫的是你要說的話,但實際上你說話的時候會停頓。每個斷句都要標出來,不能讓講者自己猜。很多 AI 給你的腳本沒有停頓標記,你唸起來像在念課文。
三、詞彙要口語。 「目前」說成「現在」、「然而」說成「但是」、「此外」說成「另外」、「不得不提」說成「要說的是」。還有更多:「呈現」→「看起來」、「提供」→「給你」、「使用者」→「你」。這些細節累積起來,就是「聽起來像機器人」和「聽起來像真人」的差距。
觀念二:3 秒鉤子——短影音的生死門
IG Reels、抖音、YouTube Shorts——所有短影音平台的演算法都看一個指標:留存率。簡單說,就是點進你的影片之後,有多少人撐過前 3 秒繼續看。這個數字低,演算法就不推你。
所以前 3 秒是你的第一道生死關。這 3 秒不是用來介紹自己,不是用來說「大家好我是 OOO」,是用來讓觀眾決定要不要繼續看。

短影音的 3 種主力鉤子:
鉤子 1:問題鉤——說出觀眾心裡在想的事
「你有沒有試過:把腳本全部打好,唸完一遍,然後感覺整個人在背課文?」
這句話讓有過這個經驗的人立刻停下來,因為那是他們自己的感受。關鍵是要問得夠具體——「你有沒有在社群行銷遇到困難?」太廣,沒有人覺得那是說自己。
鉤子 2:反差鉤——打破觀眾的預期
「AI 寫的腳本,照著唸反而更難看。」
這句話和大部分人的直覺相反。「照著 AI 寫的說不是應該更輕鬆嗎?」這個矛盾讓人想知道原因。
鉤子 3:結果鉤——先說結論,用「怎麼做到」留人
「我用這個方法,第一次錄腳本,就一次過。」
先把結果放在前面,觀眾想知道怎麼做到,就會留著看。注意:結果要真實,不能浮誇。「我用 AI 腳本一個月漲粉百萬」這種說法已經沒有人信了。
觀念三:三種長度,三種結構
60 秒、3 分鐘、10 分鐘的影片,不是說話說久一點那麼簡單——它們的結構是不同的東西。

60 秒腳本——結構要極度緊湊
| 段落 | 時間 | 功能 |
|---|---|---|
| 鉤子 | 0–5 秒 | 讓人停下來 |
| 核心 | 5–50 秒 | 一個重點說透 |
| CTA | 50–60 秒 | 一個明確行動 |
60 秒腳本只能說一件事。很多人犯的錯是在 60 秒裡塞三個要點——結果每個都說不清楚,整支影片沒有重心。一支 60 秒,一個重點,說透就夠了。
3 分鐘腳本——問題到解法的完整弧線
| 段落 | 時間 | 功能 |
|---|---|---|
| 鉤子 | 0–10 秒 | 問題現象 |
| 問題深挖 | 10–40 秒 | 為什麼會這樣 |
| 解法 | 40–140 秒 | 具體怎麼做 |
| 案例/佐證 | 140–170 秒 | 讓人相信 |
| CTA | 170–180 秒 | 具體行動 |
3 分鐘可以說一個完整的「問題—解法—案例」,這是教學型短影音最常見的結構。
10 分鐘腳本——教學型內容,需要章節感
10 分鐘以上的影片,觀眾在心理上已經把它當成「一堂課」,而不是一個快速資訊片段。需要明確的章節感:開場預告「這支影片你會學到三件事」,中間每個段落有自己的小標題感,結尾有回顧。YouTube 教學型創作者幾乎都用這個框架,因為它能讓觀眾知道自己在哪裡,不容易中途放棄。
手把手實戰
目標:從一個 idea 出發,完成一份 60 秒口播腳本,並且生成對應的分鏡表。
示範 idea:「為什麼 AI 寫的腳本唸起來很奇怪」——這是一個教學型、適合個人品牌帳號的主題。
Step 1:一句話定義這支影片的目的
在給 AI 任何指令之前,先自己寫一句話:這支影片結束後,觀眾應該「知道什麼」或「做什麼」。
影片目的:觀眾看完之後,知道 AI 腳本需要「口語化改寫」這道工序,下次會自己做這一步。
這句話不是給 AI 看的,是給你自己看的。它會告訴你腳本的核心重點是什麼、哪些內容該刪掉。60 秒腳本塞入太多內容的問題,通常從這一步就埋下了——你沒有先決定「只說一件事」。
Step 2:用 prompt 生成腳本初稿
把你的影片目的、鉤子類型、長度、口吻一次告訴 AI:
你是一個台灣短影音創作者,風格是直接、有觀點、像在跟朋友說話。
幫我寫一份 60 秒的口播腳本,主題是「為什麼 AI 寫的腳本唸起來很奇怪」。
【腳本設定】
- 目標觀眾:想做短影音的創作者、小編
- 鉤子類型:反差鉤(打破「AI 腳本很省事」的預期)
- 影片目的:讓觀眾知道需要「口語化改寫」這道工序
- 口吻:口語、輕鬆,不說教,像在分享一個親身發現
- 長度:60 秒,約 150–170 個中文字(每分鐘口播速度約 160 字)
【腳本格式要求】
1. 每個句子獨立一行
2. 需要停頓的地方用「/」標記
3. 每一段說完換行空一行,區分段落
4. 全程不超過 170 字
【禁止事項】
- 不要說「大家好我是」這類自我介紹
- 不要用「相信」「肯定」「一定」這類語氣詞
- 不要用「目前」「此外」「然而」等書面詞彙
- 第一句話就要是鉤子,不能是背景說明
Step 3:口語化改寫——自己動手做這道工序
拿到 AI 初稿後,用這個 prompt 做第一輪口語化改寫:
以下是一份短影音口播腳本初稿,請幫我做「口語化改寫」:
【原稿】
[把 Step 2 拿到的腳本貼在這裡]
【改寫規則】
1. 把所有書面詞彙換成口語版本:「目前」→「現在」、「然而」→「但是」、「此外」→「另外」、「呈現」→「看起來」
2. 句子超過 20 個字的,切短成兩句
3. 每個「因此」「所以」「因為」——留下「所以」,其他兩個換成更口語的說法或直接省略
4. 如果有任何「被動語態」(例如「會被看到」),改成主動語態(「讓人看到」「觀眾會看到」)
5. 改完之後,用「/」標出建議停頓位置
改寫完之後,在下方列出「你改了哪些地方、原因是什麼」——最多五條,讓我知道原稿哪裡出了問題。
改寫結果出來之後,你需要自己讀一遍——大聲讀出來,不要只是在心裡默讀。大聲唸是檢查腳本最有效的方法:唸起來卡口的地方就是還需要改的地方。
Step 4:生成分鏡表
腳本確認好之後,用這個 prompt 生成分鏡表:
以下是一份 60 秒短影音的口播腳本,請根據這份腳本生成對應的分鏡表。
【腳本】
[把 Step 3 完成的腳本貼在這裡]
【分鏡表格式】
請用表格輸出,欄位如下:
| 分鏡編號 | 時間點 | 口播文字 | 畫面描述 | 字幕/文字動畫建議 | 備註 |
【畫面描述規則】
- 這是口播型影片,主要畫面是「拍攝講者」或「文字/圖示說明」二擇一
- 如果是拍攝講者:描述講者的狀態(站/坐/什麼背景)和建議的鏡頭大小(特寫/中景)
- 如果是文字說明:描述要顯示的關鍵字或簡短說明文字
- 每個分鏡不超過 8 秒
【備註欄】
標注這個分鏡的製作難度:「容易」(手機直接拍)、「中等」(需要後製加字幕)、「需要素材」(需要額外找圖或錄製)
分鏡表出來之後,你可以看到這支影片的「全貌」——每一段說什麼、畫面是什麼,製作前就可以規劃拍攝流程。

Step 5:最終確認——用這個 prompt 審稿
腳本和分鏡表都完成後,做一次全盤確認:
以下是一份 60 秒短影音的完整腳本和分鏡表。請以一個有經驗的短影音創作者的角度審查,回答以下問題:
【腳本】
[貼入]
【分鏡表】
[貼入]
【審查問題】
1. 前 5 秒的鉤子:能讓正在滑 IG 的人停下來嗎?如果不夠強,給我一個替代版本
2. 整份腳本有沒有超過「一個核心重點」?有的話指出哪裡
3. 有沒有哪句話唸起來會卡口?(句子太長、停頓位置奇怪)
4. CTA 是否明確?觀眾知道看完要做什麼嗎?
5. 分鏡表裡有沒有哪個畫面「很難拍」或「跟口播內容對不上」?
給我具體的問題和修改建議,不要說整體很好。
這個最終審查 prompt 是在模擬「你自己是觀眾」的角度看這支影片——和寫腳本時的視角完全不同。很多腳本在這一步被抓出的問題是:鉤子其實沒有製造懸念,或是 CTA 說的是「留言告訴我」但前面的內容根本沒有引導觀眾留言的動機。
常見坑
坑 1:腳本字數算錯,60 秒塞了 300 字
症狀:你照著腳本錄影,60 秒到了說到一半;或是你整個說完,才 40 秒,中間有很多尷尬的停頓。
原因:AI 預設不知道你的說話速度。中文口播的「舒適速度」大約是每分鐘 130–180 字(依個人語速),但很多人給 AI 的 prompt 只說「60 秒腳本」,沒有給字數範圍,AI 可能給你 250 字的內容。
修法:在 prompt 裡明確給字數,同時說明你的語速。不確定的話,先錄一段 60 秒的自由說話,數一下字數,這就是你的「個人每分鐘字數」基準。
我的說話速度大約是每分鐘 150 字。
請幫我寫一份 60 秒的腳本,字數控制在 140–160 字之間。
坑 2:鉤子放的是「說明」,不是「懸念」
症狀:第一句話你覺得寫得不錯,但影片發出去,前 3 秒的留存率還是很低。
最常見的問題第一句長這樣:
「今天要跟大家介紹 AI 寫腳本的三個技巧。」
這句話沒有錯,但它「說完了」——觀眾知道接下來是什麼,沒有留下來看的理由。鉤子的功能是讓人想知道「然後呢」。
改法:把「說明」改成「懸念」或「打破預期」:
「AI 幫你寫腳本,但照著唸會更難看。」
「我用 AI 腳本錄了三次,每次錄完都覺得哪裡不對——直到我發現這件事。」
把你的鉤子單獨拿出來問 AI:
以下是我短影音的第一句話:
「[你的鉤子]」
這句話能讓正在滑 IG 的人停下來嗎?理由是什麼?
請給我 3 個替代版本,使用「反差鉤」或「結果鉤」,風格口語、不超過 25 字。
坑 3:分鏡表和腳本沒有接上——AI 生的是通用模板
症狀:你讓 AI 生分鏡表,拿到的內容像這樣:
分鏡 1:主角面對鏡頭說話,背景乾淨
分鏡 2:展示相關圖片
分鏡 3:特效轉場
這根本用不了——它沒有對應你的口播文字,「展示相關圖片」也不知道是什麼圖片。
原因:你沒有把腳本文字放進 prompt,AI 只能給你通用框架。
修法:腳本要完整貼入,並且在 prompt 裡說清楚「依照口播文字,逐句對應到分鏡」——參考 Step 4 的完整 prompt。
坑 4:口語化改了詞彙,但句子結構還是書面語
症狀:你把「然而」換成「但是」、把「目前」換成「現在」,唸起來感覺還是怪怪的。
原因:口語化不只是換詞,句子結構也要改。書面語很常用「雖然……但是……」「由於……因此……」這種「先條件、後結論」的長句型。口語裡我們常用「先說結論、再說原因」:
書面:「雖然 AI 能快速生成腳本,但由於缺乏口語化處理,唸起來往往生硬。」
口語:「AI 腳本唸起來很生硬。為什麼?它沒有口語化。」
這個改法不難,但你必須大聲唸出來才聽得出差異。腳本這門課最重要的工具不是 AI,是你自己的嘴巴——先唸一遍,再改,再唸,才算過關。

作業
- 定義一個你真的想做的影片題目,寫下「影片結束後,觀眾應該知道或做什麼」這句話。題目不限,可以是你的專業、生活、產品介紹——只要是你真的有東西說的。
- 用這堂課的 prompt 流程走完一遍:idea → 腳本初稿 → 口語化改寫(大聲唸一遍,自己再改一輪)→ 分鏡表。
- 把腳本大聲錄一遍,不用上傳,只是給自己聽:說話流不流暢?有沒有卡口的地方?把卡口的句子記下來,改掉,重錄一遍。這個「錄——聽——改」的循環是腳本進步最快的方法,沒有之一。
- 選做:把你完成的腳本和分鏡表用 Step 5 的審查 prompt 跑一遍,看 AI 抓出什麼問題。
下一課預告
到這一課為止,你已經會寫貼文、長文、腳本——三種主要的內容格式。但是一個人的腦袋是有限的,創作者最大的敵人不是「不會寫」,是「不知道該寫什麼、斷更、然後覺得自己沒有靈感」。
第 6 課是這個課程的收尾:內容系統。我們來解決「批量生產不斷更」的問題——怎麼把一個核心 idea 拆成一個月的內容行事曆、怎麼建立你專屬的素材庫讓 AI 越用越懂你、以及整個課程的綜合實戰:從個人品牌定位出發,一口氣產出一個月的 IG + Threads + 短影音腳本完整計畫。你在前五課學到的每一個技能,都會在第 6 課集中用到一次。