提示詞四要素公式:主體・風格・構圖・細節,一句話從四不像變神圖
第 1 課你已經在 ChatGPT 裡生出了第一張圖,也知道生圖跟聊天用的是同一個對話框。但你大概也遇到了那個讓人洩氣的瞬間:同樣一句「幫我畫一隻貓」,別人截圖分享出來的是雜誌封面等級的作品,你生出來的卻是一隻眼睛歪掉、背景一團糊的東西。
先講結論,讓你安心:這不是你的帳號比較爛,也不是別人偷偷開了什麼隱藏設定。 差別幾乎只有一個——他把話講清楚了,你沒有。生圖模型不會讀心,你給它多少資訊,它就照多少資訊去畫;剩下沒講的部分,它只能亂猜,而亂猜的結果十次有九次不是你要的。
這堂課要給你的,是一個好記到不用背的公式:主體 + 風格 + 構圖 + 細節。四個格子填齊,你的提示詞就從「畫一隻貓」升級成 AI 真的接得住的完整指令。學會這一課,你之後每一次生圖的命中率都會不一樣。
這堂學什麼
- 四要素公式:主體、風格、構圖、細節——一個框架涵蓋一張好圖需要交代的所有事
- 逐項拆解:每一項到底該回答什麼問題、可以填哪些具體的詞,附速查
- 尺寸與比例:1:1、3:2、2:3 怎麼選,以及 2026 年 7 月 GPT Image 2 能做到的超寬、超高、2K 高解析
- 進階技巧一:與其純描述,不如告訴 AI「這張圖要幹嘛」,它會自己補上合適的判斷
- 進階技巧二:負面提示——怎麼跟 AI 說「不要出現什麼」,以及為什麼不能一次列一長串
- 迭代心態:第一張永遠是草稿,用來回對話逼出理想版本,而不是一次到位
觀念一:四要素公式,一句話講齊
把生圖想成請一個超強但完全不認識你的插畫師幫忙。他技術頂尖,但你如果只丟一句「畫一隻貓」,他只能問一堆問題,或乾脆自己決定——而他決定的,通常不是你腦中那隻。四要素公式就是幫你一次把該交代的都交代完:

- 主體:畫什麼。這張圖的主角是誰、在做什麼、什麼情緒。
- 風格:什麼調性。水彩、3D、動漫、寫實照片……決定整張圖的視覺語氣。
- 構圖:怎麼取景。特寫還是全身、俯視還是平視、什麼比例。決定「鏡頭感」。
- 細節:氛圍與質感。光線、色調、材質、背景元素——把畫面從「對」變成「好看」。
這四項不是硬規則,而是一份檢查清單。你不用每次都寫得落落長,但每次動手前心裡跑一遍:主體講清楚了嗎?風格指定了嗎?構圖交代了嗎?細節補上了嗎?光是這個習慣,就能擋掉八成的四不像。
觀念二:同樣要一隻貓,差在哪
把公式套進最經典的例子,你馬上看得出差距:

→ 什麼貓?什麼風格?什麼場景?什麼氣氛?你沒說,AI 只能自己填空,結果自然跟你想的南轅北轍。
看出來了嗎?好例子並沒有用什麼專業術語,它只是把「橘色虎斑」「窗邊曬太陽」「水彩」「特寫」「午後陽光」這些你本來就會講的中文,補進四個格子裡而已。寫好提示詞的門檻不是英文、不是攝影知識,是願意把腦中的畫面描述完整。
觀念三:四要素逐一拆解
知道有四格還不夠,你得知道每一格該填什麼。這張速查表把每項要回答的問題和可以用的詞都列出來,寫的時候照著填就好:

主體:畫什麼
回答三件事:是誰或什麼、在做什麼、什麼情緒。越具體越好。「一個人」很虛,「一位年輕女生對著鏡頭微笑、手拿咖啡」就立體多了。人數、年齡、動作、表情,能講就講。風格:什麼調性
這是四要素裡最能決定成敗的一項。常見選項:扁平插畫、水彩、3D 渲染、皮克斯風、日系動漫、寫實照片、極簡線稿、賽博龐克……不確定要哪種沒關係,下一課會給你一份完整的風格速查表加可複製咒語。這堂先記得:一定要指定,別讓 AI 自己選。構圖:怎麼取景
想像你手上有一台相機。要特寫還是全身?俯視、平視還是仰角?主體置中還是留白?直式還是橫式?要不要淺景深(背景模糊、主體突出)?這些決定畫面的「鏡頭感」,是業餘和專業的分水嶺。細節:氛圍與質感
最後這一格負責把畫面從「對」推到「好看」。光線(逆光、暖光、清晨側光)、色調(莫蘭迪、高飽和、黑白)、材質(毛氈、金屬、水彩紙)、背景元素(乾淨純色、街景、書桌)。細節給得好,同一個主體的質感會差一個檔次。觀念四:尺寸與比例怎麼選
圖要拿去哪裡用,比例就得對。ChatGPT 裡不用去哪個選單勾選,直接在提示詞裡講用途或比例即可,例如「做成限時動態的直式」或「1:1 正方形」。這是 2026 年 7 月的常用比例對照:

- 1:1 正方形:IG 貼文、大頭貼、商品圖。最保險的萬用比例。
- 3:2 橫式:橫幅、YouTube 縮圖、簡報封面、部落格題圖。
- 2:3 直式:IG/FB 限時動態、手機海報、Pinterest。
進階技巧一:告訴 AI「這張圖要幹嘛」
這是新手和老手最明顯的差距。比起把每個細節都描述死,更聰明的做法是告訴 AI 這張圖的用途,它會自己補上一堆你可能沒想到的判斷:

幫我做一張 IG 貼文縮圖,主題「三個提升專注力的方法」,
要有大標題空間、扁平插畫風、暖色、吸睛。
「IG 貼文縮圖」這五個字,等於一口氣告訴了 AI:比例要抓成適合貼文的正方形、要預留放大標題的空白區、重點要放中央抓住眼球。這些你不用一條一條寫,因為「縮圖」這個用途本身就隱含了這些需求,而 AI 懂。
同樣的道理:「做成餐廳菜單」它會留文字位、「當作 podcast 封面」它會做成正方形加標題感、「LINE 貼圖」它會給你留白背景和誇張表情。先想清楚這張圖要去哪裡用,再把用途講給 AI 聽,常常比你自己硬湊一堆形容詞還準。
進階技巧二:怎麼跟 AI 說「不要什麼」
有時候問題不是缺了什麼,而是多了你不要的東西——圖上冒出一串亂碼文字、多了一隻手、加了莫名其妙的浮水印。這時候你需要「負面提示」,也就是明確講出不要出現什麼:
一杯拿鐵放在木桌上,寫實照片風,俯視構圖,自然光。
不要出現文字、不要浮水印、背景不要有其他杯子。
這裡有兩個關鍵,和某些生圖工具(例如 Stable Diffusion)不一樣:
- ChatGPT 沒有獨立的「負面提示欄位」。 你要把不要的東西直接寫在同一句提示詞裡,用「不要出現○○」的講法。
- 負面條件控制在 2 到 4 個就好。 一次列一長串「不要這、不要那」,反而會分散模型的注意力,結果更糟。挑最容易出包的來擋就好——畫人物就擋「多餘的手指」、做場景就擋「亂入的文字」、混風格就擋「風格混雜」。
手把手實戰:用公式生一張圖
觀念講完,實際跑一遍。假設你要幫一篇談「早晨習慣」的文章做題圖。
先在心裡填四格
動手打字前,先把四要素想過一遍,別急著打:
- 主體:一個人在窗邊喝咖啡看書
- 風格:溫暖的扁平插畫
- 構圖:橫式、中景、主體偏左留出標題空間
- 細節:清晨柔和側光、莫蘭迪色調、乾淨的居家背景
這一步花不到三十秒,卻決定了接下來的成敗。
把四格串成一句話丟給 ChatGPT
打開 ChatGPT,直接在對話框輸入(或用第 1 課教的方式指定要生圖):
幫我做一張部落格題圖,橫式 3:2。
一位年輕人坐在窗邊,一手拿咖啡一手拿書,神情放鬆(主體);
溫暖的扁平插畫風(風格);中景、主體偏左、右側留出放標題的空間(構圖);
清晨柔和側光、莫蘭迪色調、乾淨的居家背景(細節)。
不要出現文字、不要浮水印。
注意我把「部落格題圖」這個用途也講了,讓 AI 順便幫忙判斷排版。
看第一張,但別急著接受
第一張出來了。它大概方向對、細節不完全。這很正常——第一張永遠是草稿,不是成品。 你的工作是看著它,找出「哪裡不對」,然後用下一步修。
用對話微調,逼出好版本
不要重寫整段提示詞,直接接著對話講你要改的地方:
主體再大一點、光線再暖一點,右側的留白再多一些,
書換成筆電。
ChatGPT 會在原本那張的基礎上調整,而不是從零重畫。改個兩三輪,你就會逼出滿意的版本。
這套「生草稿 → 下微調指令 → 重生一版 → 滿意就定稿」的來回,才是生圖的真正日常:

常見坑
坑 1:提示詞明明很長,圖還是很糊、很亂
很多人以為提示詞越長越好,於是塞了一大串形容詞,結果 AI 反而抓不到重點。問題通常不是「講太少」,而是主體不只一個。「一隻貓、一隻狗、一隻兔子在森林裡開派對,旁邊有城堡和彩虹和熱氣球」——元素太多,AI 會顧此失彼。解法:一張圖抓 1 到 2 個核心主體就好,其他當背景輕描淡寫帶過。想要豐富場景,寧可分成幾張圖各自生。
坑 2:出現「This request may not follow our content policy」或 AI 回你「I wasn't able to generate that image」
這是內容政策擋下來了。常見地雷:指名真實名人的臉、有版權的卡通角色(米老鼠、寶可夢)、品牌 logo、暴力或成人內容。解法:把敏感的部分改成描述性的講法——不要寫「畫一個像某某明星的人」,改成「一位三十歲、短髮、戴圓框眼鏡的男性」;不要指名卡通角色,改描述你要的特徵。改完再送一次通常就過了。
坑 3:圖上的中文字變成亂碼、缺筆畫
想在圖裡放中文標題,結果 AI 生出來的字歪七扭八、根本不是字。這是目前所有生圖模型共同的弱點,中文尤其嚴重。解法有兩個:一是文字盡量短(幾個字比一整句成功率高),並在提示裡明講「文字要清晰正確」;二是更保險的做法——讓 AI 只生圖、留白,文字之後用 Canva 之類的工具自己疊上去。 第 6 課會示範這個實戰流程。
坑 4:每次重生,貓的花色/人的長相都不一樣
你生了一張很滿意的角色,想讓它換個姿勢再來一張,結果重生後根本變成另一隻貓。這是因為每次生成本質上都是「重新想像」,不會自動記住上一張的長相。這在做系列圖、繪本、品牌吉祥物時是大魔王。這一課先知道有這回事就好——維持角色一致性是一門專門的技術,第 4 課會整堂課教你怎麼鎖住同一個角色。
坑 5:比例講了卻沒生效
你寫了「16:9」,出來卻還是接近正方形。原因是 ChatGPT 標準輸出的三種比例是 1:1、3:2、2:3,你講的比例它會抓「最接近的那個」。16:9 會被靠到 3:2、9:16 會被靠到 2:3,通常夠用。真的需要精準的超寬或超高比例(像 3:1 橫幅),就明講「做成超寬橫幅、盡量接近 3:1」,交給 GPT Image 2 處理。
作業
- 套公式重寫:拿你之前生過、覺得不滿意的一句提示詞,用四要素公式重寫一遍,四格都填齊,再生一次。前後對照,感受差距。
- 練指定用途:選一個真實用途(你的 IG 大頭貼、一張簡報封面、一個 LINE 群組頭圖),只講用途加基本主體,看 AI 自己補了哪些判斷。
- 練來回微調:從一張草稿開始,用純對話的方式(「再暖一點」「主體再大」「換個角度」)連續微調至少三輪,把「改 → 重生 → 再改」變成肌肉記憶。
- 踩一次負面提示:生一張容易出現多餘元素的圖(例如有人物的場景),故意不加負面提示生一次,再加上「不要出現文字、不要多餘的手」生一次,比較兩張。
下一課預告
這堂課我們一直說「風格」是四要素裡最能決定成敗的一項,但也一直把它跳過——因為它值得一整堂課。第 3 課給你一份風格速查表加可直接複製的咒語:皮克斯、吉卜力、水彩、3D 渲染、極簡線稿、賽博龐克、蒸氣波……你想要哪種畫風,一句話就能召喚出來,再也不用對著空白對話框想「那種感覺到底叫什麼」。把這課的公式練熟,下一課我們就來把「風格」這一格,從你最卡的地方變成你最強的武器。