精華筆記

· @aihub.tw

ChatGPT 生圖指南

提示詞四要素公式:主體・風格・構圖・細節,一句話從四不像變神圖

提示詞四要素公式:主體・風格・構圖・細節,一句話從四不像變神圖

第 1 課你已經在 ChatGPT 裡生出了第一張圖,也知道生圖跟聊天用的是同一個對話框。但你大概也遇到了那個讓人洩氣的瞬間:同樣一句「幫我畫一隻貓」,別人截圖分享出來的是雜誌封面等級的作品,你生出來的卻是一隻眼睛歪掉、背景一團糊的東西。

先講結論,讓你安心:這不是你的帳號比較爛,也不是別人偷偷開了什麼隱藏設定。 差別幾乎只有一個——他把話講清楚了,你沒有。生圖模型不會讀心,你給它多少資訊,它就照多少資訊去畫;剩下沒講的部分,它只能亂猜,而亂猜的結果十次有九次不是你要的。

這堂課要給你的,是一個好記到不用背的公式:主體 + 風格 + 構圖 + 細節。四個格子填齊,你的提示詞就從「畫一隻貓」升級成 AI 真的接得住的完整指令。學會這一課,你之後每一次生圖的命中率都會不一樣。

這堂課適合誰 適合:想用中文描述把圖做出來、卻常常生出四不像的人(本課程屬新手指南專區)。需要基礎:零基礎 OK,只要你有 ChatGPT 帳號、跟著第 1 課生過至少一張圖。前置課:第 1 課(認識 ChatGPT 生圖介面)。

這堂學什麼

  • 四要素公式:主體、風格、構圖、細節——一個框架涵蓋一張好圖需要交代的所有事
  • 逐項拆解:每一項到底該回答什麼問題、可以填哪些具體的詞,附速查
  • 尺寸與比例:1:1、3:2、2:3 怎麼選,以及 2026 年 7 月 GPT Image 2 能做到的超寬、超高、2K 高解析
  • 進階技巧一:與其純描述,不如告訴 AI「這張圖要幹嘛」,它會自己補上合適的判斷
  • 進階技巧二:負面提示——怎麼跟 AI 說「不要出現什麼」,以及為什麼不能一次列一長串
  • 迭代心態:第一張永遠是草稿,用來回對話逼出理想版本,而不是一次到位

觀念一:四要素公式,一句話講齊

把生圖想成請一個超強但完全不認識你的插畫師幫忙。他技術頂尖,但你如果只丟一句「畫一隻貓」,他只能問一堆問題,或乾脆自己決定——而他決定的,通常不是你腦中那隻。四要素公式就是幫你一次把該交代的都交代完:

生圖提示詞四要素公式:主體加風格加構圖加細節,等於一張精準的好圖

  • 主體:畫什麼。這張圖的主角是誰、在做什麼、什麼情緒。
  • 風格:什麼調性。水彩、3D、動漫、寫實照片……決定整張圖的視覺語氣。
  • 構圖:怎麼取景。特寫還是全身、俯視還是平視、什麼比例。決定「鏡頭感」。
  • 細節:氛圍與質感。光線、色調、材質、背景元素——把畫面從「對」變成「好看」。

這四項不是硬規則,而是一份檢查清單。你不用每次都寫得落落長,但每次動手前心裡跑一遍:主體講清楚了嗎?風格指定了嗎?構圖交代了嗎?細節補上了嗎?光是這個習慣,就能擋掉八成的四不像。

觀念二:同樣要一隻貓,差在哪

把公式套進最經典的例子,你馬上看得出差距:

左邊模糊提示詞「畫一隻貓」讓 AI 亂猜出四不像,右邊四要素齊全的提示詞讓 AI 精準命中

壞例子「畫一隻貓」
→ 什麼貓?什麼風格?什麼場景?什麼氣氛?你沒說,AI 只能自己填空,結果自然跟你想的南轅北轍。
好例子「一隻橘色虎斑貓(主體),坐在窗邊曬太陽,水彩插畫風(風格),特寫、淺景深(構圖),溫暖午後陽光、毛髮蓬鬆(細節)。」

看出來了嗎?好例子並沒有用什麼專業術語,它只是把「橘色虎斑」「窗邊曬太陽」「水彩」「特寫」「午後陽光」這些你本來就會講的中文,補進四個格子裡而已。寫好提示詞的門檻不是英文、不是攝影知識,是願意把腦中的畫面描述完整。

觀念三:四要素逐一拆解

知道有四格還不夠,你得知道每一格該填什麼。這張速查表把每項要回答的問題和可以用的詞都列出來,寫的時候照著填就好:

四要素逐一拆解表:主體、風格、構圖、細節各自要回答的問題與可以填的詞

主體:畫什麼

回答三件事:是誰或什麼、在做什麼、什麼情緒。越具體越好。「一個人」很虛,「一位年輕女生對著鏡頭微笑、手拿咖啡」就立體多了。人數、年齡、動作、表情,能講就講。

風格:什麼調性

這是四要素裡最能決定成敗的一項。常見選項:扁平插畫、水彩、3D 渲染、皮克斯風、日系動漫、寫實照片、極簡線稿、賽博龐克……不確定要哪種沒關係,下一課會給你一份完整的風格速查表加可複製咒語。這堂先記得:一定要指定,別讓 AI 自己選。

構圖:怎麼取景

想像你手上有一台相機。要特寫還是全身?俯視、平視還是仰角?主體置中還是留白?直式還是橫式?要不要淺景深(背景模糊、主體突出)?這些決定畫面的「鏡頭感」,是業餘和專業的分水嶺。

細節:氛圍與質感

最後這一格負責把畫面從「對」推到「好看」。光線(逆光、暖光、清晨側光)、色調(莫蘭迪、高飽和、黑白)、材質(毛氈、金屬、水彩紙)、背景元素(乾淨純色、街景、書桌)。細節給得好,同一個主體的質感會差一個檔次。

觀念四:尺寸與比例怎麼選

圖要拿去哪裡用,比例就得對。ChatGPT 裡不用去哪個選單勾選,直接在提示詞裡講用途或比例即可,例如「做成限時動態的直式」或「1:1 正方形」。這是 2026 年 7 月的常用比例對照:

常用比例對照:1:1 正方形適合 IG 貼文、3:2 橫式適合 YouTube 縮圖、2:3 直式適合限動,超寬超高與 2K 交給 GPT Image 2

  • 1:1 正方形:IG 貼文、大頭貼、商品圖。最保險的萬用比例。
  • 3:2 橫式:橫幅、YouTube 縮圖、簡報封面、部落格題圖。
  • 2:3 直式:IG/FB 限時動態、手機海報、Pinterest。
2026 年 7 月現況ChatGPT 目前生圖用的是 GPT Image 2(gpt-image-2,2026 年 4 月上線、加入了推理能力的生圖模型,已接替早期的 DALL·E 與 GPT Image 1.5)。標準輸出就是上面三種比例;如果你需要超寬(到 3:1)、超高(到 1:3)或更高解析度(可達 2K),GPT Image 2 也吃得下,直接在提示裡講「做成超寬橫幅」「輸出高解析版本」即可。它還能在一次生成裡產出多張角色一致的圖,這個進階玩法第 4 課會專門講。

進階技巧一:告訴 AI「這張圖要幹嘛」

這是新手和老手最明顯的差距。比起把每個細節都描述死,更聰明的做法是告訴 AI 這張圖的用途,它會自己補上一堆你可能沒想到的判斷:

告訴 AI 這張圖要當 IG 貼文縮圖,它會自己預留標題空間、把比例抓成 1:1、把重點放中央

幫我做一張 IG 貼文縮圖,主題「三個提升專注力的方法」,
要有大標題空間、扁平插畫風、暖色、吸睛。

「IG 貼文縮圖」這五個字,等於一口氣告訴了 AI:比例要抓成適合貼文的正方形、要預留放大標題的空白區、重點要放中央抓住眼球。這些你不用一條一條寫,因為「縮圖」這個用途本身就隱含了這些需求,而 AI 懂。

同樣的道理:「做成餐廳菜單」它會留文字位、「當作 podcast 封面」它會做成正方形加標題感、「LINE 貼圖」它會給你留白背景和誇張表情。先想清楚這張圖要去哪裡用,再把用途講給 AI 聽,常常比你自己硬湊一堆形容詞還準。

進階技巧二:怎麼跟 AI 說「不要什麼」

有時候問題不是缺了什麼,而是多了你不要的東西——圖上冒出一串亂碼文字、多了一隻手、加了莫名其妙的浮水印。這時候你需要「負面提示」,也就是明確講出不要出現什麼:

一杯拿鐵放在木桌上,寫實照片風,俯視構圖,自然光。
不要出現文字、不要浮水印、背景不要有其他杯子。

這裡有兩個關鍵,和某些生圖工具(例如 Stable Diffusion)不一樣:

  1. ChatGPT 沒有獨立的「負面提示欄位」。 你要把不要的東西直接寫在同一句提示詞裡,用「不要出現○○」的講法。
  2. 負面條件控制在 2 到 4 個就好。 一次列一長串「不要這、不要那」,反而會分散模型的注意力,結果更糟。挑最容易出包的來擋就好——畫人物就擋「多餘的手指」、做場景就擋「亂入的文字」、混風格就擋「風格混雜」。

手把手實戰:用公式生一張圖

觀念講完,實際跑一遍。假設你要幫一篇談「早晨習慣」的文章做題圖。

先在心裡填四格

動手打字前,先把四要素想過一遍,別急著打:

  • 主體:一個人在窗邊喝咖啡看書
  • 風格:溫暖的扁平插畫
  • 構圖:橫式、中景、主體偏左留出標題空間
  • 細節:清晨柔和側光、莫蘭迪色調、乾淨的居家背景

這一步花不到三十秒,卻決定了接下來的成敗。

把四格串成一句話丟給 ChatGPT

打開 ChatGPT,直接在對話框輸入(或用第 1 課教的方式指定要生圖):

幫我做一張部落格題圖,橫式 3:2。
一位年輕人坐在窗邊,一手拿咖啡一手拿書,神情放鬆(主體);
溫暖的扁平插畫風(風格);中景、主體偏左、右側留出放標題的空間(構圖);
清晨柔和側光、莫蘭迪色調、乾淨的居家背景(細節)。
不要出現文字、不要浮水印。

注意我把「部落格題圖」這個用途也講了,讓 AI 順便幫忙判斷排版。

看第一張,但別急著接受

第一張出來了。它大概方向對、細節不完全。這很正常——第一張永遠是草稿,不是成品。 你的工作是看著它,找出「哪裡不對」,然後用下一步修。

用對話微調,逼出好版本

不要重寫整段提示詞,直接接著對話講你要改的地方:

主體再大一點、光線再暖一點,右側的留白再多一些,
書換成筆電。

ChatGPT 會在原本那張的基礎上調整,而不是從零重畫。改個兩三輪,你就會逼出滿意的版本。

這套「生草稿 → 下微調指令 → 重生一版 → 滿意就定稿」的來回,才是生圖的真正日常:

迭代循環:生第一張草稿、下微調指令、AI 重生一版、滿意就定稿,不滿意就回到微調那步

額度提醒(2026 年 7 月)每次「重生」都算一次生圖,會吃額度。免費帳號目前大約每 24 小時只有 2 到 3 張,很快就見底;想認真練生圖、需要一直來回微調,ChatGPT Plus($20 / 月,約每 3 小時 50 張)會順很多。方案階梯目前是 Free($0)、Go($8)、Plus($20)、Pro($200)。新手先用免費額度把公式練熟,真的要量產再升級。

常見坑

坑 1:提示詞明明很長,圖還是很糊、很亂

很多人以為提示詞越長越好,於是塞了一大串形容詞,結果 AI 反而抓不到重點。問題通常不是「講太少」,而是主體不只一個。「一隻貓、一隻狗、一隻兔子在森林裡開派對,旁邊有城堡和彩虹和熱氣球」——元素太多,AI 會顧此失彼。解法:一張圖抓 1 到 2 個核心主體就好,其他當背景輕描淡寫帶過。想要豐富場景,寧可分成幾張圖各自生。

坑 2:出現「This request may not follow our content policy」或 AI 回你「I wasn't able to generate that image」

這是內容政策擋下來了。常見地雷:指名真實名人的臉、有版權的卡通角色(米老鼠、寶可夢)、品牌 logo、暴力或成人內容。解法:把敏感的部分改成描述性的講法——不要寫「畫一個像某某明星的人」,改成「一位三十歲、短髮、戴圓框眼鏡的男性」;不要指名卡通角色,改描述你要的特徵。改完再送一次通常就過了。

坑 3:圖上的中文字變成亂碼、缺筆畫

想在圖裡放中文標題,結果 AI 生出來的字歪七扭八、根本不是字。這是目前所有生圖模型共同的弱點,中文尤其嚴重。解法有兩個:一是文字盡量短(幾個字比一整句成功率高),並在提示裡明講「文字要清晰正確」;二是更保險的做法——讓 AI 只生圖、留白,文字之後用 Canva 之類的工具自己疊上去。 第 6 課會示範這個實戰流程。

坑 4:每次重生,貓的花色/人的長相都不一樣

你生了一張很滿意的角色,想讓它換個姿勢再來一張,結果重生後根本變成另一隻貓。這是因為每次生成本質上都是「重新想像」,不會自動記住上一張的長相。這在做系列圖、繪本、品牌吉祥物時是大魔王。這一課先知道有這回事就好——維持角色一致性是一門專門的技術,第 4 課會整堂課教你怎麼鎖住同一個角色。

坑 5:比例講了卻沒生效

你寫了「16:9」,出來卻還是接近正方形。原因是 ChatGPT 標準輸出的三種比例是 1:1、3:2、2:3,你講的比例它會抓「最接近的那個」。16:9 會被靠到 3:2、9:16 會被靠到 2:3,通常夠用。真的需要精準的超寬或超高比例(像 3:1 橫幅),就明講「做成超寬橫幅、盡量接近 3:1」,交給 GPT Image 2 處理。

作業

  1. 套公式重寫:拿你之前生過、覺得不滿意的一句提示詞,用四要素公式重寫一遍,四格都填齊,再生一次。前後對照,感受差距。
  2. 練指定用途:選一個真實用途(你的 IG 大頭貼、一張簡報封面、一個 LINE 群組頭圖),只講用途加基本主體,看 AI 自己補了哪些判斷。
  3. 練來回微調:從一張草稿開始,用純對話的方式(「再暖一點」「主體再大」「換個角度」)連續微調至少三輪,把「改 → 重生 → 再改」變成肌肉記憶。
  4. 踩一次負面提示:生一張容易出現多餘元素的圖(例如有人物的場景),故意不加負面提示生一次,再加上「不要出現文字、不要多餘的手」生一次,比較兩張。

下一課預告

這堂課我們一直說「風格」是四要素裡最能決定成敗的一項,但也一直把它跳過——因為它值得一整堂課。第 3 課給你一份風格速查表加可直接複製的咒語:皮克斯、吉卜力、水彩、3D 渲染、極簡線稿、賽博龐克、蒸氣波……你想要哪種畫風,一句話就能召喚出來,再也不用對著空白對話框想「那種感覺到底叫什麼」。把這課的公式練熟,下一課我們就來把「風格」這一格,從你最卡的地方變成你最強的武器。

#ChatGPT#提示詞#AI 生圖#GPT Image

← 回所有文章