綜合實戰:託付一個多步驟真實任務
前六課給你的是工具和觀念:Agent 的執行迴圈、工具呼叫、多代理協作、記憶限制、授權安全。現在問題來了——真正要把一件真實工作交出去,你要從哪裡開始?說什麼、怎麼說、盯到什麼程度、最後怎麼確認做好了?
很多人卡在這裡。不是因為不懂 Agent,而是因為「說清楚一件事」本身就很難。你說「幫我做市場調研」,Agent 可能回來一份抄 Wikipedia 的流水帳;你說「幫我整理這些資料」,它整理的角度跟你想要的差了十萬八千里。
這堂課就解決這個問題。我們用一個真實任務——「調研 2026 年台灣可用的 AI 寫作工具,整理成一份可以給同事看的比較報告」——從頭到尾完整走一遍:怎麼寫任務書、怎麼啟動、怎麼中途監督、驗收標準是什麼,以及任務出錯時怎麼收拾。
這堂學什麼
- 任務書的三要素:說清楚目標、限制、驗收標準
- 多步驟任務的完整 walkthrough(調研→整理→報告)
- 中途監督的節奏:什麼時候插手、什麼時候放手
- 驗收成果的具體方法
- 失敗處理:任務到一半卡住或跑偏怎麼辦
- 六個最常踩的坑與具體解法
觀念一:任務書的三要素
委派任務給 Agent 和委派任務給人類員工,本質上是同一件事——你說得愈清楚,做出來的結果愈接近你要的。差別在於:人類遇到模糊地帶會主動問你或自己補充常識,Agent 要嘛問到煩、要嘛自己腦補然後跑偏。
好的任務書包含三個層次:

層次一:目標(我要什麼) 不只說「幫我調研 AI 工具」,而是說清楚:
- 產出物是什麼格式(Markdown 報告、Excel 表格、Notion 頁面?)
- 給誰看(給自己參考?給主管決策?給客戶提案?)
- 深度要到什麼程度(一頁摘要?詳細功能比較?)
層次二:限制(不能做什麼)
- 素材來源:限定查哪些地方?不要引用哪類來源?
- 不能做的操作:不要刪任何本機檔案、不要傳送任何 email
層次三:驗收標準(怎麼算做好了)
- 至少要涵蓋幾個工具?每個工具要比較哪幾個維度?
- 報告長度範圍?有沒有你特別想知道的問題?
三個層次都說清楚,任務跑偏的機率大幅下降。你不需要告訴 Agent 怎麼做,但你必須說清楚做到什麼程度算完成。
觀念二:監督節奏——什麼時候插手

不是每個步驟都要盯著看——那樣你會累死,而且 Agent 就沒有存在的意義了。判斷的原則很簡單:
- 不可逆操作:刪檔案、寄信、送出表單、發布文章——執行前必須讓你確認
- 影響外部系統:寫入資料庫、呼叫有費用的 API、傳送訊息——插手
- 純讀取或純生成:搜尋、閱讀、摘要、寫草稿——可以放手,設一個「完成後回報」的時間點
實際操作中,你要在 prompt 裡主動設「回報點」,不要等 Agent 自己決定要不要告訴你進度。
手把手實戰:調研 + 整理 + 產出報告
我們用這個任務走完整個流程:「幫我調研 2026 年台灣可以用的 AI 寫作輔助工具,整理功能與價格,產出一份給不懂技術的主管看的 Markdown 比較報告。」

步驟一:寫任務書,貼進 Claude Code
先在電腦建一個工作資料夾,例如 ~/Desktop/ai-tool-research/。進到這個資料夾開 Claude Code:
cd ~/Desktop/ai-tool-research
claude
然後貼上完整任務書:
我要你幫我完成一份 AI 寫作工具比較報告。
【目標】
- 調研 2026 年在台灣可以使用的 AI 寫作輔助工具
- 重點工具至少包含:ChatGPT、Claude.ai、Gemini、Notion AI、Jasper、Copy.ai(如有更新的重要工具也可加入)
- 產出一份 Markdown 格式的比較報告,檔名 ai-writing-tools-2026.md
- 讀者是不懂技術的主管,用語要平易近人,避免過多技術術語
【每個工具要比較的維度】
1. 定價(免費方案/付費方案,換算台幣標示)
2. 中文支援程度(流暢/可用/差)
3. 適合的使用情境(各寫兩句具體說明)
4. 最大缺點或限制(誠實說,不要只說優點)
【限制】
- 只使用網路搜尋查證,不要引用 Wikipedia 或知乎
- 不要修改或刪除這個資料夾裡現有的任何檔案
- 不要傳送任何 email 或訊息
【驗收標準】
- 報告開頭要有一段 150 字以內的摘要,說明「選哪個工具最划算」
- 每個工具要有獨立的章節
- 有比較表格(工具 × 維度)
- 全文不超過 3,000 字
【執行前請先列出你的計畫給我確認,我同意後再開始。】
注意最後那句「執行前先列計畫」是硬性要求。這讓你在 Agent 動手前看一眼它打算怎麼做、用哪些工具、分幾個階段。
步驟二:審核 Agent 的計畫
Claude Code 會回傳一份計畫,大致像這樣:
好的,這是我的執行計畫:
階段 1(搜尋與資料蒐集):
- 分別搜尋 ChatGPT、Claude.ai、Gemini、Notion AI、Jasper、Copy.ai 的 2026 年最新定價
- 搜尋台灣使用者的中文支援實測評價
階段 2(整理分析):
- 把蒐集到的資料依比較維度分類
- 換算美元→台幣(匯率約 32.5)
階段 3(撰寫報告):
- 先寫比較表格
- 各工具獨立章節
- 最後寫摘要
預計工具呼叫:web_search(約 10~15 次)、write_file
不會存取或修改資料夾內現有檔案。
確認後即開始。
這個環節你要看的東西:
- 工具清單對不對:有沒有要動你不希望它動的東西?
- 分階段結構合不合理:有沒有明顯漏掉的步驟?
- 範圍對不對:它理解的任務跟你的意圖一致嗎?
如果計畫看起來合理,直接回「開始吧」。如果有問題,這裡就糾正:「Jasper 是美國工具,台灣比較少人用,可以換成 Writesonic 或 Gamma。」現在糾正成本最低。
步驟三:讓 Agent 自主執行,設好你的監督節奏
Agent 開始跑之後,你不需要一直盯著。但不代表完全不管——建議的監督節奏:
前 2~3 分鐘看著它:觀察它的搜尋查詢用的關鍵字合不合理。如果它搜「AI writing tools list 2025」(舊年份),直接插嘴:「搜尋時間範圍改成 2026。」
中間放手讓它跑:它在讀頁面、整理資料、起草內容的階段,你不需要管它,去做別的事。
設一個心理的回報點:大概 10~15 分鐘後如果它還沒完成,可以問一句:「目前進度如何?有遇到什麼問題嗎?」
Claude Code 執行過程中如果遇到模糊情況,它會自動停下來問你——這是設計好的正常行為,不是故障。直接回答它的問題即可。
步驟四:用驗收標準逐條檢查
Agent 說「完成了」,你打開 ai-writing-tools-2026.md,照著你一開始寫的驗收標準逐條對:
驗收清單:
□ 開頭有 150 字以內的摘要,有「選哪個最划算」的建議?
□ 六個工具各有獨立章節?
□ 有比較表格?
□ 每個工具都寫了缺點?(不只寫優點)
□ 定價有換算台幣?
□ 全文在 3,000 字以內?
□ 有沒有明顯的錯誤資訊?(抽查 1~2 個工具的定價,自己查一下對不對)

最後那條「自己抽查」很重要。Agent 查到的定價或功能說明可能有誤——不是因為它在說謊,而是網路上的資訊本來就有錯誤和過時的內容。你是最終把關者,不是 Agent。
如果有不滿意的地方,直接說:「第三章 Jasper 的價格換算錯了,應該是月費 US$39,換算台幣約 1,270 元。另外 Notion AI 那段沒有說清楚台灣用戶要不要額外付費,請補充。」Agent 會針對你說的地方修正,不用整份重來。
步驟五:失敗了怎麼辦
如果 Agent 回來的東西和你期望差很遠(不是小細節錯,是整個方向跑偏),不要急著重新跑全部。先問診:
診斷型 prompt:
我看了報告覺得有問題。問你幾個問題:
1. 你搜尋時用了哪些關鍵字?
2. 你查了哪幾個頁面的資料?
3. 定價資訊是從哪裡來的?
請一條一條回答,我要確認問題出在哪裡再決定怎麼修。
這個技巧很有用——往往問下去才發現:搜尋關鍵字太寬泛、讀到的是舊文章、或者根本沒去查某個工具的官網。
找到問題後針對那個環節重做:「定價部分重新查一遍,每個工具都直接去官網確認,逐一列出原始資料給我看,再更新報告數字。」
常見坑
下面六個坑是委派任務時最容易翻車的地方。先看這張總覽,再逐一拆解症狀與解法:

坑 1:任務描述太短,Agent 自己填空
症狀:你說「幫我做 AI 工具比較」,Agent 回來的報告和你心裡想的完全是兩回事——比較維度不對、深度不夠、格式你不喜歡。
解法:不存在「更好的 AI 讀心術」。根本解法就是把任務書寫完整,參考本課的三要素結構:目標、限制、驗收標準。花 5 分鐘寫清楚任務書,省下 30 分鐘修改。
坑 2:中途出現 Error: Context length exceeded
Error: This task requires more context than available.
The conversation history is too long to continue.
這表示 Agent 的上下文視窗用完了——它在任務中途「失憶」了。通常發生在任務很長、搜了很多頁面資料、或者你和它對話了很多輪之後。
解法:不要繼續在同一個對話裡硬撐。開新的 Claude Code session,然後這樣說:
我在做一個 AI 寫作工具比較報告的任務。目前已完成的部分我存在 partial-report.md,請你讀這個檔案,然後繼續完成剩下的部分:
[列出還沒完成的工作]
把已完成的部分存成檔案,當作新 session 的起點——這是第 5 課說的「外部記憶補救法」在實戰中的直接應用。
坑 3:Agent 說「完成了」但輸出的資訊是錯的
症狀:報告裡 ChatGPT Plus 的定價寫成每月 NT$950,但實際上是 US$20(約 NT$650)。或者某個工具的功能描述和官網完全不符。
Agent 不會說「我不確定這條資訊的正確性」——它會以正常語氣陳述。這不是 bug,這是所有 LLM 的基本特性。
解法有兩層:
- 事前:在任務書裡加一句「定價資訊請直接從各工具官網查,並標示你查到的來源頁面」,這樣萬一有錯你知道去哪裡核對。
- 事後:驗收時對關鍵數字做抽查,把官網網址貼給它讓它自己去核實。
坑 4:任務跑到一半 Agent 突然停下來,什麼也不說
症狀:對話視窗停住了,沒有錯誤訊息,但也沒有繼續動作。等了兩分鐘還是沒反應。
可能原因有幾個:網路請求 timeout、工具呼叫回傳空白結果、或者 Claude Code 在等你的輸入但你沒看到提示。
解法:先按 Enter 或輸入「繼續」,看它有沒有反應。還是沒有的話輸入「目前進度如何?遇到什麼問題嗎?」讓它回報狀態。如果它說某個搜尋「沒有結果」,幫它換個關鍵字:「試試搜尋 'Jasper AI 訂閱方案 2026' 或直接到 jasper.ai 查。」
坑 5:每次任務都跑很久,等到你不耐煩
症狀:調研六個工具,Agent 搜了十幾次、每次都要等、整個任務花了 40 分鐘。你坐在那邊等得很焦慮。
原因:你沒有讓 Agent 聰明分配工作——每個工具都做了一樣深的調查,但有些工具其實你只需要知道定價而已。
解法:在任務書裡區分工作深度:「重點深挖 ChatGPT 和 Claude.ai,其他四個工具只需要定價和一句話描述即可。」讓 Agent 知道把時間花在哪裡。另外:多步驟任務不要在你很忙的時間點丟,丟完去做別的事,等 Agent 通知你完成。
坑 6:你修改了幾輪之後,報告愈改愈亂,前後矛盾
症狀:你叫它改了開頭摘要,但摘要和後面表格的數字對不上;或者你叫它補充 Notion AI 的說明,但補充的內容和前面章節說的不一致。
原因:每次修改 Agent 只看到你最近的指令和當前的文件,但如果對話輪數多了,它對整份文件的全域理解會退化。
解法:每次大改之前,先叫它做一件事:
修改前,先把目前報告裡各工具的定價數字列一遍給我確認,確保你知道目前的資料狀態。然後再開始修改。
讓它「讀一遍確認現狀」再下手,能避免改了前面忘了後面的問題。如果改了很多輪還是亂掉,最好的辦法是:把現在的版本存為 v2.md,開新 session,以這個檔案為基礎重新下清楚的修改指令。
你的任務:把一件真實工作交出去
用這堂課學到的結構,選一個你真實工作裡的多步驟任務,完整執行一遍。推薦難度由低到高的三個選項:
選項 A(入門):調研你工作領域的某個工具/產品,產出比較報告。格式和本課的 AI 工具報告一樣,換成你關心的主題。
選項 B(中階):找一堆你手上的資料(客戶名單、產品規格、活動報名表),寫任務書讓 Agent 整理成你需要的格式,驗收後存成乾淨的檔案。
選項 C(進階):把本課的五個步驟完整走一遍,記錄 Agent 中途問了你什麼問題、你的答案是什麼、最終花了多少時間。把這份「執行記錄」和最終報告一起儲存,作為下次做類似任務的 SOP 參考。
做的過程中,把你碰到但本課沒有提到的坑記下來——那就是你自己的第 8 堂課。
這一課結束了,整個課程也結束了
你從第 1 課學了「Agent 是什麼」——它能自己想步驟、動手執行、看結果、再調整。第 2 課學了工具呼叫是 Agent 的手。第 3 課親自開了 Claude Code 做了真實的事。第 4 課看了多代理怎麼分工協作。第 5 課理解了記憶的限制和補救方式。第 6 課把授權和安全的邊界設好。
這一課是把以上全部整合起來用一次。

但這套課程的邊界在這裡:你學的是「委派任務給現成 Agent」。如果你想更進一步——
想讓 Agent 連接你自己的工具和資料來源(直接讀公司 CRM、操作自己的資料庫):那是 MCP 課的範疇。MCP(Model Context Protocol)是 Anthropic 推出的標準,讓 Agent 能接上幾乎任何外部服務。
想從零打造客製化 Agent:那是 Agent 開發課。你會學到用 Anthropic API 設計工具呼叫、寫 system prompt、串接外部工具。
現在你已經知道 Agent 能做什麼、怎麼思考、會在哪裡出錯。帶著這個理解去做後續課程,你不會只是複製貼上——你會知道每個設計決策背後的為什麼。