精華筆記

· @aihub.tw

AI Agent 入門

綜合實戰:託付一個多步驟真實任務

綜合實戰:託付一個多步驟真實任務

前六課給你的是工具和觀念:Agent 的執行迴圈、工具呼叫、多代理協作、記憶限制、授權安全。現在問題來了——真正要把一件真實工作交出去,你要從哪裡開始?說什麼、怎麼說、盯到什麼程度、最後怎麼確認做好了?

很多人卡在這裡。不是因為不懂 Agent,而是因為「說清楚一件事」本身就很難。你說「幫我做市場調研」,Agent 可能回來一份抄 Wikipedia 的流水帳;你說「幫我整理這些資料」,它整理的角度跟你想要的差了十萬八千里。

這堂課就解決這個問題。我們用一個真實任務——「調研 2026 年台灣可用的 AI 寫作工具,整理成一份可以給同事看的比較報告」——從頭到尾完整走一遍:怎麼寫任務書、怎麼啟動、怎麼中途監督、驗收標準是什麼,以及任務出錯時怎麼收拾。

這堂課適合誰 適合:學完前六課、想把真實工作任務正式委派給 Agent 的人(本課程屬進階應用專區)。需要基礎:安裝過 Claude Code、體驗過基本操作(第 3 課內容)。前置課:第 1~6 課。不需要寫程式。

這堂學什麼

  • 任務書的三要素:說清楚目標、限制、驗收標準
  • 多步驟任務的完整 walkthrough(調研→整理→報告)
  • 中途監督的節奏:什麼時候插手、什麼時候放手
  • 驗收成果的具體方法
  • 失敗處理:任務到一半卡住或跑偏怎麼辦
  • 六個最常踩的坑與具體解法

觀念一:任務書的三要素

委派任務給 Agent 和委派任務給人類員工,本質上是同一件事——你說得愈清楚,做出來的結果愈接近你要的。差別在於:人類遇到模糊地帶會主動問你或自己補充常識,Agent 要嘛問到煩、要嘛自己腦補然後跑偏。

好的任務書包含三個層次:

任務書三要素結構圖:目標、限制、驗收標準三層堆疊

層次一:目標(我要什麼) 不只說「幫我調研 AI 工具」,而是說清楚:

  • 產出物是什麼格式(Markdown 報告、Excel 表格、Notion 頁面?)
  • 給誰看(給自己參考?給主管決策?給客戶提案?)
  • 深度要到什麼程度(一頁摘要?詳細功能比較?)

層次二:限制(不能做什麼)

  • 素材來源:限定查哪些地方?不要引用哪類來源?
  • 不能做的操作:不要刪任何本機檔案、不要傳送任何 email

層次三:驗收標準(怎麼算做好了)

  • 至少要涵蓋幾個工具?每個工具要比較哪幾個維度?
  • 報告長度範圍?有沒有你特別想知道的問題?

三個層次都說清楚,任務跑偏的機率大幅下降。你不需要告訴 Agent 怎麼做,但你必須說清楚做到什麼程度算完成。


觀念二:監督節奏——什麼時候插手

Agent 監督策略決策樹:用三個問題判斷什麼時候必須插手

不是每個步驟都要盯著看——那樣你會累死,而且 Agent 就沒有存在的意義了。判斷的原則很簡單:

  • 不可逆操作:刪檔案、寄信、送出表單、發布文章——執行前必須讓你確認
  • 影響外部系統:寫入資料庫、呼叫有費用的 API、傳送訊息——插手
  • 純讀取或純生成:搜尋、閱讀、摘要、寫草稿——可以放手,設一個「完成後回報」的時間點

實際操作中,你要在 prompt 裡主動設「回報點」,不要等 Agent 自己決定要不要告訴你進度。


手把手實戰:調研 + 整理 + 產出報告

我們用這個任務走完整個流程:「幫我調研 2026 年台灣可以用的 AI 寫作輔助工具,整理功能與價格,產出一份給不懂技術的主管看的 Markdown 比較報告。」

綜合實戰完整任務流程:寫任務書、列計畫、自主執行、回報驗收、修正迭代

步驟一:寫任務書,貼進 Claude Code

先在電腦建一個工作資料夾,例如 ~/Desktop/ai-tool-research/。進到這個資料夾開 Claude Code:

cd ~/Desktop/ai-tool-research
claude

然後貼上完整任務書:

我要你幫我完成一份 AI 寫作工具比較報告。

【目標】
- 調研 2026 年在台灣可以使用的 AI 寫作輔助工具
- 重點工具至少包含:ChatGPT、Claude.ai、Gemini、Notion AI、Jasper、Copy.ai(如有更新的重要工具也可加入)
- 產出一份 Markdown 格式的比較報告,檔名 ai-writing-tools-2026.md
- 讀者是不懂技術的主管,用語要平易近人,避免過多技術術語

【每個工具要比較的維度】
1. 定價(免費方案/付費方案,換算台幣標示)
2. 中文支援程度(流暢/可用/差)
3. 適合的使用情境(各寫兩句具體說明)
4. 最大缺點或限制(誠實說,不要只說優點)

【限制】
- 只使用網路搜尋查證,不要引用 Wikipedia 或知乎
- 不要修改或刪除這個資料夾裡現有的任何檔案
- 不要傳送任何 email 或訊息

【驗收標準】
- 報告開頭要有一段 150 字以內的摘要,說明「選哪個工具最划算」
- 每個工具要有獨立的章節
- 有比較表格(工具 × 維度)
- 全文不超過 3,000 字

【執行前請先列出你的計畫給我確認,我同意後再開始。】

注意最後那句「執行前先列計畫」是硬性要求。這讓你在 Agent 動手前看一眼它打算怎麼做、用哪些工具、分幾個階段。

步驟二:審核 Agent 的計畫

Claude Code 會回傳一份計畫,大致像這樣:

好的,這是我的執行計畫:

階段 1(搜尋與資料蒐集):
- 分別搜尋 ChatGPT、Claude.ai、Gemini、Notion AI、Jasper、Copy.ai 的 2026 年最新定價
- 搜尋台灣使用者的中文支援實測評價

階段 2(整理分析):
- 把蒐集到的資料依比較維度分類
- 換算美元→台幣(匯率約 32.5)

階段 3(撰寫報告):
- 先寫比較表格
- 各工具獨立章節
- 最後寫摘要

預計工具呼叫:web_search(約 10~15 次)、write_file
不會存取或修改資料夾內現有檔案。

確認後即開始。

這個環節你要看的東西:

  • 工具清單對不對:有沒有要動你不希望它動的東西?
  • 分階段結構合不合理:有沒有明顯漏掉的步驟?
  • 範圍對不對:它理解的任務跟你的意圖一致嗎?

如果計畫看起來合理,直接回「開始吧」。如果有問題,這裡就糾正:「Jasper 是美國工具,台灣比較少人用,可以換成 Writesonic 或 Gamma。」現在糾正成本最低。

步驟三:讓 Agent 自主執行,設好你的監督節奏

Agent 開始跑之後,你不需要一直盯著。但不代表完全不管——建議的監督節奏:

前 2~3 分鐘看著它:觀察它的搜尋查詢用的關鍵字合不合理。如果它搜「AI writing tools list 2025」(舊年份),直接插嘴:「搜尋時間範圍改成 2026。」

中間放手讓它跑:它在讀頁面、整理資料、起草內容的階段,你不需要管它,去做別的事。

設一個心理的回報點:大概 10~15 分鐘後如果它還沒完成,可以問一句:「目前進度如何?有遇到什麼問題嗎?」

Claude Code 執行過程中如果遇到模糊情況,它會自動停下來問你——這是設計好的正常行為,不是故障。直接回答它的問題即可。

放手的條件 能放手的任務條件:純資訊讀取+寫到本機檔案。不能放手的情況:涉及外部系統的寫入(例如你叫它順便把報告發 email 給主管——那個「發送」動作要你親自確認)。

步驟四:用驗收標準逐條檢查

Agent 說「完成了」,你打開 ai-writing-tools-2026.md,照著你一開始寫的驗收標準逐條對:

驗收清單:
□ 開頭有 150 字以內的摘要,有「選哪個最划算」的建議?
□ 六個工具各有獨立章節?
□ 有比較表格?
□ 每個工具都寫了缺點?(不只寫優點)
□ 定價有換算台幣?
□ 全文在 3,000 字以內?
□ 有沒有明顯的錯誤資訊?(抽查 1~2 個工具的定價,自己查一下對不對)

驗收流程示意圖:報告對照六項驗收清單,數字抽查最關鍵

最後那條「自己抽查」很重要。Agent 查到的定價或功能說明可能有誤——不是因為它在說謊,而是網路上的資訊本來就有錯誤和過時的內容。你是最終把關者,不是 Agent。

如果有不滿意的地方,直接說:「第三章 Jasper 的價格換算錯了,應該是月費 US$39,換算台幣約 1,270 元。另外 Notion AI 那段沒有說清楚台灣用戶要不要額外付費,請補充。」Agent 會針對你說的地方修正,不用整份重來。

步驟五:失敗了怎麼辦

如果 Agent 回來的東西和你期望差很遠(不是小細節錯,是整個方向跑偏),不要急著重新跑全部。先問診:

診斷型 prompt:

我看了報告覺得有問題。問你幾個問題:
1. 你搜尋時用了哪些關鍵字?
2. 你查了哪幾個頁面的資料?
3. 定價資訊是從哪裡來的?

請一條一條回答,我要確認問題出在哪裡再決定怎麼修。

這個技巧很有用——往往問下去才發現:搜尋關鍵字太寬泛、讀到的是舊文章、或者根本沒去查某個工具的官網。

找到問題後針對那個環節重做:「定價部分重新查一遍,每個工具都直接去官網確認,逐一列出原始資料給我看,再更新報告數字。」


常見坑

下面六個坑是委派任務時最容易翻車的地方。先看這張總覽,再逐一拆解症狀與解法:

六個最常踩的坑與解法對照表

坑 1:任務描述太短,Agent 自己填空

症狀:你說「幫我做 AI 工具比較」,Agent 回來的報告和你心裡想的完全是兩回事——比較維度不對、深度不夠、格式你不喜歡。

解法:不存在「更好的 AI 讀心術」。根本解法就是把任務書寫完整,參考本課的三要素結構:目標、限制、驗收標準。花 5 分鐘寫清楚任務書,省下 30 分鐘修改。


坑 2:中途出現 Error: Context length exceeded

Error: This task requires more context than available.
The conversation history is too long to continue.

這表示 Agent 的上下文視窗用完了——它在任務中途「失憶」了。通常發生在任務很長、搜了很多頁面資料、或者你和它對話了很多輪之後。

解法:不要繼續在同一個對話裡硬撐。開新的 Claude Code session,然後這樣說:

我在做一個 AI 寫作工具比較報告的任務。目前已完成的部分我存在 partial-report.md,請你讀這個檔案,然後繼續完成剩下的部分:
[列出還沒完成的工作]

把已完成的部分存成檔案,當作新 session 的起點——這是第 5 課說的「外部記憶補救法」在實戰中的直接應用。


坑 3:Agent 說「完成了」但輸出的資訊是錯的

症狀:報告裡 ChatGPT Plus 的定價寫成每月 NT$950,但實際上是 US$20(約 NT$650)。或者某個工具的功能描述和官網完全不符。

Agent 不會說「我不確定這條資訊的正確性」——它會以正常語氣陳述。這不是 bug,這是所有 LLM 的基本特性。

解法有兩層:

  1. 事前:在任務書裡加一句「定價資訊請直接從各工具官網查,並標示你查到的來源頁面」,這樣萬一有錯你知道去哪裡核對。
  2. 事後:驗收時對關鍵數字做抽查,把官網網址貼給它讓它自己去核實。

坑 4:任務跑到一半 Agent 突然停下來,什麼也不說

症狀:對話視窗停住了,沒有錯誤訊息,但也沒有繼續動作。等了兩分鐘還是沒反應。

可能原因有幾個:網路請求 timeout、工具呼叫回傳空白結果、或者 Claude Code 在等你的輸入但你沒看到提示。

解法:先按 Enter 或輸入「繼續」,看它有沒有反應。還是沒有的話輸入「目前進度如何?遇到什麼問題嗎?」讓它回報狀態。如果它說某個搜尋「沒有結果」,幫它換個關鍵字:「試試搜尋 'Jasper AI 訂閱方案 2026' 或直接到 jasper.ai 查。」


坑 5:每次任務都跑很久,等到你不耐煩

症狀:調研六個工具,Agent 搜了十幾次、每次都要等、整個任務花了 40 分鐘。你坐在那邊等得很焦慮。

原因:你沒有讓 Agent 聰明分配工作——每個工具都做了一樣深的調查,但有些工具其實你只需要知道定價而已。

解法:在任務書裡區分工作深度:「重點深挖 ChatGPT 和 Claude.ai,其他四個工具只需要定價和一句話描述即可。」讓 Agent 知道把時間花在哪裡。另外:多步驟任務不要在你很忙的時間點丟,丟完去做別的事,等 Agent 通知你完成。


坑 6:你修改了幾輪之後,報告愈改愈亂,前後矛盾

症狀:你叫它改了開頭摘要,但摘要和後面表格的數字對不上;或者你叫它補充 Notion AI 的說明,但補充的內容和前面章節說的不一致。

原因:每次修改 Agent 只看到你最近的指令和當前的文件,但如果對話輪數多了,它對整份文件的全域理解會退化。

解法:每次大改之前,先叫它做一件事:

修改前,先把目前報告裡各工具的定價數字列一遍給我確認,確保你知道目前的資料狀態。然後再開始修改。

讓它「讀一遍確認現狀」再下手,能避免改了前面忘了後面的問題。如果改了很多輪還是亂掉,最好的辦法是:把現在的版本存為 v2.md,開新 session,以這個檔案為基礎重新下清楚的修改指令。


你的任務:把一件真實工作交出去

用這堂課學到的結構,選一個你真實工作裡的多步驟任務,完整執行一遍。推薦難度由低到高的三個選項:

選項 A(入門):調研你工作領域的某個工具/產品,產出比較報告。格式和本課的 AI 工具報告一樣,換成你關心的主題。

選項 B(中階):找一堆你手上的資料(客戶名單、產品規格、活動報名表),寫任務書讓 Agent 整理成你需要的格式,驗收後存成乾淨的檔案。

選項 C(進階):把本課的五個步驟完整走一遍,記錄 Agent 中途問了你什麼問題、你的答案是什麼、最終花了多少時間。把這份「執行記錄」和最終報告一起儲存,作為下次做類似任務的 SOP 參考。

做的過程中,把你碰到但本課沒有提到的坑記下來——那就是你自己的第 8 堂課。


這一課結束了,整個課程也結束了

你從第 1 課學了「Agent 是什麼」——它能自己想步驟、動手執行、看結果、再調整。第 2 課學了工具呼叫是 Agent 的手。第 3 課親自開了 Claude Code 做了真實的事。第 4 課看了多代理怎麼分工協作。第 5 課理解了記憶的限制和補救方式。第 6 課把授權和安全的邊界設好。

這一課是把以上全部整合起來用一次。

整個課程地圖:前六課打底、第七課整合實戰、兩條進階路徑

但這套課程的邊界在這裡:你學的是「委派任務給現成 Agent」。如果你想更進一步——

想讓 Agent 連接你自己的工具和資料來源(直接讀公司 CRM、操作自己的資料庫):那是 MCP 課的範疇。MCP(Model Context Protocol)是 Anthropic 推出的標準,讓 Agent 能接上幾乎任何外部服務。

想從零打造客製化 Agent:那是 Agent 開發課。你會學到用 Anthropic API 設計工具呼叫、寫 system prompt、串接外部工具。

現在你已經知道 Agent 能做什麼、怎麼思考、會在哪裡出錯。帶著這個理解去做後續課程,你不會只是複製貼上——你會知道每個設計決策背後的為什麼。

#AI Agent#Claude Code#綜合實戰#任務委派#非工程師

← 回所有文章