精華筆記

· @aihub.tw

AI Agent 入門

Agent 是什麼:會自己動手的 AI

Agent 是什麼:會自己動手的 AI

你已經用 ChatGPT 或 Claude 聊了一陣子了。你知道怎麼寫一個厲害的 prompt,對話框裡的 AI 很聰明——但你每次得到的,還是一段文字。你要自己把文字複製到 Google 文件、自己開瀏覽器查、自己把結果貼進 Excel。AI 說,你做。這個流程,跟幾十年前的搜尋引擎沒有本質差別。

2026 年,改變就在這裡:你可以讓 AI 直接幫你做,不只是告訴你怎麼做。這個「會做事」的版本,叫 Agent。這堂課把這件事拆成你能馬上用上的三件事:AI 為什麼只是「說」、agent 怎麼「做」、2026 年哪些工具你現在就能拿來用。

這堂課適合誰 適合:用過 ChatGPT 或 Claude 聊天,想讓 AI 真正動手幫你完成任務的人(本課屬進階應用專區)。需要基礎:會寫基本 prompt、知道 LLM 是什麼。前置課:Prompt Engineering 大全(本系列假設你已修完)。

這堂學什麼

  • Chatbot vs Agent 本質差異:為什麼 chatbot 永遠只「回答」,agent 能「完成」
  • 感知-決策-行動循環:agent 背後的運作邏輯,用白話圖解一次搞懂
  • 2026 主流 agent 產品盤點:Claude Code、ChatGPT agent、Gemini Spark——各自適合什麼場合、大概多少錢
  • 能託付 vs 不能託付:哪些事放心交出去,哪些事你必須親自盯著
  • 這門課的路線圖:七堂課怎麼串起來,你學完會在哪裡

觀念一:Chatbot 只回答,Agent 完成任務

老闆叫你「幫我查一下競爭對手 A 公司最近的新聞,整理成摘要,放進週報 Google 文件的第三頁」。

你叫一個**聊天機器人(chatbot)**做這件事,它會給你一篇分析——但 Google 文件的第三頁,你得自己去填。Chatbot 的世界就是「對話框」:文字進去、文字出來,它沒有手,不知道你的 Google 文件長什麼樣。

你叫一個 agent 做同一件事,它會:

  1. 自己開瀏覽器,搜尋 A 公司最新新聞
  2. 讀過幾篇,自己判斷哪些相關
  3. 整理成摘要
  4. 打開你的 Google 文件
  5. 找到第三頁,把內容填進去
  6. 回報「完成了,這是我放進去的內容」

同樣的一句話,兩個不同的結果:一個給你文字,一個幫你做完。這就是 chatbot 和 agent 的本質差異。

Chatbot 只輸出文字,每一步都要你手動接手;Agent 從目標到完成全程自動的對照圖

為什麼 chatbot 做不到這些?

因為它沒有「工具」。Chatbot 是純語言模型:給文字、出文字,沒有接上任何外部系統。Agent 的差別在於它有工具(tools)——可以呼叫的函式、操控的 API、打開的瀏覽器。語言模型一旦連上工具,就從「說」升級到「做」。第 2 課會完整拆開這件事。


觀念二:感知-決策-行動循環

Agent 不是一次性的魔法按鈕,它有一個不斷運作的循環:

感知-決策-行動循環:讀取狀態、推理決策、呼叫工具行動,再回到感知,整個循環圍繞目標運作

用人話講就三句話:

感知:AI 看到了什麼?它讀入目前的狀態——網頁顯示什麼、文件裡有什麼、上一步執行的結果。這是它的「眼睛」。

決策:AI 接下來要幹嘛?它用語言模型推理:「目標是 X,目前狀態是 Y,下一步應該是 Z。」這是它的「大腦」。

行動:AI 真的做了什麼?它呼叫工具——搜尋、開檔、寫入、點按鈕。這是它的「手」。

做完之後,它再「感知」一次新狀態,再決策,再行動……這個循環一直跑,直到任務完成,或 agent 認為卡住了需要你介入。

一個必須知道的觀念:Agent 不保證一次就做對。它試、觀察結果、再修正——就像不確定路的外送員,先騎一個方向,發現不對再修正。這是你不能丟任務就放手的原因:你得知道它走到哪、有沒有偏離目標。


觀念三:2026 年主流 agent 產品在哪裡

不用自己從頭建 agent——幾家大公司已經做好給你用。2026 年中最容易上手的三條路線:

2026 三大主流 agent 產品對照:Claude Code、ChatGPT Agent、Gemini Spark 的適合場景、費用與取得方式

工具 公司 最擅長 費用參考 取得方式
Claude Code Anthropic 程式、本機檔案操作、CLI 任務 Claude Pro $17/月起(年繳) 官網訂閱後安裝 CLI
ChatGPT Agent OpenAI 瀏覽器查資料、填表、整理 Plus $20/月(約 40 次);Pro $200/月(約 400 次) ChatGPT 設定開啟 Agent mode
Gemini Spark Google Gmail、文件、試算表、行事曆 需 Google AI Ultra $100/月起(美國先行) 訂閱 Google AI Ultra 後啟用

三條路線怎麼選?

瀏覽器任務(查資料、填表、比價)首選 ChatGPT Agent:直接控制瀏覽器,不需技術底子,Plus 方案 40 次/月夠入門。圍繞 Google Workspace 的自動化(Gmail、文件、行事曆)選 Gemini Spark:跟 Gmail、文件深度整合、幾乎沒有學習曲線,但目前綁 Google AI Ultra($100/月起)、美國先行,台灣使用者要留意開通狀況。想讓 AI 真正操控本機電腦、執行指令選 Claude Code:這是這門課的主要載體,第 3 課帶你完整體驗。


觀念四:能託付什麼、不能託付什麼

Agent 能做很多事,但不是什麼都能放心交出去。這裡不是要嚇你,是要你從第一課建立正確期望。

以風險與可逆性劃分的四象限矩陣:低風險可逆放心交、高風險或不可逆要監看甚至絕對不要直接授權

放心託付的:

  • 查資料、搜尋、蒐集連結
  • 起草草稿、改格式、翻譯
  • 整理現有檔案、分類、批次重新命名
  • 跑重複性高的瀏覽任務(比價、追蹤新聞)

要監看、不要放著不管的:

  • 自動回覆郵件(寫完先讓你看過再發)
  • 更新試算表資料(改前確認來源正確)
  • 代你在網路上填表(送出前你自己過一遍)

現階段絕對不要直接授權的:

  • 有你信用卡資訊、可以自動付款
  • 有完整 email 發送權限(你不看就寄出的那種)
  • 修改正式服務的帳號密碼或安全設定
  • 在不可逆系統上直接執行(正式資料庫、財務系統)

原則很簡單:可逆的事放心交,不可逆的事自己盯。Agent 在 2026 年仍然會出錯——搜到過時資訊、誤解指示、做出你沒預期的動作。出錯能撤回只是浪費時間,不能撤回損失就大了。第 6 課「授權與安全」會完整展開。


手把手實戰:用 ChatGPT Agent 體驗你的第一次任務委託

理論說完了,現在讓你親眼看 agent 和 chatbot 的差別。這個實戰用 ChatGPT Agent mode,有 Plus 帳號就能用,不需要安裝任何東西。

沒有 ChatGPT Plus?可跳到第 3 課直接用 Claude Code 操作,效果更完整。

確認你的方案能用 Agent mode

登入 chatgpt.com,確認方案是 Plus($20/月)或以上。免費方案沒有 Agent mode。

點左上角帳號名稱 → Settings → 確認目前方案。接著進入主畫面,在輸入框左側或附近找「工具選擇器」按鈕,選擇或確認 Agent mode 已開啟——它會說明「可以瀏覽網路、執行程式、操控檔案」。

先用普通對話模式問同一件事(做對照組)

不要開 Agent mode,在普通對話框輸入:

幫我找出台灣前三大電商平台(蝦皮、momo、PChome),
比較它們的官網首頁今天的促銷活動,整理成一個簡單的對照表。

觀察回應:它可能說「我的資料截止到某某時間,無法查詢即時資訊」,或給你靜態的舊答案。它無法打開瀏覽器看今天的首頁——因為沒有工具。

記下這個結果,這是你的「對照組」。

切換到 Agent mode,問同一件事

現在開啟 Agent mode,再問一次同樣的問題。

這次你會看到完全不同的過程:ChatGPT 開始 thinking,然後出現行動日誌——「正在開啟瀏覽器」「正在前往 shopee.tw」「正在讀取首頁內容」「正在前往 momo.com.tw」……

它真的去開瀏覽器、讀了三個網站的首頁,然後整理成對照表。整個過程 1~3 分鐘。你可以看著它一步一步動。

這就是感知-決策-行動循環在跑:感知(讀網頁)→決策(哪些促銷資訊相關)→行動(繼續下一個網站,或整理輸出)。

試著委託一個多步驟任務

升一個難度,給它需要多個步驟才能完成的任務:

我想了解台灣近一個月 AI 相關新聞的趨勢。
請幫我:
1. 搜尋最近 30 天台灣主要科技媒體關於 AI 的頭條
2. 找出重複出現最多次的關鍵主題(3-5 個)
3. 每個主題給我一句話摘要
輸出格式:條列式,每個主題附一個代表性的新聞標題和來源連結。
不確定的地方先暫停問我,不要自己決定。

觀察 agent 怎麼拆解:先搜尋、再讀、再整理、再輸出,一步一步跑完,這就是循環實際的樣子。

模擬 ChatGPT Agent 執行多步驟任務的行動日誌:搜尋、開瀏覽器、讀頁面、分析、完成,一步步自動跑

注意 prompt 最後那句「不確定的地方先暫停問我」——這是控制 agent 的關鍵習慣,常見坑第一條就是沒加。

學會處理 agent 暫停要你介入的情況

執行過程中,agent 有時會暫停:「我找到一個需要登入才能看的頁面,要繼續跳過,還是你要提供帳號?」

這是 agent 在做人機協作決策:它判斷這個步驟需要你介入,而不是自己亂猜。直接在對話框回答它,它會繼續完成剩下步驟。

如果 agent 卡太久(超過 5 分鐘沒進展),直接說:

停止。告訴我你現在卡在哪個步驟、遇到什麼問題。

它會回報狀況讓你決定是否調整方向重來。


常見坑

坑 1:任務丟下去就放著,agent 跑偏了整個方向

症狀:agent 回報「完成」,你打開結果,發現它整理的是你沒有要的東西——你要台灣市場資料,它查到的是美國的;你要最近一個月,它抓的是兩年前。

原因:prompt 不夠明確,agent 自己選了一個認為合理的解讀繼續跑,不會主動問你。

解法:在 prompt 裡加明確的範圍限制與格式要求,並且加上這句話:

不確定的地方先暫停問我,不要自己決定。

這是第一課最值得養成的習慣。少了這句,agent 遇到岔路時永遠自己選,選錯了你不知道,等發現已經跑完了。


坑 2:以為 agent「記得」你上次說過的事

症狀:上週叫 ChatGPT Agent 幫你查競爭對手資料,這週開新對話說「照上次的格式再查一次」,它說不知道「上次的格式」是什麼。

原因:每一個 ChatGPT 對話框(conversation)是獨立的。Agent mode 也是,它沒有跨對話的長期記憶。「上次的格式」在新的對話框是一個空白的開始。

解法:把常用的格式指示、偏好、背景資訊存成一份筆記,每次開新任務時把相關段落貼進 prompt 最前面。第 5 課「記憶與脈絡」會完整展開這件事,以及怎麼用 Claude Projects 讓 agent 在指定範圍內「記住你」。


坑 3:給 agent 太廣的帳號權限

症狀:你把 Gmail 的完整發信授權給 ChatGPT Agent,叫它「整理並自動回覆不重要的郵件」。結果它把一封客戶要求退款的信判斷為「不重要」,自動回了一封制式拒絕信出去。

這不是假設——這是 ChatGPT Agent mode 的已知風險,OpenAI 官方說明直接警告授權後可能發生 prompt injection 攻擊。

解法:永遠用最小授權原則。需要 agent 讀 Gmail?給「讀取」就好,不要連寄信都給。操作 Google 試算表?給那份試算表的存取,不要給整個 Google Drive。第 6 課「授權與安全」會完整展開,從第一課就把習慣建對。


坑 4:agent 陷入無限重試迴圈

症狀:看著 ChatGPT Agent 的操作日誌,它一直在「正在嘗試載入頁面…正在重試…正在嘗試另一種方式…」,超過十分鐘還沒停止也沒進展。

原因:目標網站有防機器人機制(Cloudflare、JS 渲染),agent 被擋門外,但它的邏輯是「繼續嘗試」,不知道何時應該認輸換方向。

解法:prompt 裡加超時指示:

如果某個步驟超過 2 分鐘仍未完成,請暫停並告訴我卡在哪裡,不要一直重試。

遇到已經卡住的情況,直接介入:

停止重試這個網站。這個網站可能有反機器人機制。
改用搜尋引擎找這個網站的相關資訊,或尋找其他來源。

作業

基礎作業:用 ChatGPT Agent mode 委託一個你本來要自己手動做的查資料任務,例如比較兩個你正在考慮的產品規格與價格、或整理某個主題最近一週的新聞。觀察 agent 怎麼執行,記下它在哪些步驟表現得好、哪裡你需要介入。

對照實驗:用同一個問題,先在普通對話模式問一次,再切到 Agent mode 問一次。把兩次結果的品質差異用一段話記下來——這個紀錄在第 2 課講工具時會用上。

對照思考:想一件你最近做過的重複性任務(每週報告整理、比價、追蹤新聞)。它符合「可逆、低風險」的條件嗎?記下來,第 3 課我們會真的去做。


下一課預告

你現在知道 agent 是什麼、為什麼它能「做事」而不只是「說話」。但「工具」這個詞你在這堂課看到好幾次了——搜尋、寫檔、開瀏覽器,這些工具到底是怎麼長在 AI 身上的?

第 2 課「工具使用:AI 的手是怎麼長出來的」會把工具的運作原理拆開:語言模型怎麼決定要呼叫哪個工具、agent 拿到結果後怎麼繼續推理。不需要寫程式,但你需要理解工具這件事——因為工具就是 agent 能力的邊界,也是 agent 出錯時問題最常出現的地方。

#AI Agent#入門#Claude Code#ChatGPT agent#Gemini Spark

← 回所有文章