精華筆記

· @aihub.tw

AI 基礎觀念

AI 能與不能:幻覺、知識截止、context

AI 能與不能:幻覺、知識截止、context

你跟 AI 問了一個問題,它的回答有條有理、語氣篤定——但你事後查了一下,發現它引用的那個統計數字找不到出處,或是它提到的法規細節根本不存在。AI 在說錯和說對的時候,語氣一模一樣,完全看不出它「不確定」。

或者你問 AI 最近一個新聞事件,它要嘛說「這超出我的訓練資料範圍」,要嘛直接給你幾個月前的舊狀況——自己不知道已經過時了。

又或者你在一個長對話裡設定了很多條件,但聊到後面,AI 好像把前面說的都忘了,給的建議跟一開始設定的方向完全相反。

這三件事幾乎每個開始用 AI 的人都會踩到。但很少人解釋清楚它們的成因——不知道為什麼發生,就不知道怎麼防。這堂課把三個根本限制講透,再加上多模態能力的現況盤點,讓你對 AI 的信任建立在正確的基礎上。

這堂課適合誰 適合:剛開始用 AI、或用了一陣子卻不確定該不該相信 AI 說的話的人。需要基礎:零基礎 OK。前置課:第 3 課(訂閱怎麼買),但直接看這堂也完全可以——觀念是通用的。

這堂學什麼

  • 幻覺是什麼、為什麼 AI 會自信地說錯,以及辨識的實用原則
  • 知識截止日的定義,三大平台各自的截止日
  • 搜尋功能開了和沒開差在哪、什麼情況一定要開
  • Context window 白話解釋:為什麼聊久 AI 會「失憶」
  • 三大平台多模態能力對照:圖片、音訊、影片、文件各家能做什麼
  • 哪些任務絕對不要只靠 AI(或要特別小心)

觀念一:幻覺——AI 為什麼會自信地說錯

「幻覺」(Hallucination)是 AI 界的專有名詞,指 AI 生成了「聽起來合理但實際上是假的內容」。假的部分可以是:不存在的法院判決、捏造的論文引用、錯誤的統計數字、名人沒說過的語錄、網頁連結點開是 404。

成因:預測,不是查找

語言模型的核心機制是「預測下一個最可能出現的字詞」。它不像 Google 一樣去資料庫比對文件,而是根據訓練資料裡學到的「什麼詞通常接什麼詞」來生成文字。

幻覺成因:AI 預測 vs 人類查找的差異

這個機制讓 AI 非常擅長生成「格式完整、語氣流暢」的內容——但當它不確定某個細節時,它不會停下來說「我不知道」,而是把「看起來最合理」的詞填進去。整段話讀起來格式完美,但某幾個關鍵細節可能是假的。

真實症狀

  • 請 AI 寫含引用的研究摘要,它給的 DOI 或論文標題點進去是 404
  • 問 AI 某個官方文件的網址,它給一個連結,進去是不存在的頁面
  • 問 AI 某個法律條號,它給你一個號碼,查法規資料庫找不到這條
  • 要求 AI 給出某個產業的統計數字,數字聽起來很合理,但根本找不到來源

幻覺有越來越少嗎?

有,但沒有解決。根據 2026 年的研究數據,最好的 AI 模型幻覺率大約落在 3–18%(依任務類型不同)——就算是最好的模型,每 100 件事仍可能有 3 到 18 件包含錯誤。對於「需要準確判斷」的場景來說仍然太高。

辨識與防範的四個原則

  1. 可驗證的事實一定查證:AI 給的任何數字、引用、專有名詞,花 30 秒 Google 一下再用
  2. 越具體的細節越危險:大方向說明幻覺少;精確的數字/名字/日期/網址幻覺多
  3. 自信不等於正確:AI 說錯和說對的語氣完全一樣,語氣篤定不代表資訊正確
  4. 追加一句:「你確定嗎?有出處嗎?」——有時 AI 會自我修正,或承認不確定

觀念二:知識截止日——AI 的「記憶邊界」

語言模型的訓練不是即時的。Anthropic、OpenAI、Google 要花幾個月到一年的時間從網路收集資料、清理、訓練——整個流程完成後,模型就「凍結」了:那個時間點之後的世界,它完全不知道。這個時間點就叫「知識截止日」(Knowledge Cutoff)。

知識截止日時間軸:三大平台現況

2026 年三大平台截止日

模型 可靠知識截止日 備注
Claude Sonnet 4.6 / Opus 4 2025 年 8 月 訓練資料延伸至 2026 年 1 月,但越近越少
GPT-5.2 2025 年 8 月 舊款 GPT-4o 截止日為 2023 年 10 月
Gemini 3 2025 年 1 月 三家中截止日最早

注意:「可靠截止日」和「訓練資料最晚時間點」是兩回事。越靠近截止日的資料在訓練集裡出現次數越少,準確性也越低——靠近邊界的資訊要格外小心。

搜尋功能:穿越截止日的辦法

三大平台的付費訂閱都有「搜尋/Search」模式:

  • Claude:對話框可開啟 Search,會即時查詢網頁後回答
  • ChatGPT:有 Web 選項,用 Bing 搜尋後回答
  • Gemini:預設整合 Google 搜尋,更新最即時

開搜尋之後,AI 的回答可以包含截止日之後的資訊。

什麼情況一定要開搜尋:股價、匯率、法規最新版本、軟體最新功能、新聞事件、任何「現在」或「最新」的問題。如果你用的是免費版沒有搜尋功能,那就自己查即時資訊,只用 AI 做解釋和整理——別把它當成查詢即時資料的工具。

沒開搜尋就問「最新」,很容易踩到坑 問「現在台灣最低工資是多少」、「最新版 Python 是幾版」——如果沒開搜尋,AI 給你的是截止日前的答案,可能已經過時好幾個版本或幾次調整了。

觀念三:Context Window——為何聊久 AI 會「失憶」

「Context window」中文直譯是「上下文視窗」,但用一個比喻更好記:AI 每次能看到的文字是有限的,就像一張桌子只能平鋪 N 張紙。超過桌子大小的那些紙,就自動從邊緣掉出去了——AI 看不到,對它來說等於不存在。

Context Window 視覺化:對話如何填滿 context

Context Window 現況(2026)

模型 Context Window 大約等於
Gemini 3.1 Pro 1,000 萬 token 約 750 萬字 / 整部小說幾十本
Claude Sonnet 4 100 萬 token 約 75 萬字
GPT-5 100 萬 token 約 75 萬字
Claude Opus 4.1 20 萬 token 約 15 萬字
GPT-4o 12.8 萬 token 約 10 萬字

「Token」大約等於半個到一個中文字,或四分之三個英文單字。日常對話不容易碰到上限,但以下場景容易碰到:貼進很長的報告、對話開了幾十輪、同時請 AI 參考多份文件。

失憶的症狀

最常見的情況:你在對話開頭設定了角色或條件(例如「請一律用繁體中文」、「我是行銷人員,背景是 B2B 軟體業」),對話到後面 AI 開始違反這些設定——因為那幾句話已經「掉出桌子了」,AI 真的看不到了。

處理方法

  • 重要設定每次都提醒:不要只在開頭說一次,關鍵條件在每輪提問裡簡短重複
  • 開新對話,重貼背景:太長的對話直接開新的,把關鍵背景摘要複製進去
  • 摘要+繼續法:請 AI 先摘要這段對話的重點,開新對話把摘要貼進去繼續

觀念四:多模態能力盤點

三大平台現在都是「多模態」——不只能讀文字,還能看圖、看文件,部分能聽聲音和看影片。但各家能做的程度差很多。

多模態能力三平台對照表

圖片

三家都支援:上傳一張圖讓 AI 解釋內容、翻譯圖裡的文字、分析截圖。常見用法:截圖一個錯誤訊息叫它解釋、上傳掃描表格整理成文字、給它一張設計稿描述結構。

PDF 與文件

三家都可以上傳 PDF 並讀取內容。Claude 在長文件、結構複雜的 PDF(合約、學術論文、財報表格)的理解品質普遍評價最好,對格式和層次的掌握較細膩。

音訊

這裡差異最明顯:

  • ChatGPT:進階語音模式(Advanced Voice Mode)可以直接用聲音對話,語氣自然、有情緒感;一般模式是先透過 Whisper 轉文字再處理
  • Gemini:原生支援直接傳入音訊檔分析
  • Claude:目前不支援直接接收音訊——要先用其他工具轉成逐字稿,再丟文字給 Claude 處理

影片

Gemini 是目前最強的:直接傳入影片讓它分析內容、找特定片段、生成逐字稿。Claude 和 ChatGPT 可以透過 YouTube 連結取得部分資訊,但對長影片的原生處理能力遠不如 Gemini。


觀念五:這些事情別單靠 AI

AI 很能幹,但有幾類任務如果你不加警覺就全交給它,可能造成真實的損失:

法律文件最終判斷 AI 可以幫你讀懂合約大意、整理條款,但最終的法律判斷要給律師確認。AI 引用法規時容易給錯條號或引用過時版本,語氣卻不會因此變得不確定。

醫療診斷 問症狀、問藥物交互作用,AI 可以幫你列出可能方向,但不能取代醫師診斷——特別是劑量或罕見症狀,幻覺風險高。

需要即時資訊的判斷(未開搜尋) 股價、匯率、剛公布的政策、剛發生的事——沒確認搜尋功能已啟用的話,AI 給你的很可能是舊資訊或根據舊資訊推測的答案。

重要的引用與出處 如果你交給別人的文件需要引用論文、報告——AI 給的每一筆引用都要自己查驗。AI 生成假引用和真引用一樣流暢,格式上看不出差異。

記住你的長期偏好 AI 沒有持久記憶——你說「記得我不喜歡用 XX 格式」,換一個對話或隔天繼續,它可能就忘了。重要偏好要自己存筆記,每次新對話時貼進去。

AI 擅長 vs 需小心的任務對照


手把手實戰:自己測試 AI 的邊界

了解觀念是一回事,親自試一次才會真的記住。下面四個步驟讓你實際感受每個限制。

步驟一:測試幻覺——找一個你知道答案的事實

選一個你有把握答案的具體問題(你的行業裡的某個數字、你熟悉的某個規定,或任何你事後能查驗的細節)。用這個 prompt 問 AI:

請告訴我[你的問題],給我具體的數字/日期/來源。

拿到答案後,花一分鐘查驗。不管 AI 說的信心有多強,先假設細節可能有誤再確認。

你會發現:大方向八九不離十,但精確的數字或引用有時會跑掉。這個感覺建立起來之後,你就有了「適當的懷疑」——既不完全不信 AI,也不照單全收。

步驟二:測試知識截止日,再對比開搜尋的差異

先問一個你知道「最近才發生」的事情,不要提示 AI 它知不知道:

[最近幾個月發生的新聞或產品發佈],你能告訴我詳情嗎?

觀察 AI 的反應:它說「我的資料到 XXXX,不確定最新狀況」是誠實的好反應;它給你一個答案但資訊明顯是舊的,就是需要注意的狀況。

接著,開啟平台的搜尋功能(Claude 的 Search、ChatGPT 的 Web、Gemini 的 Google 整合),再問同一個問題。對比兩個答案的差異——你就明白為什麼即時性問題一定要開搜尋。

步驟三:上傳一份文件體驗多模態

找一份 PDF(工作文件、論文摘要,或任何你想試的東西),上傳後問:

請幫我摘要這份文件的重點,列出三個最重要的結論,並告訴我有沒有我可能會忽略的細節。

試完之後再試上傳一張截圖(比如某個軟體設定畫面或帳單截圖),問它截圖裡有什麼資訊。你會親身感受「多模態」具體是什麼意思,以及 AI 能從圖片裡讀出多少內容。

步驟四:刻意測試 Context 的「失憶」

開一個新對話,在最開頭設定一個很容易驗證的條件:

我們接下來的對話中,請你回答時一律在每段最後加上「[已確認]」三個字。這個規則請貫徹整個對話。

然後開始正常討論其他話題,刻意聊很多輪。過了 20–30 則對話之後,看 AI 有沒有還在每段加上「[已確認]」。

在免費版的短 context 模型上,這個設定很快就會消失;付費版大 context 模型通常撐得更久。這個實驗讓你直觀感受 context window 的實際影響。


常見坑

坑 1:AI 給了一個數字,直接填進報告裡

症狀:AI 說「根據 2025 年統計,台灣 XX 產業產值達 XXX 億」,你沒查就用了,後來被主管質疑出處,找不到任何文件佐證。

根本原因:精確數字是幻覺的高風險區域。AI 生成「聽起來合理的數字」非常流暢,語氣和有出處時一樣。

解法:任何數字都要找到真實出處。讓 AI 幫你找方向、列出可能的資料來源沒問題,但最終那個數字必須出現在你能點進去的文件裡。


坑 2:問「最新的 X 是什麼」沒有開搜尋

症狀:你問「最新版的某軟體是幾版」或「台幣今天匯率多少」,AI 給了一個答案,但那個答案是幾個月前的舊資訊,你渾然不覺地用了。

根本原因:純語言模型沒有「現在」的概念,只有截止日前的知識。它不知道自己說的是過時的資訊。

解法:在問任何即時性問題前,先確認搜尋功能有開。如果使用的版本沒有搜尋功能,就自己去查即時資訊,再把資訊貼給 AI 做整理或分析。


坑 3:長對話後 AI 開始「食言」

症狀:你在對話開頭請 AI「每次回答一律用繁體中文」或「記得我的角色設定」,聊到後面它開始夾雜英文或違反條件——但它沒有告訴你它忘了。

根本原因:對話太長,最早的幾則訊息已超出 context window 被截掉,AI 確實看不到那段設定了。這不是 AI「不守承諾」,是技術限制。

解法:把重要設定做成「提示模板」,每次開新對話都複製貼上。不要假設 AI 會「記得」昨天或上週的設定。部分平台有記憶功能(Claude 和 ChatGPT 都有),可以跨對話記住部分偏好,但這和 context window 是不同的機制,不能完全取代每次提示。


坑 4:叫 AI「查最新規定」然後直接照做

症狀:你問 AI 某個法規或軟體的最新用法,它給了一個聽起來完整的答案,你直接照做,後來發現規定已經改了,或步驟對應的是舊版介面。

根本原因:法規和軟體更新頻繁,AI 的截止日可能落後半年以上,加上引用法規的幻覺風險高。

解法:「查最新規定」類任務要開搜尋功能,或直接去官方網站確認。AI 的回答當草稿方向,最終以官方文件為準。


作業

  1. 幻覺測試:用你熟悉的行業或領域問 AI 三個具體的事實性問題,把 AI 的答案和你查到的正確答案對照。記錄哪些準確、哪些有出入。
  2. 截止日實驗:問三個不同「新舊程度」的問題(一個去年的事、一個三個月前的事、一個上週的事),觀察 AI 在哪個時間點開始說「不確定」或給錯資訊。
  3. 搜尋 vs 純模型:找一個最新的時事或產品資訊,分別用「有開搜尋」和「沒開搜尋」問同一個問題,對比兩個答案的差異。
  4. 多模態體驗:上傳一份你工作或生活中真正用得到的 PDF,試試 AI 能不能幫你快速掌握重點——比你自己讀快幾倍。

下一課預告

這堂課你學到了 AI 的邊界——知道它哪裡能信、哪裡要查一下。但工具會的再多,如果沒有融入你的日常流程,它就只是「偶爾想到才用的玩具」,而不是真正改變生產力的工具。

第 5 課教你把 AI 裝進生活:各種入口盤點(手機 App、桌面工具、瀏覽器擴充、快捷鍵),以及讓 AI 助手從「偶爾用」變成「自然就會用」的幾個習慣設計。工具到位了,習慣才是 AI 帶來的真正複利。

#AI 基礎觀念#幻覺#知識截止#context window#多模態#新手

← 回所有文章